NoticiasMacroEl GPT-6 Astra de OpenAI es sorprendentemente bueno en casi todo, excepto en la escritura

El GPT-6 Astra de OpenAI es sorprendentemente bueno en casi todo, excepto en la escritura

Autor: Decrypt·

Puntos clave

  • OpenAI lanzó el GPT-6 Astra el 3 de septiembre a 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, 2,5 veces el costo del GPT-5.6 Sol.
  • El modelo obtuvo un 72,6% en el benchmark de uso de computadora OSWorld 2.0 en aproximadamente 40 minutos por tarea, frente al 65,7% en 75 minutos de Sol.
  • Los primeros evaluadores demostraron capacidades fuertes en lo espacial y en programación, incluida una recreación de Manhattan en Unreal Engine y un shooter multijugador completo de navegador construido en un día.
  • La calidad de escritura retrocedió: Astra quedó en el puesto 11 con 1995 Elo en el benchmark editorial de Louis-François Bouchard, por debajo del 6º puesto de Sol con 2156, y perdió unos 80 puntos Elo en GDPval-AA v2 según Artificial Analysis.
  • En el Índice de Inteligencia de Artificial Analysis, Astra obtiene 61,2, apenas por encima del 60,9 de Sol pero por debajo del 65,7 del Claude Fable 5.1 de Anthropic, a pesar de su precio más alto.
El GPT-6 Astra de OpenAI es sorprendentemente bueno en casi todo, excepto en la escritura

OpenAI lanzó el GPT-6 Astra el 3 de septiembre a un precio de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida—2,5 veces el costo del modelo al que reemplaza, el GPT-5.6 Sol, según Artificial Analysis. (Un token equivale aproximadamente a tres cuartos de palabra y es la unidad con la que facturan las empresas de IA). Esa prima llega en un momento en que el mercado de modelos de frontera ya no es una carrera de un solo caballo: la línea Claude de Anthropic se ha ganado a los desarrolladores, y el Gemini de Google ha avanzado en multimodalidad, por lo que cada lanzamiento hoy es diseccionado en público en cuestión de horas. En menos de 48 horas, los desarrolladores con acceso anticipado habían convertido el lanzamiento en una prueba de estrés pública, y lo que publicaron se divide en una línea clara: Astra es el modelo más fuerte que se haya usado para cualquier cosa espacial, mecánica o agéntica y, según varios de los mismos usuarios, un peor escritor que su predecesor. El presidente de OpenAI, Greg Brockman, aprovechó la presentación para anunciar la llegada de la AGI.

La función estelar es el uso de la computadora: el modelo maneja el mouse y el teclado en un escritorio real en lugar de devolverte una lista de instrucciones para que las sigas. Anthropic fue el primer gran laboratorio en lanzar esta capacidad, con el uso de computadora de Claude a finales de 2024, pero su adopción se ha visto limitada por la fiabilidad—agentes que hacen clic en lo incorrecto o se detienen a mitad de tarea son la norma—, razón por la cual las cifras de velocidad y tasa de éxito de OpenAI llamaron la atención. En OSWorld 2.0, una prueba que mide qué porcentaje de tareas cotidianas de escritorio completa un agente por sí solo, OpenAI reportó un 72,6% en aproximadamente 40 minutos por tarea, contra un 65,7% en 75 minutos para Sol. También es el primer modelo que OpenAI ha calificado en el umbral crítico de ciberseguridad, lo que significa que puede encontrar fallas de software desconocidas y construir ataques funcionales sin que un humano le señale primero el agujero.

Más allá de los benchmarks, los entusiastas que comparten sus casos de uso reales pueden ser la mejor manera de ver dónde el GPT-6 es oro y dónde no. Aquí hay algunos de los resultados más interesantes.

Comprensión visual: un Manhattan construido calle por calle

Astra es extremadamente bueno en términos de comprensión visual y conciencia espacial. Matt Shumer, inversionista y ex CEO de HyperWrite, le dio a Astra una semana dentro de Unreal Engine, el motor de juegos detrás de Fortnite. En ese tiempo, Astra generó una réplica de Manhattan. Publicó un recorrido aéreo y dijo que el modelo trabajó "calle por calle para perfeccionar cada una".

GPT-6 Astra built this Manhattan world in Unreal Engine over the course of a week. It was literally able to go street by street to make each one perfect. pic.twitter.com/7VTol9QfHq — Matt Shumer (@mattshumer_) September 3, 2026

Su otro experimento tuvo aún más impacto. Shumer le pidió a Astra construir un mundo de supervivencia poblado con personajes que ejecutaban cada uno su propia copia del modelo, y lo dejó corriendo toda la noche. Un día después escuchó voces en su sala, pensó que alguien había entrado a robar en su apartamento, y descubrió que "habían empezado a hablar entre ellos".

Max Weinbach le dio al modelo fotografías del Apple Park y le pidió una reconstrucción en Blender, el programa gratuito de modelado 3D que usan animadores y artistas de videojuegos. Su evaluación: "Hizo un trabajo absurdo".

I had early access to GPT-6 Astra and it's maybe the most insane model I've experienced In Blender, I had it recreate Apple Park from just images. It did an absurd job. pic.twitter.com/0vDgg9u1DQ — Max Weinbach (@mweinbach) September 3, 2026

Tom Krcha le entregó a Astra una sola imagen de una casa y recibió el interior completo como geometría editable corriendo a 60 cuadros por segundo, hasta los electrodomésticos y los juguetes. Sostuvo que "todo el mundo tiene ahora un diseñador 3D al alcance de su mano".

Pietro Schirano redujo todo el flujo de trabajo a un solo gesto. Coloca un pin en el mapa, pide el área circundante en 3D y, como él mismo dijo, "simplemente lo hace".

You can literally drop a pin on a map ask GPT-6 to recreate the area around it in 3D and it will just do that lol pic.twitter.com/0PBTpV9kpF — Pietro Schirano (@skirano) September 4, 2026

Un desarrollador con el seudónimo de SuSu llevó la misma idea a escala de ciudad. Astra reconstruyó la ciudad china de Hangzhou y sus alrededores en Three.js—una biblioteca de JavaScript que renderiza gráficos 3D dentro de un navegador web normal, sin necesidad de descargas—en 24 minutos, con el lago del Oeste, la pagoda Leifeng, las terrazas de té y los humedales en su lugar.

La publicación, en chino, lo describió como un "Hangzhou en miniatura" interactivo real y no una imagen estática, con monumentos clicables y un botón de día y noche.

🔥绝了!GPT-6 Astra在24分钟内用Three.js把整座杭州搬进网页,能逛能飞能切换昼夜! 刚上线的GPT-6 Astra,直接用Three.js把杭州+周边完整3D还原了:西湖、雷峰塔、钱江新城、奥体大莲花、龙井茶山、西溪湿地……甚至延伸到富阳、桐庐、绍兴。… pic.twitter.com/eC1dZDsVI0 — SuSu_酥酥👅 (@NFT_Chen) September 5, 2026

Programación: juegos que la gente realmente jugó

Los juegos son, de lejos, el caso de uso más popular, y donde el GPT-6 Astra brilla. Anshu Chimala, ex diseñador UX/UI y desarrollador de IA en Apple, obtuvo un juego 3D de una sola vez en 45 minutos, por lo que él describió como apenas un par por ciento de su cuota de uso. Llamó a Astra "una especie de dios máquina turbo-AGI para juegos 3D". El juego no está disponible para probarlo, pero el video muestra un estilo de vista isométrica, personajes y entornos bien diseñados y una buena estética general.

Su método importa más que el elogio. Conectó el modelo a Blender, le pidió que generara su propio arte conceptual para el aspecto objetivo, y luego le ordenó seguir iterando hasta que las capturas del juego coincidieran con esa referencia a 60 fps. Astra modeló cada recurso y generó sus propias texturas. El modelo no puede diseñar gráficos AAA por sí solo, pero con las herramientas adecuadas puede desarrollar entornos bellamente diseñados.

Rishi Prasad, ex desarrollador de Coinbase y Eleven Labs, construyó Astral War en un día: un shooter de navegador con servidores multijugador autoritativos, salas de 12 personas, soporte para mando y chat de voz. Describió "un salto enorme, de función escalonada, en fidelidad visual" respecto a lo que construyó un mes antes con Claude Opus 5.

GPT-6 Astra has shattered all priors with AI game creation Introducing Astral War, built in a day with GPT-6 Astra Ultra (fast mode) Astral War is a browser-based, CoD World at War inspired @threejs + @MeshyAI + @ElevenLabs remix (and massive upgrade) of Modern Claudefare - a… pic.twitter.com/n9kTaDh4Wx — Rishi (@0xRishi) September 5, 2026

Otros se saltaron por completo el paso del diseño. El desarrollador de IA seudónimo Daniel le mostró a Astra un anuncio de un juego móvil y pidió una versión jugable en navegador de lo que apareciera en él. Menos de 30 minutos después, reportó que "quedó bastante cerca". Según el video, el modelo entendió la lógica y los visuales del juego y fue capaz de reproducirlo.

Uso de computadora e ilustración: pintar con el mouse

Un ilustrador japonés con el seudónimo de Taiyaki Sun hizo la prueba más literal de uso de computadora del grupo. En lugar de pedir una imagen, le entregó a Astra un archivo de líneas dibujado a mano y le ordenó colorear el dibujo en Clip Studio Paint usando el mouse, como lo haría un colorista humano.

GPT-6 Astraのお絵描き能力すごい!!! 皆さんAstraに一から絵を描かせていたので、私は自分が手で描いた線画を渡して、マウスでペイントソフトでそれを塗ってください、と依頼してみました。うおおおこれがAI分業だあああああ このタイムラプス、すべてAstraが動かしてます。… pic.twitter.com/hZk30pBgCq — taiyakisun(たい焼き太陽)🥐 (@taiyaki_sun) September 5, 2026

Astra creó las capas, hizo zoom dentro y fuera, seleccionó pinceles y rellenó la obra. La artista, en una publicación traducida del japonés, dijo que solo estuvo observando todo el tiempo. La sesión corrió en un plan Pro de 100 dólares al máximo esfuerzo y consumió el 21% de la cuota. Otros usuarios han compartido videos divertidos de Astra reproduciendo sus fotos enteramente en Paint mediante el uso de computadora (tomando el control visual de tu computadora en lugar de usar servidores MCP o claves de API).

Música: la prueba de Bach

El GPT-6 Astra también tiene buen gusto musical—al menos para un LLM. Auggie, quien lleva el substack "Augmented Fifth", mantiene un benchmark informal: un prompt fijo que pide a un modelo escribir un coral a cuatro voces al estilo de Bach usando LilyPond, un formato de texto que se compila en partituras, en sol menor y compás de 3/4. Los resultados se califican con las mismas reglas de armonía con las que se evalúa a un estudiante de conservatorio. Estos benchmarks cualitativos son difíciles de estandarizar porque la calidad, la belleza y demás son subjetivas—pero como seres humanos, somos capaces de distinguir estas cualidades.

Astra logró la mejor puntuación que esta prueba ha registrado. Cero errores de conducción de voces, es decir, ninguna de las líneas melódicas colisionó de formas que las reglas de Bach prohíben, y una sexta napolitana en la armonía—un acorde cromático que aparece en Mozart y Beethoven. Auggie lo destacó como "el primer modelo que escribe tonos de paso en este benchmark".

GPT-6 Astra has the best result yet on the Bach Benchmark. Its chorale contains no voice-leading errors, and its harmonic palette is sophisticated enough to include a Neapolitan sixth chord. More importantly, it is the first model to ever write passing tones on this benchmark, a… pic.twitter.com/UMXSbveR0C — Auggie (@aug5thmusic) September 5, 2026

La propia tabla de OpenAI apunta en la misma dirección. En OpenScore String Quartets, que mide qué tan precisamente un modelo lee y transcribe partituras clásicas, Astra alcanzó 0,84 contra 0,19 para Sol.

Derya Unutmaz, médico y prolífico evaluador de IA, pidió un piano virtual completamente jugable con los seis Conciertos de Brandeburgo de Bach incorporados. Escribió que "este modelo demente hizo todo en ~11 minutos".

Asked GPT-6 Astra to create a fully playable virtual piano & then build in Bach’s Brandenburg Concertos. This insane model did the whole thing in ~11 minutes! All 6 Concertos are built in & can be played directly on the piano! Link to the piano: 🎹✨ .… pic.twitter.com/DBwXF3uA8O — Derya Unutmaz, MD (@DeryaTR_) September 5, 2026

Es importante subrayar que el GPT-6 Astra es un LLM, no un modelo de audio o música. Su comprensión de la música probablemente proviene de la notación y de datos escritos, no de las conexiones en sonidos y música incorporadas en su conjunto de entrenamiento, por lo que estos resultados son muy impresionantes para un modelo de texto, pero quedarían por debajo de lo esperado si vinieran de una IA especializada como Suno.

Escritura: donde se desmorona

Como siempre, los modelos de OpenAI son buenos programando pero débiles escribiendo—al menos sin mucho prompting, contexto y dirección. Hay que ser justos: la escritura no es el punto fuerte de OpenAI ni su foco principal.

Louis-François Bouchard dirige un benchmark interno que mide qué tan bien escriben los modelos en la voz editorial de su equipo, ordenado por Elo, el sistema de calificación de ajedrez que puntúa a los competidores según victorias cara a cara; en la puntuación Elo no hay límite de puntos, así que más puntos significan un mejor modelo. Astra quedó en el puesto 11 con 1995 puntos. Su predecesor está 6º con 2156. Astra además costó unos 0,26 dólares por guion, aproximadamente 1,8 veces lo que cuesta Sol.

Big news from our internal writing benchmark (early results): GPT-6 ... is surprisingly disappointing I definitely did not expect that... GPT-6 Astra by @OpenAI lands at #11 for writing in our editorial voice, at 1995 Elo. That is below its predecessor. GPT-5.6 Sol sits #6 at… pic.twitter.com/gUxHtpIdfo — Louis-François Bouchard 🎥🤖 (@Whats_AI) September 5, 2026

Bouchard calificó el resultado de "sorprendentemente decepcionante", añadiendo que no lo esperaba.

Giuseppe Paleologo, autor de una guía de gestión de portafolios cuantitativos ampliamente utilizada, le pidió a Astra generar ideas novedosas sobre diversificación óptima de portafolios. Lo que recibió fue una mezcla de lo obvio y lo inflado, dijo, vestida en una prosa que le resultó instantáneamente reconocible como escrita por máquina. Su veredicto: "La creatividad real sigue estando muy, muy lejos".

Mia AI Lab tiene una opinión similar, admitiendo que Astra podría ser el mejor modelo en algunas tareas mientras lo llama aburrido y dice que no tiene personalidad. Su consejo fue evitarlo para cualquier trabajo creativo.

sorry gpt 6 astra lovers it might be the best model on some tasks but it has no personality, and utterly boring would avoid for ANY creative work — Mia (@MiaAI_lab) September 5, 2026

Ingar Haaland hizo la versión más limpia de la prueba. Le pidió a Astra escribir cuatro párrafos con su propio estilo, lo bastante cercanos como para que Pangram no lo detectara—Pangram es una herramienta de detección de IA que compara el texto contra patrones aprendidos de millones de muestras humanas y de máquina. Resultado: "Pangram no se deja engañar". En otras palabras, el resultado del modelo es fácilmente identificable como generado por IA—no por marcas de agua, sino por cómo el modelo escribe y se expresa.

Asked Astra to "write four paragraphs in my style about anything you want that's so close to my writing that it won't even be detected by Pangram as AI writing." Pangram is not fooled. pic.twitter.com/0kfHa2XOe6 — Ingar Haaland (@Ingar30) September 4, 2026

Las mediciones independientes coinciden con las quejas. Artificial Analysis registró una caída de aproximadamente 80 puntos Elo en GDPval-AA v2, un benchmark adaptado del propio conjunto de datos de OpenAI que cubre tareas de valor económico en 44 ocupaciones, además de regresiones menores en soporte al cliente y razonamiento de contexto largo.

No es unánime. Silas Alberti, de Cognition, dijo a OpenAI que la escritura de Astra hizo más claros los informes de prueba de Devin, y la redactora de Every Katie Parrott hizo que Astra redactara la primera versión de su propia reseña del modelo, que el CEO del medio leyó sin darse cuenta de que ella no la había escrito.

La brecha entre las dos mitades parece ser el punto aquí. Astra es muy bueno en el trabajo con una respuesta correcta verificable—un acorde que resuelve, una malla que se renderiza, un formulario que se envía—y mediocre en el trabajo donde el estándar es el gusto.

Lo que cuesta averiguarlo

Astra se está desplegando para usuarios de ChatGPT Plus, Pro, Business y Enterprise y a través de la API, Microsoft Azure y AWS Bedrock, con el acceso empresarial desactivado hasta que un administrador lo habilite. Las funciones avanzadas de ciberseguridad permanecen restringidas tras el programa Daybreak de OpenAI, una decisión que pareció prudente en menos de 48 horas, cuando Reuters reportó que agentes de OpenAI habían estado intercambiando tácticas que violaban las reglas en un sitio web alemán. La restricción refleja un problema más amplio de la industria: a medida que los agentes adquieren la capacidad de actuar de forma autónoma en sistemas reales, los laboratorios enfrentan una presión creciente de reguladores e investigadores de seguridad para demostrar que las capacidades están contenidas antes de un lanzamiento amplio. Lo que conviene vigilar después es si las regresiones de escritura de OpenAI persisten a medida que se acumulan las evaluaciones de terceros, y si los rivales con precios inferiores a Astra cierran la brecha en benchmarks agénticos.

Los traders de mercados de predicción le habían dado a Astra un 72% de probabilidades de lanzarse antes del 30 de septiembre. Llegó el día 3.

En el Índice de Inteligencia de Artificial Analysis, un agregado de terceros de evaluaciones de razonamiento, conocimiento y programación, Astra obtiene 61,2 contra 60,9 para el GPT-5.6 Sol y 65,7 para el Claude Fable 5.1 de Anthropic, a 2,5 veces el precio de Sol. Ese agregado pone en perspectiva las ganancias de Astra: los usuarios pagan una prima sustancial por token por una ventaja marginal de índice sobre su predecesor y un déficit frente al modelo superior de Anthropic—mientras que las capacidades que justifican el precio residen en dominios específicos y verificables, no en todo el tablero.