Usuarios de GPT-6 Astra afirman que el nuevo modelo de OpenAI fue «debilitado»
Puntos clave
- •Algunos usuarios reportan que GPT-6 Astra ahora ofrece respuestas más rápidas con resultados de menor calidad, y el desarrollador Pankaj Kumar sospecha que OpenAI redujo el esfuerzo de cómputo del modelo, un cambio que la empresa no ha confirmado.
- •Salio y el investigador Md Ismail Sojal dijeron que ejecutaron prompts idénticos el día de lanzamiento y en la versión actual con la misma configuración, y ambos reportaron peores resultados del modelo actual.
- •El equipo de Opencode de Dax Raad volvió a GPT-5.6 Sol después de que su gasto se duplicara, concluyendo que las desventajas de Astra no justificaban su precio premium.
- •Críticos como Antikythera y el fundador de T3Chat, Theo, argumentan que el modelo no ha cambiado y que la disminución del entusiasmo de la semana de lanzamiento expone inconsistencias de larga data.
- •Astra sigue siendo el primer modelo de OpenAI en cruzar el umbral crítico de riesgo de ciberseguridad de la empresa, y tiene un precio de $10 por millón de tokens de entrada y $50 por millón de tokens de salida, 2.5 veces lo que Sol cobraba en su lanzamiento.

Los usuarios están inundando X con quejas de que el GPT-6 Astra de OpenAI se volvió menos capaz apenas una semana después de su lanzamiento. Algunos usuarios reportan respuestas más rápidas y peores resultados, mientras que otros sostienen que el modelo siempre fue inconsistente y que el entusiasmo inicial simplemente ocultó sus debilidades.
Hace una semana, GPT-6 Astra estaba reconstruyendo Manhattan calle por calle dentro de un motor de videojuego, impresionando a los usuarios con sus capacidades. Esta semana, algunos de esos mismos usuarios publican capturas de pantalla y preguntan a OpenAI qué le pasó al modelo.
«Astra feels significantly dumber for me today», escribió en X el desarrollador seudónimo synthwavedd. «Was only a matter of time before The Post-Launch Lobotomy. Shame.»
El patrón es familiar para los usuarios de chatbots y agentes de inteligencia artificial, quienes a veces sienten que un modelo favorito fue «nerfeado» después de su lanzamiento, un término tomado de los videojuegos que describe a desarrolladores debilitando algo que era demasiado poderoso. Las caídas percibidas de rendimiento pueden tener explicaciones razonables, pero la cantidad de quejas similares sobre GPT-6 Astra ha llevado a los usuarios a comparar resultados y examinar si el modelo cambió. La pregunta tiene un peso práctico para los desarrolladores que construyen productos sobre modelos que alquilan en lugar de ejecutar, y dado que los sistemas propietarios no exponen internos que se puedan inspeccionar, las comparaciones lado a lado de resultados son una de las pocas herramientas de verificación disponibles para terceros.
El desarrollador Pranjal Paliwal, quien anteriormente había elogiado a Astra, dijo que luego revisó el código escrito por el modelo y cambió su evaluación.
«We don't have AGI», escribió Paliwal. «We have a regression.»
AGI, o inteligencia artificial general, es el término de la industria para una máquina capaz de realizar esencialmente cualquier tarea cognitiva que un humano pueda realizar. El presidente de OpenAI usó el término en el lanzamiento de Astra. Una semana después, Paliwal lo invocó para describir la brecha entre las capacidades aparentes del modelo y sus errores.
Otras quejas siguen un patrón similar. El desarrollador Pankaj Kumar enumeró respuestas más rápidas y menor calidad entre los síntomas, junto con la sospecha de que OpenAI había «reducido el juice value». La fundadora Saba también le preguntó a OpenAI por qué ahora tiene que «simplificarle las cosas» para completar tareas.
«Juice value» no es un término técnico oficial. En este contexto, los usuarios lo usan como abreviatura de la cantidad de esfuerzo de cómputo que un modelo aplica antes de responder, y de la sospecha de que OpenAI pudo haber reducido ese esfuerzo después de las demostraciones de lanzamiento. OpenAI no ha confirmado haber hecho tal cambio en Astra.
Algunos usuarios han intentado comparaciones directas. Salio y el investigador Md Ismail Sojal dijeron que ejecutaron prompts idénticos contra Astra el día de lanzamiento y nuevamente en la versión actual, usando la misma configuración. Ambos reportaron peores resultados del modelo actual.
«Today's GPT-6 Astra output looks worse. GPT-6 Astra at launch vs GPT-6 Astra today», escribió Sojal. La publicación indicó que la comparación usó el mismo prompt y configuración, y que «[t]he difference is bigger than I expected».
Otros usuarios dicen haber vuelto al predecesor de Astra. Dax Raad, quien desarrolla la herramienta de programación Opencode, dijo que su equipo regresó a GPT-5.6 Sol porque su gasto se había duplicado mientras que las desventajas de usar Astra no justificaban el costo. El usuario de ChatGPT Mustafa Sahinli comparó a Astra con Claude Opus 4.6 «after 1 week of release», en referencia a la reacción negativa que el modelo de Anthropic también enfrentó tras su lanzamiento.
No todos creen que OpenAI debilitó deliberadamente a Astra. El usuario seudónimo Antikythera ofreció una refutación detallada, argumentando que la cronología puede ir en dirección opuesta.
«It is as dumb as it was on launch», escribió Antikythera. «The model is good, but the model has a lot of problems. It's lazy. Writes like a bullet-point-addict... people were overhyped on launch week, now they had time to test it and see its mistakes.»
Bajo esa explicación, Astra no se volvió menos capaz; los usuarios simplemente dejaron de deslumbrarse con sus primeras demostraciones y comenzaron a notar sus problemas recurrentes.
Theo, fundador de T3Chat, ofreció una opinión similar. Dijo que Astra es más inconsistente que Claude Fable y puede producir código destacado o sumamente deficiente.
«GPT-6 Astra has done incredible things I never thought a model could do. It has also done some of the stupidest things I've ever seen a model do. Generally speaking, Fable 5.1 just does what I ask», escribió Theo en X el 8 de septiembre de 2026. El aumento de ejemplos negativos, sugirió, puede reflejar el fin del período de luna de inicial del modelo en lugar de un cambio confirmado en su comportamiento.
El debate hace eco de los eventos en torno al anterior modelo insignia de OpenAI, GPT-5.6 Sol. En julio, los usuarios dijeron que el modo de razonamiento más alto de Sol se había vuelto de repente menos profundo. El ejecutivo de OpenAI Tibo Sottiaux negó haber debilitado deliberadamente el modelo, pero confirmó que la empresa había estado experimentando con el «esfuerzo de razonamiento», una configuración que controla cuántos pasos trabaja un modelo antes de producir una respuesta.
Una respuesta resumió la broma recurrente sobre los laboratorios de IA cerrados: una empresa lanza un modelo, y pocos días después este contrae «some kind of disease a few days later and suddenly become[s] dumber». Otro usuario ofreció una explicación más cínica: «They probably get quantized so they're not burning the companies as much money».
La cuantización reduce la precisión de los cálculos internos de un modelo para disminuir los costos de cómputo, a menudo con un posible costo en precisión. OpenAI nunca ha confirmado haber cuantizado intencionalmente un modelo ya lanzado.
OpenAI no ha emitido un comunicado estilo Sol sobre Astra. En julio, una ola similar de quejas sobre Sol recibió una respuesta pública de un ejecutivo de la empresa; si OpenAI aborda las quejas sobre Astra de la misma manera sigue siendo una pregunta abierta. El modelo sigue siendo el primero de la empresa en cruzar lo que OpenAI llama el umbral crítico de riesgo de ciberseguridad. Esa designación significa que Astra puede encontrar y encadenar vulnerabilidades de software previamente desconocidas sin guía humana, una capacidad restringida a defensores aprobados a través del programa Daybreak de OpenAI.
Independientemente de si Astra se volvió menos capaz, su precio publicado se mantiene en $10 por millón de tokens de entrada y $50 por millón de tokens de salida, 2.5 veces lo que Sol cobraba en su lanzamiento, una prima que al menos un equipo ya concluyó que no vale la pena pagar.