El GPT-6 Astra de OpenAI logra el primer puntaje perfecto en el examen universitario coreano (CSAT) con un uso récord bajo de tokens
Puntos clave
- •El GPT-6 Astra de OpenAI obtuvo un puntaje perfecto de 450 en el 2026 CSAT LLM Solution Log, el primer modelo en lograrlo en todos los sujetos evaluados.
- •Astra consumió 357.000 tokens, el total más bajo reportado entre modelos disponibles públicamente, lo que reduce los costos de inferencia frente a sus rivales.
- •El GPT-5.6 de OpenAI ocupó el segundo lugar con 448,5 puntos, por delante del GPT-5.4 con 448, Claude Fable 5.1 con 447,5 y Gemini 3.1 Pro con 445.
- •La eficiencia del modelo se atribuye a un diseño que retiene, comprime y reutiliza el contexto de pasos de razonamiento anteriores durante tareas repetitivas.
- •Expertos de la industria advierten que la capacidad de la IA debe evaluarse por la resolución de problemas abiertos del mundo real, y no solo por resultados en exámenes estandarizados.

El último modelo de inteligencia artificial de OpenAI obtuvo, por primera vez, un puntaje perfecto en el College Scholastic Ability Test (CSAT), el examen de admisión universitaria de Corea del Sur, según un análisis recién publicado. Aunque modelos de IA de primer nivel ya habían logrado resultados casi perfectos, este resultado llama especialmente la atención porque el modelo lo consiguió consumiendo menos tokens que sus rivales, una métrica con relevancia comercial, ya que el uso de tokens se traduce directamente en costos de inferencia para desarrolladores y empresas que ejecutan estos modelos a gran escala.
Los resultados publicados el domingo en GitHub mostraron que el nuevo GPT-6 Astra de OpenAI fue el único modelo evaluado en lograr un puntaje perfecto de 450 en el 2026 CSAT LLM Solution Log. La evaluación sometió a los modelos a preguntas del CSAT 2026 que abarcaron lengua coreana, inglés, matemáticas, historia de Corea y cuatro asignaturas electivas — Física I, Química I, Ciencias de la Vida I y Sociedad y Cultura — sin acceso a internet. El CSAT, un examen estandarizado que presentan cientos de miles de estudiantes coreanos cada año, se ha convertido en un referente recurrente para comparar qué tan bien los modelos de vanguardia manejan el razonamiento multilingüe y multiasignatura bajo condiciones de examen.
Astra fue el primer modelo de IA en lograr un puntaje perfecto en todos los sujetos evaluados. En febrero, el Gemini 3.1 Pro de Google obtuvo un puntaje perfecto tomando solo dos electivas — Química I y Ciencias de la Vida I —, pero falló preguntas de Física I y de una asignatura de estudios sociales bajo el formato más amplio utilizado en esta evaluación.
En el ranking publicado el domingo, el GPT-5.6 de OpenAI quedó segundo con 448,5 puntos, seguido por el GPT-5.4 en tercer lugar con 448. El Claude Fable 5.1 de Anthropic quedó cuarto con 447,5, y el Gemini 3.1 Pro terminó quinto con 445.
El GPT-6 Astra utilizó 357.000 tokens, el total más bajo reportado entre los modelos disponibles públicamente. En comparación, el GPT-5.6 usó 429.000 tokens y el Claude Fable 5.1 usó 562.000. Dado que las preguntas y respuestas del examen estaban disponibles públicamente, el resultado no permite descartar una exposición previa a través de los datos de entrenamiento, aunque modelos competidores como Claude Fable 5.1 y Gemini 3.1 Pro enfrentaron las mismas condiciones.
El fuerte desempeño del modelo, combinado con un menor uso de tokens, se atribuye a un diseño vinculado al razonamiento que retiene el contexto durante tareas repetitivas. Un arnés adaptador de proveedor (provider adapter harness) comprime y reutiliza información de pasos de razonamiento anteriores, lo que permite a la IA presentar el examen imitando el enfoque de un estudiante con puntaje alto.
Lee Seung-hyun, profesor adjunto de la Universidad Hanyang, señaló que la clave no es simplemente que el modelo se haya vuelto más inteligente, sino que puede retener pasos de razonamiento previos, comprimir el contexto y revisar su plan. "Significa que, en lugar de esforzarse más en pensar cada vez, continuó con lo que ya había resuelto antes", dijo Lee.
OpenAI describió el resultado como alentador y señaló que el modelo logró un procesamiento eficiente gracias a una infraestructura de computo de IA a hiperescala. Un funcionario de OpenAI afirmó que este hito demuestra que los modelos pueden volverse más poderosos mientras mejoran el desempeño y reducen los costos.
No obstante, expertos de la industria advirtieron que el potencial de un modelo debe evaluarse por su capacidad de resolver problemas abiertos y no solo por puntajes en exámenes estandarizados. Una fuente de la industria de IA coreana señaló que será más significativo si la IA puede abordar desafíos laborales del mundo real donde no hay respuestas predeterminadas. El desempeño de los modelos líderes en benchmarks independientes más amplios — y si los rivales cierran la brecha de eficiencia — mostrará si este resultado marca un cambio duradero en la relación costo-desempeño.
Este artículo se basa en un informe del Hankook Ilbo, publicación hermana de The Korea Times, traducido por un sistema de IA generativa y editado por The Korea Times. Fuente original: The Korea Times.