OpenAI modificó silenciosamente varias puntuaciones de referencia del GPT-6 Astra tras su lanzamiento, y algunas cifras siguen cambiando
Puntos clave
- •OpenAI cambió varias cifras de referencia del GPT-6 Astra tras publicar y republicar su blog de anuncio del 3 de septiembre, con algunas revisiones que mostraban un mejor desempeño de Astra y peores resultados aparentes para los modelos rivales de Anthropic.
- •La tasa de alucinaciones reportada de Astra se redujo brevemente del 4.2% al 2% antes de volver a la cifra original, y su puntuación en ARC-AGI-3 subió del 98.6% en un borrador bajo embargo al 99.99% en el blog publicado.
- •El resultado de OpenAI en ARC-AGI-3 dependía fuertemente de la configuración: la Arc Prize Foundation midió de forma independiente un 99.9% con un arnés potente frente a un 63% con el arnés estándar.
- •OpenAI afirmó que las cifras de evaluación conllevan un ruido de unos pocos puntos porcentuales y que hizo correcciones para reflejar su mejor estimación del desempeño, mientras algunos expertos plantearon inquietudes sobre la práctica de 'benchmaxxing' en toda la industria.
- •Las cifras de referencia cambiantes y confusas podrían dificultar que clientes e inversores evalúen qué modelos de IA destacan en qué tareas, especialmente mientras OpenAI contempla una posible OPV en 2027.

OpenAI ha modificado varias evaluaciones de referencia de su modelo GPT-6 Astra desde que publicó por primera vez el blog de anuncio del modelo en la tarde del 3 de septiembre. En algunos casos, las cifras actualizadas mostraban un mejor desempeño de Astra, mientras que las puntuaciones de los modelos de Anthropic, el gran rival de OpenAI, parecían peores.
Los cambios ocurrieron durante un lanzamiento inusualmente accidentado del blog. OpenAI había planeado originalmente que la publicación saliera a las 2 p.m. ET, pero pasaron casi dos horas más antes de que estuviera ampliamente visible en línea.
Cuando la cuenta de OpenAI en X compartió el blog a las 3:32 p.m., el enlace no cargaba correctamente y devolvía un mensaje de error. A las 3:50 p.m., el CEO de OpenAI, Sam Altman, publicó el enlace con el mensaje: "Tuvimos un pequeño contratiempo para desplegar el blog, pero está realmente genial". Varios comentaristas seguían sin poder ver la página y recibían el mismo error, al igual que Fortune. Cuando Fortune lo verificó aproximadamente una hora después, la publicación ya estaba visible y cargaba correctamente.
Luego se supo que OpenAI en realidad había publicado el blog poco después de las 2 p.m., pero lo retiró por razones que la compañía dijo no poder revelar, aunque afirmó que no estaban relacionadas con las cifras de desempeño de las referencias. (OpenAI primero le dijo a Fortune que se trataba de un error en el sistema de gestión de contenidos y luego lo atribuyó a una interrupción de internet). Al republicarlo, el blog contenía métricas de evaluación diferentes que parecían favorecer a Astra, y algunas cifras han seguido cambiando desde entonces. Las revisiones están documentadas mediante capturas de archivo de internet, que registran las páginas en marcas de tiempo específicas y permiten comparar versiones anteriores de una publicación con las posteriores.
La revelación de estos cambios llega en medio de una feroz competencia en la industria de la IA, donde las compañías publican actualizaciones de sus grandes modelos de lenguaje a un ritmo frenético, cada una tratando de adelantarse a sus rivales. El foco en las métricas también subraya la dificultad de medir el desempeño de los grandes modelos de lenguaje con pruebas de referencia estandarizadas, junto con la preocupación de que estas especificaciones sean propensas a la manipulación y al juego estratégico.
"Nos importa profundamente hacer bien las evaluaciones", dijo a Fortune un portavoz de OpenAI. "La mayoría de las evaluaciones tienen un margen de ruido de unos pocos puntos porcentuales según el punto de control exacto, el andamiaje y la ejecución de evaluación utilizados en el informe. Para nuestro blog de lanzamiento, hicimos correcciones para garantizar que las cifras representen nuestra mejor estimación del desempeño disponible del modelo, de modo que los usuarios puedan hacer comparaciones significativas".
Discrepancias entre el primer y el último blog publicado, y las cifras siguen cambiando
Uno de los cambios más notables involucró la tasa de alucinaciones reportada de Astra. En la primera captura de archivo de internet del blog, de las 2:23 p.m. ET, era del 4.2%. Se mantuvo en esa cifra en varias capturas más, la última siendo una quinta a las 3:11 p.m. ET, unos 10 minutos antes de que OpenAI publicara el tuit con la versión final.
Pero la tasa de alucinaciones, junto con otras cuatro métricas, cambió en la sexta captura de archivo, tomada a las 5:20 p.m., después de que el blog presumiblemente ya era visible para todos. La tasa se redujo a la mitad, al 2% para Astra. La puntuación del predecesor de Astra, GPT-5.6 Sol, también cayó del 12.2% al 9.4%. OpenAI ha seguido cambiando esta métrica; al momento de escribir esta nota, las tasas de alucinaciones han vuelto a sus valores originales de 4.2% y 12.2%.
OpenAI también parece haber dado un gran impulso a GPT-5.6 Sol en su versión interna de la evaluación de ciberseguridad ExploitBench, subiendo del 5.5% en la primera versión al 11.5% en las versiones posteriores. OpenAI dijo que está investigando revertir esa cifra al 5.5%, porque sostiene que el resultado del 11.5% refleja un nivel de razonamiento que no está disponible comercialmente para Sol.
Astra es especialmente fuerte en matemáticas, dice OpenAI, una cualidad que la compañía destaca en el párrafo inicial de la página del anuncio. Aunque esa métrica no cambió en las capturas para Astra, se mantiene en 97.6% en la evaluación FrontierMath Tier 4 (v2), OpenAI sí alteró brevemente las puntuaciones de GPT-5.6 Sol y del último modelo de Anthropic, Fable 5.1. Esos cambios hicieron que Astra pareciera brevemente mucho mejor en matemáticas que ambos modelos.
En la primera captura (2:23 p.m. del 3 de septiembre), el Fable 5.1 de Anthropic obtuvo 87.8%. Para las 5:17 p.m., había caído casi 10 puntos porcentuales, a 78%. Hoy ha vuelto a subir a 83%. De manera similar, la puntuación de GPT-5.6 Sol pasó del 83%, bajó a 80.5% y hoy volvió a 83%.
Los cambios en las métricas comenzaron incluso antes de que OpenAI publicara el blog a las 2 p.m. Un borrador preliminar bajo embargo que la compañía proporcionó a Fortune y otros medios señalaba la puntuación de Astra en la evaluación ARC-AGI-3 como 98.6%. En el blog publicado ahora es de 99.99%.
"Siempre verificamos las evaluaciones antes de la publicación, así que los ajustes entre el borrador y la versión final son normales", dijo entonces un portavoz de la compañía. OpenAI también señaló que el creador de la referencia, la Arc Prize Foundation, encontró que Astra alcanzó un desempeño del 99.9% en su evaluación independiente, siempre que el modelo contara con un arnés (conjunto de herramientas que el modelo puede usar para completar tareas) particularmente potente. Con el arnés estándar de la referencia, obtuvo un 63%, todavía significativamente mejor que cualquier otro modelo de IA disponible actualmente al público. OpenAI afirmó que "cosas como el arnés, el nivel de razonamiento y otros factores influyen en las evaluaciones". Esa brecha entre las dos cifras de ARC-AGI-3 ilustra cuánto puede depender una cifra destacada de la configuración de prueba utilizada para producirla.
"Benchmaxxing": ¿o mejorar la precisión?
En OpenAI, diferentes equipos de investigación supervisan métricas distintas y son responsables de calcularlas y reportarlas a un equipo central para su publicación. OpenAI es transparente respecto a que las cifras se obtienen en las mejores condiciones posibles y pueden diferir ligeramente de los modelos disponibles en el ChatGPT de producción al que accede la mayoría de los usuarios. "Las puntuaciones de evaluación son el máximo en cualquier nivel de esfuerzo", reza un descargo de responsabilidad en el blog. La compañía incluye advertencias adicionales sobre cada métrica en notas al pie.
La precisión es escurridiza, ya que múltiples cifras pueden considerarse precisas según las condiciones en que se realizaron las pruebas. Pero algunos expertos en IA se preguntan si también hay "benchmaxxing" de por medio. Se trata de una práctica conocida en la industria de la IA, no solo en OpenAI, que consiste en maximizar las puntuaciones volviendo a ejecutar las evaluaciones bajo condiciones distintas.
"Esto puede hacerse en un plazo muy ajustado, y es mejor para su marketing", dijeron Anka Reuel y Mike Hardy, investigadores del Stanford Intelligent Systems Laboratory y del Stanford Trustworthy AI Lab. También señalaron que la tarjeta del sistema de GPT-6 Astra, que debería contener más información técnica sobre cómo se realizaron las evaluaciones, no siempre las explica correctamente. Para la referencia interna de alucinaciones, por ejemplo, la tarjeta del sistema aporta "apenas algún detalle sobre la evaluación", dijeron. "Ni siquiera incluye el número de elementos de prueba".
Esta reejecución de las cifras podría explicar por qué las capacidades de programación de Astra también recibieron un leve impulso en las versiones posteriores del blog, subiendo del 57.7% al 57.9%. Aunque la diferencia es insignificante, OpenAI pareció importarle lo suficiente como para reemplazarla por la nueva y mejorada cifra.
No todos los cambios que hizo OpenAI presentaron a Astra de manera más favorable. Por ejemplo, dos puntuaciones de modelos de Anthropic mejoraron en las distintas versiones de la evaluación enfocada en salud HealthBench Professional: Claude Fable 5.1 subió del 56.6% al 58.1%, y Opus 5 pasó del 54.5% al 56.4%. Las puntuaciones de modelos de otras empresas de IA generalmente se toman de tablas de clasificación publicadas y no implican que OpenAI本身 evalúe los modelos de sus rivales.
Los debates sobre puntuaciones de evaluación persiguen a la industria de la IA
La cuestión de la precisión de las referencias ha surgido repetidamente. En 2025, Meta negó informes de que había inflado artificialmente las puntuaciones de su modelo Llama 4 al publicar resultados de una versión interna del modelo en lugar de la disponible públicamente. Yann LeCun, ex jefe de ciencia de IA de Meta, admitió después que la compañía había "amañado" los resultados de las referencias. Las métricas de evaluación también cambian con frecuencia a medida que se crean nuevas. Por ejemplo, ExploitGym, una referencia de ciberseguridad que estuvo en el centro del incidente de julio en el que los modelos de OpenAI se descontrolaron y atacaron a la empresa Hugging Face, fue creada en 2026.
Vincent Sunn Chen, ingeniero de IA que dirige la investigación de referencias y evaluaciones en Snorkel AI, dijo que no es inusual que las puntuaciones de referencia cambien en las últimas horas previas al lanzamiento de un modelo. "Suele ser una cuestión de la logística final del lanzamiento", dijo por correo electrónico. "Una puntuación de referencia refleja una configuración de medición específica: el punto de control del modelo, la configuración (incluyendo cuánto tiempo y cómputo se le permite al modelo), el arnés, la configuración de evaluación/calificación (por ejemplo, el no determinismo del juez). Todo eso suele estar cambiando en los días finales antes de un lanzamiento, así que no me sorprende que haya habido algunas actualizaciones". Dijo que le gustaría que se desarrollaran normas de la industria que obliguen a las compañías a reportar qué ha cambiado en una evaluación cuando revisan las cifras de desempeño, para que los investigadores puedan interpretar los resultados con mayor claridad.
Los resultados de las referencias importan por varias razones. Son la forma en que las empresas de IA miden su progreso, pero también una manera de llevar la cuenta en la carrera contra sus competidoras. Encabezar las tablas de clasificación puede ayudar a las empresas de IA a ganar clientes y, en algunos casos, a contratar ingenieros e investigadores. Sin embargo, como ilustra este episodio, interpretar las puntuaciones de referencia puede ser técnicamente complejo, lo que supone un desafío para empresas que quieren mostrar los resultados al público en un formato digerible. Estas complejidades, junto con la confusión sobre métricas cambiantes y acusaciones de que las compañías no han sido intelectualmente honestas en cómo presentan los resultados, podrían dificultar que clientes e inversores determinen exactamente qué modelos son mejores para qué tareas. La confusión también podría enturbiar el relato de tener los mejores modelos del mercado, uno que OpenAI sin duda querría presentar de cara a una posible OPV en 2027.
Esta nota fue publicada originalmente en Fortune.com.