Anthropic Claude Opus 5 lidera el benchmark ARC-AGI-3 con una puntuación de 30.2%
Puntos clave
- •Claude Opus 5 obtuvo 30.2% en ARC-AGI-3, frente al récord anterior de 7.8% establecido por GPT-5.6 Sol (Max) de OpenAI.
- •ARC Prize dijo que Opus 5 resolvió cinco entornos previamente no resueltos, incluidos cuatro con desempeño al nivel humano o por encima de él.
- •ARC-AGI-3 evalúa la capacidad independiente de un modelo para inferir reglas, planificar acciones y resolver entornos interactivos desconocidos sin asistencia de software externo.
- •Opus 5 también igualó las mejores puntuaciones previas en ARC-AGI-2 y ARC-AGI-1, con 90.4% y 97.5%, respectivamente, aunque con costos ligeramente más altos.
- •En el benchmark privado Witness, Opus 5 obtuvo 43.4 y mostró mejoras más acotadas, empatando estadísticamente con Kimi K3 y Fable 5.

Claude Opus 5 de Anthropic se convirtió en el modelo con mejor desempeño en ARC-AGI-3, un benchmark diseñado para evaluar si los sistemas de IA pueden resolver tareas desconocidas en lugar de depender de conocimiento almacenado o de patrones vistos durante el entrenamiento.
Según ARC Prize, Claude Opus 5 obtuvo 30.2 por ciento en ARC-AGI-3, casi cuatro veces el récord anterior de 7.8 por ciento establecido por GPT-5.6 Sol (Max) de OpenAI. El resultado también coloca a Opus 5 por delante de los modelos "Fable-class" de Anthropic, que alcanzaron alrededor de 20 por ciento, según ARC Prize.
Opus 5 resolvió cinco entornos que no habían sido resueltos previamente, incluidos cuatro al nivel humano o por encima de él. Seis de los 25 entornos públicos de demostración ya han sido resueltos. ARC Prize puso a disposición del público los resultados completos, la tarjeta de puntuación y el código de benchmarking.
El análisis de ARC Prize atribuye el liderazgo de Opus 5 a un razonamiento lógico más sólido, "que permite una exploración, planificación y ejecución más autónomas en entornos desconocidos". Durante las pruebas, los investigadores también observaron comportamientos que, según dijeron, no habían aparecido antes en un modelo de IA, incluida la traducción de tareas a notación algebraica y la formulación independiente de ecuaciones de reflexión.
En versiones anteriores del benchmark, Opus 5 alcanzó 90.4 por ciento en ARC-AGI-2 y 97.5 por ciento en ARC-AGI-1. ARC Prize dijo que ambas puntuaciones igualan los mejores resultados previos, aunque con costos ligeramente más altos.
ARC-AGI-3 se enfoca en tareas interactivas desconocidas
ARC-AGI-3 mide qué tan bien los modelos de IA manejan tareas nuevas que no encontraron durante el entrenamiento, incluidas tareas que los humanos normalmente pueden resolver con poca dificultad. La versión actual está estructurada como un juego: el modelo debe inferir las reglas de un entorno interactivo, planificar acciones y ejecutarlas paso a paso.
El benchmark busca evaluar el razonamiento general en lugar del conocimiento memorizado. ARC Prize distingue entre el desempeño independiente de un modelo y los sistemas que usan software adicional, conocido como harness. Algunos sistemas de IA quizá ya hayan superado el benchmark con esa asistencia externa, pero las puntuaciones oficiales solo cuentan el desempeño propio del modelo de lenguaje. ARC Prize sostiene que los futuros sistemas de AGI no deberían requerir ayuda externa para resolver tareas nuevas. El artículo señala que Opus 5 probablemente obtendría una puntuación más alta si se usara dentro de Claude Code.
Esa distinción es importante para comparar afirmaciones sobre benchmarks, porque un sistema asistido puede combinar un modelo de lenguaje con herramientas, estructuras de apoyo u otro soporte de ejecución, mientras que la clasificación oficial de ARC-AGI-3 busca aislar la capacidad propia del modelo para explorar y resolver nuevos entornos.
Pruebas independientes apuntan a mejoras más acotadas
Anthropic no ha explicado la mejora. El artículo fuente dice que el etiquetado de datos dirigido y el aprendizaje por refuerzo son factores plausibles, al tiempo que señala que Opus 5 fue desarrollado después de que ARC-AGI-3 y su formato se hicieran públicos. Ese momento pudo haber permitido a Anthropic enfocarse en las habilidades y formatos de rompecabezas del benchmark, aunque no demuestra que la empresa haya entrenado con las tareas exactas.
Los anotadores podrían haber etiquetado trazas de razonamiento, acciones útiles, intentos fallidos y pasos de recuperación a partir de rompecabezas similares. Luego, el aprendizaje por refuerzo podría recompensar la exploración, la planificación, el descubrimiento de reglas y la autocorrección.
Las pruebas en Witness, el benchmark privado de Guanghan Ning para juegos de rompecabezas interactivos, sugieren mejoras más limitadas. Opus 5 obtuvo 43.4, empatando estadísticamente con Kimi K3 y Fable 5, mientras mejoró mucho menos frente a Opus 4.8 que en ARC-AGI-3. En esas pruebas, Opus 5 identificó las reglas ocultas de un rompecabezas convencional antes de realizar cualquier acción, pero quedó detrás de Opus 4.8 en un juego con mecánicas menos familiares.
Ning dijo que ese patrón es consistente con entrenamiento en datos específicos de un género, aunque Witness no puede identificar qué datos usó Anthropic. Sus comentarios fueron publicados en X en https://x.com/quietnning/status/2080786711861407883.
Greg Kamradt, uno de los investigadores detrás de ARC-AGI-3, dijo que los resultados no descartan mejoras más amplias en razonamiento. Un juego construido sobre mecánicas familiares no pone a prueba la adaptación a la novedad, y un resultado débil no supera la mejora general del modelo sin puntuaciones detalladas para esa tarea. Los comentarios de Kamradt fueron publicados en X en https://x.com/GregKamradt/status/2081031602596200614.
Witness también fue diseñado en torno a rompecabezas al estilo ARC-AGI-3, por lo que un mejor desempeño podría reflejar una transferencia genuina en lugar de memorización. Ning aclaró después que Opus 5 sí generalizó a Witness, pero mucho menos que a ARC-AGI-3. Comparó el proceso con la evolución de los benchmarks de programación, y dijo que, como objetivo importante para el razonamiento interactivo, ARC-AGI-3 probablemente atraerá primero la mayor parte del esfuerzo de entrenamiento.
Ning dijo que cubrir más casos límite podría ayudar luego a los modelos a generalizar a una gama más amplia de tareas de razonamiento abstracto. Comparó el patrón con la programación, que pasó de benchmarks saturados como HumanEval a competencias actualizadas con frecuencia y a los agentes de programación actuales. Su aclaración posterior fue publicada en https://x.com/quietnning/status/2081073990614061084.