NoticiasMacroClaude Opus 5 lidera varios benchmarks mientras supera a Fable 5 en costo

Claude Opus 5 lidera varios benchmarks mientras supera a Fable 5 en costo

Autor: The Decoder·

Puntos clave

  • Claude Opus 5 obtuvo 61 en el Artificial Analysis Intelligence Index, ligeramente por encima de Claude Fable 5, GPT-5.6 Sol, Kimi K3 y Claude Opus 4.8.
  • En pruebas de programación, Opus 5 compartió el primer lugar en el Artificial Analysis Coding Index e igualó a GPT-5.6 Sol con una puntuación del 89 por ciento en Terminal-Bench v2.1 en el nivel max.
  • La precisión factual sigue siendo un área más débil, con Opus 5 por detrás de Fable 5 en AA-Omniscience y su tasa de alucinación aumentando 14 puntos hasta el 50 por ciento.
  • Epoch AI calificó a Opus 5 ligeramente por debajo de Fable 5 en general, mientras que GPT-5.6 Sol lideró tanto el Epoch Capability Index general como la categoría de ingeniería de software.
  • Vals.ai descubrió que el nivel de razonamiento high de Opus 5 tuvo el mejor desempeño en Vibe Code Bench, superando a los niveles más costosos xhigh y max.
Claude Opus 5 lidera varios benchmarks mientras supera a Fable 5 en costo

Claude Opus 5 de Anthropic es el modelo de IA más capaz disponible actualmente según varios resultados de benchmarks, con un rendimiento particularmente fuerte en calidad analítica, programación y tareas de conocimiento. El modelo iguala o supera a Claude Fable 5 en muchas pruebas con un costo generalmente menor, aunque las evaluaciones también muestran una mayor tasa de alucinación cuando el modelo responde a pesar de la incertidumbre.

En el índice de inteligencia de Artificial Analysis, Claude Opus 5 obtuvo 61 puntos. El índice combina nueve pruebas que abarcan trabajo de conocimiento, programación, razonamiento científico y precisión factual. Ese resultado coloca a Opus 5 ligeramente por encima de Claude Fable 5 con 60, GPT-5.6 Sol con 59, Kimi K3 con 57 y Claude Opus 4.8 con 56. Artificial Analysis trabajó con Anthropic para probar el modelo antes de su lanzamiento público.

En los benchmarks de programación, Claude Opus 5 en el nivel de razonamiento "xhigh", utilizado con Claude Code, comparte el primer lugar en el Artificial Analysis Coding Index. El índice mide qué tan bien los modelos de IA pueden completar de forma independiente tareas de programación, incluida la identificación y corrección de errores. En Terminal-Bench v2.1, que evalúa agentes que actúan como ingenieros autónomos en entornos de terminal reales, Opus 5 obtuvo un 89 por ciento en el nivel "max", igualando al líder anterior, GPT-5.6 Sol.

En razonamiento científico, Opus 5 obtuvo un 53 por ciento en Humanity's Last Exam, una difícil prueba de conocimiento académico multidominio, empatando con Claude Fable 5. En CritPt, un benchmark de física desarrollado por investigadores de Argonne National Laboratory y UIUC, Opus 5 volvió a igualar a Fable 5, pero se mantuvo por detrás de GPT-5.6 Sol, GPT-5.5 Pro y GPT-5.6 Terra.

La precisión factual sigue siendo un área más débil. En AA-Omniscience, que evalúa la precisión de las afirmaciones de conocimiento de un modelo, Opus 5 mejoró 7 puntos respecto a Opus 4.8, pero continuó por detrás de Fable 5. El modelo también responde con mayor frecuencia cuando tiene incertidumbre, lo que eleva su tasa de alucinación en 14 puntos hasta el 50 por ciento. Esa compensación es relevante para implementaciones donde los usuarios quieren que los modelos completen tareas largas y complejas, pero que aún necesiten un manejo confiable de negativas o incertidumbre cuando la respuesta no está respaldada.

Los resultados de Epoch AI muestran una estrecha carrera entre modelos frontera

Epoch AI también ha evaluado Claude Opus 5. El instituto de investigación otorgó al modelo una puntuación general en el Epoch Capability Index de 159, ligeramente por debajo de Fable 5 con 161. En el subconjunto de ingeniería de software, conocido como SWE-ECI, Opus 5 empató con Fable 5 en 161 y superó a GPT-5.6 Terra y Claude Opus 4.8. GPT-5.6 Sol lidera tanto el índice general como la categoría de ingeniería de software.

Los resultados apuntan a una estrecha brecha de rendimiento entre los modelos frontera. Ningún modelo muestra una ventaja clara en todas las categorías. El hallazgo es consistente con el argumento de que los modelos de IA podrían volverse cada vez más commoditizados, una visión que también se ha discutido en relación con los comentarios del CEO de Microsoft, Satya Nadella. También muestra por qué los compradores y desarrolladores comparan cada vez más los modelos por carga de trabajo, latencia, confiabilidad y costo, en lugar de por una única puntuación destacada.

Los niveles de razonamiento más bajos pueden ofrecer mejor relación calidad-precio en programación

La tarea promedio del Intelligence Index cuesta $2.03 con Opus 5. Eso es menor que Claude Fable 5 con fallback a $2.75, pero superior a Opus 4.8 a $1.80 y Sonnet 5 a $1.53. En los niveles de razonamiento "high" y "xhigh", sin embargo, Opus 5 supera tanto a Opus 4.8 como a Sonnet 5 con un costo menor.

Vals.ai probó Claude Opus 5 en los cinco niveles de razonamiento utilizando Vibe Code Bench, un benchmark para tareas de programación. Las puntuaciones subieron del 76.7 por ciento en "low" al 82 por ciento en "medium" y 89.8 por ciento en "high". Luego, el rendimiento descendió en los dos niveles más altos: "xhigh" obtuvo 88.3 por ciento y "max" 88.4 por ciento, a pesar de costos sustancialmente mayores.

Vals.ai descubrió que los niveles más altos tienden a generar soluciones más complejas, que con mayor frecuencia contienen errores. El nivel "high" produjo soluciones más simples que cumplían los requisitos de manera más confiable.

Terminal-Bench 2.1 muestra un patrón similar. El nivel "high" superó a "max" porque el modelo dedica más tiempo a cada intento en el nivel más alto, dejando menos intentos dentro del límite de tiempo del benchmark. Esto coincide con la recomendación de Anthropic, que establece "high" como el nivel predeterminado tanto en la API como en Claude Code.

El precio de tokens se mantiene en $5 por millón de tokens de entrada y $25 por millón de tokens de salida. Las escrituras en caché cuestan $6.25 por millón de tokens con una validez de cinco minutos, mientras que los aciertos de caché cuestan $0.50 por millón de tokens. Esos precios hacen que la longitud de salida, el comportamiento de reintentos y el almacenamiento en caché de prompts sean partes importantes del costo efectivo para flujos de trabajo de programación agentica y procesamiento intensivo de documentos.

Opus 5 lidera en evaluaciones de trabajo de conocimiento

Opus 5 se desempeña especialmente bien en el benchmark AA-Briefcase, que mide qué tan bien los modelos de IA manejan tareas de oficina comunes como redactar informes de investigación, crear presentaciones y analizar hojas de cálculo a partir de miles de archivos de entrada. El benchmark evalúa el rendimiento en corrección, calidad analítica y calidad de presentación, y luego convierte esos resultados en una clasificación Elo similar a los rankings de ajedrez.

En el nivel de razonamiento máximo, Opus 5 alcanzó una puntuación Elo de 1720, que es 146 puntos por encima de Claude Fable 5 con 1574. Sus tres niveles más altos — max, xhigh y high — ocuparon las tres primeras posiciones. Junto con Fable 5, Sonnet 5 y Opus 4.8, los modelos de Anthropic ahora representan la gran mayoría de las posiciones del top 10.

El costo por tarea se redujo un 20 por ciento a $17.79, en comparación con $22.30 para Fable 5. La versión "xhigh" cuesta $14.26 por tarea, mientras que "high" cuesta $10.41, menos de la mitad del costo de Fable 5. Ambos niveles todavía se ubicaron por delante de Fable 5 por Elo. En rendimiento medio, Opus 5 registró una puntuación Elo de 1470, justo por detrás de GPT-5.6 Sol en max con 1505. En rendimiento bajo, Opus 5 obtuvo 1223 Elo, ligeramente por debajo de GLM-5.2 en max con 1254.

Las mayores ganancias de Opus 5 se observan en calidad analítica. En "max", el modelo alcanzó un Analytical Quality Elo de 2016, casi 300 puntos por encima de Fable 5. Su Rubric Pass Rate, que mide con qué frecuencia el modelo cumple con los estándares de calidad predefinidos, fue del 58 por ciento en "max", 57.2 por ciento en "xhigh" y 56 por ciento en "high".

La calidad de presentación fue menos dominante. Opus 5 registró un Presentation Elo de 1628, aproximadamente 40 puntos por detrás de GPT-5.6 Sol en "max", que obtuvo 1666.

Un mayor rendimiento también requiere más tiempo. En "max", Opus 5 tarda más de 36 minutos por tarea y promedia 103 pases, aproximadamente un 50 por ciento más que Opus 4.8, que tarda 24 minutos y promedia 55 pases. Para los equipos que evalúan el modelo, los resultados del benchmark sugieren que el mejor nivel puede depender de si la tarea premia el análisis máximo, una entrega más rápida o un menor costo por tarea.