NoticiasMacroClaude Opus 5 de Anthropic supera a Fable 5 en la mayoría de benchmarks a mitad de precio

Claude Opus 5 de Anthropic supera a Fable 5 en la mayoría de benchmarks a mitad de precio

Autor: Decrypt·

Puntos clave

  • Claude Opus 5 se lanzó el 24 de julio a $5 por millón de tokens de entrada, exactamente la mitad del precio de Fable 5, mientras lo supera en casi todos los principales benchmarks.
  • Opus 5 ahora es el modelo predeterminado en Claude Max y la opción más potente en Claude Pro, reemplazando en la práctica a Fable 5 como el buque insignia para suscriptores de Anthropic después de que ese modelo enfrentara problemas de control de exportación y restricciones solo por créditos.
  • En Frontier-Bench v0.1, Opus 5 logró 43.3%, superando a Fable 5 con 33.7% y a GPT-5.6 Sol de OpenAI con 34.4% en tareas de ingeniería de software de principio a fin.
  • Lovable reportó una mejora de 22% frente a Opus 4.7 en tareas de codificación agéntica, mientras que Zapier registró una puntuación perfecta de AutomationBench para Opus 5 en un flujo completo de prevención de pérdida de clientes.
  • El lanzamiento se produjo una semana después de que Moonshot AI, con sede en Beijing, presentara Kimi K3, un modelo de pesos abiertos con 2.8 billones de parámetros que benchmarks independientes ubican en tercer lugar general detrás de Fable 5 y GPT-5.6 Sol.
Claude Opus 5 de Anthropic supera a Fable 5 en la mayoría de benchmarks a mitad de precio

Anthropic lanzó Claude Opus 5 el 24 de julio, con un precio de $5 por millón de tokens de entrada—igual que su predecesor Opus 4.8 y exactamente la mitad del costo de Fable 5—mientras supera a Fable 5 en la mayoría de los principales benchmarks. El nuevo modelo ahora es la opción predeterminada en Claude Max y la más potente en Claude Pro, reemplazando en la práctica a Fable 5 como la opción principal para la mayoría de los suscriptores.

Opus 5 es más barato de operar para las empresas que el modelo líder de Anthropic, Claude Fable 5, que la compañía había posicionado como su producto frontier de uso cotidiano para usuarios de pago. También supera a Fable 5 en varios benchmarks relevantes. Para las empresas que crean productos sobre APIs de IA, donde los costos de tokens escalan directamente con el volumen de usuarios, un modelo que iguala o supera el desempeño frontier a mitad de precio puede modificar de forma significativa la economía unitaria.

Estructura de niveles de modelos de Anthropic

La línea de Anthropic abarca cuatro niveles. Haiku es rápido y económico. Sonnet se ubica en la gama media. Opus funciona como el caballo de batalla para cargas pesadas. Por encima de ellos está la clase Mythos, un nivel que Anthropic presentó esta primavera, que incluye Claude Fable 5 para el público y Claude Mythos 5, una versión con menos restricciones disponible a través de Project Glasswing para investigadores de ciberseguridad verificados y operadores de infraestructura crítica.

Fable 5 tuvo una trayectoria turbulenta como buque insignia para suscriptores. Se lanzó el 9 de junio, pero fue retirado a nivel global tres días después, luego de que el gobierno de EE. UU. emitiera una orden de control de exportación de emergencia citando una vulnerabilidad de jailbreak. Regresó el 30 de junio, pero de inmediato pasó a un modelo solo por créditos, dejando de estar incluido en los planes estándar. Opus 5 ahora ocupa el espacio que Fable 5 no pudo sostener.

Lovable, una plataforma para desarrolladores con millones de usuarios, probó Opus 5 en sus evaluaciones internas y señaló que las mejoras van más allá de las puntuaciones brutas. "It isn't just better on our hardest agentic coding tasks, up 22% over Opus 4.7, it's steadier, with far less variance run to run," dijo Fabian Hedin en un comunicado compartido por Anthropic.

Resultados de benchmark

Opus 5 supera a Fable 5 en casi todas las métricas relevantes para los usuarios cotidianos, pese a no llevar la designación de clase Mythos.

En Frontier-Bench v0.1—un benchmark que evalúa si los agentes de codificación de IA pueden completar tareas reales de ingeniería de software de principio a fin, medido como porcentaje de tareas aprobadas—Opus 5 alcanzó 43.3%. Fable 5 obtuvo 33.7%, mientras que GPT-5.6 Sol de OpenAI, el principal rival comercial de Anthropic, registró 34.4%.

La mayor diferencia apareció en ARC-AGI-3, una prueba de resolución genuina de problemas basada en acertijos novedosos que un modelo no podría haber memorizado a partir de los datos de entrenamiento, medida como porcentaje de acertijos resueltos. Opus 5 llegó a 30.2%; GPT-5.6 Sol obtuvo 7.8%; y Fable 5 no fue probado.

En GDPval-AA v2—un benchmark de trabajo de conocimiento puntuado mediante ratings Elo, el sistema de clasificación similar al ajedrez usado para medir el desempeño relativo en tareas profesionales reales—Opus 5 alcanzó 1,861, frente a 1,747 de Fable 5 y 1,736 de GPT-5.6 Sol.

Zapier probó Opus 5 en AutomationBench, una evaluación que mide si un modelo puede ejecutar un flujo de trabajo empresarial completo de principio a fin sin intervención humana. Su veredicto: el modelo "took a raw account-health workbook and ran a full churn-prevention sequence end to end: flagging at-risk accounts, alerting the right owner, and summarizing for retention ops. Previous models didn't pass; Opus 5 hit 100%."

Anthropic también está posicionando a Opus 5 como una mejora para investigación. Ultima Genomics, una empresa de secuenciación de ADN, dijo que el modelo "behaves more like a careful scientist than any model we've run. It reaches for the right statistical tests to rule out confounders, cross-checks its own results by independent methods, and stays on track through long multi-step analyses."

Dicho esto, legal y salud son los únicos dos dominios en los que Fable 5 sobresale por un margen estrecho.

Panorama competitivo más amplio

El lanzamiento llega una semana después de que Moonshot AI, una startup con sede en Beijing respaldada por Alibaba, presentara Kimi K3, un modelo de pesos abiertos con 2.8 billones de parámetros, lo que significa que cualquiera puede descargar el código subyacente para ejecutarlo de forma independiente. Moonshot lo describe como el sistema de IA abierto más grande del mundo. Benchmarks independientes ubican de forma consistente a Kimi K3 en el tercer lugar general, detrás de Fable 5 y GPT-5.6 Sol, aunque supera a esos dos en áreas específicas. Ese enfoque de pesos abiertos, que contrasta con el modelo de acceso solo vía API usado por Anthropic y OpenAI, permite a las organizaciones ejecutar modelos en su propio hardware, aunque operar un sistema de 2.8 billones de parámetros exige recursos de cómputo considerables.

Precios y disponibilidad

Opus 5 ya está disponible vía API a $5 por millón de tokens de entrada y $25 por millón de tokens de salida. (Los tokens son la unidad básica de información que un modelo de IA procesa tanto en la entrada como en la salida). También está disponible un modo Fast que funciona a aproximadamente 2.5 veces la velocidad predeterminada, al doble del precio base: $10 por millón de tokens de entrada y $50 por millón de salida.

El lanzamiento podría aliviar las preocupaciones persistentes sobre la disponibilidad pública limitada de Fable 5. Opus 5 también está disponible mediante suscripción para todos los usuarios.