NoticiasMacroAnthropic dice que Claude Opus 5 se acerca al rendimiento de Fable 5 a la mitad del precio por token

Anthropic dice que Claude Opus 5 se acerca al rendimiento de Fable 5 a la mitad del precio por token

Autor: The Decoder·

Puntos clave

  • Claude Opus 5 mantiene el mismo precio por token que su predecesor, con $5 por millón de tokens de entrada y $25 por millón de tokens de salida, mientras pasa a ser el modelo predeterminado en Claude Max y la opción más capaz en Claude Pro.
  • Opus 5 lidera varios benchmarks, incluido Frontier-Bench v0.1 de codificación agéntica en terminal con 43.3% y ARC-AGI-3 con 30.2%, pero queda detrás de GPT-5.6 Sol en DeepSWE y de Mythos 5 en tareas de ciberseguridad.
  • El modelo puede autocorregirse mediante pasos iterativos y escribir código para crear sus propias herramientas, como mostró al desarrollar de forma independiente un pipeline de visión por computadora para reconstruir una pieza 3D de maquinaria a partir de un dibujo.
  • Los clasificadores de seguridad cibernética de Opus 5 se activan aproximadamente 85% menos que los usados con Fable 5, en respuesta a críticas de desarrolladores sobre interrupciones frecuentes en tareas legítimas de codificación e investigación de seguridad.
  • El ajuste de esfuerzo max produce resultados ligeramente peores que el segundo ajuste más alto en dos benchmarks pese a costar más, lo que indica que un mayor esfuerzo computacional no garantiza mejores salidas del modelo.
Anthropic dice que Claude Opus 5 se acerca al rendimiento de Fable 5 a la mitad del precio por token

Anthropic está posicionando su nuevo modelo insignia, Claude Opus 5, como una alternativa de menor costo a Claude Fable 5, al afirmar que el modelo se acerca al rendimiento de Fable 5 y lo supera en varios benchmarks. El lanzamiento llega en un momento en que los laboratorios de IA compiten intensamente tanto en capacidad como en costo, mientras los clientes empresariales evalúan cada vez más la relación precio-rendimiento al elegir modelos para cargas de trabajo en producción.

La compañía dice que Opus 5 lidera pruebas de codificación agéntica y trabajo de conocimiento, dos de las áreas donde las empresas están implementando IA con mayor intensidad. En ARC-AGI-3, un benchmark diseñado para medir la resolución de problemas novedosos, Opus 5 obtiene 30.2%, casi cuatro veces el resultado registrado por GPT-5.6 Sol.

Anthropic también afirma que Opus 5 puede revisar y mejorar su propio trabajo mediante pasos iterativos, y puede escribir código para crear herramientas cuando las necesita, capacidades relevantes para flujos de trabajo de agentes autónomos en los que los modelos deben completar tareas de varios pasos con mínima intervención humana.

Opus 5 mantiene los precios de Opus 4.8

Anthropic presenta Opus 5 mientras aumenta la presión de precios por parte de GPT-5.6 Sol y competidores chinos. El nuevo modelo busca reducir la brecha de precio-rendimiento frente al más costoso Fable 5. Opus 5 se convierte en el modelo predeterminado en Claude Max y en el modelo más capaz ofrecido en Claude Pro.

El modelo conserva la ventana de contexto de 1 millón de tokens y las mismas tarifas por token que su predecesor, Opus 4.8. Anthropic cobra $5 por millón de tokens de entrada y $25 por millón de tokens de salida por Opus 5. Un nuevo Fast Mode aumenta la velocidad en 2.5x, pero duplica el precio.

Las tarifas base por token no reflejan por completo el costo total de las tareas, porque la eficiencia en el uso de tokens puede variar entre modelos. Opus 4.7 costaba entre 30 y 40% más por tarea que Opus 4.6, aunque ambos modelos usaban las mismas tarifas base. Un patrón similar apareció recientemente con Claude Sonnet 5. Esta diferencia importa para las organizaciones con despliegues a gran escala, donde las variaciones de costo por tarea se acumulan en millones de llamadas a la API.

Los ajustes de mayor esfuerzo pueden costar más sin mejorar los resultados

Los usuarios pueden equilibrar rendimiento y uso de tokens mediante cinco ajustes de esfuerzo: low, medium, high, xhigh y max. Anthropic dice que Opus 5 ofrece mejor valor que su predecesor en todos los niveles de esfuerzo.

En su guía de prompts, Anthropic recomienda usar ampliamente los ajustes "low" y "medium". La compañía dice que esos ajustes entregan buenos resultados con una fracción del uso de tokens y la latencia, al tiempo que superan los mismos ajustes en modelos Opus anteriores. Para tareas de codificación y agénticas, Anthropic sigue recomendando comenzar con "xhigh".

Opus 5 rinde ligeramente peor en el ajuste de esfuerzo max que en el segundo ajuste más alto en dos benchmarks, aunque max cuesta más. La caída aparece en Frontier-Bench v0.1 y en el Artificial Analysis Coding Agent Index. El resultado subraya que un mayor esfuerzo computacional no garantiza mejores salidas, un factor a considerar para equipos que optimizan costo frente a calidad.

Los benchmarks de Anthropic muestran a Opus 5 por delante en codificación agéntica

Según los resultados de benchmarks propios de Anthropic, Opus 5 marca récords en varias evaluaciones. En Frontier-Bench v0.1, alcanza 43.3% en codificación agéntica en terminal, por delante de Fable 5 con 33.7%, GPT-5.6 Sol con 34.4% y Opus 4.8 con 21.1%.

En el benchmark de trabajo de conocimiento GDPval-AA v2, Opus 5 lidera con una puntuación Elo de 1,861. Fable 5 obtiene 1,747, mientras que GPT-5.6 Sol obtiene 1,736.

Opus 5 no lidera en todas las pruebas. En DeepSWE v1.1, que mide codificación agéntica, GPT-5.6 Sol ocupa el primer lugar con 72.7%, seguido de Fable 5 con 69.7% y Opus 5 con 68.8%. En tareas de salud y benchmarks legales, Fable 5 y Mythos 5 superan a Opus 5, respectivamente. Los resultados mixtos muestran que el liderazgo de los modelos varía según el dominio, lo que hace que la selección del modelo dependa de la tarea para compradores empresariales.

El resultado de ARC-AGI-3 es una de las mayores anomalías dentro del conjunto de benchmarks de Anthropic. ARC-AGI-3 evalúa la resolución de problemas novedosos sin depender de patrones memorizados. Opus 5 obtiene 30.2%, frente a 1.5% de Opus 4.8 y 7.8% de GPT-5.6 Sol. Eso ubica a Opus 5 casi cuatro veces por delante del siguiente mejor modelo en los resultados citados. Anthropic no incluye un resultado de Fable 5 para este benchmark, y aún no está claro si una ventaja tan amplia en la prueba se traducirá en uso real.

Opus 5 queda por detrás de Mythos 5 en tareas de ciberseguridad. Anthropic dice que deliberadamente no entrenó a Opus 5 en tareas cibernéticas, como también ocurrió con su predecesor. El modelo se acerca a Mythos 5 al encontrar vulnerabilidades, pero tiene un desempeño mucho peor cuando se le pide explotarlas.

Anthropic también dice que Opus 5 mejoró en la generación de salidas visuales y en el análisis de contenido visual, incluidos gráficos y diagramas.

Anthropic dice que Opus 5 puede crear sus propias herramientas

Anthropic describe a Opus 5 como sustancialmente mejor para revisar su propio trabajo y mejorarlo mediante iteración. Este tipo de autocorrección es un foco creciente para los laboratorios de IA que desarrollan agentes autónomos, donde la capacidad de detectar y corregir errores sin guía humana determina si un modelo puede manejar tareas complejas y abiertas.

En una tarea de Frontier-Bench, Opus 5 recibió el dibujo de una pieza de maquinaria y se le pidió crear un modelo 3D en FreeCAD. Al modelo se le negó intencionalmente una forma directa de ver el dibujo.

Según Anthropic, Opus 5 escribió su propio pipeline de visión por computadora para extraer geometría de píxeles sin procesar y luego reconstruyó la pieza completa. La compañía dice que ningún otro modelo resolvió la tarea después de cinco intentos.

Opus 5 también trabajó sobre un error real en un popular gestor de paquetes de código abierto. Anthropic dice que el modelo identificó la causa raíz y corrigió un caso límite que el parche de la comunidad había pasado por alto. Un modelo competidor corrigió solo el síntoma superficial antes de marcar el error como resuelto.

Anthropic también dice que un ingeniero de una firma de trading usó Opus 5 para construir un feed de datos de mercado para una nueva bolsa en una sola sesión. Modelos anteriores no pudieron completar la tarea, incluso cuando recibieron planes detallados.

Los filtros cibernéticos se activan con menos frecuencia que en Fable 5

Anthropic dice que la configuración de seguridad de Opus 5 permite la investigación de vulnerabilidades en código fuente, pero bloquea el escaneo de vulnerabilidades basado en binarios, las pruebas de penetración y la generación de exploits. Sus clasificadores cibernéticos se activan alrededor de 85% menos que los usados con Fable 5. Las frecuentes intervenciones de Fable 5 habían generado fuertes críticas de desarrolladores que reportaban interrupciones en flujos de trabajo legítimos de codificación e investigación de seguridad.

Las solicitudes bloqueadas en Claude.ai, Claude Code y Claude Cowork recurren por defecto a Opus 4.8, el mismo enfoque que Anthropic usó con Fable 5.

Anthropic llama a Opus 5 el modelo generalmente disponible más capaz para investigación científica. La compañía dice que mejora frente a Opus 4.8 en todas las evaluaciones de ciencias de la vida, con avances notables en química orgánica y tareas relacionadas con proteínas. En química orgánica, Opus 5 mejora 10.2 puntos porcentuales en la derivación de estructuras moleculares a partir de datos de espectroscopía. En tareas relacionadas con proteínas, mejora 7.7 puntos porcentuales.

Anthropic también lanza dos funciones beta junto con Opus 5. Mid-Conversation Tool Changes en Claude Platform permite a los desarrolladores cambiar las herramientas disponibles durante una conversación sin invalidar la caché del prompt. Automatic Fallbacks en la API dirige automáticamente las solicitudes bloqueadas a otro modelo. Ambas funciones reflejan el esfuerzo de Anthropic por abordar puntos de fricción para desarrolladores en torno a la continuidad y confiabilidad del flujo de trabajo.