Anthropic lanza Claude Opus 5 con contexto de 1M de tokens y precios Opus sin cambios
Puntos clave
- •Claude Opus 5 reemplaza a Claude Opus 4.8 con el mismo precio de API de $5 por millón de tokens de entrada y $25 por millón de tokens de salida.
- •Los desarrolladores podrían tener que actualizar aplicaciones porque el pensamiento está habilitado de forma predeterminada y max_tokens ahora cubre tanto tokens de razonamiento como texto de salida.
- •Opus 5 registró resultados más sólidos que Opus 4.8 en varios benchmarks de codificación y tareas agénticas, incluidos FrontierBench, OSWorld 2.0 y Zapier AutomationBench.
- •Anthropic dijo que Opus 5 tiene capacidades cibernéticas mejoradas, pero permanece bajo las mismas protecciones ASL-3 usadas para Opus 4.8.
- •Las tasas de éxito de ataques de inyección de prompts disminuyeron frente a Opus 4.8 en las pruebas de Gray Swan y de entornos de navegador Claude Cowork.

Anthropic lanzó hoy Claude Opus 5, en reemplazo de Claude Opus 4.8 como el modelo insignia de su nivel Opus. El precio se mantiene sin cambios en $5 por millón de tokens de entrada y $25 por millón de tokens de salida, lo que conserva la nueva opción insignia con la misma tarifa de API que el modelo al que sustituye.
Anthropic describe a Opus 5 como un modelo que se acerca a la inteligencia de Claude Fable 5 a la mitad del precio. El modelo ahora es el predeterminado en Claude Max y el más potente disponible en Claude Pro.
Cambios a nivel de API
Anthropic introdujo varios cambios a nivel de API con Opus 5 que los desarrolladores podrían tener que considerar antes de evaluar resultados de benchmarks o migrar aplicaciones existentes al nuevo modelo.
Primero, el pensamiento está habilitado de forma predeterminada. Con Opus 4.8, las solicitudes se ejecutaban sin pensamiento a menos que los desarrolladores configuraran thinking: {"type": "adaptive"}. Con Opus 5, la misma solicitud piensa de forma predeterminada, mientras que el parámetro effort controla la profundidad. Debido a que max_tokens ahora limita tanto los tokens de pensamiento como el texto de respuesta, es posible que sea necesario revisar los límites de tokens existentes.
Segundo, Anthropic introdujo un cambio incompatible. Las solicitudes que configuran thinking: {"type": "disabled"} con effort establecido en xhigh o max ahora devuelven un error 400. La restricción se aplica por solicitud. Los desarrolladores deben limitar el esfuerzo a high o eliminar el campo de pensamiento.
Tercero, Anthropic recomienda a los desarrolladores eliminar los prompts de verificación. Instrucciones como “include a final verification step” ahora pueden generar verificación excesiva, porque el modelo ya verifica su propio trabajo. La guía de prompts de Opus 5 de Anthropic cubre los patrones de ajuste relacionados.
El ID del modelo es claude-opus-5. Su ventana de contexto es de 1M de tokens tanto por defecto como como máximo, sin una variante más pequeña. La salida máxima es de 128k tokens en la API síncrona Messages. La API Message Batches admite hasta 300k tokens de salida con el encabezado beta output-300k-2026-03-24. La longitud mínima de prompt que puede almacenarse en caché bajó de 1,024 a 512 tokens.
Resultados de benchmarks de codificación y tareas agénticas
En FrontierBench v0.1, un sucesor de Terminal-Bench 2.1 con 74 tareas, Opus 5 obtuvo 43.3% con esfuerzo máximo. Opus 4.8 obtuvo 18.7%, mientras que Fable 5 alcanzó 33.7% y GPT-5.6 Sol llegó a 37.5%. Con esfuerzo xhigh, Opus 5 registró su mejor resultado, con una recompensa media de 44.4%.
Un detalle destacable de esa ejecución se relaciona con los rechazos por seguridad. Los clasificadores de seguridad de Opus 5 marcaron y rechazaron 5% de las llamadas a la API en 4% de las pruebas. Los clasificadores de Fable 5 marcaron 42% de las llamadas en 26% de las pruebas.
Opus 5 obtuvo 96.0% en SWE-bench Verified y 79.2% en SWE-bench Pro. Fable 5 se mantuvo ligeramente por delante en SWE-bench Pro con 80.0%. En SWE-bench Multimodal, Opus 5 mejoró de 38.4% a 59.4%.
Las mayores mejoras aparecieron en evaluaciones agénticas, donde los modelos deben operar en entornos de software en lugar de responder a un único prompt estático. Opus 5 alcanzó 70.57% en OSWorld 2.0, frente a 55.7% de Opus 4.8. En Zapier AutomationBench, obtuvo 26.0%, frente a 17.0% de Opus 4.8 y 17.4% de Fable 5. Con esfuerzo medio, Opus 5 aún obtuvo 24% a $0.89 por tarea.
En Artificial Analysis GDPval-AA v2, Opus 5 ocupó las dos primeras posiciones de la tabla de clasificación con ELO 1861 y 1827. La configuración xhigh superó a todos los demás modelos usando 25% menos tokens de salida que max.
Resultados de razonamiento y ARC-AGI-3
Anthropic evaluó a Opus 5 con los seis problemas de IMO 2026 sin herramientas ni un arnés de agente. Un panel evaluador de tres modelos calificó como correctas las 24 soluciones generadas. Expertos humanos calificaron por separado una solución predefinida por problema con 7/7. La puntuación final de 42/42 corresponde a nivel de medalla de oro y supera el umbral de 29/42.
La ARC Prize Foundation reportó una puntuación verificada de 30.16% para Opus 5 en ARC-AGI-3 con esfuerzo alto. Eso es aproximadamente cuatro veces el mejor puntaje previamente reportado en la tabla de clasificación. GPT-5.6 Sol alcanzó 7.78%, y Opus 4.8 llegó a 1.52%. Los resultados de Opus 5 con esfuerzo máximo no estaban disponibles al momento del lanzamiento.
En Humanity’s Last Exam, Opus 5 obtuvo 56.3% sin herramientas y 64.7% con herramientas.
Uso de herramientas en tareas multimodales
Los resultados multimodales de Anthropic indican que el uso agéntico de herramientas escala el cómputo en tiempo de prueba de forma más costo-efectiva que el pensamiento adaptativo por sí solo.
En Chartography, Opus 5 obtuvo 29.6% sin herramientas y 83.0% al usar un contenedor y una herramienta de recorte de imágenes. En BenchCAD Vision2Code, el IoU de vóxeles subió de 0.366 a 0.821. Con herramientas, Opus 5 superó a Claude Mythos 5, que obtuvo 0.678 en la misma medición.
Capacidades cibernéticas y salvaguardas
Anthropic dijo que no entrenó a Opus 5 en tareas de ciberseguridad. Aun así, la capacidad cibernética del modelo aumentó como subproducto de mejoras generales de capacidad.
En ExploitBench, Opus 5 capturó una media de 10.14 indicadores de capacidad en el brazo AutoNudge y produjo 99 exploits completos de ejecución arbitraria de código. Mythos 5 produjo 132. En OSS-Fuzz, Opus 5 obtuvo una puntuación distinta de cero en 79.4% de los objetivos, mientras que Mythos 5 alcanzó aproximadamente 80%. Sin embargo, Opus 5 completó 4 exploits completos, frente a 13 de Mythos 5.
Esa brecha moldeó el diseño de salvaguardas de Anthropic. Opus 5 es casi tan fuerte como Mythos 5 para encontrar vulnerabilidades, pero sustancialmente más débil para explotarlas. Como resultado, Anthropic desbloqueó la búsqueda de vulnerabilidades en código fuente. El escaneo basado en binarios, las pruebas de penetración y la generación de exploits siguen bloqueados. Anthropic espera que los clasificadores intervengan alrededor de 85% menos que en Fable 5. Los defensores pueden postular al Cyber Verification Program.
UK AISI probó checkpoints tempranos en tres entornos cibernéticos con 100M de tokens por intento. Opus 5 resolvió “The Last Ones” de extremo a extremo en 8 de 10 intentos. No resolvió el entorno más difícil “Doing Life”, pero llegó al paso 22 de 23, más lejos que cualquier otro modelo evaluado.
Bajo la Responsible Scaling Policy de Anthropic, la compañía trata a Opus 5 como un modelo con capacidades CB-1, pero no CB-2. Anthropic está aplicando las mismas protecciones ASL-3 usadas para Opus 4.8. No se cruzó el umbral de I+D de IA.
Resultados de inyección de prompts
En el benchmark de inyección indirecta de prompts de Gray Swan, el éxito de los atacantes en un máximo de 15 intentos cayó de 5.5% en Opus 4.8 a 2.0% en Opus 5. Mythos 5 se ubicó en 2.6%, mientras que GPT-5.6 Sol estuvo en 20.0%.
En entornos de navegador ejecutados mediante Claude Cowork, el éxito de los ataques bajó de 31.5% en Opus 4.8 a 3.70% en Opus 5. Ese resultado se midió sin salvaguardas aplicadas. Con el modo automático habilitado, el éxito de los ataques llegó a 0% en los 129 entornos.
Las fuentes citadas en el informe original incluyen la publicación de lanzamiento de Anthropic, la Claude Opus 5 System Card, Novedades de Claude Opus 5, TechCrunch, y la reseña independiente de CodeRabbit.