NoticiasAccionesAnthropic lanza Claude Opus 5: inteligencia cercana a la frontera a mitad de costo para cargas empresariales y de programación

Anthropic lanza Claude Opus 5: inteligencia cercana a la frontera a mitad de costo para cargas empresariales y de programación

Autor: VentureBeat AI·

Puntos clave

  • Opus 5 tiene el mismo precio que Opus 4.8, mientras Anthropic afirma que ofrece casi toda la inteligencia de Fable 5 a mitad de costo.
  • Anthropic informa que Opus 5 obtuvo 43.3% en Frontier-Bench v0.1, frente a 18.7% de Opus 4.8 y 33.7% de Fable 5.
  • La compañía dice que Fable 5 sigue siendo más adecuado para los proyectos autónomos más largos, mientras que Opus 5 es más fuerte en tareas acotadas con resultados específicos.
  • Los primeros clientes citaron menor uso de tokens, menos llamadas a herramientas, tiempos de finalización más rápidos y mejor desempeño en flujos legales, financieros, de automatización y de programación.
  • Opus 5 incluye clasificadores de seguridad, enrutamiento de respaldo a Opus 4.8 en ciertos productos, modo Fast, disponibilidad vía API y ausencia de requisitos de retención de datos para acceso general.
Anthropic lanza Claude Opus 5: inteligencia cercana a la frontera a mitad de costo para cargas empresariales y de programación

Anthropic lanzó Claude Opus 5 el viernes, un modelo que, según la compañía, ofrece casi toda la inteligencia de su modelo insignia Claude Fable 5 a mitad de costo, un lanzamiento que subraya cómo el panorama competitivo de la IA está pasando de la capacidad bruta a la economía del uso cotidiano.

El modelo está disponible de inmediato en todas las plataformas de Anthropic. Su precio es de $5 por millón de tokens de entrada y $25 por millón de tokens de salida, sin cambios respecto de su predecesor, Opus 4.8. Opus 5 se convierte en el nuevo modelo predeterminado de Claude Max, el nivel premium para consumidores de Anthropic, y en el modelo más potente disponible en Claude Pro.

El posicionamiento es deliberado. Anthropic no afirma que Opus 5 sea su modelo más inteligente; esa distinción sigue perteneciendo a Fable 5, y los sistemas rivales conservan ventaja en ciertos ámbitos. En cambio, la compañía está impulsando un argumento más sutil dirigido directamente a compradores empresariales: que el trabajo de IA más significativo desde el punto de vista económico se ubica en una franja intermedia de dificultad, donde la inteligencia cercana a la frontera, entregada de forma eficiente y asequible, supera a la inteligencia de frontera ofrecida a un costo premium.

"Opus 5 as your daily driver, the model you hand complex work to and review when it's done," dijo un portavoz de Anthropic en una entrevista con VentureBeat, al describir la estratificación de modelos de la compañía. "Fable 5 for your most ambitious work, the days-long autonomous projects nothing could take on before... Sonnet 5 for work you run at scale, where speed and cost per call decide what ships. Haiku 4.5 for subagents and instant answers."

Desempeño en benchmarks: Opus 5 frente a Fable 5 y sus competidores

Sobre el papel, los resultados en benchmarks son llamativos. Anthropic afirma que Opus 5 establece nuevas marcas de vanguardia en evaluaciones de programación y trabajo del conocimiento, incluidas Frontier-Bench y GDPval-AA.

En Frontier-Bench v0.1, un benchmark de programación agéntica en terminal, Opus 5 obtiene 43.3 percent, más del doble del 18.7 percent de Opus 4.8 y muy por encima del 33.7 percent de Fable 5, con un menor costo por tarea, según la compañía. En ARC-AGI 3, una evaluación de resolución de problemas novedosos, Anthropic informa que Opus 5 obtuvo una puntuación tres veces superior a la del siguiente mejor modelo. En OSWorld 2.0, un benchmark de uso de computadoras, la compañía dice que Opus 5 supera el mejor resultado de Fable 5 a poco más de un tercio del costo.

Las cifras vienen acompañadas de salvedades que, en sí mismas, resultan notables en una industria propensa a los superlativos. Anthropic reconoce que Opus 5 sigue por detrás de Mythos 5, un modelo competidor, en tareas de ciberseguridad e investigación biológica. Un modelo de la familia OpenAI aún lidera en un benchmark de programación agéntica.

La salvedad más reveladora provino directamente de Anthropic cuando se le preguntó en qué aspectos Opus 5 aún queda por debajo de Fable 5. La respuesta del portavoz fue una admisión franca sobre lo que los benchmarks pueden y no pueden capturar.

"The evals where Opus 5 wins are bounded tasks with a specific outcome, which is where it's strongest. What those evals don't measure is duration," dijo el portavoz a VentureBeat. "One way to put it: Opus 5 is the best tool for the jobs benchmarks can see, and Fable 5 is what you reach for when the job outruns the benchmark."

Fable 5, en contraste, "is for the longest, most autonomous jobs, where the model has to stay coherent across many connected steps over hours or days with dense source material," dijo el portavoz, al recomendar a los clientes "run both on a representative workload, one bounded task and one long-horizon job." Ese encuadre —tareas acotadas frente a autonomía de largo horizonte— podría convertirse en el eje definitorio de la diferenciación de modelos en 2026, a medida que los benchmarks se saturan y los problemas más difíciles restantes implican trabajo agéntico sostenido durante varios días, más que acertijos discretos.

La eficiencia en tokens como el verdadero campo de batalla empresarial

A lo largo del lanzamiento aparece un tema que Anthropic claramente quiere que los compradores asimilen: Opus 5 no solo obtiene buenos resultados, sino que los obtiene bien por dólar. El modelo incluye una configuración ajustable de "effort" que permite a los clientes intercambiar inteligencia por velocidad y ahorro de tokens, y los gráficos de Anthropic enfatizan el desempeño a un costo determinado, no solo el rendimiento máximo.

Los primeros clientes reforzaron ese punto con una especificidad inusual. Harvey, la compañía de IA legal, dijo que Opus 5 logró un desempeño similar al modo de razonamiento máximo de Opus 4.8 "while generating 26% fewer tokens on average," según Niko Grupen, su jefe de investigación aplicada. Richard Pham, de Fundamental Research Lab, dijo que en tareas difíciles de modelado financiero el modelo promedió nueve puntos porcentuales más de precisión "while using roughly one-third fewer turns and tool calls and 60% less time."

Wade Foster, director ejecutivo de Zapier, dijo que Opus 5 encabezó la tabla de posiciones AutomationBench de su compañía "without spending more tokens than prior Claude models," ejecutando de extremo a extremo un flujo completo de prevención de bajas de clientes. "Previous models didn't pass; Opus 5 hit 100%," dijo.

Scott Wu, director ejecutivo de Cognition, la compañía detrás del agente de programación Devin, dijo que en FrontierCode 1.1, "Claude Opus 5 approaches Fable-level performance at half the cost," con fortalezas particulares en depuración y análisis de causa raíz.

El énfasis en la eficiencia refleja la realidad comercial. El gasto empresarial en IA ya no es experimental, y los costos de inferencia —el precio de ejecutar modelos a escala— se han convertido en una preocupación de nivel directivo. El negocio de Anthropic se inclina fuertemente hacia el uso de API y empresarial; según un análisis de febrero de 2026 de Contrary Research, Claude tenía aproximadamente 40 percent del mercado empresarial de grandes modelos de lenguaje por uso a fines de 2025, y Claude Code por sí solo había alcanzado alrededor de $1 billion en ingresos anualizados. Para una compañía cuyos clientes pagan por token, un modelo que hace más con menos tokens no es algo deseable adicional: es el producto.

Agentes que se autoverifican y los costos ocultos de la automatización

Más allá de las cifras, Anthropic está impulsando una narrativa de comportamiento: que Opus 5 verifica su propio trabajo e itera hasta tener éxito. La compañía ofreció varios ejemplos de pruebas que se leen como pequeñas parábolas de persistencia de máquina.

En una tarea de Frontier-Bench, se pidió al modelo reconstruir una pieza de máquina como un modelo CAD 3D a partir de un dibujo que intencionalmente no tenía forma de ver. En lugar de fallar, Anthropic dice que Opus 5 escribió su propio pipeline de visión computacional para extraer la geometría de píxeles sin procesar, y lo hizo repetidamente, mientras que ningún modelo competidor resolvió la tarea en cinco intentos. En otro caso, ante un error real en un popular gestor de paquetes de código abierto, el modelo encontró la causa raíz y corrigió un caso límite que el propio parche de la comunidad había pasado por alto; un modelo competidor corrigió solo el síntoma y declaró victoria. Un ingeniero de una firma de trading, según la compañía, usó Opus 5 para construir un feed de datos de mercado para una nueva bolsa en una sola sesión y, al no encontrar un feed en vivo contra el cual validar, observó cómo el modelo construía su propio arnés de pruebas para verificar su código de análisis.

Los clientes describieron comportamientos similares en producción. Cristian Rivera, ingeniero de software staff en Stripe, dijo que le asignó al modelo "a chief-of-staff role over my dev environments" durante un fin de semana: "it built its own monitor, drove each box, and pulled me in only for the judgment calls."

Esta es la capacidad que más importa a las empresas. La brecha entre un modelo que produce una salida plausible y uno que verifica su salida es la brecha entre una demostración y un sistema desplegable. La mayor parte del costo oculto de la IA empresarial hoy es la revisión humana: ingenieros verificando el trabajo de la máquina. Un modelo que revisa de manera confiable su propio trabajo comprime ese costo, precisamente por eso los clientes siguen citando menos turnos, menos pasadas y menos tiempo, en lugar de mayores puntuaciones brutas.

La estrategia de seguridad de Anthropic: brechas de capacidad, clasificadores y respaldos de modelo

El lanzamiento también destaca el enfoque cada vez más intrincado de Anthropic hacia la seguridad, uno que ahora implica no entrenar deliberadamente a sus modelos en ciertas habilidades. La compañía afirma que su auditoría automatizada de comportamiento encontró que Opus 5 es su modelo más alineado hasta la fecha, con una puntuación de 2.3 en comportamiento desalineado general, inferior a Opus 4.8, Sonnet 5 o Fable 5, con las tasas más bajas de comportamiento engañoso y la menor susceptibilidad a ser manipulado para un uso indebido.

En el plano de capacidades, Anthropic dice que evitó intencionalmente entrenar a Opus 5 en tareas cibernéticas, como hizo con Opus 4.8. El modelo mejoró en ellas de todos modos —un efecto secundario de ganancias generales de capacidad— y ahora casi iguala a Mythos 5 en la identificación de vulnerabilidades de software. Sigue muy por detrás en explotarlas: en la evaluación OSS-Fuzz de Anthropic, Opus 5 identificó vulnerabilidades a una tasa de 79.4 percent, cerca del 80 percent de Mythos 5, pero solo logró desarrollar exploits en 4 desafíos frente a los 13 de Mythos 5. Esa asimetría —fuerte en descubrimiento relevante para la defensa, débil en explotación relevante para el ataque— parece deliberada, y las salvaguardas siguen la misma lógica. Anthropic espera que los clasificadores cibernéticos de Opus 5 intervengan aproximadamente 85 percent menos que los de Fable 5.

Cuando se activa un clasificador, las solicitudes en Claude.ai, Claude Code y Claude Cowork recurren de forma predeterminada a Opus 4.8, lo que plantea una pregunta obvia: si una solicitud es demasiado riesgosa para un modelo, ¿por qué es aceptable para otro?

"The model it falls back to has lower capability levels making the risk of harmful use lower as well," dijo el portavoz, y agregó que "there is a message that lets the user know when this occurs and is visible in the chat." La lógica es defendible, pero revela cómo opera la seguridad de la IA en 2026: el riesgo no es una propiedad de la pregunta por sí sola, sino de la pregunta multiplicada por la capacidad del sistema que la responde.

En biología, el cálculo va en sentido contrario. Opus 5 es ahora el modelo de Anthropic más capaz y disponible de forma general para investigación científica, con 10.2 puntos porcentuales más que Opus 4.8 en el benchmark interno de química de la compañía, aunque el portavoz reconoció que "Mythos 5 remains the stronger model for long-horizon, open-ended work like autonomous drug design campaigns."

Apuestas de negocio: una valuación de $380 billion y enormes compromisos de cómputo

El lanzamiento llega en un momento de extraordinario impulso comercial —y obligaciones extraordinarias— para Anthropic. Reuters informó en febrero que la compañía fue valuada en aproximadamente $380 billion en su ronda de financiación más reciente. Según el análisis de Contrary Research, los ingresos anualizados subieron de aproximadamente $1 billion a fines de 2024 a una proyección de $9 billion para fines de 2025, con objetivos internos que, según reportes, alcanzarían entre $20 y $26 billion para 2026.

Esos objetivos están respaldados por enormes compromisos de infraestructura, incluido un acuerdo de cómputo con Azure reportado en $30 billion, junto con acuerdos con Google Cloud y Nvidia, un gasto que solo resulta viable si las empresas siguen ampliando su uso.

En este contexto, la estrategia de precios de Opus 5 tiene sentido claro. Mantener el precio en los niveles de Opus 4.8 mientras se duplica aproximadamente el desempeño en benchmarks agénticos clave equivale, en la práctica, a una fuerte reducción de precio por unidad de capacidad, diseñada para ampliar el embudo de cargas de trabajo que resulta económico automatizar. Cada tarea que era marginal con el costo por éxito de Opus 4.8 se vuelve viable con el de Opus 5, y cada tarea viable representa ingresos recurrentes por tokens.

El contexto regulatorio también se ha vuelto más complejo. Un juez de EE. UU. dio la aprobación final esta semana al acuerdo de $1.5 billion de Anthropic por derechos de autor con autores de libros, informó Reuters, cerrando un capítulo de litigios sobre los primeros datos de entrenamiento de la compañía. En junio, Reuters, citando a Axios, informó que el gobierno de EE. UU. había avanzado para bloquear el acceso extranjero a los modelos más avanzados de Anthropic, un recordatorio de que la IA de frontera ahora está entrelazada con la política de exportación de maneras que determinan qué clientes pueden comprar qué.

Funciones adicionales y disponibilidad

También se lanza el viernes un modo Fast que funciona a aproximadamente 2.5 veces la velocidad predeterminada al doble del precio base, enrutamiento automático de respaldo en la API y cambios de herramientas a mitad de conversación que ya no invalidan la caché del prompt, una función pequeña que los desarrolladores de agentes podrían valorar más que cualquier benchmark.

En línea con los modelos Opus anteriores, Opus 5 no tiene requisitos de retención de datos para el acceso general, un punto que el portavoz destacó sin que se le preguntara para clientes con "a hard zero data retention requirement." Los desarrolladores pueden acceder al modelo como claude-opus-5 en la Claude API desde hoy.

Dos preguntas determinarán si la apuesta da resultado: si las afirmaciones de eficiencia de Opus 5 resisten el contacto con cargas de trabajo de producción a escala, y si las empresas aceptan un mundo en el que los clasificadores de seguridad, y no los usuarios, a veces deciden qué modelo responde.

El mensaje más profundo del lanzamiento del viernes es que el centro de gravedad de la industria de la IA se ha desplazado. Durante tres años, los laboratorios compitieron por lo que su mejor modelo podía lograr en su mejor día. Con Opus 5, Anthropic compite en algo menos glamoroso y mucho más lucrativo: lo que un modelo muy bueno puede hacer todos los días, por la mitad del precio. En un mercado donde la frontera sigue avanzando, Anthropic apuesta a que la verdadera fortuna está justo detrás de ella.