Anthropic lanza Claude Fable 5.1, más que duplicando a su predecesor en una prueba clave
Puntos clave
- •Fable 5.1 obtuvo un 52.6% en Terminal-Bench-Science 0.1, más del doble del 24.7% de Fable 5, y un 55.8% en Terminal-Bench 4.0, por encima del 52.3% de Opus 5.
- •Los costos de lectura de caché cayeron un 75%, reduciendo los costos de las cargas de trabajo típicas en alrededor de un 25% y las altamente agénticas hasta en un 45%, mientras el precio base se mantiene en 10 dólares de entrada y 50 de salida por millón de tokens.
- •Fable 5.1 está excluido de los planes Pro y los asientos estándar de Team, que dependen de créditos de pago por consumo; los planes Max y los asientos premium de Team o Enterprise lo incluyen hasta el 50% de los límites de uso semanal.
- •Mythos 5.1 comparte el mismo modelo subyacente que Fable 5.1 pero con distintos filtros de seguridad, y su acceso está limitado a profesionales verificados de ciberseguridad y ciencias de la vida mediante los programas de verificación de Anthropic.
- •Fable 5.1 supera a Opus 5 en todas las pruebas publicadas pero cuesta el doble por token: 10/50 dólares frente a los 5/25 dólares de Opus 5 por millón de tokens.

Anthropic lanzó Claude Fable 5.1 y Claude Mythos 5.1 el 1 de septiembre, su primera actualización de la línea de modelos de clase Mythos desde que Fable 5 debutó el 9 de junio. El nuevo modelo obtuvo un 52.6% en Terminal-Bench-Science 0.1, frente al 24.7% de Fable 5, y un 55.8% en Terminal-Bench 4.0, una mejora respecto al 42.0%. El lanzamiento continúa un patrón en el mercado de modelos de frontera, donde OpenAI, Google y Anthropic han lanzado este año actualizaciones sucesivas de sus modelos insignia, usando las diferencias en pruebas de referencia como principal vara de medición competitiva.
Las lecturas de caché cuestan ahora un 75% menos, lo que reduce los costos de las cargas de trabajo típicas en aproximadamente un 25% y las cargas de trabajo altamente agénticas hasta en un 45%. El precio base se mantiene sin cambios en 10 dólares de entrada y 50 dólares de salida por millón de tokens. El almacenamiento en caché de prompts—reutilizar entradas previamente procesadas en lugar de reprocesarlas en cada llamada—se ha convertido en una palanca de costos estándar entre los principales proveedores de modelos, ya que los flujos de trabajo agénticos, que repiten contextos largos en muchos pasos, disparan las facturas.
Fable 5.1 no está incluido en los planes Pro ni en los asientos estándar de Team, que lo ejecutan con créditos de uso. Los planes Max y los asientos premium de Team o Enterprise lo incluyen hasta el 50% de los límites semanales. Esta estratificación importa para los desarrolladores que deciden dónde dirigir sus cargas de trabajo: lo que cuesta un modelo en la práctica depende tanto del plan bajo el cual se ejecuta como de sus tarifas publicadas por token.
Anthropic afirma que los nuevos modelos son los "más avanzados del mundo para programación y trabajo del conocimiento". El lanzamiento llega tres meses después de iniciado un ciclo que ya incluyó un cierre de 18 días por controles de exportación, una disputa de precios a mitad del verano sobre el acceso por suscripción y el lanzamiento de Claude Opus 5 en julio, que superó a Fable 5 en precio.
Según Anthropic, Fable 5.1 y Mythos 5.1 son el mismo modelo subyacente con distintos filtros de seguridad. Fable 5.1 está disponible de forma general para cualquier persona con una cuenta de Claude. Mythos 5.1 sigue restringido a profesionales verificados de ciberseguridad y ciencias de la vida a través del Cyber Verification Program y el Life Sciences Verification Program de Anthropic, sucesores de la vía de acceso Project Glasswing que regulaba a Mythos 5.
Qué miden realmente las pruebas de referencia
La cifra estelar de Anthropic proviene de Terminal-Bench-Science 0.1, una prueba que evalúa si un agente de IA puede realizar tareas de investigación científica dentro de un entorno de línea de comandos, con una puntuación de tasa de aprobación. Fable 5.1 alcanzó un 52.6%, frente al 24.7% de Fable 5 y el 29.0% de Opus 5—más del doble de su predecesor.
Terminal-Bench 4.0 evalúa la programación agéntica realizada mediante una terminal—escribir, ejecutar y depurar código en sesiones de línea de comandos de múltiples pasos—, puntuada como porcentaje de tareas completadas correctamente. Fable 5.1 obtuvo un 55.8%, frente al 42.0% de Fable 5 y por encima del 52.3% de Opus 5. El énfasis en tareas de terminal de múltiples pasos refleja el giro de la industria, de las respuestas de chat de un solo turno hacia agentes capaces de sostener flujos de trabajo autónomos prolongados, un cambio que ha convertido a las pruebas agénticas en una vara de medición común en los recientes lanzamientos de frontera.
Mythos 5.1, ejecutándose con filtros de ciberseguridad más ligeros, obtuvo un 60.9% en la misma prueba. Anthropic dice que la diferencia refleja tareas que sus salvaguardas interceptaron y redirigieron a Opus 4.8.
En Humanity's Last Exam—una prueba de razonamiento multidisciplinario construida con preguntas de nivel experto en decenas de campos académicos, puntuada como tasa de aprobación—, Fable 5.1 alcanzó un 60.9% sin herramientas externas y un 65.0% con ellas, ambas por encima de Opus 5, lo que lo convierte en el modelo más avanzado de Anthropic para fines académicos.
Dónde supera a Opus 5, y dónde la cuenta se vuelve menos clara
Opus 5 se lanzó en julio a la mitad del precio por token de Fable 5, superando a Fable 5 en la mayoría de las pruebas de referencia importantes, lo que en la práctica hacía redundante al modelo insignia para la mayoría de los usuarios de pago. Fable 5.1 revierte esa situación: ahora supera a Opus 5 en todas las pruebas publicadas por Anthropic, incluidas aquellas en las que Opus 5 había superado previamente a Fable 5.
Pero Fable 5.1 sigue costando el doble por token que Opus 5—10 dólares de entrada y 50 de salida frente a los 5 y 25 dólares de Opus 5. Los tokens son la cantidad básica de información que un modelo puede procesar, generalmente alrededor de dos tercios de una palabra promedio en inglés, y las empresas pagan por uso porque los flujos de trabajo intensivos suelen agotar muy rápido las cuotas de los planes de suscripción. La pregunta de precio versus rendimiento—si un modelo más pequeño y barato es suficientemente bueno—es una que los compradores enfrentan de manera rutinaria en el catálogo de todos los grandes proveedores, no solo en el de Anthropic.
La propuesta de Anthropic para el modelo se apoya en los niveles de esfuerzo más que en puntuaciones brutas: la compañía dice que ejecutar Fable 5.1 con un esfuerzo de razonamiento bajo o medio iguala o supera los resultados antiguos de Fable 5 a un costo mucho menor, reservando los niveles de esfuerzo máximos para problemas que dejan perplejos a todos los demás. Para el trabajo rutinario, el argumento de omitir por completo a Opus 5 se debilita cuanto más bajo se ajusta el nivel de esfuerzo.
El acceso sigue la misma división que se aplicaba a Fable 5 después de meses de ajustes en los términos por parte de Anthropic. En los planes Pro y los asientos estándar de Team o Enterprise, Fable 5.1 se nutre enteramente de créditos de uso de pago por consumo facturados a la tarifa de la API, ya que no forma parte de los límites semanales de esos planes. En los planes Max y los asientos premium de Team o Enterprise, está incluido como parte estándar de la suscripción hasta el 50% del uso semanal.
Claude Fable 5.1 ya está disponible en la API de Claude, Amazon Bedrock, Google Cloud y Microsoft Foundry, bajo el identificador de modelo "claude-fable-5-1" (Anthropic). La disponibilidad en múltiples plataformas en la nube refleja la forma histórica en que Anthropic distribuye sus modelos, permitiendo a los clientes empresariales ejecutarlos dentro de sus contratos de nube existentes en lugar de hacerlo únicamente a través de la API propia de Anthropic.