ActualitésActionsAnthropic lance Claude Fable 5.1, plus du double de son prédécesseur sur un benchmark clé

Anthropic lance Claude Fable 5.1, plus du double de son prédécesseur sur un benchmark clé

Auteur: Decrypt·

Points clés

  • Fable 5.1 a obtenu 52,6 % sur Terminal-Bench-Science 0.1, plus du double des 24,7 % de Fable 5, et 55,8 % sur Terminal-Bench 4.0, devant les 52,3 % d'Opus 5.
  • Le coût des lectures de cache a baissé de 75 %, réduisant les coûts des charges de travail typiques d'environ 25 % et ceux des charges hautement agentiques de jusqu'à 45 %, tandis que le tarif de base reste à 10 $ en entrée et 50 $ en sortie par million de tokens.
  • Fable 5.1 est exclu des plans Pro et des sièges Team standard, qui reposent sur des crédits à l'usage ; les plans Max et les sièges Team ou Enterprise premium l'incluent jusqu'à 50 % des limites d'usage hebdomadaires.
  • Mythos 5.1 partage le même modèle sous-jacent que Fable 5.1 mais avec des filtres de sécurité différents, et son accès est limité aux professionnels vérifiés de la cybersécurité et des sciences de la vie via les programmes de vérification d'Anthropic.
  • Fable 5.1 surpasse Opus 5 sur tous les benchmarks publiés mais coûte deux fois plus cher par token, à 10 $/50 $ contre 5 $/25 $ pour Opus 5 par million de tokens.
Anthropic lance Claude Fable 5.1, plus du double de son prédécesseur sur un benchmark clé

Anthropic a publié Claude Fable 5.1 et Claude Mythos 5.1 le 1er septembre, première mise à jour de la gamme de modèles Mythos depuis le lancement de Fable 5 le 9 juin. Le nouveau modèle a obtenu 52,6 % sur Terminal-Bench-Science 0.1, contre 24,7 % pour Fable 5, et 55,8 % sur Terminal-Bench 4.0, en hausse par rapport à 42,0 %. Cette publication s'inscrit dans une tendance du marché des modèles de pointe, où OpenAI, Google et Anthropic ont chacun livré des mises à jour successives de leurs modèles phares cette année, les écarts de benchmarks servant de principal étalon concurrentiel.

Les lectures de cache coûtent désormais 75 % moins cher, réduisant les coûts des charges de travail typiques d'environ 25 % et ceux des charges de travail hautement agentiques de jusqu'à 45 %. Le tarif de base demeure inchangé à 10 $ en entrée et 50 $ en sortie par million de tokens. Le caching de prompts — réutiliser une entrée déjà traitée plutôt que de la retraiter à chaque appel — est devenu un levier de coût standard chez les principaux fournisseurs de modèles, les flux agentiques, qui répètent de longs contextes sur de nombreuses étapes, faisant grimper les factures.

Fable 5.1 n'est pas inclus dans les plans Pro ni dans les sièges Team standard, qui l'utilisent via des crédits à l'usage. Les plans Max et les sièges Team ou Enterprise premium l'incluent jusqu'à 50 % des limites hebdomadaires. Cette différenciation compte pour les développeurs qui choisissent où acheminer leurs charges de travail : le coût réel d'un modèle dépend autant du plan sous lequel il tourne que de ses tarifs affichés par token.

Anthropic affirme que les nouveaux modèles sont « les plus avancés au monde pour le codage et le travail intellectuel ». Cette publication arrive trois mois après le début d'un cycle de lancement qui a déjà connu une interruption de 18 jours liée aux contrôles d'exportation, une querelle tarifaire estivale sur l'accès par abonnement, et une publication de Claude Opus 5 en juillet qui a surpassé Fable 5 sur le prix.

Selon Anthropic, Fable 5.1 et Mythos 5.1 sont le même modèle sous-jacent avec des filtres de sécurité différents. Fable 5.1 est généralement disponible pour toute personne disposant d'un compte Claude. Mythos 5.1 reste réservé aux professionnels vérifiés de la cybersécurité et des sciences de la vie, via le Cyber Verification Program et le Life Sciences Verification Program d'Anthropic, successeur du dispositif d'accès Project Glasswing qui encadrait Mythos 5.

Ce que mesurent réellement les benchmarks

Le chiffre phare d'Anthropic provient de Terminal-Bench-Science 0.1, un benchmark qui évalue si un agent IA peut accomplir des tâches de recherche scientifique dans un environnement en ligne de commande, avec un score exprimé en taux de réussite. Fable 5.1 a atteint 52,6 %, contre 24,7 % pour Fable 5 et 29,0 % pour Opus 5 — plus du double de son prédécesseur.

Terminal-Bench 4.0 teste le codage agentique effectué via un terminal — écrire, exécuter et déboguer du code sur des sessions en ligne de commande multi-étapes — avec un score exprimé en pourcentage de tâches correctement accomplies. Fable 5.1 a obtenu 55,8 %, en hausse par rapport aux 42,0 % de Fable 5 et devant les 52,3 % d'Opus 5. L'accent mis sur les tâches multi-étapes en terminal reflète l'évolution de l'industrie, qui passe des réponses de chat en un tour vers des agents capables de maintenir de longs flux de travail autonomes — une évolution qui a rendu les benchmarks agentiques un étalon commun dans les récents lancements de modèles de pointe.

Mythos 5.1, fonctionnant avec des filtres de cybersécurité allégés, a obtenu 60,9 % sur le même test. Anthropic indique que cet écart correspond aux tâches que ses garde-fous ont interceptées et réorientées vers Opus 4.8.

Sur Humanity's Last Exam — un test de raisonnement pluridisciplinaire composé de questions de niveau expert dans des dizaines de domaines académiques, noté en taux de réussite — Fable 5.1 a atteint 60,9 % sans outils externes et 65,0 % avec, devançant Opus 5 dans les deux cas, ce qui en fait le modèle d'Anthropic le plus avancé à des fins académiques.

Où il surpasse Opus 5, et là où le calcul devient plus flou

Opus 5 a été lancé en juillet à la moitié du prix par token de Fable 5 tout en surpassant Fable 5 sur la plupart des grands benchmarks, rendant effectivement le modèle phare superflu pour la plupart des utilisateurs payants. Fable 5.1 inverse cette tendance : il surpasse désormais Opus 5 sur tous les benchmarks publiés par Anthropic, y compris ceux sur lesquels Opus 5 avait précédemment battu Fable 5.

Mais Fable 5.1 coûte toujours deux fois plus cher par token qu'Opus 5 — 10 $ en entrée et 50 $ en sortie contre 5 $ et 25 $ pour Opus 5. Les tokens correspondent à la quantité de base d'informations qu'un modèle peut traiter, généralement environ deux tiers d'un mot anglais moyen, et les entreprises paient à l'usage car les charges de travail lourdes épuisent très rapidement les quotas des plans d'abonnement. La question du rapport prix-performance — un modèle plus petit et moins cher suffit-il — est désormais courante pour les acheteurs dans la gamme de chaque grand fournisseur, et pas seulement celle d'Anthropic.

L'argumentaire d'Anthropic pour ce modèle repose sur les niveaux d'effort plutôt que sur les scores bruts : l'entreprise affirme qu'exécuter Fable 5.1 à un niveau de raisonnement faible ou moyen égale ou dépasse les anciens résultats de Fable 5 à un coût bien inférieur, tout en réservant les niveaux d'effort les plus élevés aux problèmes qui bloquent tout le reste. Pour les tâches routine, l'argument visant à écarter entièrement Opus 5 s'affaiblit à mesure que le curseur d'effort descend.

L'accès suit la même répartition que celle appliquée à Fable 5 après des mois d'ajustements par Anthropic. Sur les plans Pro et les sièges Team ou Enterprise standard, Fable 5.1 puise exclusivement dans des crédits d'usage à la demande facturés au tarif API, car il ne fait pas partie des limites hebdomadaires de ces plans. Sur les plans Max et les sièges Team ou Enterprise premium, il est inclus de manière standard dans l'abonnement jusqu'à 50 % de l'usage hebdomadaire.

Claude Fable 5.1 est dès maintenant disponible sur l'API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry, sous l'identifiant de modèle « claude-fable-5-1 » (Anthropic). La disponibilité sur plusieurs plateformes cloud reflète la manière dont Anthropic a historiquement distribué ses modèles, permettant aux clients entreprise de les exécuter dans leurs contrats cloud existants plutôt que uniquement via l'API d'Anthropic.