Claude Opus 5.5 d'Anthropic égale le Fable 5.1 phare pour 60 % de son prix
Points clés
- •Les prix par token d'Opus 5.5—4 $ en entrée et 20 $ en sortie—sont 20 % inférieurs à ceux de son prédécesseur et 60 % inférieurs à ceux du phare Fable 5.1, avec un coût des lectures de cache en baisse de 60 % à 0,20 $ par million de tokens.
- •Les benchmarks d'Anthropic placent Opus 5.5 devant Fable 5.1 et Opus 5 sur les tests de codage et de travail cognitif, avec un taux de réussite de 66,4 % sur Terminal-Bench 4.0 et un score Elo de 1846 sur GDPval-AA v2.1.
- •GPT-6 A conserve l'avantage sur Opus 5.5 sur AutomationBench, 41,4 % contre 40,0 %, et sur Terminal-Bench-Science 0.1, 64,6 % contre 58,7 %.
- •Le modèle est livré avec les mêmes garanties en cybersécurité et biologie que Fable 5.1, et la plupart des tâches de cybersécurité restent automatiquement redirigées vers l'ancien Opus 4.8.
- •Opus 5.5 est le troisième modèle de classe phare lancé par Anthropic depuis l'été, après la publication d'un essai du PDG Dario Amodei appelant l'industrie à ralentir le rythme des améliorations des capacités de l'IA.

Anthropic a lancé Claude Opus 5.5 mardi, le premier modèle de ce que l'entreprise appelle sa famille Claude 5.5. Le modèle est facturé 4 $ et 20 $ par million de tokens d'entrée et de sortie—soit 40 % moins cher qu'Opus 5 dans ses réglages par défaut—et Anthropic affirme qu'il égale Claude Fable 5.1, son modèle phare le plus cher, sur la plupart des tâches.
Selon les propres chiffres d'Anthropic, Opus 5.5 devance à la fois Fable 5.1 et son prédécesseur Opus 5 sur les tests de codage et de travail cognitif, même si GPT-6 Astra le bat toujours sur AutomationBench et Terminal-Bench-Science 0.1. Le nouveau modèle est lancé avec les mêmes garanties en cybersécurité et biologie que Fable 5.1.
Cette sortie sous-cote à la fois le modèle qu'il remplace et le modèle phare qu'il poursuit : Opus 5.5 coûte 20 % moins cher à faire tourner qu'Opus 5 et est 60 % moins cher que Fable 5.1, l'offre la plus avancée de l'entreprise.
Le modèle est le plus avancé d'Anthropic tant en version (5.5 contre 5.1 pour Fable) qu'en gamme au sein de la famille—Opus étant le plus grand modèle publiquement disponible, suivi de Sonnet, Haiku étant le plus petit. Anthropic reconnaît que l'écart réel entre Fable et Opus est plus étroit que ne le suggèrent les scores des benchmarks, mais la disponibilité publique d'Opus via des abonnements payants et son coût par token plus faible en font le choix évident pour la plupart des utilisateurs de Claude.
Les deux gammes de produits se sont disputé la tête cette année. Opus 5 a été lancé en juillet, moins cher et mieux noté que Fable 5 sur la plupart des benchmarks. Fable 5.1 est arrivé début septembre et a inversé la tendance, battant Opus 5 sur chaque benchmark publié par Anthropic. Opus 5.5 réduit à nouveau l'écart—cette fois sur le prix plutôt que sur les scores bruts.
Lovable, une plateforme de développement qui a testé Opus 5 dans ses propres tests de codage en juillet, a déclaré dans un communiqué partagé par Anthropic que le modèle précédent était « plus stable, avec une variance bien moindre d'une exécution à l'autre » que ce qui le précédait—le même argument d'efficacité qu'Anthropic avance à nouveau aujourd'hui.
Opus 5.5 est également le premier modèle qu'Anthropic lancé depuis que le PDG Dario Amodei a publié un essai appelant l'industrie à ralentir, affirmant que les gains de capacités de l'IA dépassent les tests de sécurité censés les encadrer. « Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles d'IA », a écrit Amodei plus tôt ce mois-ci. Anthropic a désormais lancé trois modèles de classe phare depuis l'été—Opus 5 en juillet, Fable 5.1 début septembre et Opus 5.5 mardi—soit le rythme que l'essai estime devoir ralentir.
Anthropic mesure une grande partie de ces progrès via le codage agentique—un travail effectué par un agent d'IA, un modèle qui entreprend des actions en plusieurs étapes de manière autonome plutôt que de simplement répondre à une seule requête.
Sur Terminal-Bench 4.0, qui teste la capacité d'un agent à accomplir des tâches professionnelles complexes dans une interface en ligne de commande et note les résultats en pourcentage de tâches accomplies, Opus 5.5 atteint 66,4 %, devant les 55,8 % de Fable 5.1 et les 57,9 % de GPT-6 Astra. FrontierCode, qui vérifie si les modifications de code d'un agent seraient réellement fusionnées dans un pipeline d'ingénierie réel selon la même méthode de taux de réussite, place Opus 5.5 à 54,4 % contre 50,3 % pour Fable 5.1.
Sur GDPval-AA v2.1, qui évalue le travail professionnel réel dans 44 professions à l'aide du classement Elo—le système de classement de type échiquéen qui mesure la compétence relative plutôt qu'un simple pourcentage—Opus 5.5 a obtenu 1846, contre 1735 pour Fable 5.1 et 1708 pour Opus 5.
Opus 5.5 ne domine pas partout. Sur AutomationBench, un benchmark conçu par Zapier qui évalue la capacité d'un agent à mener un flux de travail professionnel complet du début à la fin sans aide humaine, les 41,4 % de GPT-6 Astra devancent de justesse les 40,0 % d'Opus 5.5. Sur Terminal-Bench-Science 0.1, qui teste la recherche scientifique agentique menée dans un environnement en ligne de commande selon la même méthode de taux de réussite, les 64,6 % d'Astra battent les 58,7 % d'Opus 5.5 avec une marge plus importante.
L'argument de vente le plus fort reste le coût. Les tokens d'entrée—les blocs de texte qu'un modèle lit et écrit, facturés au million—coûtent désormais 4 $ pour Opus 5.5 contre 5 $ pour Opus 5, et les tokens de sortie passent de 25 $ à 20 $. Les lectures de cache, qui consistent à réutiliser un contexte déjà traité par le modèle plutôt qu'à le retraiter de zéro et qui représentent l'essentiel du coût des longues sessions de codage agentique, baissent de 60 % à 0,20 $ par million de tokens. Cette structure fait se cumuler la remise là où elle compte : les longues sessions de codage agentique sont facturées principalement sur les lectures de cache, la réduction la plus forte s'appliquant donc au poste le plus important.
Comme Opus 5.5 égale les modèles de classe Mythos d'Anthropic—la gamme la plus restreinte de l'entreprise, réservée aux chercheurs en cybersécurité et en biologie dûment vérifiés—sur ces deux capacités, il est lancé avec les mêmes garanties que Fable .1. La plupart des tâches de cybersécurité sont automatiquement redirigées vers l'ancien Opus 4.8, une pratique dont de nombreux développeurs et utilisateurs se sont déjà plaints. Reste à savoir si l'arrivée d'Opus 5.5 modifiera ce comportement de redirection.
Opus 5.5 est disponible dès maintenant sur les plateformes d'Anthropic, notamment Amazon Web Services, Google Cloud et Microsoft Azure. Sonnet 5.5 et Haiku 5.5 suivront dans les semaines à venir, indique Anthropic, avec les mêmes baisses de prix sur le reste de la gamme.