Claude Opus 5 domine plusieurs benchmarks tout en coûtant moins cher que Fable 5
Points clés
- •Claude Opus 5 a obtenu 61 sur l’Artificial Analysis Intelligence Index, légèrement devant Claude Fable 5, GPT-5.6 Sol, Kimi K3 et Claude Opus 4.8.
- •Dans les tests de codage, Opus 5 a partagé la première place de l’Artificial Analysis Coding Index et a égalé GPT-5.6 Sol avec un score de 89 percent sur Terminal-Bench v2.1 au niveau max.
- •L’exactitude factuelle reste un domaine plus faible, Opus 5 étant derrière Fable 5 sur AA-Omniscience, tandis que son taux d’hallucination augmente de 14 points à 50 percent.
- •Epoch AI a classé Opus 5 légèrement sous Fable 5 au global, tandis que GPT-5.6 Sol a mené à la fois l’Epoch Capability Index global et la catégorie du génie logiciel.
- •Vals.ai a constaté que le niveau de raisonnement high d’Opus 5 obtenait les meilleurs résultats sur Vibe Code Bench, dépassant les niveaux xhigh et max plus coûteux.

Claude Opus 5 d’Anthropic est, selon plusieurs résultats de benchmarks, le modèle d’IA le plus performant actuellement disponible, avec des résultats particulièrement solides en qualité analytique, en codage et dans les tâches de travail intellectuel. Le modèle égale ou dépasse Claude Fable 5 dans de nombreux tests tout en coûtant généralement moins cher, même si les évaluations montrent aussi un taux d’hallucination plus élevé lorsque le modèle répond malgré l’incertitude.
Sur l’Intelligence Index d’Artificial Analysis, Claude Opus 5 a obtenu un score de 61. L’indice combine neuf tests couvrant le travail intellectuel, le codage, le raisonnement scientifique et l’exactitude factuelle. Ce résultat place Opus 5 légèrement devant Claude Fable 5 à 60, GPT-5.6 Sol à 59, Kimi K3 à 57 et Claude Opus 4.8 à 56. Artificial Analysis a travaillé avec Anthropic pour tester le modèle avant sa sortie publique.
Dans les benchmarks de codage, Claude Opus 5 au niveau de raisonnement "xhigh", utilisé avec Claude Code, partage la première place de l’Artificial Analysis Coding Index. Cet indice mesure la capacité des modèles d’IA à réaliser de manière autonome des tâches de programmation, notamment l’identification et la correction de bugs. Sur Terminal-Bench v2.1, qui évalue des agents agissant comme des ingénieurs autonomes dans de véritables environnements de terminal, Opus 5 a obtenu 89 percent au niveau "max", égalant l’ancien leader, GPT-5.6 Sol.
Pour le raisonnement scientifique, Opus 5 a obtenu 53 percent à Humanity's Last Exam, un test difficile de connaissances académiques couvrant plusieurs domaines, à égalité avec Claude Fable 5. Sur CritPt, un benchmark de physique développé par des chercheurs de l’Argonne National Laboratory et de l’UIUC, Opus 5 égale de nouveau Fable 5, mais reste derrière GPT-5.6 Sol, GPT-5.5 Pro et GPT-5.6 Terra.
L’exactitude factuelle reste un domaine plus faible. Sur AA-Omniscience, qui teste l’exactitude des affirmations de connaissance d’un modèle, Opus 5 s’est amélioré de 7 points par rapport à Opus 4.8, mais reste derrière Fable 5. Le modèle répond aussi plus souvent lorsqu’il est incertain, ce qui augmente son taux d’hallucination de 14 points à 50 percent. Ce compromis est important pour les déploiements où les utilisateurs veulent que les modèles accomplissent des tâches longues et complexes, tout en nécessitant un refus fiable ou une bonne gestion de l’incertitude lorsque la réponse n’est pas étayée.
Les résultats d’Epoch AI montrent une course serrée entre modèles de pointe
Epoch AI a également évalué Claude Opus 5. L’institut de recherche a attribué au modèle un score global de 159 sur l’Epoch Capability Index, légèrement inférieur à celui de Fable 5, à 161. Dans le sous-ensemble consacré au génie logiciel, appelé SWE-ECI, Opus 5 est à égalité avec Fable 5 à 161 et dépasse GPT-5.6 Terra ainsi que Claude Opus 4.8. GPT-5.6 Sol mène à la fois l’indice global et la catégorie du génie logiciel.
Les résultats indiquent un écart de performance réduit entre les modèles de pointe. Aucun modèle ne montre une avance claire dans toutes les catégories. Ce constat est cohérent avec l’argument selon lequel les modèles d’IA pourraient devenir de plus en plus banalisés, un point de vue également évoqué en lien avec des commentaires du CEO de Microsoft, Satya Nadella. Il montre aussi pourquoi les acheteurs et les développeurs comparent de plus en plus les modèles selon la charge de travail, la latence, la fiabilité et le coût, plutôt qu’à partir d’un seul score mis en avant.
Les niveaux de raisonnement inférieurs peuvent offrir un meilleur rapport coût-performance en codage
La tâche moyenne de l’Intelligence Index coûte $2.03 avec Opus 5. C’est moins que Claude Fable 5 avec fallback à $2.75, mais plus qu’Opus 4.8 à $1.80 et Sonnet 5 à $1.53. Aux niveaux de raisonnement "high" et "xhigh", toutefois, Opus 5 dépasse à la fois Opus 4.8 et Sonnet 5 tout en coûtant moins cher.
Vals.ai a testé Claude Opus 5 sur les cinq niveaux de raisonnement à l’aide de Vibe Code Bench, un benchmark de tâches de programmation. Les scores sont passés de 76.7 percent au niveau "low" à 82 percent au niveau "medium" et 89.8 percent au niveau "high". La performance a ensuite reculé aux deux niveaux les plus élevés : "xhigh" a obtenu 88.3 percent et "max" 88.4 percent, malgré des coûts nettement plus élevés.
Vals.ai a constaté que les niveaux les plus élevés ont tendance à générer des solutions plus complexes, qui contiennent plus souvent des erreurs. Le niveau "high" a produit des solutions plus simples répondant aux exigences de manière plus fiable.
Terminal-Bench 2.1 montre une tendance similaire. Le niveau "high" a surpassé "max", car le modèle consacre plus de temps à chaque tentative au niveau le plus élevé, ce qui laisse moins de tentatives dans la limite de temps du benchmark. Cela correspond aux recommandations d’Anthropic, qui définit "high" comme niveau par défaut à la fois dans l’API et dans Claude Code.
La tarification des tokens reste de $5 par million de tokens d’entrée et $25 par million de tokens de sortie. Les écritures en cache coûtent $6.25 par million de tokens avec une durée de vie de cinq minutes, tandis que les lectures depuis le cache coûtent $0.50 par million de tokens. Ces prix font de la longueur de sortie, du comportement de relance et de la mise en cache des prompts des éléments importants du coût effectif pour le codage agentique et les flux de travail fortement documentaires.
Opus 5 mène dans les évaluations du travail intellectuel
Opus 5 obtient des résultats particulièrement solides sur le benchmark AA-Briefcase, qui mesure la capacité des modèles d’IA à gérer des tâches de bureau courantes, comme la rédaction de rapports de recherche, la création de présentations et l’analyse de feuilles de calcul à partir de milliers de fichiers d’entrée. Le benchmark évalue les performances selon l’exactitude, la qualité analytique et la qualité de présentation, puis convertit ces résultats en un classement Elo similaire aux classements aux échecs.
Au niveau de raisonnement max, Opus 5 a atteint un score Elo de 1720, soit 146 points de plus que Claude Fable 5 à 1574. Ses trois niveaux les plus élevés — max, xhigh et high — ont occupé les trois premières places. Avec Fable 5, Sonnet 5 et Opus 4.8, les modèles d’Anthropic représentent désormais la grande majorité des positions du top 10.
Le coût par tâche a reculé de 20 percent à $17.79, contre $22.30 pour Fable 5. La version "xhigh" coûte $14.26 par tâche, tandis que "high" coûte $10.41, soit moins de la moitié du coût de Fable 5. Les deux niveaux restent toutefois devant Fable 5 au classement Elo. À performance moyenne, Opus 5 a enregistré un score Elo de 1470, juste derrière GPT-5.6 Sol au niveau max avec 1505. À faible performance, Opus 5 a obtenu 1223 Elo, légèrement sous GLM-5.2 au niveau max avec 1254.
Les gains les plus importants d’Opus 5 apparaissent dans la qualité analytique. Au niveau "max", le modèle a atteint un Elo de qualité analytique de 2016, près de 300 points devant Fable 5. Son Rubric Pass Rate, qui mesure la fréquence à laquelle le modèle satisfait des standards de qualité prédéfinis, était de 58 percent au niveau "max", 57.2 percent au niveau "xhigh" et 56 percent au niveau "high".
La qualité de présentation a été moins dominante. Opus 5 a enregistré un Elo de présentation de 1628, environ 40 points derrière GPT-5.6 Sol au niveau "max", qui a obtenu 1666.
Une performance plus élevée exige aussi plus de temps. Au niveau "max", Opus 5 prend plus de 36 minutes par tâche et réalise en moyenne 103 passes, soit environ 50 percent de plus qu’Opus 4.8, qui prend 24 minutes et réalise en moyenne 55 passes. Pour les équipes qui évaluent le modèle, les résultats des benchmarks suggèrent que le meilleur niveau peut dépendre du fait que la tâche privilégie l’analyse maximale, un délai d’exécution plus rapide ou un coût par tâche plus faible.