ActualitésMacroAnthropic affirme que Claude Opus 5 se rapproche des performances de Fable 5 à moitié prix par token

Anthropic affirme que Claude Opus 5 se rapproche des performances de Fable 5 à moitié prix par token

Auteur: The Decoder·

Points clés

  • Claude Opus 5 conserve la même tarification par token que son prédécesseur, soit $5 par million de tokens d’entrée et $25 par million de tokens de sortie, tout en devenant le modèle par défaut sur Claude Max et l’option la plus performante sur Claude Pro.
  • Opus 5 arrive en tête de plusieurs benchmarks, dont Frontier-Bench v0.1 pour le codage agentique en terminal avec 43.3% et ARC-AGI-3 avec 30.2%, mais reste derrière GPT-5.6 Sol sur DeepSWE et derrière Mythos 5 sur les tâches de cybersécurité.
  • Le modèle peut s’autocorriger par étapes itératives et écrire du code pour créer ses propres outils, comme l’a montré sa création autonome d’un pipeline de vision par ordinateur pour reconstruire une pièce mécanique 3D à partir d’un dessin.
  • Les classificateurs de sécurité cyber d’Opus 5 se déclenchent environ 85% moins souvent que ceux utilisés avec Fable 5, en réponse aux critiques des développeurs selon lesquelles les interventions fréquentes de Fable 5 perturbaient des tâches légitimes de codage et de recherche en sécurité.
  • Le paramètre d’effort max produit des résultats légèrement inférieurs au deuxième niveau le plus élevé sur deux benchmarks malgré un coût supérieur, ce qui indique qu’un effort de calcul plus important ne garantit pas de meilleures sorties du modèle.
Anthropic affirme que Claude Opus 5 se rapproche des performances de Fable 5 à moitié prix par token

Anthropic positionne son nouveau modèle phare, Claude Opus 5, comme une alternative moins coûteuse à Claude Fable 5, affirmant que le modèle se rapproche des performances de Fable 5 tout en le dépassant sur plusieurs benchmarks. Ce lancement intervient alors que les laboratoires d’IA se livrent une concurrence intense à la fois sur les capacités et sur les coûts, les clients entreprises évaluant de plus en plus les compromis prix-performance lorsqu’ils choisissent des modèles pour des charges de travail en production.

L’entreprise indique qu’Opus 5 domine les tests de codage agentique et de travail de connaissance, deux domaines dans lesquels les entreprises déploient fortement l’IA. Sur ARC-AGI-3, un benchmark conçu pour mesurer la résolution de problèmes inédits, Opus 5 obtient 30.2%, soit près de quatre fois le résultat affiché par GPT-5.6 Sol.

Anthropic affirme également qu’Opus 5 peut vérifier et améliorer son propre travail par étapes itératives, et écrire du code pour créer des outils lorsqu’il en a besoin. Ces capacités sont importantes pour les flux de travail d’agents autonomes, où les modèles doivent accomplir des tâches en plusieurs étapes avec une intervention humaine minimale.

Opus 5 conserve la tarification d’Opus 4.8

Anthropic lance Opus 5 alors que la pression sur les prix augmente de la part de GPT-5.6 Sol et de concurrents chinois. Le nouveau modèle vise à réduire l’écart prix-performance avec Fable 5, plus coûteux. Opus 5 devient le modèle par défaut de Claude Max et le modèle le plus performant proposé sur Claude Pro.

Le modèle conserve la fenêtre de contexte de 1 million de tokens et les mêmes tarifs par token que son prédécesseur, Opus 4.8. Anthropic facture Opus 5 $5 par million de tokens d’entrée et $25 par million de tokens de sortie. Un nouveau Fast Mode augmente la vitesse de 2.5x, mais double le prix.

Les tarifs de base par token ne reflètent pas entièrement le coût total des tâches, car l’efficacité en tokens peut varier selon les modèles. Opus 4.7 coûtait 30 à 40% de plus par tâche qu’Opus 4.6, bien que les deux modèles aient utilisé les mêmes tarifs de base. Une tendance similaire est récemment apparue avec Claude Sonnet 5. Cette distinction est importante pour les organisations qui déploient à grande échelle, où les différences de coût par tâche s’accumulent sur des millions d’appels API.

Des niveaux d’effort plus élevés peuvent coûter plus cher sans améliorer les résultats

Les utilisateurs peuvent équilibrer performance et consommation de tokens grâce à cinq paramètres d’effort : low, medium, high, xhigh et max. Anthropic affirme qu’Opus 5 offre une meilleure valeur que son prédécesseur à chaque niveau d’effort.

Dans son guide de prompting, Anthropic recommande d’utiliser largement les paramètres "low" et "medium". L’entreprise indique que ces réglages produisent de bons résultats avec une fraction de l’utilisation de tokens et de la latence, tout en surpassant les mêmes paramètres sur les anciens modèles Opus. Pour les tâches de codage et agentiques, Anthropic recommande toujours de commencer avec "xhigh".

Opus 5 obtient des résultats légèrement inférieurs au paramètre d’effort max qu’au deuxième paramètre le plus élevé sur deux benchmarks, même si max coûte plus cher. Le recul apparaît sur Frontier-Bench v0.1 et sur l’Artificial Analysis Coding Agent Index. Ce constat souligne qu’un effort de calcul plus important ne garantit pas de meilleurs résultats, un point à prendre en compte pour les équipes qui optimisent le rapport coût-qualité.

Les benchmarks d’Anthropic montrent Opus 5 en tête du codage agentique

Selon les propres résultats de benchmark d’Anthropic, Opus 5 établit des records dans plusieurs évaluations. Sur Frontier-Bench v0.1, il atteint 43.3% en codage agentique en terminal, devant Fable 5 à 33.7%, GPT-5.6 Sol à 34.4% et Opus 4.8 à 21.1%.

Sur le benchmark de travail de connaissance GDPval-AA v2, Opus 5 arrive en tête avec un score Elo de 1,861. Fable 5 obtient 1,747, tandis que GPT-5.6 Sol atteint 1,736.

Opus 5 ne domine pas tous les tests. Sur DeepSWE v1.1, qui mesure le codage agentique, GPT-5.6 Sol se classe premier avec 72.7%, suivi de Fable 5 à 69.7% et d’Opus 5 à 68.8%. Sur les tâches de santé et les benchmarks juridiques, Fable 5 et Mythos 5 surpassent respectivement Opus 5. Ces résultats contrastés montrent que le leadership des modèles varie selon les domaines, ce qui rend le choix d’un modèle dépendant de la tâche pour les acheteurs entreprises.

Le résultat ARC-AGI-3 est l’un des écarts les plus marqués dans l’ensemble de benchmarks d’Anthropic. ARC-AGI-3 évalue la résolution de problèmes inédits sans s’appuyer sur des schémas mémorisés. Opus 5 obtient 30.2%, contre 1.5% pour Opus 4.8 et 7.8% pour GPT-5.6 Sol. Cela place Opus 5 près de quatre fois devant le deuxième meilleur modèle dans les résultats cités. Anthropic ne mentionne pas de résultat Fable 5 pour ce benchmark, et il reste incertain qu’une avance aussi importante dans un benchmark se traduise dans les usages réels.

Opus 5 est devancé par Mythos 5 sur les tâches de cybersécurité. Anthropic affirme avoir délibérément choisi de ne pas entraîner Opus 5 sur des tâches cyber, comme c’était également le cas pour son prédécesseur. Le modèle se rapproche de Mythos 5 pour la détection de vulnérabilités, mais affiche des performances nettement inférieures lorsqu’on lui demande de les exploiter.

Anthropic indique aussi qu’Opus 5 s’est amélioré dans la génération de sorties visuelles et l’analyse de contenus visuels, notamment les graphiques et les diagrammes.

Anthropic affirme qu’Opus 5 peut créer ses propres outils

Anthropic décrit Opus 5 comme nettement meilleur pour examiner son propre travail et l’améliorer par itération. Ce type d’autocorrection devient un axe important pour les laboratoires d’IA qui développent des agents autonomes, où la capacité à détecter et corriger les erreurs sans intervention humaine détermine si un modèle peut gérer des tâches complexes et ouvertes.

Dans une tâche Frontier-Bench, Opus 5 a reçu un dessin d’une pièce mécanique et devait créer un modèle 3D dans FreeCAD. Le modèle n’avait volontairement pas de moyen direct de visualiser le dessin.

Selon Anthropic, Opus 5 a écrit son propre pipeline de vision par ordinateur pour extraire la géométrie à partir de pixels bruts, puis a reconstruit la pièce mécanique complète. L’entreprise affirme qu’aucun autre modèle n’a résolu la tâche après cinq tentatives.

Opus 5 a également travaillé sur un bug réel dans un gestionnaire de paquets open source populaire. Anthropic indique que le modèle a identifié la cause racine et corrigé un cas limite que le correctif de la communauté avait manqué. Un modèle concurrent n’a corrigé que le symptôme de surface avant de marquer le bug comme résolu.

Anthropic affirme aussi qu’un ingénieur d’une société de trading a utilisé Opus 5 pour créer un flux de données de marché pour une nouvelle plateforme d’échange en une seule session. Les modèles précédents n’étaient pas capables d’accomplir la tâche, même avec des plans détaillés.

Les filtres cyber se déclenchent moins souvent que sur Fable 5

Anthropic indique que le dispositif de sécurité d’Opus 5 autorise la recherche de vulnérabilités dans le code source tout en bloquant l’analyse de vulnérabilités basée sur des binaires, les tests d’intrusion et la génération d’exploits. Ses classificateurs cyber se déclenchent environ 85% moins souvent que ceux utilisés avec Fable 5. Les interventions fréquentes de Fable 5 avaient suscité de vives critiques de la part de développeurs qui signalaient des interruptions de flux de travail lors de tâches légitimes de codage et de recherche en sécurité.

Les requêtes bloquées dans Claude.ai, Claude Code et Claude Cowork basculent par défaut vers Opus 4.8, la même approche qu’Anthropic utilisait avec Fable 5.

Anthropic présente Opus 5 comme le modèle généralement disponible le plus performant pour la recherche scientifique. L’entreprise affirme qu’il améliore Opus 4.8 dans toutes les évaluations en sciences de la vie, avec des gains notables en chimie organique et dans les tâches liées aux protéines. En chimie organique, Opus 5 progresse de 10.2 points de pourcentage sur la dérivation de structures moléculaires à partir de données de spectroscopie. Dans les tâches liées aux protéines, il progresse de 7.7 points de pourcentage.

Anthropic lance également deux fonctionnalités bêta aux côtés d’Opus 5. Mid-Conversation Tool Changes sur la Claude Platform permet aux développeurs de modifier les outils disponibles pendant une conversation sans invalider le cache de prompt. Automatic Fallbacks sur l’API achemine automatiquement les requêtes bloquées vers un autre modèle. Ces deux fonctionnalités reflètent les efforts d’Anthropic pour réduire les points de friction des développeurs liés à la continuité et à la fiabilité des flux de travail.