ActualitésMacroAnthropic lance Claude Opus 5 avec un contexte de 1M de tokens et des tarifs Opus inchangés

Anthropic lance Claude Opus 5 avec un contexte de 1M de tokens et des tarifs Opus inchangés

Auteur: MarkTechPost·

Points clés

  • Claude Opus 5 remplace Claude Opus 4.8 au même prix API de $5 par million de tokens en entrée et $25 par million de tokens en sortie.
  • Les développeurs devront peut-être mettre à jour leurs applications, car le raisonnement est activé par défaut et max_tokens couvre désormais à la fois les tokens de raisonnement et le texte de sortie.
  • Opus 5 a obtenu de meilleurs résultats qu’Opus 4.8 sur plusieurs benchmarks de codage et d’agents, notamment FrontierBench, OSWorld 2.0 et Zapier AutomationBench.
  • Anthropic indique qu’Opus 5 dispose de cybercapacités améliorées, tout en restant soumis aux mêmes protections ASL-3 qu’Opus 4.8.
  • Les taux de réussite des attaques par injection de prompts ont diminué par rapport à Opus 4.8 dans les tests Gray Swan et les environnements de navigateur Claude Cowork.
Anthropic lance Claude Opus 5 avec un contexte de 1M de tokens et des tarifs Opus inchangés

Anthropic a publié Claude Opus 5 aujourd’hui, remplaçant Claude Opus 4.8 comme modèle phare de sa gamme Opus. Les tarifs restent inchangés à $5 par million de tokens en entrée et $25 par million de tokens en sortie, ce qui maintient le nouveau modèle phare au même prix API que celui qu’il remplace.

Anthropic décrit Opus 5 comme approchant l’intelligence de Claude Fable 5 pour la moitié du prix. Le modèle est désormais l’option par défaut sur Claude Max et le modèle le plus puissant disponible sur Claude Pro.

Changements au niveau de l’API

Anthropic a introduit plusieurs changements au niveau de l’API avec Opus 5, que les développeurs devront peut-être prendre en compte avant d’évaluer les résultats de benchmarks ou de migrer des applications existantes vers le nouveau modèle.

Premièrement, le raisonnement est activé par défaut. Avec Opus 4.8, les requêtes s’exécutaient sans raisonnement sauf si les développeurs définissaient thinking: {"type": "adaptive"}. Avec Opus 5, la même requête raisonne par défaut, tandis que le paramètre effort contrôle la profondeur. Comme max_tokens plafonne désormais à la fois les tokens de raisonnement et le texte de réponse, les limites de tokens existantes peuvent devoir être réexaminées.

Deuxièmement, Anthropic a introduit un changement non rétrocompatible. Les requêtes qui définissent thinking: {"type": "disabled"} avec effort réglé sur xhigh ou max renvoient désormais une erreur 400. La restriction est appliquée requête par requête. Les développeurs doivent soit plafonner l’effort à high, soit supprimer le champ thinking.

Troisièmement, Anthropic conseille aux développeurs de supprimer les prompts de vérification. Des instructions telles que « include a final verification step » peuvent désormais entraîner une sur-vérification, car le modèle vérifie déjà son propre travail. Le guide de prompting d’Anthropic pour Opus 5 couvre les schémas d’ajustement correspondants.

L’identifiant du modèle est claude-opus-5. Sa fenêtre de contexte est de 1M de tokens, à la fois par défaut et au maximum, sans variante plus petite. La sortie maximale est de 128k tokens sur l’API Messages synchrone. L’API Message Batches prend en charge jusqu’à 300k tokens de sortie avec l’en-tête bêta output-300k-2026-03-24. La longueur minimale d’un prompt pouvant être mis en cache est passée de 1,024 à 512 tokens.

Résultats des benchmarks de codage et d’agents

Sur FrontierBench v0.1, successeur de Terminal-Bench 2.1 comprenant 74 tâches, Opus 5 a obtenu 43.3% au niveau d’effort maximal. Opus 4.8 a obtenu 18.7%, tandis que Fable 5 a atteint 33.7% et GPT-5.6 Sol 37.5%. Au niveau d’effort xhigh, Opus 5 a enregistré son meilleur résultat, avec une récompense moyenne de 44.4%.

Un point notable de cette exécution concerne les refus liés à la sécurité. Les classificateurs de sécurité d’Opus 5 ont signalé et refusé 5% des appels API sur 4% des essais. Les classificateurs de Fable 5 ont signalé 42% des appels sur 26% des essais.

Opus 5 a obtenu 96.0% sur SWE-bench Verified et 79.2% sur SWE-bench Pro. Fable 5 est resté légèrement devant sur SWE-bench Pro avec 80.0%. Sur SWE-bench Multimodal, Opus 5 est passé de 38.4% à 59.4%.

Les gains les plus marqués apparaissent dans les évaluations agentiques, où les modèles doivent opérer dans des environnements logiciels plutôt que répondre à un seul prompt statique. Opus 5 a atteint 70.57% sur OSWorld 2.0, contre 55.7% pour Opus 4.8. Sur Zapier AutomationBench, il a obtenu 26.0%, contre 17.0% pour Opus 4.8 et 17.4% pour Fable 5. À effort moyen, Opus 5 obtient encore 24% à $0.89 par tâche.

Sur Artificial Analysis GDPval-AA v2, Opus 5 a pris les deux premières places du classement avec des scores ELO de 1861 et 1827. La configuration xhigh a surpassé tous les autres modèles tout en utilisant 25% de tokens de sortie en moins que max.

Résultats de raisonnement et ARC-AGI-3

Anthropic a soumis Opus 5 aux six problèmes de l’IMO 2026 sans outils ni orchestration agentique. Un panel de juges composé de trois modèles a évalué les 24 solutions générées comme correctes. Des experts humains ont séparément noté une solution prédéfinie par problème à 7/7. Le score final de 42/42 correspond à un niveau médaille d’or et dépasse le seuil de 29/42.

L’ARC Prize Foundation a rapporté un score vérifié de 30.16% pour Opus 5 sur ARC-AGI-3 à effort élevé. C’est environ quatre fois le meilleur score de classement précédemment publié. GPT-5.6 Sol a atteint 7.78%, et Opus 4.8 1.52%. Les résultats d’Opus 5 à effort maximal n’étaient pas disponibles au moment du lancement.

Sur Humanity’s Last Exam, Opus 5 a obtenu 56.3% sans outils et 64.7% avec outils.

Utilisation d’outils dans les tâches multimodales

Les résultats multimodaux d’Anthropic indiquent que l’utilisation agentique d’outils permet de faire évoluer le calcul au moment du test de manière plus rentable que le raisonnement adaptatif seul.

Sur Chartography, Opus 5 a obtenu 29.6% sans outils et 83.0% avec un conteneur et un outil de recadrage d’image. Sur BenchCAD Vision2Code, l’IoU voxel est passée de 0.366 à 0.821. Avec des outils, Opus 5 dépasse largement Claude Mythos 5, qui a obtenu 0.678 sur la même mesure.

Cybercapacités et garde-fous

Anthropic a indiqué ne pas avoir entraîné Opus 5 sur des tâches de cybersécurité. Les cybercapacités du modèle ont néanmoins progressé en tant que sous-produit d’améliorations plus générales.

Sur ExploitBench, Opus 5 a capturé 10.14 indicateurs moyens de capacité dans le bras AutoNudge et a produit 99 exploits complets d’exécution arbitraire de code. Mythos 5 en a produit 132. Sur OSS-Fuzz, Opus 5 a obtenu un score non nul sur 79.4% des cibles, tandis que Mythos 5 a atteint environ 80%. Toutefois, Opus 5 a mené à bien 4 exploits complets, contre 13 pour Mythos 5.

Cet écart a orienté la conception des garde-fous d’Anthropic. Opus 5 est presque aussi performant que Mythos 5 pour trouver des vulnérabilités, mais nettement moins performant pour les exploiter. En conséquence, Anthropic a débloqué la recherche de vulnérabilités dans le code source. L’analyse fondée sur des binaires, les tests d’intrusion et la génération d’exploits restent bloqués. Anthropic s’attend à ce que les classificateurs interviennent environ 85% moins souvent que sur Fable 5. Les défenseurs peuvent postuler au Cyber Verification Program.

UK AISI a testé des checkpoints précoces sur trois environnements cyber avec 100M de tokens par tentative. Opus 5 a résolu « The Last Ones » de bout en bout dans 8 tentatives sur 10. Il n’a pas résolu l’environnement plus difficile « Doing Life », mais a atteint l’étape 22 sur 23, plus loin que tout autre modèle testé.

Dans le cadre de la Responsible Scaling Policy d’Anthropic, l’entreprise considère qu’Opus 5 possède des capacités CB-1 mais pas des capacités CB-2. Anthropic applique les mêmes protections ASL-3 que pour Opus 4.8. Le seuil de R&D en IA n’a pas été franchi.

Résultats en injection de prompts

Sur le benchmark d’injection indirecte de prompts Gray Swan, le taux de réussite des attaquants en 15 tentatives est passé de 5.5% sur Opus 4.8 à 2.0% sur Opus 5. Mythos 5 s’établit à 2.6%, tandis que GPT-5.6 Sol est à 20.0%.

Dans des environnements de navigateur exécutés via Claude Cowork, le taux de réussite des attaques a diminué de 31.5% sur Opus 4.8 à 3.70% sur Opus 5. Ce résultat a été mesuré sans aucun garde-fou appliqué. Avec le mode automatique activé, le taux de réussite des attaques a atteint 0% sur l’ensemble des 129 environnements.

Les sources citées dans le rapport original incluent le billet de lancement d’Anthropic, la Claude Opus 5 System Card, Nouveautés de Claude Opus 5, TechCrunch, et l’analyse indépendante de CodeRabbit.