ActualitésMacroClaude Sonnet 5.5 décroche la troisième place du classement Agent Arena d'Arena

Claude Sonnet 5.5 décroche la troisième place du classement Agent Arena d'Arena

Auteur: CryptoBriefing·

Points clés

  • •Claude Sonnet 5.5 est entré à la troisième place d'Agent Arena d'Arena.ai avec un score net d'amélioration de 12,52 %, derrière deux autres modèles d'Anthropic : Claude Fable 5.1 (Max) à 14,31 % et Claude Opus 5.5 (High) à 13,82 %.
  • •Le modèle a dépassé de justesse GPT-6 Astra (Max) d'OpenAI, quatrième à 12,27 %, mais l'écart de 0,25 point est inférieur à la marge d'erreur de Sonnet 5.5 de plus ou moins 3,09 % ; le classement pourrait donc évoluer.
  • •Sur Terminal-Bench 4.0, Sonnet 5.5 a obtenu 70,6 %, une forte hausse par rapport aux environ 10-14 % de son prédécesseur Sonnet 5, et il a également surpassé les 66,4 % d'Opus 5.5.
  • •Sonnet 5.5 fonctionne plus de 30 % plus vite que Sonnet 5 tout en conservant les mêmes prix de 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie, avec une fenêtre de contexte d'un million de tokens.
  • •Arena évalue le coût de Sonnet 5.5 à 2,74 $ par tâche, et sa consommation de tokens plus élevée que celle de la plupart de ses concurrents peut déterminer sa dépense réelle par tâche pour les déploiements en production.
Claude Sonnet 5.5 décroche la troisième place du classement Agent Arena d'Arena

Le dernier modèle de milieu de gamme d'Anthropic s'est emparé de la troisième place du classement Agent Arena d'Arena.ai. Claude Sonnet 5.5, lancé le 28 septembre 2026, a affiché un score net d'amélioration de 12,5 % — de quoi dépasser la meilleure entrée d'OpenAI. Seuls deux modèles le devancent, et les deux sont également conçus par Anthropic.

Le classement en détail

Quelques jours à peine après sa sortie, Sonnet 5.5 a grimpé à la troisième place d'Agent Arena. Son score net d'amélioration précis est de 12,52 %, avec une marge d'erreur de plus ou moins 3,09 %.

Les deux modèles qui le précèdent sont Claude Fable 5.1 (Max) à 14,31 % et Claude Opus 5.5 (High) à 13,82 %. Juste en dessous se trouve GPT-6 Astra (Max) d'OpenAI à 12,27 %. Avec ces résultats, Anthropic occupe trois des quatre premières places du classement.

Agent Arena évalue les modèles sur des millions de tâches agentiques réelles, où une IA doit utiliser des outils, mener à bien des travaux en plusieurs étapes et satisfaire de vrais utilisateurs. La notation prend en compte la fiabilité des outils, l'accomplissement des tâches et les retours des utilisateurs. Cet accent reflète une évolution plus large du secteur : à mesure que les déploiements s'appuient sur les modèles pour appeler des outils et exécuter des travaux en plusieurs étapes, le classement des modèles se joue de plus en plus sur l'exécution de bout en bout des tâches plutôt que sur la simple réponse à des questions statiques.

Le coût est l'autre chiffre phare. Arena liste Sonnet 5.5 à 2,74 $ par tâche, tandis que les instantanés du début octobre situent son coût médian à environ 2,78 $ par tâche. Le modèle consomme également plus de tokens que la plupart de ses concurrents.

Les benchmarks au-delà d'Arena

La belle performance de Sonnet 5.5 s'étend également à d'autres benchmarks. Sur l'Artificial Analysis Intelligence Index, il a obtenu un score de 56, bon pour la deuxième place derrière Opus 5.5 (Max).

Sur Terminal-Bench 4.0, Sonnet 5.5 a obtenu 70,6 % — un bond considérable par rapport à son prédécesseur, Sonnet 5, qui avait atteint environ 10 à 14 % sur le même test. Le nouveau modèle a également devancé Opus 5.5, qui a obtenu 66,4 % sur Terminal-Bench 4.0.

La vitesse s'est elle aussi améliorée : Sonnet 5.5 fonctionne plus de 30 % plus vite que Sonnet 5. Les tarifs, en revanche, n'ont pas bougé. Le modèle coûte toujours 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie, comme auparavant. Sonnet 5.5 offre une fenêtre de contexte d'un million de tokens et une sortie maximale de 128 000 tokens. Avec des prix par token maintenus tandis que la vitesse mesurée les scores augmentaient, cette mise à niveau modifie l'équation capacités-par-dollar — même si l'appétit plus prononcé du modèle en tokens, visible dans ses chiffres Arena, reste la variable qui détermine le coût réel par tâche.

Ce que cela signifie pour la course aux modèles d'IA

Le premier élément à surveiller est la marge d'erreur. Le score de Sonnet 5.5 comporte une marge de plus ou moins 3,09 %, et l'écart global séparant les quatre premiers modèles est inférieur à cela. GPT-6 Astra (Max) ne compte que 0,25 point de pourcentage de retard sur Sonnet 5.5. Avec des écarts aussi étroits, l'ordre peut changer à mesure qu'Arena agrège davantage de résultats de tâches ; le classement est donc à lire comme un instantané actuel plutôt que comme une hiérarchie définitive.

La consommation de tokens compte ici aussi. Une utilisation plus élevée de tokens peut entamer un avantage de coût selon la charge de travail — un modèle bon marché par token mais verbeux n'est pas toujours bon marché par tâche. Pour les équipes qui font tourner des agents en production, ces deux colonnes — score et coût par tâche — finissent sur la même feuille de calcul, c'est pourquoi toute version qui remanie le haut de classements comme Agent Arena est pesée sur ces deux dimensions.