ニュースマクロClaude Sonnet 5.5がArenaのAgent Arenaリーダーボードで3位にランクイン

Claude Sonnet 5.5がArenaのAgent Arenaリーダーボードで3位にランクイン

著者: CryptoBriefing·

重要ポイント

  • •Claude Sonnet 5.5はArena.aiのAgent Arenaに3位で登場し、正味改善スコアは12.52%。上位は14.31%のClaude Fable 5.1(Max)と13.82%のClaude Opus 5.5(High)という、いずれもAnthropicの2モデルが占めた。
  • •同モデルは4位(12.27%)のOpenAI製GPT-6 Astra(Max)を僅差で上回ったが、0.25ポイントの差はSonnet 5.5の誤差±3.09%より小さく、順位は変動する可能性がある。
  • •Terminal-Bench 4.0でSonnet 5.5は70.6%を記録。前モデルSonnet 5の約10〜14%から大幅に上昇し、Opus 5.5の66.4%も上回った。
  • •Sonnet 5.5はSonnet 5より30%以上高速に動作しながら、100万入力トークンあたり2ドル、100万出力トークンあたり10ドルという価格を維持し、100万トークンのコンテキストウィンドウを備える。
  • •Arena掲載のSonnet 5.5ストは1タスクあたり2.74ドル。同級の大半より重いトークン消費が、本番環境での実際のジョブあたり費用を左右する可能性がある。
Claude Sonnet 5.5がArenaのAgent Arenaリーダーボードで3位にランクイン

Anthropicの最新ミドルティアモデルが、Arena.aiのAgent Arenaリーダーボードで3位にランクインした。2026年9月28日にリリースされたClaude Sonnet 5.5は、正味改善スコア12.5%を記録し、OpenAIの最上位エントリーを上回った。上位にランクインしているのはわずか2モデルで、その両方もAnthropic製だ。

リーダーボードの順位状況

リリースから数日のうちに、Sonnet 5.5はAgent Arenaで3位に浮上した。正味改善スコアの正確な数値は12.52%、誤差は±3.09%である。

上位の2モデルは、14.31%のClaude Fable 5.1(Max)と13.82%のClaude Opus 5.5(High)。直下には12.27%のOpenAI製GPT-6 Astra(Max)が位置する。この結果により、Anthropicは上位4枠のうち3枠を占めている。

Agent Arenaは、AIがツールを使用し、複数ステップのタスクを完了し、実際のユーザーを満足させなければならない、数百万件の現実世界のエージェントタスクに基づいてモデルを評価する。スコアリングには、ツールの信頼性、タスク完了率、ユーザーフィードバックが組み込まれている。この重点は、より広範な業界の変化とも軌を一にする。デプロイがモデルによるツール呼び出しや複数ステップ作業への依存を深めるにつれ、モデルの順位は静的な質問応答だけでなく、エンドツーエンドのタスク実行力で争われるようになりつつある。

コストはもう一つの注目数値だ。ArenaはSonnet 5.5を1タスクあたり2.74ドルと掲載しており、10月初旬のスナップショットでは中央値コストを約2.78ドルとしている。また、このモデルは同級の大半よりも多くのトークンを消費する。

Arena以外のベンチマーク

Sonnet 5.の好成績は他のベンチマークにも及んでいる。Artificial Analysis Intelligence Indexでは56点を獲得し、Opus 5.5(Max)に次ぐ2位となった。

Terminal-Bench 4.0では、Sonnet 5.5は70.6%を記録。前モデルのSonnet 5が同一テストで約10〜14%にとどまっていたことを考えると大幅な跳躍だ。さらに、66.4%を記録したOpus 5.5も上回った。

速度も向上した。Sonnet 5.5はSonnet 5より30%以上高速に動作する。しかし価格は据え置きで、100万入力トークンあたり2ドル、100万出力トークンあたり10ドルと、以前と変わらない。Sonnet 5.5は100万トークンのコンテキストウィンドウと、最大128,000トークンの出力を提供する。トークン単価を据え置いたまま実測の速度とスコアが上昇したことで、このアップグレードはコストあたりの性能の方程式を塗り替えた。ただし、Arenaの数値にも見られる重いトークン消費は、1ジョブあたりの実際のコストを左右する変数であり続ける。

AIモデル競争への意味

最初に注目すべきは誤差幅だ。Sonnet 5.5のスコアは±3.09%の誤差を含んでおり、上位4モデルを分ける差はそれよりも小さい。GPT-6 Astra(Max)はSonnet 5.5にわずか0.25ポイント差で続く。これほど僅差であれば、Arenaがより多くのタスク結果を集計するにつれて順位は変わりうるため、現時点の順位は確立された序列というより、現在のスナップショットとして読むのが妥当だ。

トークン消費もここで重要になる。トークン使用量の増加は、ワークロードによってコスト優位性を蝕む可能性がある。トークン単価は安くても冗長なモデルは、必ずしも1ジョブあたりの費用が安いとは限らない。本番環境でエージェントを稼働させるチームにとっては、スコアと1タスクあたりのコストという2つの指標は結局同じ表に並ぶことになり、だからこそAgent Arenaのようなリーダーボードの上位を入れ替えるリリースは、両方の軸で評価されるのだ。