AnthropicがClaude Sonnet 5.5を発表、Opus 5.5を上回るコーディング性能を半額で提供
重要ポイント
- •Claude Sonnet 5.5は、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルという据え置き価格で登場し、Opus 5.5の半額となる。
- •新モデルはTerminal-Bench 4.0のコーディングテストでOpus 5.5を上回り、Anthropicの結果では70.6%対66.4%、Artificial Analysisの独立実施では63.6%対59.6%だった。
- •最大エフォートでは、Sonnet 5.5はタスクあたり約193,000トークンを生成し、Artificial Analysisの測定史上最多で、コストは1タスク7.60ドル——Sonnet 5より約50%高かった。
- •Anthropicによると、同モデルはSonnet 5より30%以上高速で、タスクあたりのトークン消費量は約3分の1少なく、同一の表示価格でありながら運用コストは安くなる。
- •大量処理かつコスト重視の用途向けに設計されたClaude Haiku 5.5は、数週間以内に登場し、Anthropicの5.5世代ラインナップを完成させる見込みだ。

Anthropicは月曜日、中位AIモデルの最新版であり、6月に登場したSonnet 5の後継となるClaude Sonnet 5.5をリリースした。価格は変更なしで、入力100万トークンあたり2ドル、出力100万トークンあたり10ドル——Opus 5.5の半額だ。
低価格にもかかわらず、このモデルはコーディングですでに上位モデルを上回るスコアを出している。Anthropicによると、Terminal-Bench 4.0でSonnet 5.5は70.6%を記録し、Opus 5.5の66.4%を上回った。独立系テスト機関Artificial Analysisも独自にベンチマークを実施し、63.6%対59.6%でSonnet 5.5が優位とした。ただし同社のリーダーボードでは総合的にOpus 5.5が2位という順位はつけておらず(訳注:Sonnet 5.5は2位)、テストしたどのモデルよりもタスクあたりのトークン消費量が多かったと指摘している。
Anthropicは、新モデルが前世代より30%以上高速に動作するとしている。「Sonnet 5.5は、明確に範囲が定まった日常的なタスク、バグ修正、洗練されたドキュメント、スライド、スプレッドシートの作成に最も強く、デザインにも優れた眼を持っています」と同社は述べた。
トークンとはAIモデルが読み書きするテキストの断片(単語よりやや短い)で、AI企業は100万単位で課金する。表示価格はSonnet 5と同じだが、新モデルはタスクあたりのトークン消費量が約3分の1少なく、同一料金でありながら前世代より安く運用できる。
このモデルが真に輝くのはコーディングだ。Terminal-Bench 4.0は、AIエージェントが自らコマンドを入力して複雑な専門タスクを完遂できるかを測定するもので、完了したタスクの割合で採点される。Sonnet 5.5は70.6%を記録。Opus 5.5は66.4%、Sonnet 5はわずか10.3%にとどまった。平たく言えば、安いモデルのほうが多くの仕事を完了した。
Artificialの独立実施結果もこれを裏付けている:Sonnet 5.5が63.6%、Opus 5.5が59.6%、OpenAIのGPT-6 Astraが59.1%。同社はXへの投稿でこのモデルの躍進を強調した:
Claude Sonnet 5.5 (max) makes large strides on Terminal-Bench, sitting among the top models for both Terminal-Bench 4.0 and Terminal-Bench-Science. In Terminal-Bench 4.0 it scores 64%, a 50 point increase over Claude Sonnet 5 (max), and slightly above 60% for Opus 5.5 and GPT-6… pic.twitter.com/7CPrhgmfxe
— Artificial Analysis (@ArtificialAnlys) September 28, 2026
スコアはエフォート設定にも左右される。これはモデルにより長く考えさせてより良い回答を引き出すと同時に、請求額も増やすダイヤルだ。Anthropicは、HighエフォートのSonnet 5.5がFrontierCodeにおいてGPT6 Solと同等の成績を、タスクあたり約5分の1のコストで達成するとしている。
実世界の専門業務を44の職種にわたって評価するGDPval-AAでは、Elo(相対的な技能を順位付けるチェス式レーティングシステム)を用いて、Sonnet 5.5は1844を記録し、Opus 5.5の1846と事実上の引き分けだった。GPT-6 Solは1487だった。
競合も価格で対抗する。OpenAIは先週、GPT-6 Solを2ドルと10ドルに値下げし、中位モデルのGPT-5.6 Terraは2ドルと12ドルで提示されている。Sonnet 5.5とGPT-6 Solは現在、同一の表示価格を持つ——ただし、上述のエフォート設定が示すように、表示価格の一致がタスクあたりコストの一致を保証するわけではない。AnthropicはTerraのベンチマーク数値を公表していない。
落とし穴
トレードオフは冗長さだ。Sonnet 5.5は非常に多くの出力を行う:最大エフォートでは、テストタスクあたり約193,000トークンを生成した。これはArtificial Analysisが測定した中で最多で、Opus 5.5より約60%多い。コストは1タスクあたり7.60ドルとなり、Sonnet 5より約50%高い——この結果は、最大30%の節約というAnthropicの主張に反するものだ。
Anthropicの節約効果の主張は、より低い設定に基づいている。同社アプリのデフォルトであるMediumエフォートでは、Sonnet 5.5がSonnet 5の最高コーディングスコアを10分の1未満のコストで上回るとしている。Artificial Analysisは、Highエフォートが最もコストパフォーマンスに優れるとしている。日常的なユーザーにとっては、ダイヤルを低く保つ限り、わずかな価格でフラッグシップ並みのコーディング性能が得られることを意味する。
留意点も残る。Anthropicのベンチマーク表は自己申告であり、Artificial Analysisはリリース前のビルドをテストした。Anthropicはそのビルドにあったバグがスコアにほとんど影響しないか、わずかにスコア低く見積もったと見ている。これは、出荷版ビルドでの独立系結果が注目に値する理由の一つだ。同社はまた、持続的な判断を要する複雑な業務においては、Opus 5.5が依然として明確に優れているとしている。
大量処理かつコスト重視の用途向けに設計されたClaude Haiku 5.5は数週間以内に登場する予定で、Opus 5.5およびSonnet 5.5とともにAnthropicの5.5世代ラインナップを完成させる。