ニュース株式Anthropicの新モデルClaude Opus 5.5、フラッグシップFable 5.1に匹敵する性能を60%の価格で実現

Anthropicの新モデルClaude Opus 5.5、フラッグシップFable 5.1に匹敵する性能を60%の価格で実現

著者: Decrypt·

重要ポイント

  • •Opus 5.5のトークン価格は入力4ドル、出力20ドルで、前世代より20%、フラッグシップFable 5.1より60%安く、キャッシュ読み取りコストは60%下がり100万トークンあたり0.20ドルとなった。
  • •Anthropicのベンチマークでは、Opus 5.5はコーディングおよびナレッジワークのテストでFable 5.1とOpus 5の双方を上回り、Terminal-Bench 4.0で66.4%の完了率、GDPval-AA v2.1でEloスコア1846を記録した。
  • •GPT-6 Aは依然としてAutomationBenchで41.4%対40.0%、Terminal-Bench-Science 0.1で64.6%対58.7%とOpus 5.5を上回っている。
  • •同モデルはFable 5.1と同じサイバーセキュリティおよびバイオロジー安全対策を備えて出荷され、ほとんどのサイバーセキュリティタスクは引き続き自動的に旧世代のOpus 4.8へリルートされる。
  • •Opus 5.5は夏以降Anthropicが出荷した3つ目のフラッグシップクラスのモデルであり、CEOのDario AmodeiがAI能力向上のペースを落とすよう業界に促すエッセイを発表した後に登場した。
Anthropicの新モデルClaude Opus 5.5、フラッグシップFable 5.1に匹敵する性能を60%の価格で実現

Anthropicは火曜日、Claude Opus 5.5を公開した。同社が「Claude 5.5ファミリー」と呼ぶシリーズの最初のモデルである。価格は入力トークン100万あたり4ドル、出力トークン100万あたり20ドルで、デフォルト設定のOpus 5より40%安く、Anthropicによれば最高価格のフラッグシップであるClaude Fable 5.1にほとんどのタスクで匹敵するという。

Anthropic自身の数値によると、Opus 5.5はコーディングおよびナレッジワークのテストでFable 5.1と前世代のOpus 5の双方を上回るが、AutomationBenchとTerminal-Bench-Science 0.1ではGPT-6 Astraが依然として優位を保っている。新モデルはFable 5.1と同一のサイバーセキュリティおよびバイオロジー安全対策を備えて登場した。

今回のリリースは、置き換えるモデルと追い上げるフラッグシップの双方の価格を下回った。Opus 5.5の运行コストはOpus 5より20%低く、同社の最先端モデルであるFable 5.1より60%安い。

このモデルは、バージョン(5.5対Fableの5.1)とファミリー階層の両面でAnthropicの最も高度なモデルである。ファミリーでは、Opusが公開されている最大ので、次いでSonnet、最小がHaikuとなる。Anthropicは、FableとOpusの実際の差がベンチマークスコアが示すほど大きくないことを認めているが、Opusが有料プランで一般利用可能であり、トークンあたりのコストが低いことから、ほとんどのClaudeユーザーにとって明確な選択肢となるとしている。

両製品ラインは今年、首位を入れ替わってきた。Opus 5は7月に登場し、多くのベンチマークでFable 5を価格とスコアの両面で上回った。9月初旬に登場したFable 5.1はこれを覆し、Anthropicが公表したすべてのベンチマークでOpus 5を凌駕した。Opus 5.5が再び差を埋めた。今回はスコアではなく価格での逆転である。

7月に自社のコーディングテストでOpus 5を検証した開発者プラットフォームLovableは、Anthropicが共有した声明の中で、従来モデルはそれ以前のモデルより「安定しており、実行ごとのばらつきがはるかに少なかった」と述べており、これはAnthropicが現在改めて打ち出している効率性の訴求と同じものである。

Opus 5.5はまた、CEOのDario Amodeiがエッセイを発表し、AIの能力向上が安全検証の範囲を超えて進んでいると主張して業界に減速を呼びかけて以降、Anthropicが初めてリリースするモデルでもある。「我々はAIモデルの能力を向上させるペースを遅らせなければならない」とAmodeiは今月初めに記していた。Anthropicは夏以降、7月のOpus 5、9月初旬のFable 5.1、そして火曜日のOpus 5.5と、フラッグシップクラスのモデルを3つリリースしており、まさにエッセイが減速を求めたペースである。

Anthropicはこうした進歩の多くを、エージェンティックコーディング(AIエージェントが単一のプロンプトに答えるだけでなく、複数ステップの行動を自律的に実行する作業)によって測定している。

コマンドラインインターフェース内でエージェントが複雑な業務タスクを完了できるかを検証し、完了率で採点するTerminal-Bench 4.0では、Opus 5.5は66.4%を記録し、Fable 5.1の55.8%とGPT-6 Astraの57.9%上回った。同じ合格率方式で、エージェントのコード変更が実際のエンジニアリングパイプラインでマージされるかを検証するFrontierCodeでは、Opus 5.5が54.4%に対しFable 5.1は50.3%だった。

44の職種にわたる実際の業務を、相対的な能力を測るチェスタイルのランキング制度であるElo(単純なパーセンテージではなく)で評価するGDPval-AA v2.1では、Opus 5.5は1846を記録し、Fable 5.1の1735とOpus 5の1708を上回った。

ただし、Opus 5.5がすべてで首位というわけではない。エージェントが人間の支援なしに業務ワークフロー全体を最初から最後まで遂行できるかを評価する、Zapier製のベンチマークAutomationBenchでは、GPT-6 Astraの41.4%がOpus 5.5の40.0%をわずかに上回った。同じ合格率方式でコマンドライン環境内でのエージェンティックな科学研究を検証するTerminal-Bench-Science 0.1では、Astraの64.6%がOpus 5.5の58.7%をさらに大きな差で上回った。

より大きなセールスポイントはコストである。モデルが読み書きするテキストの単位であり100万トークン単位で価格設定される入力トークンは、Opus 5.5では4ドル(Opus 5は5ドル)となり、出力トークンは25ドルから20ドルに下がった。キャッシュ読み取りは、モデルがすでに処理したコンテキストを再処理ではなく再利用することを意味し、長時間のエージェンティックコーディングセッションのコストの大半を占めるが、60%安の100万トークンあたり0.20ドルとなった。この構造により、割引は最も効果のある場所で複利のように効く。長時間のエージェンティックコーディングセッションは主にキャッシュ読み取りで課金されるため、最大のコスト項目に最も大きな値下げが及ぶ。

Opus 5.5は、これら2つの能力においてAnthropicのMythosクラスモデル(審査を経たサイバーセキュリティおよびバイオロジー研究者向けの同社で最も制限の厳しい階層)に匹敵するため、Fable 5.1と同じ安全対策を備えて登場した。ほとんどのサイバーセキュリティタスクは自動的に旧世代のOpus 4.8へリルートされており、多くの開発者やユーザーが以前からこの挙動に不満を述べてきた。Opus 5.5の登場がこのリルート挙動を変えるかどうかは今後の成り行き次第である。

Opus 5.5は、Amazon Web Services、Google Cloud、Microsoft Azureを含むAnthropicのプラットフォーム全体現在利用可能である。Anthropicによると、Sonnet 5.5とHaiku 5.5は今後数週間以内に、同じ価格改定とともにラインナップの残りとして追随する予定だ。