ニュース株式AnthropicがClaude Opus 5を発表:企業・コーディング業務向けに半分のコストで準フロンティア級の知能を提供

AnthropicがClaude Opus 5を発表:企業・コーディング業務向けに半分のコストで準フロンティア級の知能を提供

著者: VentureBeat AI·

重要ポイント

  • Opus 5の価格はOpus 4.8と同じだが、AnthropicはFable 5の知能のほぼすべてを半分のコストで提供するとしている。
  • Anthropicによれば、Opus 5はFrontier-Bench v0.1で43.3%を記録し、Opus 4.8の18.7%、Fable 5の33.7%を上回った。
  • 同社は、Fable 5は最も長い自律プロジェクトにより適しており、Opus 5は特定の成果を持つ範囲の定まったタスクで最も強いとしている。
  • 初期顧客は、法律、金融、自動化、コーディングのワークフローで、トークン使用量の削減、ツール呼び出しの減少、完了時間の短縮、性能向上を挙げている。
  • Opus 5には安全性分類器、一部製品でのOpus 4.8へのフォールバックルーティング、Fastモード、API提供、一般アクセスでのデータ保持要件なしといった機能が含まれる。
AnthropicがClaude Opus 5を発表:企業・コーディング業務向けに半分のコストで準フロンティア級の知能を提供

Anthropicは金曜日、Claude Opus 5を発表した。同社によれば、このモデルは旗艦モデルClaude Fable 5の知能のほぼすべてを半分のコストで提供する。今回の発表は、AIの競争環境が純粋な能力から日常利用の経済性へと移りつつあることを示している。

このモデルは、Anthropicのすべてのプラットフォームで即時利用できる。価格は入力100万トークンあたり$5、出力100万トークンあたり$25で、前モデルのOpus 4.8から据え置かれている。Opus 5は、Anthropicのプレミアム消費者向けプランであるClaude Maxの新しいデフォルトモデルとなり、Claude Proで利用できる最も強力なモデルにもなる。

この位置づけは意図的なものだ。AnthropicはOpus 5が同社で最も賢いモデルだとは主張していない。その位置づけはなおFable 5にあり、競合システムも一部領域では優位性を保っている。代わりに同社は、企業顧客に真正面から向けた、より繊細な主張を打ち出している。経済的に最も重要なAI業務は難易度の中間帯にあり、効率的かつ手頃な価格で提供される準フロンティア級の知能が、高コストで提供されるフロンティア級の知能を上回る、というものだ。

「Opus 5は日常的に使う主力モデルであり、複雑な作業を任せ、完了後に確認するモデルです」とAnthropicの広報担当者はVentureBeatの取材で述べ、同社のモデル群がどのように階層化されているかを説明した。「Fable 5は最も野心的な作業、これまで引き受けられるものがなかった数日がかりの自律プロジェクト向けです。Sonnet 5は、スピードと1回の呼び出しあたりのコストが出荷可否を決める、大規模に実行する作業向けです。Haiku 4.5はサブエージェントと即時回答向けです。」

ベンチマーク性能:Opus 5とFable 5、競合モデルの比較

書面上のベンチマーク結果は目を引く。Anthropicによれば、Opus 5はFrontier-BenchやGDPval-AAを含むコーディングおよびナレッジワーク評価で、新たな最先端の水準を記録した。

エージェント型ターミナルコーディングのベンチマークであるFrontier-Bench v0.1では、Opus 5は43.3 percentを記録した。これはOpus 4.8の18.7 percentの2倍超で、Fable 5の33.7 percentを大きく上回り、同社によればタスクあたりのコストも低い。新規問題解決を評価するARC-AGI 3では、AnthropicはOpus 5が次点モデルの3倍のスコアを記録したとしている。コンピューター利用ベンチマークのOSWorld 2.0では、同社によればOpus 5はFable 5の最高結果を上回り、コストはその3分の1強にとどまった。

ただし、これらの数字には留意点もある。最上級表現に傾きがちな業界において、その留意点自体が注目に値する。Anthropicは、Opus 5がサイバーセキュリティ業務と生物学研究では競合モデルのMythos 5にまだ及ばないことを認めている。また、あるエージェント型コーディングベンチマークでは、OpenAI系のモデルが依然として首位に立っている。

より示唆的な留意点は、Opus 5がFable 5にまだ及ばない点を問われた際、Anthropic自身から示された。広報担当者の回答は、ベンチマークが捉えられるものと捉えられないものに関する率直な認識だった。

「Opus 5が勝っている評価は、特定の結果を持つ範囲の定まったタスクであり、そこが最も強い領域です。そうした評価が測っていないのは継続時間です」と広報担当者はVentureBeatに語った。「言い換えれば、Opus 5はベンチマークが見える仕事に最適なツールであり、Fable 5は仕事がベンチマークの枠を超えたときに選ぶものです。」

一方でFable 5は、「最も長く、最も自律的な仕事、つまり大量のソース素材を扱いながら、何時間または何日にもわたって多くのつながったステップの中で一貫性を保つ必要がある仕事向けです」と同広報担当者は述べ、顧客には「代表的なワークロードで両方を試すこと、すなわち範囲の定まったタスクと長期視点の仕事を1つずつ実行すること」を勧めた。この「範囲の定まったタスク」と「長期的な自律性」という枠組みは、ベンチマークが飽和し、残る最難関の問題が個別のパズルではなく、数日にわたって継続するエージェント型作業になる中で、2026年のモデル差別化を定義する軸になる可能性がある。

企業向けAIの本当の競争領域となるトークン効率

今回の発表全体を通じて、Anthropicが購入者に明確に伝えたいテーマがある。Opus 5は単に高いスコアを出すだけでなく、1ドルあたりでも高いスコアを出すという点だ。このモデルには調整可能な「effort」設定が搭載されており、顧客は知能とスピード、トークン節約のバランスを取ることができる。Anthropicの図表も、ピーク性能だけではなく、一定コストにおける性能を強調している。

初期顧客も、この点を unusually具体的に強調した。法律AI企業のHarveyは、応用研究責任者のNiko Grupenによれば、Opus 5がOpus 4.8の最大推論モードと同等の性能を達成しながら、「平均で26%少ないトークンを生成した」と述べた。Fundamental Research LabのRichard Phamは、難易度の高い財務モデリングタスクにおいて、同モデルは平均で9 percentage points高い精度を示し、「ターン数とツール呼び出しをおよそ3分の1減らし、時間を60%短縮した」と述べた。

Zapierの最高経営責任者Wade Fosterは、Opus 5が同社のAutomationBenchリーダーボードで「従来のClaudeモデルより多くのトークンを使うことなく」首位に立ち、解約防止ワークフロー全体を最初から最後まで実行したと述べた。「以前のモデルは合格しませんでしたが、Opus 5は100%を達成しました」と同氏は述べた。

Devinコーディングエージェントを手がけるCognitionの最高経営責任者Scott Wuは、FrontierCode 1.1において「Claude Opus 5は半分のコストでFable水準の性能に近づいている」と述べ、特にデバッグと根本原因分析に強みがあるとした。

効率性への重点は商業上の現実を反映している。企業のAI支出はもはや実験段階ではなく、推論コスト、すなわちモデルを実際に大規模運用するためのコストは、取締役会レベルの懸念事項になっている。Anthropicの事業はAPIおよび企業利用に大きく偏っている。2026年2月のContrary Researchによる分析によれば、Claudeは2025年後半時点で、利用量ベースの企業向け大規模言語モデル市場の約40 percentを占め、Claude Codeだけで年換算売上が約$1 billionに達していた。顧客がトークン単位で支払う企業にとって、より少ないトークンでより多くをこなすモデルは、あれば望ましい機能ではない。それこそが製品そのものだ。

自己検証するエージェントと自動化の隠れたコスト

数字の先に、Anthropicは行動面の物語も打ち出している。Opus 5は自らの作業を検証し、成功するまで反復するというものだ。同社はテストでの複数の例を示しており、それらは機械の粘り強さを示す小さなたとえ話のようにも読める。

あるFrontier-Benchタスクでは、モデルは機械部品を図面から3D CADモデルとして再構築するよう求められたが、その図面は意図的に閲覧できない形で与えられていた。失敗するのではなく、Anthropicによれば、Opus 5は生ピクセルから形状を抽出するための独自のコンピュータービジョン・パイプラインを書き、それを繰り返し実行した。一方、競合モデルはいずれも5回の試行でこのタスクを解決できなかった。別の事例では、人気のあるオープンソースのパッケージマネージャーに実在するバグを与えられた際、同モデルは根本原因を突き止め、コミュニティ自身のパッチが見逃していたエッジケースを修正した。競合モデルは症状だけを修正し、勝利を宣言したという。さらに同社によれば、あるトレーディング企業のエンジニアは、新しい取引所向けの市場データフィードをOpus 5に1回のセッションで構築させた。検証用のライブフィードがないと分かると、同モデルはパースコードを確認するために独自のテストハーネスを構築した。

顧客も、本番環境で似た挙動を報告している。StripeのスタッフソフトウェアエンジニアであるCristian Riveraは、週末の間、このモデルに「私の開発環境に対するchief-of-staffの役割」を与えたと述べた。「それは独自のモニターを構築し、各ボックスを操作し、判断が必要な場面でだけ私を呼び込みました。」

これは企業が最も重視する能力だ。もっともらしい出力を生成するモデルと、その出力を検証するモデルの差は、デモと導入可能なシステムの差である。今日の企業AIにおける隠れたコストの大半は人間によるレビュー、すなわちエンジニアが機械の作業を確認することにある。自らの作業を確実に確認できるモデルはそのコストを圧縮する。顧客がより高い生のスコアではなく、ターン数の少なさ、通過回数の少なさ、時間の短縮を繰り返し挙げているのは、まさにそのためだ。

Anthropicの安全性戦略:能力ギャップ、分類器、モデルフォールバック

今回の発表は、Anthropicの安全性に対するアプローチがますます複雑になっていることも示している。その中には、特定のスキルを意図的にモデルに訓練しないという方針も含まれる。同社によれば、自動化された行動監査の結果、Opus 5はこれまでで最もアラインメントが取れたモデルであり、全体的な不整合行動のスコアは2.3で、Opus 4.8、Sonnet 5、Fable 5を下回った。また、欺瞞的行動の発生率が最も低く、悪用へ誘導されることへの耐性も最も高かったという。

能力面では、AnthropicはOpus 4.8と同様に、Opus 5をサイバー関連タスクで意図的に訓練しなかったとしている。それでもモデルは、一般能力の向上の副作用としてその領域でも改善し、ソフトウェア脆弱性の発見ではMythos 5にほぼ並ぶ水準に達した。しかし、脆弱性の悪用では大きく後れを取っている。AnthropicのOSS-Fuzz評価では、Opus 5は79.4 percentの割合で脆弱性を特定し、Mythos 5の80 percentに近かったが、エクスプロイトの開発に成功したのは4課題にとどまり、Mythos 5は13課題だった。この非対称性、すなわち防御に関連する発見には強いが、攻撃に関連する悪用には弱いという特性は意図的なものとみられ、保護策も同じ論理に従っている。Anthropicは、Opus 5のサイバー分類器が介入する頻度はFable 5のものより約85 percent少ないと見込んでいる。

分類器が作動した場合、Claude.ai、Claude Code、Claude CoworkでのリクエストはデフォルトでOpus 4.8にフォールバックする。これは明白な疑問を提起する。あるモデルにとってリスクが高すぎるリクエストが、なぜ別のモデルでは許容されるのか、という点だ。

「フォールバック先のモデルは能力レベルが低いため、有害利用のリスクも低くなります」と広報担当者は述べ、さらに「この処理が発生したことをユーザーに知らせるメッセージがあり、チャット上で確認できます」と付け加えた。この論理は擁護可能だが、2026年におけるAI安全性の実態を明らかにしている。リスクは質問そのものだけの性質ではなく、その質問に回答するシステムの能力を掛け合わせたものなのだ。

生物学では、計算は逆方向に働く。Opus 5は現在、Anthropicが一般提供しているモデルの中で科学研究に最も高い能力を持つモデルであり、同社の内部化学ベンチマークではOpus 4.8を10.2 percentage points上回った。ただし広報担当者は、「自律的な創薬キャンペーンのような長期的で自由度の高い作業では、Mythos 5が引き続きより強力なモデルです」と認めている。

事業上の賭け:$380 billionの評価額と大規模な計算資源コミットメント

今回の発表は、Anthropicにとって並外れた商業的勢いと、並外れた義務が重なる時期に行われた。Reutersは2月に報じたところによれば、同社は直近の資金調達ラウンドで約$380 billionと評価された。Contrary Researchの分析によると、年換算売上は2024年末の約$1 billionから、2025年末には予測で$9 billionへ増加し、2026年の社内目標は$20 billionから$26 billionに達すると報じられている。

こうした目標は、報道されている$30 billion規模のAzure計算資源契約や、Google CloudおよびNvidiaとの取り決めを含む巨額のインフラ投資に支えられている。こうした支出は、企業が利用を拡大し続けて初めて採算が合う。

この文脈では、Opus 5の価格戦略は明確な意味を持つ。価格をOpus 4.8と同水準に据え置きながら、主要なエージェント型ベンチマークで性能をおおむね倍増させることは、能力1単位あたりの大幅な値下げに等しい。これは、自動化の採算が合うワークロードの範囲を広げるためのものだ。Opus 4.8の成功あたりコストでは採算ぎりぎりだったすべてのタスクが、Opus 5では実行可能になる。そして実行可能な各タスクは、継続的なトークン収益を意味する。

規制面の背景もより複雑になっている。米国の判事は今週、最終承認を与えた。Reutersによれば、これは書籍著者との$1.5 billion規模の著作権和解であり、同社の初期学習データをめぐる訴訟の一章を閉じるものだ。6月には、ReutersがAxiosを引用して報じたところによれば、米国政府はAnthropicの最先端モデルへの外国からのアクセスを阻止する方向で動いた。これは、フロンティアAIが、どの顧客が何を購入できるかを左右する輸出政策と今や結びついていることを改めて示している。

追加機能と提供開始

金曜日には他にも複数の機能が提供される。デフォルト速度のおよそ2.5倍で動作し、基本価格の2倍となるFastモード、API上の自動フォールバックルーティング、そして会話途中でツールを変更してもプロンプトキャッシュが無効化されなくなる機能だ。最後の機能は小規模ながら、エージェント開発者にとってはどのベンチマークよりもありがたいものかもしれない。

従来のOpusモデルと同様、Opus 5は一般アクセスにおいてデータ保持要件を課さない。広報担当者は、これは「厳格なゼロデータ保持要件」を持つ顧客に向けて、求められる前に強調した点だ。開発者は本日から、Claude API上でclaude-opus-5としてこのモデルにアクセスできる。

この賭けが成功するかどうかは、2つの問いにかかっている。Opus 5の効率性に関する主張が、大規模な本番ワークロードに接しても維持されるか。そして企業が、ユーザーではなく安全性分類器がどのモデルが回答するかを時に決定する世界を受け入れるかだ。

金曜日の発表が示すより深いメッセージは、AI業界の重心が移ったということだ。この3年間、研究所各社は最良のモデルが最高の日に何を達成できるかで競ってきた。Opus 5によってAnthropicが競っているのは、それほど華やかではないが、はるかに収益性の高い領域である。非常に優れたモデルが、毎日、半分の価格で何をできるかという点だ。フロンティアが前進し続ける市場で、Anthropicは本当の富がそのすぐ後ろにあると賭けている。