新聞宏觀經濟Anthropic 發布 Claude Opus 5:具備 1M Token 上下文視窗且維持原有 Opus 定價

Anthropic 發布 Claude Opus 5:具備 1M Token 上下文視窗且維持原有 Opus 定價

作者: MarkTechPost·

重點速覽

  • Claude Opus 5 取代 Claude Opus 4.8,API 定價維持不變,每百萬輸入 token 5 美元、每百萬輸出 token 25 美元。
  • 開發者可能需要更新應用程式,因為思考模式現為預設開啟,且 max_tokens 同時涵蓋推理 token 和輸出文字。
  • Opus 5 在多項程式編寫與代理式基準測試中優於 Opus 4.8,包括 FrontierBench、OSWorld 2.0 和 Zapier AutomationBench。
  • Anthropic 表示 Opus 5 的網路安全能力有所提升,但仍維持與 Opus 4.8 相同的 ASL-3 防護措施。
  • 提示注入攻擊成功率相較 Opus 4.8 在 Gray Swan 和 Claude Cowork 瀏覽器環境測試中均有所下降。
Anthropic 發布 Claude Opus 5:具備 1M Token 上下文視窗且維持原有 Opus 定價

Anthropic 今日發布 Claude Opus 5,取代 Claude Opus 4.8 成為 Opus 等級的旗艦模型。定價維持不變,每百萬輸入 token 5 美元、每百萬輸出 token 25 美元,使新旗艦模型與其前身保持相同的 API 費率。

Anthropic 將 Opus 5 定位為接近 Claude Fable 5 的智慧水準,但價格僅為一半。該模型現為 Claude Max 的預設模型,也是 Claude Pro 上最強大的模型。

API 層面的變更

Anthropic 在 Opus 5 中引入了多項 API 層面的變更,開發者在評估基準測試結果或將現有應用程式遷移至新模型前,可能需要留意這些調整。

首先,思考模式預設為開啟。在 Opus 4.8 中,除非開發者設定 thinking: {"type": "adaptive"},否則請求不會啟用思考功能。而在 Opus 5 中,相同的請求會預設啟用思考,由 effort 參數控制深度。由於 max_tokens 現在同時涵蓋思考 token 和回應文字,現有的 token 上限可能需要重新檢視。

其次,Anthropic 引入了一項破壞性變更。設定 thinking: {"type": "disabled"}effort 設為 xhighmax 的請求,現在會回傳 400 錯誤。此限制以每次請求為單位強制執行。開發者必須將 effort 上限設為 high,或是移除 thinking 欄位。

第三,Anthropic 建議開發者移除驗證提示。如「加入最終驗證步驟」等指令現在可能導致過度驗證,因為模型已會自行驗證其工作成果。Anthropic 的 Opus 5 提示工程指南涵蓋了相關的調整模式。

模型 ID 為 claude-opus-5。其上下文視窗為 1M token,同時為預設值與最大值,沒有較小的變體。同步 Messages API 的最大輸出為 128k token。Message Batches API 在使用 output-300k-2026-03-24 beta 標頭時,支援最高 300k 輸出 token。最小可快取提示長度從 1,024 降至 512 token。

程式編寫與代理式基準測試結果

在 FrontierBench v0.1(Terminal-Bench 2.1 的 74 項任務後繼版本)上,Opus 5 在 max 強度下得分 43.3%。Opus 4.8 得分 18.7%,Fable 5 達到 33.7%,GPT-5.6 Sol 達到 37.5%。在 xhigh 強度下,Opus 5 締造了最佳成績,達到 44.4% 的平均獎勵。

該次測試中有一個值得注意的細節涉及安全拒絕。Opus 5 安全分類器標記並拒絕了 5% 的 API 呼叫,涵蓋 4% 的測試。Fable 5 分類器則標記了 42% 的呼叫,涵蓋 26% 的測試。

Opus 5 在 SWE-bench Verified 得分 96.0%,在 SWE-bench Pro 得分 79.2%。Fable 5 在 SWE-bench Pro 上仍略微領先,達 80.0%。在 SWE-bench Multimodal 上,Opus 5 從 38.4% 提升至 59.4%。

最顯著的提升出現在代理式評測中,此類評測要求模型在軟體環境中操作,而非回答單一靜態提示。Opus 5 在 OSWorld 2.0 達到 70.57%,而 Opus 4.8 為 55.7%。在 Zapier AutomationBench 上得分 26.0%,相比之下 Opus 4.8 為 17.0%,Fable 5 為 17.4%。在 medium 強度下,Opus 5 仍以每項任務 0.89 美元的成本得分 24%。

在 Artificial Analysis GDPval-AA v2 上,Opus 5 占據排行榜前兩名,ELO 分別為 1861 和 1827。xhigh 配置在使用的輸出 token 比 max 少 25% 的情況下,仍優於所有其他模型。

推理結果與 ARC-AGI-3

Anthropic 在不使用工具或代理框架的情況下,讓 Opus 5 處理所有六道 IMO 2026 題目。三位模型評審小組將所有 24 個生成的解答評為正確。人類專家另行對每題一個預先指定的解答評分為 7/7。最終 42/42 的成績達到金牌水準,高於 29/42 的門檻。

ARC Prize Foundation 報告 Opus 5 在 ARC-AGI 3 的 high 強度下,獲得驗證分數 30.16%。這大約是先前排行榜已報告最佳成績的四倍。GPT-5.6 Sol 達到 7.78%,Opus 4.8 達到 1.52%。Opus 5 在 max 強度下的結果於發布時尚未提供。

在 Humanity's Last Exam 上,Opus 5 不使用工具時得分 56.3%,使用工具時得分 64.7%。

多模態任務中的工具使用

Anthropic 的多模態結果顯示,代理式工具使用在擴展測試時運算方面,比單獨使用適應性思考更具成本效益。

在 Chartography 上,Opus 5 不使用工具時得分 29.6%,使用容器和影像裁剪工具時得分 83.0%。在 BenchCAD Vision2Code 上,voxel IoU 從 0.366 提升至 0.821。使用工具時,Opus 5 超越了 Claude Mythos 5,後者在同一指標上得分 0.678。

網路安全能力與防護措施

Anthropic 表示並未在網路安全任務上訓練 Opus 5。然而,模型的網路安全能力仍因整體能力提升的副作用而有所增強。

在 ExploitBench 上,Opus 5 在 AutoNudge 組別中捕獲了 10.14 個平均能力旗標,並產出 99 個完整的任意程式碼執行漏洞。Mythos 5 產出了 132 個。在 OSS-Fuzz 上,Opus 5 在 79.4% 的目標上得分非零,而 Mythos 5 約達到 80%。然而,Opus 5 完成了 4 個完整漏洞利用,相比之下 Mythos 5 為 13 個。

這一差距形塑了 Anthropic 的防護設計。Opus 5 在發現漏洞方面幾乎與 Mythos 5 一樣強,但在利用漏洞方面則明顯落後。因此,Anthropic 解除了原始碼中的漏洞發現限制。基於二進位的掃描、滲透測試和漏洞生成仍然維持封鎖。Anthropic 預期分類器的介入頻率將比 Fable 5 減少約 85%。防禦者可以申請加入 Cyber Verification Program。

UK AISI 以每次嘗試 100M token 的條件,在三個網路安全演習場中測試了早期檢查點。Opus 5 在 10 次嘗試中有 8 次端到端解決了「The Last Ones」。它未能解決更困難的「Doing Life」演習場,但達到了第 22 步(共 23 步),比任何已測試的模型都走得更遠。

根據 Anthropic 的負責任擴展政策(RSP),該公司將 Opus 5 視為具有 CB-1 能力但不具有 CB-2 能力。Anthropic 正採用與 Opus 4.8 相同的 ASL-3 防護措施。AI R&D 門檻尚未被跨越。

提示注入結果

在 Gray Swan 間接提示注入基準測試上,15 次嘗試內的攻擊者成功率從 Opus 4.8 的 5.5% 降至 Opus 5 的 2.0%。Mythos 5 為 2.6%,GPT-5.6 Sol 為 20.0%。

在透過 Claude Cowork 運行的瀏覽器環境中,攻擊成功率從 Opus 4.8 的 31.5% 降至 Opus 5 的 3.70%。該結果是在未啟用任何安全防護的情況下測得的。啟用 auto 模式後,所有 129 個環境中的攻擊成功率達到 0%。

原始報告中引用的來源包括 Anthropic 發布文章、Claude Opus 5 系統卡、Claude Opus 5 新功能介紹、TechCrunch,以及 CodeRabbit 獨立評測。