新聞宏觀經濟Anthropic 稱新版 Claude Opus 5 以一半 Token 價格達到接近 Fable 5 的效能

Anthropic 稱新版 Claude Opus 5 以一半 Token 價格達到接近 Fable 5 的效能

作者: The Decoder·

重點速覽

  • Claude Opus 5 維持與前代相同的 Token 定價,每百萬輸入 Token 5 美元、每百萬輸出 Token 25 美元,同時成為 Claude Max 的預設模型和 Claude Pro 上最強大的選項。
  • Opus 5 在多項基準測試中領先,包括 Frontier-Bench v0.1 智能體終端編碼(43.3%)和 ARC-AGI-3(30.2%),但在 DeepSWE 上落後 GPT-5.6 Sol,在網路安全任務上落後 Mythos 5。
  • 該模型能透過反覆迭代步驟進行自我修正並編寫程式碼建構自己的工具,例如它獨立建立了一條電腦視覺管線,從圖紙重建 3D 機械零件。
  • Opus 5 的網路安全分類器觸發頻率比 Fable 5 使用的大約低 85%,以回應開發者對 Fable 5 頻繁干預干擾合法編碼和安全研究的批評。
  • max 運算強度設定在兩項基準測試中產生的結果略遜於第二高的設定,儘管成本更高,這表明更高的運算強度並不保證改善模型輸出。
Anthropic 稱新版 Claude Opus 5 以一半 Token 價格達到接近 Fable 5 的效能

Anthropic 將其全新旗艦模型 Claude Opus 5 定位為 Claude Fable 5 的低成本替代方案,表示該模型效能接近 Fable 5,同時在多項基準測試中超越它。此發布正值各 AI 實驗室在效能與成本上激烈競爭之際,企業客戶在選擇生產工作負載模型時,越來越注重價格與效能的取捨。

該公司表示,Opus 5 在智能體編碼和知識工作測試中領先——這兩個領域正是企業部署 AI 最密集的方向。在 ARC-AGI-3(一項衡量新穎問題解決能力的基準測試)中,Opus 5 達到 30.2%,幾乎是 GPT-5.6 Sol 所得結果的四倍。

Anthropic 還表示,Opus 5 能夠透過反覆迭代步驟檢查和改善自身工作,並能在需要時編寫程式碼來建構工具——這些能力對自主智能體工作流程至關重要,因為在這類流程中,模型必須在最少人工介入的情況下完成多步驟任務。

Opus 5 維持與 Opus 4.8 相同的定價

Anthropic 推出 Opus 5 之際,來自 GPT-5.6 Sol 和中國競爭對手的價格壓力日益增加。新模型旨在縮小與價格更高的 Fable 5 之間的價格效能差距。Opus 5 成為 Claude Max 的預設模型,也是 Claude Pro 上提供的最強大模型。

該模型保留了 100 萬 Token 的上下文視窗,以及與前代 Opus 4.8 相同的 Token 費率。Anthropic 對 Opus 5 每百萬輸入 Token 收費 5 美元,每百萬輸出 Token 收費 25 美元。新的快速模式將速度提升 2.5 倍,但價格加倍。

基本 Token 費率並不能完全反映實際任務成本,因為不同模型之間的 Token 效率可能有所差異。儘管 Opus 4.7 和 Opus 4.6 使用相同的基本費率,但 Opus 4.7 每項任務的成本比 Opus 4.6 高出 30% 至 40%。最近 Claude Sonnet 5 也出現了類似的模式。這一差異對於運行大規模部署的組織至關重要,因為每項任務的成本差異會在數百萬次 API 呼叫中累積放大。

更高的運算強度設定可能花費更多卻無法改善結果

使用者可透過五個運算強度設定來平衡效能和 Token 用量:low、medium、high、xhigh 和 max。Anthropic 表示,Opus 5 在每個強度級別都比前代提供更好的性價比。

在其提示指南中,Anthropic 建議廣泛使用「low」和「medium」設定。該公司表示,這些設定僅需消耗少量 Token 和延遲即可提供良好的結果,同時超越了早期 Opus 模型在相同設定下的表現。對於編碼和智能體任務,Anthropic 仍建議從「xhigh」開始。

Opus 5 在兩項基準測試中,max 強度設定的表現略遜於第二高的設定,儘管 max 的成本更高。效能下滑出現在 Frontier-Bench v0.1 和 Artificial Analysis Coding Agent Index 上。這項發現凸顯了更高的運算強度並不保證更好的輸出,這是團隊在最佳化成本與品質時需要考量的因素。

Anthropic 基準測試顯示 Opus 5 在智能體編碼中領先

根據 Anthropic 自身的基準測試結果,Opus 5 在多項評估中創下紀錄。在 Frontier-Bench v0.1 上,它在智能體終端編碼方面達到 43.3%,領先 Fable 5 的 33.7%、GPT-5.6 Sol 的 34.4% 和 Opus 4.8 的 21.1%。

在 GDPval-AA v2 知識工作基準測試中,Opus 5 以 1,861 的 Elo 分數領先。Fable 5 得分 1,747,GPT-5.6 Sol 得分 1,736。

Opus 5 並非在所有測試中都領先。在衡量智能體編碼的 DeepSWE v1.1 上,GPT-5.6 Sol 以 72.7% 排名第一,其次是 Fable 5 的 69.7% 和 Opus 5 的 68.8%。在健康任務和法律基準測試中,Fable 5 和 Mythos 5 分別優於 Opus 5。這些好壞參半的結果凸顯了模型領先地位因領域而異,使企業買家在選擇模型時需依任務而定。

ARC-AGI-3 的結果是 Anthropic 基準測試集中最大的異常值之一。ARC-AGI-3 評估的是不依賴記憶模式的新穎問題解決能力。Opus 5 達到 30.2%,相比之下 Opus 4.8 僅為 1.5%,GPT-5.6 Sol 為 7.8%。這使得 Opus 5 在所引用的結果中領先次佳模型近四倍。Anthropic 未列出 Fable 5 在此基準測試上的結果,目前尚不清楚如此大的基準測試領先優勢是否會轉化為實際應用中的優勢。

Opus 5 在網路安全任務上落後於 Mythos 5。Anthropic 表示,與前代一樣,該公司刻意未在網路安全任務上訓練 Opus 5。該模型在尋找漏洞方面接近 Mythos 5 的水準,但在被要求利用漏洞時表現明顯較差。

Anthropic 還表示,Opus 5 在生成視覺輸出和分析圖表及圖形等視覺內容方面有所改善。

Anthropic 表示 Opus 5 能自行建構工具

Anthropic 將 Opus 5 描述為在審查自身工作和透過反覆迭代改善方面有顯著提升。這種自我修正能力正成為 AI 實驗室建構自主智能體時日益關注的重點,因為在沒有人類指導下偵測和修正錯誤的能力,決定了模型能否處理複雜且開放性的任務。

在一項 Frontier-Bench 任務中,Opus 5 收到一張機械零件的圖紙,被要求在 FreeCAD 中建立 3D 模型。該模型被刻意未提供直接查看圖紙的方式。

根據 Anthropic 的說法,Opus 5 自行編寫了電腦視覺管線,從原始像素中提取幾何資訊,然後重建了完整的機械零件。該公司表示,經過五次嘗試後,沒有其他模型能解決此任務。

Opus 5 還處理了一個熱門開源套件管理器中的真實錯誤。Anthropic 表示,該模型找到了根本原因,並修復了社群修補程式遺漏的邊緣案例。一個競爭模型僅修復了表面症狀,就將該錯誤標記為已解決。

Anthropic 還表示,一家交易公司的工程師在一次工作階段中使用了 Opus 5 來為新的交易所建構市場資料饋送。先前的模型即使獲得了詳細計畫也無法完成該任務。

網路安全過濾器觸發頻率低於 Fable 5

Anthropic 表示,Opus 5 的安全設定允許原始碼漏洞研究,但會封鎖基於二進位的漏洞掃描、滲透測試和漏洞利用生成。其網路安全分類器觸發頻率比 Fable 5 使用的大約低 85%。Fable 5 頻繁的干預曾招致開發者的強烈批評,他們反映在合法的編碼和安全研究任務中遭遇工作流程中斷。

Claude.ai、Claude Code 和 Claude Cowork 中被封鎖的請求預設回退至 Opus 4.8,這與 Anthropic 對 Fable 5 使用的做法相同。

Anthropic 稱 Opus 5 為科學研究領域最強大的通用模型。該公司表示,它在所有生命科學評估中都優於 Opus 4.8,在有機化學和蛋白質相關任務方面有顯著提升。在有機化學方面,Opus 5 在從光譜資料推導分子結構方面提升了 10.2 個百分點。在蛋白質相關任務方面,提升了 7.7 個百分點。

Anthropic 還在 Opus 5 之外發布了兩項測試版功能。Claude Platform 上的 Mid-Conversation Tool Changes 讓開發者可以在對話過程中切換可用工具,而不會使提示快取失效。API 上的 Automatic Fallbacks 會自動將被封鎖的請求路由到不同的模型。這兩項功能都反映了 Anthropic 解決開發者在工作流程連續性和可靠性方面痛點的努力。