Anthropic 的 Claude Opus 5 在多數基準測試中以半價超越 Fable 5
重點速覽
- •Claude Opus 5 於 7 月 24 日推出,定價為每百萬輸入 token 5 美元,恰好是 Fable 5 的一半價格,同時在幾乎所有主要基準測試中超越它。
- •Opus 5 現為 Claude Max 的預設模型,也是 Claude Pro 上最強的選項,在 Fable 5 因出口管制問題和點數制限制後,實際上取代其成為 Anthropic 的訂閱旗艦。
- •在 Frontier-Bench v0.1 上,Opus 5 達到 43.3%,超越了 Fable 5 的 33.7% 和 OpenAI GPT-5.6 Sol 的 34.4%,涵蓋端到端軟體工程任務。
- •Lovable 報告在代理編碼任務上比 Opus 4.7 提升了 22%,而 Zapier 在完整的流失預防工作流程上為 Opus 5 記錄了 AutomationBench 滿分。
- •此次發布發生於北京 Moonshot AI 推出 Kimi K3 的一週後,Kimi K3 是一個 2.8 兆參數的開源權重模型,獨立基準測試將其總體排名第三,落後於 Fable 5 和 GPT-5.6 Sol。

Anthropic 於 7 月 24 日發布 Claude Opus 5,定價為每百萬輸入 token 5 美元——與其前身 Opus 4.8 相同,恰好是 Fable 5 的一半——同時在多數主要基準測試中超越 Fable 5。該新模型現已成為 Claude Max 的預設模型,也是 Claude Pro 上最強的選項,實際上取代了 Fable 5 作為多數訂閱者的首選。
Opus 5 的運行成本低於 Anthropic 的領先模型 Claude Fable 5,後者曾被公司定位為付費用戶的日常前沿產品。它還在多項重要基準測試中超越 Fable 5。對於在 AI API 上構建產品的公司而言,token 成本隨用戶量直接增長,一款以半價達到或超越前沿效能的模型能夠顯著改變單位經濟效益。
Anthropic 的模型分層結構
Anthropic 的產品線涵蓋四個層級。Haiku 快速且便宜。Sonnet 屬中階。Opus 是重型主力。在這之上則是 Mythos 級——這是 Anthropic 今年春天推出的層級——包括面向公眾的 Claude Fable 5,以及 Claude Mythos 5,後者是一個限制較少的版本,透過 Project Glasswing 提供給經審查的網路安全研究人員和關鍵基礎設施營運商使用。
Fable 5 作為訂閱旗艦的經歷可謂坎坷。它於 6 月 9 日推出,三天後因美國政府以越獄漏洞為由發布緊急出口管制令而在全球下架。它於 6 月 30 日回歸,但立即轉為點數制模式,不再包含在標準方案中。Opus 5 現在填補了 Fable 5 未能守住的位置。
Lovable 是一個擁有數百萬用戶的開發者平台,在其內部評估中運行了 Opus 5,並指出其提升不止於原始分數。「它不僅在我們最困難的代理編碼任務上表現更好,比 Opus 4.7 提升了 22%,而且更穩定,每次運行之間的變異性大幅降低,」Fabian Hedin 在 Anthropic 分享的一份聲明中表示。
基準測試結果
Opus 5 在幾乎所有與日常用戶相關的指標上都超越了 Fable 5,儘管它並未像 Fable 那樣被標記為 Mythos 級。
在 Frontier-Bench v0.1 上——這是一項測試 AI 編碼代理能否端到端完成真實軟體工程任務的基準測試,以通過任務的百分比計分——Opus 5 達到 43.3%。Fable 5 得分為 33.7%,而 Anthropic 的主要商業競爭對手 OpenAI 的 GPT-5.6 Sol 得分為 34.4%。
最大的差距出現在 ARC-AGI-3 上,這是一項真正的問題解決能力測試,圍繞模型無法從訓練資料中記憶的新穎謎題設計,以解開謎題的百分比計分。Opus 5 達到 30.2%;GPT-5.6 Sol 得分為 7.8%;Fable 5 則完全未被測試。
在 GDPval-AA v2 上——這是一項透過 Elo 評分來計分的知識工作基準測試,Elo 是類似西洋棋的排名系統,用於衡量在真實專業任務上的相對表現——Opus 5 達到 1,861 分,相比之下 Fable 5 為 1,747 分,GPT-5.6 Sol 為 1,736 分。
Zapier 在 AutomationBench 上測試了 Opus 5,這是一項評估模型能否在無人工干預的情況下從頭到尾完成完整業務工作流程的測試。他們的結論是:該模型「拿取了一份原始的帳戶健康狀況工作簿,並從頭到尾執行了完整的流失預防流程:標記有風險的帳戶、通知正確的負責人,並為留存營運團隊生成摘要。先前的模型未能通過;Opus 5 達到 100%。」
Anthropic 也將 Opus 5 定位為研究升級。DNA 測序公司 Ultima Genomics 表示,該模型「表現得比我們運行過的任何模型都更像一位嚴謹的科學家。它會選擇正確的統計檢定方法來排除混淆因素,透過獨立方法交叉驗證自身結果,並在冗長的多步驟分析中保持正軌。」
不過,法律和醫療是 Fable 5 僅有的兩個以微幅優勢領先的領域。
更廣泛的競爭格局
此次發布發生在北京新創公司 Moonshot AI(由阿里巴巴支持)推出 Kimi K3 的一週之後——Kimi K3 是一個 2.8 兆參數的開源權重模型,意味著任何人都可以下載底層程式碼獨立運行。Moonshot 將其描述為全球最大的開源 AI 系統。獨立基準測試一致將 Kimi K3 排名為總體第三,落後於 Fable 5 和 GPT-5.6 Sol,但在特定領域超越這兩者。這種開源權重方法與 Anthropic 和 OpenAI 使用的僅限 API 存取模式形成對比,讓組織能夠在自己的硬體上運行模型——不過一個 2.8 兆參數的系統需要大量運算資源才能運作。
定價與可用性
Opus 5 現已透過 API 提供,價格為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元。(Token 是 AI 模型在輸入和輸出中處理的基本資訊單位。)還提供一個以約 2.5 倍預設速度運行的快速模式,價格為基礎價格的兩倍——每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。
此次發布可能會緩解對 Fable 5 公眾可用性有限的持續擔憂。Opus 5 也透過訂閱向所有用戶開放。