Anthropic 推出 Claude Opus 5.5,以旗艦 Fable 5.1 六成價格達到同等水準
重點速覽
- •Opus 5.5 的每代幣定價——輸入 4 美元、輸出 20 美元——比前代便宜 20%,比旗艦 Fable 5.1 便宜 60%,快取讀取成本更下降 60% 至每百萬代幣 0.20 美元。
- •Anthropic 的基準測試顯示,Opus 5.5 在程式編寫與知識工作測試上領先 Fable 5.1 與 Opus 5,包括 Terminal-Bench 4.0 上 66.4% 的完成率,以及 GDPval-AA v2.1 上 1846 的 Elo 分數。
- •GPT-6 A 在 AutomationBench 上仍以 41.4% 對 40.0% 領先 Opus 5.5,在 Terminal-Bench-Science 0.1 上則以 64.6% 對 58.7% 勝出。
- •此模型搭載與 Fable 5.1 相同的網路安全與生物安全防護措施,且大多數網路安全任務仍自動轉送至較舊的 Opus 4.8。
- •Opus 5.5 是 Anthropic 自夏季以來出貨的第三款旗艦級模型,此前執行長 Dario Amodei 才發文呼籲業界放慢 AI 能力提升的腳步。

Anthropic 週二發布 Claude Opus 5.5,這是該公司所稱 Claude 5.5 系列的首款模型。此模型每百萬輸入與輸出代幣定價為 4 美元與 20 美元——在預設設定下比 Opus 5 便宜 40%——Anthropic 表示,其在大多數任務上可媲美該公司最昂貴的旗艦 Claude Fable 5.1。
根據 Anthropic 自己的數據,Opus 5.5 在程式編寫與知識工作測試上領先 Fable 5.1 與其前代模型 Opus 5,不過 GPT-6 Astra 在 AutomationBench 與 Terminal-Bench-Science 0.1 上仍然勝出。新模型搭載與 Fable 5.1 相同的網路安全與生物安全防護措施。
此次發布同時壓低了它所取代的模型與它所追趕的旗艦的價格:Opus 5.5 的運行成本比 Opus 5 低 20%,比該公司最先進的 Fable 5.1 便宜 60%。
無論以版本(5.5 對 Fable 的 5.1)還是系列層級來看,這款模型都是 Anthropic 最先進的——Opus 是公開可用的最大模型,其次為 Sonnet,最小的則是 Haiku。Anthropic 承認,Fable 與 Opus 之間的實際差距比基準測試分數所顯示的更小,但 Opus 可透過付費方案公開使用,且每代幣成本更低,這使它成為大多數 Claude 使用者的顯然選擇。
兩條產品線今年以來互有領先。Opus 5 於 7 月推出,價格低於 Fable 5,並在多數基準測試中勝出。Fable 5.1 於 9 月初問世扭轉局面,在 Anthropic 公布的每一項基準測試中都擊敗 Opus 5。Opus 5.5 再次縮小差距——這次是靠價格而非原始分數。
開發者平台 Lovable 曾於 7 月以自家程式測試評測 Opus 5,並在 Anthropic 分享的聲明中表示,該款先前的模型「更穩定,每次執行之間的變異遠小於更早的版本」——Anth 如今再次提出同樣的效率訴求。
Opus 5.5 也是執行長 Dario Amodei 發表一篇文章、呼籲業界放慢腳步以來,Anthropic 所出貨的首款模型。他在文中主張,AI 能力的提升速度已超越用以制衡的安全測試。「我們必須放慢提升 AI 模型能力的速度,」Amodei 本月稍早寫道。自夏季以來,Anthropic 已出貨三款旗艦級模型——7 月的 Opus 5、9 月初的 Fable 5.1,以及週二的 Opus 5.5——而這正是該文主張應放慢的步伐。
Anthropic 主要透過代理式程式編寫來衡量這些進展——即由 AI 代理執行的工作,這類模型會自主採取多步驟行動,而非僅回答單一提示。
在測試代理能否於命令列介面中完成複雜專業任務、並以任務完成百分比計分的 Terminal-Bench 4.0 上,Opus 5.5 達到 66.4%,領先 Fable 5.1 的 55.8% 與 GPT-6 Astra 的 57.9%。FrontierCode 以相同的通過率計分方式,檢驗代理的程式碼變更能否在真實工程流程中實際被合併,結果 Opus 5.5 為 54.4%,Fable 5.1 為 50.3%。
在以 Elo——一種如同西洋棋評級、衡量相對實力而非單純百分比的系統——對 44 種職業的現實專業工作進行評分的 GDPval-AA v2.1 上,Opus 5.5 得分 1846,高於 Fable 5.1 的 1735 與 Opus 5 的 1708。
不過 Opus 5.5 並非在所有項目都領先。在由 Zapier 打造、評估代理能否在無人協助下完成整個業務流程的 AutomationBench 上,GPT-6 Astra 以 41.4% 險勝 Opus 5.5 的 40.0%。在以相同通過率方式測試命令列環境中代理式科學研究的 Terminal-Bench-Science 0.1 上,Astra 的 64.6% 以更大差距勝過 Opus 5.5 的 58.7%。
更大的賣點是成本。輸入代幣——模型讀取與寫入的文字片段,以每百萬計價——如今 Opus 5.5 為 4 美元,Opus 5 為 5 美元;輸出代幣則從 25 美元降至 20 美元。快取讀取是指重複使用模型已處理過的上下文,而非從頭重新處理,也是長時間代理式程式編寫工作階段的主要成本來源,如今下降 60% 至每百萬代幣 0.20 美元。這種定價結構讓折扣在最關鍵之處發揮複利效果:長時間代理式程式編寫工作階段的計費以快取讀取為主,因此降幅最大的項目正是最大筆的成本。
由於 Opus 5.5 在這兩項能力上達到 Anthropic Mythos 級模型的水準——這是該公司限制最嚴格、僅供經審查的網路安全與生物學研究人員層級——它以與 Fable 5.1 相同的防護措施問世。大多數網路安全任務仍會自動轉送至較舊的 Opus 4.8,過去許多開發者與使用者都曾對此提出抱怨。Opus 5.5 的問世是否會改變這種轉送行為,仍有待觀察。
Opus 5.5 現已於 Anthropic 的各平台上线,包括 Amazon Web Services、Google Cloud 與 Microsoft Azure。Anthropic 表示,Sonnet 5.5 與 Haiku 5.5 將於未來數週跟進,並將同樣的降價帶至系列其餘產品。