Claude Opus 5 在多項基準測試居前,成本低於 Fable 5
重點速覽
- •Claude Opus 5 在 Artificial Analysis Intelligence Index 上取得 61 分,略高於 Claude Fable 5、GPT-5.6 Sol、Kimi K3 與 Claude Opus 4.8。
- •在程式設計測試中,Opus 5 並列 Artificial Analysis Coding Index 第一名,並在 Terminal-Bench v2.1 的 max 層級以 89 percent 成績追平 GPT-5.6 Sol。
- •事實準確性仍是較弱領域;Opus 5 在 AA-Omniscience 上落後於 Fable 5,且其幻覺率上升 14 點至 50 percent。
- •Epoch AI 將 Opus 5 的整體評分略低於 Fable 5,而 GPT-5.6 Sol 在整體 Epoch Capability Index 與軟體工程類別中均居於領先。
- •Vals.ai 發現,Opus 5 的 high 推理層級在 Vibe Code Bench 上表現最佳,優於成本更高的 xhigh 與 max 層級。

根據多項基準測試結果,Anthropic 的 Claude Opus 5 是目前可用的最強 AI 模型,在分析品質、程式設計與知識工作任務方面表現尤其突出。該模型在許多測試中追平或超越 Claude Fable 5,且整體成本通常較低;不過,評估也顯示,當模型在不確定時仍作答,其幻覺率較高。
在 Artificial Analysis Intelligence Index 上,Claude Opus 5 得分為 61。該指數結合了九項測試,涵蓋知識工作、程式設計、科學推理與事實準確性。這項結果使 Opus 5 略高於 Claude Fable 5 的 60 分、GPT-5.6 Sol 的 59 分、Kimi K3 的 57 分,以及 Claude Opus 4.8 的 56 分。Artificial Analysis 在模型公開發布前與 Anthropic 合作進行測試。
在程式設計基準測試中,Claude Opus 5 在與 Claude Code 搭配使用、推理層級為「xhigh」時,並列 Artificial Analysis Coding Index 第一名。該指數衡量 AI 模型獨立完成程式設計任務的能力,包括找出並修正錯誤。在 Terminal-Bench v2.1 上,該測試評估代理在真實終端環境中作為自主工程師執行任務的能力,Opus 5 在「max」層級取得 89 percent,追平先前領先者 GPT-5.6 Sol。
在科學推理方面,Opus 5 在 Humanity's Last Exam 上取得 53 percent。這是一項困難的多領域學術知識測試,Opus 5 與 Claude Fable 5 並列。在由 Argonne National Laboratory 與 UIUC 研究人員開發的物理基準測試 CritPt 上,Opus 5 再度追平 Fable 5,但仍落後於 GPT-5.6 Sol、GPT-5.5 Pro 與 GPT-5.6 Terra。
事實準確性仍是較弱的領域。在 AA-Omniscience 上,該測試檢驗模型知識主張的準確性,Opus 5 較 Opus 4.8 提升 7 分,但仍落後於 Fable 5。該模型也更常在不確定時作答,使其幻覺率上升 14 點至 50 percent。對於希望模型完成長篇複雜任務,但仍需要在答案缺乏支持時可靠拒答或處理不確定性的部署情境而言,這項取捨相當重要。
Epoch AI 結果顯示前沿模型競爭接近
Epoch AI 也評估了 Claude Opus 5。該研究機構給予此模型整體 Epoch Capability Index 159 分,略低於 Fable 5 的 161 分。不過,在稱為 SWE-ECI 的軟體工程子集中,Opus 5 以 161 分追平 Fable 5,並優於 GPT-5.6 Terra 與 Claude Opus 4.8。GPT-5.6 Sol 在整體指數與軟體工程類別中均居於領先。
這些結果顯示,前沿模型之間的效能差距很小。沒有單一模型在所有類別中呈現明確領先。這項發現與 AI 模型可能日益商品化的論點一致;該觀點也曾在 Microsoft 執行長 Satya Nadella 的相關評論中被討論。這也說明,買方與開發者為何愈來愈常依據工作負載、延遲、可靠性與成本來比較模型,而不是只看單一醒目分數。
較低推理層級在程式設計中可能提供更高價值
使用 Opus 5 執行一項 Intelligence Index 任務的平均成本為 $2.03。這低於含 fallback 的 Claude Fable 5 的 $2.75,但高於 Opus 4.8 的 $1.80 與 Sonnet 5 的 $1.53。不過,在「high」與「xhigh」推理層級,Opus 5 的表現優於 Opus 4.8 與 Sonnet 5,且成本更低。
Vals.ai 使用程式設計任務基準 Vibe Code Bench,測試了 Claude Opus 5 的全部五個推理層級。分數從「low」的 76.7 percent 上升至「medium」的 82 percent,再到「high」的 89.8 percent。之後在兩個最高層級表現下滑:「xhigh」得分 88.3 percent,「max」得分 88.4 percent,儘管成本大幅提高。
Vals.ai 發現,最高層級往往會產生更複雜的解法,而這些解法更常包含錯誤。「high」層級產生的解法較簡單,也更可靠地符合需求。
Terminal-Bench 2.1 顯示了類似模式。「high」層級優於「max」,原因是模型在最高層級每次嘗試花費更多時間,導致在基準測試時間限制內可進行的嘗試次數較少。這與 Anthropic 的指引一致;Anthropic 在 API 與 Claude Code 中均將「high」設定為預設層級。
Token 定價維持在每百萬輸入 token $5,以及每百萬輸出 token $25。快取寫入成本為每百萬 token $6.25,有效期五分鐘;快取命中成本則為每百萬 token $0.50。這些價格使輸出長度、重試行為與提示快取,成為代理式程式設計與文件密集型工作流程實際成本的重要因素。
Opus 5 在知識工作評估中領先
Opus 5 在 AA-Briefcase 基準測試中的表現尤其強勁。該測試衡量 AI 模型處理常見辦公任務的能力,例如根據數千個輸入檔案撰寫研究報告、製作簡報與分析試算表。該基準會依正確性、分析品質與呈現品質評分,並將結果轉換為類似西洋棋排名的 Elo 評分。
在 max 推理層級下,Opus 5 達到 1720 的 Elo 分數,比 Claude Fable 5 的 1574 高出 146 分。其三個最高層級 — max、xhigh 與 high — 包辦前三名。連同 Fable 5、Sonnet 5 與 Opus 4.8,Anthropic 模型目前占據前 10 名中的絕大多數位置。
每項任務成本下降 20 percent 至 $17.79,相較之下 Fable 5 為 $22.30。「xhigh」版本每項任務成本為 $14.26,而「high」成本為 $10.41,低於 Fable 5 的一半。這兩個層級在 Elo 排名上仍領先 Fable 5。在 medium 表現層級,Opus 5 的 Elo 分數為 1470,僅落後於 max 層級 GPT-5.6 Sol 的 1505。在 low 表現層級,Opus 5 得分為 1223 Elo,略低於 max 層級 GLM-5.2 的 1254。
Opus 5 最大的進步出現在分析品質。在「max」層級,該模型的 Analytical Quality Elo 達到 2016,幾乎比 Fable 5 高出 300 分。其 Rubric Pass Rate 用於衡量模型滿足預先定義品質標準的頻率,在「max」為 58 percent、「xhigh」為 57.2 percent、「high」為 56 percent。
呈現品質則沒有同樣占優。Opus 5 的 Presentation Elo 為 1628,比「max」層級的 GPT-5.6 Sol 約低 40 分,後者得分為 1666。
更高效能也需要更多時間。在「max」層級,Opus 5 每項任務需要超過 36 分鐘,平均 103 次 pass;相較之下,Opus 4.8 需要 24 分鐘、平均 55 次 pass,Opus 5 約多出 50 percent。對正在評估該模型的團隊而言,基準測試結果顯示,最佳層級可能取決於任務更重視最大分析能力、更快周轉,還是較低的單項任務成本。