Claude Sonnet 5.5 榮登 Arena Agent Arena 排行榜第三名
重點速覽
- •Claude Sonnet 5.5 以 12.52% 的淨改善分數登上 Arena.ai 的 Agent Arena 第三名,落後另兩個 Anthropic 模型:得分 14.31% 的 Claude Fable 5.1(Max)與得分 13.82% 的 Claude Opus 5.5(High)。
- •該模型以微弱優勢擊敗排名第四(12.27%)的 OpenAI GPT-6 Astra(Max),但 0.25 分的差距小於 Sonnet 5.5 正負 3.09% 的誤差範圍,排名仍可能變動。
- •Sonnet 5.5 在 Terminal-Bench 4.0 上得分 70.6%,較前代 Sonnet 5 約 10% 至 14% 的成績大幅提升,也超越了 Opus 5.5 的 66.4%。
- •Sonnet 5.5 的速度比 Sonnet 5 快逾 30%,同時維持每百萬輸入 token 2 美元、每百萬輸出 token 10 美元的價格,並提供一百萬 token 的上下文視窗。
- •Arena 列出 Sonnet 5.5 每項任務成本為 2.74 美元,而其高於大多數同級模型的 token 消耗量,可能決定正式部署時每項任務的實際支出。

Anthropic 最新的中階模型已登上 Arena.ai 的 Agent Arena 排行榜第三名。Claude Sonnet 5.5 於 2026 年 9 月 28 日發布,淨改善分數為 12.5%,足以超越 OpenAI 的最佳成績。排名在其之上的僅有兩個模型,而這兩個模型同樣出自 Anthropic。
排行榜局勢解析
Sonnet 5.5 發布後數天內便攀升至 Agent Arena 第三名。其精確的淨改善分數為 12.52%,誤差範圍為正負 3.09%。
排名在其之前的兩個模型分別是得分 14.31% 的 Claude Fable 5.1(Max)與得分 13.82% 的 Claude Opus 5.5(High)。緊隨其後的是 OpenAI 的 GPT-6 Astra(Max),得分 12.27%。憑藉這些成績,Anthropic 佔據了榜單前四名中的三個位置。
Agent Arena 以數百萬項真實世界的代理任務來評分模型, AI 需要使用工具、完成多步驟工作並讓實際使用者滿意。評分標準涵蓋工具可靠性、任務完成度與使用者回饋。這樣的評分重點反映了產業整體趨勢:隨著部署越來越依賴模型呼叫工具並執行多步驟工作,模型排名之爭也越來越聚焦於端到端的任務執行,而非僅止於靜態問答。
成本是另一個關鍵數字。Arena 列出 Sonnet 5.5 的每項任務成本為 2.74 美元,而 10 月初的數據顯示其中位數成本約為每項任務 2.78 美元。該模型的 token 消耗量也高於大多數同級模型。
Arena 之外的基準測試
Sonnet 5.5 的強勁表現也延伸至其他基準測試。在 Artificial Analysis Intelligence Index 上,它獲得 56 分,僅次於 Opus 5.5(Max),位居第二。
在 Terminal-Bench 4.0 上,Sonnet 5.5 得分 70.6%,較其前代 Sonnet 5 在同一測試中約 10% 至 14% 的成績大幅躍進。新模型也超越了在 Terminal-Bench 4.0 上得分 66.4% 的 Opus 5.5。
速度同樣有所提升:Sonnet 5.5 的執行速度比 Sonnet 5 快逾 30%。不過價格並未調整,維持每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,與先前相同。Sonnet 5.5 提供一百萬 token 的上下文視窗與 128,000 token 的最大輸出量。在每 token 價格維持不變、而實測速度與分數同步提升的情況下,這次升級改變了單位成本所能換取的能力——不過從 Arena 數據可見,該模型較高的 token 耗量,仍是決定每項任務實際成本的關鍵變數。
這對 AI 模型競賽意味著什麼
首先要注意的是誤差範圍。Sonnet 5.5 的分數帶有正負 3.09% 的誤差幅度,而前四名模型之間的整體差距比這個數字還小。GPT-6 Astra(Max)僅以 0.25 個百分點之差落後 Sonnet 5.5。在差距如此接近的情況下,隨著 Arena 累積更多任務結果,排名可能出現變化,因此目前的榜單更適合視為當下的快照,而非已定案的位階。
Token 消耗量在此同樣重要。較高的 token 用量可能侵蝕成本優勢,視工作負載而定——每 token 便宜但輸出冗長的模型,單次任務的總成本未必較低。對於在正式環境中運行代理的團隊而言,分數與每項任務成本這兩項數據終究會放進同一份試算表中,這正是為什麼任何撼動 Agent Arena 這類排行榜龍頭的新模型發布,都會從這兩個面向同時被檢視。