Anthropic 推出 Claude Sonnet 5.5,編碼表現勝過 Opus 5.5,價格僅一半
重點速覽
- •Claude Sonnet 5.5 以不變的定價亮相:每百萬輸入權元 2 美元、每百萬輸出權元 10 美元,僅為 Anthropic 對 Opus 5.5 收費的一半。
- •新模型在 Terminal-Bench 4.0 編碼測試中擊敗 Opus 5.5,在 Anthropic 的結果中為 70.6% 對 66.4%,在 Artificial Analysis 的獨立測試中為 63.6% 對 59.6%。
- •在最高強度下,Sonnet 5.5 每項任務產生約 193,000 個權元,是 Artificial Analysis 迄今測得的最高值,每項任務成本 7.60 美元——比 Sonnet 5 高出約 50%。
- •Anthropic 表示該模型比 Sonnet 5 快逾 30%,且每項任務使用的權元少了近三分之一,因此在標價相同的情況下實際運行更低。
- •專為高用量、對成本敏感的應用而設計的 Claude Haiku 5.5 預計將於數週內推出,完整構成 Anthropic 的 5.5 世代產品線。

Anthropic 週一發布 Claude Sonnet 5.5,這是其於 6 月推出的中階 AI 模型 Sonnet 5 的最新升級版本。定價維持不變:每百萬輸入權元 2 美元、每百萬輸出權元 10 美元——僅為該公司對 Opus 5.5 收費的一半。
儘管價格較低,這款模型在編碼方面的表現已超越其更大的同門產品。根據 Anthropic 的數據,在 Terminal-Bench 4.0 上,Sonnet 5.5 拿下 70.6%,高於 Opus 5.5 的 66.4%。獨立測試機構 Artificial Analysis 自行執行了該基準測試,同樣將 Sonnet 5.5 排在前面,成績為 63.6% 對 59.6%。不過該機構在其排行榜上仍將其列為僅次於 Opus 5.5 的第二名,並指出它在每項任務上使用的權元多於其所測試的任何模型。
Anthropic 表示,新模型的運行速度比前代快逾 30%。該公司寫道:「Sonnet 5.5 最擅長範圍明確的日常工作、修復程式錯誤,以及製作精美的文件、簡報和試算表。它在設計方面也很有眼光。」
權元是 AI 模型讀取與寫出的文字片段——略短於一個單詞——AI 公司以百萬為單位計費。雖然標價與 Sonnet 5 相同,但新模型每項任務使用的權元少了近三分之一,這意味著儘管費率相同,它的實際運行成本反而低於前代。
這款模型真正亮眼之處在於編碼。Terminal-Bench 4.0 衡量 AI 代理是否能夠透過自行輸入指令完成複雜的專業任務,以完成任務的比例計分。Sonnet 5.5 拿下 70.6%。Opus 5.5 得分 66.4%,而 Sonnet 5 僅為 10.3%。簡而言之,更便宜的模型完成了更多任務。
Artificial Analysis 的獨立測試結果也一致:Sonnet 5.5 為 63.6%,Opus 5.5 為 59.6%,OpenAI 的 GPT-6 Astra 為 59.1%。該機構在 X 上發文強調了這款模型的進步:
Claude Sonnet 5.5 (max) makes large strides on Terminal-Bench, sitting among the top models for both Terminal-Bench 4.0 and Terminal-Bench-Science. In Terminal-Bench 4.0 it scores 64%, a 50 point increase over Claude Sonnet 5 (max), and slightly above 60% for Opus 5.5 and GPT-6… pic.twitter.com/7CPrhgmfxe
— Artificial Analysis (@ArtificialAnlys) September 28, 2026
得分也取決於 effort 設定,這個旋鈕會讓模型思考更久以獲得更好的答案——同時來更高的帳單。Anthropic 表示,Sonnet 5.5 在 High 強度下於 FrontierCode 上的表現與 GPT-6 Sol 相當,而每項任務的成本僅約其五分之一。
在 GDPval-AA 這項以 Elo(類似西洋棋等級的相對實力評分系統)評估 44 種職業真實世界專業工作的測試中,Sonnet 5.5 得分 1844,與 Opus 5.5 的 1846 實際上不分上下。GPT-6 Sol 得分為 1487。
競爭對手的定價也相同。OpenAI 上週將 GPT-6 Sol 降價至 2 美元和 10 美元,而其中階模型 GPT-5.6 Terra 的定價為 2 美元和 12 美元。Sonnet 5.5 與 GPT-6 Sol 目前的定價完全相同——不過,正如上述 effort 設定所顯示,標價相同並不保證每項任務的實際成本相同。Anthropic 並未公布 Terra 的基準測試數據。
但有個代價
代價在於冗長。Sonnet 5.5 是個話癆:在最高強度下,它在每項測試任務中產生了約 193,000 個權元,是 Artificial Analysis 迄今測得的最高值,比 Opus 5.5 多出約 60%。這使每項任務的成本達到 7.60 美元,比 Sonnet 5 高出約 50%——這一結果與 Anthropic 宣稱的高達 30% 的節省幅度相矛盾。
Anthropic 的節省主張建立在較低的設定上。該公司表示,在其應用程式的預設 Medium 強度下,Sonnet 5.5 以不到十分之一的成本超越 Sonnet 5 的最佳編碼成績。Artificial Analysis 認為 High 強度的性價比最高。對一般使用者而言,這意味著只要旋鈕維持在低檔,就能以極低的價格獲得接近旗艦水準的編碼能力。
仍有一些注意事項。Anthropic 的基準測試表為自行報告,而 Artificial Analysis 測試的是一個存在錯誤的預發布版本,Anthropic 預期該錯誤影響甚微或使其成績略被低估,這也是值得關注正式版本獨立測試結果的原因之一。該公司也表示,在需要持續判斷力的複雜工作上,Opus 5.5 仍然明顯更強。
專為高用量、對成本敏感的應用而打造的 Claude Haiku 5.5 預計將於數週內推出,與 Opus 5.5 和 Sonnet 5.5 一起完整構成 Anthropic 的 5.5 世代產品線。