新聞股票Anthropic 推出 Claude Opus 5:以半價提供接近前沿的智慧能力,瞄準企業與程式開發工作負載

Anthropic 推出 Claude Opus 5:以半價提供接近前沿的智慧能力,瞄準企業與程式開發工作負載

作者: VentureBeat AI·

重點速覽

  • Opus 5 的定價與 Opus 4.8 相同,而 Anthropic 表示它以半價提供了 Fable 5 近乎全部的智慧能力。
  • Anthropic 報告 Opus 5 在 Frontier-Bench v0.1 上得分 43.3%,相比之下 Opus 4.8 為 18.7%,Fable 5 為 33.7%。
  • 該公司表示 Fable 5 仍然更適合最長的自主專案,而 Opus 5 在有明確結果的有界任務上最為強大。
  • 早期客戶指出 token 使用量更低、工具呼叫更少、完成時間更快,且在法律、金融、自動化和程式開發工作流程中表現更強。
  • Opus 5 包含安全分類器、在特定產品中回退至 Opus 4.8 的路由、Fast 模式、API 可用性,以及一般存取無資料保留要求。
Anthropic 推出 Claude Opus 5:以半價提供接近前沿的智慧能力,瞄準企業與程式開發工作負載

Anthropic 於週五推出 Claude Opus 5,該公司表示這款模型以半價提供近乎其旗艦模型 Claude Fable 5 的全部智慧能力——這次發布凸顯了 AI 競爭格局正從原始能力轉向日常使用的經濟效益。

該模型已於所有 Anthropic 平台即時上線。定價為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元,與其前身 Opus 4.8 保持一致。Opus 5 成為 Claude Max 的新預設模型——這是 Anthropic 的高階消費者方案——同時也是 Claude Pro 上最強大的模型。

這一定位是經過深思熟慮的。Anthropic 並未宣稱 Opus 5 是其最聰明的模型——這項殊榮仍然屬於 Fable 5,且競爭系統在某些領域仍保持優勢。相反地,該公司提出了更為細微的論點,直接瞄準企業買家:最具經濟重要性的 AI 工作落在中等難度的範圍內,在這個範圍中,以高效且平價方式提供的接近前沿智慧能力,勝過以高昂成本交付的前沿智慧能力。

「Opus 5 作為您的日常主力,是您交付複雜工作並在完成後進行審查的模型,」Anthropic 發言人在接受 VentureBeat 採訪時表示,描述了該公司的模型分層策略。「Fable 5 用於您最雄心勃勃的工作,那些以前無法勝任的為期數天的自主專案……Sonnet 5 用於大規模運行的工作,速度和每次呼叫的成本決定了最終成果。Haiku 4.5 用於子代理和即時回答。」

基準測試表現:Opus 5 對決 Fable 5 與競爭對手

從數據上來看,基準測試結果令人矚目。Anthropic 表示 Opus 5 在程式開發和知識工作評測中創下新的業界最佳紀錄,包括 Frontier-Bench 和 GDPval-AA。

在 Frontier-Bench v0.1——一項代理式終端程式開發基準測試中,Opus 5 得分為 43.3%,是 Opus 4.8 的 18.7% 的兩倍多,也大幅領先 Fable 5 的 33.7%——而且根據該公司,每項任務的成本更低。在 ARC-AGI 3——一項評估新穎問題解決能力的測試中,Anthropic 報告 Opus 5 的得分是次佳模型的三倍。在 OSWorld 2.0——一項電腦使用基準測試中,該公司表示 Opus 5 以僅約三分之一的成本超越了 Fable 5 的最佳成績。

這些數據伴隨著一些誠實的但書,這在一個容易使用誇張用語的行業中本身就值得注意。Anthropic 承認 Opus 5 在網路安全任務和生物學研究方面仍然落後於競爭模型 Mythos 5。一個 OpenAI 系列模型在一項代理式程式開發基準測試中仍然領先。

更具啟發性的但書直接來自 Anthropic,當被問及 Opus 5 在哪些方面仍落後於 Fable 5 時。發言人的回答等同於坦率承認基準測試能夠和不能夠捕捉什麼。

「Opus 5 獲勝的評測是有界任務且有明確結果的,這正是它最強的地方。這些評測沒有衡量的是持續時間,」發言人告訴 VentureBeat。「一種說法是:Opus 5 是基準測試能夠看到的工作的最佳工具,而 Fable 5 是當工作超出了基準測試範圍時您要用的模型。」

相比之下,Fable 5「適用於最長、最自主的工作,模型需要在數小時或數天內跨越許多連接步驟並處理密集的原始資料時保持連貫,」發言人表示,並建議客戶「在代表性的工作負載上同時運行兩者,一個有界任務和一個長程工作。」這種框架——有界任務對決長程自主性——可能成為 2026 年模型差異化的決定性軸線,因為基準測試趨於飽和,而最困難的剩餘問題涉及持續多日的代理式工作,而非離散的謎題。

Token 效率作為真正的企業戰場

貫穿此次發布的一個主題是 Anthropic 顯然希望買家吸收的訊息:Opus 5 不僅得分高,而且是每美元得分高。該模型配備了可調整的「努力」設定,讓客戶可以在智慧和速度及 token 節省之間進行權衡,而 Anthropic 的圖表強調的是在給定成本下的表現,而非僅僅是峰值表現。

早期客戶以不尋常的具體性呼應了這一點。法律 AI 公司 Harvey 表示,Opus 5 達到了與 Opus 4.8 最高推理模式相似的表現,「同時平均減少了 26% 的 token 生成量,」該公司應用研究負責人 Niko Grupen 表示。Fundamental Research Lab 的 Richard Pham 表示,在困難的金融建模任務上,該模型平均準確率高出九個百分點,「同時使用大約少了三分之一的回合和工具呼叫,以及 60% 更少的時間。」

Zapier 執行長 Wade Foster 表示,Opus 5 在該公司的 AutomationBench 排行榜上名列前茅,「且未比先前的 Claude 模型消耗更多 token,」從頭到尾運行了一個完整的客戶流失預防工作流程。「先前的模型沒有通過;Opus 5 達到了 100%,」他說。

Cognition 執行長 Scott Wu——該公司是 Devin 程式開發代理的幕後團隊——表示,在 FrontierCode 1.1 上,「Claude Opus 5 以半價接近 Fable 級別的表現,」在除錯和根因分析方面表現尤為突出。

效率的強調反映了商業現實。企業 AI 支出已不再是實驗性的,推論成本——實際大規模運行這些模型的代價——已成為董事會層級的關注事項。Anthropic 的業務嚴重偏向 API 和企業使用;根據 Contrary Research 2026 年 2 月的分析,截至 2025 年底,Claude 按使用量計約佔據企業大型語言模型市場的 40%,而 Claude Code 單獨已達到約 10 億美元的年化收入。對於一家客戶按 token 付費的公司來說,一個用更少 token 做更多事情的模型不是可有可無的——它就是產品本身。

自我驗證代理與自動化的隱藏成本

除了數字之外,Anthropic 正在推進一個行為敘事:Opus 5 會驗證自己的工作並反覆迭代直到成功。該公司提供了幾個來自測試的案例,讀起來像是機器堅持不懈的小寓言。

在一項 Frontier-Bench 任務中,模型被要求從一張刻意不給它觀看方式的圖紙中,將一個機器零件重建為 3D CAD 模型。Anthropic 表示,Opus 5 沒有放棄,而是自行撰寫了電腦視覺管線來從原始像素中提取幾何形狀——而且反覆做到了這一點,而沒有任何競爭模型在五次嘗試中解決了該任務。在另一個案例中,給定一個流行開源套件管理器中的真實錯誤,模型找到了根本原因並修復了社群自己的修補程式遺漏的邊緣情況;一個競爭模型僅修補了症狀並宣稱勝利。該公司表示,一家交易公司的工程師在一次會話中使用 Opus 5 為一個新交易所建立了市場數據饋送,在找不到即時饋送進行驗證後,看著模型構建自己的測試框架來檢查其解析程式碼。

客戶在實際生產環境中描述了類似的行為。Stripe 的 staff 軟體工程師 Cristian Rivera 表示,他讓模型在一個週末扮演「我開發環境的幕僚長角色」:「它建立了自己的監控,驅動每個機器盒,只有在需要判斷決策時才把我拉進來。」

這正是企業最關心的能力。一個產生看似合理輸出的模型與一個驗證其輸出的模型之間的差距,就是演示與可部署系統之間的差距。現今企業 AI 的大部分隱藏成本是人工審查——工程師檢查機器的工作。一個能夠可靠地檢查自己工作的模型壓縮了這一成本,這正是客戶不斷提到更少的回合、更少的通過次數和更少的時間,而非更高的原始分數的原因。

Anthropic 的安全策略:能力差距、分類器和模型回退

此次發布還凸顯了 Anthropic 日益複雜的安全方法——該方法現在涉及刻意不訓練其模型某些技能。該公司表示,其自動化行為稽核發現 Opus 5 是其迄今為止最符合一致性的模型,在整體不一致行為上得分為 2.3,低於 Opus 4.8、Sonnet 5 或 Fable 5,具有最低的欺騙行為率和最少被誘導濫用的可能性。

在能力方面,Anthropic 表示它刻意避免在網路安全任務上訓練 Opus 5,就像它對 Opus 4.8 所做的那樣。模型仍然在這方面有所提升——這是一般能力提升的副作用——現在在發現軟體漏洞方面幾乎與 Mythos 5 匹敵。但在利用漏洞方面仍然遠遠落後:在 Anthropic 的 OSS-Fuzz 評測中,Opus 5 以 79.4% 的比率發現了漏洞,接近 Mythos 5 的 80%,但僅在 4 項挑戰中成功開發了攻擊程式,而 Mythos 5 為 13 項。這種不對稱性——在國防相關的發現方面強,在攻擊相關的利用方面弱——似乎是刻意的,而防護措施也遵循相同的邏輯。Anthropic 預期 Opus 5 的網路安全分類器的干預頻率比 Fable 5 的少約 85%。

當分類器確實觸發時,Claude.ai、Claude Code 和 Claude Cowork 中的請求預設回退到 Opus 4.8——這引出了一個顯而易見的問題:如果一個請求對一個模型來說太危險,為什麼對另一個模型就可以接受?

「回退到的模型具有較低的能力水平,使有害使用的風險也隨之降低,」發言人表示,並補充道「有一條訊息會在這種情況發生時通知使用者,並且在聊天中可見。」這一邏輯是站得住腳的,但它揭示了 2026 年 AI 安全的實際運作方式:風險不僅僅是問題本身的屬性,而是問題乘以回答它的系統的能力。

在生物學方面,計算方式恰恰相反。Opus 5 現在是 Anthropic 在科學研究方面最強大的通用模型——在該公司的內部化學基準測試中比 Opus 4.8 高出 10.2 個百分點——不過發言人承認「Mythos 5 在長程、開放式工作方面仍然是更強的模型,例如自主藥物設計活動。」

商業利害關係:3,800 億美元估值與大規模運算承諾

此次發布正值 Anthropic 非凡的商業動能——以及非凡的義務——之際。路透社 2 月報導,該公司在最新一輪融資中的估值約為 3,800 億美元。根據 Contrary Research 的分析,年化收入從 2024 年底的約 10 億美元攀升至 2025 年底預計的 90 億美元,內部目標據報導在 2026 年達到 200 至 260 億美元。

這些目標由龐大的基礎設施承諾支撐,包括據報導的 300 億美元 Azure 運算交易,以及與 Google Cloud 和 Nvidia 的合作安排——這些支出只有在企業持續擴大使用量的情況下才划算。

在此背景下,Opus 5 的定價策略就顯得合理了。在關鍵的代理式基準測試上將表現大致翻倍的同時,將價格維持在 Opus 4.8 的水準,實際上等於每單位能力的大幅降價,旨在擴大可經濟地自動化的工作負載範圍。每一個在 Opus 4.8 的每次成功成本下處於邊緣的任務,在 Opus 5 下都變得可行——而每一個可行的任務都代表著經常性的 token 收入。

監管環境也變得更加複雜。一位美國法官本週給予最終批准,批准了 Anthropic 與書籍作者的 15 億美元版權和解協議,路透社報導,結束了圍繞該公司早期訓練資料的訴訟章節。6 月,路透社援引 Axios 報導,美國政府已採取行動阻止外國取得 Anthropic 最先進的模型——這提醒人們,前沿 AI 現已與出口政策糾纏在一起,影響著哪些客戶可以購買什麼。

額外功能與可用性

週五同步推出的還有:以約 2.5 倍預設速度運行的 Fast 模式,價格為基本價的兩倍;API 上的自動回退路由;以及對話中途的工具變更不再使提示快取失效——這是一個小功能,代理開發者可能比任何基準測試都更欣賞它。

與先前的 Opus 模型一致,Opus 5 對於一般存取不附帶資料保留要求,發言人主動為有「嚴格零資料保留要求」的客戶標記了這一點。開發者從今天起可以在 Claude API 上以 claude-opus-5 名稱存取該模型。

兩個問題將決定這一賭注是否回本:Opus 5 的效率聲明能否在大規模生產工作負載中經受考驗,以及企業是否會接受一個由安全分類器(而非使用者)有時決定哪個模型來回答的世界。

週五發布的更深層訊息是,AI 行業的重心已經轉移。三年來,各實驗室在比拼其最佳模型在最佳狀態下能做什麼。而 Opus 5,Anthropic 正在一個不那麼耀眼但利潤豐厚得多的領域競爭:一個非常好的模型每天能做什麼,而且只需半價。在一個前沿不斷推進的市場中,Anthropic 押注真正的財富就在前沿之後。