新聞股票Anthropic 推出 Claude Fable 5.1,關鍵基準測試成績較前代翻倍以上

Anthropic 推出 Claude Fable 5.1,關鍵基準測試成績較前代翻倍以上

作者: Decrypt·

重點速覽

  • Fable 5.1 在 Terminal-Bench-Science 0.1 上獲得 52.6%,為 Fable 5(24.7%)的兩倍以上,並在 Terminal-Bench 4.0 上獲得 55.8%,領先 Opus 5 的 52.3%。
  • 快取讀取成本調降 75%,典型工作負載成本約減少 25%,高度代理式工作負載最多減少 45%,基本定價維持每百萬 token 輸入 10 美元、輸出 50 美元。
  • Fable 5.1 未納入 Pro 方案與標準 Team 席位,這些方案須仰賴隨用隨付點數;Max 方案及進階 Team 或 Enterprise 席位可在每週用量上限的 50% 以內使用。
  • Mythos 5.1 與 Fable 5.1 共用同一底層模型但安全過濾器不同,僅限透過 Anthropic 驗證計畫審核通過的網路安全與生命科學專業人士使用。
  • Fable 5.1 在所有公布的基準測試中擊敗 Opus 5,但每 token 成本是其兩倍,為每百萬 token 10/50 美元,相較 Opus 5 的 5/25 美元。
Anthropic 推出 Claude Fable 5.1,關鍵基準測試成績較前代翻倍以上

Anthropic 於 9 月 1 日發布 Claude Fable 5.1 與 Claude Mythos 5.1,這是自 Fable 5 於 6 月 9 日推出以來,Mythos 系列模型的首度更新。新模型在 Terminal-Bench-Science 0.1 上獲得 52.6%(Fable 5 為 24.7%),在 Terminal-Bench 4.0 上獲得 55.8%(前代為 42.0%)。此次發布延續了前沿模型市場的慣常模式——OpenAI、Google 與 Anthropic 今年各自接連推出旗艦更新,並以基準測試的亮眼差距作為主要競爭指標。

快取讀取費用現已調降 75%,典型工作負載成本約可減少 25%,高度代理式(agentic)工作負載最多可減少 45%。基本定價維持不變,為每百萬 token 輸入 10 美元、輸出 50 美元。提示詞快取(prompt caching)——重複使用已處理的輸入內容,而非在每次呼叫時重新處理——已成為各大模型供應商的標準成本工具,因為會在多個步驟中重複長上下文的代理式工作流程,使帳單金額不斷攀升。

Fable 5.1 並未包含在 Pro 方案或標準 Team 席位中,這些方案須以用量點數執行;Max 方案及進階 Team 或 Enterprise 席位則可在每週上限的 50% 以內使用該模型。這種分層設計對於開發者選擇工作負載的部署位置相當重要:模型的實際成本不僅取決於其公布的每 token 費率,也同樣取決於所使用的方案。

Anthropic 宣稱新模型是「全球最先進的程式設計與知識工作模型」。此次發布距離產品週期啟動已三個月,期間經歷了為期 18 天的出口管制停權、盛夏期間針對訂閱存取權的價格爭議,以及 7 月推出的 Claude Opus 5 在價格上對 Fable 5 形成的壓力。

據 Anthropic 表示,Fable 5.1 與 Mythos 5.1 是搭載不同安全過濾器的同一底層模型。Fable 5.1 對所有 Claude 帳戶持有人開放。Mythos 5.1 則仍透過 Anthropic 的 Cyber Verification Program 與 Life Sciences Verification Program,僅限於通過審核的網路安全與生命科學專業人士使用——此為先前管制 Mythos 5 存取權的 Project Glasswing 通道的後繼機制。

基準測試實際測量什麼

Anthropic 的核心數據來自 Terminal-Bench-Science 0.1,該基準測試評估 AI 代理能否在命令列環境中執行科學研究任務,以通過率計分。Fable 5.1 達到 52.6%,相較 Fable 5 的 24.7% 與 Opus 5 的 29.0%——較前代翻倍以上。

Terminal-Bench 4.0 測試透過終端機進行的代理式程式設計——在多步驟命令列工作階段中撰寫、執行與除錯程式碼——以正確完成任務的百分比計分。Fable 5.1 獲得 55.8%,高於 Fable 5 的 42.0%,也領先 Opus 5 的 52.3%。對終端機多步驟任務的重視,反映了產業焦點從單輪對話回答,轉向能夠持續執行長時間自主工作流程的代理——這一轉變也使代理式基準測試成為近期前沿模型發布的常用評估標準。

Mythos 5.1 在較輕度的網路安全過濾器下運行,於同一測試中獲得 60.9%。Anthropic 表示,差距來自其安全防護機制攔截並轉送至 Opus 4.8 的任務。

在 Humanity's Last Exam 上——一項由數十個學術領域的專家級題目組成、以通過率計分的多學科推理測試——Fable 5.1 在不使用外部工具的情況下達到 60.9%,使用外部工具則達 65.0%,兩者均領先 Opus 5,成為 Anthropic 因應學術用途最先進的模型。

它在哪裡勝過 Opus 5,哪裡帳算起來更複雜

Opus 5 於 7 月推出,每 token 價格僅為 Fable 5 的一半,卻在多數主要基準測試中超越 Fable 5,實質上使旗艦模型對多數付費用戶而言失去必要性。Fable 5.1 扭轉了這一局面:它現在在 Anthropic 公布的每一項基準測試中都擊敗 Opus 5,包括 Opus 5 先前勝過 Fable 5 的那些項目。

但 Fable 5.1 的每 token 成本仍是 Opus 5 的兩倍——輸入 10 美元、輸出 50 美元,相較 Opus 5 的 5 美元與 25 美元。Token 是模型可處理的基本資訊量,通常約為一個英文單字的三分之二;企業之所以按用量付費,是因為重度工作流程通常會很快耗盡訂閱方案中的配額。「價格對效能」的抉擇——較小、較便宜的模型是否已經夠用——如今是買家在每一家主要供應商的產品線上都會遇到的課題,並不僅限於 Anthropic。

Anthropic 對此模型的推銷重點在於推論力度而非原始分數:該公司表示,以低或中推論力度運行 Fable 5.1,即可以更低成本追平或超越 Fable 5 的舊有成績,並將最高推論力度保留給其他模型都無法解決的難題。對日常工作而言,推論力度調得越低,完全跳過 Opus 5 的論點就越站不住腳。

存取權沿用 Anthropic 經數月調整後適用於 Fable 5 的相同劃分方式。在 Pro 方案及標準 Team 或 Enterprise 席位上,Fable 5.1 完全以按 API 費率計費的隨用隨付點數運行,因為它不計入這些方案的每週上限。在 Max 方案及進階 Team 或 Enterprise 席位上,它則作為訂閱的標準部分,可用量上限為每週用量的 50%。

Claude Fable 5.1 現已可在 Claude API、Amazon Bedrock、Google Cloud 及 Microsoft Foundry 上使用,模型 ID 為 "claude-fable-5.1"(Anthropic)。跨多個雲端平台的供應方式延續了 Anthropic 一貫的模型發布模式,讓企業客戶能在現有的雲端合約內運行模型,而不僅限於 Anthropic 自家的 API。