Anthropic新推出的Claude Opus 5.5以旗舰Fable 5.1六成的价格实现同等性能
要点速览
- •Opus 5.5的每token价格为输入4美元、输出20美元,比前代便宜20%,比旗舰Fable 5.1便宜60%,缓存读取成本下降60%至每百万token 0.20美元。
- •Anthropic的基准测试显示,Opus 5.5在编程和知识类工作测试中同时领先Fable 5.1和Opus 5,包括在Terminal-Bench 4.0上66.4%的完成率以及在GDPval-AA v2.1上1846的Elo分数。
- •GPT-6 A在AutomationBench上仍以41.4%对40.0%领先Opus 5.5,在Terminal-Bench-Science 0.1上以64.6%对58.7%领先。
- •该模型上线时配备与Fable 5.1相同的网络安全和生物安全防护措施,大多数网络安全任务仍会被自动转接到较旧的Opus 4.8。
- •Opus 5.5是Anthropic自夏季以来发布的第三款旗舰级模型,此前CEO Dario Amodei刚发表文章敦促行业放缓AI能力提升的步伐。

Anthropic于周二发布了Claude Opus 5.5,这是该公司所称的Claude 5.5系列的首款模型。该模型定价为每百万输入token 4美元、每百万输出token 20美元——在默认设置下比Opus 5便宜40%——Anthropic表示,其在大多数任务上的表现可与公司最昂贵的旗舰模型Claude Fable 5.1持平。
根据Anthropic自己的数据,Opus 5.5在编程和知识类工作测试中同时领先于Fable 5.1及其前身Opus 5,不过GPT-6 Astra在AutomationBench和Terminal-Bench-Science 0.1上仍然领先。新模型上线时配备了与Fable 5.1相同的网络安全和生物安全防护措施。
此次发布在价格上同时低于它所取代的模型和它所追赶的旗舰:Opus 5.5的运行成本比Opus 5低20%,比公司最先进的Fable 5.1便宜60%。
无论从版本(5.5对Fable的5.1)还是从家族层级来看,该模型都是Anthropic最先进的——Opus是公开发布的最大模型,其次是Sonnet,Haiku最小。Anthropic承认,Fable与Opus在现实中的差距比基准测试分数所显示的更小,但Opus可通过付费计划公开使用,且每token成本更低,这使其成为大多数Claude用户的明显选择。
今年,这两条产品线交替领先。Opus 5于7月发布,在大多数基准测试上以更低价格超越Fable 5。Fable 5.1于9月初问世并扭转局面,在Anthropic发布的所有基准测试中击败Opus 5。Opus 5.5再次缩小了差距——这一次靠的是价格而非分数。
开发者平台Lovable曾在7月用其自有编程测试对Opus 5进行评估,其在Anthropic分享的一份声明中表示,与之前的模型相比,Opus 5"更稳定,每次运行之间的差异要小得多"——这正是Anthropic如今再次强调的效率卖点。
Opus 5.5也是CEO Dario Amodei发表文章呼吁行业放缓之后,Anthropic发布的第一款模型。他在文中指出,AI能力的提升速度正在超过本应加以约束的安全测试。"我们必须放慢提升AI模型能力的速度,"Amodei本月早些时候写道。自夏季以来,Anthropic已发布了三款旗舰级模型——7月的Opus 5、9月初的Fable 5.1以及周二的Opus 5.5——这正是那篇文章认为应当放缓的节奏。
Anthropic主要通过智能体编程来衡量这些进展——即由AI智能体执行的工作,这类模型能够自主执行多步骤操作,而不仅仅是回答单个提示。
在Terminal-Bench 4.0上,该测试考察智能体能否在命令行界面内完成复杂的专业任务,并以完成任务百分比作为评分,Opus 5.5达到66.4%,领先于Fable 5.1的55.8%和GPT-6 Astra的57.9%。FrontierCode使用相同的通过率评分,检验智能体的修改能否在实际工程流水线中被合并,Opus 5.5得分为54.4%,而Fable 5.1为50.3%。
在GDPval-AA v2.1上,该测试使用Elo——与象棋相同的排名体系,衡量相对水平而非简单百分比——对涵盖44个职业的真实专业工作进行评分,Opus 5.5得分为1846,Fable 5.1为1735,Opus 5为1708。
不过,Opus 5.5并非在所有项目上领先。在AutomationBench上,这一由Zapier构建的基准测试考察智能体能否在没有人工协助的情况下完整执行端到端的业务工作流,GPT-6 Astra以41.4%微弱领先Opus 5.5的40.0%。在Terminal-Bench-Science 0.1上,该测试采用相同的通过率方法,考察在命令行环境中执行的智能体科学研究,Astra以64.6%较大幅度领先Opus 5.5的58.7%。
更大的卖点在于成本。输入token——即模型读取和写入的文本块,按每百万计价——Opus 5.5现为4美元,而Opus 5为5美元;输出token从25美元降至20美元。缓存读取是指复用模型已处理过的上下文而非从零重新处理,这是长时段智能体编程会话中成本的主要来源,现在下降60%至每百万token 0.20美元。这种定价结构让折扣在关键之处产生叠加效应:长时间的智能体编程会话主要按缓存读取计费,因此最大幅度的降价恰好落在成本最大的项目上。
由于Opus 5.5在这两项能力上与Anthropic的Mythos级模型相当——这是公司限制最严格的层级,仅向经过审核的网络安全和生物学研究人员开放——因此其上线时配备与Fable 5.1相同的防护措施。大多数网络安全任务仍会被自动转接到较旧的Opus 4.8,这一做法此前曾受到许多开发者和用户的抱怨。Opus 5.5的到来是否会改变这种转接行为,仍有待观察。
Opus 5.5现已在Anthropic的各平台上线,包括Amazon Web Services、Google Cloud和Microsoft Azure。Anthropic表示,Sonnet 5.5和Haiku 5.5将在未来几周内推出,并将同样的降价延续至整个产品线。