新闻股票Anthropic 推出 Claude Sonnet 5.5:编程能力超越 Opus 5.5,价格仅为其一半

Anthropic 推出 Claude Sonnet 5.5:编程能力超越 Opus 5.5,价格仅为其一半

作者: Decrypt·

要点速览

  • •Claude Sonnet 5.5 发布,定价维持不变:每百万输入 tokens 2 美元、每百万输出 tokens 10 美元,仅为 Anthropic 对 Opus 5.5 收费标准的一半。
  • •新模型在 Terminal-Bench 4.0 编程测试中击败了 Opus 5.5:Anthropic 的结果为 70.6% 对 66.4%,Artificial Analysis 的独立测试为 63.6% 对 59.6%。
  • •在最高推理力度下,Sonnet 5.5 每项任务生成了约 193,000 个 tokens,是 Artificial Analysis 迄今测得的最高值,每项任务成本达 7.60 美元——比 Sonnet 5 高出约 50%。
  • •Anthropic 表示,该模型比 Sonnet 5 快 30% 以上,每项任务使用的 tokens 几乎少三分之一,因此尽管标价相同,实际运行成本更低。
  • •专为高吞吐量、成本敏感应用设计的 Claude Haiku 5.5 预计将在数周内推出,补齐 Anthropic 的 5.5 代产品线。
Anthropic 推出 Claude Sonnet 5.5:编程能力超越 Opus 5.5,价格仅为其一半

Anthropic 于周一发布了 Claude Sonnet 5.5,这是其中端 AI 模型的最新版本,也是对今年 6 月推出的 Sonnet 5 的升级。定价保持不变:每百万输入 tokens 2 美元、每百万输出 tokens 10 美元——仅为该公司 Opus 5.5 收费标准的一半。

尽管价格更低,该模型在编程方面已经超越了其更大的同门模型。据 Anthropic 数据,在 Terminal-Bench 4.0 上,Sonnet 5.5 得分为 70.6%,而 Opus 5.5 为 66.4%。独立测试机构 Artificial Analysis 运行了自家的基准测试版本,同样将 Sonnet 5.5 排在前面,得分为 63.6% 对 59.6%。不过,该机构在其排行榜上仍将其排在 Opus 5.5 之后位列第二,并指出其每项任务消耗的 tokens 多于该机构测试过的任何模型。

Anthropic 表示,新模型的运行速度比前代快 30% 以上。该公司写道:"Sonnet 5.5 最擅长范围明确的日常任务、修复 bug,以及制作精美的文档、幻灯片和电子表格。它对设计也有着敏锐的眼光。"

Tokens 是 AI 模型读取和写入的文本块——比一个单词略短——AI 公司按百万为单位计费。虽然标价与 Sonnet 5 相同,但新模型每项任务使用的 tokens 几乎少了三分之一,这意味着尽管费率相同,其实际运行成本反而低于前代模型。

该模型真正大放异彩的领域是编程。Terminal-Bench 4.0 衡量的是 AI 代理能否通过自行键入命令来完成复杂的专业任务,以完成任务的比例计分。Sonnet 5.5 得分 70.6%。Opus 5.5 得分 66.4%,而 Sonnet 5 仅为 10.3%。简而言之,更便宜的模型完成了更多任务。

Artificial Analysis 的独立测试结果也印证了这一点:Sonnet 5.5 为 63.6%,Opus 5.5 为 59.6%,OpenAI 的 GPT-6 Astra 为 59.1%。该机构在 X 上的一则帖子中重点介绍了该模型的进步:

Claude Sonnet 5.5 (max) makes large strides on Terminal-Bench, sitting among the top models for both Terminal-Bench 4.0 and Terminal-Bench-Science. In Terminal-Bench 4.0 it scores 64%, a 50 point increase over Claude Sonnet 5 (max), and slightly above 60% for Opus 5.5 and GPT-6… pic.twitter.com/7CPrhgmfxe

— Artificial Analysis (@ArtificialAnlys) September 28, 2026

得分还取决于推理力度设置——一个让模型思考更久以获得更好答案的旋钮,同时也会带来更高的账单。Anthropic 表示,Sonnet 5.5 在 High 推理力度下于 FrontierCode 上可与 GPT6 Sol 比肩,而每项任务成本仅约为后者的五分之一。

在 GDPval-AA 基准测试中——该测试使用国际象棋风格的 Elo 相对水平评分体系,对 44 个职业的真实专业工作进行评级——Sonnet 5.5 得分 1844,Opus 5.5 为 1846,实际上不相上下。GPT- Sol 得分 1487。

竞争对手的价格也在跟进。OpenAI 上周将 GPT-6 Sol 降价至 2 美元和 10 美元,而其中端模型 GPT-5.6 Terra 的定价为 2 美元和 12 美元。Sonnet 5.5 与 GPT-6 Sol 现在的标价完全相同——不过,正如上述推理力度设置所示,标价相同并不意味着每项任务的实际成本相同。Anthropic 未公布 Terra 的基准测试数据。

代价所在

权衡之处在于冗长的输出。Sonnet 5.5 是个"话痨":在最高推理力度下,它每项测试任务生成了约 193,000 个 tokens,这是 Artificial Analysis 迄今测得的最高值,比 Opus 5.5 高出约 60%。这使每项任务的成本达到 7.60 美元,比 Sonnet 5 高出约 50%——这一结果与 Anthropic 所宣称的高达 30% 的节省幅度相悖。

Anthropic 的省钱说法建立在较低设置之上。该公司表示,在 Medium 推理力度(其应用中的默认设置)下,Sonnet 5.5 以不到十分之一的成本超越了 Sonnet 5 的最佳编程成绩。Artificial Analysis 则认为 High 推理力度性价比最高。对于日常用户而言,只要旋钮保持在低位,就意味着以极低的价格获得接近旗舰级的编程能力。

仍需注意一些保留事项。Anthropic 的基准测试数据表为自我报告,而 Artificial Analysis 测试的是一个存在 bug 的预发布版本,Anthropic 预计该 bug 影响甚微或略微低估了其得分,这也是为什么值得关注正式版上的独立测试结果的原因之一。该公司还表示,在需要持续判断的复杂工作中,Opus 5.5 仍然明显更强。

面向高吞吐量、成本敏感应用的 Claude Haiku 5.5 预计将在数周内推出,与 Opus 5.5 和 Sonnet 5.5 一起补齐 Anthropic 的 5.5 代产品线。