新闻股票Anthropic 发布 Claude Sonnet 5.5,AI 评估重心转向单任务成本

Anthropic 发布 Claude Sonnet 5.5,AI 评估重心转向单任务成本

作者: Cryptopolitan·

要点速览

  • •Anthropic 表示,Claude Sonnet 5.5 的运行速度比前代快超过 30%,由于使用更少 token,大多数任务的完成成本最多降低 30%,而单 token 价格保持不变。
  • •Sonnet 5.5 维持现有定价:每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 token 0.20 美元。
  • •该模型在 Terminal-Bench 4.0 上得分为 70.6%,Sonnet 5 为 10.3%,但独立数据显示,GPT-6 Sol 和小米的 MiMo-V2.6-Pro 等竞争对手能以远低于其的单任务成本达到相近的智能水平。
  • •文章引用的研究显示,自 2023 年以来,达到特定 AI 性能水平的成本每季度下降约 47%,但 Gartner 预计到 2028 年每个智能体工作流的总推理支出将增长五倍以上。
  • •据报道,约 80% 收入来自企业客户的 Anthropic 正筹备 IPO,Haiku 5.5 预计将在数周内发布。
Anthropic 发布 Claude Sonnet 5.5,AI 评估重心转向单任务成本

Anthropic 于 9 月 28 日发布 Claude 5.5 系列的第二款模型 Claude Sonnet 5.5,并通过 X 平台官方帖子 宣布了此次发布。据 路透社 报道,此次发布正值该公司筹备首次公开募股之际。这也凸显了评估 AI 技术标准的变化:基准测试的原始性能仍是关键考量,但企业越来越重视使用特定模型交付成果的成本高低。

Anthropic 表示,Sonnet 5.5 的运行速度比 Sonnet 5 快超过 30%,并且即使 token 价格保持不变,大多数任务的完成成本最多可降低 30%。根据 该模型的发布页面,成本降低源于执行相同工作时使用的 token 更少。

标价不变,token 更省

Sonnet 5.5 的定价为每百万输入 token 2 美元、输出 token 10 美元、缓存读取 token 0.20 美元——缓存读取是复用模型已处理上下文的折扣价格。专注于复杂推理与判断操作的 Opus 5.5 输入与输出 token 定价分别为 4 美元和 20 美元。Sonnet 则定位于编码、文档生成和电子表格等日常任务。

这一定价将效率推到了讨论的核心。对于许多任务,企业并不需要性能最高的模型;一个能稳定完成工作的低成本模型,可能比在基准测试上高出几分更重要。这一因素对 Anthropic 尤为关键,据路透社报道,该公司约 80% 的收入来自企业客户。

基准测试不再代表全部

Anthropic 表示,Sonnet 5.5 在 Terminal-Bench 4.0(一项通过真实终端任务测试模型的智能体基准)上得分为 70.6%,而 Sonnet 5 为 10.3%。但独立评估机构 Artificial Analysis 的 Artificial Analysis 排行榜 显示,基准成绩只是全貌的一部分。在最大算力投入下,Sonnet 5.5 在智能指数上达到 56 分,每项任务的成本估计为 7.60 美元。GPT-6 Sol 以每项任务 1.06 美元的成本获得 48 分,小米的 MiMo-V2.6-Pro 则仅以 0.13 美元的成本得到 46 分。换言之,智能水平领先的模型未必在成本效率上领先——对于高吞吐工作负载而言,这种单任务成本差距会迅速累积。

这些成本差异正推动企业采用多模型策略:更难的任务交给高端系统,而常规工作则交由更便宜的替代方案处理。这种做法让组织只在真正需要的地方为顶级能力买单。

思考的价格持续下降

这一转变契合了一个更大的长期趋势。根据 Epoch AI 于 9 月 22 日发布的 报告,自 2023 年以来,达到特定 AI 性能水平的成本每季度下降约 47%——相当于每年约缩减至十三分之一。据 Cryptopolitan 9 月 29 日发布的 报道,企业买家越来越倾向于选择能够完成所需工作的最便宜模型,而低价格也让企业更容易为同时运行多个模型提供合理依据。

token 更便宜,账单更大

然而,单位成本的降低并不保证整体 AI 支出的下降。Gartner 于 8 月 17 日发布的 报告,题为《Gartner 预测到 2028 年每个智能体工作流的 AI 推理成本将增长五倍以上》,描述了一种「推理悖论」:token 价格下降刺激了更复杂的工作流,从而推高了 token 总消耗量。单价与总支出是两个不同的杠杆——前者决定每个 token 的成本,后者取决于工作流消耗了多少 token。

「产品负责人不能指望更高效的 token 经济性来为 AI 成本辩护,」Gartner 高级总监分析师 Will Sommer 在 2026 年 8 月 17 日的报告中表示。

谁真正用上了更便宜的 AI

根据微软发布的《全球 AI 扩散报告》,低成本和开放权重模型有潜力显著提高 AI 的可及性,尤其是在全球南方地区。尽管如此,模型成本的降低本身并不能决定采用程度——基础设施、网络连接和技能仍是更便宜 AI 能否真正被使用的决定性因素。

对于企业买家而言,Sonnet 5.5 表明了市场的走向:最好的模型未必是最强大的,而是能在合理成本下出色完成工作的那一个。系列中的下一款模型 Haiku 5.5 预计将在未来几周内推出,它可能进一步推动这一转变——让大规模 AI 工作的执行成本更低,也让企业更难为常规任务支付高昂价格提供正当理由。