Anthropic 推出 Claude Sonnet 5.5:性能逼近 Opus,任务成本最高降低 30%
要点速览
- •Anthropic 推出 Claude Sonnet 5.5,作为 Claude 5.5 家族的第二款模型,以更低的成本层级面向编程、日常办公和文档工作。
- •该模型输出速度比 Sonnet 5 快逾 30%,并通过 token 效率将每项任务成本最高降低 30%,同时每百万输入 token 定价保持 2 美元、每百万 token 保持 10 美元。
- •Sonnet 5.5 在 Terminal-Bench 4.0 上以 70.6% 对 66.4% 超过 Opus 5.5,并在 GDPval-AA 上相差不到两分,得分为 1,844,Opus 为 1,846。
- •在编程评估中,高努力程度下 Sonnet 5.5 在 FrontierCode 上比 Sonnet 5 提升约 10 分,而每项任务成本约为其十五分之一。
- •它是首款搭载与 Anthropic 高端层级相当的安全防护措施的 Sonnet 模型,这一变化可能将较高风险的网络安全请求转回 Sonnet 5。

Anthropic 推出了 Claude Sonnet 5.5,这是其 Claude 5.5 家族中的第二款模型,定位为编程、日常办公和文档创作中更快、更经济的选择。
根据 Anthropic 的公告,该模型的输出速度比前代 Sonnet 5 快逾 30%,并且在公司测试中每项任务的成本最高降低 30%。节省主要源于效率提升:Sonnet 5.5 完成同样的工作所需的 token 更少。每 token 定价本身保持不变,即每百万输入 token 2 美元、每百万输出 token 10 美元。这一区别对于大规模运行该模型的团队十分重要:由于标价未变,节省体现在任务层面,而成本会随使用量累积。
Anthropic 将 Sonnet 5.5 定位为 Claude Opus 5.5 的低成本补充。Opus 仍面向需要持续判断力的复杂、开放式工作,而 Sonnet 则针对更明确的任务,例如修复缺陷以及创建文档、幻灯片和电子表格。
然而,在某些评估中,两款模型之间的差距已明显缩小。Sonnet 5.5 在 Terminal-Bench 4.0 上的得分超过 Opus 5.5,分别为 70.6% 与 66.4%。在衡量现实世界知识型工作的 GDPval-AA 上,两者几乎持平,Sonnet 5.5 得分为 1,844,Opus 5.5 为 1,846。Anthropic 表示,在某些努力程度设置下,Sonnet 5.5 的表现与 Opus 5.5 相当,但公司仍认为 Opus 是处理需要持续判断力的复杂任务的更强模型。对于权衡两个层级的买家而言,这些结果提供了一个参考,说明在 Sonnet 更低的单任务成本下能保留多少可衡量的能力。
编程是改进最大的领域之一。Anthropic 报告称,在高努力程度下,Sonnet 5.5 在 FrontierCode 上比 Sonnet 5 提升了约 10 分,而每项任务的成本约为其十五分之一。该模型的最佳 CursorBench 成绩也与 Opus 5.5 相差约两分。
更广泛的知识型工作也取得了显著进展。Anthropic 表示,Sonnet 5.5 在计算机使用和图表识别方面接近 Opus 5.5,并在公司内部和外部评估中全面超越 Sonnet 5。
在网络安全能力较上一代大幅提升后,Sonnet 5.5 也是首款搭载与 Anthropic 高端模型相当的安全防护措施的 Sonnet 模型。因此,较高风险的网络安全请求可能会回退到 Sonnet 5,而常规开发任务仍可正常使用——这是更严格防护与任务可用性之间的权衡,将模型用于安全相关工作的团队需要将其纳入考量。
该模型已在 Anthropic 的各平台以及 Amazon Web Services、Google Cloud 和 Microsoft Azure 上可用。开发者可通过 Claude Platform 使用标识符 claude-sonnet-5-5 访问。
Anthropic 还表示,面向高吞吐量、成本敏感应用的 Claude Haiku 5.5 将在未来几周内加入 Claude 5.5 家族。推出后,该家族将完整覆盖 Anthropic 的层级范围,从持续处理复杂工作到大规模部署。