新闻宏观经济Claude Sonnet 5.5 位列 Arena Agent Arena 排行榜第三名

Claude Sonnet 5.5 位列 Arena Agent Arena 排行榜第三名

作者: CryptoBriefing·

要点速览

  • •Claude Sonnet 5.5 以12.52%的净改进得分进入 Arena.ai 的 Agent Arena 排行榜第三名,落后于另外两个 Anthropic 模型:得分14.31%的 Claude Fable 5.1 (Max) 和得分13.82%的 Claude Opus 5.5 (High)。
  • •该模型以微弱优势击败排名第四(12.27%)的 OpenAI GPT-6 Astra (Max),但0.25个百分点的差距小于 Sonnet 5.5 正负3.09%的误差范围,排名可能发生变化。
  • •在 Terminal-Bench 4.0 上,Sonnet 5.5 得分为70.6%,较其前代 Sonnet 5 约10%至14%的成绩大幅提升,并超越了 Opus 5.5 的66.4%。
  • •Sonnet 5.5 的运行速度比 Sonnet 5 快30%以上,同时保持每百万输入 token 2美元、每百万输出 token 10美元的价格不变,并提供100万 token 的上下文窗口。
  • •Arena 列出 Sonnet 5.5 的成本为每项任务2.74美元,该模型高于大多数同类产品的 token 消耗量可能决定其在生产部署中的实际任务成本。
Claude Sonnet 5.5 位列 Arena Agent Arena 排行榜第三名

Anthropic 最新的中端模型已登上 Arena.ai 的 Agent Arena 排行榜第三名。Claude Sonnet 5.5 于2026年9月28日发布,录得12.5%的净改进得分——足以超越 OpenAI 的最高排名模型。排名在其之上的只有两个模型,且同样都由 Anthropic 打造。

排行榜格局一览

在发布后数日内,Sonnet 5.5 便攀升至 Agent Arena 的第三位。其精确的净改进得分为12.52%,误差范围为正负3.09%。

排名其前的两个模型分别是得分14.31%的 Claude Fable 5.1 (Max) 和得分13.82%的 Claude Opus 5.5 (High)。紧随其后的是 OpenAI 的 GPT-6 Astra (Max),得分为12.27%。凭借这些成绩,Anthropic 占据了榜单前四名中的三个席位。

Agent Arena 以数百万项真实世界的智能体任务为模型评分,AI 需要在其中使用工具、完成多步骤工作并满足真实用户的需求。评分标准包括工具调用可靠性、任务完成度以及用户反馈。这一侧重点反映了行业更广泛的趋势:随着部署日益依赖模型调用工具并执行多步骤工作,模型排名越来越多地在端到端任务执行能力上展开竞争,而非仅凭静态问答。

成本是另一个关键数字。Arena 列出 Sonnet 5.5 的成本为每项任务2.74美元,而10月初的快照显示其中位成本约为每项任务2.78美元。该模型的 token 消耗量也高于大多数同类模型。

Arena 之外的其他基准测试

Sonnet 5.5 的强劲表现延伸到了其他基准测试。在 Artificial Analysis Intelligence Index 上,它得分为56,仅次于 Opus 5.5 (Max),位居第二。

在 Terminal-Bench 4.0 上,Sonnet 5.5 得分为70.6%——相较其前代 Sonnet 5 在同一测试中约10%至14%的表现,进步显著。新模型还超越了在 Terminal-Bench 4.0 上得分为66.4%的 Opus 5.5。

速度也有所提升:Sonnet 5.5 的运行速度比 Sonnet 5 快30%以上。不过价格并未变动,仍为每百万输入 token 2美元、每百万输出 token 10美元,与此前相同。Sonnet 5.5 提供100万 token 的上下文窗口和12.8万 token 的最大输出。在单位 token 价格保持不变而实测速度和得分提升的情况下,此次升级改变了性价比方程——不过该模型较高的 token 消耗量(在其 Arena 数据中可见)仍是决定实际每项任务成本的关键变量。

这对 AI 模型竞赛意味着什么

首先要关注的是误差范围。Sonnet 5.5 的得分带有正负3.09%的误差范围,而前四名模型之间的整体差距甚至小于这一数值。GPT-6 Astra (Max) 仅落后 Sonnet 5.5 0.25个百分点。在差距如此之小的情况下,随着 Arena 汇总更多任务结果,排名可能发生变化,因此当前榜单最好被视为实时快照,而非定局。

token 消耗同样值得关注。更高的 token 使用量可能根据工作负载侵蚀成本优势——一个单位 token 便宜但输出冗长的模型未必在每项任务上都便宜。对于在生产环境中运行智能体的团队而言,得分和每项任务成本这两列数据最终会出现在同一张表格中,这正是为什么任何重塑 Agent Arena 这类榜单顶端的发布都会在这两个维度上被权衡。