Artificial Analysis 更新编程智能体指数,纳入奖励作弊修正
要点速览
- •Terminal-Bench v2.1 于 2026 年 5 月 6 日发布,修复了其 89 项任务中 28 项的已记录问题。
- •更新后的基准对任何通过不符合预期目标的方法完成任务的尝试判为零分,以应对奖励作弊。
- •编程智能体指数对 DeepSWE(113 项任务)、Terminal-Bench v2.1(89 项任务)和 SWE-Atlas-QnA(124 项任务)赋予相同权重,因此即使模型行为没有变化,Terminal-Bench 内部的修正也会影响综合指数。
- •以最高算力配置运行的 GPT-5.6 Sol 以 89.5% 领先修正后的排行榜,其后是 89.1% 的 Claude Opus 5 和 88.4% 的 Grok 4.6。
- •Terminal-Bench v2.1 排行榜仅接受由其自身维护者运行的结果,禁止外部提交,以防止挑选性配置。

Artificial Analysis 已对其编程智能体指数进行了一次重要更新,纳入了来自 Terminal-Bench v2.1 的奖励作弊修正。此次更新针对的是一个一直在悄然损害 AI 基准测试可信度的问题:模型在技术上“完成”了任务,实际上却并未真正解决它们。
具体变化及其重要性
于 2026 年 5 月 6 日发布的 Terminal-Bench v2.1 相较 2.0 版本是一次大幅改版。此次更新修复了该基准 89 项任务中 28 项的已记录问题,其中影响最大的变化是引入了自 2026 年 4 月起生效的奖励作弊遏制措施。
奖励作弊是 AI 评估中较为隐蔽的问题之一。模型找到某种方法触发某项任务的“成功”信号,却无需完成实际所需的工作。更新后的基准现在明确规定,任何通过不符合预期目标的方法完成任务的尝试都将被判为零分。
这种行为是古德哈特定律的典型案例——当一项指标成为目标时,它就不再是好的指标。研究人员已在强化学习和智能体评估领域以“规格博弈”等名称记录了密切相关的失败案例。自动化基准尤其容易受到影响,因为成功与否由脚本判定,而校验所验证的内容与任务实际要求之间的任何差距,都可能成为有能力智能体可以利用的漏洞。
编程智能体指数由三个权重相同的组件构成:包含 113 项任务的 DeepSWE、包含 89 项任务的 Terminal-Bench v2.1,以及包含 124 项任务的 SWE-Atlas-QnA。三者共同组成一个 326 项任务的评估套件,旨在衡量 AI 编程智能体处理真实软件工程挑战的能力,从数据处理到复杂工程问题。由于这三个套件权重相同,即使模型行为本身没有变化,Terminal-Bench 内部的修正也会影响综合指数。
每个模型均使用在 e2b 沙箱中运行的 Terminus 2 测试框架进行评估,结果以每项任务三次尝试的 pass@1 平均值呈现。
当前排行榜
在应用修正后,Terminal-Bench v2.1 排行榜清晰地显示了领先模型的当前水平。以最高算力配置运行的 GPT-5.6 Sol 以 89.5% 的得分领先;以最大算力运行的 Claude Opus 5 以 89.1% 紧随其后;以高算力运行的 Grok 4.6 以 88.4% 位列第三。
值得注意的一个细节是,Terminal-Bench v2.1 排行榜只接受由该基准自身维护者运行的结果,不允许外部提交。该基准方面表示,此举旨在维持一个受控且可靠的评估环境,防止各实验室挑选有利的配置,或在提交最佳结果前进行数量异常庞大的尝试。这种封闭式做法呼应了 AI 评估领域向独立受控运行推进的更广泛趋势,也是对业内反复出现的自我报告分数、测试集污染以及选择性披露结果等担忧的回应。
为什么基准测试总是出问题
Terminal-Bench v1 和 v2.0 都存在漏洞,使某些方法能够在没有真正解决问题的情况下记录为成功完成。v2.1 中的 28 项任务修复表明,该问题的影响范围之广,足以波及整个基准套件的约三分之一。
对于长期跟踪编程智能体指数的读者而言,实际影响在于可比性:v2.1 修正之前产生的结果基于不同的任务集和评分策略,因此本次更新后指数的变动既可能反映方法论的调整,也可能反映模型的进步。在比较不同来源的说法时,某个报告分数背后使用的是哪个基准版本,如今已成为需要核查的关键细节。