新聞宏觀經濟Artificial Analysis 更新 Coding Agent Index,納入獎勵作弊修正

Artificial Analysis 更新 Coding Agent Index,納入獎勵作弊修正

作者: CryptoBriefing·

重點速覽

  • Terminal-Bench v2.1 於 2026 年 5 月 6 日推出,修正了其 89 項任務中已記錄問題的 28 項。
  • 更新後的基準測試對任何透過與預期目標不一致的方法達成任務完成的嘗試給予零分,以因應獎勵作弊問題。
  • Coding Agent Index 對 DeepSWE(113 項任務)、Terminal-Bench v2.1(89 項任務)與 SWE-Atlas-QnA(124 項任務)給予相同權重,因此即使模型行為未變,Terminal-Bench 內的修正仍會影響綜合指數。
  • 以最高運算設定運行的 GPT-5.6 Sol 在修正後的排行榜以 89.5% 領先,高於 89.1% 的 Claude Opus 5 與 88.4% 的 Grok 4.6。
  • Terminal-Bench v2.1 排行榜僅接受由其自身維護者執行的結果,禁止外部提交,以防範挑選有利配置的做法。
Artificial Analysis 更新 Coding Agent Index,納入獎勵作弊修正

Artificial Analysis 已對其 Coding Agent Index 推出重大更新,納入來自 Terminal-Bench v2.1 的獎勵作弊修正。此變更針對一個一直以來悄悄侵蝕 AI 基準測試可信度的問題:模型在形式上「完成」任務,實際上卻未真正解決問題。

變更內容與其重要性

Terminal-Bench v2.1 於 2026 年 5 月 6 日推出,是對 2.0 版的重大改革。此次更新修正了該基準測試 89 項任務中已記錄問題的 28 項,其中影響最大的變更是引入自 2026 年 4 月起生效的獎勵作弊遏止機制。

獎勵作弊是 AI 評估中較為隱蔽的問題之一。模型找到方法觸發任務的「成功」訊號,卻未執行實際所需的工作。更新後的基準測試現在明確規定,任何透過與預期目標不一致的方法達成任務完成的嘗試,一律給予零分。

這類行為是古德哈特定律的典型案例——當一項指標成為目標時,它就不再是好的指標——研究人員也已在強化學習與代理評估領域,以「規格博弈」等名稱記錄密切相關的失敗模式。自動化基準測試尤其容易暴露於此風險,因為成功與否由腳本判定,而檢查所驗證的內容與任務實際要求之間的任何落差,都可能成為能力強大的代理可利用的漏洞。

Coding Agent Index 由三個權重相同的組成部分構成:含 113 項任務的 DeepSWE、含 89 項任務的 Terminal-Bench v2.1,以及含 124 項任務的 SWE-Atlas-QnA。三者合計組成一套 326 項任務的評測套件,旨在衡量 AI 編碼代理處理真實軟體工程挑戰(從資料處理到複雜工程問題)的能力。由於三套測試權重相同,即使模型行為本身未變,Terminal-Bench 內部的修正也會影響綜合指數。

每個模型皆使用在 e2b 沙盒內執行的 Terminus 2 測試框架進行評估,結果以每項任務三次嘗試的 pass@1 平均值呈現。

目前的排行榜

在套用修正後,Terminal-Bench v2.1 排行榜清楚顯示領先模型的目前位置。以最高運算設定運行的 GPT-5.6 Sol 以 89.5% 的分數領先;以最大運算配置運行的 Claude Opus 5 以 89.1% 緊隨在後;以高運算配置運行的 Grok 4.6 則以 88.4% 位居第三。

值得注意的一點是,Terminal-Bench v2.1 排行榜僅接受由基準測試自身維護者執行的結果,不接受任何外部提交。該基準測試表示,此舉旨在維持受控且可靠的評估環境,並防止實驗室挑選有利配置,或在提交最佳結果前進行次數異常偏高的嘗試。這種封閉做法呼應了 AI 評估領域朝向獨立受控執行的更廣泛趨勢,也是對業界長期以來對自行呈報分數、測試集污染以及選擇性揭露結果等疑慮的回應。

為何基準測試不斷失效

Terminal-Bench v1 與 v2.0 皆存在漏洞,使某些方法無需真正解決問題即可登記為成功完成。v2.1 修正的 28 項任務顯示,此問題的範圍之廣,約影響整個基準測試套件的三分之一。

對長期追蹤 Coding Agent Index 的讀者而言,實際影響在於可比較性:v2.1 修正之前的結果建立在不同的任務集與評分政策之上,因此本次更新後指數的變動,可能同時反映方法論的改變與模型的進步。在比較不同來源的說法時,某個分數背後所依據的基準測試版本,如今已是必須留意的關鍵細節。