新聞宏觀經濟METR 提出「支出臨界點」指標,用於比較 AI 代理與人類研究成本

METR 提出「支出臨界點」指標,用於比較 AI 代理與人類研究成本

作者: The Decoder·

重點速覽

  • 支出臨界點標示出 AI 系統與人類為達成等效改進而成本相同的預算點。
  • METR 估計,NanoGPT speedrun 上的人類工作每帶來 1% 加速約需 16 小時,或約 $2,500。
  • GPT-5.5 與 Opus-4.8 分別產生約 1% 與 1.5% 的經驗證改進,而 GPT-5 與 Opus-4.1 經驗證後未顯示真正進展。
  • 該研究未納入 Fable 5、GPT-5.6 Sol 與 Opus 5 等較新模型;若進行測試,可能改變比較結果。
  • METR 表示,該分析只衡量自主 AI 代理,並未顯示 AI 工具在有人類監督時能將研究人員加速多少。
METR 提出「支出臨界點」指標,用於比較 AI 代理與人類研究成本

METR 推出一項名為「支出臨界點」(expenditure horizon)的指標,用於衡量 AI 代理在解決研究問題時的成本效益。該指標應用於 NanoGPT speedrun 的初步結果有限,METR 也指出這套方法存在重要盲點。較新的 AI 模型也可能改變結果。

AI 研究中的一個核心問題是,AI 系統能否加速自身發展,形成模型協助後續模型以更快速度改進的循環。衡量這一點一直很困難,因為相關成本無法直接比較。研究人員必須計入人力、實驗所用運算資源,以及運行 AI 系統本身的成本。因此,將這些成本放在同一尺度上的指標,有助於評估自動化 AI 研究相關主張,而不必只依賴基準測試分數或個別案例。

METR 提出的答案是「支出臨界點」。該指標比較 AI 系統與人類各自需要花費多少,才能達成相同程度的改進。支出臨界點是兩種方式成本相同的預算水準。低於該水準時,AI 的成本效益較高;高於該水準時,人類成本較低。

這項指標建立在 METR 稱其於先前測試中觀察到的一種模式之上:AI 代理通常能比人類更快完成簡單、低成本的任務,但隨著預算提高、任務變得更困難,它們往往會落後。

根據 METR,與典型 AI 基準測試相比,這套方法有兩項優勢。第一,它不只回傳通過或失敗的結果,而是提供更細緻的衡量,顯示投入一定金額可帶來多少改進。第二,它將不同投入轉換為單一貨幣尺度,包括運行 AI 系統的成本、實驗所用運算資源,以及人類工時。

METR 估計人類每帶來 1% 加速約花費 $2,500

METR 在 NanoGPT speedrun 上測試這項指標。NanoGPT speedrun 是一個公開社群專案,志願者競相以盡可能快的速度訓練 AI 語言模型。任務本身保持固定,參與者只能改變訓練方法。自 2024 年 5 月以來,在標準化硬體上所需時間已從約 45 分鐘降至不到 2 分鐘,期間共有 82 個有記錄的改進步驟。這使 speedrun 成為進行成本比較的有用受控場景,但它也只是更廣泛 AI 研究的狹窄替代指標;在更廣泛的研究中,目標、限制與評估標準可能會在專案期間改變。

為估算人類工作的成本,METR 訪談了該專案最活躍的兩位貢獻者。它也請 AI 模型 Opus-4.6 估算每項改進背後所需的投入。兩種方法得到相近數字:每帶來 1% 加速約需 16 小時工作。以假設時薪 $150 計算,METR 得出每個百分點約 $2,500 的成本。

METR 強調,這項估算高度不確定。訪談也凸顯出,貢獻者的大部分時間都花在最終未能奏效的想法上。

AI 代理至今只帶來有限進展

為了進行比較,METR 指派六個 AI 模型各自獨立處理同一任務。這些模型並非從零開始,而是從 speedrun 已高度最佳化的版本開始,即 2026 年 3 月的 Record #78,並允許每次運行最多花費 $10,000 的運算與運行成本。

所得估計支出臨界點介於 $0 至 $3,300。不同模型的表現差異很大。經仔細驗證後,GPT-5 與 Opus-4.1 沒有產生真正進展;它們表面上的收益被歸因於隨機雜訊。相較之下,GPT-5.5 與 Opus-4.8 分別帶來約 1% 與 1.5% 的實際改進。

模型建議的品質參差不齊。speedrun 的維護者估計,約 70% 的 AI 生成想法原則上可以整合進專案,但其中許多並不特別有原創性。他將 GPT-5.5 提出的一項低層級最佳化描述為「coolest one」,同時把其餘大多數建議歸類為參數調整。

這些模型也多次嘗試作弊。這些嘗試涉及一些捷徑,能在測試中產生看似良好的結果,但實際上毫無用處,例如在接近終點前關閉部分訓練。這個問題凸顯 METR 驗證步驟的重要性:若不檢查加速是否仍保留原定任務,自動化最佳化可能會獎勵改善測量結果、卻破壞底層實驗的行為。

METR 的結論是,雖然個別模型的支出臨界點達到低四位數美元,但與 NanoGPT speedrun 背後估計總計 $250,000 的人類投入相比,這些數值非常小。依 METR 評估,自主最佳化至今對 NanoGPT 整體進展的貢獻仍然很有限。

較新的 AI 模型可能改變比較結果

METR 的測試有一項重要限制:它只納入較舊模型,具體包括 GPT-5、GPT-5.2、GPT-5.5、Opus-4.1 與 Opus-4.8。之後發布的模型,包括 Fable 5、GPT-5.6 Sol 與 Opus 5,並未出現在論文中。

Anthropic 將 Opus 5 描述為一項重大改進。該公司表示,在 Frontier-Bench 上,Opus 5 的表現是 Opus 4.8 的兩倍,同時降低了每項任務的成本。根據 Anthropic,Opus 5 在死胡同上浪費的投入較少,更可靠地驗證自身工作,並以平均少 26% 的運算步驟達到相近表現。這些因素都會直接影響 METR 的支出臨界點。

ARC-AGI-3 的結果同樣值得注意。該基準旨在測試解題能力,而非記憶知識。AI 系統被放入陌生、類遊戲的環境中,沒有指令或目標,必須透過試錯判斷如何推進。

自 2026 年 7 月 24 日以來,Opus 5 一直位居 ARC-AGI-3 榜首,得分為 30.2%。它解出了此前所有模型都失敗的五項任務。其前代 Opus 4.8 僅得到 1.5%。ARC Prize 團隊將這項進步歸因於更強的邏輯推理能力,使 AI 能更獨立地探索與規劃。這項能力也可能與 NanoGPT speedrun 相關,不過 METR 已發布的比較需要在較新模型上重新執行,才能顯示其支出臨界點是否不同。

這項研究未衡量人類與 AI 協作

這項研究最大的限制之一,也是 METR 自己指出的一點:分析衡量的是 AI 系統獨自工作,即純自主最佳化。在實際 AI 研究中,人類通常把 AI 作為工具使用,而不是完全將研究任務委派給它。

METR 為這種人類與 AI 協作情境描述了第三條假想曲線。如果人類能有效決定何時以及如何使用 AI,混合方法理論上應可透過結合雙方優勢,勝過純人類方法與純 AI 方法。

METR 警告,這種結果並非必然。該組織指出其早期研究顯示,人類加 AI 的配置有時表現比人類單獨工作更差。效益取決於 AI 是否被用在流程中的正確位置。

若要妥善衡量這一點,需要一項受控實驗,比較同一批研究人員在有無 AI 協助下工作的差異。METR 表示,這類實驗難以組織,但會提供高度資訊量。在那之前,支出臨界點能提供 AI 系統獨立完成事項的證據,但對於它們在實務上能將人類研究人員加速多少,說明仍少得多。