新聞宏觀經濟MIT 與 Sakana AI 的 SIFT 框架降低自我改進編碼代理的評判成本

MIT 與 Sakana AI 的 SIFT 框架降低自我改進編碼代理的評判成本

作者: CryptoBriefing·

重點速覽

  • •SIFT 僅以 30 個擴展步驟便在 Polyglot 編碼基準測試取得 35.1%,超越需要 80 節點搜尋的 Darwin Gödel Machine 的 30.7%。
  • •該框架以大型語言模型裁判取代對每個提出的修改進行完整基準測試,其成對偏好再透過正則化 Bradley-Terry 模型轉換為排名。
  • •基於阿里巴巴開放權重模型 Qwen3-Coder-30B 的配置,以 224 個 CPU 小時、約 34 美元的 API 成本完成整個搜尋,約為 DGM 所耗資源的十分之一。
  • •SIFT 也將 TerminalBench 2.1 的效能從 29.2% 提升至 36.7%,並將 S-60 的成績從 40.0% 提升至 52.1%。
  • •此方法的有效性取決於語言模型裁判的準確性,研究人員指出,隨著搜尋規模擴大,這是核心的開放問題。
MIT 與 Sakana AI 的 SIFT 框架降低自我改進編碼代理的評判成本

能夠改寫自身原始碼的編碼代理,存在一項與生成修改本身幾乎無關的隱藏成本:每次自我修改都必須經過驗證,才能知道是否真正帶來改善。MIT 與 Sakana AI 的研究人員認為,他們找到了一種成本大幅降低的驗證方式。

他們的框架 SIFT(Self-Improvement via Fast Tree-search 的縮寫)僅經過 30 個擴展步驟,便在 Polyglot 編碼基準測試中取得 35.1% 的成績。這個名稱相當直白:樹狀搜尋會生長出一個由候選修改構成的分支結構,每個擴展步驟都會新增一個待探索的節點。比較基準同樣重要:較早的 Darwin Gödel Machine(DGM)需要 80 個節點的搜尋,才能在同一基準上達到 30.7%。

不跑完整基準也能評判候選方案

遞迴自我改進的編碼代理的運作方式,很像作家反覆修改自己的草稿。代理會對自身程式碼提出修改,期望新版本能在真實任務上有更好的表現。難點在於驗證:將每個提出的修補程式對照完整基準測試,會消耗大量運算資源,而當代理生成大量候選方案時,帳單更會迅速累積。

SIFT 透過引入一位「裁判」來避開大部分成本。框架不對每個修改進行基準測試,而是請大型語言模型比較兩個候選修改,判斷哪一個看起來更好。這些一對一的評判結果,再透過正則化 Bradley-Terry 模型彙整——這是一種將成對偏好轉換為整體排名的統計方法。

框架也以非同步方式執行評估,候選方案不必排成一列等待上測試台。結果是一條混合式管線:由語言模型以低成本篩選候選,只有入圍的修改才進入昂貴的下游評估。

效率主張背後的數字

核心結果來自一個 o3-mini 編碼代理。在 Polyglot 上,SIFT 以 30 個擴展步驟達到 35.1% 的成績,小勝 DGM 經過遠為漫長的 80 節點搜尋才取得的 30.7%。

在開放權重模型上,成本故事更加突出。一個基於 Qwen3-Coder-30B(阿里巴巴 Qwen 家族的開放權重版本)的配置,以 224 個 CPU 小時、約 34 美元的 API 成本完成整個搜尋——約為 DGM 所耗資源的十分之一。

SIFT 在其他基準測試上也有斬獲。在 TerminalBench 2.1 上,效能從 29.2% 提升至 36.7%,改善 7.5 個點。在 S-60 上的躍升更大:分數從 40.0% 升至 52.1%,較起始基準提升 12.1 個百分點。

誰打造了它,以及它的定位

這篇論文由 MIT 的 Xinghong Fu 撰寫,共同作者包括 Aravinth Kulanthaivelu 與 Yutaro Yamada,Sakana AI 為合作實驗室。論文於 2026 年 9 月 18 日左右發表在 arXiv——研究通常在正式同行評審前先行公開的開放取用預印本平台——相關討論於 2026 年 9 月下旬開始在各個平台傳播。大部分討論集中在兩個主題:成本節省,以及語言模型裁判的品質日益重要。

這個方法與 Sakana AI 更宏觀的理念高度契合。這家位於東京的實驗室由前 Google 研究人員(包括 Transformer 論文共同作者 Llion Jones)於 2023 年創立,在 AI 開發上一直強調演化式探索方法勝過暴力策略,SIFT 正是「用更聰明的方式工作,而非投入更多硬體」的典型案例。它也直接承襲 Darwin Gödel Machine 的血統:DGM 證明了代理可以透過迭代搜尋自我改進,而 SIFT 則針對使那種搜尋如此昂貴的評估瓶頸。

這對開發者與自我改進競賽意味著什麼

最直接的影響是可及性。如果一次完整的自我改進搜尋只需約 34 美元的 API 成本,這個領域可能不再只屬於擁有龐大運算預算的實驗室。

有一點需要注意。SIFT 的整套前提建立在語言模型裁判能做出正確判斷之上,這也是為什麼裁判品質成為論文討論中的核心話題。一個持續偏好錯誤修補的裁判,會把搜尋帶往錯誤的方向——只是更便宜而已。隨著搜尋規模擴大,這種判斷能否保持可靠,是後續研究值得關注的開放問題。

來源:CryptoBriefing