Meta、杜克大學與加州大學戴維斯分校研究人員發表自我改進分支方法,用於代理框架最佳化
重點速覽
- •該方法在 Gemini 3 Flash 上的奧林匹亞級數學推理取得 34.8% 的相對改進,將準確率從 46.0% 提升至 62.0%,且未重新訓練底層模型。
- •該方法將 harness 最佳化劃分為多個自我改進的分支,每個分支使用不同的開發資料子集及各自提出變更的策略,並由路由器在部署時為每個輸入選擇最強的分支。
- •效能提升不僅限於數學,還延伸至代理式任務,包括在 Terminal-Bench 2.0 上提升 11.6%,在 SWE-bench Lite 上提升 3.8%。
- •這篇於 2026 年 9 月 29 日以 arXiv:2609.37834v1 發布的論文,直接建立在 2026 年 3 月 30 日發布、此前已超越傳統最佳化方法的 Meta-Harness 之上。
- •據作者所述,這些成果僅使用開發集資料達成,未存取測試集,但該預印本尚未通過正式的同儕審查。

Meta、杜克大學與加州大學戴維斯分校(University of California, Davis)的研究人員提出一種讓 AI 代理變得更好的新方法:不動底層模型,而是改進圍繞它的支架,使用多個自我改進的團隊,而非單一團隊。
在題為「Mixture of Self-Improving Branches for Agent Harness Optimization」的預印本中,研究人員報告在奧林匹亞級數學推理上取得 34.8% 的相對改進,使用 Gemini 3 Flash 模型將準確率從 46.0% 提升至 62.0%——全程未重新訓練模型本身。
什麼是 Harness,為何重要
更具體地說,代理 harness 是圍繞大型語言模型的程式碼框架。它決定模型接收的提示、可以呼叫的工具、能看到上下文內容,以及其行動如何被執行。
由於這層支架是程式碼而非模型權重,因此無需重新執行訓練即可修改——這正是這一系列研究所運用的槓桿。Harness 最佳化是指自動搜尋該封裝更好版本的實踐。這篇於 2026 年 9 月 29 日以 arXiv:2609.37834v1 發表的新論文,直接建立在一個名為 Meta-Harness 的早期系統之上。
分支方法的運作方式
Meta-Harness 於 2026 年 3 月 30 日發布,此前已在多項基準測試中超越傳統方法。這項新研究認為,單一搜尋路徑會讓效能有所保留。
因此,研究人員將搜尋拆分為多個專門化的分支。每個分支獨立演進,使用不同的開發資料子集,並套用各自提出變更的策略。
這些分支也會從自身的歷史中學習。每個分支會保留它勝過其他兄弟分支的案例,並根據較早嘗試的表現來改進自身策略。
這引出一個顯而易見的問題:誰來挑選專家?答案是路由器。在部署時,路由器會為每個輸入選擇最佳的分支頭。
整個過程僅在開發集資料上執行。據作者所述,這些互補的 harness 在未存取測試集的情況下取得了上述成果。
基準測試數據
最亮眼的結果出現在奧林匹亞級數學推理上。使用 Gemini 3 Flash 時,準確率從 46.0% 攀升至 62.0%,作者將此形容為 34.8% 的相對改進。
這些成果也至代理式任務。在測試代理於命令列環境中工作的 Terminal-Bench 2.0 上,系統取得 11.6% 的提升。軟體工程基準 SWE-bench Lite 則顯示 3.8% 的增加。
綜合來看,這三項評估涵蓋數學推理、命令列代理工作與軟體工程,因此報告的成果並不侷限於單一任務類型。
研究團隊
作者名單包括隸屬 Meta 與杜克大學的 Haoyu Dong,以及隸屬 Meta 與加州大學戴維斯分校的 Zihao Lin。Lizhu Zhang 與 Zhuokai Zhao 列為共同末位作者。
這篇論文是發布在 arXiv 上的預印本,這代表它已公開分享,但不一定已通過正式的同儕審查。
這代表什麼
在困難的數學題上,從 46.0% 躍升至 62.0%,且完全未更動模型權重,這顯示透過工程手段改造模型所處的環境,可以帶來實質的改進。對於在大型語言模型之上構建應用的團隊而言,這將 harness 本身定位為可最佳化的產物——它能與模型發布同步演進,而不必等待模型更新。
仍有值得關注的未解問題。執行與維護多個演進中的分支加上路由器,可能會增加複雜性,而且論文的結果來自特定的基準測試與特定模型。這種方法能否通過同儕審查、在獨立測試中站得住腳,以及能否推廣到 Gemini 3 Flash 之外的模型,都是值得追蹤的自然檢核點。
Meta-Harness 於 2026 年 3 月問世,當時已超越傳統方法。約六個月後,其後繼者宣稱超越了 Meta-Harness 本身。