Meta、杜克大学与加州大学戴维斯分校研究人员发布面向智能体Harness优化的自我改进分支方法
要点速览
- •该方法在使用Gemini 3 Flash的情况下,在奥赛级数学推理上取得了34.8%的相对提升,将准确率从46.0%提高到62.0%,且无需重新训练底层模型。
- •该方法将Harness优化划分为多个自我改进分支,每个分支使用不同的开发数据子集和各自的变更提出策略,部署时由路由器为每个输入选择最强分支。
- •性能提升不仅限于数学,还延伸到智能体任务,包括在Terminal-Bench 2.0上提升11.6%,在SWE-bench Lite上提升3.8%。
- •论文于2026年9月29日以arXiv:2609.37834v1发布,直接建立在2026年3月30日发布的早期系统Meta-Harness之上,后者此前已超越传统优化方法。
- •据作者称,这些收益仅使用开发集数据实现,未接触测试集,但该预印本尚未通过正式的同行评审。

Meta、杜克大学和加州大学戴维斯分校的研究人员提出了一种让AI智能体变得更强的新方法:不改动底层模型,而是改进模型周围的脚手架,用多个自我改进的团队取代单一团队。
在一篇题为《Mixture of Self-Improving Branches for Agent Harness Optimization》的预印本论文中,研究人员报告了在奥赛级数学推理上34.8%的相对提升,使用Gemini 3 Flash模型将准确率从46.0%提高到62.0%——而这一切都无需重新训练模型本身。
什么是Harness,为什么它很重要
更正式地说,智能体Harness是包裹在大语言模型外部的代码框架。它决定了模型接收的提示词、可以调用的工具、能够看到的上下文,以及其动作的执行方式。
由于这层脚手架是代码而非模型权重,因此无需重新训练即可修改——这正是这项工作所利用的杠杆。Harness优化就是自动搜索该包装层更优版本的实践。这篇新论文于2026年9月29日以arXiv:2609.37834v1发布,直接建立在一个名为Meta-Harness的早期系统之上。
分支方法如何运作
Meta-Harness于2026年3月30日发布,此前已在多个基准测试中超越传统方法。这项新工作认为,单一搜索路径会浪费潜在的性能。
因此,研究人员将搜索拆分为多个专门化的分支。每个分支独立演化,使用各自不同的开发数据子集,并采用各自提出变更的策略。
各分支还会从自身历史中学习。每个分支会保留它胜过其他分支的案例,并根据早期尝试的表现来改进其策略。
由此引出一个显而易见的问题:谁来挑选专家?答案是一个路由器。在部署时,路由器为每个输入选择最佳的分支头。
整个过程仅在开发集数据上运行。据作者报告,这些互补的Harness在完全未接触测试集的情况下实现了上述收益。
基准测试结果
最亮眼的结果出现在奥赛级数学推理上。使用Gemini 3 Flash,准确率从46.0%攀升至62.0%,作者将其表述为34.8%的相对提升。
性能提升也延伸到了智能体任务。在测试智能体于命令行环境中工作的Terminal-Bench 2.0上,该系统取得了11.6%的提升。在软件工程基准SWE-bench Lite上则显示出3.8%的增长。
这三项评估共同覆盖了数学推理、命令行智能体任务和软件工程,因此所报告的性能提升并不局限于单一任务类型。
研究背后的团队
作者名单包括隶属于Meta和杜克大学的Haoyu Dong,以及隶属于Meta加州大学戴维斯分校的Zihao Lin。Lizhu Zhang和Zhuokai Zhao被列为共同末位作者。
该论文是一篇发布在arXiv上的预印本,这意味着它已公开分享,但不一定通过了正式的同行评审。
这意味着什么
在不触碰模型权重的情况下,在困难数学题上将准确率从46.0%跃升至62.0%,这表明有意义的改进可以来自对模型运行环境的工程设计。对于在大语言模型之上构建产品的团队而言,这把Harness本身定位为一个可优化的对象——它可以与模型发布同步推进,而不必等待模型更新。
还有一些值得关注的开放性问题。运行和维护多个不断演化的分支以及一个路由器可能会增加复杂性,而且论文的结果来自特定基准和特定模型。该方法能否通过同行评审、能否在独立测试中站住脚、能否推广到Gemini 3 Flash之外,都是需要跟踪的自然检查点。
Meta-Harness于2026年3月问世时就已经超越了传统方法。大约六个月后,其继任者宣称要击败Meta-Harness本身。