Harness-Zero:谷歌研究人员展示如何将 AI Agent 框架蒸馏进模型权重
要点速览
- •Harness-Zero 将优化后的 Agent 框架所诱导的行为蒸馏到模型权重中,因此在部署时专用框架被最小化固定框架取代后,性能增益依然得以保留。
- •在 agent-as-harness 方法中,一个由优化框架引导的独立框架代理会在目标框架的原生动作空间中审查并纠正学员代理的每个响应,纠正后的运行作为训练示范。
- •在前沿模型的无训练评估中,agent-as-harness 方法优于传统的 code-as-harness 方法,在所测试的基准和模型设置中平均为 81.1% 对 78.1%。
- •蒸馏后,一个 90 亿参数基础模型在移除专用框架后的宏平均任务成功率从 23.3% 提升至 44.3%,超过了同一模型在框架在位时的 41.7%,且蒸馏模型平均恢复了 28 种框架诱导行为模式中的 82.3%。
- •作者指出若干局限:框架代理必须足够强大,因为较弱的模型会产生净有害的干预;审查过程提高了轨迹采集成本;深层编码的领域知识可能难以仅通过微调来内化。

北京大学、谷歌和香港科技大学的研究人员提出了一种名为 Harness-Zero 的方法,可将专用 AI Agent 框架的性能增益迁移到模型本身,使这些增益不再依赖外部脚手架。这项工作解决了当代 Agent 工程中的一个核心矛盾:Agent 的能力究竟应该有多少保留在模型权重中,又有多少存在于围绕它的脚手架里。
Agent 框架是管理语言模型如何与环境交互的外部系统——统筹工具使用、管理上下文与状态,并控制交互循环。框架工程已被证明是提升 Agent 性能的有力杠杆,但它带来的提升依赖于部署时该特定框架的存在。由于最优框架因领域、具体任务和基础模型而异,通用 Agent 面临一个艰难的权衡:要么采用单一共享框架并放弃专用优势,要么维护一个不断增长的专用框架集合,并承担路由、上下文和编排方面的成本。
Harness-Zero 提出了第三条路径:框架蒸馏。优化后的框架仅作为训练阶段的指导,它诱导出的行为被迁移到模型权重中,因此在部署时移除专用框架、改用最小化的固定框架后,这些增益依然得以保留。
Agent-as-Harness:在不同动作空间之间转换指导
核心难点在于,优化框架与目标框架在动作空间和可用信息上均存在差异,这意味着来自优化框架的指导无法直接用作训练监督。Harness-Zero 通过 agent-as-harness 方法解决这一问题:一个独立的框架代理在优化框架的引导下,审查学员代理提出的每个响应,并在必要时对其进行纠正,使纠正以目标框架的原生动作空间表达后再执行。
这些经过纠正的运行随后成为训练示范。对所得轨迹进行微调,可将框架诱导的行为直接内化到模型权重中,而在部署时,专用框架、参考框架和框架代理均被弃用。
研究人员在三个领域对该方法进行了评估——基于电子表格的知识工作(SpreadsheetBench Verified)、多应用工具使用(AppWorld)以及科学推理(USPTO Retrosynthesis)。在前沿模型的无训练评估(即不涉及微调)中,agent-as-harness 方法优于传统的 code-as-harness 方法,在所测试的基准和模型设置中平均为 81.1% 对 78.1%。
在蒸馏方面,一个 90 亿参数的基础模型——以当前标准来看规模相对紧凑——在移除专用框架后,宏平均任务成功率从 23.3% 提升至 44.3%,超过了同一基础模型在框架在位时取得的 41.7%。行为分析进一步发现,蒸馏模型平均恢复了基础模型原本不具备的 28 种框架诱导行为模式中的 82.3%,这表明蒸馏模型吸收的是框架的工作方式,而不仅仅是它的性能表现。
作者指出了若干局限。该方法需要一个能力足够强的模型来充当框架代理,因为较弱的模型会产生净有害的干预,而审查过程也提高了轨迹采集的成本。框架中编码的深层领域知识也可能难以仅通过微调来内化。
尽管如此,这些结果表明,框架开发有望成为可扩展的训练信号来源——更好的模型构建更好的框架,而每个框架又将其增益回馈给模型本身,而不是将这些增益锁在周围的脚手架中鉴于作者指出的种种限制,这一循环能延伸多远,将决定框架增益是继续留在脚手架中——还是开始落入模型权重本身。