Harness-Zero:Google研究者、AIエージェントハーネスをモデルの重みに蒸留する手法を実証
重要ポイント
- •Harness-Zeroは、最適化されたエージェントハーネスが誘発する振る舞いをモデルの重みに蒸留することで、デプロイ時に専門ハーネスを最小限の固定ハーネスに置き換えた後も性能向上が持続するようにする。
- •agent-as-harnessアプローチでは、最適化ハーネスに導かれた別個のハーネシングエージェントが、学生エージェントの各応答をターゲットハーネスのネイティブなアクション空間で確認・修正し、修正済みの実行結果が学習デモンストレーションとなる。
- •ファインチューニングを伴わないフロンティモデルでの評価では、agent-as-harnessアプローチが従来のcode-as-harness手法を上回り、テストされたベンチマークとモデル設定全体で平均81.1%対78.1%となった。
- •蒸留後、90億パラメータのベースモデルのマクロ平均タスク成功率は専門ハーネス除去後23.3%から44.3%に上昇し、ハーネス接続時の41.7%を上回った。また、蒸留モデルは28のハーネス誘発行動パターンのうち平均82.3%を回復した。
- •著者らは限界を指摘している。ハーネシングエージェントには十分な能力が必要である(弱いモデルは純粋に有害な介入を生む)、レビュープロセスは軌跡収集コストを増大させる、そして深くエンコードされたドメイン知識はファインチューニングだけでは内在化が難しい場合がある。

北京大学、Google、香港科技大学の研究チームは、専門特化したAIエージェントハーネスの性能向上をモデル自体に転移させ、外部スキャフォールディングへの依存を解消する手法「Harness-Zero」を発表した。この研究は、現代のエージェントエンジニアリングの核心にある課題、すなわちエージェントの能力のどの部分をモデルの重みに置き、どの部分をそれを包むスキャフォールディングに置くべきかという緊張関係に取り組むものである。
エージェントハーネスとは、言語モデルが環境とどのようにやり取りするかを制御する外部システムのことである。ツール利用のオーケストレーション、コンテキストと状態の管理、インタラクションループの制御を担う。ハーネスエンジニアリングはエージェント性能を向上させる強力な lever であることが証明されているが、その効果はデプロイ時に当該ハーネスが存在することに依存する。最適なハーネスはドメイン、個々のタスク、ベースモデルによって異なるため、汎用エージェントは難しいトレードオフに直面する。単一の共用ハーネスを採用して専門的な利点を放棄するか、あるいは専門特化したハーネスのコレクションを増やし続け、ルーティング、コンテキスト、オーケストレーションのコストが膨らむかである。
Harness-Zeroは第三の道、すなわちハーネス蒸留を提案する。最適化されたハーネスは学習時のガイダンスとしてのみ使用され、そこで誘発される振る舞いがモデルの重みに転移される。そのため、専門ハーネスを取り除き、デプロイ時に最小限の固定ハーネスを使用しても、性能向上は持続する。
Agent-as-Harness:異なるアクション空間へのガイダンスの翻訳
核心的な難しさは、最適化されたハーネスとターゲットハーネスがアクション空間と利用可能な情報の両面で異なるため、最適化ハーネスからのガイダンスをその学習の教師信号として使用できないことである。Harness-Zeroはagent-as-harnessアプローチでこれに対応する。最適化ハーネスに導かれた別個のハーネシングエージェントが、学生エージェントの提案する各応答を確認し、必要に応じて実行前にターゲットハーネスのネイティブなアクション空間で表現されるよう修正を行う。
修正済みの実行結果が学習デモンストレーションとなる。得られた軌跡でのファインチューニングにより、ハーネスが誘発する振る舞いがモデルの重みに内在化され、デプロイ時には専門ハーネス、参照ハーネス、ハーネシングエージェントのすべてが廃棄される。
研究者らは、スプレッドシートベースのナレッジワーク(SpreadsheetBench Verified)、複数アプリケーションのツール利用(AppWorld)、科学推論(USPTO Retrosynthesis)の3つのドメインでこの手法を評価した。ファインチューニングを伴わないフロンティアモデルでの評価では、agent-as-harnessアプローチが従来のcode-as-harness手法を上回り、テストされたベンチマークとモデル設定全体で平均81.1%対78.1%となった。
蒸留においては、現在の基準では比較的コンパクトな90億パラメータのベースモデルのマクロ平均タスク成功率が、専門ハーネス除去後には23.3%から44.3%に上昇し、ハーネス接続時の同じベースモデルの41.7%を上回った。行動分析ではさらに、蒸留モデルがベースモデルには存在しなかった28のハーネス誘発行動パターンのうち平均82.3%を回復したことが判明した。これは、蒸留モデルがハーネスの性能水準だけでなく、ハーネスの動作そのものを吸収したことを示している。
著者らはいくつかの限界を指摘している。このアプローチでは、ハーネシングエージェントとして十分に能力の高いモデルが必要である。弱いモデルでは純粋に有害な介入が生じるためである。また、レビュープロセスは軌跡収集のコストを増大させる。ハーネスにエンコードされた深いドメイン知識は、ファインチューニングだけでは内在化が難しい場合もある。
それでもなお、この結果はハーネス開発がスケーラブルな学習信号の供給源になり得ることを示唆している。より優れたモデルがより優れたハーネスを構築し、各ハーネスがその利得を周囲のスキャフォールディングに閉じ込めるのではなくモデル自体に還元する。著者らが指摘する制約の下で、そのループがどこまで拡張できるかは、ハーネスの利得がスキャフォールディングに留まり続けるか、それとも重みそのものに移り始めるかを形作る未解決の問いである。