Meta、Duke大学、UC Davisの研究チーム、エージェントハーネス最適化向けに自己改善型ブランチ手法を発表
重要ポイント
- •この手法はGemini 3 Flashでオリンピックレベルの数学推論において34.8%の相対的改善を達成し、基盤モデルを再訓練することなく精度を46.0%から62.0%へ引き上げました。
- •このアプローチはハーネス最適化を複数の自己改善ブランチに分割し、各ブランチが開発データの異なるサブセットと独自の変更提案方針を使用し、デプロイ時にルーターが入力ごとに最強のブランチを選択します。
- •性能向上は数学にとどまらずエージェント型タスクにも及び、Terminal-Bench 2.0で11.6%の改善、SWE-bench Liteで3.8%の増加を記しました。
- •2026年9月29日にarXiv:2609.37834v1として投稿された本論文は、2026年3月30日にリリースされ、すでに従来の最適化手法を上回っていた先行システムMeta-Harnessを直接ベースにしています。
- •著者らによれば、向上は開発セットのデータのみを使用して達成され、テストセットには一切アクセスしていませんが、このプレプリントはまだ正式な査読を経ていません。

Meta、Duke大学、カリフォルニア大学デービス校の研究者らが、AIエージェントを向上させる新しいアプローチを提案しました。基盤モデルには手を加えず、その周囲のスキャフォールディングを改善するというもので、単一のチームではなく複数の自己改善チームを活用します。
「Mixture of Self-Improving Branches for Agent Harness Optimization」と題されたプレプリントで、研究者らはオリンピックレベルの数学推論において34.8%の相対的改善を報告しています。Gemini 3 Flashモデルを使用して精度を46.0%から62.0%へ引き上げました。すべてモデル自体を再訓練することなく実現しています。
ハーネスとは何か、なぜ重要なのか
より正確には、エージェントハーネスとは大規模言語モデルを包むコードフレームワークです。モデルが受け取るプロンプト、呼び出せるツール、目にするコンテキスト、そしてアクションの実行方法を管理します。
そのスキャフォールディングはモデルの重みではなくコードであるため、新たな訓練なしで修正可能です。これがこの研究のアプローチの核となるレバーです。ハーネス最適化とは、そのラッパーのより良いバージョンを自動的に探索する手法です。2026年9月29日にarXiv:2609.37834v1として公開された新しい論文は、Meta-Harnessと呼ばれる先行システムを直接ベースにしています。
ブランチングアプローチの仕組み
2026年3月30日にリリースされたMeta-Harnessは、従来の手法を様々なベンチマークで上回っていました。新しい研究は、単一の探索経路では性能を余すところなく引き出せないと主張しています。
そこで研究者らは探索を複数の専門化されたブランチに分割しました。各ブランチはそれぞれ独自に進化し、開発データの異なるサブセットを使用し、変更提案のための独自の方針を適用します。
ブランチは履歴からも学習します。各ブランチは兄弟ブランチに勝ったケースを保持し、過の試みの結果に基づいて戦略を改良します。
ここで当然の疑問が生じます。専門家を選ぶのは誰か。答えはルーターです。デプロイ時、ルーターは入力ごとに最適なブランチヘッドを選択します。
プロセス全体は開発セットのデータのみで実行されます。著者らによれば、これらの相補的なハーネスはテストセットに一切アクセスすることなくその向上を達成しました。
ベンチマークの数値
最も注目すべき結果はオリンピックレベルの数学推論でした。Gemini 3 Flashを使用して精度が46.0%から62.0%に上昇し、著者らはこれを34.8%の相対的改善として提示しています。
その向上はエージェント型タスクにも及びました。コマンドライン環境で動作するエージェントをテストするTerminal-Bench 2.0では11.6%の向上を達成しました。ソフトウェア工学ベンチマークのSWE-bench Liteでは3.8%の増加を示しました。
これら3つの評価は数学推論、コマンドライン型エージェント作業、ソフトウェア工学を網羅しており、報告された向上は単一のタスク種別に限定されません。
研究チームについて
著者リストには、MetaおよびDuke大学に所属するHaoyu Dong氏、MetaおよびUC Davisに所属するZihao Lin氏が含まれます。Lizhu Zhang氏とZhuokai Zhao氏が共同最終著者として記載されています。
本論文はarXivに投稿されたプレプリントであり、公に公開されていますが、正式な査読を必ずしも経ていない点に注意が必要です。
この研究が意味するもの
モデルの重みに触れることなく困難な数学問題で46.0%から62.0%への跳躍を達成したことは、モデルが動作する環境を設計することで意味のある改善が得られることを示唆しています。大規模言語モデルの上に構築するチームにとって、ハーネス自体が最適化可能な対象であり、モデルのリリースを待つのではなく並行して進められるものとして位置づけられます。
注目すべき未解決の問いもあります。進化する複数のブランチとルーターを実行・維持することは複雑さを増す可能性があり、論文の結果は特定のベンチマークと特定のモデルに基づいています。このアプローチが査読を通過するか、独立したテストで再現されるか、Gemini 3 Flashを超えて拡張できるかが、追跡すべき自然な確認ポイントとなります。
Meta-Harnessは2026年3月に登場し、すでに従来の手法を上回っていました。その約6か月後、その後継システムがMeta-Harness自体を上回ると主張しています。