Meta, Duke et UC Davis présentent une méthode de branches auto-améliorées pour l'optimisation des harness d'agents IA
Points clés
- •La méthode a apporté une amélioration relative de 34,8 % en raisonnement mathématique de niveau olympiade avec Gemini 3 Flash, portant la précision de 46,0 % à 62,0 % sans réentraîner le modèle sous-jacent.
- •L'approche divise l'optimisation du harness en plusieurs branches auto-améliorées, chacune utilisant un sous-ensemble distinct de données de développement et sa propre politique pour proposer des modifications, un routeur sélectionnant la branche la plus performante pour chaque entrée au déploiement.
- •Les gains de performance se sont étendus au-delà des mathématiques aux tâches agentiques, avec une amélioration de 11,6 % sur Terminal-Bench 2.0 et une augmentation de 3,8 % sur SWE-bench Lite.
- •L'article, publié sous la référence ariv:2609.37834v1 le 29 septembre 2026, s'appuie directement sur Meta-Harness, un système antérieur sorti le 30 mars 2026 qui avait déjà surpassé les méthodes d'optimisation traditionnelles.
- •Selon les auteurs, les gains ont été obtenus en utilisant uniquement les données du jeu de développement, sans accès au jeu de test, mais la prépublication n'a pas encore franchi l'étape de l'évaluation formelle par les pairs.

Des chercheurs de Meta, de l'Université Duke et de l'Université de Californie à Davis ont proposé une nouvelle approche pour améliorer les agents IA : laisser le modèle sous-jacent intact et améliorer l'échafaudage qui l'entoure, en utilisant plusieurs équipes auto-améliorées plutôt qu'une seule.
Dans une prépublication intitulée « Mixture of Self-Improving Branches for Agent Harness Optimization », les chercheurs font état d'une amélioration relative de 34,8 % en raisonnement mathématique de niveau olympiade, faisant passer la précision de 46,0 % à 62,0 % avec le modèle Gemini 3 Flash — le tout sans réentraîner le modèle lui-même.
Qu'est-ce qu'un harness, et pourquoi c'est important
Plus formellement, un harness d'agent est le cadre logiciel enveloppant un grand modèle de langage. Il régit les invites que le modèle reçoit, les outils qu'il peut appeler, le contexte auquel il a accès et la manière dont ses actions sont exécutées.
Comme cet échafaudage est du code plutôt que des poids de modèle, il peut être modifié sans nouvelle campagne d'entraînement — c'est le levier sur lequel repose ce travail. L'optimisation de harness est la pratique consistant à rechercher automatiquement une meilleure version de cet enveloppement. Le nouvel article, publié le 29 septembre 2026 sous la référence arXiv:2609.37834v1, s'appuie directement sur un système antérieur nommé Meta-Harness.
Fonctionnement de l'approche par branches
Meta-Harness, publié le 30 mars 2026, avait auparavant surpassé les méthodes traditionnelles sur divers benchmarks. Le nouveau travail soutient qu'un chemin de recherche unique laisse passer des performances à côté.
Les chercheurs ont donc divisé la recherche en plusieurs branches spécialisées. Chaque branche évolue de manière autonome, en travaillant avec un sous-ensemble distinct de données de développement et en appliquant sa propre politique pour proposer des modifications.
Les branches apprennent également de leur historique. Chacune conserve les cas où elle surpasse ses voisines et affine sa stratégie en fonction des des tentatives précédentes.
Cela soulève une question évidente : qui choisit le spécialiste ? La réponse est un routeur. Au déploiement, le routeur sélectionne la meilleure tête de branche pour chaque entrée reçue.
L'ensemble du processus ne s'exécute que sur les données du jeu de développement. Selon les auteurs, les harness complémentaires ont fourni leurs gains sans aucun accès au jeu de test.
Les chiffres des benchmarks
Le résultat phare a été obtenu en raisonnement mathématique de niveau olympiade. La précision est passée de 46,0 % à 62,0 % avec Gemini 3 Flash, ce que les auteurs présentent comme une amélioration relative de 34,8 %.
Les gains se sont également traduits aux tâches agentiques. Sur Terminal-Bench 2.0, qui teste des agents travaillant dans un environnement en ligne de commande, le système a enregistré un gain de 11,6 %. SWE-bench Lite, un benchmark d'ingénierie logicielle, a montré une augmentation de 3,8 %.
Ensemble, ces trois évaluations couvrent le raisonnement mathématique, le travail d'agents en ligne de commande et l'ingénierie logicielle, de sorte que les gains rapportés ne se limitent pas à un seul type de tâche.
Qui est derrière ce travail
La liste des auteurs comprend Haoyu Dong, affilié à Meta et à l'Université Duke, ainsi que Zihao Lin, affilié à Meta et à UC Davis. Lizhu Zhang et Zhuokai Zhao figurent en co-derniers auteurs.
L'article est une prépublication déposée sur arXiv, ce qui signifie qu'elle a été rendue publique mais n'a pas nécessairement franchi l'étape de l'évaluation formelle par les pairs.
Ce que cela signifie
Un bond de 46,0 % à 62,0 % sur des mathématiques difficiles, obtenu sans toucher aux poids du modèle, suggère que des améliorations significatives peuvent découler de l'ingénierie de l'environnement dans lequel un modèle opère. Pour les équipes qui construisent sur des grands modèles de langage, cela présente le harness lui-même comme un artefact optimisable — un élément pouvant évoluer de pair avec, plutôt qu'en attendant, les sorties de modèles.
Il reste des questions ouvertes à surveiller. L'exécution et la maintenance de plusieurs branches évolutives plus un routeur ajoutent probablement de la complexité, et les résultats de l'article proviennent de benchmarks spécifiques et d'un modèle spécifique. Le passage de l'évaluation par les pairs, la tenue des résultats sous tests indépendants et l'extension au-delà de Gemini 3 Flash constituent les points de contrôle naturels à suivre.
Meta-Harness est arrivé en mars 2026 et surpassait déjà les méthodes traditionnelles. Environ six mois plus tard, son successeur prétend battre Meta-Harness lui-même.