Harness-Zero : des chercheurs de Google démontrent comment distiller un harnais d'agent IA dans les poids d'un modèle
Points clés
- •Harness-Zero distille dans les poids d'un modèle les comportements induits par un harnais d'agent optimisé, si bien que les gains de performance persistent après le remplacement du harnais spécialisé par un harnais fixe minimal au déploiement.
- •Dans l'approche d'agent comme harnais, un agent de harnais distinct, guidé par le harnais optimisé, examine et corrige chaque réponse de l'agent étudiant dans l'espace d'action natif du harnais cible, et les exécutions corrigées servent de démonstrations d'entraînement.
- •Lors d'évaluations sans entraînement sur des modèles de pointe, l'approche d'agent comme harnais a surpassé la méthode conventionnelle de code comme harnais, avec une moyenne de 81,1 % contre 78,1 % sur l'ensemble des références et configurations de modèles testées.
- •Après distillation, le taux de réussite macro-moyen d'un modèle de base de 9 milliards de paramètres est passé de 23,3 % à 44,3 % avec le harnais spécialisé retiré, dépassant les 41,7 % obtenus par le même modèle avec le harnais en place, et le modèle distillé a retrouvé en moyenne 82,3 % des 28 schémas comportementaux induits par le harnais.
- •Les auteurs signalent des limites : l'agent de harnais doit être suffisamment performant, car les modèles plus faibles produisent des interventions globalement nuisibles, le processus de révision augmente les coûts de collecte de trajectoires, et les connaissances de domaine profondément encodées peuvent être difficiles à internaliser par le seul fine-tuning.

Des chercheurs de l'Université de Pékin, de Google et de l'Université des sciences et technologies de Hong Kong ont présenté Harness-Zero, une méthode qui transfère les gains de performance d'un harnais d'agent IA spécialisé directement dans le modèle lui-même, de sorte que ces gains ne dépendent plus d'un échafaudage externe. Ce travail aborde une tension au cœur de l'ingénierie moderne des agents : quelle part des capacités d'un agent doit résider dans les poids du modèle, et quelle part dans l'échafaudage qui l'entoure.
Un harnais d'agent est le système externe qui régit la manière dont un modèle de langage interagit avec son environnement — en orchestrant l'utilisation des outils, en gérant le contexte et l'état, et en contrôlant la boucle d'interaction. L'ingénierie des harnais s'est révélée un levier puissant pour améliorer les performances des agents, mais les gains qu'elle apporte dépendent de la présence de ce harnais spécifique lors du déploiement. Comme le harnais optimal varie selon les domaines, les tâches individuelles et les modèles de base, un agent à usage général fait face à un arbitrage difficile : adopter un harnais partagé unique et renoncer aux avantages spécialisés, ou maintenir une collection croissante de harnais spécialisés avec les coûts croissants en routage, en contexte et en orchestration.
Harness-Zero propose une troisième voie : la distillation de harnais. Un harnais optimisé ne sert que de guide pendant l'entraînement, et les comportements qu'il induit sont transférés dans les poids du modèle, si bien que les gains persistent même après le retrait du harnais spécialisé, un harnais fixe minimal étant utilisé au déploiement.
Agent comme harnais : traduire les conseils entre différents espaces d'action
La difficulté centrale réside dans le fait que le harnais optimisé et le harnais cible diffèrent tant par leur espace d'action que par les informations disponibles, ce qui signifie que les conseils du harnais optimisé ne peuvent pas être appliqués directement comme supervision d'entraînement. Harness-Zero résout ce problème avec une approche d'agent servant de harnais : un agent de harnais distinct, guidé par le harnais optimisé, examine chaque réponse proposée par l'agent étudiant et, si nécessaire, la corrige afin que la correction soit exprimée dans l'espace d'action natif du harnais cible avant l'exécution.
Les exécutions corrigées servent ensuite de démonstrations d'entraînement. Le fine-tuning sur les trajectoires obtenues internalise directement dans les poids du modèle les comportements induits par le harnais, et au moment du déploiement, le harnais spécialisé, le harnais de référence et l'agent de harnais sont tous abandonnés.
Les chercheurs ont évalué la méthode dans trois domaines — le travail de connaissance sur tableurs (SpreadsheetBench Verified), l'utilisation d'outils multi-applications (AppWorld) et le raisonnement scientifique (USPTO Retrosynthesis). Lors d'évaluations sans entraînement sur des modèles de pointe c'est-à-dire sans aucun fine-tuning — l'approche d'agent comme harnais a surpassé la méthode conventionnelle de code comme harnais, avec une moyenne de 81,1 % contre 78,1 % sur l'ensemble des références et configurations de modèles testées.
Pour la distillation, le taux de réussite macro-moyen d'un modèle de base de 9 milliards de paramètres, relativement compact selon les normes actuelles, est passé de 23,3 % à 44,3 % une fois le harnais spécialisé retiré — dépassant les 41,7 % que le même modèle de base avait obtenus avec le harnais en place. Une analyse comportementale a en outre révélé que le modèle distillé a retrouvé en moyenne 82,3 % des 28 schémas comportementaux induits par le harnais qui étaient absents du modèle de base, signe que le modèle distillé a absorbé la manière dont le harnais fonctionnait, et pas seulement son niveau de performance.
Les auteurs notent plusieurs limites. L'approche nécessite un modèle suffisamment performant pour servir d'agent de harnais, car les modèles plus faibles produisent des interventions globalement nuisibles, et le processus de révision augmente le coût de la collecte de trajectoires. Les connaissances de domaine plus profondes encodées dans un harnais peuvent également être plus difficiles à internaliser par le seul fine-tuning.
Néanmoins, ces résultats suggèrent que le développement de harnais pourrait devenir une source évolutive de signal d'entraînement — avec des modèles meilleurs construisant de meilleurs harnais, et chaque harnais restituant ses gains au modèle lui-même plutôt que de les laisser enfermés dans l'échafaudage qui l'entoure. Jusqu'où cette boucle peut s'étendre, compte tenu des contraintes signalées par les auteurs, est la question ouverte qui déterminera si les gains des harnais continuent de se loger dans l'échafaudage — ou commencent à se loger dans les poids eux-mêmes.