Harness-Zero: Google-onderzoekers laten zien hoe een AI-agent-harness in modelgewichten kan worden gedistilleerd
Belangrijkste punten
- •Harness-Zero distilleert de gedragingen die door een geoptimaliseerde agent-harness worden opgeroepen in de gewichten van een model, zodat de prestatiewinst blijft bestaan nadat de gespecialiseerde harness bij inzet is vervangen door een minimale, vaste harness.
- •Bij de agent-as-harness-aanpak beoordeelt en corrigeert een aparte harnessing-agent, geleid door de geoptimaliseerde harness, elke reactie van de student-agent in de native action space van de doel-harness, en de gecorrigeerde runs dienen als trainingsdemonstraties.
- •In trainingvrije evaluaties op frontiermodellen presteerde de agent-as-harness-aanpak beter dan de conventionele code-as-harness-methode, met gemiddeld 81,1% tegenover 78,1% over de geteste benchmarks en modelinstellingen.
- •Na distillatie steeg het macro-gemiddelde taaksucces van een basismodel met 9 miljard parameters van 23,3% naar 44,3% zonder de gespecialiseerde harness, waarmee de 41,7% met harness werd overtroffen, en het gedistilleerde model wist gemiddeld 82,3% van 28 door de harness opgeroepen gedragspatronen terug te winnen.
- •De auteurs wijzen op beperkingen: de harnessing-agent moet voldoende capabel zijn omdat zwakkere modellen netto schadelijke interventies veroorzaken, het beoordelingsproces verhoogt de kosten van trajectverzameling, en diep gecodeerde domeinkennis kan moeilijk alleen via fine-tuning te internaliseren zijn.

Onderzoekers van Peking University, Google en de Hong Kong University of Science and Technology hebben Harness-Zero geïntroduceerd, een methode die de prestatiewinst van een gespecialiseerde AI-agent-harness overdraagt naar het model zelf, zodat die winst niet langer afhankelijk is van externe scaffolding. Het werk richt zich op een spanningsveld dat centraal staat in de moderne agent-engineering: hoeveel van de capaciteit van een agent in de gewichten van het model zou moeten zitten, en hoeveel in de scaffolding eromheen.
Een agent-harness is het externe systeem dat bepaalt hoe een taalmodel met zijn omgeving omgaat — het orkestreren van toolgebruik, het beheren van context en status, en het regelen van de interactielus. Harness-engineering is een krachtig middel gebleken om de prestaties van agents te verbeteren, maar de winst die het oplevert hangt af van de aanwezigheid van die specifieke harness bij inzet. Omdat de optimale harness verschilt per domein, individuele taak en basismodel, staat een algemene agent voor een moeilijke afweging: een enkele gedeelde harness accepteren en gespecialiseerde voordelen opgeven, of een groeiende verzameling gespecialiseerde harnesses onderhouden met toenemende kosten voor routering, context en orkestratie.
Harness-Zero stelt een derde pad voor: harness-distillatie. Een geoptimaliseerde dient alleen als begeleiding tijdens training, en de gedragingen die deze teweegbrengt worden overgedragen naar de gewichten van het model, zodat de winst blijft bestaan nadat de gespecialiseerde harness is verwijderd en een minimale, vaste harness bij inzet wordt gebruikt.
Agent-as-Harness: Begeleiding vertalen tussen verschillende action spaces
De centrale moeilijkheid is dat de geoptimaliseerde harness en de doel-harness verschillen in zowel action space als beschikbare informatie, wat betekent dat de begeleiding van de geoptimaliseerde harness niet direct als trainingssupervisie kan worden gebruikt. Harness-Zero lost dit op met een agent-as-harness-aanpak: een aparte harnessing-agent, geleid door de geoptimaliseerde harness, beoordeelt elke reactie die de student-agent voorstelt en corrigeert deze waar nodig, zodat de correctie wordt uitgedrukt in de native action space van de doel-harness voordat deze wordt uitgevoerd.
De gecorrigeerde runs dienen vervolgens als trainingsdemonstraties. Fine-tuning op de resulterende trajecten internaliseert het door de harness opgeroepen gedrag direct in de gewichten van het model, en bij inzet worden de gespecialiseerde harness, de referentie-harness en de harnessing-agent allemaal verwijderd.
De onderzoekers evalueerden de methode in drie domeinen — spreadsheetgerichte kennwerkarbeid (SpreadsheetBench Verified), toolgebruik over meerdere applicaties (AppWorld) en wetenschappelijk redeneren (USPTO Retrosynthesis). In trainingvrije evaluaties op frontiermodellen — dus zonder fine-tuning — presteerde de agent-as-harness-aanpak beter dan de conventionele code-as-harness-methode, met gemiddeld 81,1% tegenover 78,1% over de geteste benchmarks en modelinstellingen.
Bij distillatie steeg het macro-gemiddelde taaksucces van een basismodel met 9 miljard parameters, vergeleken relatief compact naar huidige maatstaven, van 23,3% naar 44,3% nadat de gespecialiseerde harness was verwijderd — waarmee de 41,7% werd overtroffen die hetzelfde basismodel behaalde met de harness nog aangehecht. Een gedragsanalyse toonde bovendien aan dat het gedistilleerde model gemiddeld 82,3% van 28 door de harness opgeroepen gedragspatronen terugwann die afwezig waren in het basismodel, een aanwijzing dat het gedistilleerde model opnam hoe de harness werkte, en niet alleen hoe goed deze presteerde.
De auteurs wijzen op verschillende beperkingen. De aanpak vereist een voldoende capabel model als harnessing-agent, omdat zwakkere modellen netto schadelijke interventies veroorzaken, en het beoordelingsproces verhoogt de kosten van het verzamelen van trajecten. Diepere domeinkennis die in een harness is gecodeerd, kan bovendien moeilijker te internaliseren door alleen fine-tuning.
Toch suggereren de resultaten dat harness-ontwikkeling een schaalbare bron van trainingssignaal zou kunnen worden — waarbij betere modellen betere harnesses bouwen, en elke harness zijn winst teruggeeft aan het model zelf in plaats van deze opgesloten te laten in de scaffolding eromheen. Hoe ver die lus kan worden opgerekt, gegeven de beperkingen die de auteurs aanwijzen, is de open vraag die zal bepalen of de winst van harnesses in de scaffolding blijft belanden — of begint te belanden in de gewichten zelf.