NachrichtenMakroHarness-Zero: Google-Forscher zeigen, wie sich ein KI-Agent-Harness in Modellgewichte destillieren lässt

Harness-Zero: Google-Forscher zeigen, wie sich ein KI-Agent-Harness in Modellgewichte destillieren lässt

Autor: Metaverse Post·

Wichtige Erkenntnisse

  • •-Zero destilliert die von einem optimierten Agent-Harness induzierten Verhaltensweisen in die Modellgewichte, sodass die Leistungsgewinne auch dann bestehen bleiben, wenn der spezialisierte Harness beim Einsatz durch einen minimalen festen Harness ersetzt wird.
  • •Beim Agent-as-Harness-Ansatz prüft und korrigiert ein separater, vom optimierten Harness geleiteter Harnessing-Agent jede Antwort des Student-Agents im nativen Aktionsraum des Ziel-Harnesses, und die korrigierten Durchläufe dienen als Trainingsdemonstrationen.
  • •In trainingsfreien Evaluationen an Frontier-Modellen übertraf der Agent-as-Harness-Ansatz das konventionelle Code-as-Harness-Verfahren mit durchschnittlich 81,1 % gegenüber 78,1 % über die getesteten Benchmarks und Modelleinstellungen hinweg.
  • •Nach der Destillation stieg der makro-durchschnittliche Aufgabeerfolg eines 9-Milliarden-Parameter-Basismodells nach Entfernung des spezialisierten Harnesses von 23,3 % auf 44,3 % und übertraf damit die 41,7 %, die dasselbe Modell mit angehängtem Harness erreichte; das destillierte Modell wiedererlangte im Durchschnitt 82,3 % der 28 harness-induzierten Verhaltensmuster.
  • •Die Autoren weisen auf Einschränkungen hin: Der Harnessing-Agent muss ausreichend leistungsfähig sein, da schwächere Modelle netto schädliche Eingriffe produzieren, der Prüfprozess die Kosten der Trajektorienerhebung erhöht und tief codiertes Domänenwissen sich möglicherweise schwer allein durch Fine-Tuning verinnerlichen lässt.
Harness-Zero: Google-Forscher zeigen, wie sich ein KI-Agent-Harness in Modellgewichte destillieren lässt

Forscher der Peking University, Google und der Hong Kong University of Science and Technology haben Harness-Zero vorgestellt, ein Verfahren, das die Leistungsgewinne eines spezialisierten KI-Agent-Harnesses direkt in das Modell selbst überträgt, sodass diese Gewinne nicht mehr von externem Scaffolding abhängen. Die Arbeit befasst sich mit einer zentralen Spannung des modernen Agent-Engineerings: Wie viel der Fähigkeit eines Agents sollte in den Modellgewichten liegen und wie viel in dem Scaffolding, das ihn umgibt?

Ein Agent-Harness ist das externe System, das steuert, wie ein Sprachmodell mit seiner Umgebung interagiert — es orchestriert die Werkzeugnutzung, verwaltet Kontext und Zustand und kontrolliert die Interaktionsschleife. Harness-Engineering hat sich als wirksamer Hebel zur Verbesserung der Agentenleistung erwiesen, doch die Verbesserungen hängen davon ab, dass der spezifische Harness beim Einsatz vorhanden ist. Da der optimale Harness je nach Domäne, Einzelaufgabe und Basismodell variiert, steht ein Allzweck-Agent vor einem schwierigen Kompromiss: entweder einen einzigen gemeinsamen Harness übernehmen und spezialisierte Vorteile aufgeben, oder eine wachsende Sammlung spezialisierter Harnesses mit steigenden Kosten für Routing, Kontext und Orchestrierung pflegen.

Harness-Zero schlägt einen dritten Weg vor: die Harness-Destillation. Ein optimierter Harness dient nur als Trainingsanleitung, und die von ihm induzierten Verhaltensweisen werden in die Modellgewichte übertragen, sodass die Gewinne auch dann bestehen bleiben, wenn der spezialisierte Harness entfernt wird und beim Einsatz ein minimaler, fester Harness verwendet wird.

Agent-as-Harness: Übersetzung von Anleitungen über verschiedene Aktionsräume hinweg

Die zentrale Schwierigkeit besteht darin, dass sich der optimierte Harness und der Ziel-Harness sowohl imionsraum als auch in den verfügbaren Informationen unterscheiden, sodass die Anleitung des optimierten Harnesses nicht direkt als Trainingssupervision verwendet werden kann. Harness-Zero löst dies mit einem Agent-as-Harness-Ansatz: Ein separater Harnessing-Agent, der vom optimierten Harness geleitet wird, prüft jede Antwort, die der Student-Agent vorschlägt, und korrigiert sie bei Bedarf so, dass die Korrektur vor der Ausführung im nativen Aktionsraum des Ziel-Harnesses ausgedrückt wird.

Die korrigierten Durchläufe dienen anschließend als Trainingsdemonstrationen. Fine-Tuning auf den resultierenden Trajektorien verinnerlicht das harness-induzierte Verhalten direkt in den Modellgewichten, und beim Einsatz werden der spezialisierte Harness, der Referenz-Harness und der Harnessing-Agent vollständig verworfen.

Die Forscher evaluierten das Verfahren in drei Domänen — tabellenbasierte Wissensarbeit (SpreadsheetBench Verified), werkzeuggestützte Nutzung mehrerer Anwendungen (AppWorld) und wissenschaftliches Schlussfolgern (USPTO Retrosynthesis). In trainingsfreien Evaluationen an Frontier-Modellen — also ohne Fine-Tuning — übertraf der Agent-as-Harness-Ansatz das konventionelle Code-as-Harness-Verfahren mit durchschnittlich 81,1 % gegenüber 78,1 % über die getesteten Benchmarks und Modelleinstellungen hinweg.

Bei der Destillation stieg der makro-durchschnittliche Aufgabeerfolg eines 9-Milliarden-Parameter-Basismodells, gemessen an heutigen Maßstäben vergleichsweise kompakt, nach Entfernung des spezialisierten Harnesses von 23,3 % auf 44,3 % — und übertraf damit die 41,7 %, die dasselbe Basismodell mit noch angehängtem Harness erreichte. Eine Verhaltensanalyse ergab zudem, dass das destillierte Modell im Durchschnitt 82,3 % der 28 harness-induzierten Verhaltensmuster wiedererlangte, die im Basismodell nicht vorhanden waren — ein Hinweis darauf, dass das destillierte Modell erfasst hat, wie der Harness funktionierte, nicht nur, wie gut er abschnitt.

Die Autoren weisen auf mehrere Einschränkungen hin. Der Ansatz erfordert ein ausreichend leistungsfähiges Modell als Harnessing-Agent, da schwächere Modelle netto schädliche Eingriffe produzieren, und der Prüfprozess erhöht die Kosten der Trajektorienerhebung. Tiefer in einem Harness codiertes Domänenwissen lässt sich möglicherweise auch schwerer allein durch Fine-Tuning verinnerlichen.

Dennoch deuten die Ergebnisse darauf hin, dass die Harness-Entwicklung zu einer skalierbaren Quelle von Trainingssignalen werden könnte — wobei bessere Modelle bessere Harnesses entwickeln und jeder Harness seine Gewinne an das Modell selbst zurückgibt, statt sie im umgebenden Scaffolding einzuschließen. Wie weit diese Schleife gedehnt werden kann, angesichts der von den Autoren genannten Einschränkungen, ist die offene Frage, die darüber entscheiden wird, ob die Harness-Gewinne weiterhin im Scaffolding landen — oder künftig in den Modellgewichten selbst.