NachrichtenMakroMeta, Duke und UC Davis stellen Self-Improving-Branch-Verfahren zur Agent-Harness-Optimierung vor

Meta, Duke und UC Davis stellen Self-Improving-Branch-Verfahren zur Agent-Harness-Optimierung vor

Autor: CryptoBriefing·

Wichtige Erkenntnisse

  • •Die Methode erzielte mit Gemini 3 Flash eine relative Verbesserung um 34,8 % bei Mathematik-Reasoning auf Olympiade-Niveau und hob die Genauigkeit von 46,0 % auf 62,0 % – ohne Neutraining des zugrunde liegenden Modells.
  • •Der Ansatz teilt die Harness-Optimierung in mehrere selbstverbessernde Branches auf, die jeweils eine eigene Teilmenge der Entwicklungsdaten und eine eigene Strategie für Änderungsvorschläge nutzen; ein Router wählt beim Einsatz den stärksten Branch für jede Eingabe aus.
  • •Die Leistungsgewinne gingen über Mathematik hinaus auf agentische Aufgaben über, darunter eine Verbesserung um 11,6 % bei Terminal-Bench 2.0 und eine Steigerung von 3,8 % bei SWE-bench Lite.
  • •Das Papier, veröffentlicht als arXiv:2609.37834v1 am 29. September 2026, baut direkt auf Meta-Harness auf, einem früheren System vom 30. März 2026, das traditionelle Optimierungsmethoden bereits übertroffen hatte.
  • •Laut den Autoren wurden die Gewinne ausschließlich mit Daten aus dem Development-Set und ohne Zugriff auf den Test-Set erzielt; der Preprint hat die formale Peer-Review-Prüfung jedoch noch nicht durchlaufen.
Meta, Duke und UC Davis stellen Self-Improving-Branch-Verfahren zur Agent-Harness-Optimierung vor

Forschende von Meta, der Duke University und der University of California, Davis haben einen neuen Ansatz vorgestellt, um KI-Agenten zu verbessern: Das zugrunde liegende Modell bleibt unverändert, stattdessen wird das Gerüst darum herum optimiert – mit mehreren selbstverbessernden Teams anstelle eines einzelnen.

In einem Preprint mit dem Titel "Mixture of Self-Improving Branches for Agent Harness Optimization" berichten die Forschenden von einer relativen Verbesserung um 34,8 % bei Mathematik-Reasoning auf Olympiade-Niveau; die Genauigkeit stieg mit dem Modell Gemini 3 Flash von 46,0 % auf 62,0 % – ganz ohne Neutraining des Modells selbst.

Was ein Harness ist und warum er wichtig ist

Formeller ausgedrückt ist ein Agent-Harness das Code-Framework, das ein großes Sprachmodell umschließt. Es bestimmt die Prompts, die das Modell erhält, die Tools, die es aufrufen kann, den Kontext, den es zu sehen bekommt, und wie seine Aktionen ausgeführt werden.

Da dieses Gerüst aus Code und nicht aus Modellgewichten besteht, kann es ohne neuen Trainingslauf überarbeitet werden – genau an diesem Hebel setzt die Arbeit an. Harness-Optimierung ist die Praxis, automatisch nach einer besseren Version dieses Wrappers zu suchen. Die neue Studie, veröffentlicht am 29. September 2026 als arXiv:2609.37834v1, baut direkt auf einem früheren System namens Meta-Harness auf.

So funktioniert der Branching-Ansatz

Meta-Harness, veröffentlicht am 30. März 2026, hatte zuvor traditionelle Methoden in verschiedenen Benchmarks übertroffen. Die neue Arbeit argumentiert, dass ein einzelner Suchpfad Performancepotenzial ungenutzt lässt.

Die Forschenden teilen die Suche daher in mehrere spezialisierte Branches auf. Jeder Branch entwickelt sich eigenständig weiter, arbeitet mit einer eigenen Teilmenge der Entwicklungsdaten und verfolgt eine eigene Strategie für vorgeschene Änderungen.

Die Branches lernen zudem aus ihrer Geschichte. Jeder behält die Fälle, in denen er seine Geschwister-Branches schlägt, und verfeinert seine Strategie auf Basis der Ergebnisse früherer Versuche.

Das wirft eine naheliegende Frage auf: Wer wählt den Spezialisten aus? Die Antwort ist ein Router. Beim Einsatz wählt der Router für jede eingehende Eingabe den besten Branch-Head aus.

Der gesamte Prozess läuft ausschließlich mit Daten aus dem Development-Set. Laut den Autoren wurden die Verbesserungen der komplementären Harnesses ohne jeglichen Zugriff auf den Test-Set erzielt.

Die Benchmark-Zahlen

Das Aushängeschild war das Mathematik-Reasoning auf Olympiade-Niveau. Mit Gemini 3 Flash stieg die Genauigkeit von 46,0 % auf 62,0 %, was die Autoren als relative Verbesserung um 34,8 % darstellen.

Die Gewinne übertrugen sich auch auf agentische Aufgaben. Bei Terminal-Bench 2.0, das Agenten in einer Kommandozeilen-Umgebung testet, verzeichnete das System einen Zuwachs von 11,6 %. SWE-bench Lite, ein Benchmark für Software-Engineering, zeigte eine Steigerung von 3,8 %.

Insgesamt decken die drei Evaluierungen Mathematik-Reasoning, Kommandozeilen-Aufgaben für Agenten und Software-Engineering ab – die berichteten Gewinne sind also nicht auf einen einzigen Aufgabentyp beschränkt.

Wer hinter der Arbeit steht

Zur Autorenliste gehören Haoyu Dong, der mit Meta und der Duke University verbunden ist, und Zihao Lin, der mit Meta und der UC Davis assoziiert ist. Lizhu Zhang und Zhuokai Zhao sind als Co-Lettautoren (Co-Last-Authors) angegeben.

Das Papier ist ein auf arXiv veröffentlichter Preprint. Das bedeutet: Er ist öffentlich zugänglich, muss aber eine formale Peer-Review-Prüfung noch nicht durchlaufen haben.

Was das bedeutet

Ein Sprung von 46,0 % auf 62,0 % bei anspruchsvoller Mathematik – ohne Änderung der Modellgewichte – deutet darauf hin, dass bedeutende Verbesserungen durch die Gestaltung der Umgebung erzielt werden können, in der ein Modell arbeitet. Für Teams, die auf großen Sprachmodellen aufbauen, rückt der Harness selbst als optimierbares Artefakt in den Fokus – eines, das sich parallel zu Modell-Releases weiterentwickeln kann, statt auf diese zu warten.

Es gibt offene Fragen. Der Betrieb und die Pflege mehrerer sich entwickelnder Branches samt Router erhöht vermutlich die Komplexität, und die Ergebnisse des Papiers stammen aus spezifischen Benchmarks mit einem spezifischen Modell. Ob der Ansatz die Peer-Review-Prüfung besteht, sich in unabhängigen Tests bewährt und über Gemini 3 Flash hinaus skalierbar ist, sind die naheliegenden Prüfpunkte.

Meta-Harness erschien im März 2026 und übertraf bereits traditionelle Methoden. Rund sechs Monate später behauptet sein Nachfolger nun Meta-Harness selbst zu schlagen.