NieuwsMacroOnderzoekers van Meta, Duke en UC Davis presenteren zelfverbeterende vertakkingsmethode voor agent harness-optimalisatie

Onderzoekers van Meta, Duke en UC Davis presenteren zelfverbeterende vertakkingsmethode voor agent harness-optimalisatie

Auteur: CryptoBriefing·

Belangrijkste punten

  • •De methode leverde een relatieve verbetering van 34,8% op wiskundig redeneren op Olympiade-niveau met Gemini 3 Flash, waarmee de nauwkeurigheid steeg van 46,0% naar 62,0% zonder het onderliggende model opnieuw te trainen.
  • •De aanpak verdeelt harness-optimalisatie over meerdere zelfverbeterende vertakkingen, elk met een eigen subset van ontwikkeldata en een eigen beleid voor het voorstellen van wijzigingen, waarbij een router bij inzet de sterkste vertakking per invoer selecteert.
  • •De prestatiewinsten reikten verder dan wiskunde naar agentische taken, waaronder een verbetering van 11,6% op Terminal-Bench 2.0 en een stijging van 3,8% op SWE-bench Lite.
  • •Het artikel, geplaatst als arXiv:2609.37834v1 op 29 september 2026, bouwt direct voort op Meta-Harness, een eerder systeem uitgebracht op 30 maart 2026 dat al beter presteerde dan traditionele optimalisatiemethoden.
  • •Volgens de auteurs zijn de winsten behaald met uitsluitend ontwikkeldata, zonder toegang tot de testset, maar de preprint heeft de formele peer review nog niet doorlopen.
Onderzoekers van Meta, Duke en UC Davis presenteren zelfverbeterende vertakkingsmethode voor agent harness-optimalisatie

Onderzoekers van Meta, Duke University en de University of California, Davis hebben een nieuwe aanpak voorgesteld om AI-agents beter te maken: laat het onderliggende model met rust en verbeter de structuur eromheen, met meerdere zelfverbeterende teams in plaats van één.

In een preprint getiteld “Mixture of Self-Improving Branches for Agent Harness Optimization” melden de onderzoekers een relatieve verbetering van 34,8% op wiskundig redeneren op Olympiade-niveau, waarmee de nauwkeurigheid met het Gemini 3 Flash-model steeg van 46,0% naar 62,0% — allemaal zonder het model zelf opnieuw te trainen.

Wat een harness is, en waarom het ertoe doet

Formeler gezegd is een agent harness het codeframework rond een groot taalmodel. Het bepaalt welke prompts het model ontvangt, welke tools het kan aanroepen, welke context het te zien krijgt en hoe de acties ervan worden uitgevoerd.

Omdat die structuur code is in plaats van modelgewichten, kan deze worden aangepast zonder een nieuwe trainingsrun — precies de hendel die deze onderzoekslijn gebruikt. Harness-optimalisatie is de praktijk van het automatisch zoeken naar een betere versie van dat omhulsel. Het nieuwe artikel, gepubliceerd op 29 september 2026 als arXiv:2609.37834v1, bouwt direct voort op een eerder systeem genaamd Meta-Harness.

Hoe de vertakkingsaanpak werkt

Meta-Harness, uitgebracht op 30 maart 2026, presteerde eerder al beter dan traditionele methoden op verschillende benchmarks. Het nieuwe werk stelt dat één zoekpad prestaties onbenut laat.

De onderzoekers splitsen de zoektocht daarom op in meerdere gespecialiseerde vertakkingen. El vertakking evolueert op eigen kracht, met een eigen subset van ontwikkeldata en een eigen beleid voor het voorstellen van wijzigingen.

De vertakkingen leren ook van hun geschiedenis. Elk van ze bewaart de gevallen waarin het zijn zustervertakkingen verslaat en verfijnt zijn strategie op basis van hoe eerdere pogingen presteerden.

Dat roept een voor de hand liggende vraag op: wie kiest de specialist? Het antwoord is een router. Bij inzet selecteert de router de beste vertakkingskop voor elke binnenkomende invoer.

Het hele proces draait uitsluitend op ontwikkeldata. Volgens de auteurs behaalden de complementaire harnesses hun winst zonder enige toegang tot de testset.

De benchmarkcijfers

De hoofdresultaat kwam van wiskundig redeneren op Olympiade-niveau. De nauwkeurigheid steeg met Gemini 3 Flash van 46,0% naar 62,0%, wat de auteurs presenteren als een relatieve verbetering van 34,8%.

De winsten zetten door naar agentische taken. Op Terminal-Bench 2.0, dat agents test die in een commandlineomgeving werken, boekte het systeem een winst van 11,6%. SWE-bench Lite, een software-engineeringbenchmark, liet een stijging van 3,8% zien.

Samen bestrijken de drie evaluaties wiskundig redeneren, agentisch werk in de commandline en software-engineering, dus de gerapporteerde winsten zijn niet beperkt tot één taaktype.

Wie achter het werk zit

De auteurslijst omvat Haoyu Dong, verbonden aan Meta en Duke University, en Zihao Lin, verbonden aan Meta en UC Davis. Lizhu Zhang en Zhuokai Zhao staan vermeld als co-laatste auteurs.

Het artikel is een preprint op arXiv, wat betekent dat het openbaar is gedeeld maar nog niet noodzakelijk een formele peer review heeft doorlopen.

Wat dit betekent

Een sprong van 46,0% naar 62,0% op moeilijke wiskunde, bereikt zonder de modelgewichten aan te raken, suggereert dat zinvolle verbeteringen kunnen voortkomen uit het ontwerpen van de omgeving waarin een model opereert. Voor teams die bouwen op grote taalmodellen positioneert het de harness zelf als een optimaliseerbaar artefact — één dat mee kan bewegen met modelreleases in plaats daarop te wachten.

Er zijn open vragen om in de gaten te houden. Het draaien en onderhouden van meerdere evoluerende vertakkingen plus een router voegt waarsijnlijk complexiteit toe, en de resultaten in het artikel komen van specifieke benchmarks en een specifiek model. Of de aanpak de peer review doorstaat, standhoudt onder onafhankelijke tests en zich laat uitbreiden voorbij Gemini 3 Flash, zijn de logische controlepunten om te volgen.

Meta-Harness verscheen in maart 2026 en presteerde toen al beter dan traditionele methoden. Ongeveer zes maanden later beweert zijn opvolger Meta-Harness zelf te verslaan.