SIFT van MIT en Sakana AI verlaagt de kosten van het beoordelen van zichzelf verbeterende codingagents
Belangrijkste punten
- •SIFT behaalde 35,1% op de Polyglot-codingbenchmark in slechts 30 uitbreidingsstappen en overtrof daarmee de Darwin Gödel Machine met 30,7%, waarvoor een zoektocht van 80 knooppunten nodig was.
- •Het framework vervangt volledige benchmarking van elke voorgestelde wijziging door een groot taalmodel als beoordelaar, waarvan de paarsgewijze voorkeuren via een geregulariseerd Bradley-Terry-model worden omgezet in rangschikkingen.
- •Een configuratie gebouwd op Alibaba's open-weight Qwen3-Coder-30B voltooide zijn volledige zoektocht in 224 CPU-uren voor circa $34 aan API-kosten, ongeveer een tiende van de middelen die DGM verbruikte.
- •SIFT verbeterde ook de prestaties op TerminalBench 2.1 van 29,2% naar 36,7% en op S-60 van 40,0% naar 52,1%.
- •De effectiviteit van de methode hangt af van de nauwkeurigheid van het taalmodel als beoordelaar, wat onderzoekers aanwijzen als de centrale open vraag naarmate de schaal van zoektochten groeit.

Codingagents die hun eigen broncode kunnen herschrijven, kennen een verborgen kostenpost die weinig te maken heeft met het genereren van de wijzigingen zelf: elke zelfmodificatie moet worden geverifieerd voordat duidelijk is of deze daadwerkelijk hielp. Onderzoekers van MIT en Sakana AI menen een aanzienlijk goedkopere manier te hebben gevonden om die verificatie uit te voeren.
Hun framework, SIFT—kort voor Self-Improvement via Fast Tree-search—behaalde 35,1% op de Polyglot-codingbenchmark na slechts 30 uitbreidingsstappen. De naam is letterlijk bedoeld: tree-search laat een vertakkende structuur van kandidaatwijzigingen groeien, waarbij elke uitbreidingsstap een knooppunt toevoegt om te verkennen. Het referentiepunt is belangrijk: de eerdere Darwin Gödel Machine (DGM) had 80 zoekknooppunten nodig om 30,7% te bereiken op dezelfde benchmark.
Kandidaten beoordelen zonder de volledige benchmark te draaien
Recursief zichzelf verbeterende codingagents werken ongeveer zoals een schrijver die zijn eigen concepten herziet. De agent stelt een wijziging aan zijn eigen code voor, in de hoop dat de nieuwe versie beter presteert op echte taken. De moeilijkheid ligt in de verificatie: elke voorgestelde patch tegen een volledige benchmark testen verbruikt veel rekenkracht, en de rekening loopt snel op wanneer een agent veel kandidaten genereert.
SIFT omzeilt een groot deel van die kosten door een scheidsrechter te introduceren. In plaats van elke wijziging te benchmarken, vraagt het framework een groot taalmodel om twee kandidaatwijzigingen te vergelijken en te bepalen welke er beter uitziet. Deze directe confrontaties worden vervolgens geaggregeerd via een geregulariseerd Bradley-Terry-model, een statistische methode om paarsgewijze voorkeuren om te zetten in een algehele rangschik.
Het framework voert zijn evaluaties bovendien asynchroon uit, waardoor kandidaten niet in een rij hoeven te wachten tot ze aan de beurt zijn op de testbank. Het resultaat is een hybride pijplijn: het taalmodel filtert het veld goedkoop, en alleen de doorgeselecteerde wijzigingen gaan door naar de kostbare downstream-evaluatie.
De cijfers achter de efficiëntieclaim
Een o3-mini-codingagent leverde de belangrijkste resultaat. Op Polyglot behaalde SIFT zijn score van 35,1% in 30 uitbreidingsstappen en nipte daarmee voorbij DGM's 30,7%, die werd bereikt via een veel langere zoektocht van 80 knooppunten.
Het kostenverhaal wordt nog scherper met open-weight-modellen. Een configuratie gebouwd op Qwen3-Coder-30B, een open-weight-release uit Alibaba's Qwen-familie, voltooide zijn volledige zoektocht in 224 CPU-uren met circa $34 aan API-kosten—ongeveer een tiende van de middelen die DGM verbruikte.
SIFT boekte ook winst op andere benchmarks. Op TerminalBench 2.1 steeg de prestatie van 29,2% naar 36,7%, een verbetering van 7,5 procentpunten. De sprong was groter op S-60, waar de scores stegen van 40,0% naar 52,1%, een winst van 12,1 procentpunten ten opzichte van de beginbaseline.
Wie het bouwde en waar het past
Het artikel is geschreven door Xinghong Fu van MIT, samen met Aravinth Kulanthaivelu en Yutaro Yamada, met Sakana AI als samenwerkend lab. Het verscheen op arXiv, de open-access preprintserver waar onderzoek doorgaans eerder verschijnt dan formele peerreview, rond 18 september 2026, en de discussie over het werk verspreidde zich eind september 2026 over diverse platforms. Veel van dat gesprek draaide om twee thema's: de kostenbesparing en het toenemende belang van de kwaliteit van het taalmodel dat als beoordelaar fungeert.
De aanpak past goed bij de bredere filosofie van Sakana AI. Het in Tokio gevestigde lab, opgericht in 2023 door voormalige Google-onderzoekers waaronder Transformer-artikelmedeauteur Llion Jones, heeft in AI-ontwikkeling evolutionaire ontdekkingsmethoden benadrukt boven brute-force strategieën, en SIFT is duidelijk een geval van slimmer werken in plaats van meer hardware tegen het probleem te gooien. Het bouwt bovendien direct voort op de lijn van de Darwin Gödel Machine: DGM stelde vast dat agents zichzelf kunnen verbeteren via iteratief zoeken, en SIFT richt zich op de evaluatiebottleneck die dat zoeken zo duur maakte.
Wat dit betekent voor ontwikkelaars en de race rond zelfverbetering
De meest directe implicatie is toegankelijkheid. Als een volledige zelfverbeteringszoektocht kan draaien voor circa $34 aan API-kosten, dan behoort het veld niet langer uitsluitend toe aan labs met grote rekenbudgetten.
Eén kanttekening verdient aandacht. SIFT's hele uitgangspunt rust op de goede oord van het taalmodel als beoordelaar, en daarom is de kwaliteit van die beoordelaar uitgegroeid tot een centraal gespreksonderwerp bij discussies over het artikel. Een beoordelaar die consequent de verkeerde patch verkiest, stuurt de zoektocht de verkeerde kant op—alleen goedkoper. Of dat oordeel betrouwbaar blijft naarmate zoektochten opschalen, is de open vraag voor vervolgonderzoek.
Bron: CryptoBriefing