NachrichtenMakroSIFT von MIT und Sakana AI senkt die Kosten der Bewertung selbstverbessernder Coding-Agenten

SIFT von MIT und Sakana AI senkt die Kosten der Bewertung selbstverbessernder Coding-Agenten

Autor: CryptoBriefing·

Wichtige Erkenntnisse

  • •SIFT erreichte 35,1 % auf dem Polyglot-Coding-Benchmark in nur 30 Expansionsschritten und übertraf damit die Darwin Gödel Machine mit 30,7 %, die eine Suche über 80 Knoten benötigte.
  • •Das Framework ersetzt das vollständige Benchmarking jeder vorgeschlagenen Änderung durch einen großen Sprachmodell-Richter, dessen paarweise Präferenzen über ein regularisiertes Bradley-Terry-Modell in Rangfolgen umgewandelt werden.
  • •Eine auf Alibabas Open-Weight-Modell Qwen3-Coder-30B basierende Konfiguration schloss ihre gesamte Suche in 224 CPU-Stunden bei etwa 34 USD an API-Kosten ab – rund ein Zehntel der Ressourcen von DGM.
  • •SIFT verbesserte die Leistung auch auf TerminalBench 2.1 von 29,2 % auf 36,7 % und auf S-60 von 40,0 % auf 52,1 %.
  • •Die Wirksamkeit der Methode hängt von der Genauigkeit des Sprachmodell-Richters ab, was Forscher als zentrale offene Frage bei wachsendem Suchumfang hervorheben.
SIFT von MIT und Sakana AI senkt die Kosten der Bewertung selbstverbessernder Coding-Agenten

Coding-Agenten, die ihren eigenen Quellcode umschreiben können, verursachen eine versteckte Kosten, die wenig mit der eigentlichen Generierung der Änderungen zu tun hat: Jede Selbstmodifikation muss verifiziert werden, bevor jemand wissen kann, ob sie tatsächlich geholfen hat. Forscher des MIT und von Sakana AI glauben, eine deutlich günstigere Methode für diese Verifizierung gefunden zu haben.

Ihr Framework SIFT – kurz für Self-Improvement via Fast Tree-search – erreichte 35,1 % auf dem Polyglot-Coding-Benchmark nach nur 30 Expansionsschritten. Der Name ist wörtlich gemeint: Die Baumsuche wächst zu einer verzweigten Struktur von Kandidaten-Modifikationen heran, wobei jeder Expansionsschritt einen zu erkundenden Knoten hinzufügt. Der Vergleichsmaßstab ist entscheidend: Die frühere Darwin Gödel Machine (DGM) benötigte 80 Suchknoten, um 30,7 % auf demselben Benchmark zu erreichen.

Bewertung von Kandidaten ohne Ausführung des vollständigen Benchmarks

Rekursiv selbstverbessernde Coding-Agenten arbeiten ähnlich wie ein Autor, der seine eigenen Entwürfe überarbeitet. Der Agent schlägt eine Änderung an seinem eigenen Code vor, in der Hoffnung, dass die neue Version bei echten Aufgaben besser abschneidet. Die Schwierigkeit liegt in der Verifizierung: Das Testen jedes vorgeschlagenen Patches gegen einen vollständigen Benchmark verbraucht erhebliche Rechenleistung, und die Rechnung steigt schnell, wenn ein Agent viele Kandidaten erzeugt.

SIFT umgeht einen Großteil dieser Kosten durch einen Schiedsrichter. Statt jede Änderung zu benchmarken, lässt das Framework ein großes Sprachmodell zwei Kandidaten-Modifikationen vergleichen und bestimmen, welche besser aussieht. Diese Direktvergleiche werden anschließend über ein regularisiertes Bradley-Terry-Modell aggregiert, eine statistische Methode zur Umwandlung paarweiser Präferenzen in eine Gesamtrangfolge.

Das Framework führt seine Auswertungen zudem asynchron durch, sodass Kandidaten nicht in einer Ein-Personen-Schlange auf ihren Einsatz auf dem Prüfstand warten müssen. Das Ergebnis ist eine hybride Pipeline: Das Sprachmodell filtert das Feld kostengünstig, und nur die in die engere Auswahl gekommenen Modifikationen durchlaufen die kostspielige nachgelagerte Auswertung.

Die Zahlen hinter dem Effizienzversprechen

Das Aushängeresultat stammt einem o3-mini-Coding-Agenten. Auf Polyglot erreichte SIFT seine 35,1 % in 30 Expansionsschritten und verdrängte damit DGMs 30,7 %, die erst nach einer deutlich längeren Suche über 80 Knoten erzielt wurden.

Die Kostengeschichte wird bei Open-Weight-Modellen noch deutlicher. Eine auf Qwen3-Coder-30B basierende Konfiguration, eine Open-Weight-Veröffentlichung aus Alibabas Qwen-Familie, schloss ihre gesamte Suche in 224 CPU-Stunden bei etwa 34 USD an API-Kosten ab – rund ein Zehntel der Ressourcen, die DGM verbrauchte.

SIFT erzielte auch auf anderen Benchmarks Zuwächse. Auf TerminalBench 2.1 stieg die Leistung von 29,2 % auf 36,7 %, eine Verbesserung von 7,5 Prozentpunkten. Größer war der Sprung bei S-60, wo sich die Werte von 40,0 % auf 52,1 % erhöhten – ein Gewinn von 12,1 Prozentpunkten gegenüber der Ausgangsbasis.

Wer dahintersteckt und wo das Framework einzuordnen ist

Die Arbeit wurde von Xinghong Fu vom MIT verfasst, gemeinsam mit Aravinth Kulanthaivelu und Yutaro Yamada, mit Sakana AI als kooperierendem Labor. Sie erschien etwa am 18. September 2026 auf arXiv, dem offenen Preprint-Server, auf dem Forschung üblicherweise vor der formalen Peer-Review erscheint, und die Diskussion über die Arbeit breitete sich ab Ende September 2026 auf verschiedenen Plattformen aus. Ein Großteil der Debatte konzentrierte sich auf zwei Themen: die Kostenersparnis und die wachsende Bedeutung der tatsächlichen Qualität des Sprachmodell-Richters.

Der Ansatz passt gut zur breiteren Philosophie von Sakana AI. Das in Tokio ansässige Labor, 2023 von ehemaligen Google-Forschern gegründet, darunter dem Transformer-Mitautor Llion Jones, hat in der KI-Entwicklung evolutionäre Entdeckungsmethoden gegenüber Brute-Force-Strategien betont, und SIFT ist ein klarer Fall von klügerem Arbeiten statt einfach mehr Hardware auf das Problem zu werfen. Es baut zudem direkt auf der Linie der Darwin Gödel Machine auf: DGM zeigte, dass Agenten sich durch iterative Suche selbst verbessern können, und SIFT zielt auf den Evaluations-Engpass ab, der diese Suche so teuer machte.

Was das für Entwickler und das Rennen um Selbstverbesserung bedeutet

Die unmittelbarste Konsequenz ist Zugänglichkeit. Wenn eine vollständige Selbstverbesserungssuche für etwa 34 USD an API-Kosten laufen kann, gehört das Feld möglicherweise nicht mehr nur Laboratorien mit großen Rechenbudgets.

Ein Vorbehalt verdient Aufmerksamkeit. SIFTs gesamte Prämisse beruht darauf, dass der Sprachmodell-Richter gute Entscheidungen trifft – deshalb ist die Richterqualität zum zentralen Diskussionsthema der Arbeit geworden. Ein Richter, der konsequent den falschen Patch bevorzugt, würde die Suche in die falsche Richtung lenken – nur eben günstiger. Ob dieses Urteil auch bei wachsendem Suchumfang zuverlässig bleibt, ist die offene Frage, die es in Folgearbeiten zu beobachten gilt.

Quelle: CryptoBriefing