NachrichtenAktienGoogles Dream-RSI reduziert Discovery-Agent-Aufrufe um das 162-Fache ohne Retraining

Googles Dream-RSI reduziert Discovery-Agent-Aufrufe um das 162-Fache ohne Retraining

Autor: CryptoBriefing·

Wichtige Erkenntnisse

  • Dream-RSI reduzierte die Discovery-Agent-Aufrufe bei einer Lasso-Pfadlöser-Aufgabe von 51.200 auf 317, eine Reduktion um etwa das 162-Fache, während die durchschnittliche Laufzeit von 3.587,1 auf 2.931,0 Millisekunden sank.
  • Das Framework nutzt einen dreistufigen Zyklus, der Explorationspfade als Discovery Trees aufzeichnet, diese in Replay-Simulatoren umwandelt und Suchstrategien offline mit einem separaten großen Sprachmodell verfeinert.
  • Dream-RSI erreicht rekursive Selbstverbesserung ohne Gewichts-Updates und funktioniert als Orchestrierung auf Gemini-3.1-Pro und Gemini-3.7-Flash ohne Feinabstimmung.
  • Die von Dream-RSI erzeugten Lösungen übertrafen die Bibliotheken sklearn und glmnet auf sechs zurückgehaltenen Datensätzen.
  • Auf dem KernelBench-GPU-Kernel-Benchmark erreichte Dream-RSI Parität mit bestehenden Methoden und erzeugte dabei 2,43-mal weniger Generierungen bei VGG16 und 1,79-mal weniger bei LayerNorm.
Googles Dream-RSI reduziert Discovery-Agent-Aufrufe um das 162-Fache ohne Retraining

Forscher von Google haben ein System entwickelt, das AI-Discovery-Agents deutlich leistungsfähiger macht, ohne dass sie mehr eigentliche Arbeit leisten müssen. Dream-RSI, ein Framework, das von Teams bei Google DeepMind, der University of Maryland und der University of Virginia entwickelt wurde, senkt die Anzahl der erforderlichen Discovery-Agent-Aufrufe bei einer Benchmark-Optimierungsaufgabe von 51.200 auf lediglich 317 – eine Reduktion um etwa das 162-Fache, die Ergebnisse mit einem Bruchteil der vom Baseline-Verfahren geforderten Aufrufe erzielt.

Das Framework wird in einem auf arXiv unter der Kennung arXiv:2609.14858 veröffentlichten Paper beschrieben. Im Kern bringt Dream-RSI AI-Agents bei, ihre eigenen bisherigen Suchen wiederholt und daraus zu lernen, statt jedes Mal neue Suchen von Grund auf durchzuführen.

So funktioniert Dream-RSI

Das Framework arbeitet in einem dreistufigen Zyklus, wobei jede Stufe auf der vorherigen aufbaut.

In der ersten Stufe führt das System eine anfängliche Phase der Online-Exploration durch und erzeugt dabei, was die Forscher „Discovery Trees“ nennen. Dies sind strukturierte Aufzeichnungen jedes vom Agenten eingeschlagenen Suchpfads, einschließlich der Sackgassen ebenso wie der Durchbrüche.

In der zweiten Stufe werden diese historischen Spuren in Replay-Simulatoren umgewandelt. Statt den zugrunde liegenden Coding-Agenten erneut aufzurufen, rekonstruiert das System die Entscheidungslandschaft aus den bereits vorhandenen Daten.

In der dritten Stufe findet das „Träumen“ statt. Ein separates großes Sprachmodell bewertet und verfeinert die Explorationsstrategien – darunter Verzweigungsstrategien, Batching-Regeln und der Zeitpunkt, wann die Suche beendet werden soll – vollständig offline und ohne neue teure Agent-Aufrufe. Die Orchestrierungsschicht testet verschiedene Ansätze gegen den Replay-Simulator, ermittelt, was am besten funktioniert, und verankert verbesserte Strategien für künftige Durchläufe.

Das Ergebnis ist rekursive Selbstverbesserung ohne Aktualisierung der Gewichte des Kernmodells. Der Agent muss nicht neu trainiert werden.

Die Zahlen

Bei einer Lasso-Pfadlöser-Aufgabe – Lasso ist ein Standardverfahren der regularisierten Regression – benötigte die SimpleTES-Baseline 51.200 Discovery-Agent-Aufrufe, jeder davon ein Aufruf des zugrunde liegenden Coding-Agenten. Dream-RSI, ausgeführt auf Gemini-3.1-Pro, senkte diese Zahl auf 317. Die durchschnittliche Laufzeit sank von 3.587,1 Millisekunden auf 2.931,0 Millisekunden.

Die von Dream-RSI erzeugten Lösungen übertrafen etablierte Bibliotheken wie sklearn, eine verbreitete Python-Machine-Learning-Bibliothek, und glmnet, ein weit verbreitetes Paket für regularisierte Regression, auf sechs zurückgehaltenen Datensätzen. Selbst im Vergleich zu einem rekursiven Ansatz mit fester Exploration, der 550 Aufrufe verwendete, bedeuteten Dream-RSIs 317 Aufrufe eine deutliche Verbesserung.

Auf KernelBench, einem Benchmark für die Generierung von GPU-Kernels, erreichte Dream-RSI Performance-Parität mit bestehenden Methoden und erzeugte dabei 2,43-mal weniger Generierungen bei VGG16, einem bekannten Netzwerk zur Bildklassifizierung, und 1,79-mal weniger bei LayerNorm, einer Standard-Neuronalen-Netzwerk-Schicht.

Warum das wichtig ist

Gemini-3.1-Pro und Gemini-3.7-Flash wurden in den Experimenten ohne Feinabstimmung oder Gewichts-Updates verwendet. Dream-RSI sitzt als Orchestrierungsschicht auf bestehenden Modellen auf, das heißt, die Gewinne entstehen durch die Art und Weise, wie Agenten orchestriert werden, und nicht durch Änderungen an den Modellen selbst.

Das Forschungsteam unter der Leitung von Tong Zheng mit Beiträgen unter anderem von Xidong Wu und Zheng Zhang von Google DeepMind und den beteiligten Universitäten hat eine Projektwebsite und ein GitHub-Repository eingerichtet. Der Code wird Berichten zufolge für eine externe Veröffentlichung vorbereitet – ein Schritt, der es unabhängigen Entwicklern ermöglichen würde, die Implementierung zu prüfen und die berichteten Reduktionen der Agent-Aufrufe zu reproduzieren.