Googles Dream-RSI vermindert discovery-agent-aanroepen met 162x zonder retraining
Belangrijkste punten
- •Dream-RSI verlaagde het aantal discovery-agent-aanroepen op een Lasso path solver-taak van 51.200 naar 317, een vermindering van ruwweg 162x, terwijl de gemiddelde looptijd daalde van 3.587,1 naar 2.931,0 milliseconden.
- •Het framework gebruikt een driefasen-lus die verkenningspaden vastlegt als discovery trees, deze omzet in replay-simulatoren en het zoekbeleid offline verfijnt met een apart groot taalmodel.
- •Dream-RSI realiseert recursieve zelfverbetering zonder enige gewichtsupdates en functioneert als orchestratie bovenop Gemini-3.1-Pro en Gemini-3.7-Flash zonder fine-tuning.
- •Oplossingen geproduceerd door Dream-RSI presteerden beter dan de bibliotheken sklearn en glmnet op zes held-out datasets.
- •Op de KernelBench GPU-kernel-benchmark evena Dream-RSI bestaande methoden terwijl het 2,43x minder generaties produceerde op VGG16 en 1,79x minder op LayerNorm.

Onderzoekers van Google hebben een systeem gebouwd dat AI-discoveryagents aanzienlijk capabeler maakt zonder dat er meer onderliggend werk nodig is. Dream-RSI, een framework ontwikkeld door teams van Google DeepMind, de University of Maryland en de University of Virginia, verlaagt het aantal benodigde discovery-agent-aanroepen op een benchmark-optimalisatietaak van 51.200 naar slechts 317 — een vermindering van ruwweg 162x, met resultaten die worden bereikt met een kleine fractie van de aanroepen die de baseline vereiste.
Het framework wordt beschreven in een paper die op arXiv is gepubliceerd onder de identificatie arXiv:2609.14858. In de kern leert Dream-RSI AI-agents om hun eigen eerdere zoekopdrachten te herafspelen en erfrom te leren, in plaats van elke keer opnieuw vanaf nul te beginnen.
Hoe Dream-RSI werkt
Het framework werkt volgens een driefasen-lus, waarbij elke fase op de vorige voortbouwt.
In de eerste fase voert het systeem een initiële periode van online verkenning uit en genereert wat de onderzoekers "discovery trees" noemen. Dit zijn gestructureerde registraties van elk zoekpad dat de agent heeft gevolgd, inclusief de doodlopende wegen evenals de doorbraken.
In de tweede fase worden die historische sporen omgezet in replay-simulatoren. In plaats van de onderliggende coding-agent opnieuw aan te roepen, reconstrueert het systeem het beslissingslandschap uit data die het al heeft.
De derde fase is waar het "dromen plaatsvindt. Een apart groot taalmodel evalueert en verfijnt het verkenningsbeleid — inclusief vertakingsstrategieën, batchingregels en wanneer te stoppen met zoeken — volledig offline, zonder nieuwe kostbare agent-aanroepen. De orchestratielaag test verschillende benaderingen tegen de replay-simulator, bepaalt wat het beste werkt en zet verbeterd beleid vast voor toekomstige runs.
Het resultaat is recursieve zelfverbetering zonder de gewichten van het kernmodel bij te werken. De agent hoeft niet opnieuw te worden getraind.
De cijfers
Op een Lasso path solver-taak — Lasso zijnde een standaard regularisatietechniek voor regressie — vereiste de SimpleTES-baseline 51.200 discovery-agent-aanroepen, elk een aanroep van de onderliggende coding-agent. Dream-RSI, draaiend op Gemini-3.1-Pro, bracht dat cijfer terug naar 317. De gemiddelde looptijd daalde van 3.587,1 milliseconden naar 2.931,0 milliseconden.
De oplossingen die Dream-RSI produceerde presteerden beter dan gevestigde bibliotheken zoals sklearn, een standaard Python-machinelearningbibliotheek, en glmnet, een veelgebruikt pakket voor geregulariseerde regressie, op zes held-out datasets. Zelfs in vergelijking met een recursieve benadering met vaste verkenning die 550 aanroepen gebruikte, vertegenwoordigden Dream-RSI's 317 aanroepen een aanzienlijke verbetering.
Op KernelBench, een benchmark voor het genereren van GPU-kernels, behaalde Dream-RSI prestatiepariteit met bestaande methoden terwijl het 2,43x minder generaties produceerde op VGG16, een bekend netwerk voor beeldclassificatie, en 1,79x minder op LayerNorm, een standaard neurale netwerklaag.
Waarom dit ertoe doet
Gemini-3.1-Pro en Gemini-3.7-Flash werden in de experimenten gebruikt zonder enige fine-tuning of gewichtsupdates. Dream-RSI bevindt zich als orchestratielaag bovenop bestaande modellen, wat betekent dat de winsten voortkomen uit hoe agents worden georkestreerd en niet uit veranderingen aan de modellen zelf.
Het onderzoeksteam, geleid door Tong Zheng en met bijdragen van onder anderen Xidong Wu en Zheng Zhang van zowel Google DeepMind als de partneruniversiteiten, heeft een projectwebsite en een GitHub-repository opgezet. De code zou worden voorbereid op externe release — een stap die onafhankelijke ontwikkelaars in staat zou stellen de implementatie te inspecteren en te proberen de gerapporteerde verminderingen in agent-aanroepen te reproduceren.