NotizieAzioniDream-RSI di Google riduce del 162x le chiamate degli agenti di scoperta senza riaddestramento

Dream-RSI di Google riduce del 162x le chiamate degli agenti di scoperta senza riaddestramento

Autore: CryptoBriefing·

Punti chiave

  • Dream-RSI ha ridotto le chiamate all'agente di scoperta su un compito di risoluzione di percorsi Lasso da 51.200 a 317, una riduzione di circa 162 volte, mentre il tempo medio di esecuzione è sceso da 3.587,1 a 2.931,0 millisecondi.
  • Il framework utilizza un ciclo a tre fasi che registra i percorsi di esplorazione come alberi di scoperta, li converte in simulatori di replay e affina le politiche di ricerca offline con un modello linguistico separato.
  • Dream-RSI ottiene un auto-miglioramento ricorsivo senza alcun aggiornamento dei pesi, funzionando come orchestrazione sopra Gemini-3.1-Pro e Gemini-3.7-Flash senza messa a punto.
  • Le soluzioni prodotte da Dream-RSI hanno superato le librerie sklearn e glmnet su sei dataset di riserva.
  • Sul benchmark KernelBench per kernel GPU, Dream-RSI ha eguagliato i metodi esistenti generando 2,43x di generazioni in meno su VGG16 e 1,79x in meno su LayerNorm.
Dream-RSI di Google riduce del 162x le chiamate degli agenti di scoperta senza riaddestramento

I ricercatori di Google hanno realizzato un sistema che consente agli agenti di scoperta basati su IA di diventare drasticamente più capaci senza effettuare più lavoro sottostante. Dream-RSI, un framework sviluppato dai team di Google DeepMind, dell'Università del Maryland e dell'Università della Virginia, riduce il numero di chiamate richieste all'agente di scoperta da 51.200 a soli 317 su un compito di ottimizzazione di riferimento — una riduzione di circa 162 volte che ottiene risultati con una piccola frazione delle chiamate richieste dalla baseline.

Il framework è descritto in un articolo pubblicato su arXiv con l'identificativo arXiv:2609.14858. Nella sua essenza, Dream-RSI insegna agli agenti IA a riprodurre e imparare dalle proprie ricerche precedenti anziché eseguirne di nuove da zero ogni volta.

Come funziona Dream-RSI

Il framework opera su un ciclo a tre fasi, in cui ogni fase si basa sulla precedente.

Nella prima fase, il sistema esegue una fase iniziale di esplorazione online, generando ciò che i ricercatori chiamano "alberi di scoperta" (discovery trees). Si tratta di registrazioni strutturate di ogni percorso di ricerca seguito dall'agente, compresi i vicoli ciechi e le scoperte decisieve.

Nella seconda fase, tali percorsi storici vengono trasformati in simulatori di replay. Invece di richiamare nuovamente l'agente di coding sottostante, il sistema ricostruisce il panorama decisionale a partire dai dati di cui dispone già.

La terza fase è quella in cui avviene il "sogno". Un modello linguistico separato valuta e affina le politiche di esplorazione — comprendenti strategie di ramificazione, regole di batch e quando interrompere la ricerca — interamente offline, senza nuove costose chiamate all'agente. Il livello di orchestrazione testa diversi approcci contro il simulatore di replay, determina quale funziona meglio e consolida le politiche migliorate per le esecuzioni future.

Il risultato è un auto-miglioramento ricorsivo senza aggiornare i pesi del modello centrale. L'agente non deve essere riaddestrato.

I numeri

Su un compito di risoluzione di percorsi Lasso — la Lasso essendo una tecnica standard di regressione regolarizzata — la baseline SimpleTES richiedeva 51.200 chiamate all'agente di scoperta, ognuna una chiamata all'agente di coding sottostante. Dream-RSI, in esecuzione su Gemini-3.1-Pro, ha portato quella cifra a 317. Il tempo medio di esecuzione è sceso da 3.587,1 millisecondi a 2.931,0 millisecondi.

Le soluzioni prodotte da Dream-RSI hanno superato librerie consolidate come sklearn, una libreria standard di machine learning per Python, e glmnet, un pacchetto ampiamente utilizzato per la regressione regolarizzata, su sei dataset di riserva. Anche rispetto a un approccio di esplorazione fissa ricorsiva che utilizzava 550 chiamate, le 317 chiamate di Dream-RSI hanno rappresentato un miglioramento significativo.

Su KernelBench, un benchmark per la generazione di kernel GPU, Dream-RSI ha raggiunto la parità prestazioni con i metodi esistenti generando il 2,43x di generazioni in meno su VGG16, una nota rete di classificazione di immagini, e 1,79x in meno su LayerNorm, uno standard layer di reti neurali.

Perché è importante

Gemini-3.1-Pro e Gemini-3.7-Flash sono stati utilizzati negli esperimenti senza alcuna messa a punto o aggiornamento dei pesi. Dream-RSI si colloca sopra i modelli esistenti come livello di orchestrazione, il che significa che i guadagni derivano da come gli agenti vengono orchestrati anziché da modifiche ai modelli stessi.

Il team di ricerca, guidato da Tong Zheng e comprendente contributi di Xidong Wu e Zheng Zhang, sia di Google DeepMind che delle università partner, ha allestito un sito del progetto e un repository GitHub. Il codice risulta in preparazione per il rilascio esterno — un passo che consentirebbe agli sviluppatori indipendenti di esaminare l'implementazione e di tentare di riprodurre le riduzioni di chiamate all'agente riportate.