Google 的 Dream-RSI 在無需重新訓練的情況下,將探索代理呼叫次數減少 162 倍
重點速覽
- •Dream-RSI 在 Lasso 路徑求解器任務上,將探索代理呼叫次數從 51,200 次降至 317 次,約減少 162 倍,平均執行時間也從 3,587.1 毫秒降至 2,931.0 毫秒。
- •該框架採用三階段循環:將探索路徑記錄為探索樹、轉換為重播模擬器,並以另一個大型語言模型在離線狀態下精煉搜尋策略。
- •Dream-RSI 在沒有任何權重更新的情況下實現遞迴自我改進,作為 Gemini-3.1-Pro 與 Gemini-3.7-Flash 之上的編排層運作,無需微調。
- •Dream-RSI 產出的解決方案在六個保留資料集上的表現超越了 sklearn 與 glmnet 函式庫。
- •在 KernelBench GPU 核心基準測試上,Dream-RSI 與現有方法效能相當,同時在 VGG16 上減少 2.43 倍生成次數,在 LayerNorm 上減少 1.79 倍。

Google 研究人員打造出一套系統,能讓 AI 探索代理在底層工作量大幅減少的情況下,能力顯著提升。Dream-RSI 是由 Google DeepMind、馬里蘭大學與維吉尼亞大學的團隊共同開發的框架,在一項基準最佳化任務中,將所需的探索代理呼叫次數從 51,200 次降至僅 317 次——約減少 162 倍,僅以基線所需呼叫次數的一小部分就達成了成果。
該框架在 arXiv 上以編號 arXiv:2609.14858 發表的論文中有所描述。其核心在於,Dream-RSI 教導 AI 代理重播並從自己先前的搜尋中學習,而不是每次都從零開始執行新的搜尋。
Dream-RSI 的運作方式
該框架採用三階段循環運作,每個階段都建立在前一階段的基礎上。
在第一階段,系統執行初始的線上探索,產生研究人員所稱的「探索樹」(discovery trees)。這些是代理所走過每一條搜尋路徑的結構化記錄,包括死胡同與突破點。
在第二階段,這些歷史軌跡被轉換為重播模擬器。系統不需再次呼叫底層的程式碼代理,而是從既有資料中重建決策版圖。
第三階段就是「做夢」發生的地方。另一個大型語言模型完全在離線狀態下評估並精煉探索策略,包括分支策略、批次規則以及何時停止搜尋,過程中不需要任何新的昂貴代理呼叫。編排層針對重播模擬器測試不同的方法,找出最有效的做法,並為後續執行鎖定改進後的策略。
結果是在不更新核心模型權重的情況下實現遞迴自我改進。代理不需要重新訓練。
數據說話
在一項 Lasso 路徑求解器任務上(Lasso 是一種標準的正則化迴歸技術),SimpleTES 基線需要 51,200 次探索代理呼叫,每次呼叫都是對底層程式碼代理的一次調用。在 Gemini-3.1-Pro 上執行的 Dream-RSI 將這個數字降至 317。平均執行時間從 3,587.1 毫秒降至 2,931.0 毫秒。
Dream-RSI 產出的解決方案,在六個保留資料集上的表現超越了既有的函式庫,例如標準 Python 機器學習函式庫 sklearn,以及廣泛使用的正則化迴歸套件 glmnet。即使是與使用 550 次呼叫的遞迴探索方法相比,Dream-RSI 的 317 次呼叫也代表著顯著的改進。
在 GPU 核心生成基準 KernelBench 上,Dream-RSI 在與現有方法達到相同效能的同時,在知名影像分類網路 VGG16 上減少了 2.43 倍的生成次數,在標準神經網路層 LayerNorm 上減少了 1.79 倍。
為何重要
實驗中使用的 Gemini-3.1-Pro 與 Gemini-3.7-Flash 並未經過任何微調或權重更新。Dream-RSI 作為編排層建構在既有模型之上,這意味著效能提升來自代理的編排方式,而非模型本身的變更。
由 Tong Zheng 領導、成員包括來自 Google DeepMind 與合作大學的 Xidong Wu 和 Zheng Zhang 等貢獻者的研究團隊,已建立了專案網站與 GitHub 儲存庫。據報導,程式碼正準備對外發布——這一步驟將讓獨立開發者能夠檢視實作內容,並嘗試重現所報告的代理呼叫次數縮減。