谷歌Dream-RSI将发现智能体调用次数降低162倍,且无需重新训练
要点速览
- •在Lasso路径求解器任务中,Dream-RSI将发现智能体调用次数从51,200次降至317次,降幅约为162倍,平均运行时间从3,587.1毫秒降至2,931.0毫秒。
- •该框架采用三阶段循环:将探索路径记录为发现树,将其转换为重放模拟器,并使用另一个大语言模型离线优化搜索策略。
- •Dream-RSI无需任何权重更新即可实现递归自我改进,作为编排层运行在Gemini-3.1-Pro和Gemini-3.7-Flash之上,无需微调。
- •Dream-RSI生成的解决方案在六个留出数据集上的表现优于sklearn和glmnet库。
- •在KernelBench GPU内核基准测试中,Dream-RSI与现有方法性能相当,同时在VGG16上生成的次数减少了2.43倍,在LayerNorm上减少了1.79倍。

谷歌研究人员构建了一套系统,能让AI发现智能体在无需进行更多底层工作的情况下大幅提升能力。Dream-RSI是由Google DeepMind、马里兰大学和弗吉尼亚大学的团队开发的框架,在一个基准优化任务中,将所需的发现智能体调用次数从51,200次降至仅317次——降幅约为162倍,仅用基线所需调用次数的一小部分就取得了同样的结果。
该框架在arXiv上发布的一篇论文中作了描述,论文编号为arXiv:2609.14858。其核心在于,Dream-RSI教会AI智能体重放并从自身先前的搜索中学习,而不是每次都从头开始运行新的搜索。
Dream-RSI的工作原理
该框架运行于一个三阶段循环,每个阶段都在前一阶段的基础上构建。
在第一阶段,系统运行一个初始的在线探索阶段,生成研究人员所称的“发现树”。这些是对智能体所采取的每条搜索路径的结构化记录,既包括走入死胡同的路径,也包括取得突破的路径。
在第二阶段,这些历史轨迹被转换为重放模拟器。系统无需再次调用底层编码智能体,而是从已有数据中重构决策图景。
第三阶段就是“做梦”发生的环节。另一个独立的大语言模型完全离线地评估并优化探索策略——涵盖分支策略、批处理规则以及何时停止搜索——无需任何新的昂贵智能体调用。编排层针对重放模拟器测试不同方法,确定哪种方法效果最佳,并为未来的运行锁定改进后的策略。
其结果是在不更新核心模型权重的情况下实现递归自我改进。智能体无需重新训练。
关键数据
在Lasso路径求解器任务中——Lasso是一种标准的正则化回归技术——SimpleTES基线需要51,200次发现智能体调用,每一次调用都是对底层编码智能体的一次调用。运行在Gemini-3.1-Pro上的Dream-RSI将这一数字降至317次。平均运行时间从3,587.1毫秒降至2,931.0毫秒。
Dream-RSI生成的解决方案在六个留出数据集上的表现优于sklearn(一个标准的Python机器学习库)和glmnet(一个广泛使用的正则化回归软件包)等知名库。即使与使用了550次调用的递归固定探索方法相比,Dream-RSI的317次调用也代表着显著的改进。
在用于GPU内核生成的基准测试KernelBench上,Dream-RSI与现有方法达到了相同的性能水平,同时在VGG16(一个知名的图像分类网络)上生成的次数减少了2.43倍,在LayerNorm(一种标准神经网络层)上减少了1.79倍。
为什么这很重要
实验中使用的Gemini-3.1-Pro和Gemini-3.7-Flash没有经过任何微调或权重更新。Dream-RSI作为编排层运行在现有模型之上,这意味着性能来自智能体的编排方式,而非模型本身的改动。
由Tong Zheng领导、包括来自Google DeepMind及合作大学的Xidong Wu和Zheng Zhang等贡献者的研究团队,已建立了项目网站和GitHub仓库。据称,相关代码正准备对外发布——这一步将让独立开发者能够检视其实现,并尝试复现所报告的智能体调用次数的削减。