Dream-RSI от Google сокращает количество вызовов discovery-агентов в 162 раза без переобучения
Ключевые выводы
- •Dream-RSI сократил количество вызовов discovery-агентов на задаче Lasso-солвера пути с 51 200 до 317 — снижение примерно в 162 раза, — при этом среднее время выполнения уменьшилось с 3 587,1 до 2 931,0 миллисекунды.
- •Фреймворк использует трёхэтапный цикл: запись путей исследования в виде деревьев открытий, преобразование их в симуляторы воспроизведения и офлайн-улучшение поисковых политик с помощью отдельной большой языковой модели.
- •Dream-RSI достигает рекурсивного самоулучшения без каких-либо обновлений весов, работая как оркестрационный слой поверх Gemini-3.1-Pro и Gemini-3.7-Flash без донастройки.
- •Решения, полученные Dream-RSI, превзошли библиотеки sklearn и glmnet на шести отложенных наборах данных.
- •На бенчмарке генерации GPU-ядер KernelBench Dream-RSI сравнялся с существующими методами, генерируя в 2,43 раза меньше поколений на VGG16 и в 1,79 раза меньше на LayerNorm.

Исследователи Google создали систему, которая позволяет AI discovery-агентам стать значительно эффективнее без увеличения объёма базовой работы. Dream-RSI — фреймворк, разработанный командами Google DeepMind, Мэрилендского университета и Университета Виргинии, — сокращает количество необходимых вызовов discovery-агентов на бенчмарке оптимизации с 51 200 всего до 317 — снижение примерно в 162 раза, достигающее результатов при использовании лишь малой доли вызовов, которые требовались базовому методу.
Фреймворк описан в статье, опубликованной на arXiv под идентификатором arXiv:2609.14858. По своей сути Dream-RSI учит AI-агентов воспроизводить и учиться на собственных предыдущих поисках, а не запускать новые с нуля каждый раз.
Как работает Dream-RSI
Фреймворк работает по трёхэтапному циклу, где каждый этап строится на предыдущем.
На первом этапе система выполняет начальную фазу онлайн-исследования, генерируя то, что исследователи называют «деревьями открытий» (discovery trees). Это структурированные записи каждого поискового пути агента, включая тупики и прорывы.
На втором этапе эти исторические трассы преобразуются в симуляторы воспроизведения (replay simulators). Вместо повторного вызова базового кодингового агента система восстанавливает ландшафт принятия решений на основе уже имеющихся данных.
Третий этап — это то место, где происходит «сновидение». Отдельная большая языковая модель оценивает и совершенствует политики исследования — включая стратегии ветвления, правила батчинга и критерии остановки поиска — полностью офлайн, без новых дорогостоящих вызовов агентов. Оркестрационный слой тестирует различные подходы на симуляторе воспроизведения, определяет наиболее эффективные и фиксирует улучшенные политики для будущих запусков.
В результате достигается рекурсивное самоулучшение без обновления весов базовой модели. Агент не требует переобучения.
Цифры
На задаче Lasso-солвера пути — Lasso является стандартной техникой регуляризованной регрессии — базовый метод SimpleTES требовал 51 200 вызовов discovery-агентов, каждый из которых представлял собой вызов базового кодингового агента. Dream-RSI, работающий на Gemini-3.1-Pro, снизил этот показатель до 317. Среднее время выполнения сократилось с 3 587,1 миллисекунды до 2 931,0 миллисекунды.
Полученные Dream-RSI решения превзошли признанные библиотеки, такие как sklearn — стандартная библиотека машинного обучения для Python — и glmnet, широко используемый пакет регуляризованной регрессии, на шести отложенных наборах данных. Даже по сравнению с подходом рекурсивного фиксиров исследования, использовавшим 550 вызовов, 317 вызовов Dream-RSI представляли собой существенное улучшение.
На KernelBench — бенчмарке для генерации GPU-ядер — Dream-RSI достиг паритета по производительности с существующими методами, при этом генерируя в 2,43 раза меньше поколений на VGG16, известной сети классификации изображений, и в 1,79 раза меньше на LayerNorm, стандартном слое нейронной сети.
Почему это важно
В экспериментах использовались Gemini-3.1-Pro и Gemini-3.7-Flash без какой-либо донастройки или обновления весов. Dream-RSI работает поверх существующих моделей в качестве оркестрационного слоя, то есть прирост эффективности достигается за счёт того, как оркестрируются агенты, а не за счёт изменений в самих моделях.
Исследовательская группа под руководством Тон Чжэна (Tong Zheng), в которую также вошли Сидун У (Xidong Wu) и Чжэн Чжан (Zheng Zhang) из Google DeepMind и университетов-партнёров, создала сайт проекта и репозиторий на GitHub. По имеющимся сведениям, код готовится к внешнему выпуску — шаг, который позволит независимым разработчикам изучить реализацию и попытаться воспроизвести заявленное сокращение количества вызовов агентов.