НовостиАкцииDream-RSI от Google сокращает количество вызовов discovery-агентов в 162 раза без переобучения

Dream-RSI от Google сокращает количество вызовов discovery-агентов в 162 раза без переобучения

Автор: CryptoBriefing·

Ключевые выводы

  • Dream-RSI сократил количество вызовов discovery-агентов на задаче Lasso-солвера пути с 51 200 до 317 — снижение примерно в 162 раза, — при этом среднее время выполнения уменьшилось с 3 587,1 до 2 931,0 миллисекунды.
  • Фреймворк использует трёхэтапный цикл: запись путей исследования в виде деревьев открытий, преобразование их в симуляторы воспроизведения и офлайн-улучшение поисковых политик с помощью отдельной большой языковой модели.
  • Dream-RSI достигает рекурсивного самоулучшения без каких-либо обновлений весов, работая как оркестрационный слой поверх Gemini-3.1-Pro и Gemini-3.7-Flash без донастройки.
  • Решения, полученные Dream-RSI, превзошли библиотеки sklearn и glmnet на шести отложенных наборах данных.
  • На бенчмарке генерации GPU-ядер KernelBench Dream-RSI сравнялся с существующими методами, генерируя в 2,43 раза меньше поколений на VGG16 и в 1,79 раза меньше на LayerNorm.
Dream-RSI от Google сокращает количество вызовов discovery-агентов в 162 раза без переобучения

Исследователи Google создали систему, которая позволяет AI discovery-агентам стать значительно эффективнее без увеличения объёма базовой работы. Dream-RSI — фреймворк, разработанный командами Google DeepMind, Мэрилендского университета и Университета Виргинии, — сокращает количество необходимых вызовов discovery-агентов на бенчмарке оптимизации с 51 200 всего до 317 — снижение примерно в 162 раза, достигающее результатов при использовании лишь малой доли вызовов, которые требовались базовому методу.

Фреймворк описан в статье, опубликованной на arXiv под идентификатором arXiv:2609.14858. По своей сути Dream-RSI учит AI-агентов воспроизводить и учиться на собственных предыдущих поисках, а не запускать новые с нуля каждый раз.

Как работает Dream-RSI

Фреймворк работает по трёхэтапному циклу, где каждый этап строится на предыдущем.

На первом этапе система выполняет начальную фазу онлайн-исследования, генерируя то, что исследователи называют «деревьями открытий» (discovery trees). Это структурированные записи каждого поискового пути агента, включая тупики и прорывы.

На втором этапе эти исторические трассы преобразуются в симуляторы воспроизведения (replay simulators). Вместо повторного вызова базового кодингового агента система восстанавливает ландшафт принятия решений на основе уже имеющихся данных.

Третий этап — это то место, где происходит «сновидение». Отдельная большая языковая модель оценивает и совершенствует политики исследования — включая стратегии ветвления, правила батчинга и критерии остановки поиска — полностью офлайн, без новых дорогостоящих вызовов агентов. Оркестрационный слой тестирует различные подходы на симуляторе воспроизведения, определяет наиболее эффективные и фиксирует улучшенные политики для будущих запусков.

В результате достигается рекурсивное самоулучшение без обновления весов базовой модели. Агент не требует переобучения.

Цифры

На задаче Lasso-солвера пути — Lasso является стандартной техникой регуляризованной регрессии — базовый метод SimpleTES требовал 51 200 вызовов discovery-агентов, каждый из которых представлял собой вызов базового кодингового агента. Dream-RSI, работающий на Gemini-3.1-Pro, снизил этот показатель до 317. Среднее время выполнения сократилось с 3 587,1 миллисекунды до 2 931,0 миллисекунды.

Полученные Dream-RSI решения превзошли признанные библиотеки, такие как sklearn — стандартная библиотека машинного обучения для Python — и glmnet, широко используемый пакет регуляризованной регрессии, на шести отложенных наборах данных. Даже по сравнению с подходом рекурсивного фиксиров исследования, использовавшим 550 вызовов, 317 вызовов Dream-RSI представляли собой существенное улучшение.

На KernelBench — бенчмарке для генерации GPU-ядер — Dream-RSI достиг паритета по производительности с существующими методами, при этом генерируя в 2,43 раза меньше поколений на VGG16, известной сети классификации изображений, и в 1,79 раза меньше на LayerNorm, стандартном слое нейронной сети.

Почему это важно

В экспериментах использовались Gemini-3.1-Pro и Gemini-3.7-Flash без какой-либо донастройки или обновления весов. Dream-RSI работает поверх существующих моделей в качестве оркестрационного слоя, то есть прирост эффективности достигается за счёт того, как оркестрируются агенты, а не за счёт изменений в самих моделях.

Исследовательская группа под руководством Тон Чжэна (Tong Zheng), в которую также вошли Сидун У (Xidong Wu) и Чжэн Чжан (Zheng Zhang) из Google DeepMind и университетов-партнёров, создала сайт проекта и репозиторий на GitHub. По имеющимся сведениям, код готовится к внешнему выпуску — шаг, который позволит независимым разработчикам изучить реализацию и попытаться воспроизвести заявленное сокращение количества вызовов агентов.