GoogleのDream-RSI、探索エージェントの呼び出し回数を162分の1に削減
重要ポイント
- •Dream-RSIは、Lassoパスソルバータスクにおける探索エージェントの呼び出し回数を51,200回から317回へ(約162分の1)削減し、平均実行時間も3,587.1ミリ秒から2,931.0ミリ秒に短縮した。
- •このフレームワークは、探索経路をディスカバリーツリーとして記録し、それをリプレイシミュレーターへ変換、さらに別の大規模言語モデルでオフラインにて検索ポリシーを改良する3段階のループを使用する。
- •Dream-RSIは重み更新なしで再帰的な自己改善を達成し、ファインチューニングなしでGemini-3.1-ProおよびGemini-3.7-Flashの上でオーケストレーションとして機能する。
- •Dream-RSIが生成したソリューションは、6つのホールドアウトデータセットでsklearnおよびglmnetライブラリを上回った。
- •GPUカーネルベンチマークのKernelBenchでは、Dream-RSIは既存手法と同等の性能を達成しつつ、VGG16では2.43分の1、LayerNormでは1.79分の1の生成回数にとどまった。

Googleの研究者らが、AI探索エージェントを基盤となる作業量を増やすことなく大幅に高性能化するシステムを構築した。Google DeepMind、メリーランド大学、バージニア大学のチームが開発したフレームワーク「Dream-RSI」は、ベンチマーク最適化タスクにおいて必要な探索エージェントの呼び出し回数を51,200回からわずか317回に削減した。これは約162倍の削減であり、ベースラインが必要とした呼び出し回数のごく一部で結果を達成するものである。
このフレームワークは、arXivにarXiv:2609.14858という識別子で公開された論文で説明されている。Dream-RSIの核心は、AIエージェントに毎回ゼロから新しい探索を実行するのではなく、自身の過去の探索をリプレイしてそこから学習させることにある。
Dream-RSIの仕組み
このフレームワークは、各段階が前の段階を基盤とする3段階のループで動作する。
第1段階では、システムがオンライン探索の初期フェーズを実行し、研究者らが「ディスカバリーツリー」と呼ぶものを生成する。これは、エージェントが辿ったすべての探索経路の構造化された記録であり、行き詰まりも突破も含まれる。
第2段階では、それらの履歴トレイルがリプレイシミュレーターへと変換される。基盤となるコーディングエージェントを再度呼び出す代わりに、システムは既に保有するデータから意思決定の状況を再構築する。
第3段階で「ドリーミング(夢見る)」が行われる。別の大規模言語モデルが、分岐戦略、バッチ処理ルール、探索を停止すべきタイミングといった探索ポリシーを評価・改良する。これは完全にオフラインで行われ、新たな高コストなエージェント呼び出しは不要である。オーケストレーション層はリプレイシミュレーターに対して異なるアプローチをテストし、最も効果的なものを特定し、改善されたポリシーを将来の実行のために確定する。
その結果、コアモデルの重みを更新することのない再帰的な自己改善が実現される。エージェントを再トレーニングする必要はない。
数値が示す成果
Lassoパスソルバータスク(Lassoは標準的な正則化帰手法)において、SimpleTESのベースラインは51,200回の探索エージェント呼び出しを必要とした。1回ごとに基盤となるコーディングエージェントの呼び出しが発生する。Gemini-3.1-Pro上で動作するDream-RSIは、この数値を317回まで削減した。平均実行時間も3,587.1ミリ秒から2,931.0ミリ秒に短縮された。
Dream-RSIが生成したソリューションは、標準的なPython機械学習ライブラリであるsklearnや、広く使われている正則化回帰パッケージであるglmnetといった確立されたライブラリを、6つのホールドアウトデータセットにおいて上回った。550回の呼び出しを使用した再帰的固定探索アプローチと比較しても、Dream-RSIの317回の呼び出しは有意な改善を示した。
GPUカーネル生成のベンチマークであるKernelBenchでは、Dream-RSIは既存手法と同等の性能を達成しながら、有名な画像分類ネットワークであるVGG16では2.43分の1、標準的なニューラルネットワーク層であるLayerNormでは1.79分の1の生成回数にとどまった。
この研究の意義
実験では、Gemini-3.1-ProとGemini-3.7-Flashがファインチューニングや重み更新なしで使用された。Dream-RSIは既存モデルの上にオーケストレーション層として機能しており、性能向上はモデル自体の変更ではなく、エージェントのオーケストレーションの方法によるものであることを意味する。
Tong Zheng氏が率い、Google DeepMindと提携大学の両方からXidong Wu氏やZheng Zhang氏らの貢献を含む研究チームは、プロジェクトサイトとGitHubリポジトリを開設している。コードは外部公開に向けて準備中と報じられており、これにより独立系の開発者が実装を検証し、報告されたエージェント呼び出し回数の削減を再現できるようになる。