ActualitésActionsDream-RSI de Google réduit les appels aux agents de découverte d'un facteur 162 sans réentraînement

Dream-RSI de Google réduit les appels aux agents de découverte d'un facteur 162 sans réentraînement

Auteur: CryptoBriefing·

Points clés

  • Dream-RSI a réduit les appels aux agents de découverte sur une tâche de solveur de chemin Lasso de 51 200 à 317, soit une réduction d'environ 162 fois, tandis que le temps d'exécution moyen est passé de 3 587,1 à 2 931,0 millisecondes.
  • Le framework utilise une boucle en trois étapes qui enregistre les chemins d'exploration sous forme d'arbres de découverte, les convertit en simulateurs de replay et affine les politiques de recherche hors ligne avec un grand modèle de langage distinct.
  • Dream-RSI réalise une auto-amélioration récursive sans aucune mise à jour des poids, fonctionnant comme une orchestration au-dessus de Gemini-3.1-Pro et Gemini-3.7-Flash sans affinage.
  • Les solutions produites par Dream-RSI ont surpassé les bibliothèques sklearn et glmnet sur six jeux de données de test.
  • Sur le benchmark KernelBench de génération de noyaux GPU, Dream-RSI a égalé les méthodes existantes tout en générant 2,43 fois moins de générations sur VGG16 et 1,79 fois moins sur LayerNorm.
Dream-RSI de Google réduit les appels aux agents de découverte d'un facteur 162 sans réentraînement

Des chercheurs de Google ont construit un système qui permet aux agents de découverte en IA de devenir nettement plus performants sans effectuer davantage de travail sous-jacent. Dream-RSI, un framework développé par des équipes de Google DeepMind, de l'Université du Maryland et de l'Université de Virginie, réduit le nombre d'appels requis aux agents de découverte de 51 200 à seulement 317 sur une tâche d'optimisation de référence — une réduction d'environ 162 fois qui obtient des résultats en utilisant une petite fraction des appels exigés par la baseline.

Le framework est décrit dans un article publié sur arXiv sous l'identifiant arXiv:2609.14858. En substance, Dream-RSI apprend aux agents IA à rejouer et à apprendre de leurs propres recherches antérieures plutôt que d'en relancer de nouvelles à chaque fois de zéro.

Comment fonctionne Dream-RSI

Le framework fonctionne sur une boucle en trois étapes, chacune s'appuyant sur la précédente.

Dans la première étape, le système exécute une phase initiale d'exploration en ligne, générant ce que les chercheurs appellent des « arbres de découverte ». Il s'agit d'enregistrements structurés de chaque chemin de recherche emprunté par l'agent, y compris les impasses comme les percées.

Dans la deuxième étape, ces traces historiques sont transformées en simulateurs de replay. Au lieu de rappeler à nouveau l'agent de codage sous-jacent, le système reconstruit le paysage décisionnel à partir des données dont il dispose déjà.

La troisième étape est celle où se produit le « rêve ». Un grand modèle de langage distinct évalue et affine les politiques d'exploration — couvrant les stratégies de branchement, les règles de traitement par lots et le moment où arrêter la recherche — entièrement hors ligne, sans nouveaux appels coûteux d'agents. La couche d'orchestration teste différentes approches contre le simulateur de replay, détermine ce qui fonctionne le mieux et verrouille les politiques améliorées pour les exécutions futures.

Le résultat est une auto-amélioration récursive sans mise à jour des poids du modèle central. L'agent n'a pas besoin d'être réentraîné.

Les chiffres

Sur une tâche de solveur de chemin Lasso — Lasso étant une technique de régression régularisée standard — la baseline SimpleTES nécessitait 51 200 appels aux agents de découverte, chacun étant une invocation de l'agent de codage sous-jacent. Dream-RSI, fonctionnant sur Gemini-3.1-Pro, a ramené ce chiffre à 317. Le temps d'exécution moyen est passé de 3 587,1 millisecondes à 2 931,0 millisecondes.

Les solutions produites par Dream-RSI ont surpassé des bibliothèques établies telles que sklearn, une bibliothèque Python standard d'apprentissage automatique, et glmnet, un paquet de régression régularisée largement utilisé, sur six jeux de données de test. Même par rapport à une approche d'exploration fixe récursive qui utilisait 550 appels, les 317 appels de Dream-RSI représentaient une amélioration significative.

Sur KernelBench, un benchmark de génération de noyaux GPU, Dream-RSI a atteint une parité de performance avec les méthodes existantes tout en générant ,43 fois moins de générations sur VGG16, un réseau bien connu de classification d'images, et 1,79 fois moins sur LayerNorm, une couche de réseau de neurones standard.

Pourquoi c'est important

Gemini-3.1-Pro et Gemini-3.7-Flash ont été utilisés dans les expériences sans aucun affinage ni mise à jour des poids. Dream-RSI se superpose aux modèles existants comme une couche d'orchestration, ce qui signifie que les gains proviennent de la manière dont les agents sont orchestrés plutôt que de modifications des modèles eux-mêmes.

L'équipe de recherche, dirigée par Tong Zheng et comprenant des contributeurs tels que Xidong Wu et Zheng Zhang de Google DeepMind et des universités partenaires, a mis en place un site de projet et un dépôt GitHub. Le code serait en préparation pour une publication externe — une étape qui permettrait aux développeurs indépendants d'examiner l'implémentation et de tenter de reproduire les réductions d'appels d'agents rapportées.