NoticiasAccionesDream-RSI de Google reduce las llamadas de agentes de descubrimiento en 162 veces sin reentrenamiento

Dream-RSI de Google reduce las llamadas de agentes de descubrimiento en 162 veces sin reentrenamiento

Autor: CryptoBriefing·

Puntos clave

  • Dream-RSI redujo las llamadas de agente de descubrimiento en una tarea de resolución de rutas Lasso de 51,200 a 317, una reducción de aproximadamente 162 veces, mientras el tiempo promedio de ejecución cayó de 3,587.1 a 2,931.0 milisegundos.
  • El marco usa un ciclo de tres etapas que registra las rutas de exploración como árboles de descubrimiento, los convierte en simuladores de repetición y refina las políticas de búsqueda offline con un modelo de lenguaje de gran escala separado.
  • Dream-RSI logra automejora recursiva sin ninguna actualización de pesos, funcionando como una orquestación sobre Gemini-3.1-Pro y Gemini-3.7-Flash sin ajuste fino.
  • Las soluciones producidas por Dream-RSI superaron a las bibliotecas sklearn y glmnet en seis conjuntos de datos reservados.
  • En la referencia de kernels de GPU KernelBench, Dream-RSI igualó los métodos existentes mientras generaba 2.43 veces menos generaciones en VGG16 y 1.79 veces menos en LayerNorm.
Dream-RSI de Google reduce las llamadas de agentes de descubrimiento en 162 veces sin reentrenamiento

Investigadores de Google han creado un sistema que permite a los agentes de descubrimiento de IA volverse dramáticamente más capaces sin realizar más trabajo subyacente. Dream-RSI, un marco desarrollado por equipos de Google DeepMind, la Universidad de Maryland y la Universidad de Virginia, reduce las llamadas de agentes de descubrimiento necesarias de 51,200 a solo 317 en una tarea de optimización de referencia — una reducción de aproximadamente 162 veces que logra resultados usando una fracción mínima de las llamadas que exigía la línea base.

El marco se describe en un artículo publicado en arXiv bajo el identificador arXiv:2609.14858. En esencia, Dream-RSI enseña a los agentes de IA a reproducir y aprender de sus propias búsquedas previas en lugar de ejecutar nuevas desde cero cada vez.

Cómo funciona Dream-RSI

El marco opera en un ciclo de tres etapas, cada una construida sobre la anterior.

En la primera etapa, el sistema ejecuta una fase inicial de exploración en línea, generando lo que los investigadores llaman "árboles de descubrimiento". Estos son registros estructurados de cada ruta de búsqueda que siguió el agente, incluidos los callejones sin salida y los avances.

En la segunda etapa, esos recorridos históricos se transforman en simuladores de repetición. En lugar de volver a llamar al agente de codificación subyacente, el sistema reconstruye el panorama de decisiones a partir de los datos que ya tiene.

La tercera etapa es donde ocurre el "soñar". Un modelo de lenguaje de gran escala separado evalúa y refina las políticas de exploración — que abarcan estrategias de ramificación, reglas de agrupación y cuándo detener la búsqueda — completamente offline, sin nuevas llamadas costosas al agente. La capa de orquestación prueba diferentes enfoques contra el simulador de repetición, determina cuál funciona mejor y fija las políticas mejoradas para ejecuciones futuras.

El resultado es un automejora recursiva sin actualizar los pesos del modelo central. El agente no necesita ser reentrenado.

Las cifras

En una tarea de resolución de rutas Lasso — Lasso es una técnica estándar de regresión regularizada — la línea base SimpleTES requirió 51,200 llamadas de agente de descubrimiento, cada una una invocación del agente de codificación subyacente. Dream-RSI, ejecutándose sobre Gemini-3.1-Pro, redujo esa cifra a 317. El tiempo promedio de ejecución cayó de 3,587.1 milisegundos a 2,931.0 milisegundos.

Las soluciones producidas por Dream-RSI superaron a bibliotecascidas como sklearn, una biblioteca estándar de aprendizaje automático de Python, y glmnet, un paquete ampliamente usado de regresión regularizada, en seis conjuntos de datos reservados. Incluso en comparación con un enfoque de exploración fija recursiva que usó 550 llamadas, las 317 llamadas de Dream-RSI representaron una mejora significativa.

En KernelBench, una referencia para la generación de kernels de GPU, Dream-RSI alcanzó paridad de rendimiento con los métodos existentes mientras generaba 2.43 veces menos generaciones en VGG16, una conocida red de clasificación de imágenes, y 1.79 veces menos en LayerNorm, una capa estándar de redes neuronales.

Por qué es importante

Gemini-3.1-Pro y Gemini-3.7-Flash se usaron en los experimentos sin ningún ajuste fino ni actualización de pesos. Dream-RSI opera sobre los modelos existentes como una capa de orquestación, lo que significa que las ganancias provienen de cómo se orquestan los agentes y no de cambios en los modelos mismos.

El equipo de investigación, liderado por Tong Zheng e integrado por colaboradores como Xidong Wu y Zheng Zhang de Google DeepMind y de las universidades asociadas, ha creado un sitio del proyecto y un repositorio en GitHub. Según se informa, el código se está preparando para su lanzamiento externo — un paso que permitiría a desarrolladores independientes inspeccionar la implementación e intentar reproducir las reducciones reportadas en las llamadas al agente.