AktualnościAkcjeDream-RSI od Google'a redukuje liczbę wywołań agentów odkrywczych 162-krotnie bez ponownego trenowania

Dream-RSI od Google'a redukuje liczbę wywołań agentów odkrywczych 162-krotnie bez ponownego trenowania

Autor: CryptoBriefing·

Najważniejsze informacje

  • Dream-RSI zredukował liczbę wywołań agenta odkrywczego w zadaniu solvera ścieżek Lasso z 51 200 do 317, czyli o około 162 razy, a średni czas działania spadł z 3587,1 do 2931,0 milisekund.
  • Framework wykorzystuje trzystopniową pętlę, która zapisuje ścieżki eksploracji jako drzewa odkryć, przekształca je w symulatory replay i doskonali polityki wyszukiwania offline za pomocą osobnego dużego modelu językowego.
  • Dream-RSI osiąga rekurencyjne samodoskonalenie bez żadnych aktualizacji wag, działając jako orkiestracja na modelach Gemini-3.1-Pro i Gemini-3.7-Flash bez dostrajania.
  • Rozwiązania wygenerowane przez DreamSI przewyższyły biblioteki sklearn i glmnet na sześciu zbiorach danych holdout.
  • Na benchmarku generowania jąder GPU KernelBench Dream-RSI wyrównał się z istniejącymi metodami, generując 2,43 razy mniej generacji na VGG16 i 1,79 razy mniej na LayerNorm.
Dream-RSI od Google'a redukuje liczbę wywołań agentów odkrywczych 162-krotnie bez ponownego trenowania

Badacze Google'a opracowali system, który pozwala agentom odkrywczym AI radykalnie zyskiwać na możliwościach bez wykonywania większej liczby operacji bazowych. Dream-RSI, framework opracowany przez zespoły z Google DeepMind, Uniwersytetu Maryland i Uniwersytetu Wirginii, redukuje liczbę wymaganych wywołań agenta odkrywczego z 51 200 do zaledwie 317 w benchmarkowym zadaniu optymalizacyjnym — spadek o około 162 razy, osiągając wyniki przy ułamku wywołań wymaganych przez punkt odniesienia.

Framework opisano w pracy opublikowanej na arXiv pod identyfikatorem arXiv:2609.14858. Istotą Dream-RSI jest uczenie agentów AI odtwarzania i wnioskowania z własnych wcześniejszych wyszukiwań, zamiast uruchamiania nowych od zera za każdym razem.

Jak działa Dream-RSI

Framework działa w trzystopniowej pętli, w której każdy etap bazuje na poprzednim.

W pierwszym etapie system wykonuje wstępną fazę eksploracji online, generując to, co badacze nazywają „drzewami odkryć”. To ustrukturyzowane zapisy każdej ścieżki wyszukiwania podjętej przez agenta, łącznie ze ślepymi uliczkami i przełomami.

W drugim etapie te historyczne ślady są przekształcane w symulatory replay. Zamiast ponownie wywoływać bazowego agenta programującego, system rekonstruuje krajobraz decyzyjny z posiadanych już danych.

Trzeci etap to moment, w którym następuje „śnienie”. Osobny duży model językowy ocenia i doskonali polityki eksploracji —jmujące strategie rozgałęziania, reguły grupowania i moment zakończenia wyszukiwania — całkowicie offline, bez nowych kosztownych wywołań agenta. Warstwa orkiestracji testuje różne podejścia względem symulatora replay, ustala, co działa najlepiej, i utrwala ulepszone polityki na przyszłe uruchomienia.

Efektem jest rekurencyjne samodoskonalenie bez aktualizacji wag modelu bazowego. Agent nie wymaga ponownego trenowania.

Liczby

W zadaniu solvera ścieżek Lasso — Lasso to standardowa technika regresji z regularyzacją — punkt odniesienia SimpleTES wymagał 51 200 wywołań agenta odkrywczego, z których każde stanowiło wywołanie bazowego agenta programującego. Dream-RSI, działający na Gemini-3.1-Pro, obniżył tę wartość do 317. Średni czas działania spadł z 3587,1 milisekund do 2931,0 milisekund.

Rozwiązania wygenerowane przez Dream-RSI przewyższyły uznane biblioteki, takie jak sklearn, standardowa biblioteka uczenia maszynowego w Pythonie, oraz glmnet, szeroko stosowany pakiet regresji z regularyzacją, na sześciu zbiorach danych holdout. Nawet w porównaniu z rekurencyjnym podejściem o stałej eksploracji, które zużyło 550 wywołań, 317 wywołań Dream-RSI stanowiło znaczącą poprawę.

Na KernelBench, benchmarku generowania jąder GPU, Dream-RSI osiągnął parystwo wydajności z istniejącymi metodami, generując 2,43 razy mniej generacji na VGG16, znanej sieci klasyfikacji obrazów, i 1,79 razy mniej na LayerNorm, standardowej warstwie sieci neuronowej.

Dlaczego to ważne

Gemini-3.1-Pro i Gemini-3.7-Flash zostały użyte w eksperymentach bez żadnego dostrajania ani aktualizacji wag. Dream-RSI działa na istniejących modelach jako warstwa orkiestracji, co oznacza, że zyski wynikają ze sposobu orkiestracji agentów, a nie ze zmian w samych modelach.

Zespół badawczy, kierowany przez Tong Zhenga, do którego należą m.in. Xidong Wu i Zheng Zhang z Google DeepMind oraz współpracujących uniwersytetów, uruchomił stronę projektu i repozytorium GitHub. Kod — jak donoszono — jest przygotowywany do publikacji zewnętrznej, co pozwoliłoby niezależnym deweloperom zbadać implementację i spróbować odtworzyć zgłaszane redukcje liczby wywołań agenta.