AktualnościMakroHarness-Zero: Badacze Google pokazują, jak destylować harness agenta AI do wag modelu

Harness-Zero: Badacze Google pokazują, jak destylować harness agenta AI do wag modelu

Autor: Metaverse Post·

Najważniejsze informacje

  • •Harness-Zero destyluje zachowania wywoływane przez zoptymalizowany harness agenta do wag modelu, dzięki czemu korzyści wydajnościowe utrzymują się po zastąpieniu specjalistycznego harnessu minimalnym, stałym harnessem w wdrożeniu.
  • •W podejściu agent-jako-harness osobny agent harnessujący, prowadzony przez zoptymalizowany harness, analizuje i poprawia każdą odpowiedź agenta ucznia w natywnej przestrzeni akcji harnessu docelowego, a poprawione przebiegi służą jako demonstracje treningowe.
  • •W ocenach bez treningu na modelach granicznych podejście agent-jako-harness przewyższyło konwencjonalną metodę kod-jako-harness, uzyskując średnio 81,1% wobec 78,1% w testowanych benchmarkach i ustawieniach modeli.
  • •Po destylacji makrośrednia skuteczność zadań bazowego modelu o 9 miliardach parametrów wzrosła z 23,3% do 44,3% po usunięciu specjalistycznego harnessu, przewyższając wynik 41,7% osiągnięty z harnessem, a model zdestylowany odzyskał średnio 82,3% z 28 wzorców zachowań indukowanych przez harness.
  • •Autorzy wskazują ograniczenia: agent harnessujący musi być dostatecznie zdolny, ponieważ słabsze modele generują interwencje przynoszące netto szkodę, proces weryfikacji zwiększa koszty zbierania trajektorii, a głęboko zakodowana wiedza domenowa może być trudna do przyswojenia wyłącznie poprzez dostrajanie.
Harness-Zero: Badacze Google pokazują, jak destylować harness agenta AI do wag modelu

Badacze z Uniwersytetu Pekińskiego, Google oraz Hongkońskiego Uniwersytetu Nauki i Technologii przedstawili Harness-Zero — metodę, która przenosi zyski wydajnościowe specjalistycznego harnessu agenta AI do samego modelu, tak aby nie zależały już od zewnętrznego scaffoldingu. Praca dotyka napięcia leżącego w centrum współczesnej inżynierii agentów: ile zdolności agenta powinno znajdować się w wagach modelu, a ile w scaffoldingu wokół niego.

Harness agenta to zewnętrzny system zarządzający tym, jak model językowy wchodzi w interakcję ze swoim środowiskiem — koordynuje korzystanie z narzędzi, zarządza kontekstem i stanem oraz kontroluje pętlę interakcji. Inżynieria harnessów okazała się skuteczną dźwignią poprawy wydajności agentów, ale przyniesione przez nią korzyści zależą od obecności konkretnego harnessu w momencie wdrożenia. Ponieważ optymalny harness różni się w zależności od domeny, pojedynczych zadań i modeli bazowych, agent ogólnego przeznaczenia stoi przed trudnym kompromisem: przyjąć jeden wspólny harness i stracić wyspecjalizowane przewagi albo utrzymywać rosnącą kolekcję harnessów specjalistycznych wraz ze wzrostem kosztów routingu, kontekstu i orkiestracji.

Harness-Zero proponuje trzecią drogę: destylację harnessu. Zoptymalizowany harness służy wyłącznie jako wskazówka na etapie treningu, a wywoływane przez niego zachowania są przenoszone do wag modelu, dzięki czemu korzyści utrzymują się nawet po usunięciu specjalistycznego harnessu i zastosowaniu w wdrożeniu minimalnego, stałego harnessu.

Agent jako harness: przekładanie wskazówek między różnymi przestrzeniami akcji

Główna trudność polega na tym że zoptymalizowany harness i harness docelowy różnią się zarówno przestrzenią akcji, jak i dostępnymi informacjami, co oznacza, że wskazówek zoptymalizowanego harnessu nie można bezpośrednio wykorzystać jako nadzoru treningowego. Harness-Zero rozwiązuje to podejściem agent-jako-harness: osobny agent harnessujący, prowadzony przez zoptymalizowany harness, analizuje każdą odpowiedź proponowaną przez agenta ucznia i, w razie potrzeby, ją poprawia tak, aby korekta była wyrażona w natywnej przestrzeni akcji harnessu docelowego przed wykonaniem.

Poprawione przebiegi służą następnie jako demonstracje treningowe. Dostrajanie na otrzymanych trajektoriach utrwala zachowania indukowane przez harness bezpośrednio w wagach modelu, a w momencie wdrożenia specjalistyczny harness, harness referencyjny i agent harnessujący są wszystkie odrzucane.

Badacze ocenili metodę w trzech domenach — pracy wiedzy opartej na arkuszach kalkulacyjnych (SpreadsheetBench Verified), korzystaniu z wielu aplikacji (AppWorld) oraz rozumowaniu naukowym (USPTO Retrosynthesis). W ocenach bez treningu na modelach granicznych — czyli bez żadnego dostrajania — podejście agent-jako-harness przewyższyło konwencjonalną metodę kod-jako-harness, uzyskując średnio 81,1% wobec 78,1% w testowanych ustawieniach benchmarków i modeli.

W przypadku destylacji makrośrednia skuteczność zadań bazowego modelu o 9 miliardach parametrów — relatywnie kompaktowego jak na obecne standardy — wzrosła z 23,3% do 44,3% po usunięciu specjalistycznego harnessu, przekraczając wynik 41,7%, jaki ten sam model bazowy osiągnął z nadal podłączonym harnessem. Analiza behawioralna wykazała ponadto, że model zdestylowany odzyskał średnio 82,3% z 28 wzorców zachowań indukowanych przez harness, nieobecnych w modelu bazowym — co wskazuje, że model zdestylowany przyswoił sposób działania harnessu, a nie jedynie jego skuteczność.

Autorzy wskazują na kilka ograniczeń. Podejście wymaga dostatecznie zdolnego modelu pełniącego rolę agenta harnessującego, ponieważ słabsze modele generują interwencje przynoszące netto szkodę, a proces weryfikacji zwiększa koszt zbierania trajektorii. Głębsza wiedza domenowa zakodowana w harnessie może również być trudniejsza do przyswojenia wyłącznie poprzez dostrajanie.

Niemniej wyniki sugerują, że rozwój harnessów może stać się skalowalnym źródłem sygnału treningowego — lepsze modele budują lepsze harnessy, a każdy harness oddaje swoje korzyści samemu modelowi, zamiast pozostawiać je uwięzione w scaffoldingu wokół niego. Jak daleko można tę pętlę rozciągnąć, przy ograniczeniach wskazanych przez autorów, to otwarte pytanie, które zdecyduje, czy korzyści z harness będą nadal trafiać do scaffoldingu — czy zaczną trafiać do samych wag.