Badacze z Meta, Duke i UC Davis przedstawiają samoulepszające się gałęzie do optymalizacji harnessów agentów
Najważniejsze informacje
- •Metoda przyniosła względny wzrost o 34,8% w rozumowaniu matematycznym na poziomie olimpijskim z modelem Gemini 3 Flash, podnosząc dokładność z 46,0% do 62,0% bez ponownego uczenia modelu bazowego.
- •Podejście dzieli optymalizację harnessów na wiele samoulepszających się gałęzi, z których każda używa odrębnego podzbioru danychjowych i własnej polityki proponowania zmian, a router wybiera najsilniejszą gałąź dla każdego wejścia przy wdrożeniu.
- •Zyski wydajności wykraczały poza matematykę na zadania agentowe, w tym wzrost o 11,6% na Terminal-Bench 2.0 i wzrost o 3,8% na SWE-bench Lite.
- •Praca, opublikowana jako arXiv:2609.37834v1 29 września 2026 roku, bazuje bezpośrednio na Meta-Harness — wcześniejszym systemie wydanym 30 marca 2026 roku, który już przewyższał tradycyjne metody optymalizacji.
- •Według autorów zyski osiągnięto wyłącznie przy użyciu danych ze zbioru rozwojowego, bez dostępu do zbioru testowego, jednak preprint nie przeszedł jeszcze formalnej recenzji naukowej.

Badacze z Meta, Duke University i University of California, Davis zaproponowali nowe podejście do ulepszania agentów AI: pozostawić sam model nietkniętym, a poprawiać szkielet wokół niego, wykorzystując kilka samoulepszających się zespołów zamiast jednego.
W preprincie zatytułowanym „Mixture of Self-Improving Branches for Agent Harness Optimization” badacze zgłaszają względny wzrost o 34,8% w rozumowaniu matematycznym na poziomie olimpijskim, podnosząc dokładność z 46,0% do 62,0% z modelem Gemini 3 Flash — wszystko bez ponownego uczenia samego modelu.
Czym jest harness i dlaczego to ważne
Bardziej formalnie, harness agenta to szkielet kodowy otaczający duży model językowy. Obejmuje on prompty, które otrzymuje model, narzędzia, które może wywoływać, kontekst, który widzi, oraz sposób wykonywania jego działań.
Ponieważ ten szkielet jest kodem, a nie wagami modelu, można go modyfikować bez nowego procesu treningowego — i to właśnie ta dźwignia jest tutaj wykorzystywana. Optymalizacja harnessów to praktyka automatycznego poszukiwania lepszej wersji tej otoczki. Nowa praca, opublikowana 29 września 2026 roku jako arXiv:2609.37834v1, bazuje bezpośrednio na wcześniejszym systemie o nazwie Meta-Harness.
Jak działa podejście z rozgałęzieniami
Meta-Harness, wydany 30 marca 2026 roku, przewyższał już wcześniej tradycyjne metody w różnych testach porównawczych. Nowa praca argumentuje, że pojedyncza ścieżka poszukiwań pozostawia część wydajności niewykorzystaną.
Badacze podzielili więc poszukiwania na wiele wyspecjalizowanych gałęzi. Każda gałąź ewoluuje samodzielnie, pracując z odrębnym podzbiorem danych rozwojowych i stosując własną politykę proponowania zmian.
Gałęzie uczą się również na podstawie swojej historii. Każda z nich zachowuje przypadki, w których wyprzedza pozostałe, i dopracowuje swoją strategię w opar o wyniki wcześniejszych prób.
Nasuwa się oczywiste pytanie: kto wybiera specjalistę? Odpowiedzią jest router. Przy wdrożeniu router wybiera najlepszą głowę gałęzi dla każdego przychodzącego wejścia.
Cały proces przebiega wyłącznie na danych ze zbioru rozwojowego. Według autorów komplementarne harnessy przyniosły zyski bez jakiegokolwiek dostępu do zbioru testowego.
Wyniki testów porównawczych
Główny rezultat dotyczył rozumowania matematycznego na poziomie olimpijskim. Dokładność wzrosła z 46,0% do 62,0% z modelem Gemini 3 Flash, co autorzy przedstawiają jako względny wzrost o 34,8%.
Zyski przeniosły się także na zadania agentowe. Na Terminal-Bench 2.0, który testuje agentów pracujących w środowisku wiersza poleceń, system odnotował wzrost o 11,6%. SWE-bench Lite, test porównawczy z zakresu inżynierii oprogramowania, wykazał wzrost o 3,8%.
Razem te trzy ewaluacje obejmują rozumowanie matematyczne, pracę agentów w wierszu poleceń oraz inżynierię oprogramowania, więc zgłaszane zyski nie ograniczają się do jednego typu zadań.
Kto stoi za tą pracą
Lista autorów obejmuje Haoyu Donga, związanego z Meta i Duke University, oraz Zihao Lina, związanego z Meta i UC Davis. Lizhu Zhang i Zhuokai Zhao figurują jako współostatni autorzy.
Praca to preprint opublikowany na arXiv, co oznacza, że została udostępniona publicznie, ale niekoniecznie przeszła formalną recenzję naukową.
Co to oznacza
Skok z 46,0% do 62,0% w trudnej matematyce, osiągnięty bez dotykania wag modelu, sugeruje, że istotne ulepszenia mogą wynikać z inżynierii środowiska, w którym działa model. Dla zespołów budujących na dużych modelach językowych praca ta przedstawia sam harness jako artefakt możliwy do optymalizacji — taki, który może rozwijać się równolegle z wydaniami modeli, zamiast na nie czekać.
Pozostają otwarte pytania warte obserwacji. Uruchamianie i utrzymywanie wielu ewoluujących gałęzi oraz routera prawdopodobnie zwiększa złożoność, a wyniki pracy pochodzą z konkretnych testów porównawczych i konkretnego modelu. Czy podejście przejdzie recenzję naukową, czy wytrzyma niezależne testy i czy rozszerzy się poza Gemini 3 Flash — to naturalne punkty do śledzenia.
Meta-Harness pojawił się w marcu 2026 roku i już wtedy przewyższał tradycyjne metody. Około pół roku później jego następca twierdzi, że przewyższa samego Meta-Harness.