Artykuł Stanforda pokazuje, że samorganizujące się zespoły agentów AI przewyższają modele typu debata i głosowanie
Najważniejsze informacje
- •SAT osiągnął średnią skuteczność 66,7% w pięciu testach z matematyki i fizyki, przewyższając najlepszego pojedynczego agenta w grupie, który uzyskał 48,8%.
- •Zespoły agentów nauczyły się strategii współpracy na podstawie zaledwie 15 zadań AIME 2024 lub 25 zadań GPQA Diamond, a następnie przeniosły je bez zmian do testów, z którymi nigdy wcześniej się nie zetknęły.
- •SAT przewyższył także pojedyncze wnioskowanie o wyrównanym budżecie obliczeniowym (58,7%) oraz wyrocznię routingu zbudowaną z indywidualnych odpowiedzi agentów (59,0%), co wskazuje, że zespoły rzeczywiście wytwarzały lepsze rozumowanie, a nie jedynie wybierały najlepsze odpowiedzi po fakcie.
- •Zyski w skuteczności silnie korelowały z demonstrstrowalnością, czyli łatwością odróżnienia poprawnego rozumowania od błędnego, przy korelacji Spearmana wynoszącej 0,90, co sugeruje, że podejście działa najlepiej w dziedzinach o weryfikowalnych łańcuchach logicznych, takich jak matematyka, fizyka i rozumowanie strukturalne.
- •Wyniki podważają wcześniejsze badania Stanforda z 2026 roku, według których pojedyncze agenty często dorównują systemom wieloagentowym przy równych budżetach obliczeniowych, i sytuują projektowanie orkiestracji jako dyscyplinę możliwą do nauczenia, a nie ręcznie strojony szablon.

Nowy artykuł naukowców z Uniwersytetu Stanforda przedstawia ramy, w których grupy agentów AI uczą się współpracować na podstawie niewielkiego zestawu wcześniejszych doświadczeń, a następnie stosują te strategie zespołowe do zupełnie nowych problemów. Podejście, nazwane Self-Organizing Agent Teams (SAT), osiągnęło średnią skuteczność 66,7% w pięciu testach z matematyki i fizyki, wyraźnie przewyższając najlepszego pojedynczego agenta w grupie, który uzyskał 48,8%.
Jak działa SAT
Konwencjonalne systemy wieloagentowe AI zazwyczaj działają według sztywnego protokołu: agenci debatują nad problemem, a następnie głosują nad odpowiedzią. SAT odchodzi od tego schematu, pozwalając zespołom agentów na tworzenie własnych struktur organizacyjnych, obejmujących role, zasady uczestnictwa, fazy rozmowy i wzorce przepływu informacji.
Kluczową obserwacją jest to, że strategie te można nauczyć na podstawie zaskakująco małych zbiorów danych. Zespoły SAT wypracowały swoje playbooki współpracy na podstawie zaledwie 15 zadań AIME 2024 lub 25 zadań GPQA Diamond, a następnie przeniosły te strategie bez zmian do zupełnie innych testów, z którymi nigdy wcześniej się nie zetknęły. AIME, czyli American Invitational Mathematics Examination, to konkurs matematyczny, który stał się standardowym miernikiem zdności rozumowania modeli granicznych, natomiast GPQA Diamond to najtrudniejsza część naukowego testu na poziomie studiów, skonstruowanego tak, by pokonać szybkie wyszukiwanie w sieci. To, że wystarczyło kilkadziesiąt zadań do stworzenia strategii na tyle solidnych, by móc je przenieść w niezmienionej formie, pokazuje pracę zespołową jako umiejętność możliwą do nauczenia i ponownego wykorzystania, a nie inżynierię pod konkretne zadanie.
Koncepcja w dużej mierze czerpie z psychologii organizacji. Agenci wymieniają się rozumowaniem, kwestionują nawzajem swoją logikę i łączą częściowe rozwiązania, aby osiągnąć odpowiedzi, których żaden pojedynczy agent nie byłby w stanie wytworzyć samodzielnie.
Lista wykorzystanych modeli przypomina gwiazdorską drużynę AI, obejmującą systemy z kilku laboratoriów, zarówno zamknięte, jak i o otwartych wagach. Zadania z matematyki i fizyki wykonywały modele o3-mini, Claude Sonnet 4 i DeepSeek-V3, natomiast testy wiedzy i logiki wykorzystywały Gemini-2.5-Flash, Llama-4-Maverick i GPT-4.1.
Liczby, które mają znaczenie
Średnia skuteczność SAT na poziomie 66,7% nie tylko przewyższyła pojedynczych agentów. Wyprzedziła także pojedyncze wnioskowanie o wyrównanym budżecie obliczeniowym, które osiągnęło 58,7%, oraz wyrocznię routingu zbudowaną z indywidualnych odpowiedzi agentów, która uzyskała 59,0%. Wyrocznia routingu wybiera po fakcie najlepszą indywidualną odpowiedź dla każdego zadania, więc jej pokonanie oznacza, że zespół rzeczywiście wytwarza lepsze rozumowanie, a nie jedynie wybiera najtrafniejsze odpowiedzi.
W przypadku AIME 2026 SAT osiągnął skuteczność 71,2%, przewyższając wyrocznię routingu o 0,4 punktu procentowego.
Jedno z najbardziej wymownych ustaleń dotyczy tego, co badacze nazywają „demonstrability” (demonstrowalnością) — czyli tego, jak łatwo po pojawieniu się w rozmowie można odróżnić poprawne rozumowanie od błędnego. Zyski w skuteczności skorelowane były z demonstrstrowalnością współczynnikiem korelacji Spearmana wynoszącym 0,90. Gdy pojawia się dobre rozumowanie, te zespoły je rozpoznają i na nim budują. Dla praktyków korelacja ta stanowi sygnał wdrożeniowy: przewagi SAT koncentrują się tam, gdzie zespół może sprawdzić, czy dane rozumowanie się broni.
Daczego to podważa utarty pogląd
Powiązane badania Stanforda opublikowane wcześniej w 2026 roku wykazały, że przy równych budżetach obliczeniowych pojedyncze agenty często dorównują systemom wieloagentowym lub je przewyższają. SAT odpowiada bezpośrednio na tę krytykę. Koncentrując się na wyuczonych strategiach organizacyjnych zamiast na siłowych protokołach debaty, ramy te pokazują, że współpraca może przynosić realne przewagi wykraczające poza to, co oferuje ensembling czy indywidualne wnioskowanie. Różnica między 66,7% SAT a 58,7% pojedynczego agenta o wyrównanym budżecie obliczeniowym sugeruje, że wartość nie tkwi w posiadaniu większej liczby modeli, lecz w modelach, które potrafią ze sobą współpracować — ustalenie, które sytuuje projektowanie orkiestracji jako dyscyplinę możliwą do nauczenia, a nie szablon do ręcznego strojenia.
Silna korelacja z demonstrstrowalnością wskazuje też na naturalny warunek graniczny. SAT działa najlepiej w przypadku problemów, w których poprawne rozumowanie jest rozpoznawalne, gdy pojawia się w rozmowie — czyli w dziedzinach o weryfikowalnych łańcuchach logicznych, takich jak matematyka, fizyka i rozumowanie strukturalne. Jak daleko podejście oparte na playbookach sięga w pracę otwartą, pozbawioną takich weryfikacji, to pytanie, na które wyniki nie dają odpowiedzi.