Stanford-onderzoek toont aan dat zelforganiserende AI-agententeams debate-en-stemmodellen overtreffen
Belangrijkste punten
- •SAT behaalde een gemiddelde nauwkeurigheid van 66,7% over vijf wiskunde- en natuurkunde-benchmarks en overtrof daarmee de beste individuele agent in de groep, die op 48,8% uitkwam.
- •Agententeams leerden hun samenwerkingsstrategieën uit slechts 15 AIME 2024-problemen of 25 GPQA Diamond-problemen en droegen die strategieën ongewijzigd over naar benchmarks die ze nooit eerder hadden gezien.
- •SAT presteerde ook beter dan compute-gematchte inferentie met één agent, die op 58,7% uitkwam, en dan een routing-orakel op basis van de individuele antwoorden van de agenten, dat 59,0% scoorde — een teken dat de teams daadwerkelijk beter redeneerden in plaats van achteraf de beste antwoorden te selecteren.
- •De prestatiewinst correleerde sterk met demonstreerbaarheid, het gemak waarmee correct van onjuist redeneren te onderscheiden is, met een Spearman-correlatie van 0,90, wat suggereert dat de aanpak het beste werkt in domeinen met verifieerbare logische ketens zoals wiskunde, natuurkunde en gestructureerd redeneren.
- •De resultaten weerleggen eerder Stanford-werk uit 2026 waarin individuele agenten bij gelijke compute-budgetten vaak even goed of beter presteerden dan multi-agent-opstellingen, en positioneren orchestratieontwerp als een leerbare discipline in plaats van een handmatig af te stemmen sjabloon.

Een nieuw artikel van Stanford University introduceert een raamwerk waarin groepen AI-agenten leren samenwerken op basis van een kleine set eerdere ervaringen, en die samenwerkingsstrategieën vervolgens toepassen op volledig nieuwe problemen. De aanpak, Self-Organizing Agent Teams (SAT) genoemd, behaalde een gemiddelde nauwkeurigheid van 66,7% over vijf wiskunde- en natuurkunde-benchmarks, en presteerde daarmee ruim beter dan de beste individuele agent in de groep, die op 48,8% uitkwam.
Hoe SAT werkt
Conventionele multi-agent AI-systemen volgen doorgaans een star protocol: agenten debatteren over een probleem en stemmen vervolgens over een antwoord. SAT wijkt daarvan af doordat agententeams hun eigen organisatiestructuren ontwikkelen, waaronder rollen, deelnameregels, conversatiefases en patronen van informatiestroom.
Een kerninzicht is dat deze strategieën kunnen worden geleerd uit opmerkelijk kleine datasets. SAT-teams leidden hun samenwerkingsplaybooks af uit slechts 15 AIME 2024-problemen of 25 GPQA Diamond-problemen, en droegen die strategieën ongewijzigd over naar aparte benchmarks die ze nooit eerder hadden gezien. AIME, de American Invitational Mathematics Examination, is een wiskundewedsttest die is uitgegroeid tot een standaard maatlat voor het redeneervermogen van frontiermodellen, terwijl GPQA Diamond het moeilijkste deel is van een benchmark op wetenschappelijk universitair niveau die is opgezet om snel webonderzoek te doorbreken. Dat enkele tientallen problemen voloeg voor strategieën die robuust genoeg waren om intact te overleven, kadert teamwerk zelf als een leerbaar, herbruikbaar vermogen in plaats van taakgerichte engineering.
Het concept put zwaar uit de organisatiepsychologie. Agenten wisselen redeneringen uit, bekritiseren elkaars logica en combineren deeloplossingen tot antwoorden die geen enkele agent alleen had kunnen produceren.
De modellijn leest als een all-star selectie van AI, met systemen van verschillende labo's in zowel gesloten als open-weight-vorm. Wiskunde- en natuurkunde-opdrachten gebruikten o3-mini, Claude Sonnet 4 en DeepSeek-V3, terwijl kennis- en logica-benchmarks gebruikmaakten van Gemini-2.5-Flash, Llama-4-Maverick en GPT-4.1.
De cijfers die ertoe doen
SAT's gemiddelde nauwkeurigheid van 66,7% overtrof niet alleen individuele agenten. De aanpak presteerde ook beter dan compute-gematchte inferentie met één agent, die op 58,7% uitkwam, en dan een routing-orakel dat was opgebouwd uit de individuele antwoorden van de agenten en 59,0% scoorde. Een routing-orakel selecteert achteraf het beste individuele antwoord per probleem, dus het verslaan ervan betekent dat het team daadwerkelijk beter redeneert in plaats van alleen de mooiste antwoorden te selecteren.
Op AIME 2026 specifiek bereikte SAT een nauwkeurigheid van 71,2%, 0,4 procentpunt boven het routing-orakel.
Eén van de meest veelzeggende bevindingen betreft wat de onderzoekers "demonstreerbaarheid" noemen — in wezen hoe makkelijk correct redeneren te onderscheiden is van onjuist redeneren zodra het in een gesprek opduikt. De prestatiewinst correleerde met demonstreerbaarheid met een Spearman-correlatie van 0,90. Wanneer goed redeneren opduikt, herkennen deze teams het en bouwen ze erop voort. Voor praktijkmensen is die correlatie een signaal voor inzet: SAT's voordelen concentreren zich waar een team kan controleren of een bepaalde redenering standhoudt.
Waarom dit ingaat tegen het gangbare denken
Gerelateerd Stanford-werk dat eerder in 2026 werd gepubliceerd, wees uit dat individuele agenten bij gelijke compute-budgetten vaak even goed of beter presteren dan multi-agent-opstellingen. SAT gaat direct op die kritiek in. Door zich te richten op geleerde organisatiestrategieën in plaats van op brute-force debatprotollen, toont het raamwerk aan dat samenwerking echte voordelen kan opleveren bovenop wat ensembling of individuele inferentie biedt. Het verschil tussen SAT's 66,7% en de 58,7% van de compute-gematchte enkele agent suggereert dat de waarde niet ligt in het hebben van meer modellen, maar in modellen die weten hoe ze moeten samenwerken — een bevinding die orchestratieontwerp positioneert als een leerbare discipline in plaats van een handmatig af te stemmen sjabloon.
De sterke correlatie met demonstreerbaarheid wijst ook op een natuurlijke grens. SAT presteert het best op problemen waar correct redeneren herkenbaar is zodra het in een gesprek verschijnt — domeinen met verifieerbare logische ketens zoals wiskunde, natuurkunde en gestructureerd redeneren. Hoe ver dezelfde playbook-aanpak reikt in open werk zonder zulke controles, is de vraag die de resultaten openlaten.