НовостиМакроИсследование Стэнфорда показывает, что самоорганизующиеся команды ИИ-агентов превосходят модели с дебатами и голосованием

Исследование Стэнфорда показывает, что самоорганизующиеся команды ИИ-агентов превосходят модели с дебатами и голосованием

Автор: CryptoBriefing·

Ключевые выводы

  • •SAT достиг средней точности 66,7% на пяти бенчмарках по математике и физике, опередив лучшего одиночного агента в группе, набравшего 48,8%.
  • •Команды агентов усваивали стратегии сотрудничества всего на 15 задачах AIME 2024 или 25 задачах GPQA Diamond, а затем переносили их без изменений на бенчмарки, с которыми никогда не сталкивались.
  • •SAT также превзошёл одиночный инференс при сопоставимых вычислениях (58,7%) и routing oracle, построенный на индивидуальных ответах агентов (59,0%), что указывает на действительно более качественные рассуждения, а не выбор лучших ответов постфактум.
  • •Прирост производительности сильно коррелировал с demonstrability — лёгкостью отличения корректного рассуждения от некорректного — с коэффициентом Спирмена 0,90, что указывает на наибольшую эффективность подхода в областях с проверяемыми логическими цепочками, такими как математика, физика и структурированные рассуждения.
  • •Результаты оспаривают более раннее исследование Стэнфорда 2026 года, согласно которому одиночные агенты при равных вычислительных бюджетах часто не уступают многоагентным конфигурациям, и представляют дизайн оркестрации как обучаемую дисциплину, а не шаблон ручной настройки.
Исследование Стэнфорда показывает, что самоорганизующиеся команды ИИ-агентов превосходят модели с дебатами и голосованием

Новое исследование Стэнфордского университета представляет фреймворк, в котором группы ИИ-агентов учатся сотрудничать на небольшом наборе прошлых задач, а затем применяют эти стратегии командной работы к совершенно новым проблемам. Подход, получивший название Self-Organizing Agent Teams (SAT), достиг средней точности 66,7% на пяти бенчмарках по математике и физике, уверенно опередив лучшего одиночного агента в группе, который набрал 48,8%.

Как работает SAT

Обычные многоагентные ИИ-системы, как правило, следуют жёсткому протоколу: агенты обсуждают задачу, а затем голосуют за ответ. SAT отходит от этого шаблона, позволяя командам агентов вырабатывать собственные организационные структуры, включая роли, правила участия, фазы обсуждения и схемы потоков информации.

Ключевое наблюдение состоит в том, что эти стратегии можно освоить на удивление малых наборах данных. Команды SAT выводили свои сценарии сотрудничества всего на 15 задачах AIME 2024 или 25 задачах GPQA Diamond, а затем переносили эти стратегии без изменений на отдельные бенчмарки, с которыми никогда не сталкивались. AIME (American Invitational Mathematics Examination) — олимпиадный экзамен по математике, ставший стандартной мерой способностей к рассуждению у frontier-моделей, а GPQA Diamond — самый сложный сегмент научного бенчмарка уровня магистратуры, составленного так, чтобы сбить с толку быстрые поиски в интернете. То, что нескольких десятков задач хватило для стратегий, достаточно устойчивых для переноса без изменений, представляет командную работу как обучаемый и переиспользуемый навык, а не предмет настройки под каждую задачу.

Концепция во многом опирается на организационную психологию. Агенты обмениваются рассуждениями, оспаривают логику друг друга и объединяют частичные решения, чтобы прийти к ответам, которые ни один агент не смог бы получить в одиночку.

Список задействованных моделей напоминает сборную звёзд ИИ, охватывая системы нескольких лабораторий как в закрытом, так и в открытом виде. Задачи по математике и физике выполняли o3-mini, Claude Sonnet 4 и DeepSeek-V3, а бенчмарки на знания и логику — Gemini-2.5-Flash, Llama-4-Maverick и GPT-4.1.

Цифры, которые значение

Средняя точность SAT в 66,7% превзошла не только одиночных агентов. Метод также обошёл одиночный инференс при сопоставимых вычислительных затратах, достигший 58,7%, и routing oracle, построенный на индивидуальных ответах агентов, который набрал 59,0%. Routing oracle задним числом выбирает лучший индивидуальный ответ для каждой задачи, поэтому его преодоление означает, что команда действительно выдаёт более качественные рассуждения, а не просто отбирает лучшие ответы постфактум.

В частности, на AIME 2026 SAT достиг точности 71,2%, превзойдя routing oracle на ,4 процентного пункта.

Одним из самых показательных результатов является то, что исследователи называют «demonstrability» — по сути, то, насколько легко отличить корректное рассуждение от некорректного, когда оно появляется в обсуждении. Прирост производительности коррелировал с demonstrability с коэффициентом корреляции Спирмена 0,90. Когда возникает качественное рассуждение, эти команды распознают его и строят на нём дальнейшую работу. Для практиков эта корреляция служит сигналом к развёртыванию: преимущества SAT сосредоточены там, где команда может проверить, выдерживает ли конкретная линия рассуждений проверку.

Почему это противоречит общепринятому мнению

Более раннее связанное исследование Стэнфорда, опубликованное в 2026 году, показало, что при равных вычислительных бюджетах одиночные агенты часто не уступают или превосходят многоагентные конфигурации. SAT напрямую отвечает на эту критику. Сосредотачиваясь на изучаемых организационных стратегиях, а не на грубых протоколах дебатов, фреймворк демонстрирует, что сотрудничество может давать реальные преимущества, выходящие за рамки ансамблирования или одиночного инференса. Разрыв между 66,7% у SAT и 58,7% у одиночного агента при сопоставимых вычислениях указывает, что ценность не в большем количестве моделей, а в моделях, умеющих работать вместе — вывод, который представляет дизайн оркестрации как обучаемую дисциплину, а не шаблон для ручной настройки.

Сильная корреляция с demonstrability также указывает на естественную границу применимости. SAT лучше всего работает на задачах, где корректное рассуждение узнаваемо при появлении в обсуждении — в областях с проверяемыми цепочками логики, такими как математика, физика и структурированные рассуждения. Насколько далеко тот же подход со сценариями распространяется на открытые задачи без подобных проверок — вопрос, который результаты оставляют открытым.