Исследователи Meta, Duke и UC Davis представили метод самосовершенствующихся ветвей для оптимизации agent harness
Ключевые выводы
- •Метод обеспечил относительное улучшение на 34,8% в математическом рассуждении олимпиадного уровня с моделью Gemini 3 Flash, повысив точность с 46,0% до 62,0% без переобучения базовой модели.
- •Подход разделяет оптимизацию harness на несколько самосовершенствующихся ветвей, каждая из которых использует отдельное подмножество данных для разработки и собственную политику внесения изменений, а маршрутизатор выбирает наиболее сильную ветвь для каждого входного запроса при развертывании.
- •Прирост производительности распространился за пределы математики на агентные задачи, включая улучшение на 11,% на Terminal-Bench 2.0 и увеличение на 3,8% на SWE-bench Lite.
- •Статья, размещенная как arXiv:2609.37834v1 29 сентября 2026 года, развивает Meta-Harness — более раннюю систему, выпущенную 30 марта 2026 года, которая уже превосходила традиционные методы оптимизации.
- •По словам авторов, результаты были достигнуты только на данных dev-набора без доступа к тестовому набору, однако препринт еще не прошел формальное рецензирование.

Исследователи из Meta, Университета Дьюка и Калифорнийского университета в Дэвисе предложили новый подход к повышению качества ИИ-агентов: не трогать саму модель, а улучшать окружающую ее программную инфраструктуру, используя несколько самосовершенствующихся команд вместо одной.
В препринте под названием «Mixture of Self-Improving Branches for Agent Harness Optimization» исследователи сообщают об относительном улучшении на 34,8% в математическом рассуждении олимпиадного уровня, повысив точность с 46,0% до 62,0% с моделью Gemini 3 Flash — и все это без переобучения самой модели.
Что такое harness и почему это важно
Более формально, agent harness — это программный каркас, окружающий большую языковую модель. Он определяет промпты, которые получает модель, инструменты, которые она может вызывать, контекст, который она видит, и то, как выполняются ее действия.
Поскольку эта инфраструктура является кодом, а не весами модели, ее можно изменять без нового цикла обучения — именно на этом рычаге строится данное направление. Оптимизация harness — это практика автоматического поиска улучшенной версии этой оболочки. Новая статья, опубликованная 29 сентября 2026 года как arXiv:2609.37834v1, непосредственно развивает более раннюю систему под названием Meta-Harness.
Как работает ветвящийся подход
Meta-Harness, выпущенная 30 марта 2026 года, ранее превосходила традиционные методы на различных бенчмарках. В новой работе утверждается, что единственный путь поиска оставляет часть производительности нереализованной.
Поэтому исследователи разделили поиск на несколько специализированных ветвей. Каждая ветвь эволюционирует самостоятельно, работая с отдельным подмножеством данных для разработки и применяя собственную политику внесения изменений.
Ветви также учатся на своей истории. Каждая из них сохраняет случаи, когда она превосходит соседние ветви, и корректирует свою стратегию с учетом результатов предыдущих попыток.
Возникает очевидный вопрос: кто выбирает специалиста? Ответ — маршрутизатор При развертывании он выбирает лучшую головную ветвь для каждого входного запроса.
Весь процесс выполняется только на данных из dev-набора. По словам авторов, взаимодополняющие harness обеспечили свои результаты без какого-либо доступа к тестовому набору.
Цифры бенчмарков
Главный результат был получен в математическом рассуждении олимпиадного уровня. Точность выросла с 46,0% до 62,0% с использованием Gemini 3 Flash, что авторы описывают как относительное улучшение на 34,8%.
Результаты распространились и на агентные задачи. На Terminal-Bench 2.0, который проверяет работу агентов в среде командной строки, система показала прирост 11,6%. SWE-bench Lite, бенчмарк по программной инженерии, продемонстрировал увеличение на 3,8%.
В совокупности три оценки охватывают математическое рассуждение, работу агентов в командной строке и программную инженерию, поэтому заявленные улучшения не ограничиваются одним типом задач.
Кто стоит за работой
Список авторов включает Хаою Дуна (Haoyu Dong), связанного с Meta и Университетом Дьюка, и Цзихао Лина (Zihao Lin), связанного с Meta и UC Davis. Лишу Чжан (Lizhu Zhang) и Чжуокай Чжао (Zhuokai Zhao) указаны как соавторы, разделяющие последнее место.
Статья является препринтом, размещенным на arXiv, то есть она опубликована в открытом доступе, но не обязательно прошла формальное рецензирование.
Что это значит
Скачок с 46,0% до 62,0% на сложной математике, достигнутый без изменения весов модели, указывает на то, что значительные улучшения могут быть получены за счет проектирования среды, в которой работает модель. Для команд, строящих решения на основе больших языковых моделей, это представляет сам harness как оптимизируемый артефакт — тот, который может развиваться параллельно с выпусками моделей, а не ждать их.
Остаются открытые вопросы, за которыми стоит следить. Запуск и поддержка нескольких эволюционирующих ветвей плюс маршрутизатора, вероятно, добавляют сложности, а результаты статьи получены на конкретных бенчмарках и конкретной модели. Пройдет ли подход рецензирование, выдержит ли независимую проверку и распространится ли за пределы Gemini 3 Flash — естественные контрольные точки.
Meta-Harness появилась в марте 2026 года и уже превосходила традиционные методы. Примерно полгода спустя ее преемница, по заявлению авторов, превосходит саму Meta-Harness.