Harness-Zero: исследователи Google показали, как дистиллировать агентский харнесc ИИ в веса модели
Ключевые выводы
- •Harness-Zero дистиллирует поведение, формируемое оптимизированным харнессом агента, в веса модели, так что прирост производительности сохраняется после замены специализированного харнесса минимальным фиксированным харнессом при развертывании.
- •В подходе agent-as-harness отдельный харнесящий агент, управляемый оптимизированным харнессом, проверяет и исправляет каждый ответ агента-ученика в пространстве действий целевого харнесса, а исправленные прогоны служат обучающими демонстрациями.
- •В оценках без обучения на frontier-моделях подход agent-as-harness превзошёл традиционный метод code-as-harness, показав в среднем 81,1% против 78,1% по протестированным бенчмаркам и настройкам моделей.
- •После дистилляции средний показатель успешности задач базовой модели с 9 млрд параметров вырос с 23,3% до 44,3% при удалённом специализированном харнессе, превзойдя 41,7%, достигнутые той же моделью с подключённым харнессом; дистиллированная модель воспроизвела в среднем 82,3% из 28 моделей поведения, сформированных харнессом.
- •Авторы отмечают ограничения: харнесящий агент должен быть достаточно мощным, поскольку более слабые модели дают в целом вредные вмешательства, процесс проверки повышает стоимость сбора траекторий, а глубоко закодированные знания о домене могут плохо усваиваться только за счёт дообучения.

Исследователи из Пекинского университета, Google и Гонконгского университета науки и технологий представили метод под названием Harness-Zero, который переносит прирост производительности специализированного харнесса ИИ-агентов в саму модель, так что эти результаты больше не зависят от внешнего скаффолдинга. Работа затрагивает ключевую дилемму современного инжиниринга агентов: какая часть способностей агента должна находиться в весах модели, а какая — в окружающем её скаффолдинге.
Харнесс агента — это внешняя система, управляющая взаимодействием языковой модели со средой: она координирует использование инструментов, управляет контекстом и состоянием, а также контролирует цикл взаимодействия. Инжиниринг харнесcов доказал свою эффективность как рычаг повышения производительности агентов, однако достигнутые результаты зависят от наличия конкретного харнесса при развертывании. Поскольку оптимальный харнесс различается между доменами, отдельными задачами и базовыми моделями, универсальный агент сталкивается со сложным компромиссом: либо принять единый общий харнесс, отказавшись от специализированных преимуществ, либо поддерживать растущий набор специализированных решений с растущими затратами на маршрутизацию, контекст и оркестрацию.
Harness-Zero предлагает третий путь: дистилляцию харнесса. Оптимизированный харнесс используется только как руководство на этапе обучения, а формируемое им поведение переносится в веса модели, так что прирост сохраняется даже после удаления специализированного харнесса и использования минимального фиксированного хнесса при развертывании.
Agent-as-Harness: перенос руководства между разными пространствами действий
Главная трудность в том, что оптимизированный и целевой харнесcы различаются как пространством действий, так и доступной информацией, а значит, руководство от оптимизированного харнесса нельзя напрямую использовать как обучающую супервизию. Harness-Zero решает эту проблему подходом agent-as-harness: отдельный харнесящий агент, управляемый оптимизированным харнессом, проверяет каждый ответ, предлагаемый агентом-учеником, и при необходимости исправляет его так, чтобы исправление было выражено в пространстве действий целевого харнесса до выполнения.
Исправленные прогоны затем служат обучающими демонстрациями. Дообучение на полученных траекториях интернализует сформированное харнессом поведение непосредственно в весах модели, а при развертывании специализированный харнесс, эталонный харнесс и харнесящий агент полностью удаляются.
Исследователи оценили метод в трёх доменах — работа со знаниями на основе таблиц (SpreadsheetBench Verified), использование инструментов в нескольких приложениях (AppWorld) и научные рассуждения (USPTO Retrosynthesis). В оценках без обучения на frontier-моделях — то есть без какого-либо дообучения — подход agent-as-harness превзошёл традиционный метод code-as-harness, показав в среднем 81,1% против 78,1% по протестированным бенчмаркам и настройкам моделей.
При дистилляции средний показатель успешности задач базовой модели с 9 млрд параметров — по нынешним меркам довольно компактной — вырос с 23,3% до 44,3% после удаления специализированного харнесса, превзойдя 41,7%, которых та же базовая модель достигала с подключённым харнессом. Поведенческий анализ дополнительно показал, что дистиллированная модель в среднем воспроизвела 82,3% из 28 моделей поведения, сформированных харнессом и отсутствовавших в базовой модели, — это указывает на то, что дистиллированная модель усвоила, как работал харнесс, а не только насколько хорошо он работал.
Авторы отмечают ряд ограничений. Подход требует достаточно мощной модели в роли харнесящего агента, поскольку более слабые модели дают в целом вредные вмешательства, а процесс проверки повышает стоимость сбора траекторий. Более глубокие знания о домене, закодированные в харнессе, также могут хуже усваиваться только за счёт дообучения.
Тем не менее результаты позволяют предположить, что разработка харнесcов может стать масштабируемым источником обучающего сигнала — более сильные модели создают более качественные харнесcы, а каждый харнесс возвращает свои результаты самой модели, а не оставляет их заключёнными в окружающем скаффолдинге. Насколько далеко можно растянуть этот цикл с учётом отмеченных авторами ограничений открытый вопрос, который определит, будут ли результаты харнесcов по-прежнему оседать в скаффолдинге — или начнут переходить в сами веса.