Статья Microsoft описывает дешёвую дистилляцию навыков, позволяющую GPT-5.4-mini превзойти собственный режим рассуждений
Ключевые выводы
- •Статья Microsoft от 11 августа описывает метод дистилляции навыков, позволяющий GPT-5.4-mini сравняться с более дорогим режимом рассуждений или превзойти его за $1–$3 на домен без переобучения.
- •Метод генерирует markdown-документы навыков из 40–130 строк на основе 35–50 траекторий задач; их можно проверять, редактировать и версиционировать как обычные промпт-активы.
- •На бенчмарке ALFWorld GPT-5.4-mini с навыком набрала 0,787 против 0,713 у полного режима рассуждений, используя при этом в 2,7–6 раз меньше выходных токенов по всем бенчмаркам.
- •Статья развивает фреймворк SkillOpt от Microsoft, выпущенный в июне и показавший средний прирост в 23,5 балла для GPT-5.5 на шести бенчмарках.
- •Открытыми остаются вопросы долговечности дистиллированных навыков при обновлении моделей и применимости метода за пределами протестированных доменов.

Исследователи Microsoft нашли способ, позволяющий более дешёвой модели ИИ превзойти её собственный дорогостоящий режим рассуждений, причём этот приём стоит примерно столько же, сколько латте.
Статья, опубликованная 11 августа под названием «Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills», представляет пассивный метод дистилляции навыков, который извлекает компактные наборы правил из небольшого числа примеров задач. Эти правила, написанные на обычном markdown, внедряются в системный промпт модели и фактически обучают её кратчайшим путям, избавляющим от необходимости в дорогостоящих цепочках рассуждений. Целевая модель в данном случае — GPT-5.4-mini, выпущенная ещё в марте.
Значимость результата выходит за рамки одной победы на бенчмарке. Режимы рассуждений увеличивают затраты на инференс, поскольку перед ответом генерируют длинные цепочки промежуточных токенов, а объём выходных токенов — один из главных факторов затрат для провайдеров ИИ в масштабе. Сокращение выходных токенов в разы при сохранении или повышении точности напрямую меняет экономику запуска агентных нагрузок в продакшне, где одна и та же задача может выполняться тысячи или миллионы раз.
Как это работает
Процесс обманчиво прост. Кодирующий агент анализирует от 35 до 50 траекторий задач — по сути, записей того, как модель подходила к конкретным задачам и иногда терпела в них неудачу. Из этих траекторий агент дистиллирует документ «навыка» на естественном языке объёмом от 40 до 130 строк markdown. Это не абстрактные эмбеддинги и не тонкая настройка весов. Это читаемые, проверяемые правила, выведенные из того, что пошло не так, и что сработало.
Такая читаемость — существенный отход от двух доминирующих способов встраивания предметных знаний в модели: файнтюнинга, требующего циклов обучения и специализированного оборудования, и непрозрачных подходов на основе поиска или эмбеддингов. Поскольку дистиллированные знания хранятся в виде обычного текста, разработчики могут проверять, редактировать и вести версионный контроль документа навыка так же, как любого другого промпт-актива, — без конвейера MLOps.
Когда этот документ навыка включается в системный промпт нерассуждающей модели, происходит нечто любопытное. Модель восстанавливает от 55% до более 100% разрыва в производительности, который обычно разделяет режимы рассуждения и нерассуждения. Проще говоря, дешёвый режим начинает работать как дорогой — а иногда и лучше.
Вычислительная стоимость генерации документа навыка для каждого домена составляет от $1 до $3, при этом переобучение модели не требуется.
Результаты бенчмарков
Исследовательская группа под руководством Агамдипа Сингха, Сришти Гаутам, Прияншу Гупты, Никиты Мехротры, Танмая Бакши и Сумита Гулвани оценила подход на четырёх агентных бенчмарках, включая ALFWorld и SpreadsheetBench-Verified.
На ALFWorld GPT-5.4-mini с навыком набрала 0,787 балла, тогда как полный режим рассуждений — 0,713. Более дешёвая и быстрая версия не просто сократила разрыв — она его превзошла.
По всем бенчмаркам модель с навыком использовала в 2,7–6 раз меньше выходных токенов, чем режим рассуждений. Меньше токенов означает и более быстрые ответы — практическое преимущество для интерактивных агентов, где задержка влияет на пользовательский опыт.
Развитие SkillOpt
Статья напрямую развивает фреймворк SkillOpt от Microsoft, выпущенный в июне, который переосмыслил навыки агентов как обучаемые параметры, а не статические веса модели. SkillOpt продемонстрировал средний прирост в 23,5 балла для GPT-5.5 на шести бенчмарках, заложив теоретический фундамент того, что навыки можно оптимизировать независимо от базовой модели.
Новый метод дистилляции делает эту концепцию радикально более доступной. Поскольку документы навыков — это просто markdown-файлы, внедряемые через системные промпты, они работают с существующими стратегиями развёртывания: не нужны ни специализированная инфраструктура инференса, ни особое оборудование, ни циклы переобучения.
Для практиков остаются открытыми вопросы о том, насколько долговечны дистиллированные навыки при обновлении базовых моделей и насколько метод обобщается за пределами протестированных агентных доменов — вопросов, на которые одни лишь результаты бенчмарков пока не отвечают.