Исследователи сжали GPT-OSS от OpenAI до 60 миллиардов параметров и сделали модель умнее
Ключевые выводы
- •Multiverse Computing сообщила, что сжала модель GPT-OSS от OpenAI со 120 миллиардов параметров до 60 миллиардов и снизила точность до 4 бит.
- •По данным компании, меньшая модель превзошла исходную модель с полной точностью в 7 из 9 бенчмарк-тестов.
- •Метод обучает модель-ученика на основе исходной несжатой модели, а не частично сжатой промежуточной модели.
- •Исцелённая модель Hypernova-60B была выпущена в виде открытых весов на Hugging Face.
- •Базовый инструмент сжатия остаётся проприетарным, и компания сообщила, что протестировала метод только на GPT-OSS.

Группа исследователей из компании Multiverse Computing — занимающейся квантовыми вычислениями компании со штаб-квартирой в Сан-Себастьяне (Испания), которая ранее выпустила вдохновлённый квантовой физикой инструмент сжатия больших языковых моделей под названием CompactifAI, — 25 августа опубликовала в блоге Hugging Face метод Quantization-Aware Healing, описывающий, как они сжали открытую модель GPT-OSS от OpenAI со 120 миллиардов параметров до 60 миллиардов и сократили объём памяти до 4-битной точности — при этом меньшая модель превзошла модель полного качества, из которой она была получена, в 7 из 9 тестов.
Ключ к результату: уменьшенную модель обучали на основе исходной высококачественной версии, а не слабой промежуточной копии.
Исследователи создали меньшую и более дешёвую версию большой модели искусственного интеллекта, и эта уменьшенная версия оказалась умнее модели, из которой она была получена путём сжатия. Обычно так происходить не должно — это всё равно что терять мышцы и одновременно становиться сильнее. Однако группа из Multiverse Computing утверждает, что именно этого им удалось добиться, и причина этого говорит о том, что индустрия сжимала модели ИИ неправильно.
«Для практиков практический вывод состоит в том, что в конвейере „исцеления“ на основе дистилляции шаг квантования — это не издержка, которую следует минимизировать, а дополнительная возможность для надзора со стороны учителя, благодаря чему получается модель, одновременно более дешёвая в обслуживании, менее требовательная к памяти и как минимум не менее точная, чем её аналог с полной точностью», — написали исследователи в статье, опубликованной в пятницу.
Как обычно работает сжатие моделей
Параметры модели ИИ можно представить как гигантскую стену регуляторов — числа, в которых хранится всё, чему модель научилась. Больше регуляторов, как правило, означает более умную модель, но и более тяжёлую в работе. У GPT-OSS 120B от OpenAI таких регуляторов 120 миллиардов, и каждый из них требует памяти и электроэнергии. GPT-OSS — это семейство моделей, выпущенное OpenAI в августе 2025 года как её первые языковые модели с открытыми весами со времён GPT-2 в 2019 году — именно это позволило сторонним командам, вроде этой, скачивать и модифицировать её.
Чтобы поставлять ИИ дёшево, компании убирают часть регуляторов и сжимают оставшиеся. Этот процесс похож на сжатие фотографии в архив: файл становится меньше, но слишком сильное сжатие размывает изображение — примерно как переход от 4K к 720p. Если сжать модель слишком сильно, её производительность ухудшается. Этот компромисс давно принят как должное.
Эти исследователи пошли дальше. Они сократили GPT-OSS до 60 миллиардов параметров и уместили каждый из них в крошечный 4-битный слот — цифровой эквивалент экстремального сжатия. Обычно это разрушительно сказалось бы на модели, но исследователи нашли способ её действительно улучшить. Почти во всех бенчмарках, использованных для сравнения, меньшая модель превзошла модель, созданную с полной точностью.
Ошибка ксерокопии
Когда модель сжимают, её ошибки обычно исправляют, сравнивая её с «наполовину сжатой» версией — той, у которой 60 миллиардов регуляторов и более высокая точность. Такая схема «учитель — ученик» известна в этой области как дистилляция знаний — техника, формализованная во влиятельных работах Джеффри Хинтона и его коллег. Проблема в том, что промежуточная модель уже является размытой копией оригинала. Поэтому крошечную модель учат подражать дефектному двойнику, и она никогда не сможет превзойти этого двойника.
То, что исследователи называют «Quantization-Aware Healing», меняет цель. Этот метод направляет малую модель обратно к большому несжатому оригиналу и предписывает ей копировать ответы именно этой модели. Маленькая модель учится у мастера, а не у мутного посредника. В 7 из 9 тестов 4-битная модель с 60 миллиардами параметров обошла 60-миллиардного двойника, который должен был быть её лучшей половиной. Настоящая модель со 120 миллиардами параметров всё ещё выигрывает большинство раундов — размер никто не отменял, — но «диетическая» версия взяла планку, которую никто не считал для неё достижимой.
Меньше и умнее — это важно, потому что ИИ «пожирает» аппаратные ресурсы. Исцелённой модели требуется примерно четверть памяти и половина регуляторов от оригинала. Это разница между ИИ, живущим в дата-центре, и ИИ, который помещается на приличном настольном компьютере — или со временем на вашем смартфоне. 4-битное квантование уже давно является рабочим форматом для локальных ИИ-инструментов вроде llama.cpp и Ollama, которые запускают сжатые модели на потребительском оборудовании, поэтому метод, сохраняющий точность при 4 битах, ложится на путь, которым локальные разработчики уже идут. Модель, способная выдавать лучшие результаты при вдвое меньшем энергопотреблении, очень много значит для небольших лабораторий и локальных разработчиков.
Модель также бесплатна. Команда выпустила исцелённую модель Hypernova-60B в виде открытых весов на Hugging Face, так что любой может её скачать и запустить. Это вписывается в серию недавних успехов открытых моделей, берущих неожиданные высоты: загадочная бесплатная модель Ox Alpha недавно обошла систему Claude, за которой не стоит известного создателя; есть ажиотаж вокруг Qwen 3.8 Flash Next от Alibaba; и есть волна файнтюнов, улучшающих малые модели с помощью цепочек рассуждений больших LLM вроде Fable или Claude Opus.
Впрочем, не стоит впадать в чрезмерный энтузиазм. Инструмент сжатия, создающий 60-миллиардного «ученика», является проприетарным, так что рецепт пока не полностью открыт, а команда протестировала метод только на GPT-OSS — а не на семействах Llama, Qwen или Mistral.