Naukowcy pomniejszyli GPT-OSS OpenAI do 60 miliardów parametrów i uczynili go inteligentniejszym
Najważniejsze informacje
- •Multiverse Computing poinformowało, że skompresowało model GPT-OSS OpenAI ze 120 miliardów parametrów do 60 miliardów i zredukowało go do precyzji 4-bitowej.
- •Firma podała, że mniejszy model pokonał oryginalny model w pełnej precyzji w 7 z 9 testów porównawczych.
- •Metoda uczy model-ucznia na podstawie oryginalnego, nieskompresowanego modelu, a nie częściowo skompresowanego modelu pośredniego.
- •Uzdrowiony model Hypernova-60B został wydany jako otwarte wagi na Hugging Face.
- •Podstawowe narzędzie pomniejszające pozostaje własnościowe, a firma poinformowała, że przetestowała metodę wyłącznie na GPT-OSS.

Zespół badawczy firmy Multiverse Computing — spółki zajmującej się obliczeniami kwantowymi z siedzibą w San Sebastián w Hiszpanii, która wcześniej wydała inspirowane mechaniką kwantową narzędzie kompresji dużych modeli językowych o nazwie CompactifAI — opublikował 25 sierpnia na blogu Hugging Face metodę o nazwie Quantization-Aware Healing, opisującą, jak skompresowali oni otwarty model GPT-OSS OpenAI ze 120 miliardów parametrów do 60 miliardów i zredukowali jego pamięć do precyzji 4-bitowej — przy czym mniejszy model przewyższył model w pełnej jakości, z którego powstał, w 7 z 9 testów.
Kluczem do tego rezultatu: pomniejszony model nauczano na podstawie oryginalnej wersji wysokiej jakości, a nie słabszej, połowicznej kopii.
Badacze zbudowali mniejszą i tańszą wersję dużego modelu AI, a mniejsza wersja okazała się inteligentniejsza niż model, z którego ją pomniejszono. Zwykle nie powinno się to zdarzyć — to jakby tracić mięśnie i jednocześnie stawać się silniejszym. Grupa z Multiverse Computing twierdzi jednak, że im się to udało, a powód sugeruje, że branża pomniejszała modele AI w niewłaściwy sposób.
„Dla praktyków praktyczny przekaz jest taki, że w opartym na destylacji procesie uzdrawiania krok kwantyzacji nie jest kosztem, który trzeba minimalizować, lecz dodatkową okazją do nadzoru ze strony nauczyciela, dającą model jednocześnie tańszy w eksploatacji, lżejszy w pamięci i co najmniej tak dokładny jak jego odpowiednik w pełnej precyzji” — napisali badacze w artykule opublikowanym w piątek.
Jak normalnie działa kompresja modeli
Parametry modelu AI można sobie wyobrazić jako gigantyczną ścianę pokręteł — liczby, które przechowują wszystko, czego model się nauczył. Więcej pokręteł oznacza zazwyczaj inteligentniejszy model, ale też cięższy w uruchamianiu. GPT-OSS 120B OpenAI ma 120 miliardów takich pokręteł, a każde z nich kosztuje pamięć i energię elektryczną. GPT-OSS to rodzina modeli, którą OpenAI wydało w sierpniu 2025 roku jako swoje pierwsze modele językowe o otwartych wagach od czasów GPT-2 z 2019 roku — i właśnie to pozwoliło zewnętrznym zespołom, takim jak ten, na pobranie i modyfikację modelu.
Aby tanio dostarczać AI, firmy usuwają pokręteła i pomniejszają te, które zostają. Proces ten przypomina kompresję zdjęcia: plik staje się mniejszy, ale zbyt duża kompresja rozmywa obraz, podobnie jak przejście z 4K do 720p. Zbyt mocne pomniejszenie modelu pogarsza jego wydajność. Ten kompromis został powszechnie zaakceptowany.
Ci badacze poszli dalej. Zredukowali GPT-OSS do 60 miliardów parametrów i upchnęli każdy z nich w malutkim slocie 4-bitowym — cyfrowym odpowiedniku ekstremalnej kompresji. Zwykle zniszczyłoby to model, ale badacze znaleźli sposób, aby faktycznie go ulepszyć. W niemal wszystkich testach porównawczych mniejszy model wypadał lepiej niż model zbudowany z pełną precyzją.
Błąd kserokopii
Kiedy pomniejsza się model, zwykle naprawia się jego błędy, porównując go z wersją „na wpół pomniejszoną” — tą z 60 miliardami pokręteł i wyższą precyzją. Ten schemat nauczyciel–uczeń jest w tej dziedzinie znany jako destylacja wiedzy — technika sformalizowana w wpływowej pracy Geoffreya Hintona i współpracowników. Problem w tym, że model pośredni jest już rozmytą kopią oryginału. Malutki model uczy się więc naśladować wadliwego bliźniaka i nigdy nie zdoła go przewyższyć.
To, co badacze nazywają „Quantization-Aware Healing”, zmienia cel. Wskazuje małemu modelowi z powrotem duży, nieskompresowany oryginał i nakazuje mu kopiować odpowiedzi tego modelu. Mały model uczy się od mistrza, a nie od rozmytego pośrednika. W 7 z 9 testów 4-bitowy model 60-miliardowy pokonał 60-miliardowego bliźniaka, który miał być jego lepszą połową. Prawdziwy model o 120 miliardach parametrów nadal wygrywa większość rund — rozmiar nie został zniesiony — ale wersja „na diecie” przeskoczyła poprzeczkę, o której nikt nie sądził, że jest w jej zasięgu.
Mniejszy i inteligentniejszy model ma znaczenie, ponieważ AI pochłania sprzęt. Uzdrawiany model potrzebuje mniej więcej ćwierci pamięci i połowy pokręteł oryginału. To różnica między AI, które żyje w centrum danych, a takim, które mieści się na porządnym komputerze stacjonarnym — a docelowo w twoim telefonie. Kwantyzacja 4-bitowa to już podstawowy format lokalnych narzędzi AI, takich jak llama.cpp i Ollama, które uruchamiają skompresowane modele na sprzęcie konsumenckim — metoda utrzymująca dokładność przy 4 bitach trafia więc na ścieżkę, którą lokalni deweloperzy już wykorzystują. Model, który może dawać lepsze wyniki przy zużyciu połowy energii, wiele znaczy dla małych laboratoriów i lokalnych twórców.
Model jest również darmowy. Zespół wydał uzdrowiony model Hypernova-60B jako otwarte wagi na Hugging Face, więc każdy może go pobrać i uruchomić. Wpisuje się to w serię sukcesów otwartych modeli pokonujących zaskakujące poprzeczki: tajemniczy darmowy model Ox Alpha pokonał niedawno system Claude bez znanego twórcy; jest entuzjazm wokół modelu Qwen 3.8 Flash Next Alibaby; jest też fala dostrajań ulepszających małe modele przy użyciu śladów rozumowania większych modeli LLM, takich jak Fable czy Claude Opus.
Nie warto jednak przesadzać. Narzędzie pomniejszające, tworzące 60-miliardowego ucznia, jest własnościowe, więc przepis nie jest jeszcze w pełni otwarty, a zespół testował wyłącznie GPT-OSS — nie rodziny Llama, Qwen czy Mistral.