Onderzoekers verkleinen OpenAI's GPT-OSS tot 60 miljard parameters — en maken het slimmer
Belangrijkste punten
- •Multiverse Computing zegt het GPT-OSS-model van OpenAI te hebben gecomprimeerd van 120 miljard parameters naar 60 miljard en te hebben teruggebracht naar 4-bit precisie.
- •Het bedrijf meldde dat het kleinere model het originele model met volledige precisie op 7 van de 9 benchmarktests versloeg.
- •De methode laat het studentmodel leren van het originele, niet-gecomprimeerde model in plaats van van een deels gecomprimeerd tussenmodel.
- •Het herstelde Hypernova-60B-model is uitgebracht als open gewichten op Hugging Face.
- •Het onderliggende verkleiningstool blijft propriëtair, en het bedrijf zegt de methode alleen op GPT-OSS te hebben getest.

Een onderzoeksteam bij Multiverse Computing — een quantumcomputingbedrijf gevestigd in San Sebastián, Spanje, dat eerder een door quantum geïnspireerd compressietool voor grote taalmodellen uitbracht onder de naam CompactifAI — heeft op 25 augustus een methode genaamd Quantization-Aware Healing gepubliceerd op de Hugging Face-blog. Daarin beschrijft het team hoe het het open GPT-OSS-model van OpenAI comprimeerde van 120 miljard parameters naar 60 miljard en het geheugen terugbracht naar 4-bit precisie — waarbij het kleinere model op 7 van de 9 tests beter presteerde dan het volwaardige model waarvan het is afgeleid.
De sleutel tot het resultaat: het verkleinde model leerde van de originele hoogwaardige versie, niet van een zwakke, half-gecomprimeerde kopie.
De onderzoekers bouwden een kleinere, goedkopere versie van een groot AI-model, en die kleinere versie bleek slimmer dan het model waarvan hij was verkleind. Normaal gesproken zou dat niet moeten gebeuren — het is alsof je spiermassa verliest en tegelijkertijd sterker wordt. Maar de groep bij Multiverse Computing zegt dat het toch gebeurde, en de reden suggereert dat de sector AI-modellen al die tijd op de verkeerde manier heeft verkleind.
“Voor professionals is de praktische boodschap dat in een op distillatie gebaseerde healing-pipeline de kwantisatiestap geen kostenpost is die geminimaliseerd moet worden, maar een extra kans op supervisie door het lerarenmodel, met als resultaat een model dat tegelijk goedkoper te bedienen is, lichter is in geheugen en minstens even nauwkeurig is als zijn tegenhanger in volledige precisie,” schreven de onderzoekers in een vrijdag gepubliceerde paper.
Hoe modelcompressie normaal gesproken werkt
Je kunt de parameters van een AI-model zien als een gigantische muur vol draaiknoppen — getallen die alles bevatten wat het model heeft geleerd. Meer knoppen betekenen doorgaans een slimmer model, maar ook een model dat zwaarder draait. OpenAI's GPT-OSS 120B heeft 120 miljard van die knoppen, en elke knop kost geheugen en elektriciteit. GPT-OSS is de modelfamilie die OpenAI in augustus 2025 uitbracht als zijn eerste open-weight taalmodellen sinds GPT-2 in 2019 — precies wat externe teams zoals dit team in staat stelde het model te downloaden en aan te passen.
Om AI goedkoop te leveren, halen bedrijven knoppen weg en verkleinen ze wat overblijft. Het proces lijkt op het zippen van een foto: het bestand wordt kleiner, maar te veel compressie vervaagt het beeld, vergelijkbaar met de stap van 4K naar 720p. Verklein je een model te agressief, dan gaan de prestaties achteruit. Die afweging is breed geaccepteerd.
Deze onderzoekers gingen verder. Ze kapten GPT-OSS terug naar 60 miljard parameters en persten elk ervan in een minuscule 4-bit-positie — het digitale equivalent van extreme compressie. Normaal gesproken zou dat het model volledig uithollen, maar de onderzoekers vonden een manier om het er juist beter op te maken. In vrijwel alle benchmarks die voor de vergelijking werden gebruikt, presteerde het kleinere model beter dan een model dat met volledige precisie was gebouwd.
De fotokopiefout
Als je een model verkleint, corrigeer je de fouten doorgaans door het te vergelijken met de “half-verkleinde” versie — die met 60 miljard knoppen en hogere precisie. Die leraar-leerling-aanpak staat in het veld bekend als kennisdistillatie, een techniek die werd geformaliseerd in invloedrijk werk van Geoffrey Hinton en collega's. Het probleem is dat het tussenmodel allang een wazige kopie van het origineel is. Het kleine model leert daardoor een gebrekkige tweeling na te bootsen, en het kan die tweeling nooit overtreffen.
Wat de onderzoekers “Quantization-Aware Healing” noemen, verandert het doelwit. Het wijst het kleine model terug naar het grote, ongecomprimeerde origineel en draagt het op de antwoorden van dát model te kopiëren. Het kleine model leert van de meester, niet van de wazige tussenversie. Op 7 van de 9 tests versloeg het 4-bit model van 60 miljard parameters de 60-miljard-tweeling die zogezegd zijn betere helft moest zijn. Het echte model met 120 miljard parameters wint nog steeds de meeste rondes — grootte is niet afgeschaft — maar de “dieet”-versie nam een horde waarvan niemand had gedacht dat hij haalbaar was.
Kleiner én slimmer is belangrijk, omdat AI hardware verslindt. Het herstelde model heeft ruwweg een kwart van het geheugen en de helft van de knoppen van het origineel nodig. Dat is het verschil tussen een AI die in een datacenter thuishoort en een die op een degelijke desktop past — of uiteindelijk op je telefoon. 4-bit kwantisatie is allang het standaardformaat voor lokale AI-tools zoals llama.cpp en Ollama, die gecomprimeerde modellen draaien op consumentenhardware — een methode die de nauwkeurigheid op 4 bits behoudt, sluit dus aan bij een pad waar lokale ontwikkelaars al op zitten. Een model dat betere resultaten kan leveren met de helft van het energieverbruik betekent veel voor kleine labs en lokale ontwikkelaars.
Het model is bovendien gratis. Het team bracht het herstelde Hypernova-60B-model als open gewichten uit op Hugging Face, zodat iedereen het kan downloaden en draaien. Dat past in een reeks open modellen die verrassende hordes nemen: het mysterieuze gratis model Ox Alpha versloeg onlangs een Claude-systeem zonder bekende maker achter het model; er is de hype rond Alibaba's Qwen 3.8 Flash Next; en er is de golf van finetunes die kleine modellen verbeteren met redeneersporen van grotere LLM's zoals Fable of Claude Opus.
Nuance is daarbij wel op zijn plaats. De tool waarmee de 60B-student wordt gemaakt, is propriëtair, dus het recept is nog niet volledig open, en het team testte alleen GPT-OSS — niet de families Llama, Qwen of Mistral.