NotizieMacroI ricercatori riducono il GPT-OSS di OpenAI a 60 miliardi di parametri e lo rendono più intelligente

I ricercatori riducono il GPT-OSS di OpenAI a 60 miliardi di parametri e lo rendono più intelligente

Autore: Decrypt·

Punti chiave

  • Multiverse Computing ha dichiarato di aver compresso il modello GPT-OSS di OpenAI da 120 miliardi di parametri a 60 miliardi, riducendolo a una precisione a 4 bit.
  • L'azienda ha riferito che il modello più piccolo ha battuto il modello originale a piena precisione in 7 dei 9 test benchmark.
  • Il metodo addestra il modello studente a partire dal modello originale non compresso anziché da un modello intermedio parzialmente compresso.
  • Il modello «guarito» Hypernova-60B è stato rilasciato come pesi aperti su Hugging Face.
  • Lo strumento di compressione sottostante resta proprietario, e l'azienda ha dichiarato di aver testato il metodo solo su GPT-OSS.
I ricercatori riducono il GPT-OSS di OpenAI a 60 miliardi di parametri e lo rendono più intelligente

Un team di ricercatori di Multiverse Computing — un'azienda di calcolo quantistico con sede a San Sebastián, in Spagna, che in precedenza aveva rilasciato uno strumento di compressione a ispirazione quantistica per i grandi modelli linguistici chiamato CompactifAI — ha pubblicato un metodo chiamato Quantization-Aware Healing sul blog di Hugging Face il 25 agosto, descrivendo come hanno compresso il modello open GPT-OSS di OpenAI da 120 miliardi di parametri a 60 miliardi e ne hanno ridotto la memoria a una precisione a 4 bit — con il modello più piccolo che ha superato il modello a piena qualità da cui era derivato in 7 test su 9.

La chiave del risultato: il modello ridotto è stato addestrato a partire dalla versione originale di alta qualità, non da una debole copia intermedia.

I ricercatori hanno costruito una versione più piccola ed economica di un grande modello di intelligenza artificiale, e la versione più piccola si è rivelata più intelligente del modello da cui era stata rimpicciolita. Normalmente questo non dovrebbe accadere: è come perdere massa muscolare e allo stesso tempo diventare più forti. Ma il gruppo di Multiverse Computing afferma che è successo, e la ragione suggerisce che l'industria abbia ridotto i modelli di IA nel modo sbagliato.

«Per chi lavora sul campo, il messaggio pratico è che in una pipeline di healing basata sulla distillazione la fase di quantizzazione non è un costo da minimizzare, ma un'ulteriore opportunità di supervisione da parte del docente, che produce un modello al tempo stesso più economico da servire, più leggero in memoria e almeno altrettanto accurato della controparte a piena precisione», hanno scritto i ricercatori in un paper pubblicato venerdì.

Come funziona normalmente la compressione dei modelli

I parametri di un modello di IA possono essere pensati come un'enorme parete di manopole — numeri che contengono tutto ciò che il modello ha appreso. Più manopole significano generalmente un modello più intelligente, ma anche più pesante da eseguire. Il GPT-OSS 120B di OpenAI ha 120 miliardi di queste manopole, e ognuna costa memoria ed elettricità. GPT-OSS è la famiglia di modelli che OpenAI ha rilasciato nell'agosto 2025 come suoi primi modelli linguistici a pesi aperti dal GPT-2 del 2019 — ed è proprio questo che ha permesso a team esterni come questo di scaricarlo e modificarlo.

Per distribuire l'IA a basso costo, le aziende eliminano manopole e comprimono le superstiti. Il processo è come comprimere una foto in zip: il file diventa più piccolo, ma una compressione eccessiva sfoca l'immagine, un po' come passare dal 4K al 720p. Rimpicciolire troppo un modello ne degrada le prestazioni. Questo compromesso è stato ampiamente accettato.

Questi ricercatori sono andati oltre. Hanno ridotto GPT-OSS a 60 miliardi di parametri e hanno compresso ciascuno di essi in un minuscolo slot a 4 bit — l'equivalente digitale di una compressione estrema. Normalmente questo avrebbe devastato il modello, ma i ricercatori hanno trovato un modo per potenziarlo davvero. In quasi tutti i benchmark utilizzati per il confronto, il modello più piccolo ha superato un modello costruito a piena precisione.

L'errore della fotocopia

Quando si rimpicciolisce un modello, di solito si correggono i suoi errori confrontandolo con la versione «ridotta a metà» — quella con 60 miliardi di manopole e una precisione più alta. Questa routine docente-allievo è nota nel settore come distillazione della conoscenza (knowledge distillation), una tecnica formalizzata in un lavoro influente di Geoffrey Hinton e colleghi. Il problema è che il modello intermedio è già una copia sfocata dell'originale. Al modello minuscolo viene quindi insegnato di imitare un gemello imperfetto, e non potrà mai superare quel gemello.

Quello che i ricercatori chiamano «Quantization-Aware Healing» cambia il bersaglio. Riporta il piccolo modello al grande originale non compresso e gli indica di copiare le risposte di quel modello. Il modello piccolo impara dal maestro, non dalla copia intermedia offuscata. In 7 test su 9, il modello a 4 bit da 60 miliardi ha battuto il gemello da 60 miliardi che avrebbe dovuto essere la sua metà migliore. Il vero modello da 120 miliardi di parametri vince ancora la maggior parte dei round — le dimensioni non sono state abolite — ma la versione «a dieta» ha superato una soglia che nessuno pensava potesse raggiungere.

Più piccolo e più intelligente conta, perché l'IA divora hardware. Il modello «guarito» ha bisogno di circa un quarto della memoria e della metà delle manopole dell'originale. È la differenza tra un'IA che vive in un data center e una che entra in un desktop discreto — o, prima o poi, nel tuo telefono. La quantizzazione a 4 bit è già il formato di riferimento per gli strumenti di IA locale come llama.cpp e Ollama, che eseguono modelli compressi su hardware consumer — quindi un metodo che mantiene l'accuratezza a 4 bit si inserisce in un percorso che gli sviluppatori locali stanno già usando. Un modello in grado di produrre risultati migliori consumando metà dell'energia significa molto per i piccoli laboratori e per gli sviluppatori locali.

Il modello è anche gratuito. Il team ha rilasciato il modello «guarito» Hypernova-60B come pesi aperti su Hugging Face, così chiunque può scaricarlo ed eseguirlo. Ciò si inserisce in una serie di modelli aperti che stanno superando soglie sorprendenti: un misterioso modello gratuito, Ox Alpha, ha recentemente battuto un sistema Claude senza un costruttore noto alle spalle; c'è l'hype attorno a Qwen 3.8 Flash Next di Alibaba; e c'è l'onda di finetune che migliorano i modelli piccoli usando tracce di ragionamento di LLM più grandi come Fable o Claude Opus.

Attenzione a non esagerare, però. Lo strumento di compressione che crea lo studente da 60B è proprietario, quindi la ricetta non è ancora completamente aperta, e il team ha testato solo GPT-OSS — non le famiglie Llama, Qwen o Mistral.