ActualitésMacroDes chercheurs réduisent le GPT-OSS d'OpenAI à 60 milliards de paramètres et le rendent plus intelligent

Des chercheurs réduisent le GPT-OSS d'OpenAI à 60 milliards de paramètres et le rendent plus intelligent

Auteur: Decrypt·

Points clés

  • Multiverse Computing a annoncé avoir compressé le modèle GPT-OSS d'OpenAI de 120 milliards de paramètres à 60 milliards et l'avoir réduit à une précision de 4 bits.
  • L'entreprise a rapporté que le modèle réduit a battu le modèle original en pleine précision sur 7 des 9 tests de référence.
  • La méthode entraîne le modèle élève à partir du modèle original non compressé plutôt qu'à partir d'un modèle intermédiaire partiellement compressé.
  • Le modèle réparé Hypernova-60B a été publié en poids ouverts sur Hugging Face.
  • L'outil de réduction sous-jacent reste propriétaire, et l'entreprise a déclaré n'avoir testé la méthode que sur GPT-OSS.
Des chercheurs réduisent le GPT-OSS d'OpenAI à 60 milliards de paramètres et le rendent plus intelligent

Une équipe de recherche de Multiverse Computing — une entreprise de calcul quantique basée à Saint-Sébastien, en Espagne, qui avait précédemment publié un outil de compression inspiré du quantique pour les grands modèles de langage appelé CompactifAI — a publié le 25 août, sur le blog de Hugging Face, une méthode appelée Quantization-Aware Healing, décrivant comment ils ont compressé le modèle ouvert GPT-OSS d'OpenAI de 120 milliards de paramètres à 60 milliards et réduit sa mémoire à une précision de 4 bits — le modèle réduit surpassant le modèle en pleine qualité dont il est issu sur 7 des 9 tests.

La clé de ce résultat : le modèle réduit a été entraîné à partir de la version originale de haute qualité, et non à partir d'une copie intermédiaire affaiblie.

Les chercheurs ont créé une version plus petite et moins coûteuse d'un grand modèle d'IA, et cette version réduite s'est révélée plus intelligente que le modèle dont elle était issue. Normalement, cela ne devrait pas se produire — c'est comme perdre du muscle et devenir plus fort en même temps. Mais le groupe de Multiverse Computing affirme l'avoir fait, et la raison de ce résultat suggère que l'industrie réduisait les modèles d'IA de la mauvaise manière.

« Pour les praticiens, le message pratique est que, dans un pipeline de réparation fondé sur la distillation, l'étape de quantification n'est pas un coût à minimiser mais une opportunité supplémentaire de supervision par le professeur, produisant un modèle à la fois moins coûteux à déployer, plus léger en mémoire et au moins aussi précis que son équivalent en pleine précision », ont écrit les chercheurs dans un article publié vendredi.

Comment fonctionne normalement la compression des modèles

Les paramètres d'un modèle d'IA peuvent être comparés à un immense mur de boutons — des nombres qui contiennent tout ce que le modèle a appris. Plus il y a de boutons, plus le modèle est généralement intelligent, mais plus il est lourd à exécuter. Le GPT-OSS 120B d'OpenAI compte 120 milliards de ces boutons, et chacun d'eux coûte de la mémoire et de l'électricité. GPT-OSS est la famille de modèles qu'OpenAI a publiée en août 2025 comme ses premiers modèles de langage à poids ouverts depuis GPT-2 en 2019 — c'est d'ailleurs ce qui a permis à des équipes externes comme celle-ci de le télécharger et de le modifier.

Pour déployer l'IA à bas coût, les entreprises retirent des boutons et réduisent ceux qui restent. Le processus ressemble à la compression d'une photo : le fichier devient plus petit, mais une compression trop intensive rend l'image floue, un peu comme passer de la 4K au 720p. Réduisez trop un modèle et ses performances se dégradent. Ce compromis a été largement accepté.

Ces chercheurs sont allés plus loin. Ils ont réduit GPT-OSS à 60 milliards de paramètres et fait tenir chacun d'eux dans un minuscule emplacement de 4 bits — l'équivalent numérique d'une compression extrême. Normalement, cela détruirait le modèle, mais les chercheurs ont trouvé un moyen de l'améliorer réellement. Dans presque tous les benchmarks utilisés pour la comparaison, le modèle réduit a surpassé un modèle construit en pleine précision.

L'erreur de la photocopie

Lorsqu'on réduit un modèle, on corrige généralement ses erreurs en le comparant à la version « à moitié réduite » — celle qui compte 60 milliards de boutons et une précision supérieure. Ce procédé de professeur et d'élève est connu dans le domaine sous le nom de distillation de connaissances, une technique formalisée dans des travaux influents de Geoffrey Hinton et ses collègues. Le problème est que le modèle intermédiaire est déjà une copie floue de l'original. Le mini modèle est donc entraîné à imiter un jumeau défectueux, et il ne peut jamais dépasser ce jumeau.

Ce que les chercheurs appellent la « Quantization-Aware Healing » change la cible. Elle ramène le petit modèle vers le grand original non compressé et lui demande de copier les réponses de ce modèle. Le petit modèle apprend du maître, et non de l'intermédiaire embrouillé. Sur 7 des 9 tests, le modèle de 60 milliards de paramètres en 4 bits a battu le jumeau de 60 milliards qui était censé être sa meilleure moitié. Le véritable modèle de 120 milliards de paramètres gagne encore la plupart des manches — la taille n'a pas été abolie —, mais la version « allégée » a franchi un cap que personne ne croyait possible.

Être plus petit et plus intelligent compte, car l'IA dévore le matériel. Le modèle réparé nécessite environ un quart de la mémoire et la moitié des boutons de l'original. C'est l'écart entre une IA qui vit dans un centre de données et une IA qui tient sur un ordinateur de bureau correct — ou, à terme, dans votre téléphone. La quantification en 4 bits est déjà le format de prédilection des outils d'IA locale comme llama.cpp et Ollama, qui exécutent des modèles compressés sur du matériel grand public — une méthode qui conserve la précision à 4 bits s'inscrit donc dans une voie que les développeurs locaux empruntent déjà. Un modèle capable de produire de meilleurs résultats en consommant deux fois moins d'énergie revêt une grande importance pour les petits laboratoires et les développeurs locaux.

Le modèle est également gratuit. L'équipe a publié le modèle réparé Hypernova-60B en poids ouverts sur Hugging Face, afin que chacun puisse le télécharger et l'exécuter. Cela s'inscrit dans une série de modèles ouverts qui franchissent des caps surprenants : un mystérieux modèle gratuit, Ox Alpha, a récemment battu un système Claude sans créateur connu derrière lui ; il y a l'engouement autour du Qwen 3.8 Flash Next d'Alibaba ; et il y a la vague de finetunes qui améliorent les petits modèles en utilisant des traces de raisonnement de grands LLM comme Fable ou Claude Opus.

Il ne faut toutefois pas trop s'emballer. L'outil de réduction qui produit l'élève de 60B est propriétaire, la recette n'est donc pas encore entièrement ouverte, et l'équipe n'a testé que GPT-OSS — pas les familles Llama, Qwen ou Mistral.