NoticiasMacroInvestigadores reducen el GPT-OSS de OpenAI a 60 mil millones de parámetros y lo vuelven más inteligente

Investigadores reducen el GPT-OSS de OpenAI a 60 mil millones de parámetros y lo vuelven más inteligente

Autor: Decrypt·

Puntos clave

  • Multiverse Computing afirmó que comprimió el modelo GPT-OSS de OpenAI de 120 mil millones de parámetros a 60 mil millones y lo redujo a una precisión de 4 bits.
  • La empresa informó que el modelo más pequeño superó al modelo original de precisión completa en 7 de 9 pruebas de benchmark.
  • El método enseña al modelo estudiante a partir del modelo original sin comprimir, en lugar de a partir de un modelo intermedio parcialmente comprimido.
  • El modelo sanado Hypernova-60B fue publicado como pesos abiertos en Hugging Face.
  • La herramienta de reducción subyacente sigue siendo propietaria, y la empresa afirmó que solo ha probado el método en GPT-OSS.
Investigadores reducen el GPT-OSS de OpenAI a 60 mil millones de parámetros y lo vuelven más inteligente

Un equipo de investigación de Multiverse Computing —una empresa de computación cuántica con sede en San Sebastián, España, que anteriormente lanzó una herramienta de compresión inspirada en la computación cuántica para modelos de lenguaje de gran tamaño llamada CompactifAI— publicó el 25 de agosto en el blog de Hugging Face un método llamado Quantization-Aware Healing, en el que describe cómo comprimieron el modelo abierto GPT-OSS de OpenAI de 120 mil millones de parámetros a 60 mil millones y redujeron su memoria a una precisión de 4 bits, con el modelo más pequeño superando en 7 de 9 pruebas al modelo de calidad completa del que fue derivado.

La clave del resultado: al modelo reducido se le enseñó a partir de la versión original de alta calidad, no a partir de una copia intermedia débil.

Los investigadores construyeron una versión más pequeña y más barata de un modelo grande de IA, y la versión más pequeña resultó ser más inteligente que el modelo del que fue reducido. Normalmente, eso no debería ocurrir: es como perder músculo y fortalecerse al mismo tiempo. Pero el grupo de Multiverse Computing afirma que sucedió, y la razón sugiere que la industria ha estado reduciendo los modelos de IA de manera incorrecta.

"For practitioners, the practical message is that in a distillation-based healing pipeline the quantization step is not a cost to be minimized but an additional opportunity for teacher supervision, yielding a model that is simultaneously cheaper to serve, lighter in memory, and at least as accurate as its full-precision counterpart," escribieron los investigadores en un artículo publicado el viernes.

Cómo funciona normalmente la compresión de modelos

Los parámetros de un modelo de IA pueden imaginarse como una pared gigante de perillas: números que contienen todo lo que el modelo ha aprendido. Más perillas generalmente significan un modelo más inteligente, pero también uno más pesado de ejecutar. El GPT-OSS 120B de OpenAI tiene 120 mil millones de esas perillas, y cada una de ellas consume memoria y electricidad. GPT-OSS es la familia de modelos que OpenAI lanzó en agosto de 2025 como sus primeros modelos de lenguaje de pesos abiertos desde GPT-2 en 2019, lo que permitió que equipos externos como este pudieran descargarla y modificarla.

Para entregar IA de forma económica, las empresas eliminan perillas y reducen las que sobreviven. El proceso es como comprimir una foto: el archivo se hace más pequeño, pero demasiada compresión hace que la imagen se vea borrosa, similar a pasar de 4K a 720p. Si se reduce demasiado un modelo, su rendimiento se degrada. Ese compromiso ha sido ampliamente aceptado.

Estos investigadores fueron más allá. Redujeron GPT-OSS a 60 mil millones de parámetros y comprimieron cada uno en un diminuto espacio de 4 bits, el equivalente digital de una compresión extrema. Normalmente eso destrozaría el modelo, pero los investigadores encontraron una forma de mejorarlo realmente. En casi todos los benchmarks utilizados para la comparación, el modelo más pequeño superó a un modelo construido con precisión completa.

El error de la fotocopia

Cuando se reduce un modelo, normalmente se corrigen sus errores comparándolo con la versión "a medio reducir": la que tiene 60 mil millones de perillas y mayor precisión. Esa dinámica de maestro y estudiante se conoce en el campo como destilación de conocimiento, una técnica formalizada en trabajos influyentes de Geoffrey Hinton y sus colegas. El problema es que el modelo intermedio ya es una copia borrosa del original. Por eso, al modelo diminuto se le enseña a imitar a un gemelo defectuoso, y nunca puede superar a ese gemelo.

Lo que los investigadores llaman "Quantization-Aware Healing" cambia el objetivo. Dirige al modelo pequeño de vuelta hacia el original grande y sin comprimir, y le indica que copie las respuestas de ese modelo. El modelo pequeño aprende del maestro, no de la copia intermedia difusa. En 7 de 9 pruebas, el modelo de 4 bits y 60 mil millones superó al gemelo de 60 mil millones que se suponía que era su mitad mejorada. El verdadero modelo de 120 mil millones de parámetros todavía gana la mayoría de las rondas —el tamaño no ha sido abolido—, pero la versión "de dieta" superó un listón que nadie creía posible.

Que un modelo sea más pequeño y más inteligente importa, porque la IA devora hardware. El modelo sanado necesita aproximadamente un cuarto de la memoria y la mitad de las perillas del original. Esa es la diferencia entre una IA que vive en un centro de datos y una que cabe en una computadora de escritorio decente —o, con el tiempo, en tu teléfono—. La cuantización de 4 bits ya es el formato predominante de las herramientas de IA local como llama.cpp y Ollama, que ejecutan modelos comprimidos en hardware de consumo, por lo que un método que mantiene la precisión en 4 bits se inserta en un camino que los desarrolladores locales ya están recorriendo. Un modelo capaz de producir mejores resultados consumiendo la mitad de la energía significa mucho para los laboratorios pequeños y los desarrolladores locales.

El modelo también es gratuito. El equipo publicó el modelo sanado Hypernova-60B como pesos abiertos en Hugging Face, de modo que cualquiera puede descargarlo y ejecutarlo. Esto encaja con una racha de modelos abiertos que superan barreras sorprendentes: un misterioso modelo gratuito, Ox Alpha, venció recientemente a un sistema de Claude sin un creador conocido detrás; está el revuelo en torno a Qwen 3.8 Flash Next de Alibaba; y está la ola de finetunes que mejoran modelos pequeños usando trazas de razonamiento de LLM más grandes como Fable o Claude Opus.

Sin embargo, no hay que exagerar. La herramienta de reducción que crea al estudiante de 60B es propietaria, por lo que la receta aún no es completamente abierta, y el equipo solo probó GPT-OSS, no las familias Llama, Qwen ni Mistral.