新闻宏观经济研究人员将OpenAI的GPT-OSS压缩至600亿参数,反而使其更聪明

研究人员将OpenAI的GPT-OSS压缩至600亿参数,反而使其更聪明

作者: Decrypt·

要点速览

  • Multiverse Computing表示,其将OpenAI的GPT-OSS模型从1200亿参数压缩至600亿参数,并降至4位精度。
  • 该公司报告称,在9项基准测试中有7项,较小的模型击败了原始全精度模型。
  • 该方法让学生模型从原始未压缩模型学习,而非从部分压缩的中间模型学习。
  • 修复后的Hypernova-60B模型已以开放权重形式发布在Hugging Face上。
  • 底层压缩工具仍为专有技术,且该公司表示仅在GPT-OSS上测试过该方法。
研究人员将OpenAI的GPT-OSS压缩至600亿参数,反而使其更聪明

总部位于西班牙圣塞巴斯蒂安的量子计算公司Multiverse Computing的研究团队(该公司此前曾发布一款面向大语言模型、名为CompactifAI的量子启发式压缩工具)于8月25日在Hugging Face博客上发表了一种名为Quantization-Aware Healing(量化感知修复)的方法,介绍了他们如何将OpenAI开源的GPT-OSS模型从1200亿参数压缩至600亿参数,并将其内存降至4位精度——而这个较小的模型在9项测试中有7项优于其源自的全精度模型。

这一结果的关键在于:缩小后的模型是从原始高质量版本学习的,而不是从一个较弱的半成品副本学习。

这些研究人员构建了一个更小、更便宜的大型AI模型版本,而这个较小的版本最终被证明比它从中压缩而来的模型更聪明。通常情况下,这不应该发生——这就像失去肌肉却同时变得更强壮。但Multiverse Computing的团队表示他们做到了,而其中的原因表明,业界一直以来压缩AI模型的方式是错误的。

“对于从业者而言,实际的信息是:在基于蒸馏的修复流程中,量化步骤并不是需要最小化的成本,而是教师监督的额外机会,由此产生的模型在部署成本上更低、内存占用更轻,且准确度至少与全精度版本相当。”研究人员在周五发表的论文中写道。

模型压缩通常如何运作

AI模型的参数可以被想象成一整面墙的旋钮——这些数字保存着模型学到的一切。旋钮越多,模型通常越聪明,但运行起来也越沉重。OpenAI的GPT-OSS 120B拥有1200亿个这样的旋钮,而每一个都要消耗内存和电力。GPT-OSS是OpenAI于2025年8月发布的模型家族,是该公司自2019年GPT-2以来首次发布的开放权重语言模型——正是这一点让像该团队这样的外部团队能够下载并修改它。

为了低成本地部署AI,各公司会去掉一部分旋钮并压缩剩下的旋钮。这个过程就像压缩一张照片:文件变小了,但过度压缩会让图像模糊,就像从4K降到720p。把模型压缩得太狠,其性能就会下降。这一权衡早已被普遍接受。

这些研究人员走得更远。他们将GPT-OSS削减至600亿参数,并把每个参数塞进一个微小的4位槽位——相当于数字领域的极限压缩。通常这会重创模型,但研究人员找到了一种切实增强它的方法。在几乎所有用于对比的基准测试中,这个较小的模型都胜过了以全精度构建的模型。

复印件式的错误

在压缩模型时,通常的做法是让模型与“半压缩”版本——即拥有600亿个旋钮、精度更高的那个版本——进行比较,以此修正其错误。这种师生式流程在业内被称为知识蒸馏,该技术由Geoffrey Hinton及其同事在有影响力的工作中正式确立。问题在于,半成品模型本身已经是原件的模糊副本。因此,小模型被教导去模仿一个有缺陷的孪生体,而它永远无法超越这个孪生体。

研究人员所称的“量化感知修复”(Quantization-Aware Healing)改变了目标。它让小模型重新对准那个大而未压缩的原始模型,并指示它复制该模型的答案。小模型向大师学习,而不是向模糊的中间版本学习。在9项测试中有7项,这个4位、600亿参数的模型击败了本应是其“更优半身”的600亿参数孪生体。真正的1200亿参数模型仍在大多数回合中获胜——体量优势并未被消灭——但这个“瘦身”版本跨越了一道没人认为它能跨过的门槛。

更小且更聪明之所以重要,是因为AI极其消耗硬件。修复后的模型所需内存大约为原始模型的四分之一,参数数量约为其一半。这正是“只能住在数据中心的AI”与“可以装进一台像样台式机——乃至最终装进你手机——的AI”之间的差距。4位量化早已是llama.cpp和Ollama等本地AI工具的主力格式,这些工具在消费级硬件上运行压缩模型——因此,一种能在4位精度下保持准确度的方法,恰好落在本地开发者已在使用的路径上。一个在消耗一半能源的同时还能产生更好结果的模型,对小型实验室和本地开发者意义重大。

该模型还是免费的。团队已将修复后的Hypernova-60B模型以开放权重形式发布在Hugging Face上,任何人都可以下载并运行它。这与开源模型不断跨过惊人门槛的连串趋势相吻合:一个神秘的免费模型Ox Alpha最近击败了一个Claude系统,且背后没有已知的开发者;围绕阿里巴巴Qwen 3.8 Flash Next的热议;以及利用Fable或Claude Opus等更大型LLM的推理轨迹来改进小模型的微调浪潮。

不过,也不必过度解读。用于打造这个600亿参数“学生”模型的压缩工具是专有的,因此整套方法尚未完全开源,而且该团队仅在GPT-OSS上进行了测试——并未测试Llama、Qwen或Mistral系列。