研究人員將 OpenAI 的 GPT-OSS 縮減至 600 億參數,還讓它變得更聰明
重點速覽
- •Multiverse Computing 表示,其將 OpenAI 的 GPT-OSS 模型從 1200 億參數壓縮至 600 億,並降至 4 位元精度。
- •該公司指出,這個較小的模型在 9 項基準測試中有 7 項擊敗了原始全精度模型。
- •該方法讓學生模型向原始未壓縮模型學習,而非向部分壓縮的中間模型學習。
- •修復後的 Hypernova-60B 模型已以開放權重形式發布於 Hugging Face。
- •其背後的壓縮工具仍屬專有技術,且該公司表示僅在 GPT-OSS 上測試過此方法。

Multiverse Computing(總部位於西班牙聖塞巴斯提安的量子運算公司,先前曾推出名為 CompactifAI、以量子概念為靈感的大型語言模型壓縮工具)的研究團隊,已於 8 月 25 日在 Hugging Face 部落格上發表一種名為「量化感知修復」(Quantization-Aware Healing)的方法,內容描述他們如何將 OpenAI 的開源 GPT-OSS 模型從 1200 億參數壓縮至 600 億,並將其記憶體降至 4 位元精度——而這個較小的模型在 9 項測試中有 7 項超越了它所源自的全品質模型。
這項成果的關鍵在於:縮小後的模型是向原始的高品質版本學習,而不是向中途產生的劣質複本學習。
這些研究人員打造了一個更小、更便宜的大型 AI 模型版本,而這個較小的版本最終竟比它被壓縮前的模型更聰明。一般而言,這種情況不應該發生——就像同時失去肌肉卻變得更強壯。但 Multiverse Computing 的團隊表示他們做到了,而箇中原因顯示,業界一直以來縮小 AI 模型的方式其實是錯的。
研究人員在週五發表的論文中寫道:「對於實務工作者而言,實際的訊息是:在以蒸餾為基礎的修復流程中,量化步驟並非需要最小化的成本,而是教師監督的額外機會,最終產出的模型不僅部署成本更低、記憶體佔用更輕,準確度也至少與全精度版本相當。」
模型壓縮通常如何運作
AI 模型的參數可以想像成一整面牆的旋鈕——這些數字儲存了模型學到的一切。旋鈕越多,模型通常越聰明,但執行起來也越笨重。OpenAI 的 GPT-OSS 120B 擁有 1200 億個這樣的旋鈕,而每一個都要耗用記憶體與電力。GPT-OSS 是 OpenAI 於 2025 年 8 月發布的模型系列,也是該公司自 2019 年的 GPT-2 以來首批開放權重的語言模型——正因如此,像這個團隊一樣的外部團隊才能下載並修改它。
為了讓 AI 的部署更便宜,企業會刪減旋鈕並壓縮剩下的部分。這個過程就像壓縮一張照片:檔案變小了,但過度壓縮會讓影像變得模糊,就像從 4K 降到 720p。模型若壓縮得太過頭,效能就會退化。這種取捨一直被廣泛接受。
這些研究人員則走得更遠。他們將 GPT-OSS 縮減至 600 億參數,並把每個參數塞進極小的 4 位元空間——相當於數位世界的極限壓縮。一般來說,這樣做會重創模型,但研究人員找到了實際強化它的方法。在幾乎所有用於比較的基準測試中,這個較小的模型都優於以全精度建構的模型。
影印副本的錯誤
當你縮小一個模型時,通常是透過與「半縮小」版本(即擁有 600 億個旋鈕、精度較高的版本)比較來修正其錯誤。這種師徒式的做法在這個領域稱為知識蒸餾,是由 Geoffrey Hinton 及其同僚在深具影響力的研究中正式確立的技術。問題在於,這個中途版本早已是原始模型的模糊複本。因此,小型模型被教導去模仿一個有缺陷的雙生版本,而且永遠無法超越它。
研究人員所稱的「量化感知修復」改變了學習目標。它讓小模型回頭指向大型、未壓縮的原始模型,並指示它複製該模型的答案。小模型向大師學習,而不是向模糊的中間版本學習。在 9 項測試中的 7 項,這個 4 位元、600 億參數的模型擊敗了本應是其「較佳另一半」的 600 億雙生模型。真正的 1200 億參數模型在多數回合仍然勝出——規模的優勢並未就此消失——但這個「瘦身」版本跨過了沒有人認為它能跨過的門檻。
更小又更聰明之所以重要,是因為 AI 相當吃硬體。修復後的模型所需的記憶體大約只有原始模型的四分之一,參數數量則為一半。這正是「住在資料中心的 AI」與「能塞進一台不錯的桌上型電腦、甚至最終塞進你手機的 AI」之間的差距。4 位元量化早已是 llama.cpp 與 Ollama 等本地 AI 工具的主力格式,這些工具能在消費級硬體上執行壓縮模型——因此這種能在 4 位元下保持準確度的方法,正好落在本地開發者已在使用的路徑上。一個能以一半能耗產生更好結果的模型,對小型實驗室與本地開發者而言意義重大。
這個模型也是免費的。團隊已將修復後的 Hypernova-60B 模型以開放權重形式發布於 Hugging Face,任何人都可以下載並執行。這也延續了開源模型屢屢突破意料之外門檻的趨勢:一個名為 Ox Alpha 的神秘免費模型最近擊敗了某個 Claude 系統,且背後沒有已知的開發者;此外還有圍繞阿里巴巴 Qwen 3.8 Flash Next 的熱議,以及利用 Fable 或 Claude Opus 等較大型 LLM 的推理軌跡來強化小模型的微調浪潮。
不過,也不必過度解讀。用來打造這個 60B 學生模型的壓縮工具屬於專有技術,因此這套方法尚未完全開放,而且團隊只測試了 GPT-OSS——並未測試 Llama、Qwen 或 Mistral 系列。