新聞股票微軟論文揭露低成本技能蒸餾技術,讓 GPT-5.4-mini 超越自身推理模式

微軟論文揭露低成本技能蒸餾技術,讓 GPT-5.4-mini 超越自身推理模式

作者: CryptoBriefing·

重點速覽

  • 微軟 8 月 11 日的論文展示了一種技能蒸餾方法,讓 GPT-5.4-mini 以每領域 1 至 3 美元的成本追平或超越其更昂貴的推理模式,且無需重新訓練。
  • 該方法從 35 至 50 條任務軌跡產生 40 至 130 行的 Markdown 技能文件,可像一般提示詞資產一樣被檢視、編輯與版控。
  • 在 ALFWorld 基準測試中,強化技能後的 GPT-5.4-mini 獲得 0.787 分,優於完整推理模式的 0.713 分,且在各項基準測試中使用的輸出 token 減少 2.7 至 6 倍。
  • 這篇論文建構於微軟 6 月發布的 SkillOpt 框架之上,該框架在六項基準測試中為 GPT-5.5 帶來平均 23.5 分的提升。
  • 隨著底層模型更新,蒸餫技能的持久性如何,以及該方法能否推廣至受測代理領域之外,仍是未解的問題。
微軟論文揭露低成本技能蒸餾技術,讓 GPT-5.4-mini 超越自身推理模式

微軟研究人員找到一種方法,能讓較便宜的 AI 模型超越自身昂貴的推理模式,而這個訣竅的成本大約只有一杯拿鐵咖啡的價格。

一篇於 8 月 11 日發表、題為「Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills」的論文,介紹了一種被動式技能蒸餾方法,可從少量任務範例中萃取精簡的規則集。這些以純 Markdown 撰寫的規則會被注入模型的系統提示詞,實質上教會模型走捷徑,藉此繞過成本高昂的思維鏈推理。本案例的目標模型是 GPT-5.4-mini,於今年 3 月推出。

這項成果的意義不止於單一基準測試的勝利。推理模式會推高推論成本,因為它們在回答前會產生冗長的中間 token 鏈,而 token 輸出正是大規模 AI 服務商的主要成本來源。將輸出 token 減少數倍、同時維持或提升準確度,能直接改變在生產環境中執行代理工作負載的經濟效益——同樣的任務可能被執行數千次甚至數百萬次。

運作原理

這個流程看似簡單得令人意外。一個編碼代理會檢視 35 至 50 條任務軌跡,也就是模型如何處理特定任務(有時失敗)的記錄。代理從這些軌跡中蒸餾出一份自然語言的「技能」文件,長度為 40 至 130 行 Markdown。這些不是抽象的嵌入向量,也不是微調後的權重調整,而是從錯誤與成功經驗中衍生、可讀取、可稽核的規則。

這種可讀性與目前將領域知識植入模型的兩大主流方式有明顯差異:微調需要訓練流程與專用硬體,而不透明的檢索或嵌入式方法則難以解釋。由於蒸餾後的知識以純文字形式存在,開發者可以像檢視、編輯與版控任何其他提示詞資產一樣處理技能文件——完全不需要 MLOps 管線。

一旦這份技能文件被納入非推理模型的系統提示詞,有趣的事情就發生了。該模型恢復了推理與非推理模式之間效能差距的 55% 至超過 100%。換句話說,便宜的模式開始表現得像昂貴的模式——有時甚至更好。

為每個領域產生技能文件的運算成本介於 1 至 3 美元之間,且無需重新訓練模型。

基準測試結果

由 Agamdeep Singh、Srishti Gautam、Priyanshu Gupta、Nikita Mehrotra、Tanmay Bakshi 與 Sumit Gulwani 領導的研究團隊,在四項代理基準測試(包括 ALFWorld 與 SpreadsheetBench-Verified)上評估了這項方法。

在 ALFWorld 上,強化技能後的 GPT-5.4-mini 獲得 0.787 分,而完整推理模式為 0.713 分。這個更便宜、更快速的版本不僅追平差距——還超越了它。

在各項基準測試中,技能強化後的模型使用的輸出 token 比推理模式減少 2.7 至 6 倍。更少的 token 也意味著更快的回應速度,對於延遲直接影響使用者體驗的互動式代理而言,這是一項實際優勢。

建構於 SkillOpt 之上

這篇論文直接建構於微軟 6 月發布的 SkillOpt 框架之上,該框架將代理技能重新定義為可訓練的參數,而非靜態的模型權重。SkillOpt 在六項基準測試中為 GPT-5.5 帶來平均 23.5 分的提升,確立了技能可獨立於底層模型進行最佳化的理論基礎。

新的蒸餾方法將這個概念變得更容易上手。由於技能文件只是透過系統提示詞注入的 Markdown 檔案,它們可與現有的部署策略搭配運作——無需自訂推論基礎設施、專用硬體或重新訓練。

對實務工作者而言,尚未解答的問題包括:隨著底層模型更新,蒸餾技能能維持多久的效果,以及這項方法能否推廣至受測代理領域之外——這些都是基準測試結果本身尚未能回答的問題。