新聞宏觀經濟史丹佛與 Nvidia 發布 CLM-8B,速度最高可達 TypeSafe AI Jev 的 9 倍

史丹佛與 Nvidia 發布 CLM-8B,速度最高可達 TypeSafe AI Jev 的 9 倍

作者: CryptoBriefing·

重點速覽

  • •CLM-8B 於 9 月 23 日發布,是首個公開發布的對比式語言模型,使即時代理決策速度比 TypeSafe AI 的專有模型 Jev 快約九倍。
  • •該架構建立在凍結的 Qwen3-8B 主幹之上,搭配每個約 2,000 萬參數的可訓練投影頭,讓輕量級模組負責動作選擇,同時保持低運算成本。
  • •訓練分三個階段進行:預訓練使用 6,000 萬組問答對、中段訓練引入 3,000 萬個合成困難負樣本、後訓練在 100 萬條代理軌跡上進行。
  • •該模型在 DeepSWE 上得分 81.6%,在 Terminal-Bench 2.1 上達到 87.6%,均為其參數規模中的最先進結果,並在電腦操作、遊戲與 WikiRacing 等任務上以零樣本方式達到與 Jev 相當的表現。
  • •CLM-8B 以 Apache 2.0 授權釋出開放權重,可使用 vLLM 在單一 Nvidia GPU 上自行託管,其多模態後繼版本 CLM-35B 預定於 2026 年 10 月初發布。
史丹佛與 Nvidia 發布 CLM-8B,速度最高可達 TypeSafe AI Jev 的 9 倍

史丹佛大學與 Nvidia 發布了 CLM-8B,這款 AI 模型使即時代理決策速度比目前領先的系統快約九倍。該模型於 9 月 23 日釋出,是首個公開發布的對比式語言模型(Contrastive Language Model),這一類別在相關論文發表前並不存在。

CLM-8B 在多項基準測試中達到 TypeSafe AI 專有模型 Jev 的效能水準,同時將延遲降至原本的一小部分。在 T-Rex 遊戲基準測試中,CLM-8B 每次決策耗時 16.5 毫秒,而 Jev 為 149.8 毫秒。對於在單次執行中串連多次決策的代理而言,每次決策的額外開銷會在每個步驟中累積,這也是為什麼延遲數據與準確度分數同樣重要。

對比式學習如何改變方法

CLM-8B 不從零開始生成回應,而是運用對比式學習建構一個狀態與動作並存的共享嵌入空間。當模型決定下一步行動時,它會根據候選動作在該空間中與當前狀態的匹配程度進行評分。

此架構建立在凍結的 Qwen3-8B 主幹之上。核心創新在於投影頭——每個約含 2,000 萬參數的小型可訓練模組,用於學習將輸入映射到對比空間。由於基礎模型的權重保持鎖定,運算成本得以控制,同時由輕量級的投影頭負責動作選擇的主要工作。每個投影頭僅約為主幹 80 億參數的 0.25%,這種不對稱性顯示出實際重新訓練的網路部分極少。

由研究員 Jacky Kwok 領導的團隊將這些模型稱為「System One」模型,此術語借用了 Daniel Kahneman 區分快速直覺思考與緩慢深思推理的框架——這一框架將快速、自動化的決策而非冗長的深思置於設計核心。

大規模訓練與基準測試結果

該模型經歷了三個不同的訓練階段。預訓練使用 6,000 萬組問答對建立基礎理解。中段訓練引入了 3,000 萬個合成的困難負樣本。後訓練則在 100 萬條代理軌跡上進行精煉。

在測試軟體工程能力的程式編寫基準 DeepSWE 上,CLM-8B 得分 81.6%。在 Terminal-Bench 2.1 上,它達到 87.6%。這兩項結果均是該參數規模模型中的最先進表現,且是透過可公開下載的權重而非封閉系統達成的。

除了程式編寫之外,該模型在電腦操作、Super Mario 等遊戲環境以及 WikiRacing 等任務上,展現了與 Jev 相當的零樣本效能。這種速度優勢在所有測試領域均成立,不僅限於 9 倍數字所來自的 T-Rex 基準測試。

Apache 2.0 授權下的開放權重

CLM-8B 以 Apache 2.0 授權釋出開放權重,這是一種寬鬆的授權,允許在署名條件下進行商業使用與再散布。程式碼與模型檔案已在 GitHub 上提供,整個系統可使用 vLLM 在單一 Nvidia GPU 上自行託管——這種部署規模讓硬體需求在較小團隊的可及範圍內,與其效能相當的專有模型 Jev 形成對比。

其多模態後繼版本 CLM-35B 已在開發中,預定於 2026 年 10 月初發布。該版本將是檢驗對比式方法能否延伸至多模態環境的下一個里程碑。