斯坦福与英伟达发布CLM-8B:AI模型速度最高达TypeSafe AI Jev的9倍
要点速览
- •CLM-8B于9月23日发布,是首个公开的对比语言模型,使实时智能体决策速度达到TypeSafe AI专有模型J的约九倍。
- •该架构建立在冻结的Qwen3-8B骨干网络之上,配备每个约2000万参数的可训练投影头,让轻量级模块负责动作选择,同时保持较低的计算成本。
- •训练分为三个阶段:预训练使用6000万个问答对,中期训练引入3000万个合成难负样本,后训练使用100万个智能体轨迹。
- •该模型在DeepSWE上得分81.6%,在Terminal-Bench 2.1上达到87.6%,均为其参数范围内的最先进水平,并在计算机使用、游戏和WikiRacing等任务上实现与Jev相当的零样本表现。
- •CLM-8B以Apache 2.0许可证提供开放权重,可使用vLLM在单个英伟达GPU上自行部署;其多模态后续版本CLM-35B目标于2026年10月初发布。

斯坦福与英伟达发布了CLM-8B,这是一个使实时智能体决策速度较当前领先系统快约九倍的AI模型。该模型于9月23日发布,是首个公开发布的对比语言模型(Contrastive Language Model)——在这一论文问世之前,这一类别并不存在。
CLM-8B在多个基准测试中的表现与TypeSafe AI的专有模型Jev相当,同时将延迟降低至此前水平的一小部分。在T-Rex游戏基准测试中,CLM-8B单次决策耗时16.5毫秒,而Jev为149.8毫秒。对于将多次决策串联在单次运行中的智能体而言,每次决策的开销会在每一步中累积,这也是延迟数据与准确率分数同等重要的原因。
对比学习如何改变方法
CLM-8B并非从零生成响应,而是运用对比学习构建一个状态与动作并存的共享嵌入空间。当模型决定下一步行动时,它会根据候选动作与当前状态在该空间中的匹配程度进行评分。
该架构构建于冻结的Qwen3-8B骨干网络之上。核心创新在于投影头——每个约2000万参数的小型可训练模块,用于学习将输入映射到对比空间。由于基础模型的权重保持锁定,计算成本得以控制在合理范围内,同时由轻量级投影头承担动作选择的主要工作。每个投影头约占骨干网络80亿参数的千分之二点五,这种不对称性表明实际重新训练的网络部分极少。
在研究员Jacky Kwok的带领下,团队将这些模型称为“System One”模型,这一术语借鉴自丹尼尔·卡尼曼(Daniel Kahneman)区分快速直觉思维与缓慢深思熟虑推理的框架——这一框架将快速、自动化的决策而非冗长的深思置于设计核心。
大规模训练与基准测试结果
该模型的训练分为三个不同阶段。预训练使用6000万个问答对建立基础理解。中期训练引入3000万个合成难负样本。后训练则在100万个智能体轨迹上对系统进行精调。
在测试软件工程能力的编码基准DeepSWE上,CLM-8B得分81.6%。在Terminal-Bench 2.1上,达到87.6%。两项成绩均代表该参数范围内模型的最先进水平,且是通过公开可下载的权重而非封闭系统实现的。
除编码之外,该模型在计算机使用、Super Mario等游戏环境以及WikiRacing等任务上展现出与Jev相当的零样本性能。这一速度优势在所有测试领域均成立,而不仅仅是在得出9倍数据的T-Rex基准测试中。
Apache 2.0许可下的开放权重
CLM-8B以Apache 2.0许可证发布开放权重,这是一种允许在署名条件下商业使用和再分发的宽松许可证。代码和模型文件已在GitHub上提供,整套系统可使用vLLM在单个英伟达GPU上自行部署——这种部署规模使硬件需求在较小团队的承受范围内,与之形成对比的是其性能相当的专有模型Jev。
多模态后续版本CLM-35B已在开发中,目标于2026年10月初发布。该版本将成为检验对比学习方法能否延伸至多模态场景的下一个节点。