Meta 推出上下文语言模型:能自行编辑记忆的 AI 智能体以更低算力超越固定框架
要点速览
- •来自 Meta Superintelligence Labs、华盛顿大学、麻省理工学院和 Trillium Labs 的研究人员提出了上下文语言模型(CLM),由模型自身通过可编辑文件重写、删除和重组上下文,而无需将记忆管理交给外部框架代码。
- •在零样本条件下,CLM 超越了最先进的上下文管理策略:BrowseComp-Plus 准确率提升 11.4% 且 FLOPs 减少 21.5%,EdgeBench 分数提升 5% 且 FLOPs 减少 59%,并在 24 小时多代码库智能体任务中以同等算力取得 65% 的额外提升。
- •团队证明记忆策略可通过单条自然语言指令引导,且技能演化循环在降低算力的同时将 ContextBench 留出集准确率提升了最多 35.9 个百分点。
- •基于分步 GRPO 的在线强化学习方案使 Qwen3.5-9B 在 BrowseComp-Plus 上的准确率提升 47.6%、FLOPs 减少 12%;集成到 SGLang 的 Suffix Cache Reuse 技术在任务准确率不受影响的情况下将服务端算力削减 35%。
- •作者警告称,可编辑的上下文可能使提示注入或自生成指令跨轮次持续存在,并呼吁在保持灵活性的同时不牺牲完整性的防御手段。

来自 Meta Superintelligence Labs、华盛顿大学、麻省理工学院和 Trillium Labs 的研究团队提出了上下文语言模型(Context Language Models,CLM),这一框架由语言模型自身——而非外部框架——决定其工作上下文的维护方式。这项工作在 9 月底发布于预印本服务器 arXiv 的一篇论文中描述,它挑战了当前长时程 AI 智能体的主流架构——在这类架构中,上下文压缩、摘要和卸载由僵硬的人工编排层处理。
在当今大多数智能体技术栈中,这些记忆逻辑存在于模型之外、模型无法接触的框架代码中。其核心概念很直接:CLM 不把对话历史当作只能追加的日志,而是将实时上下文映射到一个可编辑的文件中。模型可以用普通代码随意重写、删除或重组该文件,每次更改都会在下一步之前同步到其工作记忆中。作者指出,这种对保留、压缩或丢弃内容的无限制控制,使自适应甚至富有创造性的记忆管理策略得以涌现,呼应了"苦涩的教训"(bitter lesson)——即 Rich Sutton 那个颇具影响力的论点:交给规模去学习胜过固定的人为设计规则。
团队报告称,现有模型在零样本条件下获得这一能力后,在一系列长时程基准测试中的表现超越了最先进的上下文管理策略。在深度研究基准 BrowseComp-Plus 上,CLM 的准确率比最强基线高出 11.4%,同时消耗的 FLOPs——浮点运算次数,衡量模型算力的标准尺度——减少 21.5%。在 12 小时代码库优化套件 EdgeBench 上,分数提升了 5%,FLOPs 减少 59%。在 24 小时多代码库智能体集群任务中,该方法在同等算力下带来了 65% 的额外提升;在数学优化任务中,它在多个问题上击败了 OpenEvolve 等专门的演化工作流。这些数字中的效率部分在长时程场景下尤为关键,因为不断累积的上下文会让每次重读都变成反复产生的算力成本。
研究人员还记录了定性上的新行为:模型会维护用于多智能体协作的记分板、定义辅助函数来压缩自身历史,并创建内部的记录角色。
学习记忆管理并高效服务
由于上下文编辑成为模型的内在行为,它本身也可以被学习。研究人员展示了两种途径。其一,用户可以通过单条自然语言指令来引导记忆策略——例如指定在什么上下文长度时进行压缩——模型会相应地调整。其二,技能演化循环能够以文本形式发现可复用的上下文管理流程,在团队的诊断基准 ContextBench 上,将出集准确率提升了最多 35.9 个百分点,同时降低了算力消耗。
论文还提出了一种面向 CLM 的在线强化学习方案,该方案建立在分步 GRPO(Group Relative Policy Optimization)之上,并带有以成功为门控的效率优势,倾向于既正确又节省算力的轨迹。将该方案应用于深度研究任务中的 Qwen3.5-9B,BrowseComp-Plus 准确率提升了 47.6%,FLOPs 减少 12%——在更低成本下,与用相同方案训练的基于摘要的框架持平。
服务端仍是一个瓶颈:任意编辑会使标准前缀缓存失效——这一机制通常允许服务引擎跳过对未变更文本的重新计算——从而迫使对未变更文本进行代价高昂的重新预填充。为解决这一问题,团队协同设计了 Suffix Cache Reuse,它在编辑后为存续的 token 复用缓存状态——包括在普通聊天服务中被剥离的推理块之后的 token——同时重新旋转位置编码。该技术集成到开源大语言模型服务框架 SGLang 后,在同等性能下将服务端算力削减了 35%,任务准确率不受影响。
作者坦率地指出了安全隐患:可编辑的上下文开辟了一条新通道,提示注入或模型自生成的指令可能借此跨轮次持续存在,他们呼吁在保持灵活性的同时不牺牲完整性的防御手段。未来工作包括扩展 CLM 强化学习,以及将现有框架中的策略直接蒸馏到模型权重中——朝着记忆管理是被学习而非硬编码的智能体迈出一步。这一目标将颠覆当今的分工,把目前由外部框架掌控的编排逻辑转移到模型自身。