Meta 發表上下文語言模型:可自行編輯記憶的 AI 代理以更低運算成本超越固定框架
重點速覽
- •來自 Meta 超級智慧實驗室、華盛頓大學、MIT 與 Trillium Labs 的研究人員提出上下文語言模型,由模型本身透過可編輯檔案改寫、刪除並重組自身上下文,而非將記憶管理交給外部框架程式碼。
- •在零樣本情況下,CLM 超越了最先進的上下文管理策略:BrowseComp-Plus 準確率在減少 21.5% FLOPs 下提升 11.4%,EdgeBench 成績在減少 59% FLOPs 下提升 5%,並在 24 小時多程式碼庫代理任務中以相同運算量多帶來 65% 的改進。
- •研究團隊證明記憶策略可透過單一自然語言指令引導,且技能演化迴圈在降低運算量的同時,將 ContextBench 保留集準確率提升最多 35.9 個百分點。
- •建立在逐步 GRPO 之上的線上強化學習配方,在減少 12% FLOPs 下將 Qwen35-9B 的 BrowseComp-Plus 準確率提升 47.6%;整合至 SGLang 的 Suffix Cache Reuse 技術則在任務準確率不受影響的情況下,將伺服器端運算量削減 35%。
- •作者警告,可編輯上下文可能使提示注入或模型自行產生的指令跨輪次持續存在,並呼籲建立兼顧彈性與完整性的防禦機制。

來自 Meta 超級智慧實驗室、華盛頓大學、MIT 與 Trillium Labs 的研究團隊提出上下文語言模型(Context Language Models,CLM),在這一框架中,由語言模型本身——而非外部框架(harness)——決定其工作上下文如何維護。這項發表於 9 月底預印本伺服器 arXiv 上的研究,挑戰了長時程 AI 代理的主流架構:在該架構中,上下文壓縮、摘要與卸載均由僵化的人工編寫編排層處理。
在如今大多數代理技術棧中,這類記憶邏輯位於模型之外,存在於模型從未接觸的框架程式碼中。此處的核心概念十分直接:CLM 不將對話歷史視為僅可附加的日誌,而是將即時上下文映射為一個可編輯檔案。模型可以使用普通程式碼任意改寫、刪除或重組該檔案,且每次變更都會在下一步之前同步至其工作記憶。作者指出,這種對保留、壓縮或捨棄內容的不受限控制,使模型得以浮現具適應性——甚至具創造性——的記憶管理策略,呼應了「苦澀的教訓」(bitter lesson),即 Rich Sutton 那項極具影響力的論點:交由規模化學習勝過固定的人為設計規則。
研究團隊報告,現有模型在零樣本情況下獲得這一能力後,在多項長時程基準上超越了最先進的上下文管理策略。在深度研究基準 BrowseComp-Plus 上,CLM 相較最強基線,在減少 21.5% FLOPs(浮點運算次數,衡量模型運算量的標準指標)的情況下,準確率提升了 11.4%。在 12 小時的程式碼庫最佳化測試套件 EdgeBench 上,成績在減少 59% FLOPs 的情況下提升了 5%。在一項 24 小時的多程式碼庫代理群集任務中,該方法在相同運算量下多帶來 65% 的改進;在數學最佳化中,它在多個問題上超越了 OpenEvolve 等專門的演化式工作流程。這些數字中的效率面向在長時程任務中尤其重要,因為累積的上下文會使每次重新閱讀都成為持續發生的運算成本。
研究人員也記錄了質化行為:模型會維護用於多代理協作的記分板、定義輔函式來壓縮自身歷史,並建立內部筆記記錄角色。
學習記憶管理並高效提供服務
由於上下文編輯成為模型的內在行為,它本身也可以被學習。研究人員展示了兩條路徑。其一,使用者可以透過單一自然語言指令引導記憶策略——例如指定在何種上下文長度時進行壓縮——模型即會相應調整。其二,技能演化迴圈能以文字形式發現可重複使用的上下文管理程序,在減少運算量的同時,將團隊診斷基準 ContextBench 的保留集準確率提升最多 35.9 個百分點。
論文還為 CLM 引入了一套線上強化學習配方,建立在逐步 GRPO(Group Relative Policy Optimization)之上,並採用成功門控的效率優勢,偏好既正確又節省運算的軌跡。將該配方應用於深度研究任務中的 Qwen3.5-9B,在減少 12% FLOPs 的情況下,將 BrowseComp-Plus 準確率提升了 47.6%——以更低的成本達到與使用相同配方訓練的摘要式框架相當的效果。
服務仍是瓶頸。任意編輯會使標準前綴快取失效——這一機制通常使服務引擎能跳過對未變文字的重新計算——迫使對未變文字進行昂貴的重新預填充(re-prefilling)。為解決此問題,團隊共同設計了 Suffix Cache Reuse,在編輯後為存留的 token 重用快取狀態——包括在一般聊天服務中位於被剝離推理區塊之後的 token——同時重新旋轉位置編碼。整合至開源大型語言模型服務框架 SGLang 後,該技術在效能相當的情況下將伺服器端運算量削減 35%,且任務準確率不受影響。
作者坦率地指出安全影響:可編輯的上下文開啟了一條新通道,提示注入或模型自行產生的指令可能藉此跨輪次持續存在;他們呼籲建立既能保留彈性又不犧牲完整性的防禦機制。未來工作包括擴展 CLM 強化學習,以及將現有框架的策略直接蒸餾至模型權重——朝著記憶管理是學習所得而非硬式編碼的代理邁進一步。這一終點將顛倒今日的分工,把目前由外部框架掌握的編排邏輯轉移至模型本身。