ニュース株式Metaが「Context Language Models」を発表:自らの記憶を編集するAIエージェントが、低い計算コストで固定ハーネスを上回る性能

Metaが「Context Language Models」を発表:自らの記憶を編集するAIエージェントが、低い計算コストで固定ハーネスを上回る性能

著者: Metaverse Post·

重要ポイント

  • •Meta Superintelligence Labs、ワシントン大学、MIT、Trillium Labsの研究者らはContext Language Models(CLMs)を提案しました。この手法では、モデル自身が編集可能なファイルを通じてコンテキストを書き換え、削除、再編成し、メモリ管理を外部ハーネスコードに委ねません。
  • •ゼロショットで使用したCLMsは最先端のコンテキスト管理戦略を上回り、BrowseComp-Plusの精度を21.5%少ないFLOPsで11.4%向上させ、EdgeBenchのスコアを59%少ないFLOPsで5%改善し、24時間のマルチリポジトリ・エージェントタスクでは同一計算量で65%大きい改善を達成しました。
  • •チームは、単一の自然言語指示でメモリポリシーを誘導できることを示し、スキル進化ループがContextBenchのホールドアウト精度を計算量を削減しながら最大35.9ポイント向上させました。
  • •ステップワイズGRPOに基づくオンライン強化学習レシピは、Qwen3.5-9BのBrowseComp-Plus精度を12%少ないFLOPsで47.6%向上させ、SGLangに統合された共同設計のSuffix Cache Reuse手法は、タスク精度に影響なくサーバー側計算を35%削減しました。
  • •著者らは、編集可能なコンテキストによりプロンプトインジェクションや自己生成の指示がターンをまたいで持続する可能性があると警告し、柔軟性を損なわずに完全性を保つ防御策を求めています。
Metaが「Context Language Models」を発表:自らの記憶を編集するAIエージェントが、低い計算コストで固定ハーネスを上回る性能

Meta Superintelligence Labs、ワシントン大学、MIT、Trillium Labsの研究者チームは、Context Language Models(CLMs)を発表しました。これは、外部ハーネスではなく言語モデル自身が作業コンテキストの維持方法を決定するフレームワークです。9月末にプレプリントサーバーarXivに投稿された論文で説明されたこの研究は、コンテキストの圧縮、要約、オフロードを硬直的で手作業で設計されたオーケストレーションレイヤーが担当する、長時間タスク向けAIエージェントの支配的なアーキテクチャに異を唱えるものです。

現在のほとんどのエージェントスタックでは、このメモリロジックはモデルの外部、つまりモデルが決して目にしないフレームワークコード内に存在します。ここでの中核概念はシンプルです。会話履歴を追記専用のログとして扱う代わりに、CLMsはライブコンテキストを編集可能なファイルにミラーリングします。モデルは通常のコードを使って、そのファイルを自由に書き換え、削除、再編成でき、すべての変更は次のステップの前に作業メモリへ同期されます。著者らによれば、何を保持、圧縮、破棄するかについてのこの無制限の制御により、適応的でさえある創造的なメモリ管理戦略が emergent に生まれるといい、これは「bitter lesson(苦い教訓)」、すなわちスケールに委ねられた学習は固定された人間設計のルールに勝るというRich Suttonの影響力ある主張を彷彿とさせます。

チームの報告によれば、既存のモデルはこの能力をゼロショットで与えられただけで、さまざまな長時間タスクベンチマークにおいて最先端のコンテキスト戦略を上回りました。深層リサーチベンチマークであるBrowseComp-Plusでは、CLMsは最強のベースラインに対して11.4%高い精度を、21.5%少ないFLOPs(モデル計算量の標準的な指標である浮動小数点演算数)で達成しました。12時間のリポジトリ最適化スイートであるEdgeBenchでは、59%少ないFLOPsでスコアが5%向上しました。24時間のマルチリポジトリ・エージェントスウォームタスクでは、同一計算量で65%大きい改善をもたらし、数学的最適化ではOpenEvolveなどの専門的な進化的ワークフローを複数の問題で上回りました。これらの数値における効率性の側面は、蓄積されたコンテキストが再読のたびに継続的な計算コストに変わる長時間タスクにおいて重要です。

研究者らは定性的な挙動も記録しています。モデルはマルチエージェント協調のためのスコアボードを維持し、自らの履歴を圧縮するヘルパー関数を定義し、内部のメモ取り役を創設しました。

メモリ管理の学習と効率的なサービング

コンテキスト編集がモデルの内在的な挙動になるため、それ自体を学習することができます。研究者らは2つの経路を実証しました。第一に、ユーザーは単一の自然言語指示でメモリポリシーを誘導できます。たとえば、どのコンテキスト長で圧縮を行うかを指定すると、モデルはそれに応じて適応します。第二に、スキル進化ループがテキスト形式の再利用可能なコンテキスト管理手順を発見でき、チームの診断ベンチマークであるContextBenchのホールドアウト精度を、計算量を削減しながら最大35.9ポイント向上させました。

論文はさらに、CLMs向けのオンライン強化学習レシピを紹介しています。これはステップワイズのGRPO(Group Relative Policy Optimization)に基づき、正確かつ計算効率の良い軌跡を優遇する成功ゲート付き効率性アドバンテージを備えています。深層リサーチタスクのQwen3.5-9Bに適用したところ、このレシピは12%少ないFLOPsでBrowseComp-Plus精度を47.6%向上させ、同じレシピで訓練された要約ベースのハーネスに一致しつつ、より低いコストで実現しました。

サービングは依然としてボトルネックです。任意の編集は標準的なプレフィックスキャッシュ(通常、サービングエンジンが未変更テキストの再計算をスキップできるようにする仕組み)を無効化し、未変更テキストの高コストな再プリフィルを強制します。これに対処するため、チームはSuffix Cache Reuseを共同設計しました。これは編集後も生き残ったトークン(通常のチャットサービングで推論ブロックが剥ぎ取られた後に続くトークンを含む)のキャッシュ状態を再利用しつつ、位置エンコーディングを再回転させるものです。大規模言語モデル向けのオープンソースサービングフレームワークであるSGLangに統合されたこの手法は、同一性能でサーバー側の計算を35%削減し、タスク精度には影響しませんでした。

著者らは安全性への影響を率直に指摘しています。編集可能なコンテキストは、プロンプトインジェクションや自己生成の指示がターンをまたいで持続しうる新たな経を開くため、柔軟性を損なわずに完全性を保つ防御策を呼びかけています。今後の作業には、CLM強化学習のスケーリングと、既存ハーネスからの戦略をモデルの重みに直接蒸留することが含まれており、メモリ管理がハードコードではなく学習されるエージェントへの一歩となります。その到達点は現在の分業を逆転させ、外部フレームワークが担っているオーケストレーションロジックをモデル自身の中に移すことになります。

ソース: Metaverse Post