Meta présente les Context Language Models : des agents IA qui modifient leur propre mémoire surpassent les harnais fixes à moindre coût de calcul
Points clés
- •Des chercheurs de Meta Superintelligence Labs, de l'Université de Washington, du MIT et de Trillium Labs ont proposé les Context Language Models, dans lesquels le modèle lui-même réécrit, supprime et réorganise son contexte via un fichier modifiable plutôt que de déléguer la gestion de la mémoire à un code de harnais externe.
- •Utilisés en zero-shot, les CLM ont surpassé les stratégies de gestion de contexte les plus avancées, augmentant la précision sur BrowseComp-Plus de 11,4 % avec 21,5 % de FLOPs en moins, améliorant les scores sur EdgeBench de 5 % avec 59 % de FLOPs en moins et apportant une amélioration supérieure de 65 % à calcul égal dans une tâche d'agents multi-dépôts de 24 heures.
- •L'équipe a montré que la politique de mémoire peut être pilotée par une seule instruction en langage naturel et qu'une boucle d'évolution de compétences a augmenté jusqu'à 35,9 points de pourcentage la précision hors entraînement sur ContextBench tout en réduisant le calcul.
- •Une recette d'apprentissage par renforcement en ligne construite sur le GRPO pas à pas a augmenté la précision de Qwen3.5-9B sur BrowseComp-Plus de 47,6 % avec 12 % de FLOPs en moins, tandis que la technique co-conçue Suffix Cache Reuse, intégrée à SGLang, a réduit le calcul côté serveur de 35 % sans affecter la précision des tâches.
- •Les auteurs ont averti qu'un contexte modifiable pourrait permettre à des injections de prompts ou à des instructions auto-générées de persister entre les tours et ont appelé à des défenses préservant la flexibilité sans sacrifier l'intégrité.

Une équipe de chercheurs de Meta Superintelligence Labs, de l'Université de Washington, du MIT et de Trillium Labs a présenté les Context Language Models (CLM), un cadre dans lequel le modèle de langage lui-même — plutôt qu'un harnais externe — décide de la manière dont son contexte de travail est maintenu. Ces travaux, décrits dans un article publié fin septembre sur le serveur de prépublications arXiv, remettent en cause l'architecture dominante des agents IA de longue durée, dans laquelle la compression, la synthèse et le déchargement du contexte sont assurés par des couches d'orchestration rigides, conçues à la main.
Dans la plupart des piles d'agents actuelles, cette logique de mémoire réside en dehors du modèle, dans du code de framework que le modèle ne voit jamais. Le concept central ici est simple : au lieu de traiter l'historique de conversation comme un journal en ajout seul, les CLM reflètent le contexte actif dans un fichier modifiable. Le modèle peut réécrire, supprimer ou réorganiser ce fichier à volonté à l'aide de code ordinaire, chaque modification étant synchronisée avec sa mémoire de travail avant l'étape suivante. Selon les auteurs, ce contrôle sans restriction sur ce qu'il faut conserver, compresser ou abandonner permet l'émergence de stratégies de gestion de mémoire adaptatives — voire créatives — faisant écho à la « bitter lesson », l'argument influent de Rich Sutton selon lequel un apprentissage laissé à l'échelle l'emporte sur des règles fixes conçues par l'humain.
L'équipe rapporte que des modèles existants, dotés de cette capacité en zero-shot, surpassent les stratégies de gestion de contexte les plus avancées sur une série de benchmarks longues durées. Sur BrowseComp-Plus, un benchmark de recherche approfondie, les CLM ont atteint une précision supérieure de 11,4 % tout en consommant 21,5 % de FLOPs en moins — opérations en virgule flottante, l'étalon standard du calcul des modèles — que le meilleur système de référence. Sur EdgeBench, une suite d'optimisation de dépôts de 12 heures, les scores se sont améliorés de 5 % avec 59 % de FLOPs en moins. Dans une tâche d'essaim d'agents multi-dépôts de 24 heures, l'approche a apporté une amélioration supérieure de 65 % à calcul égal, et en optimisation mathématique, elle a surpassé des flux de travail évolutionnaires spécialisés tels qu'OpenEvolve sur plusieurs problèmes. L'aspect efficacité de ces chiffres compte sur les longues durées, où le contexte accumulé transforme chaque relecture en coût de calcul récurrent.
Les chercheurs ont également documenté des comportements qualitatifs : les modèles tenaient des tableaux de scores pour la coordination multi-agents, définissaient des fonctions utilitaires pour compresser leur propre historique et créaient des rôles internes de prise de notes.
Apprendre la gestion de la mémoire et la servir efficacement
Comme l'édition du contexte devient un comportement intrinsèque du modèle, elle peut elle-même être apprise. Les chercheurs démontrent deux voies. Premièrement, les utilisateurs peuvent orienter la politique de mémoire avec une seule instruction en langage naturel — par exemple, en spécifiant à quelle longueur de contexte la compression doit intervenir — et le modèle s'adapte en conséquence. Deuxièmement, une boucle d'évolution de compétences peut découvrir des procédures réutilisables de gestion de contexte sous forme textuelle, augmentant jusqu'à 35,9 points de pourcentage la précision hors entraînement sur ContextBench, le benchmark de diagnostic de l'équipe, tout en réduisant le calcul.
L'article introduit en outre une recette d'apprentissage par renforcement en ligne pour les CLM, construite sur le GRPO pas à pas (Group Relative Policy Optimization) avec un avantage d'efficacité conditionné au succès qui favorise les trajectoires à la fois correctes et économes en calcul. Appliquée à Qwen3.5-9B sur des tâches de recherche approfondie, la recette a augmenté la précision sur BrowseComp-Plus de 47,6 % tout en utilisant 12 % de FLOPs en moins — égaling un harnais basé sur la synthèse entraîné avec la même recette, mais à moindre coût.
Le service demeure un goulot d'étranglement. Les modifications arbitraires invalident les caches de préfixe standard — le mécanisme qui permet normalement au moteur de service d'éviter de recalculer le texte inchangé — et forcent un re-préremplissage coûteux du texte inchangé. Pour y remédier, l'équipe a co-conçu Suffix Cache Reuse, qui réutilise les états en cache pour les tokens survivants après une modification — y compris les tokens suivant des blocs de raisonnement supprimés dans le service de chat ordinaire — tout en réorganisant les encodages positionnels. Intégré à SGLang, un framework de service open source pour grands modèles de langage, la technique a réduit le calcul côté serveur de 35 % à performance égale, sans affecter la précision des tâches.
Les auteurs signalent franchement les implications de sécurité : un contexte modifiable ouvre un nouveau canal par lequel des injections de prompts ou des instructions auto-générées pourraient persister entre les tours, et ils appellent à des défenses qui préservent la flexibilité sans sacrifier l'intégrité. Les travaux futurs incluent le passage à l'échelle de l'apprentissage par renforcement des CLM et la distillation de stratégies issues de harnais existants directement dans les poids des modèles — une étape vers des agents dont la gestion de la mémoire est apprise plutôt que codée en dur. Ce point d'arrivée inverserait la division du travail actuelle, en déplaçant la logique d'orchestration détenue par les frameworks externes vers les modèles eux-mêmes.
Source : Metaverse Post