Meta introduceert Context Language Models: AI-agenten die hun eigen geheugen bewerken presteren beter dan vaste harnesses tegen lagere rekenkosten
Belangrijkste punten
- •Onderzoekers van Meta Superintelligence Labs, de University of Washington, MIT en Trillium Labs stelden Context Language Models voor, waarin het model zelf zijn context herschrijft, verwijdert en herorganiseert via een bewerkbaar bestand in plaats van geheugenbeheer uit te besteden aan externe harness-code.
- •Zonder voorafgaande training presteerden CLMs beter dan state-of-the-art contextbeheerstrategieën, met 11,4% hogere nauwkeurigheid op BrowseComp-Plus bij 21,5% minder FLOPs, 5% betere EdgeBench-scores bij 59% minder FLOPs en 65% grotere verbetering bij gelijke rekenkracht in een 24 uur durende multi-repository-agenttaak.
- •Het team liet zien dat het geheugenbeleid kan worden gestuurd met een enkele instructie in natuurlijke taal en dat een skill-evolutielus de ContextBench held-out-nauwkeurigheid met maximaal 35,9 procentpunten verhoogde terwijl het rekenverbruik daalde.
- •Een online reinforcement-learning-recept gebouwd op stapsgewijze GRPO verhoogde de BrowseComp-Plus-nauwkeurigheid van Qwen3.5-9B met 47,6% met 12% minder FLOPs, terwijl de mede-ontworpen techniek Suffix Cache Reuse, geïntegreerd in SGLang, de server-side rekenkosten met 35% verlaagde zonder dat de taaknauwkeurigheid werd aangetast.
- •De auteurs waarschuwden dat een bewerkbare context prompt-injecties of zelfgegenereerde instructies over meerdere beurten kan laten voortbestaan en pleitten voor verdedigingen die flexibiliteit behouden zonder integriteit op te offeren.

Een team onderzoekers van Meta Superintelligence Labs, de University of Washington, MIT en Trillium Labs heeft Context Language Models (CLMs) geïntroduceerd, een raamwerk waarin het taalmodel zelf — en niet een externe harness — bepaalt hoe zijn werkcontext wordt onderhouden. Het werk, beschreven in een paper die eind september op de preprint-server arXiv verscheen, daagt de heersende architectuur voor long-horizon-AI-agenten uit, waarin contextcompressie, samenvatting en offloading worden verzorgd door starre, met de hand gebouwde orchestratielagen.
In de meeste agentstacks van vandaag bevindt die geheugenlogica zich buiten het model, in frameworkcode die het model nooit te zien krijgt. De kerngedachte hier is eenvoudig: in plaats van de gespreksgeschiedenis te behandelen als een alleen-maar-toevoegen logboek, spiegelen CLMs de live context naar een bewerkbaar bestand. Het model kan dat bestand naar eigen inzicht herschrijven, verwijderen of herorganiseren met gewone code, waarbij elke wijziging vóór de volgende stap wordt gesynchroniseerd met zijn werkgeheugen. Volgens de auteurs geeft deze onbeperkte controle over wat behouden, gecomprimeerd of weggegooid wordt ruimte voor adaptieve — en zelfs creatieve — strategieën voor geheugenbeheer, in lijn met de "bitter lesson", Rich Suttons invloedrijke stelling dat leren dat aan schaal wordt overgelaten vaste, door mensen ontworpen regels verslaat.
Het team meldt dat bestaande modellen, zonder voorafgaande training met deze mogelijkheid, beter presteren dan state-of-the-art contextbeheerstrategieën bij een reeks long-horizon-benchmarks. Op BrowseComp-Plus, een deep-research-benchmark, behaalden CLMs 11,4% hogere nauwkeurigheid terwijl ze 21,5% minder FLOPs — zwevendekommabereingen, de standaard maatstaf voor rekenkracht van modellen — verbruikten dan de sterkste baseline. Op EdgeBench, een 12 uur durende repository-optimalisatiesuite, verbeterden de scores met 5% met 59% minder FLOPs. In een 24 uur durende multi-repository-agent-swarmtaak boekte de aanpak 65% grotere verbetering bij gelijke rekenkracht, en bij wiskundige optimalisatie overtrof het gespecialiseerde evolutionaire workflows zoals OpenEvolve op meerdere problemen. Het efficiëntieaspect van die cijfers is van belang bij lange looptijden, waar opgebouwde context elke herlezing terugbrengt tot terugkerende rekenkosten.
De onderzoekers documenteerden ook kwalitatieve gedragingen: modellen hielden scoreborden bij voor multi-agent-coördinatie, definieerden hulpfuncties om hun eigen geschiedenis te comprimeren en creëerden interne rollen voor notitiebijhouding.
Geheugenbeheer leren en het efficiënt serveren
Omdat het bewerken van context een intrinsieke modelgedraging wordt, kan het zelf ook worden geleerd. De onderzoekers tonen twee routes. Ten eerste kunnen gebruikers het geheugenbeleid sturen met een enkele instructie in natuurlijke taal — bijvoorbeeld door aan te geven bij welke contextlengte compressie moet plaatsvinden — waarna het model zich daaraan aanpast. Ten tweede kan een skill-evolutielus herbruikbare procedures voor contextbeheer in tekstvorm ontdekken, waardoor de held-out-nauwkeurigheid op de diagnostische benchmark van het team, ContextBench, met maximaal 35,9 procentpunten steeg terwijl het rekenverbruik daalde.
De paper introduceert bovendien een online reinforcement-learning-recept voor CLMs, gebouwd op stapsgewijze GRPO (Group Relative Policy Optimization) met een succesgecontroleerd efficiëntievoordeel dat voorkeur geeft aan trajecten die zowel correct als rekenzuinig zijn. Toegepast op Qwen3.5-9B bij deep-research-taken verhoogde het recept de BrowseComp-Plus-nauwkeurigheid met 47,6% met 12% minder FLOPs — gelijk aan een op samenvattingen gebaseerde harness die met hetzelfde recept was getraind, maar tegen lagere kosten.
Serveren blijft een knelpunt. Willekeurige bewerkingen maken standaard prefix-caches ongeldig — het mechanisme dat een serving-engine normaal gesproken laat overschakelen tot het opnieuw berekenen van ongewijzigde tekst — wat kostbaar opnieuw vullen van ongewijzigde tekst afdwingt. Om dit aan te pakken ontwierp het team samen Suffix Cache Reuse, dat gecachte toestanden hergebruikt voor overgebleven tokens na een bewerking — inclusief tokens die volgen op verwijderde reasoningblokken bij gewoon chatserveren — terwijl positionele coderingen opnieuw worden geroteerd. Geïegreerd in SGLang, een open-source serving-framework voor grote taalmodellen, verlaagde de techniek de server-side rekenkosten met 35% bij gelijkblijvende prestaties, zonder dat de taaknauwkeurigheid werd aangetast.
De auteurs wijzen openhartig op veiligheidsimplicaties: een bewerkbare context opent een nieuw kanaal waarmee prompt-injecties of zelfgegenereerde instructies over meerdere beurten kunnen blijven bestaan, en zij pleiten voor verdedigingen die flexibiliteit behouden zonder integriteit op te offeren. Toekomstig werk omvat het opschalen van CLM-reinforcement learning en het destilleren van strategieën uit bestaande harnesses rechtstreeks in modelgewichten — een stap richting agenten wier geheugenbeheer wordt geleerd in plaats van vastgelegd in code. Dat eindpunt zou de huidige verdeling van arbeid omdraaien en de orchestratielogica die externe frameworks momenteel beheren verplaatsen naar de modellen zelf.
Bron: Metaverse Post