Meta stellt Context Language Models vor: KI-Agenten, die ihren eigenen Speicher bearbeiten, schlagen feste Harnesses bei geringerem Rechenaufwand
Wichtige Erkenntnisse
- •Forschende von Meta Superintelligence Labs, der University of Washington, dem MIT und Trillium Labs haben Context Language Models vorgeschlagen, bei denen das Modell selbst seinen Kontext über eine editierbare Datei umschreibt, löscht und neu ordnet, statt die Speicherverwaltung an externen Harness-Code zu delegieren.
- •Ohne Training übertrafen CLMs moderne Strategien zum Kontextmanagement: BrowseComp-Plus-Genauigkeit stieg um 11,4 % bei 21,5 % weniger FLOPs, EdgeBench-Ergebnisse verbesserten sich um 5 % bei 59 % weniger FLOPs, und eine 24-stündige Multi-Repository-Agentenaufgabe brachte bei gleichem Rechenaufwand eine 65 % größere Verbesserung.
- •Das Team zeigte, dass sich die Speicherrichtlinie mit einer einzigen Anweisung in natürlicher Sprache steuern lässt und eine Skill-Evolutions-Schleife die ContextBench-Genauigkeit bei ungesehenen Daten um bis zu 35,9 Prozentpunkte steigerte, während der Rechenaufwand sank.
- •Ein auf schrittweisem GRPO basierendes Online-Reinforcement-Learning-Rezept steigerte die BrowseComp-Plus-Genauigkeit von Qwen3.5-9B um 47,6 % bei 12 % weniger FLOPs, während die mitentwickelte Technik Suffix Cache Reuse, integriert in SGLang, den serverseitigen Rechenaufwand um 35 % senkte, ohne die Aufgabengenauigkeit zu beeinträchtigen.
- •Die Autoren warnten, dass ein editierbarer Kontext es Prompt-Injektionen oder selbst generierten Anweisungen ermöglichen könnte, über mehrere Runden hinweg zu bestehen, und forderten Abwehrmaßnahmen, die Flexibilität bewahren, ohne die Integrität zu opfern.

Ein Forschungsteam von Meta Superintelligence Labs, der University of Washington, dem MIT und Trillium Labs hat Context Language Models (CLMs) vorgestellt – ein Framework, bei dem das Sprachmodell selbst und nicht ein externer Harness entscheidet, wie sein Arbeitskontext gepflegt wird. Die Arbeit, beschrieben in einem Ende September auf dem Preprint-Server arXiv veröffentlichten Paper, stellt die vorherrschende Architektur für Langzeit-KI-Agenten in Frage, bei der Kontextkomprimierung, Zusammenfassung und Auslagerung von starren, handentwickelten Orchestrierungsschichten übernommen werden.
In den meisten heutigen Agent-Stacks liegt diese Speicherlogik außerhalb des Modells, in Framework-Code, den das Modell nie sieht. Das Kernkonzept ist hier unkompliziert: Statt den Gesprächsverlauf als rein anhängendes Protokoll zu behandeln, spiegeln CLMs den Live-Kontext in eine editierbare Datei. Das Modell kann diese Datei mithilfe von gewöhnlichem Code nach Belieben umschreiben, löschen oder neu ordnen, wobei jede Änderung vor dem nächsten Schritt mit seinem Arbeitsgedächtnis synchronisiert wird. Laut den Autoren ermöglicht diese uneingeschränkte Kontrolle darüber, was behalten, komprimiert oder verworfen wird, das Entstehen adaptiver – sogar kreativer – Speicherverwaltungsstrategien. Das spiegelt die „bitter lesson“ wider, Rich Suttons einflussreiche These, dass Lernen durch Skalierung feste, menschentworfene Regeln schlägt.
Das Team berichtet, dass bestehende Modelle mit dieser Fähigkeit ohne weiteres Training moderne Strategien zum Kontextmanagement bei einer Reihe von Langzeit-Benchmarks übertreffen. Auf BrowseComp-Plus, einem Deep-Research-Benchmark, erreichten CLMs 11,4 % höhere Genauigkeit bei gleichzeitig 21,5 % weniger FLOPs – Gleitkommaoperationen, der übliche Maßstab für den Rechenaufwand von Modellen – als der stärkste Baseline. Auf EdgeBench, einer 12-stündigen Suite zur-Optimierung, verbesserten sich die Ergebnisse um 5 % bei 59 % weniger FLOPs. Bei einer 24-stündigen Multi-Repository-Agenten-Schwarm-Aufgabe erzielte der Ansatz bei gleichem Rechenaufwand eine 65 % größere Verbesserung, und in der mathematischen Optimierung übertraf er spezialisierte evolutionäre Workflows wie OpenEvolve bei mehreren Problemen. Die Effizienzseite dieser Zahlen ist bei langen Zeithorizonten entscheidend, wo sich angesammelter Kontext bei jedem erneuten Lesen in wiederkehrende Rechenkosten umsetzt.
Die Forschenden dokumentierten auch qualitative Verhaltensweisen: Modelle führten Scoreboards zur Koordination mehrerer Agenten, definierten Hilfsfunktionen, um ihre eigenen Verläufe zu komprimieren, und schufen interne Rollen für Notizen.
Lernende Speicherverwaltung und effizientes Serving
Da die Kontextbearbeitung zu einem intrinsischen Modellverhalten wird, kann sie selbst erlernt werden. Die Forschenden zeigen zwei Wege auf. Erstens können Nutzer die Speicherrichtlinie mit einer einzigen Anweisung in natürlicher Sprache steuern – etwa indem sie vorgeben, bei welcher Kontextlänge komprimiert werden soll – und das Modell passt sich entsprechend an. Zweitens kann eine Skill-Evolutions-Schleife wiederverwendbare Verfahren zur Kontextverwaltung in Textform entdecken und so die Genauigkeit bei ungesehenen Daten auf dem Diagnose-Benchmark des Teams, ContextBench, um bis zu 35,9 Prozentpunkte steigern, während der Rechenaufwand sinkt.
Das Papier stellt außerdem ein Online-Reinforcement-Learning-Rezept für CLMs vor, das auf schrittweisem GRPO (Group Relative Policy Optimization) mit einem erfolgsabhängigen Effizienzvorteil basiert, der Trajektorien bevorzugt, die sowohl korrekt als auch rechenessparend sind. Angewendet auf Qwen3.5-9B bei Deep-Research-Aufgaben steigerte das Rezept die BrowseComp-Plus-Genauigkeit um 47,6 % bei 12 % weniger FLOPs – was einem mit demselben Rezept trainierten zusammenfassungsbasierten Harness entspricht, jedoch zu geringeren Kosten.
Das Serving bleibt ein Engpass. Beliebige Bearbeitungen machen Standard-Präfix-Caches ungültig – den Mechanismus, der einer Serving-Engine normalerweise erlaubt, unveränderten Text nicht neu zu berechnen –, wodurch eine teure erneute Präfüllung des unveränderten Texts erforderlich wird. Um dies zu lösen, entwarf das Team gemeinsam Suffix Cache Reuse, das gecachte Zustände für überlebende Tokens nach einer Bearbeitung wiederverwendet – einschließlich Tokens, die auf entfernten Reasoning-Blöcken im gewöhnlichen Chat-Serving folgen –, während die Positionskodierungen neu rotiert werden. In SGLang, ein Open-Source-Serving-Framework für große Sprachmodelle, integriert, senkte die Technik den serverseitigen Rechenaufwand bei gleicher Leistung um 35 %, ohne dass die Aufgabengenauigkeit beeinträchtigt wurde.
Die Autoren weisen offen auf Sicherheitsimplikationen hin: Ein editierbarer Kontext eröffnet einen neuen Kanal, über den Prompt-Injektionen oder selbst generierte Anweisungen über mehrere Runden hinweg bestehen bleiben könnten, und sie fordern Abwehrmaßnahmen, die Flexibilität bewahren, ohne die Integrität zu opfern. Zukünftige Arbeiten umfassen Skalierung von CLM-Reinforcement-Learning und die Destillation von Strategien bestehender Harnesses direkt in Modellgewichte – ein Schritt hin zu Agenten, deren Speicherverwaltung gelernt statt fest einprogrammiert ist. Dieser Endpunkt würde die heutige Arbeitsteilung umkehren und die Orchestrierungslogik, die derzeit externe Frameworks besitzen, in die Modelle selbst verlagern.
Quelle: Metaverse Post