AktualnościAkcjeMeta prezentuje Context Language Models: agenci AI edytujący własną pamięć wypadają lepiej niż sztywne harnessy przy niższych kosztach obliczeniowych

Meta prezentuje Context Language Models: agenci AI edytujący własną pamięć wypadają lepiej niż sztywne harnessy przy niższych kosztach obliczeniowych

Autor: Metaverse Post·

Najważniejsze informacje

  • •Badacze z Meta Superintelligence Labs, Uniwersytetu Waszyngtońskiego, MIT i Trillium Labs zaproponowali Context Language Models, w których model sam przepisuje, usuwa i reorganizuje swój kontekst za pomocą edytowalnego pliku, zamiast delegować zarządzanie pamięcią do zewnętrznego kodu harnessa.
  • •Użyte zero-shot, modele CLM przewyższyły najlepsze strategie zarządzania kontekstem: o 11,4% wyższa dokładność przy 21,5% mniej FLOPs na BrowseComp-Plus, o 5% lepsze wyniki na EdgeBench przy 59% mniej FLOPs oraz o 65% większa poprawa przy równych nakładach w 24-godzinnym zadaniu agentowym obejmującym wiele repozytoriów.
  • •Zespół wykazał, że politykę pamięci można sterować jedną instrukcją w języku naturalnym, a pętla ewolucji umiejętności podniosła dokładność na niewidzianym zbiorze ContextBench nawet o 35,9 punktu procentowego redukcji obliczeń.
  • •Receptura uczenia ze wzmocnieniem online oparta na krokowym GRPO podniosła dokładność Qwen3.5-9B na BrowseComp-Plus o 47,6% przy o 12% mniejszej liczbie FLOPs, a współprojektowana technika Suffix Cache Reuse, zintegrowana z SGLang, obniżyła obciążenie obliczeniowe serwera o 35% bez wpływu na dokładność zadań.
  • •Autorzy ostrzegli, że edytowalny kontekst może pozwalać na utrzymywanie się iniekcji promptów lub samodzielnie wygenerowanych instrukcji między turami i wezwali do opracowania zabezpieczeń zachowujących elastyczność bez poświęcania integralności.
Meta prezentuje Context Language Models: agenci AI edytujący własną pamięć wypadają lepiej niż sztywne harnessy przy niższych kosztach obliczeniowych

Zespół badaczy z Meta Superintelligence Labs, Uniwersytetu Waszyngtońskiego, MIT i Trillium Labs zaprezentował Context Language Models (CLM) — framework, w którym to sam model językowy, a nie zewnętrzny harness, decyduje o tym, jak utrzymywany jest jego kontekst roboczy. Praca, opisana w artykule opublikowanym pod koniec września na serwerze preprintów arXiv, podważa dominującą architekturę agentów AI o długim horyzoncie działania, w której kompakcja kontekstu, streszczanie i oddelegowywanie danych obsługiwane są przez sztywne, ręcznie zaprojektowane warstwy orkiestracji.

W większości obecnych stosów agentowych logika pamięci znajduje się poza modelem, w kodzie frameworka, którego model nigdy nie widzi. Kluczowa koncepcja jest prosta: zamiast traktować historię rozmowy jako dziennik tylko do dopisywania, modele CLM odwzorowują żywy kontekst do edytowalnego pliku. Model może następnie dowolnie przepisywać, usuwać lub reorganizować ten plik za pomocą zwykłego kodu, a każda zmiana jest synchronizowana z jego pamięcią roboczą przed kolejnym krokiem. Według autorów ta nieograniczona kontrola nad tym, co zachować, skompresować lub odrzucić, pozwala na wyłanianie się adaptacyjnych — a nawet kreatywnych — strategii zarządzania pamięcią, co przywodzi na myśl „gorzką lekcję”, wpływowy argument Richa Suttona, że uczenie pozostawione skali bije sztywne, ludzkie reguły.

Zespół informuje, że istniejące modele, wyposażone w tę zdolność zero-shot, przewyższają najlepsze strategie zarządzania kontekstem w szeregu benchmarków o długim horyzoncie. Na BrowseComp-Plus, benchmarku badań pogłębionych, modele CLM osiągnęły o 11,4% wyższą dokładność, zużywając o 21,5% mniej FLOPs — operacji zmiennoprzecinkowych, standardowej miary mocy obzeniowej modeli — niż najsilniejsza baza porównawcza. Na EdgeBench, 12-godzinnym zestawie testów optymalizacji repozytoriów, wyniki poprawiły się o 5% przy o 59% mniejszej liczbie FLOPs. W 24-godzinnym zadaniu roju agentów obejmującym wiele repozytoriów podejście przyniosło o 65% większą poprawę przy równych nakładach obliczeniowych, a w optymalizacji matematycznej przewyższyło wyspecjalizowane ewolucyjne przepływy pracy, takie jak OpenEvolve, na kilku problemach. Istotna jest również strona wydajnościowa tych wyników przy długich horyzontach, gdzie narastający kontekst zamienia każde ponowne odczytanie w powtarzający się koszt obliczeniowy.

Badacze udokumentowali także zachowania jakościowe: modele prowadziły tablice wyników dla koordynacji wielu agentów, definiowały funkcje pomocnicze do kompakcji własnej historii oraz tworzyły wewnętrzne role do prowadzenia notatek.

Uczenie zarządzania pamięcią i jego wydajne serwowanie

Ponieważ edycja kontekstu staje się wewnętrznym zachowaniem modelu, sama może być nauczana. Badacze pokazują dwie ścieżki. Po pierwsze, użytkownicy mogą sterować polityką pamięci jedną instrukcją w języku naturalnym — na przykład określając, przy jakiej długości kontekstu powinna nastąpić kompakcja — a model odpowiednio się dostosowuje. Po drugie, pętla ewolucji umiejętności może odkrywać wielokrotnego użytku procedury zarządzania kontekstem w formie tekstowej, podnosząc dokładność na niewidzianym zbiorze testowym diagnostycznego benchmarku zespołu, ContextBench, nawet o 35,9 punktu procentowego przy jednoczesnej redukcji obliczeń.

Artykuł przedstawia również recepturę uczenia ze wzmocnieniem online dla modeli CLM, opartą na krokowym GRPO (Group Relative Policy Optimization) z przewagą wydajnościową uzależnioną od sukcesu, faworyzującą trajektorie jednocześnie poprawne i oszczędne obliczeniowo. Zastosowana do Qwen3.5-9B w zadaniach badań pogłębionych receptura podniosła dokładność na BrowseComp-Plus o 47,6% przy użyciu o 12% mniej FLOPs — dorównując harnessowi opart na streszczeniach wytrenowanemu tą samą recepturą, ale przy niższych kosztach.

Serwowanie pozostaje wąskim gardłem. Dowolne edycje unieważniają standardowe pamięci podręczne prefiksów — mechanizm, który normalnie pozwala silnikowi serwującemu pominąć ponowne obliczanie niezmienionego tekstu — wymuszając kosztowne ponowne wypełnianie przedrostków niezmienionego tekstu. Aby temu zaradzić, zespół współprojektował Suffix Cache Reuse, który ponownie wykorzystuje stany z pamięci podręcznej dla tokenów przetrwałych po edycji — w tym tokenów następujących po usuniętych blokach rozumowania w zwykłym serwowaniu czatu — przy jednoczesnym ponownym rotowaniu kodowań pozycyjnych. Zintegrowane z SGLang, otwartoźródłowym frameworkiem serwowania dużych modeli językowych, rozwiązanie obniżyło obciążenie obliczeniowe po stronie serwera o 35% przy zachowanej wydajności, bez wpływu na dokładność zadań.

Autorzy otwarcie wskazują na implikacje bezpieczeństwa: edytowalny kontekst otwiera nowy kanał, przez który iniekcje promptów lub samodzielnie wygenerowane instrukcje mogą utrzymywać się między turami, i wzywają do opracowania zabezpieczeń zachowujących elastyczność bez poświęcania integralności. Przyszłe prace obejmują skalowanie uczenia ze wzmocnieniem dla modeli CLM oraz destylację strategii z istniejących harnessów bezpośrednio do wag modeli — krok w stronę agentów, których zarządzanie pamięcią jest wyuczone, a nie zakodowane na sztywno. Taki finał odwróciłby obecny podział ról, przenosząc logikę orkiestracji, którą dziś posiadają zewnętrzne frameworki, do samych modeli.

Źródło: Metaverse Post