НовостиАкцииMeta представляет Context Language Models: ИИ-агенты, редактирующие собственную память, превосходят фиксированные фреймворки при меньших затратах вычислений

Meta представляет Context Language Models: ИИ-агенты, редактирующие собственную память, превосходят фиксированные фреймворки при меньших затратах вычислений

Автор: Metaverse Post·

Ключевые выводы

  • •Исследователи из Meta Superintelligence Labs, Университета Вашингтона, MIT и Trillium Labs предложили Context Language Models, в которых модель сама переписывает, удаляет и реорганизует свой контекст через редактируемый файл, а не делегирует управление памятью внешнему коду фреймворка.
  • •Использованные без дополнительного обучения, CLM превзошли передовые стратегии управления контекстом: точность на BrowseComp-Plus выросла на 11,4% при 21,5% меньшем количестве FLOPs, результаты на EdgeBench улучшились на 5% при 59% меньшем количестве FLOPs, а в 24-часовой мультиагентной задаче для нескольких репозиторий было достигнуто на 65% большее улучшение при равных вычислениях.
  • •Команда показала, что политикой памяти можно управлять одной инструкцией на естественном языке, а цикл эволюции навыков повысил точность на отложенных данных ContextBench до 35,9 процентных пунктов при снижении вычислительных затрат.
  • •Рецепт онлайн-обучения с подкреплением на основе пошагового GRPO повысил точность Qwen3.5-9B на BrowseComp-Plus на 47,6% при 12% меньшем количестве FLOPs, а совместно разработанная техника Suffix Cache Reuse, интегрированная в SGLang, сокила серверные вычисления на 35% без влияния на точность задач.
  • •Авторы предупредили, что редактируемый контекст может позволить prompt-инъекциям или самогенерируемым инструкциям сохраняться между ходами, и призвали к защитам, сохраняющим гибкость без ущерба для целостности.
Meta представляет Context Language Models: ИИ-агенты, редактирующие собственную память, превосходят фиксированные фреймворки при меньших затратах вычислений

Группа исследователей из Meta Superintelligence Labs, Университета Вашингтона, MIT и Trillium Labs представила Context Language Models (CLM) — фреймворк, в котором сама языковая модель, а не внешний фреймворк, решает, как поддерживается её рабочий контекст. Работа, описанная в статье, опубликованной на сервере препринтов arXiv в конце сентября, бросает вызов преобладающей архитектуре ИИ-агентов с длинным горизонтом действий, в которой сжатие, суммаризация и выгрузка контекста выполняются жёсткими, созданными вручную оркестрационными слоями.

В большинстве современных агентных стеков эта логика памяти находится за пределами модели — в коде фреймворка, который модель никогда не видит. Ключевая концепция здесь проста: вместо трактовки истории диалога как журнала с последовательным добавлением CLM отражают живой контекст в редактируемый файл. Модель может переписывать, удалять или реорганизовывать этот файл по своему усмотрению с помощью обычного кода, причём каждое изменение синхронизируется с её рабочей памятью до следующего шага. По словам авторов, такой неограниченный контроль над тем, что сохранять, сжимать или отбрасывать, позволяет возникать адаптивным — и даже творческим — стратегиям управления памятью, перекликаясь с «горьким уроком» (bitter lesson) — влиятельным аргументом Рича Саттона о том, что обучение, предоставленное самому себе, превосходит фиксированные, созданные человеком правила.

Команда сообщает, что существующие модели, получившие эту возможность без дополнительного обучения, превосходят передовые стратегии управления контекстом на целом ряде бенчмарков с длинным горизонтом. На BrowseComp-Plus, бенчмарке глубоких исследований, CLM достигли точности на 11,4% выше, потребляя на 21,5% меньше FLOPs — операций с плавающей запятой, стандартной меры вычислений модели, — чем сильнейший базовый метод. На EdgeBench, 12-часовом наборе задач по оптимизации репозиториев, результаты улучшились на 5% при 59% меньшем количестве FLOPs. В 24-часовой задаче мультиагентного роя для нескольких репозиториев подход обеспечил на 65% большее улучшение при равных вычислениях, а в математической оптимизации превзошёл специализированные эволюционные рабочие процессы, такие как OpenEvolve, на нескольких задачах. Эффективность этих показателей имеет значение на длинных горизонтах, где накопленный контекст превращает каждое повторное чтение в регулярныечислительные затраты.

Исследователи также задокументировали качественные поведенческие особенности: модели вели таблицы результатов для координации мультиагентной работы, определяли вспомогательные функции для сжатия собственной истории и создавали внутренние роли для ведения заметок.

Обучение управлению памятью и его эффективное обслуживание

Поскольку редактирование контекста становится внутренним поведением модели, ему можно обучать. Исследователи демонстрируют два пути. Во-первых, пользователи могут направлять политику памяти одной инструкцией на естественном языке — например, указывая, при какой длине контекста должно происходить сжатие, — и модель соответствующим образом адаптируется. Во-вторых, цикл эволюции навыков может обнаруживать повторно используемые процедуры управления контекстом в текстовой форме, повышая точность на отложенных данных диагностического бенчмарка команды ContextBench до 35,9 процентных пунктов при снижении вычислительных затрат.

В статье также представлен рецепт онлайн-обучения с подкреплением для CLM, построенный на пошаговом GRPO (Group Relative Policy Optimization) с контролируемым успехом преимуществом по эффективности, который отдаёт предпочтение траекториям, одновременно корректным и экономным по вычислениям. Применённый к Qwen3.5-9B в задачах глубоких исследований, рецепт повысил точность на BrowseComp-Plus на 47,6% при использовании на 12% меньше FLOPs — достигнув результатов фреймворка на основе суммаризации, обученного по тому же рецепту, но при меньших затратах.

Обслуживание остаётся узким местом. Произвольные правки делают недействительными стандартные префиксные кеши — механизм, который обычно позволяет серверному движку пропускать повторное вычисление неизменённого текста, — вынуждая к дорогостоящему повторному префиллингу неизменённого текста. Для решения этой проблемы команда совместно разработала Suffix Cache Reuse, который переиспользует кешированные состояния для сохранившихся токенов после правки — включая токены, следующие за удалёнными блоками рассуждений при обычном чатовом обслуживании, — с переориентацией позиционных кодировок. Интегрированная в SGLang, открытый фреймворк обслуживания больших языковых моделей, техника сократила серверные вычисления на 35% при сопоставимом качестве, не затронув точность задач.

Авторы открыто указывают на последствия для безопасности: редактируемый контекст открывает новый канал, через который prompt-инъекции или самогенерируемые инструкции могут сохраняться между ходами, и они призывают к созданию защит, сохраняющих гибкость без ущерба для целостности. Будущая работа включает масштабирование обучения с подкреплением для CLM и дистилляцию стратегий из существующих фреймворков непосредственно в веса модели — шаг к агентам, чьё управление памятью изучено, а не жёстко запрограммировано. Такая конечная точка перевернёт нынешнее разделение труда, перенеся оркестрационную логику, которой сейчас владеют внешние фреймворки, в сами модели.

Источник: Metaverse Post