Meta presenta Context Language Models: agentes de IA que editan su propia memoria superan a los harness fijos con menor costo de cómputo
Puntos clave
- •Investigadores de Meta Superintelligence Labs, la Universidad de Washington, MIT y Trillium Labs propusieron Context Language Models, en los que el propio modelo reescribe, elimina y reorganiza su contexto mediante un archivo editable en lugar de delegar la gestión de memoria a código de harness externo.
- •Usados de forma zero-shot, los CLMs superaron las estrategias de gestión de contexto más avanzadas: elevaron la precisión en BrowseComp-Plus un 11.4% con 21.5% menos FLOPs, mejoraron las puntuaciones de EdgeBench 5% con 59% menos FLOPs y lograron una mejora 65% mayor con el mismo cómputo en una tarea multi-repositorio de agentes de 24 horas.
- •El equipo demostró que la política de memoria puede dirigirse con una sola instrucción en lenguaje natural y que un bucle de evolución de habilidades elevó la precisión held-out en ContextBench hasta 35.9 puntos porcentuales mientras reducía el cómputo.
- •Una receta de aprendizaje por refuerzo en línea basada en GRPO por pasos elevó la precisión de Qwen3.5-9B en BrowseComp-Plus un 47.6% con 12% menos FLOPs, mientras que la técnica codesignada Suffix Cache Reuse, integrada en SGLang, redujo el cómputo del servidor en 35% sin afectar la precisiónLos autores advirtieron que un contexto editable podría permitir que inyecciones de prompts o instrucciones autogeneradas persistan entre turnos, y pidieron defensas que preserven la flexibilidad sin sacrificar la integridad.

Un equipo de investigadores de Meta Superintelligence Labs, la Universidad de Washington, MIT y Trillium Labs presentó Context Language Models (CLMs), un marco en el que el propio modelo de lenguaje —y no un harness externo— decide cómo se mantiene su contexto de trabajo. El trabajo, descrito en un artículo publicado en el servidor de preprints arXiv a finales de septiembre, desafía la arquitectura predominante para agentes de IA de largo horizonte, en la que la compactación, resumen y descarga del contexto son manejados por rígidas capas de orquestación diseñadas a mano.
En la mayoría de los stacks de agentes actuales, esa lógica de memoria vive fuera del modelo, en código de frameworks que el modelo nunca ve. El concepto central aquí es directo: en lugar de tratar el historial de conversación como un registro de solo escritura, los CLMs replican el contexto en vivo en un archivo editable. El modelo puede reescribir, eliminar o reorganizar ese archivo a voluntad usando código ordinario, con cada cambio sincronizado en su memoria de trabajo antes del siguiente paso. Según los autores, este control sin restricciones sobre qué conservar, comprimir o descartar permite que emerjan estrategias de gestión de memoria adaptativas —e incluso creativas—, en eco de la "bitter lesson", el influyente argumento de Rich Sutton de que el aprendizaje dejado a escala supera las reglas fijas diseñadas por humanos.
El equipo informa que modelos existentes, con esta capacidad de forma zero-shot, superan las estrategias de gestión de contexto más avanzadas en una serie de benchmarks de largo horizonte. En BrowseComp-Plus, un benchmark de investigación profunda, los CLMs lograron un 11.4% más de precisión consumiendo 21.5% menos FLOPs —operaciones de punto flotante, la métrica estándar del cómputo de modelos— que el baseline más fuerte. En EdgeBench, una suite de optimización de repositorios de 12 horas, las puntuaciones mejoraron 5% con 59% menos FLOPs. En una tarea enjambre de agentes multi-repositorio de 24 horas, el enfoque logró una mejora 65% mayor con el mismo cómputo, y en optimización matemática superó flujos de trabajo evolutivos especializados como OpenEvolve en varios problemas. La eficiencia de estas cifras importa en horizontes largos, donde el contexto acumulado convierte cada relectura en un costo de cómputo recurrente.
Los investigadores también documentaron comportamientos cualitativos: los modelos mantenían marcadores para la coordinación multi-agente, definían funciones auxiliares para compactar sus propios historiales y creaban roles internos de toma de notas.
Aprender la gestión de memoria y servirla de forma eficiente
Dado que la edición del contexto se convierte en un comportamiento intrínseco del modelo, puede aprenderse. Los investigadores demuestr dos vías. Primera: los usuarios pueden dirigir la política de memoria con una sola instrucción en lenguaje natural —por ejemplo, especificar a qué longitud de contexto debe ocurrir la compactación— y el modelo se adapta en consecuencia. Segunda: un bucle de evolución de habilidades puede descubrir procedimientos reutilizables de gestión de contexto en forma de texto, elevando la precisión held-out en ContextBench, el benchmark de diagnóstico del equipo, hasta 35.9 puntos porcentuales mientras reduce el cómputo.
El artículo también introduce una receta de aprendizaje por refuerzo en línea para CLMs, basada en GRPO por pasos (Group Relative Policy Optimization) con una ventaja de eficiencia condicionada al éxito que favorece trayectorias a la vez correctas y ahorradoras de cómputo. Aplicada a Qwen3.5-9B en tareas de investigación profunda, la receta elevó la precisión en BrowseComp-Plus un 47.6% usando 12% menos FLOPs —igualando un harness basado en resúmenes entrenado con la misma receta, pero a menor costo.
El servido sigue siendo un cuello de botella. Las ediciones arbitrarias invalidan las cachés de prefijo estándar —el mecanismo que normalmente permite al motor de servido omitir el recálculo de texto sin cambios—, forzando un re-prefilling costoso del texto no modificado. Para resolverlo, el equipo codesignó Suffix Cache Reuse, que reutiliza estados cacheados de los tokens supervivientes tras una edición —incluidos los tokens que siguen a bloques de razonamiento eliminados en el servido ordinario de chat— mientras rota nuevamente los codificados posicionales. Integrada en SGLang, un framework de servido de código abierto para grandes modelos de lenguaje, la técnica redujo el cómputo del lado del servidor en 35% con el mismo rendimiento, sin afectar la precisión de las tareas.
Los autores señalan con franqueza las implicaciones de seguridad: un contexto editable abre un nuevo canal por el que las inyecciones de prompts o instrucciones autogeneradas podrían persistir entre turnos, y piden defensas que preserven la flexibilidad sin sacrificar la integridad. El trabajo futuro incluye escalar el aprendizaje por refuerzo de los CLMs y destilar estrategias de harnesses existentes directamente en los pesos del modelo —un paso hacia agentes cuya gestión de memoria se aprende en lugar de estar codificada de forma rígida. Ese punto final invertiría la división del trabajo actual, moviendo la lógica de orquestación que hoy poseen los frameworks externos hacia los propios modelos.
Fuente: Metaverse Post