NotizieAzioniMeta presenta i Context Language Model: agenti AI che modificano la propria memoria superano gli harness fissi con un costo computazionale inferiore

Meta presenta i Context Language Model: agenti AI che modificano la propria memoria superano gli harness fissi con un costo computazionale inferiore

Autore: Metaverse Post·

Punti chiave

  • •Ricercatori di Meta Superintelligence Labs, University of Washington, MIT e Trillium Labs hanno proposto i Context Language Model, in cui il modello stesso riscrive, elimina e riorganizza il proprio contesto tramite un file modificabile invece di delegare la gestione della memoria a codice di harness esterno.
  • •Utilizzati in modalità zero-shot, i CLM hanno superato le strategie di gestione del contesto più avanzate, aumentando l'accuratezza su BrowseComp-Plus dell'11,4% con il 21,5% di FLOPs in meno, migliorando i punteggi su EdgeBench del 5% con il 59% di FLOPs in meno e producendo un miglioramento superiore del 65% a parità di calcolo in un task multi-repository con agenti della durata di 24 ore.
  • •Il team ha dimostrato che la policy di memoria può essere guidata con una singola istruzione in linguaggio naturale e che un ciclo di evoluzione delle skill ha aumentato fino a 35,9 punti percentuali l'accuratezza su ContextBench su dati non visti, riducendo il calcolo.
  • •Una ricetta di apprendimento per rinforzo online basata sul GRPO stepwise ha aumentato l'accuratezza di Qwen3.5-9B su BrowseComp-Plus del 47,6% con il 12% di FLOPs in meno, mentre la tecnica Suffix Cache Reuse, co-progettata e integrata in SGLang, ha ridotto il calcolo lato server del 35% senza impatti sull'accuratezza.
  • •Gli autori hanno avvertito che un contesto modificabile potrebbe consentire a iniezioni di prompt o istruzioni autogenerate di persistere attraverso i turni e hanno invocato difese che preservino la flessibilità senza sacrificare l'integrità.
Meta presenta i Context Language Model: agenti AI che modificano la propria memoria superano gli harness fissi con un costo computazionale inferiore

Un team di ricercatori di Meta Superintelligence Labs, University of Washington, MIT e Trillium Labs ha introdotto i Context Language Model (CLM), un framework in cui è il modello linguistico stesso — e non un harness esterno — a decidere come viene mantenuto il proprio contesto di lavoro. Il lavoro, descritto in un articolo pubblicato sul server di preprint arXiv a fine settembre, mette in discussione l'architettura prevalente per gli agenti AI long-horizon, in cui la compattazione, la sintesi e l'offload del contesto sono gestiti da rigidi livelli di orchestrazione progettati manualmente.

Nella maggior parte degli stack agenti attuali, quella logica di memoria risiede all'esterno del modello, in codice di framework che il modello non vede mai. Il concetto alla base è semplice: invece di trattare la cronologia delle conversazioni come un log di sola aggiunta, i CLM replicano il contesto attivo in un file modificabile. Il modello può riscrivere, eliminare o riorganizzare quel file a piacere tramite codice ordinario, con ogni modifica sincronizzata con la propria memoria di lavoro prima del passo successivo. Secondo gli autori, questo controllo senza restrizioni su cosa conservare, comprimere o scartare consente l'emergere di strategie di gestione della memoria adattive — e persino creative — facendo eco alla "bitter lesson", l'influente tesi di Rich Sutton secondo cui l'apprendimento lasciato scalare batte le regole fisse progettate dall'uomo.

Il team riferisce che modelli esistenti, dotati di questa capacità in modalità zero-shot, superano le strategie di gestione del contesto più avanzate su una serie di benchmark long-horizon. Su BrowseComp-Plus, un benchmark di deep research, i CLM hanno ottenuto un'accuratezza superiore dell'11,4% consumando il 21,5% di FLOPs in meno — operazioni in virgola mobile, l'unità di misura standard per il calcolo dei modelli — rispetto al baseline più forte. Su EdgeBench, una suite di ottimizzazione di repository della durata di 12 ore, i punteggi sono migliorati del 5% con il 59% di FLOPs in meno. In un task multi-repository con sciame di agenti della durata di 24 ore, l'approccio ha prodotto un miglioramento superiore del 65% parità di calcolo, e nell'ottimizzazione matematica ha superato flussi di lavoro evolutivi specializzati come OpenEvolve su diversi problemi. Il lato efficienza di questi numeri conta sui lunghi orizzonti, dove il contesto accumulato trasforma ogni rilettura in un costo computazionale ricorrente.

I ricercatori hanno anche documentato comportamenti qualitativi: i modelli mantenevano scoreboard per il coordinamento multi-agente, definivano funzioni di supporto per compattare le proprie storie e creavano ruoli interni di annotazione.

Apprendere la gestione della memoria e servirla in modo efficiente

Poiché la modifica del contesto diventa un comportamento intrinseco del modello, essa stessa può essere appresa. I ricercatori dimostrano due strade. La prima: gli utenti possono guidare la policy di memoria con una singola istruzione in linguaggio naturale — ad esempio, specificando a quale lunghezza del contesto avvenire la compattazione — e il modello si adatta di conseguenza. La seconda: un ciclo di evoluzione delle skill può scoprire procedure riutilizzabili di gestione del contesto in forma testuale, aumentando fino a 35,9 punti percentuali l'accuratezza su dati non visti del benchmark diagnostico del team, ContextBench, riducendo al contempo il calcolo.

L'articolo introduce inoltre una ricetta di apprendimento per rinforzo online per i CLM, basata sul GRPO (Group Relative Policy Optimization) stepwise con un vantaggio di efficienza vincolato al successo che favorisce traiettorie al tempo stesso corrette e frugali in termini di calcolo. Applicata a Qwen3.5-9B su task di deep research, la ricetta ha aumentato l'accuratezza su BrowseComp-Plus del 47,6% utilizzando il 12% di FLOPs in meno — eguagliando un harness basato su sintesi addestrato con la stessa ricetta, ma a costo inferiore.

Il serving resta un collo di bottiglia. Le modifiche arbitrarie invalidano le prefix cache standard — il meccanismo che normalmente permette al motore di serving di evitare di ricalcolare il testo invariato — imponendo un costoso re-prefilling del testo non modificato. Per affrontare il problema, il team ha co-progettato Suffix Cache Reuse, che riutilizza gli stati in cache per i token sopravvissuti dopo una modifica — inclusi i token che seguono i blocchi di reasoning rimossi nel normale serving chat — ri-ro式ando al contempo le codifiche posizionali. Integrata in SGLang, un framework di serving open source per grandi modelli linguistici, la tecnica ha ridotto il calcolo lato server del 35% a parità di prestazioni, senza impatti sull'accuratezza dei task.

Gli autori segnalano apertamente le implicazioni per la sicurezza: un contesto modificabile apre un nuovo canale attraverso cui iniezioni di prompt o istruzioni autogenerate potrebbero persistere attraverso i turni, e chiedono difese che preservino la flessibilità senza sacrificare l'integrità. I lavori futuri includono il ridimensionamento dell'apprendimento per rinforzo dei CLM e la distillazione di strategie dagli harness esistenti direttamente nei pesi del modello — un passo verso agenti la cui gestione della memoria è appresa anziché cablata nel codice. Questo punto d'arrivo invertirebbe l'attuale divisione del lavoro, spostando nei modelli stessi la logica di orchestrazione oggi appannaggio dei framework esterni.

Fonte: Metaverse Post