NotizieMacroRicercatori di Meta, Duke e UC Davis presentano rami auto-miglioranti per l'ottimizzazione degli agent harness

Ricercatori di Meta, Duke e UC Davis presentano rami auto-miglioranti per l'ottimizzazione degli agent harness

Autore: CryptoBriefing·

Punti chiave

  • •Il metodo ha ottenuto un miglioramento relativo del 34,8% nel ragionamento matematico di livello olimpiade con Gemini 3 Flash, portando l'accuratezza dal 46,0% al 62,0% senza riaddestrare il modello sottostante.
  • •L'approccio divide l'ottimizzazione dell'harness in più rami auto-miglioranti, ciascuno con un sottoinsieme distinto di dati di sviluppo e una propria politica per proporre modifiche, con un router che seleziona ilo più forte per ogni input al momento del deployment.
  • •I guadagni di prestazione si sono estesi oltre la matematica ai compiti agentici, inclusi un miglioramento dell'11,6% su Terminal-Bench 2.0 e un aumento del 3,8% su SWE-bench Lite.
  • •L'articolo, pubblicato come arXiv:2609.37834v1 il 29 settembre 2026, si basa direttamente su Meta-Harness, un sistema precedente rilasciato il 30 marzo 2026 che aveva già superato i metodi di ottimizzazione tradizionali.
  • •Secondo gli autori, i guadagni sono stati ottenuti utilizzando solo dati del set di sviluppo senza alcun accesso al set di test, ma il preprint non ha ancora superato la formale revisione tra pari.
Ricercatori di Meta, Duke e UC Davis presentano rami auto-miglioranti per l'ottimizzazione degli agent harness

Ricercatori di Meta, Duke University e University of California, Davis hanno proposto un nuovo approccio per migliorare gli agenti AI: lasciare invariato il modello sottostante e migliorare l'impalcatura che lo circonda, utilizzando diversi team auto-miglioranti invece di uno solo.

In un preprint intitolato "Mixture of Self-Improving Branches for Agent Harness Optimization", i ricercatori riportano un miglioramento relativo del 34,8% nel ragionamento matematico di livello olimpiade, portando l'accuratezza dal 46,0% al 62,0% con il modello Gemini 3 Flash — il tutto senza riaddestrare il modello stesso.

Cos'è un harness e perché è importante

Più formalmente, un agent harness è il framework di codice avvolto attorno a un modello linguistico di grandi dimensioni. Governa i prompt che il modello riceve, gli strumenti che può richiamare, il contesto che può vedere e come le sue azioni vengono eseguite.

Poiché quell'impalcatura è codice e non pesi del modello, può essere rivista senza un nuovo addestramento — questa è la leva su cui agisce questa linea di lavoro. L'ottimizzazione dell'harness è la pratica di cercare automaticamente una versione migliore di tale involucro. Il nuovo articolo, pubblicato il 29 settembre 2026 come arXiv:2609.37834v1, si basa direttamente su un sistema precedente chiamato Meta-Harness.

Come funziona l'approccio a rami

Meta-Harness, rilasciato il 30 marzo 2026, aveva già superato i metodi tradizionali su vari benchmark. Il nuovo lavoro sostiene che un singolo percorso di ricerca lasci prestazioni sul tavolo.

I ricercatori hanno quindi diviso la ricerca in più rami specializzati. Ogni ramo evolve in autonomia, lavorando con un sottoinsieme distinto di dati di sviluppo e applicando la propria politica per proporre modifiche.

I rami imparano anche dalla loro storia. Ognuno conserva i casi in cui batte i rami fratelli e affina la propria strategia in base a come si sono comportati i tentativi precedenti.

Sorge una ovvia: chi sceglie lo specialista? La risposta è un router. Al momento del deployment, il router seleziona la migliore testa di ramo per ogni input in arrivo.

L'intero processo gira solo sui dati del set di sviluppo. Secondo gli autori, gli harness complementari hanno ottenuto i loro guadagni senza alcun accesso al set di test.

I numeri dei benchmark

Il risultato di punta è arrivato nel ragionamento matematico di livello olimpiade. L'accuratezza è salita dal 46,0% al 62,0% con Gemini 3 Flash, che gli autori presentano come un miglioramento relativo del 34,8%.

I guadagni si sono estesi anche ai compiti agentici. Su Terminal-Bench 2.0, che testa gli agenti che lavorano in un ambiente a riga di comando, il sistema ha registrato un guadagno dell'11,6%. SWE-bench Lite, un benchmark di ingegneria del software, ha mostrato un aumento del 3,8%.

Insieme, le tre valutazioni coprono ragionamento matematico, lavoro agentico a riga di comando e ingegneria del software, quindi i guadagni riportati non si limitano a un unico tipo di compito.

Chi c'è dietro al lavoro

L'elenco degli autori include Haoyu Dong, affiliato a Meta e Duke University, e Zihao Lin, affiliato a Meta e UC Davis. Lizhu Zhang e Zhuokai Zhao sono indicati come co-last author.

L'articolo è un preprint pubblicato su arXiv, il che significa che è stato condiviso pubblicamente ma non ha necessariamente superato la formale revisione tra pari.

Cosa significa

Un salto dal 46,0% al 62,0% nella matematica complessa, ottenuto senza toccare i pesi del modello, suggerisce che miglioramenti significativi possono derivare dall'ingegnerizzazione dell'ambiente in cui opera un modello. Per i team che costruiscono sopra modelli linguistici di grandi dimensioni, quadra l'harness stesso come un artefatto ottimizzabile — uno che può progredire di pari passo, anziché attendere, i rilasci dei modelli.

Ci sono questioni aperte da tenere d'occhio. Eseguire e mantenere più rami in evoluzione più un router probabilmente aggiunge complessità, e i risultati dell'articolo provengono da benchmark specifici e da un modello specifico. Se l'approccio supererà la revisione tra pari, reggerà sotto test indipendenti e si estenderà oltre Gemini 3 Flash sono i naturali punti di controllo da seguire.

Meta-Harness è arrivato a marzo 2026 e stava già battendo i metodi tradizionali. Circa sei mesi dopo, il suo successore rivendica di battere Meta-Harness stesso.