NotizieMacroHarness-Zero: i ricercatori di Google dimostrano come distillare un harness per agenti AI nei pesi del modello

Harness-Zero: i ricercatori di Google dimostrano come distillare un harness per agenti AI nei pesi del modello

Autore: Metaverse Post·

Punti chiave

  • •Harness-Zero distilla nei pesi di un modello i comportamenti indotti da un agente harness ottimizzato, così che i guadagni di prestazione persistano dopo che l'harness specializzato è sostituito da un harness fisso minimale in fase di distribuzione.
  • •Nell'approccio agent-as-harness, un agente di harnessing separato guidato dall'harness ottimizzato esamina e corregge ogni risposta dell'agente studente nello spazio di azione nativo dell'harness target, e le esecuzioni corrette servono come dimostrazioni di addestramento.
  • •Nelle valutazioni senza addestramento su modelli di frontiera, l'approccio agent-as-harness ha superato il metodo convenzionale code-as-harness, con una media dell'81,1% contro il 78,1% nei benchmark e nelle impostazioni di modello testate.
  • •Dopo la distillazione, il successo macro-medio nelle attività di un modello di base da 9 miliardi di parametri è salito dal 23,3% al 44,3% con l'harness specializzato rimosso, superando il 41,7% ottenuto dallo stesso modello con l'harness collegato, e il modello distillato ha recuperato in media l'82,3% dei 28 pattern comportamentali indotti dall'harness.
  • •Gli autori segnalano limitazioni: l'agente di harnessing deve essere sufficientemente capace perché modelli più deboli producono interventi complessivamente dannosi, il processo di revisione aumenta i costi di raccolta delle traiettorie, e le conoscenze di dominio profondamente codificate possono essere difficili da interiorizzare con il solo fine-tuning.
Harness-Zero: i ricercatori di Google dimostrano come distillare un harness per agenti AI nei pesi del modello

Ricercatori della Peking University, di Google e della Hong Kong University of Science and Technology hanno presentato Harness-Zero, un metodo che trasferisce i guadagni di prestazione di un harness specializzato per agenti AI nel modello stesso, così che tali guadagni non dipendano più da scaffolding esterno. Il lavoro affronta una tensione al centro dell'ingegneria degli agenti moderna: quanta parte della capacità di un agente debba risiedere nei pesi del modello e quanta nello scaffolding che lo avvolge.

Un agente harness è il sistema esterno che governa il modo in cui un modello linguistico interagisce con il proprio ambiente — orchestrando l'uso degli strumenti, gestendo contesto e stato e controllando il ciclo di interazione. L'ingegneria degli harness si è dimostrata una leva potente per migliorare le prestazioni degli agenti, ma i miglioramenti che offre dipendono dalla presenza dello specifico harness in fase di distribuzione. Poiché l'harness ottimale varia a seconda dei domini, dei singoli compiti e dei modelli di base, un agente per uso generale deve affrontare un difficile compromesso: adottare un unico harness condiviso rinunciando ai vantaggi specializzati, o mantenere una collezione crescente di harness specializzati con i costi crescenti in termini di routing, contesto e orchestrazione.

Harness-Zero propone una terza via: la distillazione dell'harness. Un harness ottimizzato serve solo come guida durante l'addestramento, e i comportamenti che induce vengono trasferiti nei pesi del modello, così che i guadagni persistano anche dopo la rimozione dell'harness specializzato e l'uso di un harness fisso minimale in fase di distribuzione.

Agent-as-Harness: tradurre la guida tra diversi spazi di azione

La difficoltà centrale che l'harness ottimizzato e l'harness target differiscono sia nello spazio di azione sia nelle informazioni disponibili, il che significa che la guida dell'harness ottimizzato non può essere applicata direttamente come supervisione di addestramento. Harness-Zero affronta il problema con un approccio agent-as-harness: un agente di harnessing separato, guidato dall'harness ottimizzato, esamina ogni risposta proposta dall'agente studente e, se necessario, la corregge in modo che la correzione sia espressa nello spazio di azione nativo dell'harness target prima dell'esecuzione.

Le esecuzioni corrette servono quindi come dimostrazioni di addestramento. Il fine-tuning sulle traiettorie risultanti interiorizza il comportamento indotto dall'harness direttamente nei pesi del modello, e in fase di distribuzione l'harness specializzato, l'harness di riferimento e l'agente di harnessing vengono tutti scartati.

I ricercatori hanno valutato il metodo in tre domini — lavoro conoscitivo basato su fogli di calcolo (SpreadsheetBench Verified), uso di strumenti multi-applicazione (AppWorld) e ragionamento scientifico (USPTO Retrosynthesis). Nelle valutazioni senza addestramento su modelli di frontiera — cioè senza alcun fine-tuning — l'approccio agent-as-harness ha superato il metodo convenzionale code-as-harness, con una media dell'81,1% contro il 78,1% nelle impostazioni di benchmark e modello testate.

Per quanto riguarda la distillazione, il successo macro-medio nelle attività di un modello di base da 9 miliardi di parametri, relativamente compatto secondo gli standard attuali, è passato dal 23,3% al 44,3% una volta rimosso l'harness specializzato — superando il 41,7% ottenuto dallo stesso modello di base con l'harness ancora collegato. Un'analisi comportamentale ha inoltre rilevato che il modello distillato ha recuperato in media l'82,3% dei 28 pattern comportamentali indotti dall'harness assenti nel modello di base, un'indicazione che il modello distillato ha assorbito come funzionava l'harness, non soltanto quanto era efficace.

Gli autori segnalano diverse limitazioni. L'approccio richiede un modello sufficientemente capace per fungere da agente di harnessing, poiché modelli più deboli producono interventi complessivamente dannosi, e il processo di revisione aumenta il costo della raccolta delle traiettorie. Conoscenze di dominio più profonde codificate in un harness possono inoltre essere più difficili da interiorizzare con il solo fine-tuning.

Ciò nonostante, i risultati suggeriscono che lo sviluppo degli harness potrebbe diventare una fonte scalabile di segnale di addestramento — con modelli migliori che couiscono harness migliori, e ogni harness che restituisce i propri guadagni al modello stesso anziché lasciarli intrappolati nello scaffolding che lo circonda. Quanto lontano possa estendersi quel ciclo, date le limitazioni segnalate dagli autori, è la questione aperta che determinerà se i guadagni degli harness continueranno a restare nello scaffolding — o inizieranno a finire nei pesi stessi del modello.