NotizieAzioniIl paper di Microsoft rivela una skill distillation low-cost che consente a GPT-5.4-mini di superare la propria modalità di reasoning

Il paper di Microsoft rivela una skill distillation low-cost che consente a GPT-5.4-mini di superare la propria modalità di reasoning

Autore: CryptoBriefing·

Punti chiave

  • Il paper di Microsoft dell'11 agosto mostra un metodo di skill distillation che consente a GPT-5.4-mini di eguagliare o superare la propria costosa modalità di reasoning al costo di 1-3 dollari per dominio, senza retraining.
  • L'approccio genera documenti di skill in markdown di 40-130 righe a partire da 35-50 traiettorie di task, che possono essere ispezionati, modificati e gestiti con versionamento come normali asset di prompt.
  • Sul benchmark ALFWorld, il GPT-5.4-mini potenziato dalle skill ha totalizzato 0,787 contro 0,713 della modalità di reasoning completa, utilizzando da 2,7 a 6 volte meno token in output su tutti i benchmark.
  • Il paper si basa sul framework SkillOpt di Microsoft, rilasciato a giugno, che ha mostrato un guadagno medio di 23,5 punti per GPT-5.5 su sei benchmark.
  • Restano questioni aperte sulla durata delle skill distillate man mano che i modelli sottostanti vengono aggiornati e sulla generalizzabilità del metodo oltre i domini agentici testati.
Il paper di Microsoft rivela una skill distillation low-cost che consente a GPT-5.4-mini di superare la propria modalità di reasoning

I ricercatori di Microsoft hanno trovato un modo per far sì che un modello AI più economico superi la propria costosa modalità di reasoning, e il trucco costa all'incirca quanto un caffellatte.

Un paper pubblicato l'11 agosto, intitolato “Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills”, introduce un metodo passivo di skill distillation che estrae insiemi di regole compatti da un numero ridotto di esempi di task. Queste regole, scritte in semplice markdown, vengono iniettate nel system prompt di un modello e gli insegnano di fatto delle scorciatoie che evitano la necessità di un costoso ragionamento chain-of-thought. Il modello di destinazione in questo caso è GPT-5.4-mini, lanciato a marzo.

Il risultato va oltre la vittoria in un singolo benchmark. Le modalità di reasoning aumentano i costi di inferenza perché generano lunghe catene di token intermedi prima di rispondere, e l'output di token è uno dei principali fattori di costo per i provider AI su larga scala. Ridurre i token in output di un multiplo—mantenendo o migliorando l'accuratezza—modifica direttamente l'economia dell'esecuzione di carichi di lavoro agentici in produzione, dove lo stesso task può essere eseguito migliaia o milioni di volte.

Come funziona

Il processo è ingannevolmente semplice. Un coding agent esamina tra le 35 e le 50 traiettorie di task, essenzialmente registrazioni di come un modello ha affrontato—e a volte fallito—task specifici. Da queste traiettorie, l'agente distilla un documento "skill" in linguaggio naturale composto da 40 a 130 righe di markdown. Non si tratta di embedding astratti né di aggiustamenti dei pesi tramite fine-tuning. Sono regole leggibili e verificabili, derivate da ciò che è andato storto e da ciò che ha funzionato.

Questa leggibilità rappresenta un distacco significativo dai due modi dominanti in cui le conoscenze di dominio vengono solitamente incorporate nei modelli: il fine-tuning, che richiede run di addestramento e hardware specializzato, e approcci opachi basati su retrieval o embedding. Poiché le conoscenze distillate sono in testo semplice, gli sviluppatori possono ispezionare, modificare e gestire con versionamento un documento di skill nello stesso modo in cui trattano qualsiasi altro asset di prompt—senza alcuna pipeline MLOps.

Una volta che quel documento di skill viene inserito nel system prompt di un modello non-reasoning, accade qualcosa di interessante. Il modello recupera tra il 55% e oltre il 100% del divario di prestazioni che normalmente separa le modalità reasoning e non-reasoning. In termini più semplici, la modalità economica inizia a comportarsi come quella costosa—e a volte anche meglio.

Il costo di calcolo per generare il documento di skill di ciascun dominio si aggira tra 1 e 3 dollari, senza alcun retraining del modello.

Risultati dei benchmark

Il team di ricerca, guidato da Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi e Sumit Gulwani, ha valutato l'approccio su quattro benchmark agentici, tra cui ALFWorld e SpreadsheetBench-Verified.

Su ALFWorld, il GPT-5.4-mini potenziato dalle skill ha ottenuto un punteggio di 0,787, mentre la modalità di reasoning completa ha totalizzato 0,713. La versione più economica e veloce non si è limitata a colmare il divario—lo ha superato.

Su tutti i benchmark, il modello aumentato dalle skill ha utilizzato da 2,7 a 6 volte meno token in output rispetto alla modalità di reasoning. Meno token significa anche risposte più rapide, un vantaggio pratico per gli agenti interattivi in cui la latenza influisce sull'esperienza utente.

Costruire su SkillOpt

Il paper si basa direttamente sul framework SkillOpt di Microsoft, rilasciato a giugno, che ridefiniva le skill degli agenti come parametri addestrabili anziché pesi statici del modello. SkillOpt ha dimostrato un guadagno medio di 23,5 punti per GPT-5.5 su sei benchmark, stabilendo le fondamenta teoriche secondo cui le skill possono essere ottimizzate indipendentemente dal modello sottostante.

Il nuovo metodo di distillazione riprende quel concetto e lo rende radicalmente più accessibile. Poiché i documenti di skill sono semplici file markdown iniettati tramite system prompt, funzionano con le strategie di rollout esistenti—nessuna infrastruttura di inferenza personalizzata, nessun hardware specializzato e nessun run di retraining richiesto.

Per i professionisti, le questioni aperte riguardano quanto le skill distillate restino durature man mano che i modelli sottostanti vengono aggiornati, e come l'approccio si generalizzi al di là dei domini agentici testati—domande a cui i soli risultati dei benchmark non rispondono ancora.