Il framework SIFT di MIT e Sakana AI riduce i costi di valutazione degli agenti di coding auto-miglioranti
Punti chiave
- •SIFT ha raggiunto il 35,1% sul benchmark Polyglot in soli 30 passi di espansione, superando il 30,7% della Darwin Gödel Machine, che ha richiesto una ricerca di 80 nodi.
- •Il framework sostituisce il benchmarking completo di ogni modifica proposta con un modello linguistico arbitro le cui preferenze a coppie vengono convertite in classifiche tramite un modello Bradley-Terry regolarizzato.
- •Una configurazione basata su Qwen3-Coder-30B open-weight di Alibaba ha completato l'intera ricerca in 224 ore CPU con circa 34 dollari di costi API, circa un decimo delle risorse consumate da DGM.
- •SIFT ha anche migliorato le prestazioni su TerminalBench 2.1 dal 29,2% al 36,7% e su SWE-60 dal 40,0% al 52,1%.
- •L'efficacia del metodo dipende dall'accuratezza del modello linguistico arbitro, evidenziata dai ricercatori come la principale question aperta man mano che la scala delle ricerche cresce.

Gli agenti di coding capaci di riscrivere il proprio codice sorgente comportano una spesa nascosta che ha poco a che vedere con la generazione delle modifiche in sé: ogni auto-modifica deve essere verificata prima che qualcuno possa sapere se ha effettivamente funzionato. I ricercatori del MIT e di Sakana AI ritengono di aver trovato un modo sostanzialmente più economico per effettuare tale verifica.
Il loro framework, SIFT—abbreviazione di Self-Improvement via Fast Tree-search—ha ottenuto un punteggio del 35,1% sul benchmark Polyglot dopo soli 30 passi di espansione. Il nome è letterale: la ricerca ad albero sviluppa una struttura ramificata di modifiche candidate, con ogni passo di espansione che aggiunge un nodo da esplorare. Il punto di confronto è importante: la precedente Darwin Gödel Machine (DGM) ha richiesto 80 nodi di ricerca per raggiungere il 30,7% sullo stesso benchmark.
Valutare i candidati senza eseguire il benchmark completo
Gli agenti di coding auto-miglioranti ricorsivi funzionano molto come uno scrittore che revisiona le proprie bozze. L'agente propone una modifica al proprio codice, sperando che la nuova versione si comporti meglio su compiti reali. La difficoltà sta nella verifica: testare ogni patch proposta contro un benchmark completo consuma risorse di calcolo considerevoli, e il conto cresce rapidamente quando un agente genera molti candidati.
SIFT aggira gran parte di quel costo introducendo un arbitro. Invece di eseguire il benchmark su ogni modifica, il framework chiede a un modello linguistico di grandi dimensioni di confrontare due modifiche candidate e determinare quale sembra migliore. Questi verdetti confronto diretto vengono poi aggregati attraverso un modello Bradley-Terry regolarizzato, un metodo statistico per convertire preferenze a coppie in una classifica complessiva.
Il framework esegue inoltre le proprie valutazioni in modo asincrono, così i candidati non devono aspettare in fila per il proprio turno sul banco di prova. Il risultato è una pipeline ibrida: il modello linguistico filtra il campo a basso costo, e solo le modifiche selezionate procedono verso la costosa valutazione a valle.
I numeri dietro alla dichiarazione di efficienza
Un agente di coding o3-mini ha prodotto il risultato principale. Su Polyglot, SIFT ha raggiunto il suo punteggio del 35,1% in 30 passi di espansione, superando di poco il 30,7% di DGM, ottenuto con una ricerca molto più lunga di 80 nodi.
La storia dei costi si fa ancora più netta con i modelli open-weight. Una configurazione basata su Qwen3-Coder-30B, una release open-weight famiglia Qwen di Alibaba, ha completato l'intera ricerca in 224 ore CPU con circa 34 dollari di costi API—circa un decimo delle risorse consumate da DGM.
SIFT ha mostrato miglioramenti anche su altri benchmark. Su TerminalBench 2.1, le prestazioni sono salite dal 29,2% al 36,7%, un miglioramento di 7,5 punti percentuali. Il salto è stato maggiore su SWE-60, dove i punteggi sono passati dal 40,0% al 52,1%, un guadagno di 12,1 punti percentuali rispetto alla baseline iniziale.
Chi l'ha creato e dove si colloca
L'articolo è stato scritto da Xinghong Fu del MIT, insieme ad Aravinth Kulanthaivelu e Yutaro Yamada, con Sakana AI come laboratorio collaboratore. È stato pubblicato su arXiv, la piattaforma di preprint ad accesso aperto dove le ricerche appaiono tipicamente prima della revisione formale tra pari, verso il 18 settembre 2026, e la discussione sul lavoro ha iniziato a diffondersi su varie piattaforme alla fine di settembre 2026. Gran parte della conversazione si è concentrata su due temi: il risparmio sui costi e la crescente importanza di quanto sia valido in realtà il giudizio del modello linguistico.
L'approccio si inserisce perfettamente nella filosofia più ampia di Sakana AI. Il laboratorio con sede a Tokyo, fondato nel 2023 da ex ricercatori di Google tra cui il co-autore dell'articolo sul Transformer Llion Jones, ha privilegiato metodi di scoperta evolutiva rispetto alle strategie brute-force nello sviluppo dell'AI, e SIFT è decisamente un caso di lavorare in modo più intelligente piuttosto che gettare più hardware sul problema. Si basa inoltre direttamente sulla discendenza della Darwin Gödel Machine: DGM ha dimostrato che gli agenti possono migliorare se stessi attraverso la ricerca iterativa, e SIFT punta sul collo di bottiglia della valutazione che rendeva quella ricerca così costosa.
Cosa significa per gli sviluppatori e la corsa all'auto-miglioramento
L'implicazione più immediata è l'accessibilità. Se un'intera ricerca di auto-miglioramento può essere eseguita con circa 34 dollari di costi API, il campo potrebbe non appartenere più soltanto ai laboratori con grandi budget di calcolo.
Una riserva merita attenzione. L'intera premessa di SIFT si fonda sulla capacità del modello linguistico arbitro di fare scelte corrette, ed è per questo che la qualità del giudice è emersa come tema centrale nelle discussioni sull'articolo. Un giudice che preferisce costantemente la patch sbagliata indirizzerebbe la ricerca nella direzione sbagliata—solo più a buon mercato. Se quel giudizio rimanga affidabile man mano che le ricerche scalano è la domanda aperta da seguire nei lavori futuri.
Fonte: CryptoBriefing