ActualitésMacroLe framework SIFT du MIT et de Sakana AI réduit le coût d'évaluation des agents de codage auto-améliorants

Le framework SIFT du MIT et de Sakana AI réduit le coût d'évaluation des agents de codage auto-améliorants

Auteur: CryptoBriefing·

Points clés

  • •SIFT a atteint 35,1 % sur le benchmark de codage Polyglot en seulement 30 étapes d'expansion, surpassant les 30,7 % de la Darwin Gödel Machine, qui nécessitait une recherche de 80 nœuds.
  • •Le framework remplace l'évaluation complète de chaque modification proposée par un modèle de langage évaluateur dont les préférences par paires sont converties en classements via un modèle Bradley-Terry régularisé.
  • •Une configuration construite sur Qwen3-Coder-30B, aux poids ouverts, a achevé l'intégralité de sa recherche en 224 heures CPU pour environ 34 $ de coûts d'API, soit environ un dixième des ressources consommées par DGM.
  • •SIFT a également amélioré la performance sur TerminalBench 2.1, de 29,2 % à 36,7 %, et sur SWE-60, de 40,0 % à 52,1 %.
  • •L'efficacité de la méthode dépend de la précision du modèle de langage évaluateur, que les chercheurs présentent comme la principale question ouverte à mesure que l'échelle des recherches augmente.
Le framework SIFT du MIT et de Sakana AI réduit le coût d'évaluation des agents de codage auto-améliorants

Les agents de codage capables de réécrire leur propre code source entraînent une dépense cachée qui n'a que peu de rapport avec la génération des modifications elles-mêmes : chaque auto-modification doit être vérifiée avant de savoir si elle a réellement été utile. Des chercheurs du MIT et de Sakana AI pensent avoir trouvé une méthode de vérification nettement moins coûteuse.

Leur framework, SIFT — abréviation de Self-Improvement via Fast Tree-search — a obtenu un score de 35,1 % sur le benchmark de codage Polyglot après seulement 30 étapes d'expansion. Le nom est littéral : la recherche arborescente construit une structure ramifiée de modifications candidates, chaque étape d'expansion ajoutant un nœud à explorer. Le point de comparaison importe : l'approche antérieure de la Darwin Gödel Machine (DGM) n'a atteint 30,7 % sur le même benchmark qu'après 80 nœuds de recherche.

Évaluer les candidats sans exécuter le benchmark complet

Les agents de codage auto-améliorants récursifs fonctionnent un peu comme un écrivain qui révise ses propres brouillons. L'agent propose une modification de son propre code, dans l'espoir que la nouvelle version donne de meilleurs résultats sur des tâches réelles. La difficulté réside dans la vérification : tester chaque patch proposé sur un benchmark complet consomme beaucoup de calcul, et la facture s'alourdit rapidement lorsque l'agent génère de nombreux candidats.

SIFT contourne une grande partie de ce coût en introduisant un arbitre. Plutôt que d'évaluer chaque modification sur un benchmark, le framework demande à un grand modèle de langage de comparer deux modifications candidates et de déterminer laquelle semble meilleure. Ces verdicts en face-à-face sont ensuite agrégés via un modèle Bradley-Terry régularisé, une méthode statistique qui convertit des préférences par paires en un classement global.

Le framework exécute également ses évaluations de manière asynchrone, de sorte que les candidats n'ont pas à attendre en file d'attente leur tour sur le banc d'essai. Il en résulte un pipeline hybride : le modèle de langage filtre le champ à moindre coût, et seules les modifications présélectionnées passent à l'évaluation aval coûteuse.

Les chiffres derrière l'annonce d'efficacité

Un agent de codage o3-mini a produit le résultat phare. Sur Polyglot, SIFT a atteint son score de 35,1 % en 30 étapes d'expansion, dépassant les 30,7 % de DGM, obtenus au terme d'une recherche de 80 nœuds bien plus longue.

Le volet des coûts devient encore plus parlant avec les modèles à poids ouverts. Une configuration construite sur Qwen3-Coder-30B a achevé l'intégralité de sa recherche en 224 heures CPU avec environ 34 $ de coûts d'API — soit à peu près un dixième des ressources consommées par DGM.

SIFT a également enregistré des gains sur d'autres benchmarks. Sur TerminalBench 2.1 la performance est passée de 29,2 % à 36,7 %, une amélioration de 7,5 points de pourcentage. Le bond a été plus important sur SWE-60, où les scores sont passés de 40,0 % à 52,1 %, un gain de 12,1 points de pourcentage par rapport à la référence de départ.

Qui l'a conçu et où il se situe

L'article a été rédigé par Xinghong Fu du MIT, aux côtés d'Aravinth Kulanthaivelu et de Yutaro Yamada, avec Sakana AI comme laboratoire collaborateur. Il a été publié sur arXiv autour du 18 septembre 2026, et les discussions sur ces travaux ont commencé à se propager sur diverses plateformes fin septembre 2026. Une grande partie des échanges s'est concentrée sur deux thèmes : les économies de coûts et l'importance croissante de la qualité réelle du modèle de langage évaluateur.

L'approche s'inscrit parfaitement dans la philosophie plus large de Sakana AI. Le laboratoire basé à Tokyo a privilégié les méthodes de découverte évolutionnaire aux stratégies de force brute dans le développement de l'IA, et SIFT est typiquement un cas où l'on travaille plus intelligemment plutôt que d'ajouter du matériel au problème. Il s'appuie également directement sur la lignée de la Darwin Gödel Machine : DGM a établi que des agents pouvaient s'améliorer par recherche itérative, et SIFT cible le goulot d'étranglement d'évaluation qui rendait cette recherche si coûteuse.

Ce que cela signifie pour les développeurs et la course à l'auto-amélioration

L'implication la plus immédiate est l'accessibilité. Si une recherche complète d'auto-amélioration peut s'exécuter pour environ 34 $ de coûts d'API, le domaine pourrait ne plus être réservé aux laboratoires disposant de budgets de calcul importants.

Une réserve mérite cependant l'attention. Toute la prémisse de SIFT repose sur la capacité du modèle de langage évaluateur à porter de bons jugements, c'est pourquoi la qualité de l'évaluateur est devenue un sujet central dans les discussions autour de l'article. Un évaluateur qui préférerait systématiquement le mauvais patch orienterait la recherche dans la mauvaise direction — simplement à moindre coût. La question ouverte à suivre dans les travaux ultérieurs est de savoir si ce jugement reste fiable à mesure que les recherches passent à plus grande échelle.

Source : CryptoBriefing