MITとSakana AIのSIFTフレームワーク、自己改善型コーディングエージェントの評価コストを削減
重要ポイント
- •SIFTはわずか30ステップの拡張でPolyglotコーディングベンチマークにおいて35.1%を達成し、80ノードの探索を必要としたDarwin Gödel Machineの30.7%を上回った。
- •このフレームワークは、提案されたすべての変更を完全にベンチマークする代わりに、大規模言語モデルの審判を用い、そのペアごとの選好を正則化Bradley-Terryモデルでランキングに変換する。
- •アリババのオープンウェイトモデルQwen3-Coder-30Bを用いた構成は、検索全体を224 CPU時間、APIコスト約34ドルで完了し、DGMが消費したリソースの約10分の1で済んだ。
- •SIFTはTerminalBench 2.1で29.2%から36.7%へ、S-60で40.0%から52.1%へとパフォーマンスを向上させた。
- •この手法の有効性は言語モデル審判の正確さに左右され、研究者らは探索規模の拡大に伴う中心的な未解決問題としてこれを挙げている。

自らのソースコードを書き換えることができるコーディングエージェントには、変更の生成そのものとは別の隠れたコストが存在する。すべての自己修正は、実際に効果があったかどうかを確認する前に検証されなければならないのだ。MITとSakana AIの研究者らは、その検証を大幅に安価に行う方法を見つけたと考えている。
彼らのフレームワーク「SIFT(Self-Improvement via Fast Tree-searchの略)」は、わずか30ステップの拡張でPolyglotコーディングベンチマークにおいて35.1%を記録した。その名の通り、ツリー探索は候補修正の分岐構造を成長させ、各拡張ステップで探索対象のノードを1つ追加する。比較基準となるのが、先行するDarwin Gödel Machine(DGM)で、同じベンチマークで30.7%に到達するには80ノードの探索を必要とした。
フルベンチマークを実行せずに候補を評価する
再帰的に自己改善を行うコーディングエージェントは、自らの草稿を推敲する作家によく似た働きをする。エージェントは自分のコードに対する修正を提案し、新しいバージョンが実際のタスクでより良いパフォーマンスを発揮することを期待する。難しいのは検証だ。提案された各パッチを完全なベンチマークでテストすると多大な計算資源を消費し、エージェントが多くの候補を生成する場合にはコストが急速に膨らむ。
SIFTは「審判」を導入することで、そのコストの大部分を回避する。すべての変更をベンチマークにかける代わりに、大規模言語モデルに2つの候補修正を比較させ、どちらが優れているかを判断させる。これらの一対一の判定は、正則化Bradley-Terryモデル(ペアごとの選好を全体のランキングに変換する統的手法)によって集計される。
さらに、このフレームワークは評価を非同期で実行するため、候補がテスト台番順を待つ必要がない。その結果がハイブリッドパイプラインだ。言語モデルが安価に候補をふるいにかけ、絞り込まれた修正のみが高コストな下流評価に進む。
効率性の主張を支える数字
目覚ましい結果を生み出したのは、o3-miniコーディングエージェントだ。Polyglotにおいて、SIFTは30ステップの拡張で35.1%に到達し、はるかに長い80ノードの探索を要したDGMの30.7%をわずかに上回った。
オープンウェイトモデルを使うと、コスト面の話はさらに鮮明になる。アリババのQwenファミリー由来のオープンウェイトモデルであるQwen3-Coder-30Bを用いた構成は、全体の検索を224 CPU時間、APIコスト約34ドルで完了した。これはDGMが消費したリソースの約10分の1に相当する。
SIFTは他のベンチマークでも成果を示した。TerminalBench 2.1では、パフォーマンスが29.2%から36.7%へと7.5ポイント向上した。S-60での伸びはさらに大きく、スコアは40.0%から52.1%へと、開始時のベースラインから12.1ポイントの上昇となった。
開発者とその位置づけ
論文はMITのXinghong Fu氏を筆頭に、Aravinth Kulanthaivelu氏、Yutaro Yamada氏によって執筆され、Sakana AIが共同研究ラボとして参加した。論文は通常、正式な査読前に研究成果が公開されるオープンアクセスのプレプリントサーバーarXivに、2026年9月18日頃に掲載され、この研究に関する議論は2026年9月下旬に各プラットフォームで広まり始めた。その議論の多くは、コスト削減と、言語モデルの審判がどれほど優れているかの重要性の高まりという2つのテーマに集中している。
このアプローチは、Sakana AIのより広い思想とも合致する。東京を拠点とする同ラボは、Transformer論文の共著者であるLlion Jones氏を含む元Google研究者らによって2023年に設立され、AI開発において総当たり的な戦略よりも進化的な発見手法を重視してきた。SIFTはまさに、より多くのハードウェアを投じるのではなく、より賢く取り組む事例だ。また、Darwin Gödel Machineの系譜を直接受け継いでいる。DGMはエージェントが反復的な探索を通じて自己改善できることを示し、SIFTはその探索を高コストにしていた評価のボトルネックに狙いを定めている。
開発者と自己改善競争にとっての意味
最も直接的な示唆はアクセシビリティだ。完全な自己改善探索がAPIコスト約34ドルで実行できるなら、この分野はもはや潤沢な計算予算を持つラボだけのものではなくなるかもしれない。
留意すべき注意点が一つある。SIFTの前提はすべて、言語モデルの審判が適切な判断を下すことに依存している。だからこそ、審判の質が論文に関する議論の中心的な話題として浮上している。誤ったパッチを一貫して好む審判は、探索を誤った方向へ導くことになる——ただ、より安価に、というだけだ。探索の規模拡大してもその判断が信頼性を保てるかどうかが、今後の研究で注目すべき未解決の問いである。