MIT 与 Sakana AI 的 SIFT 框架大幅降低自我改进编码智能体的评估成本
要点速览
- •SIFT 仅用 30 步扩展便在 Polyglot 编码基准上取得 35.1%,超过需要 80 节点搜索的 Darwin Gödel Machine 的 30.7%。
- •该框架不再对每个 proposed 修改进行完整基准测试,而是由大语言模型担任裁判,其两两偏好通过正则化 Bradley-Terry 模型转换为排名。
- •基于阿里巴巴开放权重模型 Qwen3-Coder-30B 构建的配置在 224 个 CPU 小时内完成整个搜索,API 成本约 34 美元,约为 DGM 所耗资源的十分之一。
- •SIFT 还将 TerminalBench 2.1 的性能从 29.2% 提升至 36.7%,并将 SWE-60 的成绩从 40.0% 提升至 52.1%。
- •该方法的有效性取决于语言模型裁判的准确性,研究人员指出这是搜索规模扩大时的核心未解问题。

能够重写自身源代码的编码智能体带有一项隐藏开销,而这与生成修改本身关系不大:每一处自我修改都必须经过验证,才能知道它是否真正带来了改进。MIT 与 Sakana AI 的研究人员认为,他们找到了一种成本大幅更低的验证方式。
他们的框架 SIFT——Self-Improvement via Fast Tree-search 的缩写——仅用 30 步扩展就在 Polyglot 编码基准上取得了 35.1% 的成绩。这个名称十分直白:树搜索会生长出一个由候选修改构成的分支结构,每一步扩展都会增加一个待探索的节点。对比基线同样重要:更早的 Darwin Gödel Machine(DGM)需要 80 个节点的搜索才能在同一基准上达到 30.7%。
无需运行完整基准即可评判候选方案
递归自我改进的编码智能体的工作方式很像一位修改自己草稿的作者。智能体对自身代码提出修改,希望新版本能在真实任务上表现更好。难点在于验证:将每个 proposed 补丁对照完整基准进行测试会消耗大量算力,而当智能体生成大量候选方案时,成本会迅速叠加。
SIFT 通过引入一个“裁判”绕开了大部分成本。该框架不再对每一处修改进行基准测试,而是让一个大语言模型比较两个候选修改并判断哪一个更好。这些一对一的判定结果随后通过正则化 Bradley-Terry 模型进行汇总——这是一种将两两偏好转换为整体排名的统计方法。
该框架还异步运行评估,因此候选方案无需排成单列队列等待上测试台。最终形成了一条混合流水线:由语言模型以低成本筛选候选,只有进入短名单的修改才会进入昂贵的下游评估。
效率声明背后的数字
核心结果来自一个 o3-mini 编码智能体。在 Polyglot 上,SIFT 用 30 步扩展达到了 35.1% 的成绩,略胜 DGM 在长得多的 80 节点搜索中取得的 30.7%。
在开放权重模型上,成本优势更加突出。基于 Qwen3-Coder-30B(阿里巴巴 Qwen 系列的开放权重模型)构建的配置,在 224 个 CPU 小时内完成了整个搜索,API 成本约为 34 美元——大约是 DGM 所耗资源的十分之一。
SIFT 在其他基准上也带来了提升。在 TerminalBench 2.1 上,性能从 29.2% 升至 36.7%,提高了 7.5 个百分点。在 SWE-60 上的跃升更大:成绩从 40.0% 升至 52.1%,较起始基线提高了 12.1 个百分点。
研究团队及其定位
论文由 MIT 的 Xinghong Fu 撰写,合作者包括 Aravinth Kulanthaivelu 和 Yutaro Yamada,Sakana AI 为合作实验室。论文于 2026 年 9 月 18 日左右发布在 arXiv——一个研究通常在正式同行评审之前发布的开放获取预印本平台上,相关讨论自 2026 年 9 月下旬开始在多个平台上传播。讨论主要围绕两个主题:成本节约,以及语言模型裁判的实际水平日益增长的重要性。
这一方法与 Sakana AI 的整体理念十分契合。这家总部位于东京的实验室由前 Google 研究人员(包括 Transformer 论文合著者 Llion Jones)于 2023 年创立,在 AI 开发中一直强调进化式发现方法而非暴力搜索策略,而 SIFT 正是“更聪明地工作”而非堆砌硬件的典型案例。它也直接承继了 Darwin Gödel Machine 的脉络:GM 证明了智能体可以通过迭代搜索实现自我改进,而 SIFT 针对的正是使这种搜索如此昂贵的评估瓶颈。
这对开发者与自我改进竞赛意味着什么
最直接的影响是可及性。如果一次完整的自我改进搜索只需约 34 美元的 API 成本,那么这个领域可能不再只属于拥有雄厚算力预算的实验室。
有一个注意事项值得关注。SIFT 的全部前提是语言模型裁判能做出正确判断,这也是为什么裁判质量成为该论文讨论中的核心话题。一个持续偏好错误补丁的裁判会把搜索引向错误方向——只是成本更低而已。随着搜索规模扩大,这种判断能否保持可靠,是后续工作值得关注的核心问题。