НовостиМакроSIFT от MIT и Sakana AI снижает стоимость оценки самоулучшающихся агентов для написания кода

SIFT от MIT и Sakana AI снижает стоимость оценки самоулучшающихся агентов для написания кода

Автор: CryptoBriefing·

Ключевые выводы

  • •SIFT набрал 35,1% на бенчмарке Polyglot всего за 30 шагов расширения, превзойдя Darwin Gödel Machine с её 30,7%, потребовавшей поиска на 80 узлов.
  • •Фреймворк заменяет полный бенчмаркинг каждого предложенного изменения языковой моделью-судьёй, чьи попарные предпочтения преобразуются в рейтинги с помощью регуляризованной модели Брэдли — Терри.
  • •Конфигурация на базе Qwen3-Coder-30B с открытыми весами от Alibaba завершила весь поиск за 224 часа CPU при затратах на API около 34 долларов — примерно одна десятая ресурсов, потреблённых DGM.
  • •SIFT также повысил результаты на TerminalBench 2.1 с 29,2% до 36,7% и на S-60 с 40,0% до 52,1%.
  • •Эффективность метода зависит от точности языковой модели-судьи, что исследователи выделяют как центральный открытый вопрос при росте масштаба поиска.
SIFT от MIT и Sakana AI снижает стоимость оценки самоулучшающихся агентов для написания кода

Агенты для написания кода, способные переписывать собственный исходный код, несут скрытые расходы, которые слабо связаны с самой генерацией изменений: каждое самомодифицирование должно быть проверено, прежде чем кто-либо сможет понять, помогло ли оно на самом деле. Исследователи из MIT и Sakana AI полагают, что нашли значительно более дешёвый способ выполнения такой проверки.

Их фреймворк SIFT — сокращение от Self-Improvement via Fast Tree-search — набрал 35,1% на бенчмарке Polyglot всего за 30 шагов расширения. Название говорит само за себя: tree-search выращивает ветвящуюся структуру кандидатных модификаций, где каждый шаг расширения добавляет узел для исследования. Важна базовая точка сравнения: более ранняя Darwin Gödel Machine (DGM) потребовала 80 узлов поиска, чтобы достичь 30,7% на том же бенчмарке.

Оценка кандидатов без полного запуска бенчмарка

Рекурсивно самоулучшающиеся агенты для написания кода работают во многом как писатель, редактирующий собственные черновики. Агент предлагает модификацию собственного кода, надеясь, что новая версия будет лучше справляться с реальными задачами. Сложность заключается в верификации: тестирование каждого предложенного патча на полном бенчмарке требует серьёзных вычислительных ресурсов, а счёт быстро растёт, когда агент генерирует множество кандидатов.

SIFT обходит значительную часть этих затрат, вводя «рефери». Вместо бенчмаркинга каждого изменения фреймворк просит большую языковую модель сравнить две кандидатные модификации и определить, какая выглядит лучше. Эти попарные вердикты затем агрегируются через регуляризованную модель Брэдли — Терри — статистический метод преобразования попарных предпочтений в общую рейтинговую оценку.

Фреймворк также выполняет оценки асинхронно, поэтому кандидатам не нужно ждать в одной очереди своей очереди на тестовом стенде. В результате получается гибридный конвейер: языковая модель дёшево отфильтровывает поле кандидатов, и лишь отобранные модификации проходят дорогостоящую последующую оценку.

Цифры, стоящие за заявлением об эффективности

Главный результат показал агент для написания кода o3-mini. На Polyglot SIFT достиг результата 35,1% за 30 шагов расширения, немного превзойдя 30,7% DGM, полученные в ходе гораздо более длинного поиска на 80 узлов.

История затрат становится ещё более впечатляющей с моделями с открытыми весами. Конфигурация на базе Qwen3-Coder-30B — релиза с открытыми весами из семейства Qwen компании Alibaba — завершила весь поиск 224 часа работы CPU при затратах на API примерно в 34 доллара — около одной десятой ресурсов, потреблённых DGM.

SIFT также продемонстрировал прирост на других бенчмарках. На TerminalBench 2.1 производительность выросла с 29,2% до 36,7% — улучшение на 7,5 процентного пункта. На S-60 скачок был больше: результат вырос с 40,0% до 52,1% — прирост на 12,1 процентного пункта относительно исходной базовой линии.

Кто это создал и какое место это занимает

Авторы статьи — Синхун Фу (Xinghong Fu) из MIT, а также Аравинт Кулантайвелу (Aravinth Kulanthaivelu) и Ютаро Ямада (Yutaro Yamada), сотрудничающей лабораторией выступила Sakana AI. Статья была опубликована на arXiv — сервере препринтов открытого доступа, где исследования обычно появляются до формального рецензирования, — около 18 сентября 2026 года, а обсуждение работы начало распространяться на различных платформах в конце сентября 2026 года. Значительная часть дискуссии сосредоточилась на двух темах: экономии затрат и растущей важности того, насколько качественна сама языковая модель-судья.

Подход хорошо согласуется с общей философией Sakana AI. Токийская лаборатория, основанная в 2023 году бывшими исследователями Google, включая соавтора статьи о Transformer Ллиона Джонса (Llion Jones), делает акцент на эволюционных методах поиска, а не на стратегиях грубой силы в разработке ИИ, и SIFT — это именно случай работы «умнее», а не решения проблемы за счёт большего количества оборудования. Он также напрямую продолжает линейку Darwin Gödel Machine: DGM показала, что агенты могут улучшать себя через итеративный поиск, а SIFT нацелен на узкое место в оценке, делавшее этот поиск столь дорогим.

Что это означает для разработчиков и гонки самоулучшения

Самое непосредственное следствие — доступность. Если полный поиск самоулучшения может выполняться примерно за 34 доллара затрат на API, эта область может больше не принадлежать исключительно лабораториям с большими вычислительными бюджетами.

Одна оговорка заслуживает внимания. Вся предпосылка SIFT опирается на то, что языковая модель-судья принимает правильные решения, — именно поэтому качество судьи стало центральной темой обсуждения статьи. Судья, стабильно предпочитающий неверный патч, направит поиск в неверную сторону — просто дешевле. Останется ли это суждение надёжным при масштабировании поисков — открытый вопрос, за которым стоит следить в последующих работах.

Источник: CryptoBriefing