НовостиМакроCursor протестировала рой агентов, где фронтирные модели планируют, а более дешевые пишут код

Cursor протестировала рой агентов, где фронтирные модели планируют, а более дешевые пишут код

Автор: The Decoder·

Ключевые выводы

  • Новый рой Cursor разделяет агентов-планировщиков на фронтирных моделях и более быстрых, дешевых агентов-исполнителей для управления длительными задачами разработки ПО.
  • Бенчмарк требовал, чтобы агенты реализовали SQLite на Rust только по документации, без доступа к исходному коду SQLite, бинарным файлам, тестам или интернету.
  • Все конфигурации новой системы в итоге достигли 100 процентов в sqllogictest, а результаты через четыре часа превысили показатели старого роя во всех конфигурациях.
  • Старый рой Grok 4.5 создал около 68,000 коммитов за два часа и более 70,000 конфликтов слияния, тогда как новый запуск оставался ниже 1,000 конфликтов.
  • Cursor сообщила о значительной разнице в стоимости из-за выбора модели-исполнителя: гибрид Opus-Composer стоил $1,339 против $10,565 для одиночного GPT-5.5.
Cursor протестировала рой агентов, где фронтирные модели планируют, а более дешевые пишут код

Cursor протестировала обновленный рой агентов в сравнении со своей предыдущей системой: обеим было поручено заново реализовать SQLite на Rust, используя только документацию, без доступа к исходному коду или интернету. Каждая конфигурация новой системы в итоге достигла 100 процентов в тестовом наборе, тогда как прежний рой замедлялся из-за многочисленных конфликтов слияния и дублирования работы.

В Cursor флоты агентов перешли из исследовательского проекта в категорию ключевого продукта. С Cursor 3 разработчики могут запускать флоты ИИ-агентов параллельно. Anysphere, компания, стоящая за Cursor, недавно была приобретена SpaceX Илона Маска за $60 billion.

Система разделяет агентов на две роли. Агенты-планировщики, работающие на фронтирных моделях, рекурсивно разбивают цель на более мелкие задачи. Агенты-исполнители, использующие более быстрые и дешевые модели, выполняют эти задачи. В результате формируется дерево задач, которое может меняться по мере выполнения работы.

Cursor утверждает, что такое разделение в основном решает проблему управления контекстом. Один агент должен проходить по всему дереву задач, одновременно удерживая в памяти общую цель и текущую задачу, что помогает объяснить, почему агенты отклоняются от курса при длительных заданиях. В архитектуре роя Cursor планировщики не пишут код, а исполнители не занимаются планированием.

Git не смог справиться с 1,000 коммитов в секунду

Более ранний браузерный рой Cursor достигал примерно 1,000 коммитов в час в Git. В этой системе использовались агенты-исполнители, агент-судья и интегратор, отвечавший за разрешение конфликтов. В итоге интегратор стал скорее узким местом, чем решением.

Новый рой достиг 1,000 коммитов в секунду. Поэтому Cursor создала собственную систему контроля версий, заявив, что агенты, работающие на такой скорости, порождают типы сбоев, с которыми человеческие инженерные команды обычно не сталкиваются. В результате эксперимент стал не только проверкой генерации кода как таковой, но и вопросом о том, способна ли инфраструктура разработки координировать тысячи автоматизированных правок, не превращаясь в дублирование работы.

Одной из проблем стало то, что Cursor назвала "split-brain design". При таком сценарии два планировщика, не зная друг о друге, создавали одну и ту же концепцию в разных частях кодовой базы и реализовывали ее по-разному. Управлять конкуренцией становилось еще сложнее, когда планировщики знали друг о друге и блокировали друг друга конкурирующими правками.

Чтобы сократить такие проблемы, Cursor поручила агентам фиксировать решения в общих проектных документах. Код, связанный с решением, ссылался на соответствующий документ через ссылку, проверяемую во время компиляции.

Когда возникали конфликты слияния, вмешивался нейтральный агент и разрешал их. Исполнители также помечали слишком крупные файлы, чтобы внешний агент мог разделить их на меньшие модули. Поскольку агенты научились не трогать ключевой код при работе в существующих кодовых базах под человеческим контролем, Cursor намеренно разрешила им ломать вещи. Агент мог исправлять код за пределами назначенной ему области, а компилятор проводил изменение через систему.

Cursor протестировала нескольких рецензентов и поддерживаемый агентами справочник

Cursor оценила несколько методов проверки. Один рецензент получал полный транскрипт работы исполнителя, другой видел только результат работы исполнителя, а третий — только кодовую базу. Ни одна точка зрения не выявляла все проблемы, но Cursor обнаружила, что сочетание некоррелированных перспектив повышает надежность.

Компания также протестировала "field guide" — папку знаний, которую поддерживали сами агенты при фиксированном лимите строк. Каждый агент получал содержимое этой папки при запуске. Поскольку веса моделей после обучения фиксированы, Cursor сочла полезным сохранять неожиданные находки, чтобы последующие агенты могли сокращать путь.

Для бенчмарка Cursor дала рою 835-страничное руководство SQLite и поручила построить реализацию на Rust. Агенты не получили исходный код SQLite, тестовые наборы, бинарный файл SQLite или доступ в интернет. Бенчмарком был sqllogictest — тестовый набор с миллионами SQL-запросов и известными ответами. Рой не знал о существовании бенчмарка. Такая постановка делала задачу проверкой следования спецификации и системной интеграции, а не переводом исходного кода или настройкой под конкретный бенчмарк.

Cursor протестировала четыре конфигурации: GPT-5.5 solo, Grok 4.5 solo, Opus 4.8 в роли планировщика с Composer 2.5 в роли исполнителя и Fable 5 в роли планировщика с Composer 2.5 в роли исполнителя. Новая система превзошла старую во всех конфигурациях. Через четыре часа новые запуски набрали от 73 до 85 процентов, тогда как старые — от 11 до 77 процентов. Каждая конфигурация новой системы позднее достигла 100 процентов.

Старый рой создавал больше работы, чем завершал

Запуски Grok 4.5 показали, почему прежняя система отставала. Старый рой создал 68,000 коммитов за два часа — примерно в 70 раз больше, чем новая система. Cursor заявила, что большая часть этой активности была потрачена впустую. Старый запуск накопил более 70,000 конфликтов слияния, тогда как новый оставался ниже 1,000 на протяжении всего теста.

Самый конфликтный файл в старом запуске зафиксировал 7,771 конфликт с участием 1,173 агентов. Сопоставимый показатель в новом запуске составил 47 конфликтов. Та же проблема split-brain проявилась и в структуре пакетов. Старый запуск разделил проект на 54 Rust crate и создал три отдельные SQL-пакета, тогда как новый запуск рано остановился на девяти crate.

В конфигурации Fable 5 старому рою потребовалось 64,305 строк кода движка против 9,908 строк у новой системы. В конфигурации Opus старая система сгенерировала 19,013 строк и набрала 97 процентов. Новая система достигла 100 процентов с 4,645 строками. Для Cursor меньшее число строк и конфликтов было частью одного результата: улучшенный рой выполнял меньше избыточной реализации и при этом достигал более высокой эффективности в тестах.

Более дешевые модели-исполнители дали наибольшую разницу в стоимости

Общие расходы варьировались от $1,339 для гибридной конфигурации Opus до $10,565 для одиночного запуска GPT-5.5. Исполнители потребляли не менее 69 процентов токенов в каждом запуске и обычно более 90 процентов. Поскольку токены планировщиков были дороже, распределение стоимости отличалось от распределения токенов. В гибридном запуске Opus планировщик произвел лишь небольшую долю токенов, но на него пришлось две трети общего счета.

Выбор модели-исполнителя дал самый большой разрыв в стоимости. В запуске GPT-5.5 одни только исполнители стоили $9,373. В запуске с Opus и Composer весь флот исполнителей стоил $411 при сопоставимом качестве. Cursor объяснила разницу почти полностью ценой. Composer 2.5 показывает в бенчмарках уровень Opus 4.7 и GPT-5.5, но стоит $0.50 за миллион входных токенов и $2.50 за миллион выходных токенов. По словам основателя Cursor Майкла Труэлла, модель основана на Kimi K2.5.

Cursor утверждает, что лишь отдельные части большой задачи требуют интеллекта фронтирной модели, включая декомпозицию задачи и ключевые проектные решения. После того как фронтирный планировщик устраняет неоднозначность, более дешевые модели могут следовать плану. Однако гибридные запуски также показали, что качество планировщика по-прежнему имеет значение. Планировщик Fable 5 использовал меньше токенов планирования, чем Opus, но его исполнителям потребовалось намного больше токенов для завершения работы, из-за чего запуск Fable в целом оказался дороже.

Cursor описывает рои как своего рода вероятностный компилятор, который шаг за шагом преобразует намерение в исполняемую работу. Компания заявила, что главным ограничением в эксперименте было точное описание этого намерения. Cursor опубликовала кодовую базу из одиночного запуска Opus под названием minisqlite на GitHub.

В статье говорится, что запуски такого типа больше не ограничиваются лабораторными экспериментами. Предрелизная версия Fable 5 выполнила большую часть переписывания Bun с Zig на Rust. Шестьдесят четыре экземпляра написали более миллиона строк кода за 11 дней при стоимости около $165,000. Производственное использование остается другим: исследование, опубликованное в конце 2025 года, показало, что 68 процентов агентов, используемых в продакшене, выполняли не более десяти шагов до вмешательства человека. Для 47 процентов предел составлял менее пяти шагов. Этот контраст оставляет главный практический вопрос: какая часть контролируемого высокопараллельного рабочего процесса Cursor может быть перенесена в производственные среды, где люди по-прежнему быстро прерывают большинство запусков агентов.