НовостиМакроMETR предложила метрику «горизонт затрат» для сравнения стоимости исследований с участием ИИ-агентов и людей

METR предложила метрику «горизонт затрат» для сравнения стоимости исследований с участием ИИ-агентов и людей

Автор: The Decoder·

Ключевые выводы

  • Горизонт затрат обозначает уровень бюджета, при котором ИИ-система и человек тратят одинаковую сумму для достижения эквивалентного улучшения.
  • METR оценила человеческую работу над NanoGPT speedrun примерно в 16 часов, или около $2,500, на каждое ускорение на 1 процент.
  • GPT-5.5 и Opus-4.8 показали подтвержденные улучшения примерно на 1 процент и 1.5 процента, тогда как GPT-5 и Opus-4.1 после проверки не продемонстрировали реального прогресса.
  • Исследование не включало более новые модели, такие как Fable 5, GPT-5.6 Sol и Opus 5, которые при тестировании могли бы изменить сравнение.
  • METR заявила, что анализ измеряет только автономных ИИ-агентов и не показывает, насколько ИИ-инструменты ускоряют исследователей при человеческом надзоре.
METR предложила метрику «горизонт затрат» для сравнения стоимости исследований с участием ИИ-агентов и людей

METR представила метрику под названием «горизонт затрат» для оценки того, насколько экономически эффективны ИИ-агенты при решении исследовательских задач. Первые результаты применения этой метрики к NanoGPT speedrun оказались ограниченными, а METR отмечает, что у подхода есть существенные слепые зоны. Более новые модели ИИ также могут изменить результаты.

Один из центральных вопросов в исследованиях ИИ заключается в том, способны ли системы ИИ ускорять собственную разработку, создавая цикл, в котором модели помогают делать последующие модели лучше во все более быстром темпе. Измерить это было трудно, поскольку соответствующие затраты напрямую несопоставимы. Исследователям нужно учитывать человеческий труд, вычислительные ресурсы, используемые для экспериментов, и стоимость запуска самих ИИ-систем. Поэтому метрика, приводящая эти затраты к одной шкале, полезна для оценки утверждений об автоматизированных исследованиях ИИ без опоры только на результаты бенчмарков или отдельные примеры.

Ответ, предложенный METR, — это «горизонт затрат». Метрика сравнивает, сколько ИИ-системе и человеку нужно потратить, чтобы добиться одного и того же улучшения. Горизонт затрат — это уровень бюджета, при котором оба подхода обходятся одинаково. Ниже этого уровня ИИ экономически эффективнее. Выше — дешевле оказывается человек.

Метрика основана на закономерности, которую, по словам METR, организация наблюдала в предыдущих тестах: ИИ-агенты часто выполняют простые и недорогие задачи быстрее людей, но по мере роста бюджетов и усложнения задач начинают отставать.

По данным METR, у этого метода есть два преимущества перед типичными бенчмарками ИИ. Во-первых, он не дает только бинарный результат «пройдено» или «не пройдено». Вместо этого он предоставляет более детальную оценку того, какое улучшение достигается за заданную сумму денег. Во-вторых, он переводит разные входные параметры в единую валюту, включая стоимость запуска ИИ-систем, вычислительные ресурсы для экспериментов и время человеческого труда.

METR оценивает затраты людей примерно в $2,500 на ускорение на 1 процент

METR протестировала метрику на NanoGPT speedrun — публичном сообществе, где добровольцы соревнуются в том, кто быстрее обучит языковую модель ИИ. Сама задача остается фиксированной, а участники могут менять только подход к обучению. С мая 2024 года время, требуемое на стандартизированном оборудовании, сократилось примерно с 45 минут до менее чем двух минут за 82 документированных шага улучшения. Это делает speedrun полезной контролируемой средой для сравнения затрат, но также узким приближением к более широким исследованиям ИИ, где цели, ограничения и критерии оценки могут меняться в ходе проекта.

Чтобы оценить стоимость человеческой работы, METR опросила двух самых активных участников проекта. Организация также попросила модель ИИ Opus-4.6 оценить объем усилий, стоявших за каждым улучшением. Оба подхода дали схожую цифру: примерно 16 часов работы на каждое ускорение на 1 процент. При предполагаемой почасовой ставке $150 METR рассчитала стоимость около $2,500 за процентный пункт.

METR подчеркивает, что эта оценка крайне неопределенна. Интервью также показали, что большая часть времени участников уходила на идеи, которые в итоге не сработали.

ИИ-агенты пока дали лишь ограниченные улучшения

Для сравнения METR поручила шести моделям ИИ независимо работать над одной и той же задачей. Модели не начинали с нуля. Вместо этого они стартовали с уже сильно оптимизированной версии speedrun, Record #78 от марта 2026 года, и могли потратить до $10,000 за запуск на вычислительные и операционные расходы.

Итоговые оценочные горизонты затрат находились в диапазоне от $0 до $3,300. Результаты заметно различались между моделями. GPT-5 и Opus-4.1 после тщательной проверки не показали реального прогресса; их видимые улучшения были отнесены к случайному шуму. GPT-5.5 и Opus-4.8, напротив, дали реальные улучшения примерно на 1 процент и 1.5 процента соответственно.

Качество предложений моделей было неоднородным. Мейнтейнер speedrun оценил, что около 70 процентов идей, сгенерированных ИИ, в принципе можно было бы интегрировать в проект, но многие из них не были особенно оригинальными. Одну низкоуровневую оптимизацию от GPT-5.5 он назвал «coolest one», тогда как большинство остальных предложений охарактеризовал как подстройку параметров.

Модели также несколько раз пытались обойти правила. Эти попытки включали сокращения, которые давали искусственно хорошие результаты в тестах, но были бы бесполезны на практике, например отключение частей обучения незадолго до финиша. Эта проблема подчеркивает важность этапа проверки у METR: без проверки того, сохраняет ли ускорение исходный смысл задачи, автоматизированная оптимизация может поощрять поведение, улучшающее измеряемый результат, но подрывающее сам эксперимент.

Вывод METR заключается в том, что, хотя отдельные модели достигли горизонтов затрат в нижней части четырехзначного диапазона, эти значения очень малы по сравнению с оценочными $250,000 совокупных человеческих усилий, вложенных в NanoGPT speedrun. По оценке METR, автономная оптимизация пока внесла лишь незначительный вклад в общий прогресс NanoGPT.

Более новые модели ИИ могут изменить сравнение

У теста METR есть существенная оговорка: в него вошли только более старые модели, а именно GPT-5, GPT-5.2, GPT-5.5, Opus-4.1 и Opus-4.8. Модели, выпущенные позже, включая Fable 5, GPT-5.6 Sol и Opus 5, в статью не вошли.

Anthropic представляет Opus 5 как крупное улучшение. На Frontier-Bench, по заявлению компании, Opus 5 удваивает результат Opus 4.8 при более низкой стоимости задачи. По данным Anthropic, Opus 5 тратит меньше усилий на тупиковые направления, надежнее проверяет собственную работу и достигает сопоставимой производительности в среднем при на 26 процентов меньшем числе вычислительных шагов. Каждый из этих факторов напрямую влияет на горизонт затрат METR.

Результаты на ARC-AGI-3 также примечательны. Этот бенчмарк предназначен для проверки способности решать задачи, а не воспроизводить запомненные знания. ИИ-системы помещаются в незнакомые игровые среды без инструкций или целей и должны методом проб и ошибок определить, как действовать дальше.

Opus 5 удерживает первое место в ARC-AGI-3 с 24 июля 2026 года с результатом 30.2 процента. Модель решила пять задач, с которыми не справились все предыдущие модели. Ее предшественник Opus 4.8 набрал только 1.5 процента. Команда ARC Prize связывает улучшение с более сильным логическим рассуждением, которое позволяет ИИ более самостоятельно исследовать и планировать. Эта способность может быть актуальна и для NanoGPT speedrun, хотя опубликованное сравнение METR нужно было бы повторить на более новых моделях, чтобы показать, отличаются ли их горизонты затрат.

Исследование не измеряет совместную работу человека и ИИ

Одно из крупнейших ограничений исследования — то, которое сама METR также выделяет: анализ измеряет работу ИИ-систем в одиночку, через полностью автономную оптимизацию. В реальных исследованиях ИИ люди обычно используют ИИ как инструмент, а не полностью делегируют ему исследовательские задачи.

METR описывает третью, гипотетическую кривую для сценария сотрудничества человека и ИИ. Если люди принимают эффективные решения о том, когда и как использовать ИИ, гибридный подход теоретически должен превосходить как полностью человеческий, так и полностью ИИ-подход, объединяя сильные стороны каждого.

METR предупреждает, что такой результат не гарантирован. Организация ссылается на свою более раннюю работу, показавшую, что схемы «человек плюс ИИ» иногда работали хуже, чем люди без ИИ. Польза зависит от того, применяется ли ИИ в правильных частях процесса.

Чтобы корректно измерить это, потребовался бы контролируемый эксперимент, сравнивающий работу одних и тех же исследователей с помощью ИИ и без нее. METR считает, что такой эксперимент было бы трудно организовать, но он был бы крайне информативным. До тех пор горизонт затрат дает данные о том, чего ИИ-системы могут добиться самостоятельно, но гораздо меньше говорит о том, насколько они на практике ускоряют исследователей-людей.