НовостиМакроРазрыв в оценке ИИ-агентов: компании доверяют автономии больше, чем тестам, которые должны ее ограничивать

Разрыв в оценке ИИ-агентов: компании доверяют автономии больше, чем тестам, которые должны ее ограничивать

Автор: VentureBeat AI·

Ключевые выводы

  • Половина опрошенных организаций, проводящих оценки, сообщили о клиентском сбое после того, как ИИ-агент или функция на базе LLM прошли внутреннее тестирование.
  • Только 5% респондентов заявили, что полностью доверяют автоматизированным оценкам агентов в их текущем виде.
  • Две трети организаций уже разрешают или разрабатывают пайплайны для изменений в production исключительно на основе результатов автоматизированной оценки.
  • Большинство организаций мониторит production-системы агентов на предмет функционирования, тогда как лишь 23% отслеживают корректность выводов в реальном времени.
  • Большинство респондентов планируют внедрить, добавить или заменить платформу оценки в течение 12 месяцев.
Разрыв в оценке ИИ-агентов: компании доверяют автономии больше, чем тестам, которые должны ее ограничивать

В 157 компаниях организации предоставляют ИИ-агентам все больше автономии, одновременно теряя уверенность в оценках, которые должны эту автономию регулировать. Половина уже развернула агента, который прошел внутренние оценки, но затем дал сбой перед клиентом. Сегодня лишь одна из двадцати организаций полностью доверяет автоматизированной оценке, а самым часто называемым недостатком является то, что оценки не согласуются с реальными результатами. Тем не менее две трети организаций либо уже разрешают, либо активно выстраивают процессы для вывода изменений агентов в production только на основе автоматизированной оценки — без участия человека.

Итогом становится то, что VentureBeat называет "разрывом в оценке": дистанция между тем, сколько автономии компании передают своим агентам, и тем, насколько они доверяют тестам, предназначенным для выявления сбоев. Отчасти этот разрыв носит структурный характер. В отличие от традиционного ПО, где детерминированные модульные и интеграционные тесты могут проверить ожидаемое поведение, ИИ-агенты связывают несколько этапов рассуждения, обращаются к внешним инструментам и API и выдают вариативные результаты на один и тот же ввод — из-за чего по своей природе сложно определить, как выглядит корректный результат, не говоря уже об автоматизации теста для него.

Обзор опроса

Этот выпуск VentureBeat Pulse Research — трекер Agentic Reliability & Evals — рассматривает, как технические руководители измеряют производительность агентов, какие платформы надежности и оценки они используют, как выбирают их и доверяют им, что ломается в production и насколько далеко они готовы позволить агентам работать без человеческого контроля.

Методология

VentureBeat провела этот опрос в рамках своей продолжающейся серии Pulse Research. Ответы были отфильтрованы по организациям со 100 и более сотрудниками (n=157) и получены в рамках одного опроса, проведенного в июне 2026 года. Поскольку это одна волна, а не объединенная многомесячная выборка, отчет является срезовым и не делает выводов о помесячных трендах. В вопросах с возможностью множественного выбора доли могут в сумме превышать 100%.

По ролям выборка состоит из старших и релевантных для закупок респондентов: 38% являются финальными лицами, принимающими решения о закупках ИИ, а еще 34% — рекомендателями или влиятельными участниками процесса. Среди указанных должностей — продуктовые и программные менеджеры (15%), консультанты и советники (10%), директора по инженерии/IT (8%) и CIO/CTO/CISO (8%), а также крупная категория "Другое" (37%).

По размеру организаций выборка смещена в сторону среднего рынка: лидируют компании со 100–499 сотрудниками (37%) и 500–2 499 сотрудниками (27%), далее следуют 2 500–9 999 (20%), 10 000–49 999 (10%) и 50 000+ (6%). Technology/Software — крупнейшая представленная отрасль с долей 23%, за ней следуют Retail/Consumer (15%), Healthcare/Life Sciences (12%) и Manufacturing (10%).

При 157 респондентах выборка достаточно велика, чтобы давать ориентир, но ее следует рассматривать как сигнал, а не как точное измерение. Она является самоотобранной, не вероятностной, и смещена в сторону среднего рынка — поэтому лучше всего отражает взгляд организаций, которые активно выстраивают практики оценки агентов, а не крупнейших операторов.

Примечание: этот опрос был перестроен для июньской волны на основе более раннего опроса "LLM observability and evaluations". Поскольку вопросы и выборка отличаются, сравнения с данными за апрель–май не проводятся.

Вывод 1: пройденная оценка не означает работающего агента

Организации спросили, развертывали ли они за последние 12 месяцев агента или функцию на базе LLM, которые прошли внутренние оценки, но затем вызвали сбой, заметный клиентам. Половина из тех, кто проводит оценки, сообщила, что такое происходило.

Это ключевая статистика отчета. Половина организаций (50%) выпустила ИИ-функцию, которая прошла внутренние оценки, а затем дала сбой перед клиентом — будь то некорректный вывод, нарушенный рабочий процесс или инцидент качества. Четверть сталкивалась с этим более одного раза. Лишь 36% сообщают, что таких сбоев не было, тогда как остальные либо не проводят оценок перед развертыванием (8%), либо не отслеживают первопричины достаточно тщательно, чтобы знать ответ (6%).

Сбой точен и значим: оценка показала, что агент готов, но это было не так. Все последующие выводы — как компании доверяют своим оценкам, что они мониторят и сколько автономии предоставляют — формируются этим опытом.

Вывод 2: почти никто полностью не доверяет автоматизированной оценке

Респондентов спросили, какое ограничение сильнее всего снижает их доверие к автоматизированным оценкам агентов. Лишь небольшая доля компаний вообще не высказала претензий.

Доверие к автоматизированной оценке ограничено и конкретно. Только 5% организаций говорят, что полностью доверяют автоматизированной оценке в ее текущем виде, то есть 95% указывают на ограничивающий фактор. Самое распространенное ограничение, названное 29%, напрямую объясняет вывод 1: оценки плохо согласуются с реальными результатами, пропуская агентов, которые позже терпят неудачу. Далее следуют предвзятость или непоследовательность — 21%, а также недостаток объяснимости — компании не всегда могут определить, почему оценка вынесла тот или иной вердикт, — 18%. Еще 17% указывают на риски утечки данных или конфиденциальности внутри самого процесса оценки.

Тестам, предназначенным для сертификации агентов, пока не доверяют в этой роли, что делает траекторию автономии, описанную в выводе 3, особенно показательной.

Вывод 3: потолок автономии все равно повышается

Организации спросили, разрешили бы они автономному агенту развернуть изменение кода или системы в production, опираясь исключительно на результаты автоматизированной оценки, без проверки человеком.

В этом заключается главный парадокс отчета. Несмотря на почти повсеместное недоверие к автоматизированной оценке (вывод 2), две трети организаций (66%) либо уже разрешают развертывание без участия человека для агентов с низким риском (34%), либо активно проектируют свои пайплайны так, чтобы разрешить это в течение года (33%). Лишь 22% исключают такую возможность в обозримом будущем.

Направление однозначно: компании движутся к тому, чтобы оценки автономно пропускали изменения в production — убирая человеческую проверку — именно в тот момент, когда признают, что эти оценки ненадежно отражают реальность. Потолок автономии растет быстрее, чем уровень уверенности под ним, создавая механизм, за счет которого сбои ложной уверенности из вывода 1 будут масштабироваться, а не сокращаться.

Примечательно, что этот сдвиг к автономии не ограничивается небольшими компаниями. При разделении выборки по размеру компании крупные предприятия немного дальше продвинулись по пути к отсутствию человеческой проверки, чем меньшие организации (70% против 64%), и немного чаще сообщали, что выпускали агента, прошедшего оценку, который затем подвел клиента (54% против 48%). Предположение, что крупные регулируемые организации дольше всех сохраняют человека в контуре, в этой выборке оказывается обратным. Эти показатели являются ориентировочными и основаны на 57 респондентах из компаний с 2 500+ сотрудниками и 100 респондентах из меньших организаций.

Вывод 4: стек оценки фрагментирован и ведется провайдерами

Респондентов спросили, какую платформу надежности или оценки агентов они в основном используют. У рынка нет явного лидера, а значительная доля не имеет специализированного инструмента.

Слой оценки находится на раннем этапе и не консолидирован. Лидируют инструменты самих провайдеров: native evals and traces от OpenAI (17%) и Claude Console evals от Anthropic (13%) вместе превосходят любую независимую платформу. Однако инструменты провайдеров делят первое место с примечательным ответом — 17% компаний вообще не используют специализированные инструменты оценки агентов, что является заметным пробелом для организаций, выпускающих агентов клиентам. Специализированные поставщики оценки — DeepEval (12%), Braintrust (8%), LangSmith, Weave, Promptfoo, Langfuse и Arize — распределены от единичных до низких двузначных долей, а 11% построили собственные решения. Ни одна независимая платформа пока не стала стандартом категории, из-за чего большинство компаний оценивают агентов с помощью инструментов провайдеров, самописных скриптов или вовсе без них. Фрагментация отчасти отражает темпы развития выше по стеку: open-source фреймворки для агентов, такие как LangChain, AutoGen и CrewAI, распространялись быстрее, чем успели сформироваться стандарты оценки, оставляя каждой экосистеме собственные представления о корректности.

Вывод 5: production-мониторинг редко следит за качеством вывода

Production-мониторинг ИИ-агента может отслеживать две принципиально разные вещи. Он может контролировать, функционирует ли система: доступен ли агент и отвечает ли он, завершился ли каждый запрос, насколько быстро, с какими затратами и с какими ошибками. Или он может контролировать, корректен ли вывод агента: автоматизированные проверки, оценивающие содержание каждого ответа по мере его отправки — дал ли агент правильный ответ, выполнил ли правильное действие и остался ли в рамках политики.

Это различие важно, потому что уверенно неверный ответ невидим для первого типа мониторинга. Запрос завершается, ответ приходит быстро, ошибка не возникает, и все метрики функционирования выглядят здоровыми.

При группировке по тому, что фактически мониторится, разрыв резкий: 51% организаций отслеживают только то, функционирует ли агент, тогда как 23% мониторят, корректны ли его ответы. С учетом нерегулярных проверяющих и тех, кто не знает ответа, примерно три четверти организаций не проводят автоматизированную оценку корректности вывода в production в реальном времени. Они видят, что система работает и сколько она стоит, но корректность ее ответов принимают на веру.

Технический барьер для закрытия этого разрыва значителен: оценка корректности вывода в реальном времени обычно требует второй модели — часто называемой LLM-as-judge, — которая оценивает каждый ответ при отправке; надежность и согласованность этой техники сами отражают те же опасения, которые компании высказывают об автоматизированной оценке в выводе 2.

Эта слепая зона является runtime-аналогом разрыва перед развертыванием из вывода 1: те же организации, которые выводят человека из решения о развертывании, в значительной степени не могут в реальном времени увидеть, когда развернутый агент начинает выдавать неверные ответы.

Вывод 6: покупают по цене, измеряют по согласованности

Организации спросили, что сильнее всего влияет на выбор поставщика оценки и что они считают главным показателем успеха. Оба ответа прагматичны.

Компании покупают инструменты оценки, исходя из экономики, а доверяют им за повторяемость. Стоимость оценок (28%) немного опережает другие критерии выбора, сразу перед простотой интеграции (27%) и точностью оценки (24%). Широта наблюдаемости (13%) и roadmap поставщика (4%) имеют гораздо меньшее значение.

В описании успеха более трети (36%) называют согласованность оценки — получение одного и того же вердикта для одного и того же поведения каждый раз — значительно опережая скорость экспериментов (19%), сокращение сбоев (18%), видимость в production (13%) и соответствие требованиям (11%). Акцент на согласованности показателен: прежде чем компании смогут доверять вердикту оценки, им нужна его стабильность — именно то свойство, отсутствие которого (предвзятость и непоследовательность) вошло в число главных ограничений доверия в выводе 2. Удовлетворенность текущими инструментами лишь умеренная: в среднем 3,8 по пятибалльной шкале по общей удовлетворенности, простоте внедрения и соотношению цены и ценности.

Вывод 7: следующий доллар идет на людей и наблюдаемость

Респондентов спросили, какие инвестиции в надежность и оценку вырастут сильнее всего в следующем году. Финансирование направляется на более пристальное наблюдение за агентами — в том числе с участием людей.

Второе по величине планируемое направление инвестиций — после production-наблюдаемости — это рабочие процессы человеческой проверки, 26%. В сопоставлении с выводом 1 это самое тихое противоречие отчета: в тот же момент, когда две трети компаний выстраивают процессы, выводящие человека из решения о развертывании, больше организаций планируют увеличить расходы на человеческих проверяющих (26%), чем на автоматизированные пайплайны оценки (16%), которые должны были бы их заменить. Траектория к нулевому участию человека и бюджет на человеческую проверку одновременно растут внутри одних и тех же компаний. Более того, лишь 8% сообщают, что их бюджет не увеличивается.

В совокупности компании хеджируют риски: строят путь к автономии, одновременно инвестируя в более пристальное наблюдение за агентами и сохраняя людей доступными для решений, которые автоматизированной оценке пока нельзя доверить.

Вывод 8: грядет перестановка инструментов

Организации спросили, планируют ли они внедрить новую, дополнительную или заменяющую платформу оценки и какие варианты рассматривают. Немногие намерены оставить все как есть.

Рынок оценки широко открыт. Хотя 36% не планируют изменений, явное большинство (64%) намерено внедрить новую, дополнительную или заменяющую платформу в течение двенадцати месяцев, а 31% — уже в следующем квартале. Набор рассматриваемых решений показывает, где текущее использование наиболее слабое: DeepEval от Confident AI лидирует среди оцениваемых платформ (20%), опережая native evals от OpenAI (13%) и Braintrust (9%); при этом open-source специалисты привлекают больше интереса, чем предполагает их текущая доля.

Учитывая, что сегодня многие компании полагаются на инструменты провайдеров или вообще ни на что (вывод 4), это скорее не уход от существующих решений, а первая настоящая волна внедрения инструментов — момент, когда слой оценки начинает консолидироваться. Какие платформы заслужат доверие на рынке, где почти никто пока не доверяет автоматизированной оценке, остается открытым вопросом, за которым эта серия продолжит следить.

Итог: разрыв в оценке, который автономия расширит, а не закроет

Организации со 100 и более сотрудниками предоставляют ИИ-агентам больше независимости, чем позволяют оценки, которым они доверяют. Половина уже выпустила агента, прошедшего оценки, который затем подвел клиента. Почти никто полностью не доверяет автоматизированной оценке, главным образом потому, что она не совпадает с реальными результатами. Большинство мониторит production на предмет доступности и стоимости, а не корректности ответов агента. Тем не менее две трети уже разрешают или активно движутся к развертыванию в production только на основе автоматизированной оценки.

Эта динамика разворачивается на фоне того, как регуляторные рамки начинают формализовать ожидания к тестированию ИИ. EU AI Act, вступивший в силу в августе 2024 года, вводит риск-ориентированные обязательства, включая оценку перед развертыванием и пострыночный мониторинг для высокорисковых ИИ-систем. NIST AI Risk Management Framework, опубликованный в январе 2023 года, предоставляет добровольные рекомендации по измерению, управлению и мониторингу надежности ИИ. Обе рамки подчеркивают тот же принцип, который показывают данные опроса: способность продемонстрировать заслуживающую доверия оценку становится требованием, а не предпочтением.

Рынок поставщиков находится на ранней и нестабильной стадии: самые распространенные основные инструменты оценки — это evals самих провайдеров, делящие место с полным отсутствием специализированных инструментов, и явное большинство планирует внедрить или сменить платформу в течение года. Следующий доллар направляется на наблюдаемость и — что особенно показательно — человеческую проверку, что говорит о том, что компании ощущают этот разрыв, даже когда проектируют процессы, проходящие мимо него.

При 157 респондентах в одной волне это ориентировочная картина, смещенная в сторону среднего рынка. Однако направление ясно: автономия предоставляется на основе оценок, которым люди, предоставляющие эту автономию, пока не доверяют. Разрыв в оценке — это не проблема покрытия, которую можно закрыть одними лишь дополнительными тестами; это проблема оценок, которые отражают реальность и которым можно доверить контроль доступа к ней. Открытый вопрос для будущих волн — догонит ли уверенность автономию или сбои ложной уверенности перейдут от клиентских инцидентов к изменениям, которые развертывают сами себя.

Основано на ответах 157 квалифицированных корпоративных респондентов (100+ сотрудников), полученных в рамках одной волны в июне 2026 года. Это ориентировочная картина, а не точное измерение: выборка самоотобранная, не вероятностная и смещена в сторону среднего рынка. Среди респондентов — продуктовые и программные менеджеры, консультанты и советники, директора по инженерии/IT и CIO/CTO/CISO, а также представители других функций из technology/software, retail/consumer, healthcare/life sciences, manufacturing и других отраслей.