新闻宏观经济AI Agent 评估缺口:企业对自主性的信任超过了对把关测试的信任

AI Agent 评估缺口:企业对自主性的信任超过了对把关测试的信任

作者: VentureBeat AI·

要点速览

  • 在接受调查且开展评估的组织中,有一半报告称,AI agent 或 LLM 功能通过内部测试后仍发生了面向客户的故障。
  • 只有 5% 的受访者表示完全信任当前运行方式下的自动化 agent 评估。
  • 三分之二的组织已经允许,或正在开发流水线,以便仅基于自动化评估结果进行生产变更。
  • 多数组织监控 agent 生产系统的功能状态,而只有 23% 实时监控输出是否正确。
  • 多数受访者计划在 12 个月内采用、增加或替换评估平台。
AI Agent 评估缺口:企业对自主性的信任超过了对把关测试的信任

在 157 家企业中,组织正在赋予 AI agent 更高的自主性,同时对用于治理这种自主性的评估失去信心。有一半企业已经部署过通过内部评估的 agent,结果却在客户面前失败。如今,只有二十分之一的企业完全信任自动化评估,而最常被提及的弱点是评估无法与真实世界结果保持一致。尽管如此,三分之二的组织要么已经允许,要么正在积极建设能力,以便仅基于自动化评估就将 agent 变更部署到生产环境——且无需人工介入。

其结果就是 VentureBeat 所称的“评估缺口”:企业赋予 agent 的自主性与其对用于发现故障的测试的信任程度之间的距离。这个缺口在一定程度上是结构性的。与传统软件不同,传统软件可以通过确定性的单元测试和集成测试来验证预期行为;AI agent 会串联多个推理步骤,调用外部工具和 API,并针对相同输入产生可变输出——这使得定义正确结果本身就非常困难,更不用说为其自动化测试了。

调查概览

本期 VentureBeat Pulse Research——Agentic Reliability & Evals tracker——考察技术领导者如何衡量 agent 性能、他们使用哪些可靠性和评估平台、如何选择并信任这些平台、生产环境中会出现哪些问题,以及他们愿意在多大程度上让 agent 在没有人工监督的情况下运行。

方法论

VentureBeat 将这项调查作为其持续开展的 Pulse Research 系列的一部分。回复筛选范围为拥有 100 名或以上员工的组织(n=157),数据来自 2026 年 6 月进行的一次单独调查。由于这是一轮调查,而不是汇总的多月样本,因此报告采用横截面视角,不推断逐月趋势。在允许多选的问题中,各选项占比相加可能超过 100%。

从职能角色看,样本具有较高资深度和采购可信度:38% 是 AI 采购的最终决策者,另有 34% 是推荐者或影响者。具名职位包括产品和项目经理(15%)、顾问和咨询师(10%)、工程/IT 总监(8%)以及 CIO/CTO/CISO(8%),此外还有较大的“其他”类别(37%)。

从组织规模看,样本偏向中端市场:100–499 名员工的企业占 37%,500–2,499 名员工的企业占 27%,随后是 2,500–9,999 名员工(20%)、10,000–49,999 名员工(10%)以及 50,000+ 名员工(6%)。技术/软件是占比最高的行业,为 23%,其次是零售/消费(15%)、医疗健康/生命科学(12%)和制造业(10%)。

157 名受访者的样本规模足以提供方向性信息,但应被视为一种信号,而非精确测量。该样本为自我选择样本,不是概率样本,并且偏向中端市场——因此更适合被理解为正在积极构建 agent 评估实践的组织视角,而非最大型运营方的视角。

注:本次调查是在 6 月这一轮中基于此前的“LLM observability and evaluations”调查重新构建的。由于问题和样本不同,本文不与 4–5 月数据进行比较。

发现 1:通过评估并不等于 agent 可正常工作

调查询问各组织,在过去 12 个月中,是否曾部署过通过内部评估但随后造成面向客户故障的 agent 或 LLM 功能。在开展评估的组织中,有一半表示曾发生过这种情况。

这是本报告的核心统计数据。有一半组织(50%)曾发布通过内部评估的 AI 功能,但随后在客户面前失败——可能表现为错误输出、流程中断或质量事件。四分之一的组织不止一次经历过这种情况。只有 36% 报告没有此类故障,其余组织要么不进行部署前评估(8%),要么没有足够细致地追踪根因,因此无法判断(6%)。

这种失败明确且后果重大:评估显示 agent 已经准备就绪,但事实并非如此。后续所有发现——企业如何信任其评估、监控什么,以及授予多少自主性——都受到这一经历的影响。

发现 2:几乎没有人完全信任自动化评估

受访者被问及哪一项限制最削弱他们对自动化 agent 评估的信任。只有极少数企业表示没有任何不满。

对自动化评估的信任既稀缺又具体。只有 5% 的组织表示完全信任当前状态下的自动化评估,这意味着 95% 的组织指出了某种限制因素。最常见的限制因素由 29% 的受访者提及,它直接解释了发现 1:评估与真实世界结果匹配不佳,让后来会失败的 agent 通过。偏差或不一致性以 21% 紧随其后;缺乏可解释性——企业并不总能确定评估为何得出某个结论——占 18%。另有 17% 提到评估过程本身存在数据泄露或隐私方面的担忧。

用于认证 agent 的测试尚未被信任能够完成这项认证,这使得发现 3 中描述的自主性趋势尤其引人关注。

发现 3:自主性上限仍在上升

调查询问各组织,是否会允许自主 agent 仅基于自动化评估结果,将代码或系统变更部署到生产环境,而无需人工参与验证。

这是本报告核心的悖论。尽管几乎普遍不信任自动化评估(发现 2),三分之二的组织(66%)要么已经允许低风险 agent 进行零人工参与的部署(34%),要么正在积极建设流水线,以便在一年内实现这一点(33%)。只有 22% 在可预见的未来排除了这种做法。

方向非常明确:企业正在转向让评估自主把关生产环境——移除人工检查——而与此同时,它们也承认这些评估并不能可靠地匹配现实。自主性上限的上升速度快于其底层保障能力,这形成了一种机制,使发现 1 中由虚假信心导致的失败更可能扩大,而不是减少。

值得注意的是,这种向自主性的推进并不局限于小型公司。按公司规模拆分样本后,大型企业在迈向零人工审核的路径上比小型企业略微更靠前(70% 对 64%),并且也略微更可能已经发布过通过评估但随后导致客户失败的 agent(54% 对 48%)。认为大型、受监管组织会最长时间保留人工介入的假设,在本样本中恰好相反。这些数字具有方向性,来自 57 名任职于 2,500+ 名员工企业的受访者,以及 100 名来自规模更小组织的受访者。

发现 4:评估技术栈碎片化,并由提供商主导

受访者被问及他们主要使用哪种 agent 可靠性或评估平台。市场没有明确领导者,而且相当一部分企业没有专用工具。

评估层仍处于早期且尚未整合。提供商原生工具领先:OpenAI 的原生 evals 和 traces(17%)以及 Anthropic 的 Claude Console evals(13%)合计超过任何独立平台。然而,提供商原生工具在榜首位置还与一个值得注意的答案并列——17% 的企业根本没有使用任何专门的 agent 评估工具;对于正在向客户交付 agent 的组织而言,这是一个显著缺口。专业评估供应商——DeepEval(12%)、Braintrust(8%)、LangSmith、Weave、Promptfoo、Langfuse 和 Arize——分散在个位数到低两位数区间,另有 11% 构建了自己的解决方案。尚无独立平台成为该类别的标准,这使得大多数企业仍在使用提供商原生工具、自研脚本,或者完全没有工具来评估 agent。这种碎片化在一定程度上反映了上游发展的速度:LangChain、AutoGen 和 CrewAI 等开源 agent 框架的扩散速度快于评估标准形成的速度,导致每个生态系统都在定义自己的正确性概念。

发现 5:生产监控很少关注输出质量

AI agent 的生产监控可以追踪两类本质上不同的事项。它可以监控系统是否在运行——agent 是否在线并响应、每个请求是否完成、速度如何、成本多少、是否有错误。或者,它可以监控 agent 的输出是否正确——在每个响应发出时,通过自动化检查评估其内容:agent 是否给出了正确答案、采取了正确行动,并遵守了政策。

这种区别很重要,因为自信但错误的答案对第一类监控来说是不可见的。请求完成了,响应很快,没有抛出错误,所有功能性指标都显示健康。

按实际监控内容分组后,差异非常明显:51% 的组织只监控 agent 是否正常运行,而 23% 监控其答案是否正确。若计入临时审核人员以及“不知道”的受访者,大约四分之三的组织在生产环境中没有对输出正确性进行自动化、实时评估。它们可以看到系统是否在线以及成本是多少,但对其答案的正确性只能选择相信。

弥合这一缺口的技术障碍相当显著:实时评估输出正确性通常需要第二个模型——通常称为 LLM-as-judge——在每个响应发出时进行评分,而这种技术自身的可靠性和一致性限制,又呼应了企业在发现 2 中对自动化评估提出的担忧。

这个盲点是发现 1 中部署前缺口在运行时的对应物:那些正在把人工从部署决策中移除的组织,在很大程度上无法实时看到已部署 agent 何时开始产生错误答案。

发现 6:按成本购买,按一致性衡量

调查询问组织在选择评估供应商时最看重什么,以及它们认为主要成功指标是什么。两个答案都很务实。

企业基于经济性购买评估工具,并因可重复性而信任它。评估成本(28%)略微领先选择标准,紧随其后的是集成便捷性(27%)和评估准确性(24%)。可观测性的广度(13%)和供应商路线图(4%)的重要性要低得多。

在成功标准方面,超过三分之一(36%)将评估一致性列为首要指标——也就是对相同行为每次都给出相同结论——明显领先于实验速度(19%)、故障减少(18%)、生产可见性(13%)和合规性(11%)。对一致性的强调很有启示意义:在企业能够信任评估结论之前,它们需要结论保持稳定——而这种特性的缺失(偏差和不一致性)正是发现 2 中排名靠前的信任限制之一。企业对当前工具的满意度仅为中等,在总体满意度、实施便捷性和性价比三项上,五分制平均得分为 3.8。

发现 7:下一笔投入流向人工和可观测性

受访者被问及未来一年哪类可靠性和评估投资增长最多。资金正在流向对 agent 更密切的监督——包括通过人工方式。

第二大计划投资方向——仅次于生产可观测性——是人工审核工作流,占 26%。结合发现 1 来看,这是本报告中最不显眼的矛盾:在三分之二的企业正在把人工从部署决策中移除的同时,计划增加人工审核人员支出的企业(26%)多于计划增加自动化评估流水线支出的企业(16%),而后者本应取代人工。零人工路径和人工审核预算正在同一批公司中同时上升。事实上,只有 8% 的受访者表示其预算没有增加。

综合来看,企业正在进行对冲:一方面建设通往自主性的能力,另一方面投资以更密切地观察 agent,并保留人工来处理自动化评估尚不值得信任的决策。

发现 8:工具洗牌即将到来

调查询问组织是否计划采用新的、额外的或替代性的评估平台,以及正在考虑哪些平台。很少有组织打算原地不动。

评估市场仍然高度开放。虽然 36% 没有变更计划,但明显多数(64%)打算在 12 个月内采用新的、额外的或替代性平台,其中 31% 计划在下个季度内行动。候选名单凸显了当前使用最薄弱的领域:Confident AI 的 DeepEval 在正在被评估的平台中领先(20%),高于 OpenAI 的原生 evals(13%)和 Braintrust(9%)——开源专业厂商吸引的兴趣超过其当前市场足迹所显示的水平。

鉴于许多企业如今依赖提供商原生工具或根本没有工具(发现 4),这与其说是流失,不如说是第一波真正的工具采用浪潮——也就是评估层开始整合的时刻。在一个几乎还没有人信任自动化评估的市场中,哪些平台能够赢得信任,仍是本系列将继续追踪的开放问题。

结论:自主性会扩大而非缩小评估缺口

拥有 100 名或以上员工的组织正在赋予 AI agent 更多独立性,但它们对评估的信任并不足以支撑这种独立性。有一半企业已经发布过通过评估但随后导致客户失败的 agent。几乎没有企业完全信任自动化评估,主要原因是它无法匹配真实世界结果。大多数企业监控生产环境中的正常运行时间和成本,而不是 agent 的答案是否正确。尽管如此,三分之二的企业已经允许,或正在积极建设能力,以便仅凭自动化评估就部署到生产环境。

这一动态正在展开之际,监管框架也开始正式化对 AI 测试的预期。2024 年 8 月生效的 EU AI Act 引入了基于风险的义务,包括对高风险 AI 系统进行部署前评估和上市后监测。2023 年 1 月发布的 NIST AI Risk Management Framework 为衡量、管理和监控 AI 可靠性提供了自愿性指导。两个框架都强调了调查数据所揭示的同一原则:证明评估可信的能力正在成为一项要求,而不是一种偏好。

供应商市场仍处于早期且尚不稳定:最常见的主要评估工具是提供商原生 evals,并列的是完全没有专用工具;而明显多数企业计划在一年内采用或更换平台。下一笔资金正在流向可观测性,以及——尤为值得注意的——人工审核,这表明企业即使在试图越过这个缺口时,也感知到了它的存在。

在单轮调查中有 157 名受访者,这是一份方向性解读,且样本偏向中端市场。不过,方向是明确的:自主性正在基于一套连授予自主性的人自己都尚未信任的评估而被授予。评估缺口不是仅靠增加测试数量就能弥合的覆盖率问题;它是一个关于评估是否反映现实、并且能否被信任来把关现实的问题。后续调查中的开放问题是:保障能力能否追上自主性——还是由虚假信心导致的失败会从客户事件升级为自动部署的变更。

本文基于 157 名合格企业受访者(100+ 名员工)的调查回复,数据来自 2026 年 6 月的单轮调查。这是一份方向性解读,而非精确测量——样本为自我选择样本,不是概率样本,并且偏向中端市场。受访者包括产品和项目经理、顾问和咨询师、工程/IT 总监以及 CIO/CTO/CISO 等不同职能,覆盖技术/软件、零售/消费、医疗健康/生命科学、制造业和其他行业。