新闻宏观经济VentureBeat Research:企业 AI Agent 治理在各控制层均滞后于部署

VentureBeat Research:企业 AI Agent 治理在各控制层均滞后于部署

作者: VentureBeat AI·

要点速览

  • VentureBeat Research 将身份、评估、成本遥测、上下文和编排确定为负责任地管理 AI Agent 所需的五个控制层。
  • 71% 的企业表示,其已部署的“Agent”中,能够完成自主多步骤工作的比例不超过四分之一。
  • 只有 5% 的企业表示完全信任自动化评估,尽管许多企业已经允许或计划允许 Agent 在没有人工审核的情况下进行生产变更。
  • 允许 Agent 共享凭证的公司报告的安全事件或险些发生的安全事件比例,高于为每个 Agent 使用限定范围身份的公司。
  • 更换意愿在编排层最高,68% 的组织计划在 12 个月内采用、新增或替换平台。
VentureBeat Research:企业 AI Agent 治理在各控制层均滞后于部署

企业在建立管理 AI Agent 所需控制措施之前,就已明知地部署了这些 Agent。这是 VentureBeat Research 于 2026 年 6 月开展的五项并行调查得出的核心结论;这些调查覆盖了 Agentic 技术栈的每一层。这一模式呼应了早期企业技术采用周期中的情况——从云迁移到移动集成——部署势头超过治理能力,迫使组织进入被动补救阶段。Agentic 浪潮的不同之处在于其覆盖面:由于 Agent 能够在生产系统内部采取自主行动,治理缺口带来的不仅是长期合规风险,还包括即时运营风险。各组织现在正在补建治理框架,以满足自身标准,并为此投入预算。在所衡量的全部五个控制层中,57% 至 68% 的企业计划在 12 个月内更换供应商或新增供应商,约三分之一的企业打算在本季度内作出调整。

VentureBeat Research 确定了企业在能够负责任地信任 AI Agent 之前必须实施的五项控制:身份、评估、成本遥测、上下文层和编排。身份决定哪个 Agent 被授权执行哪些操作,以及使用谁的凭证。评估用于判断 Agent 的输出是否达到质量标准。成本遥测跟踪运行每个 Agent 的费用。上下文层提供 Agent 在生成响应时依赖的业务数据和定义。编排控制平面协调多步骤 Agent 工作流。五份报告分别聚焦其中一项控制。它们共同构成了一条依赖链:没有限定范围身份的 Agent 无法被安全评估;没有可靠评估的 Agent 无法被信任去自主行动;而没有准确上下文的 Agent,无论其他控制运行得多好,都可能给出看似自信的答案。

大多数已部署的“Agent”本质上是披着外衣的聊天机器人

71% 的企业表示,在其已部署的“Agent”中,能够自主完成多步骤工作的比例不超过四分之一。只有 10% 的企业表示,真正的 Agent 构成了其运行系统中的大多数。这些受访者有能力作出判断:81% 的受访者在其组织中负责推荐或直接决定 AI 采购。对于每个回答都由人工审核的单提示词聊天机器人而言,其他四份报告所研究的控制措施都不是必需的。相比之下,真正的多步骤 Agent 需要所有这些控制——但大多数企业无法清楚识别自己部署的是哪一种类型。整个行业长期存在这种定义模糊的问题,因为供应商和内部团队对“Agent”这一标签的使用并不一致,从而使采购决策和风险评估更加复杂。(完整发现:Agentic Orchestration report.)

自主性推进速度超过了对评估的信任

三分之二的企业要么已经允许 Agent 仅根据自动化评估结果将代码或系统变更推送到生产环境——无需人工审核——要么正在积极建设这项能力,并计划在 12 个月内实现。尽管如此,只有 5% 的企业表示完全信任将用于支撑此类决策的评估。在过去一年中,一半企业曾发布通过内部评估的 Agent,但随后引发了面向客户的故障。评估信心与生产现实之间的差距反映出一个结构性挑战:大多数内部基准测试是在受控条件下测试 Agent 行为,未能纳入真实用户输入和不断变化的业务数据所带来的不确定性。建议很明确:在从任何工作流中移除人工审核之前,组织应将评估与真实生产结果进行对照测试,而不是依赖内部基准。(完整发现:Agent Reliability & Evals report.)

凭证共享与安全事件相关

69% 的公司允许至少部分 Agent 共享凭证,即多个 Agent 使用同一个 API key 或服务账户运行。在任何场景下允许凭证共享的组织中,63.5%(74 家中的 47 家)经历过安全事件或险些发生的安全事件。在每个 Agent 都使用自身限定范围身份的公司中,这一比例降至 40.9%(22 家中的 9 家)。这种相关性符合既有的零信任安全原则;在这些原则中,最小权限访问和按实体限定凭证范围长期以来一直是人类账户和服务账户的基线实践。建议的补救措施是为每个 Agent 配置限定范围的身份,并从接触生产系统的 Agent 开始。(完整发现:Agentic Security & Identity report.)

GPU 利用率持续偏低,成本跟踪滞后

在运营自有 GPU 的企业中,超过八成报告其利用率为 50% 或更低。与此同时,只有 44% 的企业严格监控其 AI 计算的实际成本及其产生的回报。这种组合造成了叠加的低效率:组织无法优化其没有衡量的工作负载;如果缺乏按工作负载划分的成本可见性,采购决策就会由容量焦虑而非利用率数据驱动。根据研究发现,首要任务不应是采购更多 GPU,而应是提高现有硬件的利用率,并衡量每项工作负载的成本。(完整发现:AI Infrastructure & Compute report.)

缺乏治理的数据导致自信但错误的回答

57% 的企业将过去六个月中 Agent 给出自信但错误答案的原因追溯到自身缺失或不一致的业务上下文,包括错误指标、过时定义或缺失文档。多数企业观察到这种情况不止一次。该发现凸显了行业日益认识到的一个区别:检索质量是必要条件,但当底层业务定义本身不一致或过时时,仅有检索质量并不足够。对 Agent 所依赖的定义进行治理,首先从指标和实体开始,必须先于任何扩大依赖这些定义的 Agent 规模的行动。(完整发现:Context Layers / RAG report.)

各层均未出现根深蒂固的既有厂商

没有任何一个层面拥有根深蒂固的既有供应商。当前的默认选择是企业已在使用的主要 AI 平台所捆绑的内置工具。更换意愿在编排层最高,68% 的组织计划在 12 个月内采用、新增或替换平台,34% 的组织计划在本季度内采取行动。这种开放的竞争格局与以往企业基础设施类别的早期阶段相一致:平台捆绑工具最初占据主导,随后专业供应商在深度和控制能力上实现差异化。调查并未捕捉支出将流向何处——是流向平台原生工具,还是流向专业挑战者——而这一尚未解决的问题预计将定义未来四个季度的市场走向。

关于本研究

VentureBeat Research 于 2026 年 6 月在其 VB Pulse 项目下开展了五项并行调查:Agentic Orchestration(101 名受访者)、Agent Reliability & Evals(157 名)、Agentic Security & Identity(107 名)、AI Infrastructure & Compute(107 名)以及 Context Layers / RAG(101 名)——合计 573 名合格受访者,均来自员工人数为 100 人或以上的组织。样本为自选样本,部分发现应作为方向性参考;每份报告均包含完整的方法说明。整体模式比任何单一百分比更有力地支持的是方向本身:每项调查独立地指向同一趋势。VentureBeat 同时制作了这项研究以及 VB Transform,这些报告正是在该会议上首次发布。