新闻股票VentureBeat 调查显示,企业 AI Agent 编排正向模型平台集中,但多数部署仍是聊天机器人封装

VentureBeat 调查显示,企业 AI Agent 编排正向模型平台集中,但多数部署仍是聊天机器人封装

作者: VentureBeat AI·

要点速览

  • Anthropic 的 Claude 是 40% 受访企业的主要 Agent 编排平台,份额超过第二名 Microsoft(18%)的两倍。
  • 尽管企业拥有雄心勃勃的编排策略,71% 的企业承认其已部署 Agent 中只有四分之一或更少是真正的多步骤编排工作流,而不是单提示词聊天机器人封装。
  • 供应商锁定是企业对驻留在提供商内部的 Agent 控制最主要的担忧,有 35% 的受访者提到,这促使 51% 预计到 2026 年底将采用混合控制平面。
  • 68% 的受访组织计划在 12 个月内采用、增加或替换其编排平台,这是 VentureBeat 跟踪的所有技术层中最高的更换意愿。
  • 超过四分之一的企业缺乏任何实时程序化方法,无法在成本产生之前阻止失控的 Agent token 支出,凸显财政控制仍主要是被动的。
VentureBeat 调查显示,企业 AI Agent 编排正向模型平台集中,但多数部署仍是聊天机器人封装

企业 AI Agent 编排——即协调将模型调用、工具使用和自主决策串联起来的多步骤工作流——正迅速向模型提供商平台集中。根据 VentureBeat Pulse Research 对 101 家企业的调查,Anthropic 的 Claude 以较大优势领先。受访者表示,他们选择编排平台主要是因为底层模型的实力和吸引力,并且主要以可靠的多步骤执行来衡量成功。

然而,企业部署的现实仍远远落后于这一目标。多数已部署的“Agent”仍是聊天机器人封装,而不是真正的编排工作流。企业还预计,Agent 控制平面将保持有意设计的混合形态,以避免供应商锁定,而对 token 消耗的实时预算控制仍不常见。

这一轮 VentureBeat Pulse Research 从多个维度研究了企业 Agent 编排:组织使用哪些平台、平台选择由什么驱动、优先考虑哪些成功指标、预计 Agent 控制将如何构建、已部署的“Agent”实际编排程度如何,以及它们对运行成本的控制有多严格。

核心发现是,编排目标与编排现实之间存在显著差距。企业正迅速向主要模型平台集中。Anthropic 的 Claude 是 40% 受访者的主要平台,份额超过任何竞争对手的两倍;Microsoft 为 18%,OpenAI 为 13%。平台选择由“模型引力”驱动——即与最先进基础模型的原生契合——有 21% 的受访者提到这一点。成功则以可靠的多步骤执行衡量,其中任务完成可靠性为 32%,多步骤工作流管理为 28%。

但当被要求直接评估其产品组合时,71% 的企业表示,其已部署的“Agent”中只有四分之一或更少是真正的多步骤编排工作流,而不是单提示词聊天机器人封装。只有 10% 表示其已部署 Agent 中超过一半跨过了这一门槛。实际上,编排层正在先于其本应管理的编排型产品组合而被建设。

这一差距正在影响企业架构。到 2026 年底,51% 的受访者预计将采用混合控制平面,把提供商原生能力与外部编排结合起来。只有 6% 预计会将控制权完全交给提供商托管服务。供应商锁定是企业最担心的风险,有 35% 提到;如果 Agent 控制驻留在模型提供商内部,就会出现这一风险。这一担忧呼应了早期企业技术采用周期中有充分记录的锁定模式,包括云基础设施和关系型数据库:一旦工作负载与单一供应商深度集成,迁移成本就会急剧上升。投资正在跟随这一建设进程:Agent 工作流工具以 34% 领跑预期支出增长,其次是安全与权限执行,为 25%。财政控制仍落后于形势,27% 的企业表示,在账单到来之前,它们没有实时方式阻止失控 Agent。

方法论

VentureBeat 将该调查作为其持续进行的 Pulse Research 系列的一部分开展,本次工具聚焦企业 Agent 编排。回应被筛选至拥有 100 名或更多员工的组织,来自 2026 年 6 月单一调查波次,共形成 101 名受访者样本。由于这是单一波次,而不是多个月合并样本,报告以横截面方式呈现,不推断环比趋势。

样本分布于不同企业规模区间。员工数为 100–499 人、2,500–9,999 人以及 50,000 人或以上的组织各占样本的 21%。员工数为 10,000–49,999 人和 500–2,499 人的组织各占 19%。

受访者群体层级较高,并与采购相关。产品和项目经理占 15%,CIO/CTO/CISO 职位占 13%,顾问和咨询人员占 13%,此外还包括数据、AI 和工程总监及副总裁。“其他”职能占 18%。在采购权限方面,81% 的受访者是 AI 解决方案的推荐者、影响者或最终决策者,其中 66% 是推荐者或影响者,15% 是最终决策者。Technology/Software 是占比最高的行业,为 44%;其次是 Financial Services,为 17%;Healthcare/Life Sciences 为 8%。

VentureBeat 表示,101 名受访者的样本规模足以在合理信心下进行方向性解读,同时指出该样本仍是自选择样本,并非概率样本。

发现 1:编排运行在模型提供商平台上

Anthropic 的 Claude 领先,而开放框架仍处于边缘位置。

VentureBeat 询问企业当前主要使用哪个 Agent 编排平台。回应集中在主要模型提供商,尤其是 Anthropic。

报告提醒,应谨慎解读这些数据。受访者是自选择的,问题要求他们给出一个主要平台。因此,这些数字衡量的是在一个由活跃于 AI 的技术决策者组成的自选择群体中,哪个平台主导了各企业的部署。VentureBeat 表示,这类样本可能与按支出加权的市场衡量存在显著差异,而且每次 VB Pulse 调查都有自己的样本和公司规模组合。因此,平台份额应被解读为这一群体当前将主要编排押注放在哪里,而不是市场份额。

模型平台主导了当前部署格局。Anthropic、Microsoft、OpenAI、Google 和 Amazon 合计约占 80% 的部署,即 101 名受访者中的 81 名。LangChain/LangGraph 等开放框架(用于构建 LLM 驱动应用的开源工具包,在开发者社区中广泛使用,但尚未将这种关注度转化为企业生产份额)以及定制化内部构建仍为个位数。Anthropic 40% 的份额超过下一平台的两倍,这与第二项发现中描述的“模型引力”选择逻辑一致:企业正在选择与其希望构建所依托模型配套的编排层。与 VentureBeat 之前的 Agent 安全调查波次一样,在技术圈定义该类别的工具,尚不是企业部署集中的地方。还有少量 3% 表示完全没有进行编排。

受访者对其使用平台的总体评分为 3.94 分(满分 5 分),该评分问题有 109 人作答。“物有所值”同样为 3.94 分,而“实施便利性”得分最低,为 3.85 分。VentureBeat 表示,这使编排在其五项追踪满意度范围中接近底部,仅高于评估工具。在 96% 计划于年内改变其编排方法的用户中,接近但低于 4 分(满分 5 分)的评分意味着一种暂时接受:这些平台足以支持当前运行,但还不足以终止寻找更好方案。VentureBeat 将其描述为一个企业更多是在容忍、而非喜爱的技术层。

发现 2:模型引力驱动平台选择

决定平台选择的是基础模型,而不只是工具本身。

当 VentureBeat 询问什么因素对编排平台选择影响最大时,最大因素是底层模型的吸引力。灵活性和开发便利性紧随其后。

报告称,模型引力的主导作用解释了 Anthropic 在平台选择方面的领先:企业倾向于选择最接近其已标准化前沿模型的编排环境。但第二梯队的回应让图景更复杂。跨模型和工具的灵活性被 17% 提到,开发便利性同样为 17%,这表明企业希望避免被其平台选择所困。这一担忧预示了报告后文描述的锁定风险。安全和权限为 14%,总拥有成本为 11%,共同构成务实的购买逻辑。性能,包括延迟和内存,以 4% 排在最后,说明在当前采用阶段,约束因素是模型契合度和可选性,而不是原始速度。

发现 3:关键任务是可靠的多步骤执行

企业以是否完成工作来评判编排。

VentureBeat 要求受访者指出其编排的主要成功指标。可靠性和多步骤工作流管理占据主导,而面向开发者和用户的指标则落后。

任务完成可靠性为 32%,多步骤工作流管理为 28%,二者合计占回应的 59%,即 101 名受访者中的 60 名。在企业看来,当编排能够可靠地将一项任务经过多个步骤推进至完成时,编排才算成功。开发者生产力为 17%,虽有重要性但居于次要位置,这与其在框架讨论中的突出程度相反。终端用户体验为 9%,是较小的关注点,这与编排主要被视为内部执行问题而非用户体验问题相一致。

这种可靠性优先的标准,使“聊天机器人陷阱”这一发现尤其突出。企业将成功定义为可靠的多步骤执行,但多数已部署的“Agent”根本没有执行多步骤工作。

这一陷阱在不同公司规模中分布并不均匀。在较小企业中,77% 表示其 Agent 中只有四分之一或更少执行真正的多步骤工作;较大企业中的这一比例为 62%。VentureBeat 表示,较大企业在真正的多步骤部署方面明显走得更远,而聊天机器人陷阱从方向上看更像是中端市场问题。

发现 4:整合、生产化和内部构建

未来一年,三项战略举措几乎并列。

VentureBeat 询问企业预计在未来 12 个月内其编排策略会发生哪些重大变化。三项举措集中在顶部,比例几乎平均。

25% 提到构建内部控制,24% 提到标准化到一个框架,23% 提到将 Agent 从沙箱迁移到生产环境。VentureBeat 表示,这三者在统计上难以区分,并共同讲述了一个故事:企业正从实验转向运营整合。它们希望减少框架数量,扩大生产环境暴露,并增强对控制层的所有权。只有 4% 预计不会发生变化。

结合发现 1 中描述的平台集中趋势来看,对定制化内部控制平面的兴趣值得注意。企业一方面正在模型提供商平台上标准化,另一方面又计划用自己拥有的控制逻辑将其包裹起来,这正是报告在发现 7 中明确指出的混合姿态。

发现 5:近七成计划更换,且最大群体尚无候选名单

企业预期的战略变化与供应商变动相关。当被问及是否计划在未来 12 个月内采用新的、额外的或替换性的 Agent 编排平台时,受访者在这一层表现出的变动意愿高于 VentureBeat 跟踪的任何其他层。

当被问及正在考虑哪些平台时,在有变动意向的受访者中,最常见的答案是尚无候选名单。该群体占所有受访者的 29%,是“未考虑变化”之后的最大单一回应。在被点名的候选平台中,OpenAI 以 16% 领先,其次是 LangChain/LangGraph,为 12%,Anthropic 为 7%。

报告指出,独立框架在未来考虑中的占比约为其当前使用份额的两倍,这与 VentureBeat 安全追踪器对专业供应商发现的模式相同。结合报告中的集中度和锁定发现来看,图景很清晰:主要模型平台提供商占当前主要使用量的约五分之四,供应商锁定已成为首要担忧,96% 预计会发生战略变化,买方现在显示出行动意愿,而最大群体仍未决定。VentureBeat 将 Agentic 技术栈中最集中的一层描述为截至 6 月也最不稳定的一层。

发现 6:投资流向工作流工具

工具和权限引领支出计划,监控则落后。

VentureBeat 询问哪类编排相关投资将在明年增长最多。Agent 工作流工具排名第一,其次是安全与权限执行。

工作流工具为 34%,是在预算侧体现了发现 3 中确定的可靠性和多步骤优先级。支出正流向能够可靠串联各步骤的机制。安全与权限执行为 25%,扩展基础设施为 20%,这些是将 Agent 从沙箱环境迁移到生产环境所需的投资,也就是发现 4 中描述的战略转变。监控和调试吸引了较小的 11%,另有 11% 表示预算持平。

相较于纯粹可观测性,对工具、权限和扩展的强调表明,企业正在投入资金建设和加固编排,而不只是监控其运行。

发现 7:控制平面将是混合的,原因是锁定风险

企业预计将在提供商与自身层之间划分控制权。

VentureBeat 询问企业预计到 2026 年底 Agent 的主要控制平面将位于何处,以及如果该控制位于模型提供商平台内部,它们最担心什么。明显多数预计采用混合模式,而供应商锁定是首要原因。

混合控制是占据明显优势的主流预期,有 51% 的受访者提到。只有 6% 预计会将控制权完全交给提供商托管服务。将混合、定制以及外部抽象选项合并来看——即所有至少将部分控制保留在提供商之外的架构——合计达到 88%,即 101 名受访者中的 89 名。

原因直接体现在关于提供商驻留控制风险的回应中。供应商锁定以 35% 领先,即 101 名受访者中的 35 名;其次是安全和权限限制,为 28%;以及跨模型和工具的不灵活性,为 21%。VentureBeat 表示,这一模式呼应了上一波调查中“不要相信模型会自我监管”的姿态:企业会基于提供商平台构建,但拒绝完全由其治理。混合控制平面是它们应对最担心锁定风险的架构对冲。

6 月对混合控制平面的偏好相比早前快照有所变化。在拥有 145 名受访者的 4–5 月调查中,只有 34% 预计采用混合控制平面,而 12% 预计将控制权完全交给提供商托管服务。VentureBeat 表示,这两个快照尚不能确立已确认的纵向趋势,但讨论方向很明确:走向保留控制权。

锁定也新近成为首要担忧。在 4–5 月波次中,安全和权限限制以 32% 领先,而锁定以 24% 位居第二。到 6 月,两者交换了位置。对提供商平台的担忧似乎正在从“它们能否被安全保护”演变为“它们能否被替换”。

发现 8:聊天机器人陷阱——多数“Agent”还不是 Agent

企业承认,多数部署仍是聊天机器人封装。

VentureBeat 要求企业诚实评估其产品组合:已部署的“Agent”中有多少是真正的多步骤编排工作流,而不是简单的单提示词聊天机器人封装。回应成为本轮调查的决定性发现。

将底部两个区间合并来看,71% 的企业,即 101 名受访者中的 72 名,表示其已部署的“Agent”中只有四分之一或更少是真正经过编排的。只有 10%,即 101 名受访者中的 10 名,表示其已部署 Agent 中超过一半跨过了这一门槛。

这正是报告核心的差距。此前发现中记录的目标——模型提供商平台、可靠性优先的成功指标、生产部署以及有意设计的控制架构——远远领先于部署现实;而部署现实仍由被包装成 Agent 的单提示词助手主导。VentureBeat 将其描述为与其说是矛盾,不如说是一张路线图:平台、预算和战略之所以正在建立,恰恰是因为编排型产品组合仍然薄弱。后续调查波次的开放问题是,现实将以多快速度缩小与目标之间的差距。

发现 9:财政控制仍是被动的

只有少数企业能在账单到来前阻止失控 Agent。

最后,VentureBeat 询问企业如何对 Agent token 消耗实施财政控制——即自主循环在任何人介入之前耗尽预算的风险。由于 LLM 推理按 token 计量——token 是模型作为输入和输出处理的文本片段——如果一个 Agent 在没有限制的情况下反复调用模型,可能在任何人工审查之前累积显著成本。多数企业依赖原生上限或事后监控,而实时程序化控制仍是例外。

超过四分之一的企业,即 27%,表示它们没有实时、程序化方式在造成突破预算的账单之前阻止 Agent;它们是在事后通过日志得知。另有 32% 完全依赖其主要平台内置的原生上限和节流机制,这种控制形式的强度取决于提供商工具本身,并与发现 7 中描述的锁定担忧相关。构建定制网关的企业占 23%,使用跨模型路由进行成本套利的企业占 19%,这些企业将 token 消耗视为一个需要确定性控制的工程问题。

与编排成熟度一样,财政控制也是运营现实落后于目标的领域。Agent 正在比其周围的成本控制平面建设更快地走向生产环境。

报告还指出,公司规模之间存在差异。在员工少于 2,500 人的企业中,约三分之一,即 34%,只对 Agent 支出进行被动控制;较大企业中的这一比例为 20%。VentureBeat 将这些数字描述为方向性数据,但与聊天机器人陷阱的规模差异一致:中端市场运行着最不成熟的 Agent,也使用着工具化程度最低的预算。

结论:编排层是真实存在的,但多数 Agent 还不是

拥有 100 名或更多员工的组织描述了一种快速集中但缓慢成熟的编排策略。至少目前,它们正在模型提供商平台上标准化,这些平台合计占主要使用量的约五分之四。它们选择这些平台是因为底层模型的引力,并以可靠的多步骤执行来评判成功。投资正在转向工作流工具和权限。战略重点是整合框架并将 Agent 推向生产环境。预期中的控制平面是有意设计的混合形态,因为供应商锁定是企业最担心的风险。

但这种标准化是暂时的。68% 计划在 12 个月内采用新的、额外的或替换性的编排平台,这是 VentureBeat 跟踪的任何层中最高的更换意愿,而这些潜在变动者中最大的群体尚未列出候选名单。当前集中度显示的是企业今天所处的位置,不一定是它们打算停留的位置。

自我评估削弱了这一雄心。71% 表示其已部署的“Agent”中只有四分之一或更少是真正经过编排的,只有 10% 超过半数门槛,超过四分之一无法实时阻止失控 Agent。编排层——包括平台、预算和控制架构——正在先于其本应运行的编排型产品组合而被建设。

VentureBeat 表示,在单一 6 月波次中有 101 名受访者的情况下,这些发现应被视为清晰的方向性信号,而不是精确衡量。企业已经决定了它们希望如何编排 Agent,远早于多数 Agent 真正执行任何需要编排层的工作。后续波次的问题是,已部署现实能否缩小与目标之间的差距;并且,在近七成买方处于变动中且多数尚未决定的情况下,最终稳定下来的技术栈会落在哪些平台上。

这些发现基于来自拥有 100 名或更多员工组织的 101 名合格企业受访者的调查回应,样本来自 2026 年 6 月单一波次。由于这是单一波次,而非多个月合并样本,结果是方向性的,而不是已确认趋势。受访者包括产品和项目经理、CIO、CTO 和 CISO、顾问和咨询人员,以及 Technology/Software、Financial Services、Healthcare 和其他行业的数据、AI 与工程总监和副总裁。