企业AI面临上下文鸿沟:信任滞后于检索技术的采用——VentureBeat Pulse调查发现
要点速览
- •57%的受访企业在过去六个月内经历了AI代理给出自信但错误的答案,这些错误可追溯到业务上下文的缺失或不一致。
- •提供商原生检索工具——具体为OpenAI的文件搜索(40%)和Google的Vertex AI Search(38%)——在生产环境中的使用率已超过专用向量数据库。
- •基于文档或向量索引的RAG是38%组织的主要上下文来源,几乎是下一种最常见方法——受治理的语义层或本体(21%)的两倍。
- •58%的企业正在运行或建设受治理的语义层,但仅25%已投入生产,使大多数组织缺乏防止上下文相关代理失败所需的基础设施。
- •57%的企业计划在十二个月内更换或增加检索提供商,而36%表示打算保留同类最佳的独立工具,而非整合到单一提供商的平台上。

根据VentureBeat对101家企业的调查,为AI代理提供业务上下文的基础设施的部署速度超过了其可被信任的建设速度。检索增强生成(RAG)已成为企业AI的默认上下文来源,提供商原生检索工具已悄然超越了最初定义该类别的专用向量数据库。这种采用速度令人瞩目:RAG于2020年作为一种研究技术被提出(Lewis等人,当时在Facebook AI Research),在短短几年内便成为企业将大语言模型扎根于自身数据的标准方式。然而,多数企业已经目睹其AI代理给出自信但错误的答案,这些错误可追溯到上下文的缺失或不一致——这是仅靠增加检索量无法解决的问题。
本期VentureBeat Pulse Research考察了企业RAG和上下文层:什么在为AI代理提供业务上下文、企业运行哪些检索系统、它们如何选择和评估这些系统、架构走向何方,以及该上下文已经以何种频率产生失败。
上下文鸿沟
报告的核心发现被VentureBeat称为"上下文鸿沟"——企业代理回答的自信程度与底层上下文实际可靠性之间的差距。多数企业(57%)报告称,在过去六个月内,其AI代理因业务上下文缺失或不一致而产生了自信但错误的答案。其中超过一半的受访者表示这种情况不止发生一次。仅28%的企业报告未出现此类失败。
这并非边缘性问题。检索是38%企业的首要上下文来源——高于任何其他方法——这意味着当检索内容稀薄或不一致时,由此产生的错误会带有代理的权威感。旨在解决这一问题的基础设施正在积极开发中:58%的企业已经在运行或正在建设受治理的语义层,尽管对大多数企业而言,它尚未投入生产。
在这些发现的背后,市场正以一种出乎意料的方向整合。提供商原生检索——OpenAI的文件搜索(40%)和Google的Vertex AI Search(38%)——在生产使用中已领先于所有专用向量数据库。企业预计到2026年底,混合检索将占主导地位(34%)。然而,有36%的企业表示打算保留同类最佳的独立工具,而非整合到单一提供商的原生上下文技术栈上,同时有57%的企业计划在十二个月内更换或增加提供商。声明的偏好与实际使用正在分化:组织在购买提供商原生检索的同时坚称自己希望保持独立性。
研究方法
VentureBeat作为其持续的Pulse Research系列的一部分开展了这项调查,重点关注企业RAG基础设施和上下文层——为AI代理提供信息的检索系统、语义层和上下文来源。回复筛选条件为员工超过100人的组织(n=101)。调查未收到100人及以下组织的回复,因此全部样本均符合条件。所有回复均来自2026年第二季度(6月)的单次调查轮次,使报告成为横截面研究而非趋势追踪。若干问题为多选题,因此各比例之和可能超过100%。
按组织规模划分,样本集中在中端市场:251–1,000人(31%)和101–250人(31%)领先,其后依次为1,001–5,000人(20%)、5,001–10,000人(12%)和10,001人以上(7%)。按角色划分,受访者涵盖管理者(39%)、个人贡献者(27%)、高管层(16%)以及副总裁和总监(14%)。在采购决策权方面,样本具有买方可信度:46%为最终决策者,另有26%为推荐者或影响者。科技/软件是占比最大的行业,为20%,其次是医疗/生命科学(11%),以及零售、交通运输、金融服务、制造业和教育等领域的广泛分布。
在101名受访者的情况下,样本规模较小,应被视为方向性信号而非精确测量。该样本为自选样本,非概率样本,反映的是正在积极建设RAG和上下文基础设施的组织,而非最大的运营商。
发现1:自信但错误——代理错误可追溯至不良上下文
VentureBeat询问企业是否在过去六个月内将一个自信但错误的代理回答追溯到业务上下文的缺失或不一致。多数企业确实如此。
这是报告的决定性数字。多数企业(57%)已经经历过AI代理因不良上下文——包括错误的指标、过时的定义或缺失的文档——而产生自信但错误答案的情况,其中超过一半的企业表示这种情况发生了不止一次。仅28%的企业报告未出现此类失败,其余少数企业要么不在企业数据上运行代理,要么不够仔细地追踪根本原因以知晓。
这种失败模式具体而危险:模型并非明显在产生幻觉。它之所以自信地给出错误答案,是因为提供给它的是稀薄或不一致的上下文。这一区别对企业风险至关重要:幻觉——模型在检索数据中毫无依据地编造——已越来越多地可通过护栏和输出验证来检测。但从过时文档中自信地提取的错误指标更难被发现,因为答案拥有看似合理的来源。报告中的所有其他发现——企业检索什么、如何治理以及计划构建什么——都是这个问题的下游。
发现2:RAG是默认的上下文来源
检索为比任何其他方法都多的代理提供支持。对于38%的组织来说,基于文档或向量索引的RAG是代理理解业务的主要方式——几乎是下一种方法(受治理的语义层或本体,21%)的两倍。混合方法占14%,直接实时系统查询占10%,长上下文加载占6%。仅有2%让代理仅依靠模型的通用知识运行。
这一集中度在发现1的背景下意义重大:因为如此多的企业上下文通过检索流动,检索的质量决定了答案的质量。当RAG是默认来源时,稀薄的检索不是边缘案例——它是主要的失败面。
一种方法明显缺席:自定义模型权重,即微调。调查中所有主要的业务上下文来源都是在运行时注入的。VentureBeat最近一次对微调的直接测量来自其4月至5月的调查轮次(另一项独立调查,n=136),其中微调能力在模型选择的六个因素中排名最后,仅占5%——尽管该样本中26%仍将微调和定制列为他们预期会增长的投资。微调已退出了主要选择对话;上下文注入是企业使代理了解其业务的方式。
发现3:提供商原生检索已领先于向量数据库
专用向量数据库不再是RAG技术栈的中心。OpenAI的文件搜索(40%)和Google的Vertex AI Search(38%)在生产使用中领先——提供商原生和超大规模云原生检索——超越了所有专用向量数据库。在专业工具中,使用最多的是企业因其他原因已在运行的工具(Elasticsearch/OpenSearch,20%)和开源嵌入式选项(pgvector,12%)。定义该类别的纯向量数据库——Weaviate、Qdrant、Pinecone和Milvus——各处于个位数到低两位数。值得注意的是,13%的企业表示它们目前完全没有运行生产环境的RAG。
对于一个在2022至2023年吸引了大量风险投资的类别来说,这是一个重大转变。Pinecone、Weaviate和Qdrant等公司基于专用向量基础设施将成为企业AI基石的论点进行了融资。调查数据表明,模型提供商和超大规模云厂商正通过将检索层捆绑到企业已经用于推理的同一API中来捕获这一层——这同样是从监控到CI/CD重塑市场的平台动态模式。
与VentureBeat并行基础设施浪潮中的平台一样,企业正在倾向于选择与他们已购买工具捆绑在一起的检索方案。
这一发现在第二季度的两次调查轮次中均成立。在4月至5月(n=161)中,提供商构建的检索同样在使用中领先,而所有专用向量数据库仍处于边缘地位——使用最多的独立向量数据库在该样本中也仅为8%。当时混合、多元化的未来也已是共识性预期(34%预计混合检索将占主导,另有29%预计按用例采用多种架构)。两次调查描绘了一致的画面:创造了"向量数据库"这一术语的类别正在被企业已经购买的平台所吸收。
发现4:企业声称希望保持同类最佳策略
即使提供商原生检索在实践中领先,仍有36%的企业表示打算保留同类最佳的独立工具,而非整合到提供商的原生上下文技术栈上——远高于计划整合的21%。另有21%预计采用混合方式,9%打算自行构建并拥有该层。
企业实际运行的与企业声称想要的之间的差距,是该类别的战略性问题:它们为了便利而采用捆绑检索,同时声称将保持独立性。哪种冲动最终胜出——提供商捆绑包的吸引力还是对模块化控制的声明偏好——将比任何单一工具更能塑造检索市场。
发现5:混合检索是共识性押注
三分之一的企业(34%)预计,到2026年底,混合检索——结合嵌入、重排序和访问控制——将在其生产系统中占主导地位,是预计纯向量检索占主导(11%)的三倍。曾经开创该类别的纯向量搜索方法已被认为自身不足以满足需求,被增加了准确性重排序和治理访问控制的流水线所取代——而这些访问控制的缺失恰恰导致了发现1中描述的失败。
第二大答案是不确定性:17%的受访者不知道哪种架构将占主导,另有14%预计将完全超越专用向量层,转向工具优先或长上下文检索。共识不是单一工具,而是分层流水线——而且尚未完全成型。
发现6:受治理的上下文层正在建设中
超过一半的企业(58%)要么在生产中运行受治理的语义层(25%),要么正在试点和建设中(34%)。另有17%正在积极评估该方法,这意味着四分之三的企业以某种形式参与了这一理念。
语义层概念在商业智能领域有先例,dbt、Looker和Tableau等平台长期以来一直提供受治理的、可复用的业务指标定义,以确保整个组织的仪表板和报告引用相同的数字。这里的新颖之处在于将同样的严谨定义层扩展到为AI代理提供输入——确保当代理引用收入或客户状态时,底层定义是一致的、最新的、受访问控制的,而非随意从检索流水线首先返回的文档中提取。
然而,平衡状况值得关注:正在建设的组织多于已经交付的。对大多数企业来说,能够防止发现1中"自信但错误"失败的那个共享、受治理的定义层仍是一项正在进行的工作。语义层是行业对上下文不一致问题的答案,而本次调查在建设过程中捕捉到了它——雄心远超生产实际。
发现7:以数据摄取和简便性选购,以正确性监控
企业基于可操作性来选择检索系统。数据摄取的便利性(36%)、延迟和性能(32%)以及运营简便性(29%)在选购标准中领先——高于检索准确性和访问控制(各23%),而这两个因素与发现1中的失败最直接相关。
系统投入运行后,重点转向信任。最受关注的指标是响应正确性(42%)和安全与访问控制(38%),领先于延迟(28%)、运营稳定性(27%)和答案相关性(23%)。
这种购买标准与监控标准之间的分歧反映了企业AI采用中的一个更广泛模式:组织在采购时优先考虑集成速度,随后发现正确性和治理——那些更难、更慢衡量的属性——才是决定代理能否在生产中被信任的指标。这一差距因以下事实而更加突出:检索准确性和访问控制这两个与自信但错误失败最直接相关的维度,在选购标准中排名最低。
对当前系统的满意度适度正面但并不热烈。在五分量表中,总体满意度平均为4.0,实施便利性和性价比均接近3.9。企业为系统运行的便利性而购买,为是否能被信任而监控。
发现8:检索市场的重新洗牌即将到来
虽然43%的企业没有更换检索提供商的计划,但有微弱多数(57%)打算在十二个月内更换或增加提供商,四分之一(26%)计划在下个季度内进行。
考虑范围与当前的技术栈有所不同。提供商原生检索仍引领着企业正在评估的方向(OpenAI 22%,Vertex AI Search 21%),但开源向量专家们的影响力超出了它们的现有份额。Qdrant(14%)和Milvus(13%)吸引的更换兴趣高于其当前使用率(分别为10%和6%)所暗示的水平。
结合发现4来看,市场正处于变动之中:企业今天使用提供商原生工具,正在评估更广泛的选择,并表示希望保持选择的开放性。即将到来的洗牌将考验同类最佳的意愿能否经受住捆绑方案便利性的考验。
结论
员工超过100人的组织正在以超过其上下文保障能力的速度将AI代理接入业务运营。检索是企业上下文的默认来源,且越来越多地来自模型提供商和超大规模云厂商,而非专用向量数据库。然而,多数企业已经目睹代理因上下文稀薄或不一致而自信但错误地回答。这种失败并不罕见;它是将听起来权威的代理指向不可靠基础的必然结果。
行业提出的解决方案——受治理的语义层结合混合检索、重排序和访问控制——正在建设中,但大多数尚未投入生产。企业夹在提供商原生捆绑包的便利性和对同类最佳独立性的声明偏好之间。
在101名受访者、单一第二季度轮次的情况下,这是一个偏向中端市场的方向性参考。但方向是明确的:上下文层是AI技术栈下一个争夺的层级,而现在代理正跑在其前面。上下文鸿沟不是仅靠更多文档或更大索引就能解决的检索量问题;它是一个关乎受治理的、一致的、具备访问意识的上下文的问题。后续调查轮次的悬而未决的问题是,企业能否在自信但错误的失败从实验室走向重大决策之前完成该层的建设。
基于101名合格企业受访者(100人以上)的调查回复,来自2026年第二季度(6月)的单次轮次。在此样本规模下,结果应被视为方向性信号而非精确测量。该样本为自选样本,非概率样本,偏向中端市场。受访者包括管理者、个人贡献者、副总裁/总监和高管层,具有较强的采购决策权,分布在科技、医疗、零售、交通运输、金融服务、制造业和教育等领域。