企業 AI 面臨上下文鴻溝:信任滯後於檢索技術採用,VentureBeat Pulse 調查發現
重點速覽
- •57% 的受訪企業在過去六個月內經歷了 AI 代理因缺失或不一致的業務上下文而給出自信但錯誤的答案。
- •供應商原生檢索工具,特別是 OpenAI 的檔案搜尋(40%)和 Google 的 Vertex AI Search(38%),在企業生產環境使用量上已超越專用向量資料庫。
- •基於文件或向量索引的 RAG 是 38% 組織的主要上下文來源,幾乎是次常見方法——治理語意層或本體論(21%)——的兩倍。
- •58% 的企業正在運行或建構治理語意層,但僅 25% 已達生產環境,使多數組織缺乏防止上下文相關代理失誤所需的基礎設施。
- •57% 的多數企業計劃在十二個月內更換或新增檢索供應商,而 36% 表示打算保留最佳獨立工具而非整合到單一供應商的平台。

根據 VentureBeat 對 101 家企業的調查,為 AI 代理提供業務上下文的基礎設施部署速度,已超過其能被信任的速度。檢索增強生成(RAG)已成為企業 AI 的預設上下文來源,而供應商原生檢索工具已悄悄超越了最初定義該類別的專用向量資料庫。此採用速度令人矚目:RAG 於 2020 年作為研究技術被提出(Lewis 等人,時任 Facebook AI Research),在短短幾年內便成為企業將大型語言模型奠基於自身資料的標準方式。然而,多數企業已目睹其 AI 代理因缺失或不一致的上下文而給出自信卻錯誤的答案——這是一個僅靠增加檢索量無法解決的問題。
本期 VentureBeat Pulse Research 探討企業 RAG 與上下文層:什麼為 AI 代理提供業務上下文、企業運行哪些檢索系統、如何選擇和評估這些系統、架構的發展方向,以及這些上下文已多頻繁地產生失誤。
上下文鴻溝
報告的核心發現是 VentureBeat 所稱的「上下文鴻溝」——企業代理回答時的自信程度與底層上下文實際可靠性之間的距離。多數企業(57%)表示,在過去六個月內,其 AI 代理產生了自信但錯誤的答案,可追溯到缺失或不一致的業務上下文。其中超過一半的受訪者表示此情況發生不止一次。僅 28% 報告未出現此類失誤。
這不是邊緣問題。檢索是 38% 企業的主要上下文來源——多於任何其他方法——這意味著當檢索內容稀薄或不一致時,所產生的錯誤會帶有代理的權威感。旨在解決此問題的基礎設施正在積極開發中:58% 的企業已在運行或正在建構治理語意層,但對多數企業而言尚未進入生產環境。
在這些發現背後,市場正以出人意料的方向整合。供應商原生檢索——OpenAI 的檔案搜尋(40%)和 Google 的 Vertex AI Search(38%)——在生產環境使用量上已領先所有專用向量資料庫。企業預期混合式檢索將在 2026 年底前占主導地位(34%)。然而,相對多數(36%)表示他們打算保留最佳獨立工具,而非整合到單一供應商的原生上下文堆疊上,且多數(57%)計劃在十二個月內更換或新增供應商。聲明偏好與實際使用正在背道而馳:組織在購買供應商原生檢索的同時,堅稱自己想要獨立性。
研究方法
VentureBeat 將此調查作為其持續進行的 Pulse Research 系列的一部分,聚焦於企業 RAG 基礎設施和上下文層——為 AI 代理提供資料的檢索系統、語意層和上下文來源。回應篩選條件為員工超過 100 人的組織(n=101)。調查未收到來自 100 人及以下組織的回應,因此全部樣本均符合資格。所有回應均來自單一 Q2 2026(六月)調查波段,使本報告為橫截面分析而非趨勢追蹤。部分問題為複選,因此各選項比例加總可能超過 100%。
按組織規模,樣本集中於中型市場:251–1,000 名員工(31%)和 101–250 名員工(31%)領先,其次是 1,001–5,000 名(20%)、5,001–10,000 名(12%)和 10,001 名以上(7%)。按職位,受訪者涵蓋經理(39%)、個人貢獻者(27%)、高階主管層(16%)以及副總裁和總監(14%)。在採購決策權方面,樣本具備採購可信度:46% 為最終決策者,另有 26% 為建議者或影響者。科技/軟體是最大的產業,占 20%,其次是醫療/生命科學(11%),並廣泛分布於零售、運輸、金融服務、製造和教育等領域。
以 101 名受訪者而言,此樣本規模屬中等,應視為方向性訊號而非精確測量。其為自選樣本而非機率抽樣,反映的是積極建構 RAG 與上下文基礎設施的組織,而非最大型營運商。
發現 1:自信且錯誤——代理錯誤追溯到不良上下文
VentureBeat 詢問企業在過去六個月內,是否曾將代理自信但錯誤的答案追溯到缺失或不一致的業務上下文。多數企業曾有此經驗。
這是本報告最具定義性的數字。多數企業(57%)已經歷 AI 代理產生自信、錯誤的答案,可追溯到不良上下文——包括錯誤的指標、過時的定義或缺失的文件——其中超過一半表示此情況發生不止一次。僅 28% 報告無此類失誤,其餘少數要麼未在企業資料上運行代理,要麼未足夠密切地追蹤根本原因以致無法判斷。
此失敗模式具體且危險:模型並非明顯在幻覺。它之所以自信地犯錯,是因為餵給它的上下文稀薄或不一致。此區別對企業風險至關重要:幻覺——模型在沒有檢索資料依據下捏造——越來越可透過護欄和輸出驗證來偵測。但從過時文件中提取的、被自信陳述的錯誤指標更難察覺,因為答案具有看似合理的來源。本報告中的所有其他發現——企業檢索什麼、如何治理以及計劃建構什麼——均為此問題的下游效應。
發現 2:RAG 是預設上下文來源
檢索為比任何其他方法更多代理提供資料。對 38% 的組織而言,基於文件或向量索引的 RAG 是代理理解業務的主要方式——幾乎是下一種方法(治理語意層或本體論,21%)的兩倍。混合方法占 14%,直接即時系統查詢占 10%,長上下文載入占 6%。僅 2% 讓代理僅依靠模型的通用知識運行。
鑑於發現 1,此集中度值得關注:因為如此多的企業上下文流經檢索,該檢索的品質決定了答案的品質。當 RAG 是預設來源時,稀薄的檢索並非邊緣案例——它是主要的失敗面。
一種方法明顯缺席:自訂模型權重,即微調。調查中所有主要的業務上下文來源均在運行時注入。VentureBeat 對微調的最近一次直接測量來自其 4–5 月調查波段(另一項獨立調查,n=136),其中微調能力在六個模型選擇因素中排名最後,僅占 5%——儘管該樣本中 26% 仍將微調和自訂視為預期成長的投資。微調已退出了主要選擇對話;上下文注入才是企業讓代理了解業務的方式。
發現 3:供應商原生檢索已領先向量資料庫
專用向量資料庫不再是 RAG 堆疊的中心。OpenAI 的檔案搜尋(40%)和 Google 的 Vertex AI Search(38%)在生產環境使用量上領先——供應商原生和超大規模供應商原生檢索——超越所有專用向量資料庫。在專業廠商中,使用最多的是企業已因其他原因運行的工具(Elasticsearch/OpenSearch,20%)和開源嵌入式選項(pgvector,12%)。定義該類別的純粹向量資料庫——Weaviate、Qdrant、Pinecone 和 Milvus——各自僅為個位數至低十位數。值得注意的是,13% 的企業表示他們仍未運行任何生產環境 RAG。
對於一個在 2022–2023 年吸引大量創投的類別而言,這是一個重大轉變。Pinecone、Weaviate 和 Qdrant 等公司基於專用向量基礎設施將成為企業 AI 基石的論點進行了融資。調查數據顯示,模型供應商和超大規模供應商正透過將檢索層捆绑到企業已用於推理的相同 API 中來佔領該層——這與從監控到 CI/CD 重塑市場的平台動態模式相同。
如同 VentureBeat 平行基礎設施調查中的平台,企業正轉向與他們已採購工具捆绑在一起的檢索方案。
此發現在兩個 Q2 波段中均成立。在 4–5 月波段(n=161)中,供應商建構的檢索同樣領先使用量,而所有專用向量資料庫仍處於邊緣地位——使用最多的獨立向量資料庫在該樣本中僅達 8%。混合式、多元化未來也已是當時的共識預期(34% 預期混合式檢索將占主導地位,另有 29% 預期按使用案例採用多種架構)。兩個波段呈現一致的圖景:創造「向量資料庫」一詞的類別正被企業已採購的平台所吸收。
發現 4:企業表示希望保留最佳獨立工具
儘管供應商原生檢索在實際應用中領先,相對多數的企業(36%)表示他們打算保留最佳獨立工具,而非整合到供應商的原生上下文堆疊上——遠超計劃整合的 21%。另有 21% 預期會採用混合方式,9% 打算自行建構並擁有該層。
企業實際運行與其所聲稱想要之間的差距,是此類別的策略性問題:他們為便利性而採用捆绑檢索,同時聲稱將保持獨立性。哪種衝動會勝出——供應商捆绑的拉力還是對模組化控制的聲明偏好——將比任何單一工具更能塑造檢索市場。
發現 5:混合式檢索是共識押注
三分之一的企業(34%)預期混合式檢索——嵌入結合重排序和存取控制——將在 2026 年底前在其生產系統中占主導地位,是預期純向量檢索占主導(11%)的三倍。啟動該類別的純向量搜尋方法已被認為本身不足,被添加重排序以提高準確性和存取控制以實現治理的管線所取代——正是那些因缺失而導致發現 1 中失誤的存取控制。
第二大答案是不确定性:17% 的受訪者不知道什麼架構將占主導,另有 14% 預期將完全超越專用向量層,轉向工具優先或長上下文檢索。共識不是單一工具而是分層管線——且尚未完全成形。
發現 6:治理上下文層正在建構中
超過半數的企業(58%)已在生產環境中運行治理語意層(25%)或正在試驗和建構中(34%)。另有 17% 正在積極評估此方法,意味著四分之三的組織已以某種形式投入此概念。
語意層概念在商業智慧領域有先例,其中 dbt、Looker 和 Tableau 等平台長期以來提供治理的、可重複使用的業務指標定義,確保組織內的儀表板和報表引用相同的數字。此處的新意在於將同樣嚴謹的定義層擴展到餵給 AI 代理的輸入——確保當代理引用營收或客戶狀態時,底層定義是一致的、最新的且受存取控制的,而非從檢索管線最先呈現的任何文件中提取。
然而,比例分佈值得注意:正在建構的組織多於已交付的。對多數企業而言,能防止發現 1 中「自信但錯誤」失誤的共享、治理定義層仍是進行中的工作。語意層是業界對不一致上下文的解答,此調查捕捉到的是其建構中途的狀態,雄心遠超生產進度。
發現 7:因資料攝取和簡便性而採購,因正確性而監控
企業根據可操作性選擇檢索系統。資料攝取的便利性(36%)、延遲和效能(32%)以及營運簡便性(29%)領先選擇標準——超前於檢索準確性和存取控制(各 23%),這兩個因素與發現 1 中的失誤最直接相關。
系統運行後,重心轉向信任。最受追蹤的指標是回應正確性(42%)以及安全性和存取控制(38%),超前於延遲(28%)、營運穩定性(27%)和答案相關性(23%)。
此採購標準與監控標準之間的分歧反映了企業 AI 採用中更廣泛的模式:組織在採購時優先考慮整合速度,隨後發現正確性和治理——那些更難、更慢衡量的屬性——才是決定代理是否在生產環境中受信任的指標。這一差距因以下事實而更加凸顯:檢索準確性和存取控制——與「自信但錯誤」失誤最直接相關的兩個維度——在選擇標準中排名最低。
對目前系統的滿意度為中度正面但不熱切。在五分制量表上,整體滿意度平均為 4.0,實施便利性和性價比均接近 3.9。企業因系統運行的便利性而購買,並監控其是否值得信任。
發現 8:檢索市場即將洗牌
雖然 43% 的企業無計劃更換檢索供應商,但小幅多數(57%)打算在十二個月內更換或新增供應商,四分之一(26%)在下一季度內。
考量組合與目前的堆疊不同。供應商原生檢索仍領先企業正在評估的選項(OpenAI 22%,Vertex AI Search 21%),但開源向量專家正超越其目前的足跡。Qdrant(14%)和 Milvus(13%)吸引了比其目前使用量(10% 和 6%)所暗示的更多轉換興趣。
結合發現 4 來看,呈現的是一個變動中的市場:企業目前運行供應商原生工具,正在評估更廣泛的領域,並表示希望保持選擇的開放性。即將到來的洗牌將考驗最佳獨立工具的意圖能否在捆绑方案的便利性面前存活。
結論
員工超過 100 人的組織正以超過其能保證代理上下文可靠性的速度,將 AI 代理接入其業務運營。檢索是企業上下文的預設來源,且越來越多地來自模型供應商和超大規模供應商,而非專用向量資料庫。然而,多數企業已目睹代理因上下文稀薄或不一致而自信且錯誤地回答。此失敗並非罕見;它是將聽起來具權威性的代理指向不可靠基礎的可預見結果。
業界提出的解答——治理語意層結合混合式檢索、重排序和存取控制——正在建構中,但多數尚未進入生產環境。企業在供應商原生捆绑方案的便利性與聲明偏好最佳獨立工具之間左右為難。
以單一 Q2 波段中的 101 名受訪者而言,這是一個偏向中型市場的方向性解讀。但方向很明確:上下文層是 AI 堆疊中下一個爭奪的層級,而目前代理正跑在其前面。上下文鴻溝不是一個僅靠更多文件或更大索引就能自行解決的檢索量問題;它是一個治理的、一致的、具存取感知的上下文問題。後續調查波段的開放性問題是:企業能否在「自信但錯誤」的失誤從實驗室進入影響決策的場景之前,完成建構該層。
根據來自 101 名合格企業受訪者(100 名以上員工)的調查回應,取自單一 Q2 2026(六月)波段。在此樣本規模下,結果應視為方向性訊號而非精確測量。樣本為自選樣本而非機率抽樣,且偏向中型市場。受訪者涵蓋經理、個人貢獻者、副總裁/總監和高階主管層,具有強大的採購決策權,遍布科技、醫療、零售、運輸、金融服務、製造和教育等領域。