新聞宏觀經濟AI 代理評估落差:企業對自主性的信任,超越了對把關測試的信任

AI 代理評估落差:企業對自主性的信任,超越了對把關測試的信任

作者: VentureBeat AI·

重點速覽

  • 在執行評估的受訪組織中,有一半表示 AI 代理或 LLM 功能通過內部測試後,發生了客戶端失敗。
  • 僅 5% 的受訪者表示完全信任目前運作的自動化代理評估。
  • 三分之二的組織已允許或正在開發僅基於自動化評估結果進行生產環境變更的管道。
  • 多數組織監控代理生產系統的運作狀態,僅 23% 即時監控輸出是否正確。
  • 多數受訪者計劃在 12 個月內採用、新增或更換評估平台。
AI 代理評估落差:企業對自主性的信任,超越了對把關測試的信任

在 157 家企業中,各組織正賦予 AI 代理越來越高的自主性,卻對用於規範這些自主性的評估機制日益失去信心。半數企業已部署過通過內部評估、卻在客戶面前失敗的代理。如今僅二十分之一的企業完全信任自動化評估,而最常被提及的缺陷是評估結果與真實世界的成果不一致。儘管如此,三分之二的組織已允許或正積極推動僅憑自動化評估就將代理變更部署至生產環境——過程中沒有任何人工介入。

結果便是 VentureBeat 所稱的「評估落差」:企業授予代理的自主性程度,與其對用來攔截失敗的測試所抱持的信任之間的距離。此落差部分源於結構性因素。與傳統軟體不同——後者可透過確定性的單元測試與整合測試驗證預期行為——AI 代理串接多個推理步驟、呼叫外部工具與 API,並對相同輸入產生不同輸出,這使得定義正確結果本身就極為困難,更遑論為其自動化測試。

調查概覽

本期 VentureBeat Pulse Research——Agentic Reliability & Evals 追蹤器——探討技術領導者如何衡量代理效能、使用哪些可靠性與評估平台、如何選擇並信任它們、在生產環境中會出現什麼問題,以及他們願意讓代理在無人工監督下運行到何種程度。

研究方法

VentureBeat 將此調查納入其持續進行的 Pulse Research 系列。受訪對象篩選條件為員工數 100 人以上的組織(n=157),取自 2026 年 6 月進行的單次調查。由於這是單一調查波次而非多月彙整樣本,因此報告採橫斷面分析,不推論月度趨勢。若問題允許複選,各選項比例總和可能超過 100%。

就職務而言,樣本資歷深且具採購決策影響力:38% 為 AI 採購的最終決策者,另有 34% 為建議者或影響者。具名職位包括產品與專案經理(15%)、顧問與顧問(10%)、工程/IT 主管(8%)及 CIO/CTO/CISO(8%),另有大量「其他」類別(37%)。

就組織規模而言,樣本以中型市場為主:100–499 人(37%)與 500–2,499 人(27%)領先,其次為 2,500–9,999 人(20%)、10,000–49,999 人(10%)及 50,000 人以上(6%)。科技/軟體為最大產業,佔 23%,其次為零售/消費品(15%)、醫療/生命科學(12%)及製造業(10%)。

以 157 位受訪者而言,樣本規模足以提供方向性參考,但應視為訊號而非精確測量。此為自選樣本,非機率抽樣,且偏向中型市場——因此最適合將其解讀為正在積極建立代理評估實務的組織觀點,而非最大型營運商的視角。

備註:此調查為 6 月波次而從先前的「LLM 可觀測性與評估」調查重新建構。由於問題與樣本不同,未與 4 月至 5 月的數據進行比較。

發現 1:通過評估不等於代理可用

組織被詢問在過去 12 個月內,是否曾部署通過內部評估、但隨後造成客戶端失敗的代理或 LLM 功能。在執行評估的組織中,有一半表示確實如此。

這是本報告最具定義性的數據。半數組織(50%)已交付通過內部評估、卻在客戶面前失敗的 AI 功能——無論是輸出錯誤、流程中斷或品質事件。四分之一的組織經歷過不止一次。僅 36% 報告無此類失敗,其餘組織要麼未執行部署前評估(8%),要麼未充分追蹤根本原因而無從得知(6%)。

這種失敗既明確又影響重大:評估顯示代理已就緒,但實際並非如此。後續所有發現——企業如何信任其評估、監控什麼、以及授予多少自主性——均受此經驗影響而形塑。

發現 2:幾乎無人完全信任自動化評估

受訪者被詢問哪項限制最削弱其對自動化代理評估的信任。僅極少數企業表示毫無抱怨。

對自動化評估的信任既稀缺又具體。僅 5% 的組織表示完全信任目前狀態下的自動化評估,意味著 95% 指出了限制因素。最常見的限制(29%)直接解釋了發現 1:評估與真實世界成果一致性差,讓後來會失敗的代理通過。其次是偏見或不一致性(21%),以及缺乏可解釋性(18%)——企業無法始終判斷評估為何得出某項結論。另有 17% 提及評估過程本身的資料外洩或隱私疑慮。

用來認證代理的測試本身尚未獲得信任,這正是發現 3 中所述自主性發展軌跡格外引人注目的原因。

發現 3:自主性上限仍在上升

組織被詢問是否會允許自主代理僅根據自動化評估結果、在無人工介入驗證的情況下,將程式碼或系統變更部署至生產環境。

這是本報告核心的矛盾。儘管幾乎沒有人完全信任自動化評估(發現 2),三分之二的組織(66%)要麼已允許低風險代理的零人工介入部署(34%),要麼正積極建構管道以在一年內實現(33%)。僅 22% 排除在可預見的未來採行此做法。

方向相當明確:企業正朝向讓評估自主把關生產環境部署的目標邁進——移除人工檢查——同時承認這些評估無法可靠地反映現實。自主性上限的上升速度快於其下方的保障措施,這正是發現 1 中錯誤信心導致的失敗將會擴大而非縮小的機制。

值得注意的是,此一自主性推進並非僅限於小型公司。按公司規模拆分樣本,大型企業在零人工審查路徑上比小型公司略為領先(70% 對 64%),且略有可能已交付通過評估卻在客戶端失敗的代理(54% 對 48%)。大型受監管組織最長時間維持人工介入的假設,在此樣本中正好相反。這些數據具方向性,取自 57 位任職於 2,500 人以上公司的受訪者及 100 位來自較小組織的受訪者。

發現 4:評估技術堆疊分散且由供應商主導

受訪者被詢問目前主要使用哪個代理可靠性或評估平台。市場沒有明確領導者,且有相當比例的組織沒有任何專用工具。

評估層尚處早期且未整合。供應商原生工具領先:OpenAI 的原生評估與追蹤(17%)與 Anthropic 的 Claude Console 評估(13%)合計超過任何獨立平台。然而,供應商原生工具在榜首位置與一個引人注目的回答並列——17% 的企業完全未使用專用的代理評估工具,對於向客戶交付代理的組織而言,這是一個顯著的缺口。專業評估供應商——DeepEval(12%)、Braintrust(8%)、LangSmith、Weave、Promptfoo、Langfuse 及 Arize——分散在個位數至低十位數之間,11% 則自行建構解決方案。目前沒有任何獨立平台成為品類標準,使得多數企業只能使用供應商原生工具、自製腳本,或根本不用任何工具來評估代理。這種分散性部分反映了上游的發展速度:LangChain、AutoGen 及 CrewAI 等開源代理框架的擴散速度快於評估標準的形成,導致各生態系各自定義其正確性概念。

發現 5:生產監控鮮少關注輸出品質

AI 代理的生產監控可以追蹤兩種截然不同的事物。它可以監控系統是否正常運作——代理是否啟動並回應、每個請求是否完成、速度多快、成本多少、有無錯誤。或者可以監控代理的輸出是否正確——自動化檢查會在每個回應送出時評估其內容:代理是否給出正確答案、採取正確行動、遵守政策規範。

這種區別至關重要,因為自信但錯誤的回答對第一類監控是不可見的。請求完成、回應快速、未拋出錯誤,每項運作指標都顯示正常。

按實際監控內容分組,差異相當懸殊:51% 的組織僅監控代理是否正常運作,而 23% 監控其答案是否正確。計入臨時審查者與不確定者,約四分之三的組織在生產環境中未執行輸出正確性的自動化即時評估。他們可以看到系統是否運作及成本多少,但對答案的正確性僅憑信任。

彌合此落差的技術門檻相當高:即時評估輸出正確性通常需要第二個模型——通常稱為 LLM-as-judge——在每個回應送出時進行評分,而此技術本身的可靠性與一致性限制,恰好呼應企業在發現 2 中對自動化評估提出的疑慮。

此盲點是發現 1 中部署前落差的運行時對應:同樣那些正在將人工從部署決策中移除的組織,大多無法即時看見已部署的代理何時開始產出錯誤答案。

發現 6:以成本採購,以一致性衡量

組織被詢問什麼因素最影響其選擇評估供應商,以及他們如何定義主要成功指標。兩個答案都相當務實。

企業基於經濟因素採購評估工具,並基於可重複性予以信任。評估成本(28%)略微領先選擇標準,其次為整合便利性(27%)與評估準確度(24%)。可觀測性廣度(13%)與供應商產品藍圖(4%)的影響遠低於前者。

在成功定義方面,超過三分之一(36%)選擇評估一致性——每次對相同行為獲得相同判定——遠超實驗速度(19%)、失敗減少(18%)、生產可見性(13%)及合規性(11%)。對一致性的強調頗具啟示意義:企業在信任評估判定之前,需要它先具備穩定性——而此特性的缺失(偏見與不一致)正是發現 2 中名列前茅的信任限制。對現有工具的滿意度僅屬中等,在整體滿意度、實施便利性與性價比方面,五分制平均為 3.8。

發現 7:下一筆預算投入人力與可觀測性

受訪者被詢問未來一年哪項可靠性與評估投資將成長最多。資金正流向更密切的代理監督——包括透過人力。

第二大計劃投資——僅次於生產可觀測性——是人工審查工作流程,佔 26%。對照發現 1,這是本報告最隱晦的矛盾:就在三分之二的企業將人工從部署決策中移除之際,計劃增加人工審查者支出的比例(26%)卻高於將取代他們的自動化評估管道(16%)。零人工軌跡與人工審查預算在同一批公司中同時上升。事實上,僅 8% 表示預算未增加。

整體而言,企業正在避險:一方面朝自主性邁進,另一方面投入資金更密切地監控代理,並保留人力以處理自動化評估尚無法被信任做出的決策。

發現 8:工具洗牌即將到來

組織被詢問是否計劃採用新的、額外的或替換的評估平台,以及正在考慮哪些。鮮少有人打算維持現狀。

評估市場大門敞開。雖然 36% 無計劃改變,但明確多數(64%)打算在十二個月內採用新的、額外的或替換的平台,31% 計劃在下一季度內完成。考慮名單凸顯了目前使用最薄弱之處:Confident AI 的 DeepEval 在企業評估中的平台裡領先(20%),超越 OpenAI 的原生評估(13%)與 Braintrust(9%)——開源專家吸引的興趣高於其目前佔有率所反映的程度。

考量到如今許多企業依賴供應商原生工具或根本沒有專用工具(發現 4),這較不像是叛逃,而更像第一波真正的工具採用浪潮——評估層開始整合的時刻。在幾乎無人信任自動化評估的市場中,哪些平台能贏得信任,仍是本系列將持續追蹤的開放性問題。

結論:評估落差將被自主性擴大而非縮小

員工 100 人以上的組織正賦予 AI 代理超過其評估所能支撐的獨立性。半數已交付通過評估卻在客戶端失敗的代理。幾乎無人完全信任自動化評估,主因是它與真實世界成果不一致。多數組織監控生產環境的運行時間與成本,而非代理答案是否正確。然而三分之二已允許或正積極推動僅憑自動化評估進行生產部署。

此一動態正隨監管框架開始將 AI 測試期待正式化而展開。2024 年 8 月生效的《歐盟 AI 法案》引入了基於風險的義務,包括高風險 AI 系統的部署前評估與上市後監控。2023 年 1 月發布的 NIST AI 風險管理框架提供了衡量、管理與監控 AI 可靠性的自願性指引。兩項框架都強調了與調查數據相同的原则:展示可信評估的能力正成為一項要求,而非偏好。

供應商市場尚處早期且未定型:最常見的主要評估工具為供應商原生評估,與無任何專用工具並列,而明確多數計劃在一年內採用或更換平台。下一筆資金正流向可觀測性以及——值得注意地——人工審查,顯示企業即使正在跨越落差,仍察覺到它的存在。

以 157 位受訪者的單一調查波次而言,這是方向性解讀,偏向中型市場。然而方向很明確:自主性正建立在授予者本身尚未信任的評估基礎上。評估落差並非僅靠更多測試就能解決的覆蓋率問題;它是評估結果需要反映現實、且值得信任以作為把關的問題。後續調查波次的開放性問題是:保障措施是否能追上自主性的腳步——抑或錯誤信心導致的失敗將從客戶事件升級為自行部署的變更。

根據 157 位合格企業受訪者(100 人以上)的調查回覆,取自 2026 年 6 月的單一調查波次。此為方向性解讀而非精確測量——樣本為自選性質,非機率抽樣,且偏向中型市場。受訪者包括產品與專案經理、顧問與顧問、工程/IT 主管及 CIO/CTO/CISO 等職務,涵蓋科技/軟體、零售/消費品、醫療/生命科學、製造業及其他產業。