新聞宏觀經濟VentureBeat Research:企業 AI 代理治理在各控制層均落後於部署

VentureBeat Research:企業 AI 代理治理在各控制層均落後於部署

作者: VentureBeat AI·

重點速覽

  • VentureBeat Research 將身分、評估、成本遙測、情境與編排列為負責任管理 AI 代理所需的五個控制層。
  • 71% 的企業表示,其已部署的「代理」中,不超過四分之一能完成自主多步驟工作。
  • 只有 5% 的企業對自動化評估表示完全有信心,儘管許多企業已允許或計畫允許代理在無人工審查下進行生產變更。
  • 允許代理共享憑證的公司,回報安全事件或險些發生事故的比例高於為每個代理使用範圍限定身分的公司。
  • 更換意向在編排層最高,有 68% 的組織計畫在 12 個月內採用、新增或替換平台。
VentureBeat Research:企業 AI 代理治理在各控制層均落後於部署

企業在建立管理 AI 代理所需的控制措施之前,就已明知地部署了 AI 代理。這是 VentureBeat Research 於 2026 年 6 月進行五項平行調查後得出的核心結論,調查涵蓋代理式技術堆疊的每一層。這一模式呼應了過去企業技術採用週期中的情況——從雲端遷移到行動整合——部署動能往往超前治理,迫使組織進入被動補救。代理式浪潮的不同之處在於其涵蓋範圍:由於代理可以在生產系統內採取自主行動,治理缺口帶來的是即時營運風險,而不只是長期合規曝險。組織如今正在補強治理框架,以符合自身標準,並為此編列預算。在所衡量的五個控制層中,有 57% 至 68% 的企業計畫在 12 個月內更換供應商或新增供應商,約三分之一則打算在本季內進行變更。

VentureBeat Research 指出,企業在能夠負責任地信任 AI 代理之前,必須導入五項控制:身分、評估、成本遙測、情境層與編排。身分決定哪個代理被授權執行哪些動作,以及使用誰的憑證。評估用於判斷代理的輸出是否符合品質標準。成本遙測追蹤每個代理的執行費用。情境層提供代理在產生回應時所依賴的業務資料與定義。編排控制平面則協調多步驟代理工作流程。五份報告各自聚焦於其中一項控制。整體而言,它們形成一條依賴鏈:沒有範圍限定身分的代理無法被安全評估;沒有可靠評估的代理無法被信任以自主行動;而沒有準確情境的代理,無論其他控制運作得多好,都會產生看似有把握的答案。

多數已部署的「代理」其實是披著代理外衣的聊天機器人

71% 的企業表示,其已部署的「代理」中,只有四分之一或更少能自主完成多步驟工作。只有 10% 表示真正的代理占其運行項目的多數。這些受訪者具備評估此事的條件:81% 會在其組織中建議或直接決定 AI 採購。若是每個回答都由人工審閱的單一提示聊天機器人,並不需要其他四份報告所檢視的任何控制。相較之下,真正的多步驟代理需要所有這些控制——但多數企業無法清楚辨識自己部署的是哪一種類型。這種定義上的模糊性在整個產業中持續存在,因為供應商與內部團隊對「代理」這一標籤的使用並不一致,使採購決策與風險評估更加複雜。(完整 findings:Agentic Orchestration 報告。)

自主性超前於對評估的信任

三分之二的企業要麼已允許代理僅根據自動化評估結果將程式碼或系統變更推送到生產環境——無需人工審查——要麼正在積極建置此能力,目標是在 12 個月內實現。儘管如此,只有 5% 對將用於管控這類決策的評估表示完全有信心。過去一年中,有一半企業曾推出通過內部評估的代理,隨後卻引發面向客戶的故障。評估信心與生產現實之間的落差反映了一項結構性挑戰:多數內部基準測試是在受控條件下測試代理行為,未能納入即時使用者輸入與持續變動的業務資料所帶來的變異性。建議很明確:在任何工作流程中移除人工審查之前,組織應將評估與真實生產結果進行測試,而不是依賴內部基準。(完整 findings:Agent Reliability & Evals 報告。)

憑證共享與安全事件存在相關性

69% 的公司允許至少部分代理共享憑證,意即多個代理在同一個 API 金鑰或服務帳戶下運作。在任何地方允許憑證共享的組織中,63.5%(74 家中的 47 家)曾發生安全事件或險些發生事故。相較之下,在每個代理都以自身範圍限定身分運作的公司中,這一比例降至 40.9%(22 家中的 9 家)。這項相關性符合既有的零信任安全原則;在這些原則中,最小權限存取與按實體劃分憑證範圍,長期以來都是人員帳戶與服務帳戶的基準實務。建議的補救方式是為每個代理設定範圍限定身分,並從會接觸生產系統的代理開始。(完整 findings:Agentic Security & Identity 報告。)

GPU 使用率偏低,成本追蹤也落後

在自行運行 GPU 的企業中,超過八成回報其使用率為 50% 或更低。與此同時,只有 44% 嚴格監控其 AI 運算的實際成本以及所產生的回報。兩者結合造成複合式低效率:組織無法最佳化未被衡量的工作負載;若缺乏按工作負載劃分的成本可視性,採購決策就會由容量焦慮而非使用率資料所驅動。根據調查結果,優先事項不應是購買更多 GPU,而應是提升現有硬體的使用率,並衡量其按工作負載計算的成本。(完整 findings:AI Infrastructure & Compute 報告。)

未受治理的資料助長自信但錯誤的回答

57% 的企業表示,過去六個月中,曾將代理自信但不正確的回答追溯到自身缺失或不一致的業務情境——包括錯誤指標、過時定義或缺漏文件。多數企業觀察到這種情況不只發生一次。這項發現凸顯了產業日益認識到的一項區別:檢索品質是必要條件,但當底層業務定義本身不一致或已過時時,僅有檢索品質仍不足夠。對代理所依賴的定義進行治理,從指標與實體開始,必須先於任何擴展依賴這些定義之代理的工作。(完整 findings:Context Layers / RAG 報告。)

各層都尚無根深蒂固的既有業者

沒有任何單一層級擁有根深蒂固的既有供應商。如今的預設選項是企業已在使用的主要 AI 平台所內建的工具。更換意向在編排層最高,有 68% 的組織計畫在 12 個月內採用、新增或替換平台,34% 則計畫在本季內行動。這種開放的競爭格局與過去企業基礎架構類別早期階段一致:平台捆綁工具起初占據主導,之後專業供應商再以深度與控制能力形成差異化。這些調查並未掌握支出將流向何方——是流向平台原生工具,還是流向挑戰它們的專業業者——而這個未解問題預計將定義未來四個季度的市場走向。

關於本研究

VentureBeat Research 於 2026 年 6 月在其 VB Pulse 計畫下進行五項平行調查:Agentic Orchestration(101 名受訪者)、Agent Reliability & Evals(157 名)、Agentic Security & Identity(107 名)、AI Infrastructure & Compute(107 名)以及 Context Layers / RAG(101 名)——合計 573 名合格受訪者,均來自員工數 100 人以上的組織。樣本為自我選擇,部分發現應作為方向性解讀;每份報告都包含完整的方法論說明。整體模式所支持的方向,比任何單一百分比都更具說服力:每項調查都獨立指向同一方向。VentureBeat 同時製作本研究以及這些報告首次發表的會議 VB Transform