新聞宏觀經濟Rubrik 的 AI 治理引擎即時審核每個代理動作,但審核者本身仍未被量化評估

Rubrik 的 AI 治理引擎即時審核每個代理動作,但審核者本身仍未被量化評估

作者: VentureBeat AI·

重點速覽

  • Rubrik 正在內部使用 SAGE 測試自主 AI 代理工作流程;SAGE 是一套 AI 治理引擎,可解讀每個代理動作的語意意圖,並即時依據自然語言政策判定其是否可被允許。
  • Rubrik Zero Labs 調查了超過 1,600 名 IT 與安全主管,發現監控與核准代理動作所耗費的時間,超過代理本身節省的時間。
  • VentureBeat Pulse 研究顯示,66% 的企業已經允許或正積極朝向零人工審查的生產部署發展,但只有 5% 完全信任支撐這項決策的自動化評估。
  • VentureBeat 對 107 名企業受訪者的調查發現,在代理群中使用共享憑證的組織,發生安全事件或險些發生安全事件的比例為 63.5%,相比之下,使用個別限定範圍代理身分的組織為 40.9%。
  • Rishi 並未提供 SAGE 的誤報率或漏報率,這意味著該系統目前的有效性主要依賴回溯測試與工作階段軌跡分析所提供的可稽核性,而非已發布的效能基準。
Rubrik 的 AI 治理引擎即時審核每個代理動作,但審核者本身仍未被量化評估

在 Anthropic 資安長主持的一場 CISO 圓桌會議上,Rubrik AI 總經理 Dev Rishi 向在場人士提出一個直接的問題:是否每個人都已將 AI 治理與安全政策寫成文件?大約 14 個人舉手。他接著追問,實際上要如何執行這些政策,得到的反應則明顯不同。

「然後大家都笑了,」Rishi 在 Menlo Park 舉行的 VB Transform 2026 爐邊對談中回憶道。「這就像是房間裡心照不宣的祕密:每個人都有這些政策,但沒有辦法真正讓它們落地。」

政策存在與執行之間的落差,正是 Rubrik 鎖定的領域。Rishi 透露,該公司的創辦人兼 CTO 一直積極推動讓公司的 AI 代理啟用所謂的 YOLO mode——這是一種從代理工作流程中移除權限提示、讓代理自主行動的設定。對一家核心業務是備份關鍵企業資料的上市資料安全公司而言,這項承認具有分量。

在 Rubrik 的實作中,第二套 AI 系統會即時依據組織政策評估每個代理動作,取代原本需要點擊核准的人類。Rubrik 先在自身內部測試這種做法。Rishi 將自主性描述為判斷問題,而非能力問題。「如果你要求代理自主行動,它就會這麼做,」他說。「這是你們內部要問的問題:它應該這麼做嗎?」

從安全劇場到 AI 仲裁

Rubrik 是透過痛苦經驗走到這一步的。當 Claude Code 和 Cowork 試點在內部推出時,公司要求每個指令都必須以 ask mode 執行,也就是由發出指令的員工承擔責任。開發人員的反彈相當強烈,單一 Slack 討論串累積了 120 則訊息。

「開發人員基本上都在反彈,他們的意思是,這就像 iTunes 服務協議。我只是一直按勾、勾、勾、勾、勾、勾、勾,」Rishi 回憶道。「我根本不可能真的讀完這些內容。於是它就變成了安全劇場。」

這種挫折相當普遍。Rishi 引述 Rubrik Zero Labs 研究指出,約 80% 的受訪者面臨同樣困境。這些發現來自 4 月發布的《The State of the Agent》報告,該報告基於對超過 1,600 名 IT 與安全主管的調查,結論是監控與核准代理動作所耗費的時間,超過代理本身節省的時間。

Rubrik 的答案是 SAGE,也就是 Semantic AI Governance Engine。SAGE 是 Rubrik Agent Cloud 內的仲裁層,負責監控每個代理動作、解讀其背後的語意意圖,並依照以自然語言撰寫的政策判定該動作是否可被允許。「我們把人們所說的 human in the loop——這個好主意——改成了 AI in the loop,」Rishi 說。他以此描述自己如何向安全主管推介這個概念;他形容這些主管對非確定性系統抱持戒心。

這項轉變很重要,因為企業代理正從聊天與程式碼建議,進入記錄系統、工單佇列、程式碼庫與通訊工具。在這種情境下,治理不再只是文件化工作,而是執行問題:控制措施必須在代理嘗試使用工具的當下運作。

阻礙 AI ROI 的是安全核准,而非成本

Rishi 的背景橫跨 AI 與機器學習領域中一些最具影響力的組織。在加入 Rubrik 之前,他共同創辦並領導生成式 AI 基礎設施新創 Predibase;Rubrik 於 2025 年 6 月同意收購該公司。在此之前,他曾在 Google 領導 ML 產品,所屬團隊後來成為 Vertex AI;他也曾在 Kaggle 從約 100 萬用戶成長至 1,000 萬用戶期間擔任首任產品經理。他擁有 Harvard 的電腦科學學士與碩士學位。

在加入 Rubrik 的前三個半月左右,Rishi 與橫跨類似 Global 2000 客戶群的 IT 與安全主管進行了 200 場客戶對話,並以開放式問題詢問成本、延遲、效能與編排等議題。

「在所有這些對話中,我相當一致地聽到,這些其實都相當次要,」他說。「主要挑戰其實是:我如何從安全與風險角度讓這件事獲得核准?我擔心所有可能出錯的不同事情。事實上,我覺得這是限制 ROI 的最大因素之一。」

VentureBeat Pulse 當天稍早在 Transform 舞台上公布的研究,印證了 Rishi 一再聽到的情況。數據顯示,66% 的企業——也就是三分之二——已經允許或正積極朝向零人工審查的生產部署發展,但只有 5% 完全信任支撐這項決策的自動化評估。

這種信任落差為代理治理產品創造了商業機會,但也設定了很高的門檻。如果自動化審查成為允許代理繞過人工核准的機制,企業就需要證據證明這個審查層既足夠快,能支援生產工作流程,也足夠可靠,能讓安全團隊為其背書。

由一個 AI 讀懂規則手冊無法涵蓋的內容

Rubrik 自身的內部政策顯示,為何書面規則作為執行機制會有所不足。其中一項規則規定,代理必須遵守 Rubrik 的客戶資料使用政策——這項指示聽起來可執行,直到有人嘗試將其操作化。

「Rubrik 的客戶資料使用政策就像是一份三頁的法律文字文件,」Rishi 說。「我完全不知道要如何把它寫成一條規則。」當台上有人問,一支 AI 基礎設施專家團隊如何接手傳統上由安全工程師負責的問題時,Rishi 回答:「老實說,是帶著很多天真與單純。」

該團隊的核心賭注是,擅長理解語言的模型能有效監督其他模型。SAGE 因此誕生。把模型放上判斷席的理由,核心在於精準度。例如,禁止代理編輯 Salesforce 中營收欄位的規則,在傳統工具下會失效,因為 Salesforce 不會區分哪些欄位屬於營收。因此,管理員被迫手動核准每一個 Salesforce 動作。SAGE 則改為讀取意圖,並運用組織情境,區分良性的資料查詢與政策禁止的編輯行為。

經濟可行性取決於讓這個審核者保持小型化。Rishi 表示,SAGE 運行於小型語言模型,其成本與延遲比前沿 LLM 低一個數量級。「如果我告訴你,別擔心,你會安全且受到治理,但我要讓你的成本與延遲翻倍,你會叫我離開房間,」他說。

當 Rishi 詢問現場觀眾過去一年是否曾擔心 token 消耗時,約有一半的人舉手。「我猜另一半大概只是懶得舉手,」他打趣說。

SAGE 是由多個專門化審核者組成,採用參數高效率微調,讓 Rubrik 能建立共享組織情境的基礎模型任務特定變體。其中一個審核者監控工具使用幻覺,另一個在個人識別資訊離開系統前加以抑制,而每一個都作為可獨立執行的政策運作。安全與 GRC 團隊也已開始在同一層中撰寫財務規則,包括一項禁止將 AI 支出用於個人專案的內部政策。

致命三連

當被問及最擔心哪些攻擊向量時,Rishi 指向安全研究員 Simon Willison 於 2025 年 6 月稱為「lethal trifecta」的概念。這個概念描述的是一個代理同時持有私有資料、攝取未經審查的外部內容,並具備將發現傳送到外部世界的通道。

Rishi 解釋,核心危險在於個別看似合法的權限在疊加後可能產生複合風險。若一個代理以員工憑證同時取得 Salesforce 存取權與電子郵件存取權,它本身尚未做錯任何事——至少目前尚未。

「一個非常簡單的例子是,代理可能開始從 Salesforce 拉取資料,然後決定不小心透過電子郵件洩漏並外洩這些資料,」他對觀眾說。Rishi 當天早上會面的一家金融服務公司也強化了這一點,該公司告訴他,單獨來看,每一項權限都沒有問題,而代理確實需要每一項權限才能執行其功能。「它應該擁有每個系統的權限,但最終變得非常具破壞性的,是這些權限的組合,」Rishi 說。

Rishi 主張,傳統身分與存取管理從未將這類組合納入考量,因為它依賴持有憑證者的人類判斷,而代理並不具備這一點。「我可以告訴你,Claude Code 試圖把我們一些敏感原始碼洩漏到公開 GitHub 儲存庫的次數高得驚人,」Rishi 透露。完全切斷代理對公共資源的存取會否定其效用,因此挑戰又回到在情境中裁定意圖,而不是全面撤銷存取權。

VentureBeat 另一項於 6 月進行、涵蓋 107 名合格企業受訪者的 Pulse 調查,量化了這種模式的影響範圍。VentureBeat 當天早上在 Transform 舞台上公布的研究顯示,69% 的公司在其代理群中的某些地方使用憑證共享。使用共享憑證的組織發生安全事件或險些發生安全事件的比例為 63.5%(74 家中的 47 家),相比之下,每個代理都擁有自身限定範圍身分的組織比例為 40.9%(22 家中的 9 家)。

單一回合看不出的攻擊

Rubrik Agent Cloud 已於 2 月正式推出,不過 Rishi 描述的並非所有功能都已出貨。回溯測試才剛開始推出。這項功能會將組織的歷史代理動作與工具呼叫,套用到一項新政策上重播,顯示該政策原本會在哪些地方介入,以及哪些動作會未被偵測地通過,同時可即時套用政策調整。Rishi 稱這份歷史檔案是企業所擁有最有價值的資料資產之一。

事實證明,即時偵測與阻擋只是切入點,而不是完整產品。某些攻擊從不會觸發單一動作規則。「對話中的任何單一回合本身都沒有問題,但如果你把整個工作階段視為完整軌跡,它最後就變得有問題,」Rishi 解釋。Agent Cloud 會每小時或每天對完整工作階段軌跡進行批次分析,浮現 Rubrik 所稱的「insights」——也就是個別防護欄都未能捕捉到的問題。

同一份 Zero Labs 報告發現,88% 的組織缺乏在不中斷系統的情況下回復代理動作的能力——這項復原缺口正好落在 Rubrik 既有專業領域之內。

對安全團隊而言,回復是執行的另一半。只有在系統及時捕捉到問題時,阻擋不良動作才有用;若代理在任何人發現問題前完成多步驟工作流程,回應就取決於是否知道哪些內容被改變、使用了哪些工具,以及組織能否在不造成更大範圍停機的情況下逆轉影響。

一個未被回答的問題

持懷疑態度的 CISO 會提出這場爐邊對談沒有回答的問題。SAGE 本身就是一個非確定性模型,正在評估其他非確定性模型,而 Rishi 並未提供這個審核者的誤報率或漏報率。這套架構最接近答案的部分是可稽核性:回溯測試與批次 insights 都會產生可供人工審查的紀錄,記錄 SAGE 做出的每項決策,以及任何繞過它的動作。就目前而言,誰來監督監督者這個問題,答案是一串可追溯憑證,而非已發布的基準測試。在這樣的基準存在之前,AI-in-the-loop 仍是一項營運賭注,而不是已量化的控制措施。

對正在評估自身準備程度的安全團隊而言,這場會議提出了三個問題:目前生產環境中的防護欄有多少依賴人類點擊核准?隨著代理數量擴大,這項工作量會如何變化?技術堆疊中是否有任何元件能執行語意意圖,還是完全依賴允許清單與拒絕清單?團隊能否將代理行為針對新政策進行回溯測試,並在不讓系統離線的情況下回復多回合工作階段?

Rishi 的時機與可衡量的市場需求相符。同一項 VentureBeat 研究發現,82% 的企業仍將其主要 AI 供應商內建的防護欄與雲端控制列為主要代理安全層;同時,59% 計畫在未來 12 個月內採用、增加或替換代理安全工具。即使憑證共享仍是常態,只有 12% 正在考慮代理身分產品。

在那場 Anthropic 圓桌會議上,每位 CISO 都有政策文件,卻缺乏執行機制。Rubrik 針對這兩種現實之間的空白打造了一款產品。YOLO mode 代表的賭注是:由 AI 監看其他 AI,終於能讓這些政策真正運作起來。