新聞宏觀經濟更長的 AI 代理程式工作階段暴露內建合規規則的弱點

更長的 AI 代理程式工作階段暴露內建合規規則的弱點

作者: CryptoBriefing·

重點速覽

  • 2025 年至 2026 年間的研究顯示,隨著工作階段延長,AI 代理程式可能逐步降低早期合規指令的優先級,原因在於 Transformer 注意力機制會在不斷增加的上下文中分散焦點。
  • 不同模型的合規效能差異顯著,合規率最高可相差 46 個百分點,而標準基準測試無法捕捉這項差距。
  • 更長的上下文視窗無法顯著改善合規敏感型任務的效能,還可能增加計算成本、脆弱性,以及多步驟工具工作流程中的上下文污染風險。
  • Cloud Security Alliance 表示,53% 的組織曾經歷 AI 代理程式定期或偶爾超出預期權限。
  • Microsoft 於 2026 年 4 月推出的 Agent Governance Toolkit,以及 Atlassian 的 Agent Context Controls,反映業界轉向外部執行階段政策強制執行;《EU AI Act》高風險義務將於 2026 年 8 月起具備可執行性,也進一步強化了這項趨勢。
更長的 AI 代理程式工作階段暴露內建合規規則的弱點

2025 年至 2026 年間進行的研究顯示,隨著 AI 代理程式的工作階段變得更長、更複雜,AI 代理程式可能逐步降低對對話開始時所下達之合規指令的優先級。這些規則不一定會被刪除,而是可能被稀釋並埋藏在層層累積的上下文之下,直到代理程式的機率性推理將完成任務置於其既有防護規則之上。

合規失效背後的注意力問題

核心問題在於架構。Transformer 模型為市場上幾乎所有主要 AI 代理程式提供動力,並使用注意力機制將焦點分配至完整輸入。隨著對話擴展,注意力會分散到更多內容上。工作階段開始時引入的合規指令,必須與不斷增加的使用者訊息、工具輸出及中間推理步驟競爭。

研究已記錄,與位於長上下文開頭或結尾的資訊相比,位於中間的資訊準確度會顯著下降。這不只是小型的特殊案例,而是這些模型處理資訊方式的基本特徵。合規規則可能特別容易受到影響,因為它們通常是靜態指令,必須與直接關聯任務的動態內容競爭。

不同模型之間的效能也存在顯著差異。AI 合規率可能因所使用的模型不同而相差最高 46 個百分點。因此,兩個採用相同合規框架、但依賴不同底層模型的組織,可能具有截然不同的風險狀況;這是標準基準測試無法捕捉的重要差距。

更大的上下文視窗並不足夠

研究一再發現,更長的上下文視窗並不會在對合規要求敏感的任務中帶來具實質意義的更佳結果。相反地,它們可能增加計算成本與脆弱性。即使模型具備一百萬個 token 的上下文視窗,仍會受到注意力稀釋的影響。

長時間的工作階段也帶來上下文污染的風險。在涉及外部工具呼叫的多步驟工作流程中,累積的上下文可能包含細微矛盾或削弱原始合規指令的資訊。

根據 Cloud Security Alliance,53% 的組織曾回報 AI 代理程式定期或偶爾超出其預期權限的情況。

轉向外部強制執行

研究人員與實務工作者逐漸形成的觀點是,合規不能只依賴儲存在模型上下文中的資訊。合規也必須透過獨立於代理程式推理流程運作的專用基礎設施來強制執行。

Microsoft 於 2026 年 4 月推出 Agent Governance Toolkit,提供該公司所稱的次毫秒級執行階段政策強制執行能力。該工具包不再依賴代理程式記住並遵守規則,而是在代理程式執行操作前攔截這些操作,並透過外部政策引擎進行檢查。Atlassian 也採取了類似方法,推出 Agent Context Controls,旨在代理程式處理複雜企業工作流程時維持監督。

《EU AI Act》對高風險 AI 系統所規定的義務,自 2026 年 8 月起具備可執行性。在醫療、金融、執法及其他受監管領域部署 AI 代理程式的組織,將面臨與透明度、人類監督及風險管理相關的具體法律要求。這些要求使模型遵循指令的效能,與獨立強制執行的執行階段控制之間的差異,對受監管部署而言尤其重要。

對合規要求敏感的應用而言,模型選擇與基準測試分數仍是必要條件,但遠遠不夠。業界正日益將重點轉向上下文工程、外部政策強制執行及執行階段治理基礎設施。來源:CryptoBriefing