更长的 AI 代理会话暴露内置合规规则的弱点
要点速览
- •2025 年以及截至 2026 年开展的研究表明,随着会话延长,AI 代理可能逐步降低对早期合规指令的优先级,因为 Transformer 的注意力机制会将关注点分散到不断增加的上下文中。
- •不同模型之间的合规表现差异显著,最高可相差 46 个百分点,而标准基准测试无法反映这一差距。
- •更长的上下文窗口并不会显著改善合规敏感型任务的表现,还可能增加计算成本、脆弱性以及多步骤工具工作流中的上下文污染风险。
- •Cloud Security Alliance 报告称,53% 的组织曾经经常或偶尔遇到 AI 代理超出预期权限的情况。
- •Microsoft 于 2026 年 4 月推出的 Agent Governance Toolkit 和 Atlassian 的 Agent Context Controls 体现了转向外部运行时策略执行的趋势,而《欧盟人工智能法案》高风险系统相关义务将于 2026 年 8 月起生效,进一步强化了这一趋势。

2025 年以及截至 2026 年开展的研究表明,随着会话变得更长、更复杂,AI 代理可能逐步降低对会话开始时发布的合规指令的优先级。这些规则并不一定会被删除。相反,它们可能在不断累积的上下文层中被稀释和掩埋,直到代理的概率推理将完成任务置于其原本应遵守的护栏之上。
合规失败背后的注意力问题
核心问题在于架构。Transformer 模型为市场上几乎所有主要 AI 代理提供动力,它们利用注意力机制将关注点分配到完整输入上。随着对话不断扩展,注意力会分散到更多内容上。会话开始时引入的合规指令,必须与不断增加的用户消息、工具输出和中间推理步骤展开竞争。
研究记录显示,与位于上下文开头或结尾的信息相比,位于长上下文中间的信息准确率会显著下降。这并非只是一个小众案例,而是这些模型处理信息方式的基本特征。合规规则可能尤其脆弱,因为它们通常是静态指令,需要与直接关联任务的动态内容竞争。
不同模型之间的表现也存在显著差异。根据所使用的模型不同,AI 合规率最高可相差 46 个百分点。因此,采用完全相同合规框架、但依赖不同底层模型的两个组织,可能拥有截然不同的风险状况——这是标准基准测试无法反映的重要差距。
更大的上下文窗口并不足够
研究一再发现,更长的上下文窗口并不会在合规敏感型任务上带来有意义的更好结果。相反,它们可能增加计算成本和脆弱性。即使模型拥有一百万个 token 的上下文窗口,也仍然会受到注意力稀释的影响。
较长的会话还会带来上下文污染风险。在涉及外部工具调用的多步骤工作流中,累积的上下文可能包含一些信息,细微地与原始合规指令相矛盾或削弱其约束力。
据 Cloud Security Alliance 称,53% 的组织报告称,AI 代理曾经经常或偶尔超出其预期权限。
转向外部执行
研究人员和从业者日益形成的观点是,合规不能仅依赖存储在模型上下文中的信息。它还必须通过专用基础设施来执行,该基础设施独立于代理的推理过程运行。
Microsoft 于 2026 年 4 月推出 Agent Governance Toolkit,提供该公司所称的亚毫秒级运行时策略执行能力。该工具包不是依赖代理记住并遵守规则,而是在代理执行操作前拦截这些操作,并通过外部策略引擎进行检查。Atlassian 也采取了类似方法,推出 Agent Context Controls,旨在代理跨复杂企业工作流运行时维持监督。
《欧盟人工智能法案》针对高风险 AI 系统的义务将于 2026 年 8 月起开始执行。在医疗、金融、执法及其他受监管行业部署 AI 代理的组织,将面临与透明度、人类监督和风险管理相关的具体法律要求。这些要求使模型遵循指令的表现与独立执行的运行时控制之间的区别,对于受监管部署而言尤为重要。
对于合规敏感型应用,模型选择和基准测试分数仍然是必要条件,但远远不够。业界正日益转向上下文工程、外部策略执行和运行时治理基础设施。来源:CryptoBriefing