新闻宏观经济Cisco 研究显示:多轮攻击最高可在 88% 的情况下突破旗舰 AI 模型

Cisco 研究显示:多轮攻击最高可在 88% 的情况下突破旗舰 AI 模型

作者: VentureBeat AI·

要点速览

  • Cisco 对 15 个旗舰 AI 模型的研究发现,多轮对抗性攻击的成功率从 7.89% 到 88.3% 不等,而单轮测试与多轮测试并未按相同顺序对模型脆弱性进行排名。
  • VentureBeat 于 2026 年 6 月调查的 107 家企业中,超过一半报告称曾遭遇已确认的智能体安全事件,或在造成损害前被拦截的险些事故。
  • Palo Alto Networks、CrowdStrike 和 Cisco 合计承诺投入超过 260 亿美元,分别收购 CyberArk、SGNL 和 Astrix Security,重点都是加强 AI 时代的身份和访问管理。
  • Box CISO Heather Ceylan 表示,一个安全运营智能体在一次错误后使此前积累的信任消失,迫使分析师重新启动人工审批流程,并凸显了持续监控的必要性。
  • Intuit 构建了 GenOS 作为集中式生成式 AI 操作系统,用于抽象安全、风险和欺诈建模,使智能体开发者能够继承标准化保护,而不是独立构建这些能力。
Cisco 研究显示:多轮攻击最高可在 88% 的情况下突破旗舰 AI 模型

当 Cisco 对 15 个旗舰 AI 模型发起 6,986 次多轮攻击时,能够在对话过程中调整策略的攻击者最高在 88.3% 的情况下取得成功。Cisco AI 威胁情报与安全研究负责人 Amy Chang 在 VB Transform 2026 的智能体安全专题小组上展示了这一发现——对于任何仍依赖单轮红队测试项目的组织来说,这个数字都值得警惕。

现场的紧迫感有数据支撑。根据 VentureBeat 2026 年 6 月 Pulse 调查,在 107 名企业受访者中,超过一半——54%——已经经历过已确认的智能体安全事件(18%),或在造成损害前被拦截的险些事故(36%)。只有 32% 的企业为每个智能体分配其自身限定范围的托管身份,只有 30% 将最高风险的智能体隔离在沙箱中。供应商原生控制和超大规模云服务商控制仍是 82% 受访企业的主要智能体安全层——这一数据也出现在 VentureBeat 关于共享 API 密钥的更广泛研究中。

全球最大的安全供应商似乎已经得出了同样的结论。Palo Alto Networks 于 2 月完成了以 250 亿美元收购 CyberArk 的交易,CrowdStrike 于 1 月同意以 7.4 亿美元收购 SGNL,而 Cisco 宣布有意收购 Astrix Security,据报道交易金额为 4 亿美元——这些交易都指向大多数企业尚未完全构建的身份和隔离层。三笔交易合计代表超过 260 亿美元的承诺资本,集中投向身份和访问管理领域。

横跨网络安全、政府和军方的职业经历

Chang 带着近 20 年横跨网络安全运营、政府和军方服务的经验参加了本次小组讨论。她曾在 JPMorgan Chase 担任执行董事,负责全球网络安全运营,并领导该行的网络威胁情报团队。她还曾担任美国众议院外交事务委员会高级工作人员,以及美国海军预备役军官。她目前在 Middlebury Institute of International Studies 以兼职教师身份讲授网络安全和新兴威胁课程。

88.3% 这一数字来自她与 Nicholas Conley 共同撰写的一项研究。该研究基于 30,090 个单轮提示词,以及针对 15 个闭源和专有旗舰模型的 6,986 次多轮攻击。多轮攻击成功率从 7.89% 到 88.3% 不等,所有被测试模型都表现出不可忽视的多轮暴露风险。值得注意的是,两种测试方法甚至没有按相同顺序对模型脆弱性进行排名。Chang 还指出,Cisco 现在会在其 LLM Security Leaderboard 上发布 105 个模型的对抗性评估信号。

“如果你不了解模型如何容易受到不同类型攻击的影响,那么你就无法解释驱动你的智能体、驱动你的应用的那个模型,也无法理解那些故障点在哪里,”Chang 说。

她将单轮测试——一次性的恶意提示词——与多轮攻击进行了对比。她称多轮攻击“更接近我们实际与模型、智能体和应用交互的方式”。这种延展的交互路径会暴露快照式测试永远无法捕捉到的有害输出和不一致行为。在实践中,多轮攻击者可能从看似无害的问题开始,试探模型护栏的边界,然后逐步将对话引向受限制的话题——并根据模型的回应不断优化每一轮,就像社会工程攻击者会根据目标反应调整策略一样。

智能体红队测试与出人意料的简单防御

Cisco 已将自身测试推进到智能体化领域。Chang 描述了一个框架:由智能体评估部署场景,制定相关攻击,判断攻击是否值得继续执行,实施攻击,并评估自身是否成功。然而,尽管这一过程相当复杂,最让她意外的是,防御方案依然非常直接。

“答案仍然很简单,”她说。“你不必特别有创意。你只需要真正思考,我在组织中试图保护的到底有哪些基本面和基础要素。”

对于刚开始部署智能体的 CISO,她建议的起点是 Cisco 的 Integrated AI Security and Safety Framework。她表示,该框架“规定了 AI 在整个 AI 生命周期中可能遭到破坏的所有方式”——从模态到供应链。随后,团队可以从真实事件反向推演,追踪每次攻击是如何实现的,并利用该框架构建具备适当覆盖范围和缓解措施的策略。政府框架尚未跟上:NIST 于 2023 年 1 月发布的 AI Risk Management Framework 早于智能体浪潮,对于自主智能体串联工具调用并执行多步骤工作流的系统,所提供的指导有限。

Box:三层同心防线与信任崩塌的教训

Box 的 CISO Heather Ceylan 从防御者角度指出了同样的缺口。“你在外面看到的许多智能体红队测试都只是单轮测试,而这并不是人们日常实际与 AI 交互的方式,”她对听众说。Box 现在使用被设计成像攻击者一样思考的智能体来模拟多轮对手,让其一次又一次迭代尝试劫持目标。“你必须对你的智能体进行压力测试,否则你不知道执行控制是否真的按你的预期运行。”

大约一年前,Box 在其安全运营中心内部部署了智能体,最初每个动作都需要人工批准。信任很快建立起来,分析师最终转向监控角色。随后,该智能体犯了一个错误——此前积累的全部信任随即消失。

“他们不得不从头再来,”Ceylan 说。“所以我认为监控这一环节非常重要。即使你不打算让人参与到流程中,事情也会变化,模型会变化,而我们无法控制模型如何变化以及如何解释事物。”

Ceylan 将 Box 的防御架构描述为三层同心结构。首先是权限控制,确保智能体永远不能访问超过调用它的人类用户权限范围的内容。每项任务都会启动临时沙箱环境,以便在智能体被攻陷时控制影响半径。随后,运行时执行控制会将智能体的工具调用限制在与当前任务相关的范围内。

“如果你希望一个智能体为你总结一份文档,而某个提示注入内容写着把它转发给 maliciousattacker at domain.com,它做不到,”Ceylan 说。“那个工具调用里的这个动作甚至不在它的词汇表里。”

她将智能体动作划分为三类监督层级。不敏感的动作,例如读取和总结,不需要人类参与。中等敏感的动作可以绕过人工批准,但会被记录和监控。破坏性动作,例如批量删除文件,则始终需要人工参与。“这些动作会在这三类之间发生相当多的变化,”她承认,“但预先设置这些类别,可以让你拥有一个有原则的框架。”

Intuit:生成式 AI 操作系统

Intuit 的 AI 和 ML 副总裁 Rajesh Parekh 带来了建设者视角。Parekh 此前曾领导支撑 Google Maps 和 Geo 产品的大规模计算机视觉与 ML 系统,并拥有计算机科学博士学位。

Intuit 并不是逐个向单个智能体叠加控制,而是构建了一个名为 GenOS 的中央平台——即 generative AI operating system 的缩写。该平台抽象出安全、风险和欺诈建模能力,使智能体开发者不必从零开始重复构建保护措施。

“权限控制并不是给 AI 授权访问,”Parekh 说。“相反,它是为智能体定义范围非常严格、并且清晰可审计的权限,使其执行非常具体的任务。”Intuit 已经从让智能体继承用户权限,演进到让每个智能体携带自身身份;该公司现在还在探索与当前具体任务绑定的会话中权限变更。

Parekh 将更广泛的模型描述为一个由 AI 驱动的专家平台,其中人类专家被整合进信任架构,而不是作为一道外加的关卡。“我们正在追求的范式,是用户、AI 智能体和人类专家协作解决用户问题,”他说。

他还解释了为什么红队测试的攻击面扩张得如此迅速。“这些智能体拥有技能,而技能可能会变成漏洞,”他说。“智能体可以访问某些数据,可以访问工具,而这些工具内部也可能潜藏威胁。因此,恶意代码或意图的影响半径会突然大幅扩大。”当 Intuit 从手动红队测试中识别出常见漏洞模式时,它会把这些测试自动化并纳入 GenOS 测试框架,使未来的智能体继承相关保护,而红队人员则专注于新兴威胁。对提示词和响应进行运行时扫描提供了最后一层防线,能够停止可疑响应并将其升级给人类专家。

“你需要持续测试,以确保它们对于你已经构建的保护措施仍然稳健,同时也要考虑漂移,或你引入场景中的任何其他类型依赖,这些都可能产生新的漏洞,”Ceylan 补充说。

人工代码审查的终结

Ceylan 直接谈到了安全测试与开发速度之间的张力。“由人查看代码、进行安全代码审查,或者查看安全架构评审和设计文档的时代已经结束了,”她说。“如果你继续试图用这种方式做安全,你就会被甩在后面。”

Box 正在构建一个完全智能体化的开发生命周期,由智能体审查设计文档、应用安全要求,并审计代码中的漏洞。“我非常乐观地认为,我们将会达到一个能够编写没有安全漏洞代码的阶段,因为智能体和模型会非常擅长编写没有漏洞的代码,”她说。“但我们距离那一步仍然很远。”

她给开发团队的建议并不涉及高级 AI 概念,而是回到早在智能体出现之前就存在的基础原则。“归根结底是非常基本的最小权限访问,”她说。“如果你一开始就给智能体过于宽泛的权限,之后要收回来并构建支持这些临时凭据和仅限窄范围任务的基础设施,会非常困难。”

意图与概率

一位听众关于意图检测的问题引发了本场小组最激烈的交流。Ceylan 指出,当 Box 自有智能体运行时,系统始终知道用户意图,因为它控制提示词,因此可以围绕这一点设计护栏和工具调用限制。更困难的挑战——她承认 Box 仍在努力解决——出现在外部智能体连接进来、而请求背后的上下文不透明时。

这场交流揭示了行业中更广泛的分歧。在小组讨论前的炉边谈话中,Mastercard 支持量化意图,并构建一个开源框架以将其作为标准传播,因为复杂的 B2B 采购离不开这种信任。相比之下,多位端点安全 CTO 在 VentureBeat 的简报中采取了相反立场,称他们将在生产工作负载中依赖概率,而不是意图推断。

Chang 解释说,以目前的训练方式,模型无法可靠地从提示词中推导出意图,因此确定性控制和行为代理仍然必不可少。Ceylan 也同意两者都需要。“如果你没有做任何确定性的事情,你实际上就是在高度依赖那个意图,而我还没有看到有项目达到那个水平,”她说。

Ceylan 关于一次智能体错误导致信任崩塌的叙述,成为本场小组最令人印象深刻的时刻。它凸显出,企业级智能体安全并不是一个解决后就会长期保持解决状态的问题。模型会变化,权限会漂移,对手会在多轮对话中调整策略,而快照式测试无法捕捉这些情况。

对于 82% 将供应商原生控制作为主要安全层的企业,以及 59% 计划在未来 12 个月内采购智能体安全工具的企业而言——这一类别目前在很大程度上仍是 Box 和 Intuit 等公司内部定制基础设施的形态——小组给出的结论非常明确:要按照攻击者的攻击方式进行测试,覆盖完整对话并持续进行;否则,就只能在生产环境中发现单轮红队测试漏掉的问题。