新闻宏观经济Anthropic的Opus 5在浏览器代理测试中实现零百分比提示注入攻击成功率

Anthropic的Opus 5在浏览器代理测试中实现零百分比提示注入攻击成功率

作者: The Decoder·

要点速览

  • Opus 5在129个浏览器代理测试场景中实现了零百分比的提示注入攻击成功率,但仅在启用Auto Mode保护时成立。
  • 在没有Auto Mode分层防御的情况下,Opus 5对提示注入的易受攻击率为3.7%,高于Sonnet 5在相同无保护配置下的0.93%。
  • 安全公司Gray Swan的独立测试发现,Opus 5将15次尝试后的攻击成功率从Opus 4.8的5.5%降至2.0%。
  • Auto Mode使用两个独立层防御提示注入:扫描传入数据中的隐藏指令,以及在执行前阻止危险操作。
  • Anthropic的结果专门适用于其自有生态系统,可能不适用于缺乏等效分层防御的第三方部署。
Anthropic的Opus 5在浏览器代理测试中实现零百分比提示注入攻击成功率

Anthropic报告称,其最新模型Opus 5在自有软件生态系统中几乎对提示注入攻击免疫。提示注入——一种攻击者通过操纵输入(如嵌入网页中的隐藏文本)绕过AI模型操作指令的技术——在几乎所有测试场景中都对Opus 5无效。

根据Opus 5系统卡,在129个测试场景中,浏览器代理的攻击成功率降至零百分比。这与OpenAI在12月承认提示注入可能永远无法完全解决形成了显著对比。

在安全公司Gray Swan进行的通用提示注入评估中,经过15次尝试后的成功率从Opus 4.8的5.5%降至Opus 5的2.0%,详见系统卡的安全测试部分。

然而,浏览器代理零百分比的结果取决于在Claude Cowork等产品中启用Auto Mode。Auto Mode部署了两层防御:一层在模型处理前扫描传入数据中的隐藏指令,另一层在执行前阻止危险操作。攻击者需要独立突破这两层防御才能成功。

在没有这些保护措施的情况下,Opus 5的提示注入易受攻击率为3.7%。有趣的是,Sonnet 5在无保护配置下表现更好,率为0.93%。只有Opus 5模型与Auto Mode保护软件的结合,才能将浏览器代理场景中的攻击成功率降至零。

提示注入一直被广泛认为是AI代理面临的最重大安全挑战之一——这些自主系统可以浏览网页、阅读文档并代表用户执行操作。由于这些代理经常处理不可信的外部内容,恶意行为者可能会嵌入指令来覆盖代理的原始指令。这一漏洞一直是整个AI行业的持续关注点,也是代理AI系统更广泛部署的关键障碍。包括Google和OpenAI在内的主要AI实验室也在开发浏览器代理产品,随着这些工具向更广泛的消费者和企业使用推进,提示注入抵抗力已成为竞争差异化因素。Anthropic的结果表明,将模型层面的训练改进与架构防护相结合可以降低风险,但这些发现专门适用于Anthropic自己的生态系统,可能不适用于缺乏等效分层防御的第三方部署。