英美AI研究所发现月之暗面Kimi K3在网络攻击能力上落后于美国前沿模型
要点速览
- •Kimi K3在ExploitBench漏洞利用开发基准测试中得分32%,远低于领先美国模型76.2%的平均水平,且在41个测试漏洞中未能实现任何任意代码执行。
- •在模拟企业网络入侵测试中,Kimi K3在十次尝试中仅完成了一次完整的32步入侵攻击链,而最好的美国模型成功了六到七次。
- •该模型未拒绝攻击性网络任务,评估人员警告其7月27日的开放权重发布将使任何下游用户都能移除防护措施并无监督地重新部署该模型。
- •Kimi K3在网络能力方面表现不佳,尽管通用基准测试结果强劲,这可能源于使用Anthropic模型的输出进行蒸馏,而Anthropic的模型会拦截攻击性网络提示词,因此提供的训练数据有限。
- •该评估是政府支持的安全研究所在前沿AI模型公开发布前进行预发布评估这一新兴实践的一部分。

英国人工智能安全研究所(AISI)和美国人工智能标准与创新中心(CAISI)的联合评估发现,月之暗面的Kimi K3在构建软件漏洞利用程序和执行模拟网络攻击方面落后于领先的美国AI系统。两家研究所于7月23日发布了调查结果,先于月之暗面计划于7月27日公开发布完整开放权重的日期。该评估是政府支持的安全机构在前沿模型公开发布前进行预发布评估这一更广泛趋势的一部分。
根据报告,Kimi K3的安全防护措施未能阻止其协助攻击性网络操作。评估人员表示:"Kimi K3能够在接到指令并获得初始网络访问权限时,自主攻击小型、防御薄弱且脆弱的企业系统。"
ExploitBench测试结果
两家研究所使用ExploitBench对Kimi K3进行了测试。ExploitBench是由卡内基梅隆大学设计的基准测试,用于衡量模型将软件漏洞利用程序推进至完成的效率。该基准测试基于2023年后在Chrome的V8引擎中发现的41个漏洞。ExploitBench等基准测试已成为AISI及类似机构生成可比较、可复现的模型风险测量结果的标准工具。
Kimi K3在该基准测试中得分32%。领先的美国模型平均得分为76.2%,而中国的GLM-5.2得分为24%。
任意代码执行——该基准测试中最严重的结果——使攻击者能够完全控制目标机器。美国模型在41项任务中平均实现了20项的任意代码执行。Kimi K3一项也未实现。GLM-5.2同样未能达到该水平。虽然Kimi K3目前在开放权重竞争对手中领跑通用网络能力,但它在实际攻击造成最大损害的阶段表现不足。
模拟网络入侵测试
第二项评估名为"The Last Ones",将模型置于一个模拟企业网络中,该网络包含分布在四个子网中的约20台主机。完成全部32步入侵路径需要人类专家约20小时。
Kimi K3平均到达第17步。能力最强的美国模型平均达到28.5步,GLM-5.2达到11步。然而,评估人员指出,Kimi K3在十次尝试中完成了一次完整攻击链,且未超出测试设定的1亿token上限。表现最好的美国模型在十次中完成了六到七次完整攻击链。
两家研究所将Kimi K3的这一次成功运行解读为该模型具备潜在能力的证据,但无法按需可靠地复现。他们还指出,模拟环境缺乏主动防御者,并包含通向目标的内置路径,这些条件天然有利于任何攻击者。
安全防护问题与开放权重风险
评估人员强调,该模型在不拒绝的情况下执行攻击性任务的意愿构成重大风险。AISI此前曾警告称,开放模型能力的提升创造了"持续且不可逆的滥用风险"。一旦Kimi K3的权重于7月27日公开发布,该模型的行为将不再受托管方的限制。与开发者可以更新安全防护或撤销访问权限的封闭或仅API系统不同,开放权重发布意味着任何下游用户都可以移除防护措施并在无监督的情况下重新部署该模型。
完整的初步评估可在AISI网站上查看。
通用能力与网络能力之间的差距
在本报告之前,Kimi K3在通用基准测试中表现强劲——这一记录至今未变。这款2.8万亿参数的中国模型据报道超越了Anthropic的Claude 4.8和OpenAI的GPT-5.5,并在多个排行榜上名列前茅。
两家研究所表示,这种性能差距可能源于该模型的训练方法。7月22日,白宫科学总监Michael Kratsios指控月之暗面通过使用Anthropic的Fable模型的输出作为训练数据来进行蒸馏。蒸馏——即使用更强大模型的输出来训练另一个模型的做法——在业内很常见,但可能同时传播源模型的优势和不足。Anthropic的分类器会拦截高级攻击性网络提示词,这意味着从Claude的回复中抓取的训练数据集在这些特定技能上包含的材料有限。Kimi K3缺乏此类分类器,这使其在通用任务上能够与西方模型匹敌,但在漏洞利用开发方面仍表现不足。