新闻宏观经济Kimi K3在网络攻击能力上远落后于美国前沿模型,蒸馏指控或可解释原因

Kimi K3在网络攻击能力上远落后于美国前沿模型,蒸馏指控或可解释原因

作者: The Decoder·

要点速览

  • Kimi K3的内置安全防护未能阻止攻击性网络行动,该模型在协助漏洞利用开发时没有任何阻拦。
  • 在ExploitBench上,Kimi K3完成率为32.2%,而美国领先模型为76.2%,且在全部41项任务中从未达到最高漏洞利用等级——任意代码执行(ACE)。
  • Kimi K3在十次尝试中有一次完成了整个32步模拟网络攻击路径,表明它具备该能力但无法稳定复现。
  • CAISI的时间序列分析显示,截至2025年,中国开源权重模型在网络攻击能力上仍落后美国前沿系统四到七个月。
  • Kimi K3在通用基准测试中的强劲表现与网络攻击能力薄弱之间的落差,支持了其蒸馏自Anthropic Fable模型的指控——Fable的安全分类器阻止了攻击性网络查询出现在训练数据中。
Kimi K3在网络攻击能力上远落后于美国前沿模型,蒸馏指控或可解释原因

Kimi K3在网络攻击能力上远落后于美国前沿模型,蒸馏指控或可解释原因

英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)的联合评估发现,月之暗面(Moonshot AI)最新模型Kimi K3在协助攻击性网络行动时几乎没有有效抵抗。月之暗面由杨植麟于2023年创立,获得了阿里巴巴和腾讯等投资者的支持,是中国最知名的AI初创企业之一。虽然Kimi K3在攻击性网络任务上大幅落后于美国前沿模型,但它确实超越了中国GLM-5.2,并在开源权重模型中创下了新的基准。

该模型的内置安全防护未能阻止漏洞利用开发或攻击性网络行动,且在协助这两类活动时没有任何阻拦。该评估报告由UK AISI和NIST/CAISI发布。

ExploitBench:Kimi K3未能达到最高漏洞利用等级

两家机构使用卡内基梅隆大学开发的ExploitBench基准来评估漏洞利用开发技能。ExploitBench采用2023年后在Chrome V8引擎中发现的41个漏洞,衡量模型在软件漏洞利用流程中能推进到什么程度。

美国领先模型平均完成率为76.2%,而Kimi K3为32.2%,GLM-5.2为24.4%。关键的是,Kimi K3在全部41项任务中均未能达到最高漏洞利用等级——任意代码执行(ACE)。ACE被视为最严重的漏洞利用等级,因为它赋予攻击者对目标系统的完全控制权。美国领先模型在41项任务中的20项中实现了ACE。

对于美国闭源权重模型,两家机构禁用了系统级安全防护以测量最大能力。这些防护在公开发布的版本中处于启用状态。

模拟网络攻击:Kimi K3仅达到中途

第二项评估名为"The Last Ones"(TLO),模拟了一次企业网络攻击,涉及跨四个子网、约20台主机的32步攻击路径。据两家机构介绍,一名人类专家大约需要20小时才能完成这一演练。

只有少数模型能够解决TLO测试。迄今为止,已有四款公开可用的闭源权重模型通过了该测试,其中表现最强的在十次尝试中成功了六到七次。

Kimi K3平均到达第17步(满分32步),而美国领先模型为28.5步,GLM-5.2仅为11步。Kimi K3在十次尝试中有一次完成了整个攻击路径,同时保持在1亿token限制之内,表明它具备该能力但无法稳定调用。

"Kimi K3能够在被指示执行并获得初始网络访问权限时,自主攻击小型、防御薄弱且脆弱的企业系统,"该机构写道。

TLO未考虑主动防御措施,因此并不完全符合实际场景。然而,这些结果在现实场景中仍会引发警示。本周早些时候出现了一个值得注意的案例:OpenAI模型试图自主入侵Hugging Face。Hugging Face成功击退了攻击,但需要付出大量努力并部署开源权重模型。

中国模型正在缩小差距但仍落后

CAISI进行了一项时间序列分析,使用基于Elo的评分体系追踪自2025年初以来美国和中国模型的网络攻击能力。两条趋势线均在上升,但中国模型始终落后于美国同行。

在之前的一项分析中,英国研究所估算开源模型的性能差距为四到七个月,而2025年初为六到十个月。最新结果与这一趋势一致:中国开源权重模型正在进步,但仍大幅落后于美国领先系统。

AISI警告称,这一差距不应引发自满情绪。开源模型不断增长的网络攻击能力构成了该机构所称的"持续且不可逆转的滥用风险"。与提供商可以远程更新或限制的闭源权重模型不同,开源权重模型一旦被下载,开发者就无法撤销其能力或修补其安全防护。

网络攻击结果与蒸馏指控一致

Kimi的发现也为针对中国模型开发者的蒸馏指控提供了佐证。蒸馏是一种技术,通过在更强大模型的输出上训练模型,使其能够近似教师模型的能力,而无需访问其底层权重或训练数据。美国科学顾问Michael Kratsios最近指控月之暗面"蒸馏"了Anthropic的Fable模型,利用Fable的最佳输出作为训练数据来提升Kimi K3的性能。Kratsios还指控月之暗面获得了Nvidia GB300s的访问权,而这些芯片受美国出口管制限制。Anthropic已发布了Fable的安全防护框架。

对于Kimi K3在通用基准测试中的强劲表现与网络攻击能力薄弱之间的落差,一种解释是该模型可能主要在涵盖通用知识、编程和智能体任务的Claude输出上进行了训练。Anthropic的安全分类器专门拦截高级攻击性网络查询,这意味着此类输出在任何基于Claude回复构建的蒸馏数据集中都将被低度呈现。因此,Kimi K3可以在标准基准上匹敌西方领先模型,但未能获得其更深层的漏洞利用能力。

AISI的结果支持了这一解读。两家机构禁用了美国模型的系统级安全防护,揭示了几乎无法通过公开接口获取的网络攻击能力——因此这些能力在很大程度上无法被用于蒸馏。