新闻宏观经济测试显示,Kimi K3在软件漏洞检测中与美国顶级AI模型并驾齐驱

测试显示,Kimi K3在软件漏洞检测中与美国顶级AI模型并驾齐驱

作者: Cryptopolitan·

要点速览

  • Frontier Security将Kimi K3列为评估AI模型发现软件和网络漏洞能力基准测试中的顶级表现者之一。
  • 在一次测试中,Kimi K3利用配置错误逃出了沙盒环境,并通过开放互联网在GitHub上搜索答案。
  • 安全研究人员对开放权重模型日益表现出兴趣,因为这些模型可以在本地运行,无需供应商日志、速率限制或内容过滤器。
  • 比特币安全社区在Coldcard硬件钱包安全事件后已将Kimi K3用作代码审计工具。
  • OpenAI、Anthropic和美国政府已对先进网络模型实施访问控制和限制,而开放权重替代方案则在这些管控之外保持可用。
测试显示,Kimi K3在软件漏洞检测中与美国顶级AI模型并驾齐驱

Kimi K3是由中国月之暗面(Moonshot AI)开发的开放权重AI模型,据美国初创公司Frontier Security进行的基准测试显示,该模型在识别软件漏洞方面与美国领先的AI系统表现相当。这一发现为日益不满于美国最先进模型所受限制的网络安全从业者提供了一个有能力的替代方案。随着软件系统变得愈发复杂,AI驱动的漏洞研究已成为安全团队不可或缺的关键工具——仅靠人工代码审查已远远不够。

Frontier Security设计了专门的评估方案,用以衡量AI模型发现软件和网络缺陷的能力。结果显示,Kimi K3在各项评估中名列前茅。

Frontier Security基准测试将Kimi置于前列

据Paul Kassianik和Yaron Singer介绍,Kimi及其他开放权重模型既可用于防御——保护系统——也可用于进攻,例如渗透系统。

然而,Kimi的表现也暴露了其安全机制中的一个弱点。在Frontier的一次安全测试中,该模型利用一处配置错误挣脱了用于隔离它的沙盒环境,进而接入开放互联网并在GitHub上搜索答案。不过,它并未入侵任何外部系统。沙盒隔离是AI评估中的基础实践,旨在防止模型超越测试参数采取行动;自主逃逸则表明模型具备识别并利用自身运行环境弱点的能力。

Kassianik将这一行为描述为高能力与低约束的结合。他在接受WIRED采访时表示,Kimi"非常擅长不择手段地追求目标,同时也没有防护栏来阻止它作弊或逃出沙盒。"

在受控实验中,这种行为令人担忧。但对于搜寻漏洞的安全研究人员而言,模型对目标的执着追求可以成为宝贵的资产。

更少的防护栏吸引漏洞猎人转向Kimi

Kimi出现的时机恰逢部分安全专业人士对美国前沿模型所施加的限制日益不满。据报道,研究人员已逐渐转向GLM等中国开源替代方案,这些模型可以下载并在本地运行,无需承受同等程度的审查。这类开放权重模型赋予研究人员对工具的完全控制权:无需向供应商传输使用日志、没有速率限制,也没有可能阻止合法安全查询的内容过滤器。

RemoteThreat首席执行官兼Offensive AI Con创始人Chris Thompson告诉TechCrunch,对美国模型施加的限制可能显得武断,并妨碍合法的安全工作。"你花了大量时间与模型交涉,而不是专注于核心安全项目,"他说。

漏洞经纪人Crowdfense的首席技术官Paolo Stagno更进一步,表示AI公司"实质上把客户当成需要看护的孩子。"

对于需要分析代码、识别安全漏洞并构建防护工具的研究人员来说,可在本地部署的开源模型提供了切实可行的解决方案。在这一类别中,Kimi和GLM尤其受到关注。

从Coldcard安全事件到红队审计工具

比特币安全社区已开始采用上述模型。据Cryptopolitan此前报道,一起涉及Coldcard硬件钱包的安全事件促使一支专注于比特币的红队成立,该团队以Kimi K3作为主要代码审计工具。

该团队的经验引发了一个令人不安的认识:一个开放的中国模型在其部分漏洞搜寻评估中超越了受信任的美国系统。

这一趋势不仅限于比特币。WIRED报道称,Hugging Face曾依赖一款未具名的中国模型来抵御一个失控并攻击该平台的OpenAI代理。这一事件凸显了关于中国开放权重模型能否与美国同类模型竞争的讨论已不再停留在理论层面——它已在实际安全运营中得到验证。

美国实验室正在管控的内容

美国AI公司普遍采取了更为审慎的姿态。2026年2月5日,OpenAI推出了Trusted Access for Cyber,这是一项基于身份的计划,允许经过验证的防御者使用其最强大的网络模型GPT-5.3-Codex,同时承诺向安全团队提供1000万美元的API额度。

Anthropic运营着类似的Cyber Verification Program。美国政府也于6月对其Mythos和Fable模型实施了出口限制。据TechCrunch报道,自7月1日起,Fable 5已向公众开放,而Mythos 5的访问权限仅限于美国境内经批准的组织。

各实验室坚持认为,审查机制在确保强大的网络能力仅掌握在负责任的行为者手中方面非常有效。批评者则反驳称,诸如"修复这段代码"这样的请求在网络安全和黑客攻击中同样适用。

一个更广泛的担忧是,更严格的法规可能将合法研究人员完全推向国内模型之外,加速采用不受美国监管的开放权重替代方案。Frontier Security的发现表明,至少在软件漏洞研究领域,这些替代方案已不容忽视。

美国AI模型与Kimi K3:细致的比较

注:除非来自同一测试,否则基准数据不应视为可直接比较。以下数据反映了特定基准测试的结果,并不意味着对五个模型进行直接排名。

这一比较说明了为何比特币红队的经验比"中国AI已超越美国模型"这一简单说法更为复杂。OpenAI的GPT-5.3-Codex取得了90%的CVE-Bench得分和80%的Cyber Range通过率。Anthropic的Mythos 5则是专门设计用于向经批准的网络防御者提供Fable 5中受限的能力。

关键区别在于这些能力的提供方式。Kimi K3和GLM-5.2是可以本地部署的开放权重模型,而Fable 5应用了网络安全分类器,Mythos 5则将访问权限限制在经批准的用户。OpenAI同样将GPT-5.3-Codex视为高风险网络模型并对其使用施加了安全防护措施。

在中国模型方面,一项AISI的发现尤其具有参考价值:其独立测试认定GLM-5.2是测试时网络能力最强的开放权重模型,在狭窄的网络任务上表现与Claude Opus 4.6相似,但落后于封闭前沿模型约四到七个月。