谷歌发布 Gemini 4 Argon:一款旨在查找并修复软件漏洞的 AI 模型
要点速览
- •Gemini 4 Argon 于 2026 年 9 月 30 日发布,是谷歌 Gemini 4 系列的首款模型,旨在自主发现、验证并修复软件漏洞。
- •该模型在 DeepSWE v1.1 上获得 77.9% 的成绩,领先于在同一真实软件工程任务测试中获得 74.1% 的 OpenAI GPT-6 Astra 和 74.2% 的 Anthropic Claude Opus 5.5。
- •Argon 在基于 MITRE 通用缺陷枚举(CWE)分类体系的 CWE-bench v1 漏洞修复部分录得 68% 的最高分。
- •谷歌表示,该模型帮助将 Fuchsia OS 中超过 80 万行 Zircon 内核代码迁移至 Rust,为其数据中心节省了 300 TiB 内存。
- •目前访问仅限谷歌的 Fairwind 计划,该计划涵盖 CrowdStrike 和 Palo Alto Networks 等超过 650 家经过审查的网络防御组织,而面向付费 API 客户和 Google AI Ultra 订阅者的更广泛开放尚未公布日期。

谷歌发布了 Gemini 4 Argon,这是 Gemini 4 系列的首款模型,重点聚焦防御性网络安全。据公司介绍,该模型可自主发现、验证并修复软件漏洞。通过覆盖漏洞的完整生命周期——发现、验证与修复——此次发布以修复环节为核心,而这正是安全团队常常积压已知缺陷待办事项的阶段。
此次发布于 2026 年 9 月 30 日公布。虽然安全是主打应用场景,谷歌同时也在将 Argon 定位为适用于软件工程以及法律、金融等知识密集型领域的长时复杂工作流。
基准测试表现
Argon 最突出的规格是输出容量:该模型单次响应最多可生成 100 万 token,较早期模型的 64K token 输出上限大幅提升。这一容量旨在应对大规模、持续性的工作负载,使完整的迁移或审查周期可以在一次执行中完成,而无需通过多次较小的响应拼接而成。
在围绕真实软件工程任务构建的基准测试 DeepSWE v1.1 中,Argon 获得了 77.9% 的成绩。这使其领先于在同一测试中获得 74.1% 的 OpenAI GPT-6 Astra 以及获得 74.2% 的 Anthropic Claude Opus 5.5,三家前沿实验室的成果首次在真实工程任务上同台比较。
安全领域是谷歌着重强调其领先优势之处。Argon 在 CWE-bench v1 的漏洞修复部分录得 68% 的最高分,该基准专注于修复已知类别的软件弱点。CWE 指通用缺陷枚举(Common Weakness Enumeration),这是由 MITRE 维护的软件弱点类别标准分类体系,为各家厂商的成绩提供了统一的参照标准。
谷歌还披露了内部成果。该模型帮助将 Fuchsia OS 中的 Zircon 内核超过 80 万行代码迁移至 Rust。这项工作为谷歌的数据中心节省了 300 TiB 内存。Rust 是一种内存安全的系统级语言,此类内核重写是业界在语言层面消除内存安全漏洞这一更广泛努力的一部分。
可用性与定价
Argon 尚未全面开放。目前仅可通过谷歌的 Fairwind 计划访问,该计划涵盖超过 650 家经过审查的网络防御组织以及谷歌内部团队。参与机构包括安全领域的重量级企业 CrowdStrike 和 Palo Alto Networks。早期部署者之一的 Wiz 曾使用该模型发现了广泛使用的医疗软件中的重大缺陷。在访问范围扩大之前,大多数开发者只能通过谷歌和计划参与方报告的结果来评估 Argon,因为目前公布的基准数据均为自行报告。
预计付费 API 客户和 Google AI Ultra 订阅者将获得更广泛的使用权限,不过在发布的材料中,谷歌尚未将这一扩展与具体日期挂钩。由于 Argon 是 Gemini 4 系列的首款模型,更广泛开放的时机以及该系列后续发布的节奏是当下值得关注的要点。
在定价方面,Argon 的 introductory 优惠价为每百万输入 token 2 美元、每百万输出 token 10 美元。根据公布的路线图,这些价格可分别上调至 4 美元和 20 美元,这一明确的涨价路径让潜在客户可以在完整费率生效前利用优惠期评估该模型。