谷歌发布面向高级编程的 Gemini 4 Argon,因网络安全风险限制访问
要点速览
- •Gemini 4 Argon 于 9 月 30 日通过谷歌的 Fairwind 计划发布,初期访问仅限于特定政府、受信任合作伙伴及谷歌内部团队,更广泛推出的日期尚未确定。
- •谷歌报告 Argon 在 DeepSWE v1.1 软件工程基准测试中获得 77.9%,领先于得分 74.2% 的 Claude Opus 5.5 和得分 74.1% 的 GPT-6 Astra,但这些数据来自谷歌自身的评估。
- •该模型可在单次响应中生成多达 100 万个 token,较此前模型 64,000 个 token 的输出上限有大幅提升。
- •在谷歌内部,数千名员工使用 Argon 执行将 C 和 C++ 代码库迁移到 Rust 等任务,包括 Fuchsia 操作系统 Zircon 内核中超过 80 万行的代码库。
- •Argon 以每百万输入 token 2 美元、每百万输出 token 10 美元的 introductory 价格发布,introductory 期后分别涨至 4 美元和 20 美元,缓存输入 token 可享受 95% 的折扣。

谷歌发布了 Gemini 4 Argon,这是 Gemini 4 世代的首个模型,初期仅向受信任的网络安全防御者及谷歌内部团队开放。
谷歌于 9 月 30 日通过其 Fairwind 计划宣布了 Argon。该计划向特定政府和受信任合作伙伴提供谷歌先进网络安全模型的访问权限。根据官方公告,Argon 可以自主发现、验证并修复关键软件漏洞。在继续测试模型并完善安全防护措施的同时,谷歌目前暂缓更广泛的开放。
付费应用编程接口(API)客户和 Google AI Ultra 订阅者将在之后获得访问权限,但谷歌尚未公布更广泛推出的具体日期。
谷歌公布的 Argon 对比表现
谷歌报告称,Argon 在软件工程任务基准测试 DeepSWE v1.1 上得分 77.9%。在同一测试中,谷歌报告 Anthropic 的 Claude Opus 5.5 得分 74.2%,OpenAI 的 GPT-6 Astra 得分 74.1%。
在评估 AI 模型识别和修复软件漏洞能力的 CWE-bench v1 上,谷歌报告 Argon 得分 68%,与 GPT-6 Astra 持平。这些基准数据来自谷歌自身的评估,因此并不能独立证明 Argon 在真实工作负载中的表现。
Argon 还可以在单次响应中生成多达 100 万个 token,而此前模型的输出上限为 64,000 个 token。Token 是 AI 模型处理和生成文本的基本单位。更大的输出上限旨在让 Argon 能够处理更长的软件工程任务和其他复杂任务,而无需反复提示其继续。
内部部署
谷歌表示,Argon 已在内部被数千名员工用于编程、研究及其他专业任务。据报道,其用途之一是将 C 和 C++ 代码库迁移到 Rust——一种旨在防止内存安全错误的系统编程语言,而内存安全错误正是软件漏洞的公认重要来源。据谷歌介绍,Argon 智能体正在处理其 Fuchsia 操作系统 Zircon 内核中的代码库,规模从数万行到超过 80 万行不等。
谷歌表示,较大规模的代码迁移在部署到生产环境之前,会经过自动化与人工审计、仿真测试和审查。内核代码位于操作系统的核心位置,一旦出错可能影响其上运行的每一个组件。
谷歌还利用 Argon 智能体分析数据中心性能数据并识别内存优化机会。谷歌表示,这些改动全面推出后预计可释放超过 300 tebibyte 的内存,总节省量估计在 500 tebibyte 至 1 pebibyte 之间。1 pebibyte 相当于 1,024 tebibyte。
谷歌量子计算研究人员也在使用 Argon 优化算法。谷歌举了一个例子:Argon 在几分钟内将某量子计算任务的表现比已发表的基准提升了 40%。
Argon 的网络安全能力是其分阶段开放的主要原因。谷歌表示,该模型能够在极少人工干预的情况下识别和修复漏洞,随着此类能力变得更加普及,这既带来防御价值,也带来潜在的安全风险。因此,谷歌通过 Fairwind 计划首先向受信任的网络防御者提供该模型,同时收集反馈并持续开发安全防护措施。
谷歌表示,随着访问范围扩大,Argon 最终将向开发者、企业和消费者开放。
定价
谷歌将以每百万输入 token 2 美元、每百万输出 token 10 美元的 introductory 价格发布 Argon。introductory 期结束后,价格将上涨至每百万输入 token 4 美元、每百万输出 token 20 美元。缓存输入 token(可在多次请求中复用相同上下文)可享受输入 token 价格 95% 的折扣。
此次发布正值谷歌与 OpenAI 和 Anthropic 在编程、网络安全、研究和企业工作等日益强大的 AI 模型开发领域展开竞争之际。不过,目前谷歌自身的基准测试仍是 Argon 公开可见的主要性能衡量标准;更广泛的开放将让独立用户和研究人员能够在更多工作负载中测试该模型。