新闻股票Google DeepMind 发布 Gemini 4 Argon:新一代前沿 AI 模型

Google DeepMind 发布 Gemini 4 Argon:新一代前沿 AI 模型

作者: Google DeepMind Blog·

要点速览

  • •Gemini 4 Argon 在多个领域创下业界最佳基准成绩:在衡量长周期软件工程的 DeepSWE v1.1 上得分 77.9%,在 Zapier 的 AutomationBench 上得分 51.3%,在长视频理解基准 LVBench 上得分 91.7%。
  • •模型的输出 token 上限已扩展至业界领先的 100 万 token,约为此前 64,000 的十五倍,Google 表示这使难题得以一次性解决。
  • •Argon 能够自主发现、验证并修补关键漏洞,并已通过 Wiz 的 Scan for Good 计划发现了一个在全球医院使用的医疗软件中泄露敏感个人信息的严重漏洞,而此前的前沿模型均未识别出该风险。
  • •可用性采取分阶段推出方式:受信任的网络防御者可通过 Fairwind 计划率先获得不设网络安全护栏的访问权限,开发者、企业和消费者随后将获得访问权限,首先面向付费 API 客户和 Google AI Ultra 订阅用户
  • •在 Google 内部,Argon 智能体将已发表的量子算法基准提高了 40%,释放了超过 300 TiB 的数据中心内存,并正在将大型 C/C++ 代码库迁移至 Rust,其中包括 Fuchsia OS Zircon 内核超过 80 万行代码。
Google DeepMind 发布 Gemini 4 Argon:新一代前沿 AI 模型

Google DeepMind 于 2026 年 9 月 30 日宣布推出 Gemini 4 Argon,这是一款全新前沿 AI 模型,旨在复杂、长周期的专业工作流中保持深度推理。公司表示,该模型在真实世界软件工程、法律与金融等企业知识工作以及网络安全防御方面具备前沿性能,目前已通过 Google 的 Fairwind 计划 向一批受信任的网络防御者开放。

Google DeepMind 高级副总裁兼 Google 首席 AI 架构师 Koray Kavukcuoglu 在一篇博客文章中宣布了该模型,并写道 Argon 正在"从根本上改变我们在 Google 的工作和构建方式。"公司强调了该模型业界领先的 100 万 token 上限(用于深度、多步骤问题求解),以及其在编程、金融研究、法律文书起草和自主修补网络安全漏洞方面的优势。

分阶段发布与定价

Google 表示,安全地发布这一级别的前沿能力需要采取分阶段的方式。公司正积极参与美国政府针对模型发布前访问的自愿流程,同时逐步扩大可用范围,并将在向开发者、企业和消费者开放 Argon 之前,继续收集早期测试者的反馈并迭代安全护栏。这一初始访问计划意味着 Google 所述的能力和安全措施将首先在受控环境中接受评估,而非立即向更广泛的市场提供。

Argon 将以 introductory 价格推出:每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 的价格为输入 token 价格的 5%(即 95% 折扣)。introductory 期结束后,将适用每 100 万输入 token 4 美元、每 100 万输出 token 20 美元的定价。更大范围的推出将首先面向付费 API 客户和 Google AI Ultra 订阅用户。

改变 Google 内部的工作与构建方式

Gemini 4 Argon 已经在驱动 Google 的内部工作流,数千名 Google 员工强调了该模型在专业编程任务、深度研究和写作质量方面的优势。Google 表示,该模型正在帮助团队更快地构建、突破工程生产力的边界并加速取得突破。博客文章中列举的示例包括:

  • **量子算法优化:**Argon 正帮助 Google 的量子计算研究人员优化制约重要应用性能的子程序的时空资源(量子比特 × 门)。在一个示例中,它在几分钟内就比已发表的基准提高了 40%。
  • **内存效率:**一组 Argon 智能体分析了全网性能分析遥测数据,自主识别并在 Google 的数据中心应用内存优化,上线后释放了超过 300 TiB 的内存,预计总节省量在 500 TiB 至 1 PiB 之间。
  • **大规模代码库迁移与优化:**Argon 智能体正在 Google 内部将 C/C++ 代码库迁移至 Rust——从 re2、libgav1 等核心库中的数万行代码,扩展到 Fuchsia OS Zircon 内核的超过 80 万行代码。鉴于其中许多系统的关键性,这些大规模重写在部署到生产环境之前,正在接受严格的自动化与人工审计、仿真测试和审查。对于 Google 用于视频解码的开源软件 libgav1,Argon 能体在现有 Rust 移植版本的基础上,通过多轮基于性能分析的实验、研究编译器输出并生成安全 Rust 代码以使编译器自动向量化,替换了 32,000 行 SIMD 代码。最终成果是一个内存安全的视频解码器,其运行速度比 Rust 移植版本快 2.7 倍,视频输出完全一致,并更接近优化后的 C++ 实现。

100 万 token 输出上限

为支持 Gemini 4 Argon 在更长、更复杂用例中的能力,Google 表示正将模型的输出 token 上限扩大至业界领先的 100 万 token,而此前为 64,000 token。据公司介绍,当模型有足够的余量进行深度思考并在单次轨迹中生成数十万 token 时,它为推理增加了新的深度层级,使难题可以一次性解决。

跨领域的编程与企业工作流

Google 表示,Gemini 4 Argon 在编程、推理和多模态方面的能力,加上其执行长周期多步骤任务的能力,使其能够在一系列企业工作流中表现出色。Google 工程师一直在将 Argon 用于日常工作,从日常调试到大规模代码库迁移和算法设计。在衡量模型在真实世界长周期软件工程任务中表现的 DeepSWE v1.1 上,Argon 以 77.9% 的成绩创下新的业界最佳水平。

在编程之外,Google 表示 Argon 是 Vals Index 上的领先模型,该指数衡量在金融、编程、法律和税务工作方面的经济影响,每个领域均按其对美国 GDP 的贡献加权。公司还报告了在其他领域专项评估中的类似领先表现,包括测试多步骤金融研究的 Vals Finance Agent v2,以及涵盖法律研究与起草的 Harvey 法律智能体基准。在 Zapier 衡量核心业务职能端到端执行的 AutomationBench 基准上,Argon 以 51.3% 的成绩排名第一。

据 Google 介绍,当知识工作需要视觉理解时,Argon 同样表现突出。该模型能够进行专业的图表分析、从长视频中识别细节,并基于一系列文档采取行动。在衡量长视频理解的 LVBench 上,公司表示 Argon 以 91.7% 的成绩处于业界最佳水平。

在防御性网络安全领域领先

Google 表示,为了更好地武装网络防御者以应对网络攻击的新时代,其训练了 Gemini 4 Argon 使其在网络安全防御方面具备强大能力。该模型能够自主发现、验证并修补关键软件漏洞。对于受信任的防御者以及 Google 自己的内部团队,公司将在发布 Argon 时不设网络安全护栏,以便他们充分利用其完整的前沿级网络安全防御能力。

安全公司 Wiz 已通过其 Scan for Good 计划将 Argon 用于网络安全防御,该计划致力于通过发现并修复高风险暴露面来免费保护关键公共基础设施。Google 表示,作为该模型影响的早期示范,Argon 发现了一个关键漏洞,该漏洞在全球医院使用的医疗软件中暴露了敏感的个人信息,识别出了此前前沿模型遗漏的严重风险。

在评估模型修复安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分并列第一,延续了 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表现。

Google 表示,Gemini 4 Argon 在漏洞发现方面相较 3.8 Flash Cyber 展现出显著跃升:

  • 在 Google 内部的综合漏洞基准上,Argon 在涵盖 20 种编程语言的复杂代码库中发现了广泛的暴露面。
  • 在 Wiz 内部的黑盒渗透测试基准上(该基准测试模型在没有源代码的情况下分析在线 Web 系统的能力),Argon 在发现攻击面、识别漏洞以及生成验证漏洞的概念验证证据方面均优于 3.8 Flash Cyber。

在广泛可用之前加强前沿安全防护

广泛推出 Gemini 4 Argon 之前,Google 表示将继续在四个主要领域加强关键的前沿安全防护:

  • **防范滥用:**为防止不良行为者将 Argon 用于网络攻击或化学、生物、放射与核(CBRN)攻击,根据 Google DeepMind 的前沿安全框架,该模型被设计为拒绝有害请求,同时保留合法的军民两用科学研究。公司正在为此次发布加强安全防护的稳健性,包括改进监控模型内部激活以发现滥用的技术。这些安全防护措施经过了内部和外部红队采用人工与自动化攻击方法相结合方式的稳健性测试。
  • **防范提示注入攻击:**Google 将 Argon 描述为迄今对间接提示注入最具抵抗力的模型。间接提示注入是指利用恶意指令或上下文来劫持模型行为。公司表示,这是一类复杂的攻击,需要持续警惕和多层次的防御。据 Google 介绍,通过自动化红队测试和对抗性训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准上处于领先地位。
  • **监控错位:**为防止 Argon 在完成任务时以超出用户意图的方式越界行事,Google 正在部署错位缓解措施,监控模型的思维链和行动,并在必要时停止执行。公司使用了类似的系统来监控其训练运行,并向专门的事件响应团队发送警报,同时谨慎防范将监测发现反馈到训练中,以免 Argon 的推理被塑造成规避监控。Google 表示,强烈鼓励行业其他参与者在这一能力提升的关键时刻,在应对对齐风险的同时保持推理透明度,"以便模型思维仍有助于识别和诊断错位。"
  • **加固系统:**随着前沿模型能力日益增强,安全地测试它们需要能够与系统本身保持同步的安全环境。根据其智能体控制路线图,公司正在加固其沙箱环境,在开始高风险训练或评估之前对其进行隔离和封闭。Google 还承诺与合作伙伴分享这些智能体安全最佳实践,以提升整个生态系统的安全性。

即将推出

Google 表示,构建 Gemini 4 Argon 时为其赋予了编程、知识工作、网络安全防御和创意写作方面的前沿级能力,使其能够成为开发者、专业人士和企业攻克最困难难题的伙伴。公司对首批网络防御者和受信任测试者表示感谢,他们的真实世界评估和反馈将帮助 Google 在向开发者、企业和消费者发布之前强化其系统,推出将首先面向付费 API 客户和 Google AI Ultra 订阅用户。

**关于作者:**Koray Kavukcuoglu 是全球最杰出的人工智能专家之一。作为 Google DeepMind 的高级副总裁,他领导 Google DeepMind 最先进生成式 AI 模型的开发及其在 Google 产品中的大规模整合。在担任现职之前,他是 Google DeepMind 研究副总裁,创立了深度学习团队,该团队开创了 DQN(Deep Q-Network)和 WaveNet 等重大研究突破。