新闻股票Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,面向智能体工作流与网络安全

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,面向智能体工作流与网络安全

作者: Google DeepMind Blog·

要点速览

  • Google DeepMind 发布了迄今最强推理与编码模型 Gemini 3.8,距 3.7 Flash 仅三周,为六周内第三次 Flash 版本发布。
  • Gemini 3.8 Flash 入门价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,2027 年 1 月 1 日起费率翻倍。
  • Gemini 3.8 Flash Cyber 在 CyberGym 上实现前沿级漏洞发现,在 Google 内部 20 种编程语言漏洞基准上成功率超过 70%。
  • Chrome 安全团队发现 Flash Cyber 为 Chrome 漏洞生成的正确补丁数量是更大规模商业模型的 2.6 倍。
  • Flash Cyber 通过全新 Fairwind 计划仅向可信防御者开放,而 3.8 Flash 可通过 Gemini API、Gemini Enterprise 及 Google AI Pro/Ultra 订阅使用。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,面向智能体工作流与网络安全

Google DeepMind 发布了迄今最强大的推理与编码模型 Gemini 3.8,距 3.7 Flash 发布仅三周,这也是该公司六周内的第三次 Flash 版本发布。这一加速节奏反映了当前前沿模型市场的现状:Google、OpenAI 和 Anthropic 正以数周而非数季度的间隔持续推出新版本,而中端 "Flash" 级模型正日益成为生产级 AI 应用的主力。本次发布包含两个版本:通用主力模型 Gemini 3.8 Flash,以及通过全新 Fairwind 计划向经过审核的可信防御者提供的专用网络安全模型 Gemini 3.8 Flash Cyber。

据产品管理高级总监 Tulsee Doshi 与 Google DeepMind Gemini 安全负责人 Raluca Ada Popa 的公告,两款模型由相同的基础智能驱动,并通过长程智能体循环递归评估和优化底层模型进一步加速。这一共享核心在编码与推理方面的提升源于多项创新,包括在极具挑战性的网络安全领域进行的严格训练。这一组合值得关注的点在于,它采用了一种技术——将安全这类高难度、可验证的领域作为训练信号——业界其他公司也曾用类似方法提升通用模型推理能力。

Gemini 3.8 Flash:为长程编码与自主智能体而打造

Gemini 3.8 Flash 在软件工程、智能体任务以及专业领域的多步推理方面相较 3.7 Flash 实现了显著提升,其性能常常接近价格更高的前沿模型。其入门定价与 3.7 Flash 相同:每百万输入 token 0.75 美元,每百万输出 token 3.75 美元。该入门价格将于 2026 年 12 月 31 日到期;自 2027 年 1 月 1 日起,将执行每百万输入 token 1.50 美元、每百万输出 token 7.50 美元的费率。即便按全价计算,该模型的定价也远低于典型前沿模型层级,凸显了随着厂商争夺消耗远多于聊天式交互的智能体工作负载,按 token 计价的竞争压力。

在 DeepSWE v1.1(长程软件工程)基准上,3.8 Flash 在端到端自主解决复杂工程问题方面超越了多数更大的前沿模型,且成本仅为其一小部分。该模型还在专业知识领域展现出关键企业自主化所需的可靠性。在需要高级分析与报告的量化及专业领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基准上超越了 3.7 Flash 及其他前沿模型。它还在 HLE-Verified 上取得 54.9% 的成绩,体现了其跨 STEM、人文与专业领域的多步推理能力。

这些提升源于一个核心设计选择:3.8 Flash 更加“勤奋”。在复杂任务上,模型会执行额外的推理步骤并迭代调用工具,有时为最大化性能会消耗更多 token,尤其是在较高的努力级别下。准确率与 token 消耗之间的权衡已成为智能体 AI 的核心设计问题,因为跨越多个步骤循环的自主智能体可能使推理成本成倍增长;努力级别控制为开发者提供了调节这一权衡的杠杆。对于计算受限的应用,开发者可以使用更低的努力级别以减少 token 开销,或继续依赖 Gemini 3.7 Flash——该模型仍将获得全面支持,以服务效率优先的工作负载。

Google 重点展示了多个使用 3.8 Flash 在 Google Antigravity 中构建的演示:一款通过简单循环提示创建的 3D 城堡巫师探索游戏,包含谜题、环境叙事以及由 Nano Banana 生成的纹理;一个完全可玩的 DOS 版 Google 地图,具备地点、路线和街景功能;一个著名地理景点的地形图,提供实时剖面、2D 投影和基于美国地质调查局真实数据集的科学讲解;以及 Hardware Anatomy——一个在 Google AI Studio 中构建的交互式 3D 可视化工具,可生成按物理比例呈现的硬件拆解的逼真 Three.js 渲染,并配有可分层展开检查的拆解滑块。

Gemini 3.8 Flash Cyber:专家级网络安全性能

Gemini 3.8 Flash Cyber 为防御者提供前沿级的漏洞检测与自动补丁能力,并以 Flash 级的速度和成本交付,支持快速迭代。该模型的推出正值行业整体向 AI 辅助安全转型之际——软件供应链攻击和大型组织中未修补的漏洞,使自动化发现与修复成为安全行业的活跃投资领域,同时也引发了对类似能力若不受限可能被攻击者利用的担忧。

自主漏洞发现。 在查找漏洞的标准行业基准 CyberGym 上,3.8 Flash Cyber 展现了前沿级的自主漏洞发现能力,超越了 3.5 Flash Cyber 以及规模显著更大的前沿模型。为更好地反映 CyberGym 所覆盖的 C/C++ 代码库之外的真实防御需求,Google 还在一个全面的内部基准上评估了该模型,要求其在跨越 20 种编程语言的复杂代码库中发现多种漏洞,模型取得了超过 70% 的成功率——相较以往模型是大幅跃升。

自动补丁。 Google 表示,其重点是为防御者配备使其相对攻击者占优的专家级能力,因此从一开始就投资于漏洞修复,并优先于漏洞利用等攻击性能力。在由 Collinear 运营的具有挑战性的外部补丁基准 CWE-Bench 上,3.8 Flash Cyber 处于帕累托前沿:pass@1 达到 47.2%,而领先的前沿模型为 47.8%——但价格显著更低。

实际影响。 Google 报告称,其已在公司内部使用 3.8 Flash Cyber 保障代码安全。Chrome 安全团队发现,该模型为 Chrome 漏洞生成的正确补丁数量是规模大得多的最优秀商业模型的 2.6 倍。Wiz 发现,与其他领先前沿模型相比,该模型在其内部渗透测试基准上召回率高出 7.5–9.7%,成本低 2.3–5.2 倍。Google 的云漏洞研究团队利用该模型在不到两小时内发现了一个关键的基础性漏洞——此类漏洞的研究与发现通常需要数月时间。来自 Wiz 和 Collinear 外部基准的第三方验证,为 Google 的说法提供了一定程度的独立佐证,超越了自报的内部评估,不过详细的基准方法论仍由厂商自行发布。

安全为先

Gemini 3.8 Flash 内置了针对化学、生物、放射和核(CBRN)领域及网络攻击滥用的防护措施,同时依据 Google 的前沿安全框架允许有益的用例。3.8 Flash Cyber 携带更宽松的网络安全缓解措施,因此仅面向需要更全面网络能力的可信防御者提供。这种受限访问方式映照了 AI 与安全社区关于如何分发强大攻击性网络能力——将其限制于经过审核的防御者——同时不扼杀合法安全研究的更广泛讨论。Google 还指出,Gemini 3.8 系列模型在 Gray Swan 测量的提示注入鲁棒性方面取得显著跃升,保护用户免受与提示注入相关的恶意攻击;提示注入仍是读取不可信内容并代表用户执行操作的智能体 AI 系统中被引用最多的安全风险之一。

可用性

  • 开发者: 使用 3.8 Flash 构建应用,在 Google Antigravity 中探索智能体优先的工作流,或通过 Google AI Studio 和 Android Studio 在 Gemini API 中开始构建,或在 Stitch 中生成 UI。开发者文档可通过 Google 开发者文档获取。
  • 企业: 在 Gemini Enterprise 中使用 3.8 Flash。
  • 消费者: 3.8 Flash 面向 Google AI Pro 和 Ultra 订阅用户开放,涵盖 Gemini 应用、Google 搜索中的 AI 模式以及 Google 表格中的 Gemini。
  • 网络安全: 通过全新的 Fairwind 计划,可信的政府机构、关键基础设施运营商和软件维护者将获得 Gemini 3.8 Flash Cyber 的优先访问权。相关机构可申请访问权限。

来源:Google DeepMind 博客