Google DeepMind 發表 Gemini 3.8 Flash 與 3.8 Flash Cyber,主打代理式工作流程與網路安全
重點速覽
- •Google DeepMind 發表了迄今最強的推理與編碼模型 Gemini 3.8,距離 3.7 Flash 僅三週,為六週內第三次 Flash 發布。
- •Gemini 3.8 Flash 入門價為每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元,費率將於 2027 年 1 月 1 日加倍。
- •Gemini 3.8 Flash Cyber 在 CyberGym 上達到前沿水準的漏洞發現能力,並在 Google 內部 20 種程式語言漏洞基準上取得超過 70% 的成功率。
- •Chrome 安全團隊發現,Flash Cyber 為 Chrome 漏洞產生的正確修補數量,是體積更大的商業模型的 2.6 倍。
- •Flash Cyber 透過全新的 Fairwind 計畫僅提供給受信任的防禦者,而 3.8 Flash 則可透過 Gemini API、Gemini Enterprise 與 Google AI Pro/Ultra 訂閱使用。

Google DeepMind 發表了 Gemini 3.8,這是該公司迄今最強的推理與編碼模型,距離 3.7 Flash 僅三週,也是六週內的第三次 Flash 發布。如此密集的推出節奏反映了當前前沿模型市場的步調——Google、OpenAI 與 Anthropic 皆以數週而非數季為間隔持續推出新版本,而中階「Flash」級模型也日益成為生產級 AI 應用的主力。本次發布包含兩個版本:通用型主力模型 Gemini 3.8 Flash,以及專為網路安全設計的 Gemini 3.8 Flash Cyber,後者透過全新的 Fairwind 計畫提供給經審核的防禦者。
根據產品管理資深總監 Tulsee Doshi 與 Google DeepMind Gemini 安全負責人 Raluca Ada Popa 的公告,這兩款模型由相同的基礎智慧驅動,並透過長時間運行的代理式迴圈加速,這些迴圈會遞迴地評估與精煉底層模型。此一共用核心的編碼與推理提升來自多項創新,包括在需求極高的網路安全領域進行嚴格訓練。這樣的組合值得注意,因為它採用了一種技巧——以安全這類高難度、可驗證的領域作為訓練訊號——業界其他公司也曾運用類似方法來強化通用模型的推理能力。
Gemini 3.8 Flash:為長程編碼與自主代理而生
Gemini 3.8 Flash 在軟體工程、代理式任務以及專業領域的多步推理方面,相較 3.7 Flash 均有大幅提升,表現時常接近成本更高的前沿模型。其定價與 3.7 Flash 的入門價相同:每百萬輸入 token 0.75 美元,每百萬輸出 token 3.75 美元。此入門價將於 2026 年 12 月 31 日到期;自 2027 年 1 月 1 日起,費率調整為每百萬輸入 token 1.50 美元、每百萬輸出 token 7.50 美元。即使以全額費率計算,該模型的定價仍遠低於一般前沿模型等級,凸顯廠商在爭奪代理式工作負載時,對每 token 定價的競爭壓力——此類工作負載消耗的 token 遠多於聊天式互動。
在 DeepSWE v1.1(長程軟體工程)基準上,3.8 Flash 在端到端自主解決複雜工程問題的表現優於多數更大的前沿模型,且成本僅為其中一小部分。該模型在專業知識領域也展現出關鍵企業自主化所需的可靠性。在需要進階分析與報告的量化與專業領域,3.8 Flash 在 Vals Finance Agent V2 與 Harvey's Legal Agent Benchmark 等基準上超越了 3.7 Flash 與其他前沿模型。它在 HLE-Verified 上也達到 54.9%,展現跨 STEM、人文與專業領域的多步推理能力。
這些進展源自一項核心設計選擇:3.8 Flash 更加賣力工作。在複雜任務上,模型會執行額外的推理步驟並反覆呼叫工具,有時為了將效能最大化而消耗更多 token,尤其在較高的努力等級下。這種準確性與 token 消耗之間的取捨已成為代理式 AI 的核心設計課題,因為執行多步迴圈的自主代理會使推理成本成倍增加;努力等級控制為開發者提供了調節此一取捨的槓桿。對於運算資源受限的應用,開發者可使用較低的努力等級以減少 token 開銷,或繼續使用 Gemini 3.7 Flash——該模型仍針對效率優先的工作負載提供完整支援。
Google 展示了多項以 3.8 Flash 在 Google Antigravity 中打造的示範:一款由簡單循環提示生成的 3D 城堡巫師遊戲,包含謎題、環境敘事以及由 Nano Banana 生成的紋理;一個完全可遊玩的 DOS 版 Google 地圖,具備地點、導航與街景服務;一幅以美國地質調查所真實資料集繪製的知名地理景點地形圖,提供即時剖面、2D 投影與科學解說;以及 Hardware Anatomy——一個在 Google AI Studio 中打造的互動式 3D 視覺化工具,能產生比例寫實的硬體拆解 Three.js 渲染,並配備可展開檢視各層的分解滑桿。
Gemini 3.8 Flash Cyber:專家級網安效能
Gemini 3.8 Flash Cyber 為防禦者提供漏洞偵測與自動修補的前沿能力,並以 Flash 級的速度與成本交付,支援快速迭代。此模型的推出正值全產業積極投入 AI 輔助安全之際——軟體供應鏈攻擊與大型組織未修補的漏洞,使自動化發現與修復成為資安產業的投資熱點,但同時也引發疑慮:若此類能力不受限制,可能反而助長攻擊者。
自主漏洞發現。 在尋找漏洞的標準業界基準 CyberGym 上,3.8 Flash Cyber 展現前沿水準的自主漏洞發現能力,超越 3.5 Flash Cyber 以及體積大得多的前沿模型。為更貼近 CyberGym 所涵蓋 C/C++ 程式碼庫之外的實務防禦需求,Google 另在一項全面的內部基準上評估該模型,要求其橫跨 20 種程式語言的複雜程式碼庫中找出各類漏洞,模型在此達到超過 70% 的成功率——相較先前的模型有顯著躍升。
自動修補。 Google 表示,其重點在於賦予防禦者相對攻擊者更具優勢的專家能力,因此從一開始便投資於漏洞修復,並將其置於漏洞利用等攻擊性能力之上。在由 Collinear 營運的高難度外部修補基準 CWE-Bench 上,3.8 Flash Cyber 位於帕累托前沿:pass@1 達 47.2%,相較領先前沿模型的 47.8%,但價格顯著更低。
實際影響。 Google 表示已在全公司使用 3.8 Flash Cyber 保障程式碼安全。Chrome 安全團隊發現,該模型為 Chrome 漏洞產生的正確修補數量,是體積大得多的最佳商業模型的 2.6 倍。Wiz 發現,與其他領先前沿模型相比,該模型在其內部滲透測試基準上召回率高出 7.5–9.7%,成本卻低 2.3–5.2 倍。Google 的雲端漏洞研究團隊利用該模型在兩小時內發現一個關鍵的基礎漏洞——此類漏洞的研究與發現通常需時數月。Wiz 與 Collinear 外部基準的第三方驗證,為 Google 的說法提供了一定程度超出自我評估的獨立佐證,不過詳細的基準方法論仍由廠商自行發布。
以安全為設計核心
Gemini 3.8 Flash 內建針對化學、生物、放射、核子(CBRN)領域與網路攻擊的防濫用防護,同時允許有益的使用案例,符合 Google 的前沿安全框架。3.8 Flash Cyber 則採用較寬鬆的網路安全防護措施,因此僅提供給需要更全面網安能力的受信任防禦者。此種限制存取的做法,呼應了 AI 與資安社群對如何分配強大攻擊性網安能力的廣泛辯論——將其限於經審核的防禦者,同時又不扼殺合法的資安研究。Google 亦指出,Gemini 3.8 系列模型在 Gray Swan 衡量的提示注入防禦上有顯著躍升,可保護使用者免於提示注入相關的惡意攻擊;提示注入仍是代理式 AI 系統最常被引用的資安風險之一,因為這類系統會讀取不受信任的內容並代表使用者採取行動。
可用性
- 開發者: 使用 3.8 Flash 打造應用,並在 Google Antigravity 中探索代理優先的工作流程,或透過 Google AI Studio 與 Android Studio 在 Gemini API 中開始開發,也可在 Stitch 中生成 UI。開發者文件可透過 Google 開發者文件取得。
- 企業: 在 Gemini Enterprise 中使用 3.8 Flash。
- 消費者: 3.8 Flash 已向 Google AI Pro 與 Ultra 訂閱者開放,涵蓋 Gemini 應用程式、Google 搜尋的 AI 模式,以及 Google 試算表中的 Gemini。
- 網安: 透過全新的 Fairwind 計畫,受信任的政府機關、關鍵基礎設施營運者與軟體維護者可優先取得 Gemini 3.8 Flash Cyber。組織可申請存取權限。