新聞股票Google DeepMind 發表 Gemini 4 Argon,開啟前沿智慧新時代

Google DeepMind 發表 Gemini 4 Argon,開啟前沿智慧新時代

作者: Google DeepMind Blog·

重點速覽

  • •Gemini 4 Argon 在多項基準測試中創下業界最佳成績:長週期軟體工程的 DeepSWE v1.1 得分 77.9%、Zapier 的 AutomationBench 得分 51.3%、長影片理解的 LVBench 得分 91.7%。
  • •模型的輸出 token 上限已擴展至業界領先的 100 萬個,約為先前 64,000 個的十五倍,Google 表示這讓困難的問題能一次解決。
  • •Argon 能自主發現、驗證並修補關鍵漏洞;透過 Wiz 的 Scan for Good 計畫,它在全球醫院使用的醫療軟體中,找出了先前前沿模型未能察覺、洩露敏感個人資料的重大漏洞。
  • •可用性採分階段推出:受信任的網路防禦者先透過 Fairwind Program 取得無網路安全防護限制的版本,開發者、企業與消費者則須等待後續開放,首先從付費 API 客戶與 Google AI Ultra 訂閱者開始。
  • •在 Google 內部,Argon 代理將已發表的量子演算法基準提升了 40%、釋放了超過 300 TiB 的資料中心記憶體,並正將大型 C/C++ 程式碼庫遷移至 Rust,包括逾 800,000 行的 Fuchsia OS Zircon 核心。
Google DeepMind 發表 Gemini 4 Argon,開啟前沿智慧新時代

Google DeepMind 於 2026 年 9 月 30 日發表 Gemini 4 Argon,這款新的前沿 AI 模型能在複雜、長週期的專業工作流程中維持深度推理。該公司表示,此模型在實際軟體工程、法律與金融等企業知識工作,以及網路安全防禦方面皆展現前沿水準的表現,並初期透過 Google 的 Fairwind Program 提供給一批受信任的網路防禦者。

Google DeepMind 資深副總裁兼 Google 首席 AI 架構師 Koray Kavukcuoglu 在部落格文章中宣布此模型,並寫道 Argon 正「從根本上改變我們在 Google 工作與打造產品的方式」。該公司強調此模型具備業界領先的 100 萬 token 上限,可進行深度、多步驟的問題解決,並在程式編寫、金融研究、法律文書起草,以及自主修補網路安全漏洞方面表現出色。

分階段發布與定價

Google 表示,安全地釋出此等水準的前沿能力需要分階段推進。該公司正積極參與美國政府的自願性模型預先發布存取流程,同時逐步擴大可用範圍,並將持續蒐集早期測試者的回饋,在向開發者、企業與消費者開放 Argon 之前持續完善防護機制。初期存取畫意味著 Google 所描述的能力與安全防護,會先在受控環境中接受評估,而非立即向廣大市場開放。

Argon 將以 introductory 價格推出:每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取輸入 token 則以輸入價格的 5%(95% 折扣)計費。introductory 期結束後,將適用每百萬輸入 token 4 美元、每百萬輸出 token 20 美元的定價。更廣泛的推出將從付費 API 客戶與 Google AI Ultra 訂閱者開始。

改變 Google 內部的工作與開發方式

Gemini 4 Argon 已在 Google 內部工作流程中發揮作用,數千名 Google 員工稱讚此模型在專業程式編寫任務、深度研究與寫作品質上的優勢。Google 表示,此模型協助團隊加快開發速度、突破工程生產力的界限並加速重大突破。文章中列舉的範例包括:

  • 量子演算法最佳化: Argon 正協助 Google 的量子運算研究人員最佳化限制重要應用效能的副程式的時空資源(qubits × gates)。在其中一個案例中,它在幾分鐘內就將已發表的基準提升了 40%。
  • 記憶體效率: 一組 Argon 代理分析了整個機群的效能剖析遙測資料,自主識別並套用記憶體最佳化方案至 Google 的資料中心,全面部署後釋放了超過 300 TiB 的記憶體,估計總節省量為 500 TiB 至 1 PiB。
  • 大規模程式碼庫遷移與最佳化: Argon 代理正在 Google 內部將 C/C++ 程式碼庫遷移至 Rust——規模從 re2、libgav1 等核心函式庫的數萬行程式碼,一直到 Fuchsia OS Zircon 核心的逾 800,000 行。考量到許多系統的關鍵性,這些大規模改寫在部署至正式環境前,皆須經過嚴格的自動化與人工審核、模擬測試與程式碼審查。以 Google 的開源影片解碼軟體 libgav1 為例,Argon 代理在既有 Rust 移植版本的基礎上,透過多輪以效能剖析為導向的實驗、研究編譯器輸出,並撰寫安全 Rust 程式碼使編譯器能自動向量化,取代了 32,000 行 SIMD 程式碼。最終成果是一個記憶體安全的影片解碼器,執行速度比原 Rust 移植版本快 2.7 倍,輸出內容完全相同,並更接近最佳化的 C++ 實作。

100 萬 token 輸出上限

為支援 Gemini 4 Argon 在更長、更複雜的使用情境中的能力,Google 表示已將模型的輸出 token 上限擴展至業界領先的 100 萬個,先前的上限為 64,000 個。該公司指出,當模型有足夠的空間進行深度思考並在單一軌跡中產生數十萬個 token 時,便能為推理增加新的深度層次,讓困難的問題能一次解決。

跨領域的程式編寫與企業工作流程

Google 表示,Gemini 4 Argon 在式編寫、推理與多模態方面的能力,加上能夠持續執行長時間、多步驟任務,使其能在多種企業工作流程中脫穎而出。Google 工程師已將此模型用於日常工作,從日常除錯到大規模程式碼庫遷移與演算法設計。Argon 在衡量模型於真實世界長週期軟體工程任務表現的 DeepSWE v1.1 上,以 77.9% 的成績創下新的業界最佳紀錄。

在程式編寫之外,Google 表示 Argon 是 Vals Index 上的領先模型,該指標衡量在金融、程式編寫、法律與稅務工作上的經濟影響,各領域依其對美國 GDP 的貢獻加權。該公司也表示,在 Vals Finance Agent v2(多步驟金融研究)與 Harvey 的 Legal Agent Benchmark(法律研究與文書起草)等領域特定評測中,Argon 同樣有領先表現。在衡量核心業務職能端對端執行能力的 Zapier 基準 AutomationBench 上,Argon 以 51.3% 的成績排名第一。

Google 表示,當知識工作需要視覺理解時,Argon 同樣表現突出。此模型能進行專業圖表分析、從長影片中識別細節,並根據一系列文件採取行動。在衡量長影片理解的 LVBench 上,該公司表示 Argon 以 91.7% 的成績居於業界最佳。

在防禦性網路安全方面的領先地位

Google 表示,為了讓網路防禦者更能因應新型態的網路攻擊,該公司將 Gemini Argon 訓練為在網路安全防禦方面具備高度能力。此模型能自主尋找、驗證並修補關鍵軟體漏洞。針對受信任的防禦者與 Google 自身的內部團隊,該公司將釋出不含網路安全防護限制的 Argon,使其能充分運用此模型完整的前沿級網路安全防禦能力。

資安公司 Wiz 已透過其 Scan for Good 計畫將 Argon 用於網路安全防禦,該計畫致力於免費尋找並修補高風險曝險,以保護關鍵公共基礎設施。Google 表示,在一個早期的影響力示範中,Argon 在全球醫院使用的醫療軟體中發現了一個洩露敏感個人資料的關鍵漏洞,找出了先前前沿模型未能察覺的嚴重風險。

在評估模型修補安全漏洞能力的 CWE-bench v1 上,Argon 以最高分 68% 並列第一,延續了 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表現。

Google 表示,Gemini 4 Argon 在漏洞發現方面較 3.8 Flash Cyber 有顯著躍進:

  • 在 Google 內部的綜合漏洞基準測試中,Argon 在橫跨 20 種程式語言的複雜程式碼庫中發現了廣泛的曝險。
  • 在 Wiz 內部的黑箱滲透測試基準(測試模型在沒有原始碼的情況下分析線上系統的能力)中,Arg 在發現攻擊面、識別漏洞,以及產生驗證漏洞的概念驗證證據方面,均優於 3.8 Flash Cyber。

在廣泛開放前強化前沿安全防護

在廣泛推出 Gemini 4 Argon 之前,Google 表示將持續在四大主要領域強化關鍵的前沿安全防護:

  • 防範濫用: 為防止惡意行為者利用 Argon 進行網路或化學、生物、輻射與核(CBRN)攻擊,此模型的設計會拒絕有害請求,同時依據 Google DeepMind 的 Frontier Safety Framework 保留合法的兩用科學研究。該公司正為此次推出強化安全防護的穩健性,包括改進監控模型內部激活以察覺濫用的技術。這些防護措施已由內部與外部紅隊結合人工與自動化攻擊方法進行穩健性測試。
  • 防範提示注入攻擊: Google 表示,Argon 是其迄今對間接提示注入最具抵抗力的模型;間接提示注入是指利用惡意指令或上下文來劫持模型行為。該公司指出,這類攻擊複雜,需要持續警覺與多層防禦。Google 表示,透過自動化紅隊測試與對抗性訓練,Gemini 4 Argon 在 Gray Swan 的間接提示注入(IPI)基準上的提示注入抵禦能力居於領先。
  • 監控錯位: 為防止 Argon 在完成任務時超出使用者意圖的範圍,Google 正部署錯位緩解措施,監控模型的思維鏈與行動,並在必要時停止執行。該公司曾使用類似系統監控訓練過程並向專責事件回應團隊發送警報,同時審慎避免將研究發現回饋至訓練中,以免 Argon 的推理被塑造來規避監控。Google 表示,強烈鼓勵業界在能力大幅提升的關鍵時刻,於因應對齊風險的同時保持推理透明度,使模型的想法能有助於識別與診斷錯位。
  • 強化系統: Google 表示,隨著前沿模型的能力日益增強,安全測試需要能與系統本身同步演進的安全環境。依據其 agent control roadmap,該公司正在高風險訓練或評估開始前,透過隔離與封閉來強化其沙盒環境。Google 也承諾與合作夥伴分享這些代理安全最佳實務,以提升整個生態系的安全。

即將推出

Google 表示,Gemini 4 Argon 具備程式編寫、知識工作、網路安全防禦與創意寫作方面的前沿級能力,旨在成為開發者、專業人士與企業處理最困難問題時的合作夥伴。該公司感謝首批網路防禦者與受信任測試者,他們的真實世界評估與回饋,將協助該公司在向開發者、企業與消費者開放之前強化其系統,首先從付費 API 客戶與 Google AI Ultra 訂閱者開始。

關於作者: Koray Kavukcuoglu 是全球頂尖智慧專家之一。身為 Google DeepMind 資深副總裁,他領導 Google DeepMind 最先進生成式 AI 模型的開發,以及這些模型在 Google 產品中的大規模整合。在擔任現職之前,他是 Google DeepMind 的研究副總裁,創立了深度學習團隊,該團隊開創了 DQN(Deep Q-Network)與 WaveNet 等重大研究突破。