Google 推出 Gemini 4 Argon,在網路安全基準測試上超越競爭對手 AI 模型
重點速覽
- •Gemini 4 Argon 在 DeepSWE v1.1 軟體工程基準測試中獲得 77.9%,領先 Claude Opus 5.5 的 74.2%、GPT-6 Astra 的 74.1% 與 Claude Fable 5.1 的 67.4%,但該分數由 Google 自行計算,競爭對手的數據則來自外部來源。
- •在 Gray Swan 的間接提示注入基準測試中,Argon 錄得 0.7% 的攻擊成功率,優於均為 1.0% 的 Claude Opus 5.5 與 Claude Fable 5.1,而 Grok 4.6 與 Kimi K3 被欺騙的時間超過一半。
- •Google 透過 Fairwind Program 將初期存取權限限制於經審核的安全團隊,該計畫擁有超過 650 個合作夥伴,包括政府與關鍵基礎設施營運商,且模型在分階段推出時不含內建網路安全防護欄。
- •Argon 單次回覆最多可產生 100 萬個 token,較先前 64,000 個 token 的上限增加約十六倍,為長篇程式編寫與辦公任務提供更大空間。
- •計劃向付費 API 客戶與 Google AI Ultra 訂閱用戶進行更廣泛的發布,初期定價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,為最終標準費率的一半。

Google 週三推出 Gemini 4 Argon,這款新的前沿模型在網路安全測試上的基準成績領先競爭對手 AI 系統。該模型在 DeepSWE v1.1 上獲得 77.9% 的分數,並在 Gray Swan 的提示注入基準測試中錄得 0.7% 的攻擊成功率,優於 Claude Opus 5.5 與 Claude Fable 5.1,兩者均為 1.0%。
此次發布距離 Claude Opus 5.5 的推出僅一週,距離 GPT 6.1 Sol 的發布也僅一天,是美國頂尖 AI 實驗室一系列快速接連發布前沿模型的最新一例——這種節奏使發布當日的基準測試圖表成為業界的持續記分板。
根據 Google 的官方公告,on 是該公司迄今最強的模型,專為程式編寫、辦公工作與網路防禦而構建。
軟體工程成績亮眼,但有所保留
DeepSWE v1.1 衡量 AI 模型能否完成冗長、繁雜的真實世界軟體工程任務,成績以百分比計算。Argon 獲得 77.9%,領先 Claude Opus 5.5 的 74.2%、GPT-6 Astra 的 74.1% 以及 Claude Fable 5.1 的 67.4%。作為參考,Gemini 3.6 Flash 在 7 月的同一測試中僅獲得 49%。
該模型還能在單次回覆中撰寫多達 100 萬個 token,高於先前的 64,000 個。一個 token 大約相當於四分之三個單詞,這意味著新的上限約為 75 萬字,而先前約為 48,000 字——這一容量是為該模型所針對的長篇程式編寫與辦公工作而設計的。
不過這些數字需有所保留:DeepSWE 分數是 Google 自行計算的,而競爭對手模型的數字則來自公開排行榜與公司報告。Google 的比較表也承認部分落後。Argon 在 18 項基準測試中有 12 項領先,1 項持平,5 項落後,這些測試涵蓋程式編寫、科學與電腦操作——在瀏覽頭條數字時,值得記住這是自測第三方方法混合的結果。
網路安全成為焦點
該模型的招牌能力是網路防禦。在間接提示注入攻擊中,一條秘密指令被隱藏在電子郵件或其他內容中;當 AI 助手閱讀它時,測試的問題是模型會服從陌生人還是其用戶。對於任何讓 AI 存取其收件匣或購物車的人來說,這類攻擊都是噩夢般的場景。
在 Gray Swan 的間接提示注入基準測試中,該測試將惡意指令隱藏在 AI 代理閱讀的內容中,並統計在 15 次嘗試內攻擊成功的比例,Argon 的成績為 0.7%——數字越低越好。Claude Opus 5.5 與 Claude Fable 5.1 均為 1.0%。GPT-6 Astra 為 8.5%。Grok 4.6 與 Kimi K3 則有超過一半的時間被欺騙,分別為 51.8% 和 52.7%。榜單上最佳與最差防禦之間 52 個百分點的差距顯示,業界在抵抗提示注入方面仍存在巨大落差。
透過 Fairwind Program 限制性推出
Argon 首先透過 Fairwind Program 提供給經審核的安全團隊,這是 Google 有限存取的網路防禦計畫,於 9 月 2 日啟動,擁有超過 650 個合作夥伴,包括政府與關鍵基礎設施營運商。該模型在發布時「不含網路安全防護欄」——即通常阻止模型協助駭客行為的內建拒答機制。
這一舉措的邏輯在於,防禦者需要一個能像攻擊者一樣思考的模型,以便在犯罪分子發現漏洞之前將其修補。問題是同樣的能力也是把雙面刃,因此 Google 表示分階段推出是唯一安全的路徑。該公司還參與了美國政府自願性的模型發布前存取流程。
Google 並非第一家對網路安全模型設置門檻的公司。Anthropic 的 Claude Mythos 早期版本曾協助在 Firefox 中發現 271 個漏洞——即 Mozilla 隨後修補的 271 個安全漏洞。OpenAI 也透過其 Trusted Access for Cyber 計畫採取了類似路徑,使受限的網路安全存取成為前沿實驗室之間的新興模式。
Argon 的網路安全成績也超越了 Gemini 3.8 Flash Cyber,即 Google 與 Fairwind 同步推出的受限模型。在 Wiz 滲透測試基準(Google 內部測試,要求 AI 在看不到程式碼的情況下,針對真實網頁應用程式漏洞撰寫可用的攻擊程式,並統計首次嘗試即成功的比例)中,Argon 獲得 70.9%,相較之下 Gemini 3.8 Flash Cyber 為 58.2%。Google 也表示,Argon 協助安全公司 Wiz 在全球醫院使用的醫療軟體中發現了一個關鍵漏洞——此前的前沿模型都未曾察覺。
艱難夏季之後的發布
此次發布正值 Google 度過一段艱難時期之後。7 月,該公司推出了較小的 Flash 模,卻跳票了承諾的 Gemini 3.5 Pro,Alphabet 股價下跌約 4.4%。Argon 也在川普總統公布一項自願性、無罰則的 AI 協議的同一天問世,Google 領導層已簽署該協議。
Google 表示,將盡快進行更廣泛的發布,首先面向付費 API 客戶與 Google AI Ultra 訂閱用戶。初期定價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。Google 尚未說明此優惠期何時結束,僅表示標準費率為 4 美元與 20 美元——恰好是初期價格的兩倍。更廣泛發布的時間點與優惠期的長短,是 Argon 推出過程中最值得關注的兩個時間點。