Google DeepMindが次世代フロンティアAIモデル「Gemini 4 Argon」を発表
重要ポイント
- •Gemini 4 Argonは各分野で最先端のベンチマーク結果を記録し、長期ソフトウェアエンジニアリングのDeepSWE v1.1で77.9%、ZapierのAutomationBenchで51.3%、長尺動画理解のLVBenchで91.7%のスコアを達成した。
- •モデルの出力トークン上限は、従来の64,000の約15倍となる業界最高水準の100万トークンに拡大され、Googleによると難しい問題を一度で解決できるようになるという。
- •Argonは重要な脆弱性を自律的に発見・検証・パッチ適用でき、WizのScan for Goodイニシアブを通じて、世界中の病院で使用される医療ソフトウェアにおける機密個人情報の漏洩につながる重大な欠陥を、以前のフロンティアモデルが見逃していた中で暴露した。
- •提供は段階的な展開に従い、信頼されたサイバー防御者はFairwindプログラムを通じてサイバーガードレールなしで初期アクセスを受け、開発者、企業、消費者はその後、有料API顧客とGoogle AI Ultra契約者からアクセスを得ることになる。
- •Google社内では、Argonエージェントが公開された量子アルゴリズムのベースラインを40%上回り、300 TiB超のデータセンターメモリを解放し、Fuchsia OSのZirconカーネルの80万行超を含む大規模なC/C++コードベースのRustへの移行を進めている。

Google DeepMindは2026年9月30日、複雑で長期的な専門ワークフローにわたって深い推論を持続するよう設計された新たなフロンティアAIモデル「Gemini 4 Argon」を発表した。同社によると、このモデルは実世界のソフトウェアエンジニアリング、法務・金融などのエンタープライズナレッジワーク、サイバーセキュリティ防御においてフロンティアレベルのパフォーマンスを発揮し、当初はGoogleのFairwindプログラムを通じて信頼されたサイバー防御者のグループに展開されるという。
Google DeepMindのSVPでGoogleチーフAIアーキテクトであるKoray Kavukcuogluは、ブログ記事でこのモデルを発表し、Argonは「Googleでの働き方と開発のあり方を根本的に変えている」と述べた。同社は、深い多段階の問題解決のための業界最高水準の100万トークンの上限に加え、コーディング、金融リサーチ、法務文書作成、サイバーセキュリティ脆弱性の自律的なパッチ適用における強みを強調した。
段階的なリリースと価格設定
Googleは、このレベルのフロンティア機能を安全にリリースするには段階的なアプローチが必要であると述べた。同社は提供を段階的に拡大する中で、米国政府のリリース前モデルアクセスに関する任意のプロセスに積極的に参加しており、Argonを開発者、企業、消費者に提供する前にガードレールの反復改善を続けながら、初期テスターからのフィードバックを収集し続けるとしている。この初期アクセス計画により、Googleが説明する機能とセーフガードは、より広い市場に即座に提供されるのではなく、まず管理された環境で評価されることになる。
Argonは導入価格として入力トークン100万あたり2ドル、出力トークン100万あたり10ドルで提供され、キャッシュされた入力トークンは入力トークン価格の95%引きで提供される。導入期間終了後には、入力万トークンあたり4ドル、出力100万トークンあたり20ドルの価格が適用される。より広い展開は、有料API顧客とGoogle AI Ultra契約者から始まる。
Googleの働き方と開発の変革
Gemini 4 ArgonはすでにGoogle社内のワークフローを支えており、何千人ものGoogle社員が、専門的なコーディングタスク、より深いリサーチ、文章の品質におけるモデルの強みを挙げている。Googleは、このモデルがチームの開発加速を支援し、エンジニアリングの生産性の限界を押し広げ、ブレークスルーを加速していると述べた。記事で挙げられた例は以下の通りである。
- 量子アルゴリズムの最適化: Argonは、Googleの量子コンピューティング研究者が、重要なアプリケーションのボトルネックとなるサブルーチンの空間時間リソース(キュービット×ゲート)を最適化するのを支援している。ある例では、数分のうちに公開されているベースラインを40%上回った。
- メモリ効率: Argonエージェントのチームは、フリート全体のプロファイリングテレメトリを分析し、Googleのデータセンター全体でメモリ最適化を自律的に特定・適用し、展開後には300 TiB以上のメモリを解放し、合計で推定500 TiBから1 PiBの節約を見込んでいる。
- 大規模コードベースの移行と最適化: Argonエージェントは、Google全体でC/C++コードベースのRustへの移行に取り組んでおり、re2やlibgav1などのコアライブラリの数万行から、Fuchsia OSのZirconカーネルの80万行超まで対応している。これらのシステムの多くが重要であるため、大規模な書き換えは、本番環境に展開される前に厳格な自動・手動監査、エミュレーションテスト、レビューを受けている。動画デコード用のGoogleのオープンソースソフトウェアlibgav1では、Argonエージェントが既存のRustポートを基に、プロファイルガイド実験を何度も実行し、コンパイラの出力を研究しながら、コンパイラが自動的にベクトル化できる安全なRustを生成することで、32,000行のSIMDコードを置き換えた。その結果、メモリ安全な動画デコーダーはRustポートより2.7倍高速に動作し、動画出力は同一で、最適化されたC++実装に近づいた。
100万トークンの出力上限
Gemini 4 Argonのより長く複雑なユースケースにわたる能力を支えるため、Googleはモデルの出力トークン上限を、従来の64,000トークンから業界最高水準の100万トークンに拡大していると述た。同社によると、モデルが深く思考し、1つの軌跡で数十万トークンを生成する余地がある場合、難しい問題を一度で解決できる新たな推論の深さが加わるという。
各分野におけるコーディングとエンタープライズワークフロー
Googleは、コーディング、推論、マルチモーダリティにわたるGemini 4 Argonの能力と、長い多段階タスクを持続する能力により、幅広いエンタープライズワークフローで優れた成果を上げられると述べた。Googleのエンジニアは、日常的なデバッグから大規模なコードベース移行、アルゴリズム設計まで、日々のタスクでこのモデルを利用している。Argonは、実世界の長期ソフトウェアエンジニアリングタスクにおけるモデルのパフォーマンスを測るDeepSWE v1.1で77.9%のスコアを記録し、新たな最先端水準を打ち立てた。
コーディングを超えて、GoogleはArgonがVals Indexで首位のモデルであると述べた。このベンチマークは、金融、コーディング、法務、税務の仕事にわたる経済的影響を、各セクターの米国GDPへの貢献度で重み付けして測定するものである。同社は、多段階の金融リサーチを試験するVals Finance Agent v2や、法務リサーチと文書作成を対象とするHarveyのLegal Agent Benchmarkなど、分野特化型の評価でも同様に首位のパフォーマンスを報告している。主要なビジネス機能にわたるエンドツーエンドの実行を測定するZapierのベンチマークAutomationBenchでは、Argonが51.3%のスコアで1位にランクした。
Googleによると、ナレッジワークに視覚的な理解が必要な場合でもArgonは高い強みを発揮する。このモデルは、専門的なチャート分析の実行、長い動画からの詳細の特定、一連のドキュメントに基づくアクションの実行が可能である。長尺動画の理解を測定するLVBenchでは、同社はArgonが91.7%のスコアで最先端であると述べている。
防御的サイバーセキュリティにおけるリーダーシップ
Googleは、新たなサイバー攻撃の時代にサイバー防御者をより良く装備するため、Gemini Argonをサイバーセキュリティ防御に高度に対応できるよう訓練したと述べた。このモデルは、重要なソフトウェア脆弱性を自律的に発見、検証、パッチ適用できる。信頼された防御者とGoogle自身の社内チーム向けには、同社はフロンティアレベルのサイバーセキュリティ防御能力を最大限に活用できるよう、サイバーガードレールなしでArgonをリリースする予定である。
セキュリティ企業Wizは、Scan for Goodイニシアチブを通じて、サイバーセキュリティ防御にArgonをすでに活用している。これは、高リスクな露出を発見し修復することで、重要な公共インフを無償で保護することに特化したプログラムである。Googleによると、このモデルの影響を示す初期の実証として、Argonは世界中の病院で使用されている医療ソフトウェアにわたって機密性の高い個人情報を露出させる重大な脆弱性を発見し、以前のフロンティアモデルが見逃していた深刻なリスクを特定したという。
モデルのセキュリティ脆弱性の修復能力を評価するCWE-bench v1では、Argonは最高スコア68%で首位に並び、CWE-bench v0における3.8 Flash Cyberのフロンティアパフォーマンスを基盤としている。
Googleは、Gemini 4 Argonが3.8 Flash Cyberを大きく上回る脆弱性発見の飛躍を示していると述べた。
- Google社内の包括的な脆弱性ベンチマークで、Argonは20のプログラミング言語にわたる複雑なコードベースにおける幅広い露出を発見した。
- ソースコードなしで稼働中のWebシステムを分析するモデルの能力を試験するWizの社内ブラックボックス・ペネトレーションテストベンチマークでは、Argonは攻撃対象領域の発見、脆弱性の特定、それらを検証する概念実証の証拠の生成において、3.8 Flash Cyberを上回る成果を上げた。
広く提供する前のフロンティアセーフガードの強化
Gemini 4 Argonを広く展開する前に、Googleは4つの主要分野にわたる重要なフロンティアセーフガードの強化を続けていると述べた。
- 悪用からの防御: 悪意のある actor がサイバー攻撃や化学・生物・放射線・核(CBRN)攻撃にArgonを使用することを防ぐため、モデルはGoogle DeepMindのFrontier Safety Frameworkに従い、正当なデュアルユースの科学研究を維持しながら有害な要求を拒否するよう設計されている。同社は今回のリリースに向けてセーフガードの堅牢性を強化しており、悪用を検知するためのモデルの内部アクティベーション監視技術の改善が含まれる。これらのセーフガードは、手動と自動の攻撃手法を組み合わせた社内および外部のレッドチームによる堅牢性テストを受けている。
- プロンプトインジェクション攻撃からの防御: Googleは、Argonを、悪意のある指示やコンテキストでモデルの挙動を乗っ取る間接プロンプトインジェクションに対して、これまでで最も耐性のあるモデルであると説明した。同社はこれらが絶え間ない警戒と多層防御を必要とする複雑な攻撃であると述べた。自動化されたレッドチーミングと敵対的訓練を通じて、GoogleによればGemini 4 ArgonはGray Swanの間接プロンプトインジェクション(IPI)ベンチマークでプロンプトインジェクション耐性の首位を維持している。
- アライメント逸脱の監視: Argonがユーザーの意図超えた方法でタスクを遂行しようとして限界を越えることを防ぐため、Googleはモデルの思考連鎖とアクションを監視し、必要に応じて実行を停止するアライメント逸脱の緩和策を展開している。同社は同様のシステムを使用して訓練ランを監視し、専任のインシデント対応チームにアラートを送信しており、Argonの推論が監視を回避するよう形作られるリスクを避けるため、発見内容を訓練にフィードバックしないよう慎重な注意を払っている。Googleは、アライメントのリスクに対処するこれらの能力向上の重要な時期において、モデルの思考がアライメント逸脱の特定と診断に役立ち続けられるよう、業界全体が推論の透明性を維持することを強く推奨していると述べた。
- システムの強化: フロンティアモデルがますます高度化する中、安全にテストするには、システム自体に追いつける安全な環境が必要であるとGoogleは述べた。エージェントコントロールロードマップに沿って、同社は高リスクな訓練や評価の開始前に、サンドボックス環境を分離・封鎖することで強化している。Googleはまた、エコシステム全体のセキュリティ向上のため、これらのエージェントセキュリティのベストプラクティスをパートナーと共有することを約束している。
近日中に展開開始
Googleは、Gemini 4 Argonを、コーディング、ナレッジワーク、サイバーセキュリティ防御、創作的執筆におけるフロンティアレベルの能力を備え、最も困難な問題に取り組む開発者、専門家、企業のパートナーとなるよう構築したと述べた。同社は、開発者、企業、消費者へのリリース(有料API顧客とGoogle AI Ultra契約者から開始)前にシステムを強化するのに役立つ実世界の評価とフィードバックを提供した、最初のサイバー防御者と信頼されたテスターのグループに感謝を表明した。
導入期間終了後には、入力100万トークンあたり4ドル、出力100万トークンあたり20ドルの価格が適用される。
著者について: Koray Kavukcuogluは、人工知能分野における世界有数の専門家の一人である。Google DeepMindのSVPとして、同社の最先端の生成AIモデルの開発と、Googleの製品への大規模な統合を統括している。現職以前はGoogle DeepMindのVP of Researchを務め、深層学習チームを創設し、そのチームはDQN(Deep Q-Network)やWaveNetなどの主要な研究ブレークスルーを先導した。