Google startet Gemini 4 Argon für fortgeschrittene Programmierung, beschränkt den Zugang jedoch wegen Cybersicherheitsrisiken
Wichtige Erkenntnisse
- •Gemini 4 Argon wurde am 30. September im Rahmen von Googles Fairwind Programme angekündigt, wobei der Zugang zunächst auf ausgewählte Regierungen, vertrauenswürdige Partner und Googles eigene Teams beschränkt ist, während Termine für eine breitere Bereitstellung noch offen sind.
- •Google meldet, dass Argon 77,9 % im DeepSWE-v1.1-Software-Engineering-Benchmark erreichte, vor Claude Opus 5.5 mit 74,2 % und GPT-6 Astra mit 74,1 %, wobei diese Werte aus Googles eigenen Bewertungen stammen.
- •Das Modell kann bis zu 1 Million Token in einer einzigen Antwort erzeugen, eine deutliche Steigerung gegenüber dem Ausgabe-Limit von 64.000 Token bei vorherigen Modellen.
- •Innerhalb von Google nutzen Tausende Mitarbeiter Argon für Aufgaben wie die Migration von C- und C++-Codebasen zu Rust, darunter Codebasen mit mehr als 800.000 Zeilen im Zircon-Kernel des Betriebssystems Fuchsia.
- •Argon startet zu einem Einführungspreis von 2 $ pro Million Eingabe-Token und 10 $ pro Million Ausgabe-Token, der nach der Einführungsphase auf 4 $ bzw. 20 $ steigt; Cache-Eingabe-Token erhalten 95 % Rabatt.

Google hat Gemini 4 Argon vorgestellt, das erste Modell seiner Gemini-4-Generation, und führt es mit einem Zugang ein, der zunächst auf vertrauenswürdige Cybersecurity-Verteidiger und Googles interne Teams beschränkt ist.
Das Unternehmen kündigte Argon am 30. September im Rahmen seines Fairwind Programme an, einer Initiative, die ausgewählten Regierungen und vertrauenswürdigen Partnern Zugang zu Googles fortschrittlichen Cybersicherheitsmodellen gewährt. Laut der offiziellen Ankündigung kann Argon kritische Software-Schwachstellen autonom finden, validieren und patchen. Google hält den breiteren Zugang vorerst zurück, während es das Modell weiter testet und seine Schutzmaßnahmen verfeinert.
Zahlende Application-Programming-Interface-Kunden (API) und Google-AI-Ultra-Abonnenten erhalten später Zugang, allerdings hat Google noch keinen konkreten Termin für die breitere Bereitstellung genannt.
Wie Argon laut Google im Vergleich abschneidet
Google meldet, dass Argon 77,9 % im DeepSWE v1.1 erreicht hat, einem Benchmark für Software-Engineering-Aufgaben. Im selben Test weist das Unternehmen 74,2 % für Anthropics Claude Opus 5.5 und 74,1 % für OpenAIs GPT-6 Astra aus.
Im CWE-bench v1, der bewertet, wie gut KI-Modelle Software-Schwachstellen identifizieren und beheben, erreichte Argon laut Google 68 % und zog damit mit GPT-6 Astra gleich. Die Benchmark-Werte stammen aus Googles eigenen Bewertungen, sodass sie nicht unabhängig belegen, wie Argon bei realen Arbeitslasten abschneidet.
Argon kann zudem bis zu 1 Million Token in einer einzigen Antwort generieren, verglichen mit einem Ausgabe-Limit von 64.000 Token bei vorherigen Modellen. Token sind die grundlegenden Texteinheiten, die von KI-Modellen verarbeitet und erzeugt werden. Das größere Ausgabe-Limit soll Argon in die Lage versetzen, längere Software-Engineering- und andere komplexe Aufgaben zu bewältigen, ohne wiederholt zum Fortfahren aufgefordert werden zu müssen.
Interner Einsatz
Google zufolge wird Argon intern bereits von Tausenden Mitarbeitern für Programmierung, Forschung und andere spezialisierte Aufgaben genutzt. Eine der berichteten Anwendungen ist die Migration von C- und C++-Codebasen zu Rust, einer Systemprogrammiersprache, die darauf ausgelegt ist, die Speichersicherheitsfehler zu verhindern, die eine gut dokumentierte Quelle von Software-Schwachstellen sind. Laut Google arbeiten Argon-Agenten an Codebasen von Zehntausenden Zeilen bis zu mehr als 800.000 Zeilen im Zircon-Kernel seines Betriebssystems Fuchsia.
Das Unternehmen erklärt, die größeren Code-Migrationen durchlaufen automatisierte und manuelle Audits, Emulationstests und, bevor sie in Produktion going werden. Kernel-Code bildet den Kern eines Betriebssystems, wo Fehler jede darauf aufbauende Komponente beeinträchtigen können.
Google hat Argon-Agenten außerdem eingesetzt, um Leistungsdaten von Rechenzentren zu analysieren und Speicheroptimierungen zu identifizieren. Das Unternehmen sagt, die Änderungen sollen nach vollständiger Einführung mehr als 300 Tebibyte Speicher freisetzen, wobei die Gesamteinsparungen auf zwischen 500 Tebibyte und 1 Pebibyte geschätzt werden. Ein Pebibyte entspricht 1.024 Tebibyte.
Googles Quantencomputing-Forscher nutzen Argon ebenfalls zur Optimierung von Algorithmen. In einem Beispiel sagte das Unternehmen, Argon habe einen veröffentlichten Referenzwert für eine Quantencomputing-Aufgabe binnen Minuten um 40 % übertroffen.
Warum der Zugang gestaffelt erfolgt
Argons Cybersicherheitsfähigkeiten sind ein wesentlicher Grund für die gestaffelte Bereitstellung. Google sagt, das Modell kann Schwachstellen mit begrenzter menschlicher Beteiligung identifizieren und beheben, was sowohl defensiven Nutzen als auch potenzielle Sicherheitsrisiken schafft, je weiter solche Fähigkeiten verfügbar werden. Das Unternehmen stellt das Modell daher zunächst vertrauenswürdigen Cyber-Verteidigern über Fairwind zur Verfügung, während es Feedback sammelt und weiterhin Schutzmaßnahmen entwickelt.
Google sagte, Argon werde Entwicklern, Unternehmen und Verbrauchern schließlich zugänglich gemacht, sobald sich der Zugang ausweitet.
Preise
Google wird Argon zu einem Einführungspreis von 2 $ pro Million Eingabe-Token und 10 $ pro Million Ausgabe-Token starten. Nach der Einführungsphase steigt der Preis auf 4 $ pro Million Eingabe-Token und 20 $ pro Million Ausgabe-Token. Cache-Eingabe-Token, die dieselben Kontextdaten über mehrere Anfragen hinweg wiederverwenden, erhalten 95 % Rabatt auf den Preis für Eingabe-Token.
Der Launch erfolgt, während Google mit OpenAI und Anthropic um die Entwicklung immer leistungsfähigerer KI-Modelle für Programmierung, Cybersicherheit, Forschung und Unternehmensarbeit konkurriert. Vorerst sind jedoch Googles eigene Benchmarks die wichtigsten öffentlich verfügbaren Leistungsmessungen für Argon; der breitere Zugang wird es unabhängigen Nutzern und Forschern ermöglichen, das Modell über weitere Arbeitslasten hinweg zu testen.