Google stellt Gemini 4 Argon vor, ein KI-Modell zur Aufspürung von Softwarefehlern
Wichtige Erkenntnisse
- •Gemini 4 Argon, vorgestellt am 30. September 2026, ist das erste Modell in Googles Gemini-4-Serie und darauf ausgelegt, Software-Sicherheitslücken autonom aufzudecken, zu validieren und zu patchen.
- •Das Modell erzielte 77,9 % auf DeepSWE v1.1 und liegt damit vor OpenA GPT-6 Astra mit 74,1 % und Anthropics Claude Opus 5.5 mit 74,2 % bei realen Softwareentwicklungsaufgaben.
- •Argon erreichte einen Topwert von 68 % im Vulnerability-Remediation-Teil von CWE-bench v1, einem Benchmark auf Basis von MITREs Common Weakness Enumeration.
- •Google berichtete, das Modell habe bei der Migration von über 800.000 Zeilen Zircon-Kernel-Code im Fuchsia OS zu Rust geholfen und 300 TiB Arbeitsspeicher in den Rechenzentren eingespart.
- •Der Zugang ist derzeit auf Googles Fairwind Program beschränkt, dem über 650 geprüfte Cyber-Defense-Organisationen wie CrowdStrike und Palo Alto Networks angehören; eine breitere Verfügbarkeit für zahlende API-Kunden und Google AI Ultra Abonnenten hat kein angekündigtes Datum.

Google hat Gemini 4 Argon vorgestellt, das erste Modell seiner Gemini-4-Serie, das mit Fokus auf defensive Cybersicherheit entwickelt wurde. Nach Angaben des Unternehmens kann das Modell Software-Sicherheitslücken autonom aufdecken, validieren und patchen. Da es den gesamten Lebenszyklus einer Schwachstelle – Aufdecken, Validieren und Patchen – abdeckt, steht bei der Ankündigung die Sanierung im Mittelpunkt, jene Phase, in der Sicherheitsteams häufig Rückstände bekannter Schwachstellen ansammeln.
Die Ankündigung erfolgte am 30. September 2026. Während die Sicherheit der Hauptanwendungsfall ist, positioniert Google Argon auch für langwierige, komplexe Workflows in der Softwareentwicklung sowie in wissensintensiven Bereichen wie Recht und Finanzen.
Benchmark-Leistung
Argons auffälligste Spezifikation ist die Ausgabekapazität: Das Modell kann bis zu 1 Million Tokens in einer einzigen Antwort erzeugen, ein deutlicher Anstieg gegenüber dem 64K-Token-Ausgabelimit früherer Modelle. Diese Kapazität ist auf große, kontinuierliche Workloads ausgelegt, sodass eine gesamte Migration oder ein Review-Zyklus in einem Durchgang erstellt werden kann, statt aus vielen kleineren Antworten zusammen gesetzt zu werden.
Auf DeepSWE v1.1, einem Benchmark rund um reale Softwareentwicklungsaufgaben, erzielte Argon 77,9 %. Damit liegt es vor OpenAIs GPT-6 Astra mit 74,1 % und Anthropics Claude Opus 5.5 mit 74,2 % im selben Test, wobei alle drei Frontierabore nun Seite an Seite an realer Entwicklungsarbeit gemessen werden.
Bei der Sicherheit betont Google seinen Vorsprung. Argon erreichte einen Topwert von 68 % im Vulnerability-Remediation-Teil von CWE-bench v1, einem Benchmark zur Behebung bekannter Kategorien von Softwareschwächen. CWE steht für die Common Weakness Enumeration, die von MITRE gepflegte Standardtaxonomie von Softwareschwachstellen-Kategorien, die dem Wert einen herstellerübergreifenden Referenzpunkt gibt.
Google hat zudem interne Ergebnisse offengelegt. Das Modell half dabei, mehr als 800.000 Codezeilen im Zircon-Kernel, Teil des Fuchsia OS, zu Rust zu migrieren. Dieser Aufwand sparte 300 TiB Arbeitsspeicher in Googles Rechenzentren. Rust ist eine speichersichere Systemsprache, und solche Kernel-Rewrites sind Teil eines branchenweiten Bestrebens, Speichersicherheits-Schwachstellen auf Sprachebene zu beseitigen.
Verfügbarkeit und Preise
Argon ist noch nicht breit verfügbar. Derzeit ist es über Googles Fairwind Program zugänglich, dem mehr als 650 geprüfte Cyber-Defense-Organisationen sowie interne Google-Teams angehören. Zu den Teilnehmern zählen die Sicherheitsunternehmen CrowdStrike und Palo Alto Networks. Wiz, einer der frühen Anwender, nutzte das Modell, um erhebliche Schwachstellen in weit verbreiteter Healthcare-Software aufzudecken. Bis der Zugang erweitert wird, beurteilen die meisten Entwickler Argon anhand der von Google und Programmiteilnehmern berichteten Ergebnisse, da die bisher veröffentlichten Benchmark-Werte selbst berichtet sind.
Eine breitere Verfügbarkeit wird für zahlende API-Kunden und Abonnenten von Google AI Ultra erwartet, wobei Google diese Ausweitung im bisher veröffentlichten Material nicht an ein konkretes Datum gebunden hat. Da Argon das erste Modell der Gemini-4-Serie ist, sind das Timing des breiteren Zugangs und von Folgereleases der Familie die unmittelbaren Punkte, die es zu beobachten gilt.
Beim Pricing startet Argon zu einem Einführungstarif von 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens. Laut veröffentlichter Roadmap können diese Sätze auf jeweils 4 $ und 20 $ steigen – ein definierter Eskalationspfad, der potenziellen Kunden das Einführungsfenster zur Evaluierung des Modells verschafft, bevor die vollen Tarife gelten.