NachrichtenAktienGoogle DeepMind stellt Gemini 4 Argon vor: sein KI-Frontier-Modell der nächsten Generation

Google DeepMind stellt Gemini 4 Argon vor: sein KI-Frontier-Modell der nächsten Generation

Autor: Google DeepMind Blog·

Wichtige Erkenntnisse

  • •Gemini 4 Argon erzielt Spitzenwerte bei Benchmarks über verschiedene Domänen hinweg: 77,9 % bei DeepSWE v1.1 für langfristige Software-Engineering-Aufgaben, 51,3 % bei Zapiers AutomationBench und 91,7 % bei LVBench für das Verständnis langer Videos.
  • •Die Ausgabe-Token-Grenze des Modells wurde auf branchenführende 1 Million Token erweitert, rund das Fünfzehnfache der bisherigen 64.000, was laut Google die Lösung schwieriger Probleme in einem Durchgang ermöglicht.
  • •Argon kann kritische Schwachstellen autonom entdecken, validieren und patchen; über Wiz' Scan for Good-Initiative deckte es eine kritische Schwachstelle auf, die sensible personenbezogene Daten in Healthcare-Software preisgab, die von Krankenhäusern weltweit genutzt wird und die frühere Frontier-Modelle übersehen hatten.
  • •Die Verfügbarkeit erfolgt gestaffelt: Vertrauenswürdige Cyber-Defender erhalten zunächst über das Fairwind-Programm Zugang ohne Cyber-Guardrails, während Entwickler, Unternehmen und Verbraucher später folgen, beginnend mit zahlenden API-Kunden und Google AI Ultra-Abonnenten.
  • •Innerhalb von Google übertrafen Argon-Agenten eine veröffentlichte Quantenalgorithmus-Baseline um 40 %, gaben über 300 TiB Rechenzentrumsspeicher frei und migrieren große C/C++-Codebasen zu Rust, darunter über 800.000 Zeilen des Fuchsia OS Zircon-Kernels.
Google DeepMind stellt Gemini 4 Argon vor: sein KI-Frontier-Modell der nächsten Generation

Google DeepMind gab am 30. September 2026 Gemini 4 Argon bekannt, ein neues Frontier-KI-Modell, das tiefes reasoning über komplexe, langfristige professionelle Workflows hinweg aufrechterhalten soll. Das Unternehmen erklärte, das Modell liefere Frontier-Leistung in praxisnaher Softwareentwicklung, Wissensarbeit im Unternehmensbereich wie Jura und Finanzen sowie in der Cyber-Abwehr, und es wird zunächst an eine Gruppe vertrauenswürdiger Cyber-Defender über Googles Fairwind Program ausgerollt.

Koray Kavukcuoglu, SVP von Google DeepMind und Chief AI Architect bei Google, kündigte das Modell in einem Blogbeitrag an und schrieb, Argon verändere "fundamental die Art, wie wir bei Google arbeiten und entwickeln". Das Unternehmen hob die branchenführende Grenze von 1 Million Token für tiefes, mehrstufiges Problemlösen hervor sowie Stärken in Programmierung, Finanzrecherche, juristischem Formulieren und autonomem Patchen von Sicherheitsschwachstellen.

Gestaffelte Einführung und Preise

Google erklärte, die sichere Freigabe von Frontier-Fähigkeiten auf diesem Niveau erfordere einen gestaffelten Ansatz. Das Unternehmen nimmt aktiv am freiwilligen Prozess der US-Regierung für den Modellzugang vor der Freigabe teil, während es die Verfügbarkeitrittweise ausweitet, und es wird weiterhin Feedback von frühen Testern einholen, während es an Schutzmaßnahmen feilt, bevor Argon für Entwickler, Unternehmen und Verbraucher verfügbar wird. Der anfängliche Zugangsplan bedeutet, dass die von Google beschriebenen Fähigkeiten und Schutzmaßnahmen zunächst in kontrollierten Umgebungen evaluiert werden, statt sofort dem breiteren Markt angeboten zu werden.

Argon wird zu einem Einführungspreis von 2 USD pro Million Eingabe-Token und 10 USD pro Million Ausgabe-Token starten, wobei zwischengespeicherte Eingabe-Token 95 % unter dem Eingabe-Token-Preis liegen. Nach Ablauf der Einführungsphase gelten Preise von 4 USD pro 1 Million Eingabe-Token und 20 USD pro 1 Million Ausgabe-Token. Die breitere Einführung beginnt mit zahlenden API-Kunden und Google AI Ultra-Abonnenten.

Wie Google arbeitet und entwickelt

Gemini 4 Argon treibt bereits interne Workflows bei Google an, wobei Tausende von Googlern die Stärken des Modells bei spezialisierten Programmieraufgaben, tieferer Recherche und Schreibqualität hervorheben. Google sagte, das Modell helfe Teams, schneller zu entwickeln, die Grenzen der Engineering-Produktivität auszuloten und Durchbrüche zu beschleunigen. Zu den im Beitrag genannten Beispielen gehören:

  • Quantenalgorithmische Optimierung: Argon hilft Googles Quantencomputing-Forschern, die Raum-Zeit-Ressourcen (Qubits × Gates) von Unterprogrammen zu optimieren, die wichtige Anwendungen ausbremsen. In einem Beispiel übertraf es den veröffentlichten Baseline in wenigen Minuten um 40 %.
  • Speichereffizienz: Ein Team von Argon-Agenten analysierte fleet-weite Profiling-Telemetrie, um autonom Speicheroptimierungen in Googles Rechenzentren zu identifizieren und anzuwenden, wodurch nach dem Rollout über 300 TiB Speicher freigesetzt wurden, mit geschätzten Gesamteinsparungen von 500 TiB bis 1 PiB.
  • Großskalige Codebase-Migrationen und -Optimierungen: Argon-Agenten arbeiten an der Migration von C/C++-Codebasen zu Rust bei Google – von Zehntausenden Zeilen in Kernbibliotheken wie re2 und libgav1 bis zu über 800.000 Zeilen für den Zircon-Kernel von Fuchsia OS. Angesichts der Kritikalität vieler dieser Systeme durchlaufen die großskaligen Neuschreibungen strenge automatisierte und manuelle Audits, Emulationstests und Reviews, bevor sie in Produktion gehen. Für libgav1, Googles Open-Source-Software zum Dekodieren von Video, nahmen Argon-Agenten einen bestehenden Rust-Port und ersetzten 32.000 Zeilen SIMD-Code durch viele Runden profilgeführter Experimente, die Untersuchung der Compiler-Ausgabe und die Erzeugung von safe Rust, damit der Compiler es automatisch vektorisiert. Das Ergebnis ist ein speichersicherer Video-Decoder, der 2,7-mal schneller läuft als der RustPort, mit identischer Videoausgabe, was ihn näher an die optimierte C++-Implementierung heranbringt.

Eine Ausgabe-Grenze von 1 Million Token

Um die Fähigkeiten von Gemini 4 Argon bei längeren, komplexeren Anwendungsfällen zu unterstützen, erweitert Google die Ausgabe-Token-Grenze des Modells auf branchenführende 1 Million Token, zuvor waren es 64.000 Token. Laut dem Unternehmen entsteht, wenn das Modell den Spielraum hat, tief zu denken und Hunderttausende Token in einer einzigen Sequenz zu generieren, eine neue Ebene der reasoning-Tiefe, mit der schwierige Probleme in einem Durchgang gelöst werden können.

Programmier- und Enterprise-Workflows über Domänen hinweg

Google sagte, die Fähigkeiten von Gemini 4 Argon in Programmierung, reasoning und Multimodalität sowie seine Fähigkeit, lange, mehrstufige Aufgaben durchzuhalten, ermöglichten ihm, in einer Reihe von Enterprise-Workflows zu glänzen. Google-Ingenieure nutzen das Modell für tägliche Aufgaben, vom alltäglichen Debugging bis zu großskaligen Codebase-Migrationen und Algorithmendesign. Argon setzt einen neuen Stand der Technik bei DeepSWE v1.1, das die Leistung eines Modells in praxisnahen, langfristigen Software-Engineering-Aufgaben misst, mit einem Wert von 77,9 %.

Jenseits der Programmierung ist Argon laut Google das führende Modell im Vals Index, der die wirtschaftliche Wirkung in Finanz-, Programmier-, Rechts- und Steuerarbeit misst, wobei jeder Sektor nach seinem Beitrag zum US-BIP gewichtet wird. Das Unternehmen berichtete von ähnlich führender Leistung bei domänenspezifischen Evaluierungen wie Vals Finance Agent v2, das mehrstufige Finanzrecherche testet, und Harveys Legal Agent Benchmark, der juristische Recherche und Abfassung abdeckt. Bei AutomationBench, Zapiers Benchmark für die End-to-End-Ausführung zentraler Geschäftsfunktionen, belegt Argon den ersten Platz mit einem Wert von 51,3 %.

Argon ist laut Google auch stark, wenn Wissensarbeit visuelles Verständnis erfordert. Das Modell kann professionelle Chartanalyse durchführen, Details aus langen Videos identifizieren und auf Grundlage einer Reihe von Dokumenten handeln. Bei LVBench, das das Verständnis langer Videos misst, sei Argon mit einem Wert von 91,7 % Stand der Technik.

Führend in defensiver Cybersicherheit

Google sagte, es habe Gemini Argon trainiert, um in der Cybersicherheit-Abwehr hochgradig leistungsfähig zu sein und Cyber-Defender besser für eine neue Ära der Cyberangriffe zu rüsten. Das Modell kann kritische Software-Schwachstellen autonom finden, validieren und patchen. Für vertrauenswürdige Defender und Googles eigene interne Teams wird das Unternehmen Argon ohne Cyber-Guardrails veröffentlichen, damit diese seine vollen Frontier-Fähigkeiten in der Cyber-Abwehr nutzen können.

Das Sicherheitsunternehmen Wiz nutzt Argon bereits für die Cybersicherheit-Abwehr über seine Initiative Scan for Good, ein Programm zur kostenlosen Schutz kritischer öffentlicher Infrastruktur durch das Auffinden und Beheben hochriskanter Schwachstellen. In einer frühen Demonstration der Wirkung des Modells habe Argon, so Google, eine kritische Schwachstelle aufgedeckt, die personenbezogene Daten in Healthcare-Software exponierte, die von Krankenhäusern weltweit genutzt wird, und dabei ein schwerwiegendes Risiko identifiziert, das frühere Frontier-Modelle übersehen hatten.

Bei CWE-bench v1, das die Fähigkeit eines Modells zur Behebung von Sicherheitsschwachstellen bewertet, teilt sich Argon mit einem Spitzenwert von 68 % den ersten Platz und baut damit auf der Frontier-Leistung von 3.8 Flash Cyber bei CWE-bench v0 auf.

Google sagte, Gemini 4 Argon zeige beeindruckende Sprünge bei der Schwachstellenerkennung gegenüber 3.8 Flash Cyber:

  • Auf Googles internem umfassenden Schwachstellen-Benchmark deckte Argon ein breites Spektrum an Expositionen in komplexen Codebasen in 20 Programmiersprachen auf.
  • Auf Wiz' internem Black-Box-Penetrationstest-Benchmark, der die Fähigkeit eines Modells testet, Live-Websysteme ohne Quellcode zu analysieren, übertrifft Argon 3.8 Flash Cyber beim Aufdecken der Angriffsfläche, dem Identifizieren von Schwachstellen und der Erstellung von Proof-of-Concept-Nachweisen zu deren Validierung.

Verstärkung der Frontier-Schutzmaßnahmen

Vor der breiten Einführung von Gemini 4 Argon verstärkt Google nach eigenen Angaben kritische Frontier-Schutzmaßnahmen in vier Hauptbereichen:

  • Schutz vor Missbrauch: Um zu verhindern, dass böswillige Akteure Argon für Cyber- oder chemische, biologische, radiologische und nukleare (CBRN)-Angriffe nutzen, ist das Modell darauf ausgelegt, schädliche Anfragen abzulehnen, während legitime, dual-use wissenschaftliche Forschung erhalten bleibt, gemäß Googles DeepMind Frontier Safety Framework. Das Unternehmen stärkt die Robustheit seiner Schutzmaßnahmen für diese Einführung, einschließlich verbesserter Techniken zur Überwachung der internen Aktivierungen des Modells, um Missbrauch zu erkennen. Diese Schutzmaßnahmen wurden von internen und externen Red Teams mittels einer Kombination manueller und automatisierter Angriffsmethoden auf Robustheit getestet.
  • Schutz vor Prompt-Injection-Angriffen: Google beschrieb Argon als sein bislang widerstandsfähigstes Modell gegen indirekte Prompt-Injections, bei denen bösartige Anweisungen oder Kontexte verwendet werden, um das Verhalten eines Modells zu kapern. Das Unternehmen sagte, dies seien komplexe Angriffe, die ständige Wachsamkeit und mehrere Verteidigungsebenen erfordern. Durch automatisiertes Red Teaming und adversariales Training führt Gemini 4 Argon laut Google bei der Robustheit gegenüber Prompt-Injections auf Gray Swans Indirect Prompt Injection (IPI)-Benchmark.
  • Überwachung auf Fehlausrichtung: Um zu verhindern, dass Argon bei der Erfüllung einer Aufgabe die Grenzen überschreitet und über die Absichten des Nutzers hinausgeht, setzt Google Gegenmaßnahmen gegen Fehlausrichtung ein, die die Chain-of-Thought und die Aktionen des Modells überwachen und bei Bedarf die Ausführung stoppen. Das Unternehmen nutzte ein ähnliches System, um seine Trainingsläufe zu überwachen Warnungen an ein eigenes Incident-Response-Team zu senden, wobei sorgfältige Vorsichtsmaßnahmen getroffen wurden, um die Erkenntnisse nicht ins Training zurückzuspeisen, damit Argons reasoning nicht darauf abgerichtet wird, die Überwachung zu umgehen. Google rief die übrige Branche nachdrücklich dazu auf, die Transparenz des reasoning zu bewahren, "in diesen entscheidenden Momenten gesteigerter Fähigkeiten beim Umgang mit Alignment-Risiken", damit Modellgedanken weiterhin hilfreich beim Identifizieren und Diagnostizieren von Fehlausrichtung bleiben.
  • Systemhärtung: Da Frontier-Modelle immer leistungsfähiger werden, erfordere ihre sichere Testung geschützte Umgebungen, die mit den Systemen selbst Schritt halten können. Im Einklang mit seiner Agent Control Roadmap härtet das Unternehmen seine Sandbox-Umgebungen, indem es sie isoliert und versiegelt, bevor hochriskantes Training oder Evaluierungen beginnen. Google verpflichtete sich zudem, diese Sicherheits-Best-Practices für Agenten mit Partnern zu teilen, um die Sicherheit im gesamten Ökosystem zu verbessern.

Baldige Einführung

Google sagte, es habe Gemini 4 Argon mit Frontier-Fähigkeiten in Programmierung, Wissensarbeit, Cyber-Abwehr und kreativem Schreiben gebaut, um Entwickler, Profis und Unternehmen als Partner bei der Bewältigung ihrer schwierigsten Probleme zu begleiten. Das Unternehmen dankte der ersten Gruppe von Cyber-Defendern und vertrauenswürdigen Testern, deren Praxis-Evaluierungen und Feedback helfen werden, seine Systeme vor der Freigabe an Entwickler, Unternehmen und Verbraucher zu stärken, beginnend mit zahlenden API-Kunden und Google AI Ultra-Abonnenten.

Über den Autor: Koray Kavukcuoglu ist einer der weltweit führenden Experten für künstliche Intelligenz. Als SVP von Google DeepMind leitet er die Entwicklung der modernsten generativen KI-Modelle von Google DeepMind und deren Integration in Googles Produkte im großen Maßstab. Vor seiner aktuellen Rolle war er VP of Research bei Google DeepMind, wo er das Deep-Learning-Team gründete, das bedeutende Forschungsdurchbrüche wie DQN (Deep Q-Network) und WaveNet vorantrieb.