NachrichtenAktienGoogle DeepMind stellt Gemini 3.8 Flash und 3.8 Flash Cyber für agentische Workflows und Cybersicherheit vor

Google DeepMind stellt Gemini 3.8 Flash und 3.8 Flash Cyber für agentische Workflows und Cybersicherheit vor

Autor: Google DeepMind Blog·

Wichtige Erkenntnisse

  • Google DeepMind hat Gemini 3.8 veröffentlicht, sein leistungsfähigstes Modell für Reasoning und Coding, drei Wochen nach 3.7 Flash – die dritte Flash-Veröffentlichung innerhalb von sechs Wochen.
  • Gemini 3.8 Flash wird zum Einführungspreis von 0,75 USD pro Million Eingabe-Tokens und 3,75 USD pro Million Ausgabe-Tokens angeboten; die Preise verdoppeln sich zum 1. Januar 2027.
  • Gemini 3.8 Flash Cyber erreichte Frontier-Niveau bei der Schwachstellenerkennung in CyberGym und über 70 % Erfolg in Googles internem Benchmark über 20 Programmiersprachen.
  • Das Chrome-Sicherheitsteam stellte fest, dass Flash Cyber 2,6-mal mehr korrekte Patches für Chrome-Schwachstellen erzeugte als größere kommerzielle Modelle.
  • Flash Cyber ist über das neue Fairwind-Programm vertrauenswürdigen Verteidigern vorbehalten, während 3.8 Flash über die Gemini API, Gemini Enterprise sowie Google AI Pro- und Ultra-Abos verfügbar ist.
Google DeepMind stellt Gemini 3.8 Flash und 3.8 Flash Cyber für agentische Workflows und Cybersicherheit vor

Google DeepMind hat Gemini 3.8 vorgestellt, sein bisher leistungsfähigstes Modell für Reasoning und Coding, das nur drei Wochen nach 3.7 Flash erscheint und bereits die dritte Flash-Veröffentlichung des Unternehmens innerhalb von sechs Wochen darstellt. Das beschleunigte Veröffentlichungstempo spiegelt die aktuelle Dynamik des Frontier-Modell-Markts wider, in dem Google, OpenAI und Anthropic aufeinanderfolgende Veröffentlichungen in Abständen von Wochen statt Quartalen ausliefern und mittlere Modelle der „Flash“-Klasse zunehmend die Arbeitstiere produktiver KI-Anwendungen sind. Der Launch umfasst zwei Varianten: Gemini 3.8 Flash, ein vielseitig einsetzbares Arbeitsmodell, und Gemini 3.8 Flash Cyber, ein spezialisiertes Cybersicherheitsmodell, das geprüften Verteidigern über das neue Fairwind-Programm zur Verfügung steht.

Gemäß der Ankündigung von Tulsee Doshi, Senior Director of Product Management, und Raluca Ada Popa, Gemini Security Lead bei Google DeepMind, basieren beide Veröffentlichungen auf derselben fundamentalen Intelligenz, beschleunigt durch langlaufende agentische Schleifen, die die zugrunde liegenden Modelle rekursiv evaluieren und verfeinern. Die Fortschritte bei Coding und Reasoning über diesen gemeinsamen Kern wurden durch mehrere Innovationen erreicht, darunter ein rigoroses Training im anspruchsvollen Bereich der Cybersicherheit. Bemerkenswert an dieser Kombination ist eine Methode – die Nutzung einer schwierigen, überprüfbaren Domäne wie Sicherheit als Trainingssignal –, die auch anderswo in der Branche eingesetzt wird, um das allgemeine Modell-Reasoning zu schärfen.

Gemini 3.8 Flash: gebaut für langfristige Programmierung und autonome Agenten

Gemini 3.8 Flash bietet deutliche Verbesserungen gegenüber 3.7 Flash in den Bereichen Software Engineering, agentische Aufgaben und mehrstufiges Reasoning in spezialisierten Domänen und erreicht häufig die Leistung teurerer Frontier-Modelle. Es ist zum gleichen Einführungspreis wie 3.7 Flash erhältlich: 0,75 USD pro Million Eingabe-Tokens und 3,75 USD pro Million Ausgabe-Tokens. Dieser Einführungspreis läuft am 31. Dezember 2026 aus; ab dem 1. Januar 2027 gelten 1,50 USD pro Million Eingabe-Tokens und 7,50 USD pro Million Ausgabe-Tokens. Selbst zum vollen Preis liegt das Modell deutlich unter typischen Frontier-Preisklassen, was den Wettbewerbsdruck auf die Token-Preisgestaltung unterstreicht, da Anbieter um agentische Workloads konkurrieren, die weit mehr Tokens verbrauchen als Chat-Interaktionen.

Bei DeepSWE v1.1 (Long-Horizon Software Engineering) übertrifft 3.8 Flash die meisten größeren Frontier-Modelle beim autonomen, durchgängigen Lösen komplexer Engineering-Probleme – bei einem Bruchteil der Kosten. Das Modell zeigt zudem die Zuverlässigkeit, die für unternehmenskritische Autonomie in spezialisierten Wissensdomänen erforderlich ist. In quantitativen und professionellen Bereichen, die fortgeschrittene Analysen und Berichte erfordern, übertrifft 3.8 Flash sowohl 3.7 Flash als auch andere Frontier-Modelle in Benchmarks wie Vals Finance Agent V2 und Harveys Legal Agent Benchmark. Zudem erreicht es 54,9 % bei HLE-Verified, was mehrstufige Reasoning-Fähigkeiten in MINT-Fächern, Geisteswissenschaften und Berufsfeldern belegt.

Diese Fortschritte beruhen auf einer zentralen Designentscheidung: 3.8 Flash arbeitet intensiver. Bei komplexen Aufgaben führt das Modell zusätzliche Reasoning-Schritte aus und ruft iterativ Werkzeuge auf, wobei es manchmal mehr Tokens verbraucht, um die Leistung zu maximieren – insbesondere bei höheren Anstrengungsstufen. Dieser Zielkonflikt zwischen Genauigkeit und Token-Verbrauch ist zu einer zentralen Designfrage für agentische KI geworden, da autonome Agenten mit vielen Schleifendurchläufen die Inferenzkosten vervielfachen können; die Steuerung der Anstrengungsstufe gibt Entwicklern einen Hebel für diesen Trade-off. Für rechenlimitierte Anwendungen können Entwickler niedrigere Anstrengungsstufen nutzen, um den Token-Overhead zu reduzieren, oder weiterhin auf Gemini 3.7 Flash setzen, das für effizienzorientierte Workloads vollständig unterstützt wird.

Google präsentierte mehrere Demonstrationen, die mit 3.8 Flash in Google Antigravity erstellt wurden: ein 3D-Spiel, in dem ein Zauberer ein Schloss erkundet, entstanden aus einem einfachen Prompt mit Schleifenanweisung, mit Rätseln, atmosphärischem Storytelling und von Nano Banana generierten Texturen; eine voll spielbare DOS-Version von Google Maps mit Orten, Routen und Street View; eine topografische Karte berühmter geografischer Stätten mit Echtzeit-Querschnitten, 2D-Projektionen und wissenschaftlichen Erläuterungen auf Basis echter Datensätze des U.S. Geological Survey; sowie Hardware Anatomy, ein interaktiver 3D-Visualisierer, der in Google AI Studio erstellt wurde und realistische Three.js-Darstellungen maßstabsgetreuer Hardware-Zerlegungen mit einem Explosions-Slider für einzelne Ebenen erzeugt.

Gemini 3.8 Flash Cyber: Expertenniveau in Cybersicherheit

Gemini 3.8 Flash Cyber verleiht Verteidigern Frontier-Fähigkeiten bei der Schwachstellenerkennung und automatisierten Patch-Erstellung – geliefert mit der Geschwindigkeit und zu den Kosten der Flash-Klasse, um schnelle Iterationen zu ermöglichen. Es erscheint im Kontext eines breiteren Branchentrends hin zu KI-gestützter Sicherheit, da Angriffe auf Software-Lieferketten und ungepatchte Schwachstellen in großen Organisationen automatisierte Erkennung und Behebung zu einem aktiven Investitionsfeld der Sicherheitsbranche gemacht haben – während gleichzeitig Befürchtungen bestehen, dass vergleichbare Fähigkeiten ohne Einschränkungen auch Angreifern nützen könnten.

Autonome Schwachstellenerkennung. Bei CyberGym, dem branchenüblichen Benchmark für die Schwachstellenfindung, demonstriert 3.8 Flash Cyber autonome Schwachstellenerkennung auf Frontier-Niveau und übertrifft sowohl 3.5 Flash Cyber als auch deutlich größere Frontier-Modelle. Um den realen Verteidigungsanforderungen jenseits der von CyberGym abgedeckten C/C++-Codebasen besser gerecht zu werden, evaluierte Google das Modell zudem anhand eines umfassenden internen Benchmarks, der die Erkennung einer Vielzahl von Schwachstellen in komplexen Codebasen über 20 Programmiersprachen erfordert; dort erreichte es eine Erfolgsquote von über 70 % – ein erheblicher Sprung gegenüber früheren Modellen.

Automatisierte Patch-Erstellung. Google gab an, sich darauf konzentriert zu haben, Verteidiger mit Expertenfähigkeiten auszustatten, die sie gegenüber Angreifern begünstigen, von Beginn an in die Behebung von Schwachstellen investiert und dies gegenüber offensiven Fähigkeiten wie der Ausnutzung von Schwachstellen priorisiert zu haben. Bei CWE-Bench, einem anspruchsvollen externen Benchmark für Patch-Fähigkeiten, der von Collinear betrieben wird, liegt 3.8 Flash Cyber auf der Pareto-Front: mit einem pass@1 von 47,2 % gegenüber 47,8 % eines führenden Frontier-Modells – bei deutlich geringeren Kosten.

Praxiswirkung. Google berichtete, 3.8 Flash Cyber bereits unternehmensweit zur Absicherung von Code einzusetzen. Das Chrome-Sicherheitsteam stellte fest, dass das Modell 2,6-mal mehr korrekte Patches für Chrome-Schwachstellen erzeugte als deutlich größere, beste kommerzielle Modelle. Wiz stellte fest, dass es bei seinem internen Penetrationstest-Benchmark eine um 7,5–9,7 % höhere Trefferquote bei 2,3–5,2-fach niedrigeren Kosten im Vergleich zu anderen führenden Frontier-Modellen erreichte. Das Cloud Vulnerability Research Team von Google nutzte das Modell, um in weniger als zwei Stunden eine kritische grundlegende Schwachstelle zu finden – ein Prozess, für den Forschung und Entdeckung üblicherweise Monate dauern. Die Validierung durch Dritte wie Wiz und Collinears externen Benchmark liefert eine gewisse unabhängige Bestätigung der Google-Angaben über hinausgehend selbstberichteter interner Evaluationen, wobei detaillierte Benchmark-Methodiken von den Anbietern selbst veröffentlicht werden.

Mit Sicherheit im Blick gebaut

Gemini 3.8 Flash wird mit Schutzmaßnahmen gegen Missbrauch in den Bereichen Chemie, Biologie, Radiologie und Nukleares (CBRN) sowie gegen Cyber-Offensive ausgeliefert, während nützliche Anwendungsfälle im Einklang mit Googles Frontier Safety Framework ermöglicht werden. 3.8 Flash Cyber trägt einen permissiveren Satz von Cybersicherheits-Mitigationen und ist entsprechend nur vertrauenswürdigen Verteidigern vorbehalten, die ein umfassenderes Set an Cyber-Fähigkeiten benötigen. Dieser Zugangsbeschränkungsansatz spiegelt eine breitere Debatte in den KI- und Sicherheitsgemeinschaften darüber wider, wie mächtige offensive Cyber-Fähigkeiten verteilt werden sollten – begrenzt auf geprüfte Verteidiger –, ohne legitime Sicherheitsforschung zu behindern. Google wies zudem darauf hin, dass die Gemini-3.8-Modelle laut Messung durch Gray Swan einen bedeutenden Sprung bei der Robustheit gegen Prompt-Injection gemacht haben und Nutzer so vor bösartigen Prompt-Injection-Angriffen schützen; Prompt-Injection gilt als eines der am häufigsten genannten Sicherheitsrisiken für agentische KI-Systeme, die nicht vertrauenswürdige Inhalte lesen und im Auftrag von Nutzern handeln.

Verfügbarkeit

  • Entwickler: Bauen Sie mit 3.8 Flash und erkunden Sie agentenorientierte Workflows in Google Antigravity oder beginnen Sie direkt in der Gemini API über Google AI Studio und Android Studio, oder erstellen Sie UIs in Stitch. Die Entwicklerdokumentation ist über Googles Entwicklerdokumente verfügbar.
  • Unternehmen: Zugriff auf 3.8 Flash in Gemini Enterprise.
  • Verbraucher: 3.8 Flash ist für Google AI Pro- und Ultra-Abonnenten in der Gemini-App, im KI-Modus der Google-Suche und in Gemini in Google Sheets verfügbar.
  • Cyber: Über das neue Fairwind-Programm erhalten vertrauenswürdige Regierungsbehörden, Betreiber kritischer Infrastruktur und Software-Betreuer bevorzugten Zugang zu Gemini 3.8 Flash Cyber. Organisationen können Zugang beantragen.

Quelle: Google DeepMind Blog