NieuwsAandelenGoogle DeepMind onthult Gemini 3.8 Flash en 3.8 Flash Cyber voor agentische workflows en cybersecurity

Google DeepMind onthult Gemini 3.8 Flash en 3.8 Flash Cyber voor agentische workflows en cybersecurity

Auteur: Google DeepMind Blog·

Belangrijkste punten

  • Google DeepMind bracht Gemini 3.8 uit, zijn meest capabele model voor redeneren en code, drie weken na 3.7 Flash — de derde Flash-release in zes weken.
  • Gemini 3.8 Flash wordt aangeboden tegen een introductieprijs van $0,75 per miljoen invoertokens en $3,75 per miljoen uitvoertokens; de tarieven verdubbelen op 1 januari 2027.
  • Gemini 3.8 Flash Cyber bereikte frontier-niveau in kwetsbaarheidsontdekking op CyberGym en meer dan 70% slagingspercentage op Google's interne benchmark over 20 programmeertalen.
  • Het Chrome Security-team stelde vast dat Flash Cyber 2,6 keer meer correcte patches voor Chrome-kwetsbaarheden produceerde dan grotere commerciële modellen.
  • Flash Cyber is beperkt tot vertrouwde verdedigers via het nieuwe Fairwind Program, terwijl 3.8 Flash beschikbaar is via de Gemini API, Gemini Enterprise en Google AI Pro- en Ultra-abonnementen.
Google DeepMind onthult Gemini 3.8 Flash en 3.8 Flash Cyber voor agentische workflows en cybersecurity

Google DeepMind heeft Gemini 3.8 geïntroduceerd, tot nu toe zijn meest capabele model voor redeneren en code, slechts drie weken na 3.7 Flash en de derde Flash-release van het bedrijf in zes weken. Het versnelde tempo weerspiegelt de huidige snelheid van de frontier-modelmarkt, waarin Google, OpenAI en Anthropic opeenvolgende releases uitbrengen met tussenpozen van weken in plaats van kwartalen, en waarin modellen van de middelste "Flash"-klasse steeds meer de werkpaarden vormen van productie-AI-toepassingen. De lancering omvat twee varianten: Gemini 3.8 Flash, een algemeen inzetbaar werkpaard, en Gemini 3.8 Flash Cyber, een gespecialiseerd cybersecuritymodel dat via het nieuwe Fairwind Program beschikbaar is voor gecontroleerde verdedigers.

Volgens de aankondiging van Tulsee Doshi, Senior Director of Product Management, en Raluca Ada Popa, Gemini Security Lead bij Google DeepMind, worden beide releases aangedreven door dezelfde fundamentele intelligentie, versneld door langlopende agentische lussen die de onderliggende modellen recursief evalueren en verfijnen. De winst in codeervaardigheid en redeneervermogen binnen deze gedeelde kern voortgekomen uit verschillende innovaties, waaronder rigoureus trainen in het veeleisende domein van cybersecurity. De combinatie is opvallend omdat zij een techniek toepast — een moeilijk, verifieerbaar domein zoals security als trainingssignaal gebruiken — die ook elders in de industrie wordt gebruikt om algemeen redeneervermogen te verscherpen.

Gemini 3.8 Flash: gebouwd voor langlopende codeerwerk en autonome agents

Gemini 3.8 Flash levert aanzienlijke verbeteringen ten opzichte van 3.7 Flash op het gebied van software-engineering, agentische taken en meerstaps-redeneren in gespecialiseerde domeinen, en benadert daarmee vaak de prestaties van duurdere frontier-modellen. Het model is beschikbaar tegen dezelfde introductieprijs als 3.7 Flash: $0,75 per miljoen invoertokens en $3,75 per miljoen uitvoertokens. Deze introductieprijs vervalt op 31 december 2026; vanaf 1 januari 2027 gelden tarieven van $1,50 per miljoen invoertokens en $7,50 per miljoen uitvoertokens. Zelfs tegen het volledige tarief is het model aanzienlijk goedkoper dan gangbare frontier-modelcategorieën, wat de concurrentiedruk op de prijs per token onderstreept nu leveranciers strijden om agentische workloads die veel meer tokens verbruiken dan chat-achtige interacties.

Op DeepSWE v1.1 (Long-Horizon Software Engineering) presteert 3.8 Flash beter dan de meeste grotere frontier-modellen in het autonoom end-to-end oplossen van complexe engineeringproblemen, tegen een fractie van de kosten. Het model toont bovendien de betrouwbaarheid die nodig is voor kritieke bedrijfsexemene autonomie in gespecialiseerde kennisdomeinen. In kwantitatieve en professionele vakgebieden die geavanceerde analyse en rapportage vereisen, presteert 3.8 Flash beter dan 3.7 Flash en andere frontier-modellen op benchmarks zoals Vals Finance Agent V2 en Harvey's Legal Agent Benchmark. Het behaalt daarnaast 54,9% op HLE-Verified, wat het meerstaps-redeneervermogen in STEM, geesteswetenschappen en professionele vakgebieden aantoont.

Deze winst is het gevolg van een kernkeuze in het ontwerp: 3.8 Flash werkt harder. Bij complexe taken voert het model extra redeneerstappen uit en roept het iteratief tools aan, waarbij het soms meer tokens verbruikt om prestaties te maximaliseren, vooral op hogere inspanningsniveaus. Deze afweging tussen nauwkeurigheid en tokenverbruik is een centrale ontwerpvraag geworden voor agentische AI, aangezien autonome agents die veel stappen doorlopen de inferentiekosten kunnen vermenigvuldigen; de instelling van het inspanningsniveau geeft ontwikkelaars een hendel voor die afweging. Voor rekenkracht-beperkte toepassingen kunnen ontwikkelaars lagere inspanningsniveaus gebruiken om tokenoverhead te beperken, of blijven vertrouwen op Gemini 3.7 Flash, dat volledig ondersteund blijft voor efficiencygerichte workloads.

Google benadrukte verschillende demonstraties die met 3.8 Flash in Google Antigravity zijn gebouwd: een 3D-spel waarin een tovenaar door een kasteel navigeert, gemaakt met een eenvoudige looping-prompt, met puzzels, omgevingsverhalen en texturen gegenereerd met Nano Banana; een volledig speelbare DOS-versie van Google Maps met locaties, routebeschrijvingen en Street View; een topografische kaart van bekende geografische locaties met realtime doorsneden, 2D-projecties en wetenschappelijke toelichtingen op basis van echte datasets van de U.S. Geological Survey; en Hardware Anatomy, een interactieve 3D-visualisatie gebouwd in Google AI Studio die realistische Three.js-weergaven genereert van hardware-teardowns op ware schaal, met een schuifregelaar om apparaten in lagen uiteen te nemen en te inspecteren.

Gemini 3.8 Flash Cyber: expertprestaties op cybergebied

Gemini 3.8 Flash Cyber biedt verdedigers frontier-niveaucapaciteiten op het gebied van kwetsbaarheidsdetectie en geautomatiseerd patchen, geleverd tegen Flash-snelheid en -kosten om snelle iteratie mogelijk te maken. Het model verschijnt te midden van een bredere industriële beweging richting AI-ondersteunde beveiliging, aangezien aanvallen op de softwaretoeleveringsketen en ongepatchte kwetsbaarheden bij grote organisaties geautomatiseerde ontdekking en herstel tot een actief investeringsgebied binnen de security-industrie hebben gemaakt — terwijl er ook zorgen bestaan dat vergelijkbare capaciteiten, indien onbeperkt, aanvallers zouden kunnen helpen.

Autonome kwetsbaarheidsontdekking. Op CyberGym, de standaard industriële benchmark voor het vinden van kwetsbaarheden, toont 3.8 Flash Cyber frontier-niveauprestaties in autonome kwetsbaarheidsontdekking en overtreft het zowel 3.5 Flash Cyber als aanzienlijk grotere frontier-modellen. Om beter aan te sluiten bij praktische verdedigingsbehoeften buiten de C/C++-codebases die CyberGym dekt, evalueerde Google het model ook op een uitgebreide interne benchmark die kwetsbaarheidsontdekking vereist over complexe codebases in 20 programmeertalen, waar het een slagingspercentage van meer dan 70% behaalde — een aanzienlijke sprong ten opzichte van eerdere modellen.

Geautomatiseerd patchen. Google zei zich specifiek te richten op het uitrusten van verdedigers met expertise die hen een voordeel ten opzichte van aanvallers geeft, door vanaf het begin te investeren in het verhelpen van kwetsbaarheden en dit voorrang te geven boven offensieve capaciteiten zoals exploitatie. Op CWE-Bench, een uitdagende externe patch-benchmark die door Collinear wordt uitgevoerd, staat 3.8 Flash Cyber op de Pareto-frontier met een pass@1 van 47,2% tegenover 47,8% voor een toonaangevend frontier-model — tegen aanzienlijk lagere kosten.

Praktische impact. Google meldde het model 3.8 Flash Cyber al in te zetten om code binnen het bedrijf te beveiligen. Het Chrome Security-team constateerde dat het model 2,6 keer meer correcte patches voor Chrome-kwetsbaarheden produceerde dan veel grotere, beste commerciële modellen. Wiz stelde vast dat het 7,5–9,7% hogere recall behaalde op de interne penetrationtesting-benchmark tegen 2,3–5,2x lagere kosten in vergelijking met andere toonaangevende frontier-modellen. Het Cloud Vulnerability Research-team van Google gebruikte het model om een kritieke fundamentele kwetsbaarheid te vinden in minder dan twee uur — onderzoek en ontdekking waar het proces doorgaans maanden over doet. Validatie door derden van Wiz en de externe benchmark van Collinear biedt enige onafhankelijke ondersteuning van Google's claims naast zelfgerapporteerde interne evaluaties, hoewel gedetailleerde benchmarkmethodologieën door leveranciers worden gepubliceerd.

Gebouwd met veiligheid in gedachten

Gemini 3.8 Flash wordt geleverd met beschermingen tegen misbruik op het gebied van chemische, biologische, radiologische en nucleaire (CBRN) domeinen en cyberoffensieven, terwijl nuttige toepassingen mogelijk blijven, in lijn met Google's Frontier Safety Framework. 3.8 Flash Cyber heeft een ruimere set cybersecuritymitigaties en is daarom beperkt tot vertrouwde verdedigers die een meer uitgebreide set cybercapaciteiten nodig hebben. Deze benadering met beperkte toegang weerspiegelt een bredere discussie in de AI- en securitygemeenschappen over hoe krachtige offensieve cybercapaciteiten te distribueren — beperkt tot gecontroleerde verdedigers — zonder legitiem beveiligingsonderzoek te belemmeren. Google merkte tevens op dat de Gemini 3.8-modellen een aanzienlijke sprong hebben gemaakt in robuustheid tegen prompt-injectie, gemeten door Gray Swan, waardoor gebruikers van Gemini-modellen worden beschermd tegen kwaadaardige aanvallen via prompt-injectie; prompt-injectie blijft een van de meest genoemde beveiligingsrisico's voor agentische AI-systemen die onvertrouwde content lezen en namens een gebruiker acties ondernemen.

Beschikbaarheid

  • Ontwikkelaars: Bouw met 3.8 Flash en verken agent-first workflows in Google Antigravity, of begin vandaag met bouwen in de Gemini API via Google AI Studio en Android Studio, of genereer UI's in Stitch. Documentatie voor ontwikkelaars is beschikbaar via Google's ontwikkelaarsdocumentatie.
  • Bedrijven: Gebruik 3.8 Flash in Gemini Enterprise.
  • Consumenten: 3.8 Flash is beschikbaar voor Google AI Pro- en Ultra-abonnees in de Gemini-app, AI Mode in Google Search en Gemini in Google Sheets.
  • Cyber: Via het nieuwe Fairwind Program krijgen vertrouwde overheidsinstanties, beheerders van kritieke infrastructuur en softwareonderhouders prioritaire toegang tot Gemini 3.8 Flash Cyber. Organisaties kunnen toegang aanvragen.

Bron: Google DeepMind Blog