NieuwsAandelenGoogle DeepMind onthult Gemini 4 Argon, zijn next-generation frontier AI-model

Google DeepMind onthult Gemini 4 Argon, zijn next-generation frontier AI-model

Auteur: Google DeepMind Blog·

Belangrijkste punten

  • •Gemini 4 Argon behaalt state-of-the-art benchmarkresultaten in meerdere domeinen, met 77,9% op DeepSWE v1.1 voor langlopende software-engineering, 51,3% op Zapier's AutomationBench en 91,7% op LVBench voor begrip van lange video's.
  • •De outputtokenlimiet van het model is uitgebreid tot een toonaangevende 1 miljoen tokens, ruim vijftien keer de eerdere 64.000, waarmee volgens Google moeilijke problemen in één keer oplosbaar zijn.
  • •Argon kan autonoom kritieke kwetsbaarheden ontdekken, valideren en patchen, en legde via Wiz's Scan for Good-initiatief een kritieke fout bloot die gevoelige persoonlijke informatie lekte in gezondheidszorgsoftware die wereldwijd door ziekenhuizen wordt gebruikt en die eerdere frontiermodellen hadden gemist.
  • •Beschikbaarheid verloopt via een gefaseerde uitrol: vertrouwde cyberverdedigers krijgen als eerste toegang via het Fairwind Program zonder cyberguardrails, terwijl ontwikkelaars, ondernemingen en consumenten later toegang krijgen, te beginnen met betalende API-klanten en Google AI Ultra-abonnees.
  • •Binnen Google overtroffen Argon-agents een gepubliceerde kwantumalgoritme-baseline met 40%, maakten meer dan 300 TiB datacentergeheugen vrij en migreren ze grote C/C++-codebases naar Rust, waaronder meer dan 800.000 regels van de Zircon-kernel van Fuchsia OS.
Google DeepMind onthult Gemini 4 Argon, zijn next-generation frontier AI-model

Google DeepMind kondigde op 30 september 2026 Gemini 4 Argon aan, een nieuw frontier AI-model dat is gebouwd om diepgaand redeneren te ondersteunen bij complexe, langlopende professionele workflows. Het bedrijf zei dat het model frontierprestaties levert in real-world software-engineering, ondernemingskenniswerk zoals juridische en financiële taken en cybersecuritydefensie, en dat het in eerste instantie wordt uitgerold naar een groep vertrouwde cyberverdedigers via Google's Fairwind Program.

Koray Kavukcuoglu, SVP van Google DeepMind en Chief AI Architect bij Google, kondigde het model aan in een blogpost, waarin hij schreef dat Argon "fundamenteel verandert hoe we bij Google werken en bouwen." Het bedrijf benadrukte de toonaangevende limiet van 1 miljoen tokens van het model voor diep, meerstaps probleemoplossen, evenals sterke punten in programmeren, financieel onderzoek, juridisch opstellen en autonoom patchen van cybersecuritykwetsbaarheden.

Gefaseerde uitrol en prijzen

Google zei dat het veilig vrijgeven van frontiermogelijkheden op dit niveau een gefaseerde aanpak vereist. Het bedrijf is actief betrokken bij het vrijwillige proces van de Amerikaanse overheid voor toegang tot het model vóór release, terwijl het de beschikbaarheid geleidelijk uitbreidt, en het zal blijven feedback verzamelen van vroege testers terwijl het aan guardrails werkt voordat Argon beschikbaar wordt voor ontwikkelaars, ondernemingen en consumenten. Het initiële toegangsplan betekent dat de mogelijkheden enborgen die Google beschrijft eerst in gecontroleerde omgevingen worden geëvalueerd in plaats van direct op de bredere markt te worden aangeboden.

Argon wordt gelanceerd tegen een introductieprijs van $2 per miljoen inputtokens en $10 per miljoen outputtokens, waarbij gecachte inputtokens worden aangeboden met 95% korting op de inputtokenprijs. Na afloop van de introductieperiode gelden prijzen van $4 per 1 miljoen inputtokens en $20 per 1 miljoen outputtokens. De bredere uitrol begint met betalende API-klanten en Google AI Ultra-abonnees.

Hoe Google werkt en bouwt verandert

Gemini 4 Argon drijft al interne workflows bij Google aan, waarbij duizenden Googlers de sterke punten van het model benadrukten bij gespecialiseerde programmeertaken, diepgaander onderzoek en schrijfkwaliteit. Google zei dat het model teams sneller laat bouwen, de grenzen van engineeringproductiviteit verlegt en doorbraken versnelt. Voorbeelden die in de blogpost worden genoemd, zijn onder andere:

  • Kwantumalgoritmische optimalisatie: Argon helpt de kwantumonderzoekers van Google om de ruimtetijdbronnen (qubits × gates) van subroutines te optimaliseren die belangrijke toepassingen beperken. In één voorbeeld versloeg het de gepubliceerde baseline met 40% in enkele minuten.
  • Geheugenefficiëntie: Een team van Argon-agents analyseerde profilerings-telemetrie voor de hele vloot om autonoom geheugenoptimalisaties te identificeren en toe te passen in de datacenters van Google, waardoor na uitrol meer dan 300 TiB geheugen werd vrijgemaakt, met een geschatte totale besparing van 500 TiB tot 1 PiB.
  • Grootschalige codebasismigraties en optimalisaties: Argon-agents werken aan het migreren van C/C++-codebases naar Rust binnen Google — van tienduizenden regels in kernbibliotheken zoals re2 en libgav1 tot meer dan 800.000 regels voor de Zircon-kernel van Fuchsia OS. Gezien de kritieke aard van veel van deze systemen ondergaan de grootschalige herschrijvingen strenge geautomatiseerde en handmatige audits, emulatietests en evaluaties voordat ze naar productie gaan. Voor libgav1, Google's openbronsoftware voor het decoderen van video, namen Argon-agents een bestaande Rust-port over en vervingen ze 32.000 regels SIMD-code door vele rondes van profielgeleide experimenten uit te voeren, de compileruitvoer te bestuderen en veilige Rust te produceren zodat de compiler deze automatisch zou vectoriseren. Het resultaat is een memory-safe videodecoder die 2,7x sneller draait dan de Rust-port, met identieke video-uitvoer, waarmee het dichter bij de geoptimaliseerde C++-implementatie komt.

Een outputlimiet van 1 miljoen tokens

Om de mogelijkheden van Gemini 4 Argon bij langere, complexere use cases te ondersteunen, zei Google dat het de outputtokenlimiet van het model uitbreidt tot een toonaangevende 1 miljoen tokens, tegenover de eerdere 64.000 tokens. Volgens het bedrijf voegt het model, wanneer het de ruimte heeft om diep na te en honderdduizenden tokens in één trajectory te genereren, een nieuw niveau van redeneerdiepte toe dat moeilijke problemen in één keer oplosbaar maakt.

Programmeren en ondernemingsworkflows in alle domeinen

Google zei dat de mogelijkheden van Gemini 4 Argon op het gebied van programmeren, redeneren en multimodaliteit, samen met het vermogen om lange, meerstapstaken vol te houden, het uitstekend laten presteren in een reeks ondernemingsworkflows. Google-ingenieurs gebruiken het model voor dagelijkse taken, variërend van alledaagse debugging tot grootschalige codebasismigraties en algoritmeontwerp. Argon zet een nieuwe state of the art neer op DeepSWE v1.1, dat de prestaties van een model meet in real-world langlopende software-engineeringtaken, met een score van 77,9%.

Voorbij het programmeren zei Google dat Argon het toonaangevende model is op de Vals Index, die de economische impact meet over financiën, programmeren, juridisch werk en belastingen, waarbij elke sector wordt gewogen naar zijn bijdrage aan het Amerikaanse bbp. Het bedrijf meldde vergelijkbaar leidende prestaties op domeinspecifieke evaluaties, waaronder Vals Finance Agent v2, dat meerstaps financieel onderzoek test, en Harvey's Legal Agent Benchmark, dat juridisch onderzoek en opstellen omvat. Op AutomationBench, Zapier's benchmark voor end-to-end uitvoering over kernbedrijfsfuncties, staat Argon eerste met een score van 51,3%.

Argon is volgens Google ook sterk wanneer kenniswerk visueel begrip vereist. Het model kan professionele grafiekanalyse uitvoeren, details uit lange video's identificeren en actie ondernemen op basis van een reeks documenten. Op LVBench, dat begrip van lange video's meet, is het bedrijf van mening dat Argon de state of the art is met een score van 91,7%.

Leidend in defensieve cybersecurity

Google zei dat het Gemini Argon heeft getraind om zeer capabel te zijn in cybersecuritydefensie om cyberverdedigers beter toe te rusten voor een nieuw tijdperk van cyberaanvallen. Het model kan autonoom kritieke softwarekwetsbaarheden vinden, valideren en patchen. Voor vertrouwde verdedigers en Google's eigen interne teams zal het bedrijf Argon uitbrengen zonder cyberguardrails, zodat zij gebruik kunnen maken van de volledige frontiermogelijkheden op het gebied van cybersecuritydefensie.

Beveiligingsbedrijf Wiz gebruikt Argon al voor cybersecuritydefensie via zijn Scan for Good-initiatief, een programma dat zich inzet om kritieke openbare infrastructuur gratis te beschermen door hoog-risico blootstellingen te vinden en te verhelpen. In een vroege demonstratie van de impact van het model, aldus Google, ontdekte Argon een kritieke kwetsbaarheid die gevoelige persoonlijke informatie blootlegde in gezondheidszorgsoftware die wereldwijd door ziekenhuizen wordt gebruikt, waarmee een ernstig risico werd geïdentificeerd dat eerdere frontiermodellen hadden gemist.

Op CWE-bench v1, dat het vermogen van een model evalueert omveiligingskwetsbaarheden te verhelpen, deelt Argon de eerste plaats met een topscore van 68%, voortbouwend op de frontierprestaties van 3.8 Flash Cyber op CWE-bench v0.

Google zei dat Gemini 4 Argon indrukwekkende sprongen laat zien in het ontdekken van kwetsbaarheden ten opzichte van 3.8 Flash Cyber:

  • Op Google's interne, uitgebreide kwetsbaarheidsbenchmark ontdekte Argon een breed scala aan blootstellingen in complexe codebases in 20 programmeertalen.
  • Op Wiz's interne black-box penetratietestbenchmark, die het vermogen van een model test om live websystemen zonder broncode te analyseren, presteert Argon beter dan 3.8 Flash Cyber in het ontdekken van het aanvalsvlak, het identificeren van kwetsbaarheden en het produceren van proof-of-concept-bewijs om ze te valideren.

Versterking van frontierwaarborgen

Voordat Gemini 4 Argon breed wordt uitgerold, blijft Google volgens eigen zeggen kritieke frontierwaarborgen versterken op vier hoofdgebieden:

  • Bescherming tegen misbruik: Om te voorkomen dat kwaadwillenden Argon gebruiken voor cyberaanvallen of aanvallen met chemische, biologische, radiologische of nucleaire (CBRN) middelen, is het model ontworpen om schadelijke verzoeken te weigeren terwijl legitiem, dubbelgebruik wetenschappelijk onderzoek behouden blijft, in lijn met Google DeepMind's Frontier Safety Framework. Het bedrijf versterkt de robuustheid van zijn waarborgen voor deze lancering, waaronder het verbeteren van technieken om de interne activaties van het model te monitoren en misbruik te signaleren. De waarborgen ondergingen robuustheidstests door interne en externe red teams met een combinatie van handmatige en geautomatiseerde aanvalsmethoden.
  • Bescherming tegen prompt-injectieaanvallen: Google beschreef Argon als zijn tot nu toe meest veerkrachtige model tegen indirecte prompt-injecties, waarbij kwaadaardige instructies of context worden gebruikt om het gedrag van een model te kapen. Het bedrijf zei dat dit complexe aanvallen zijn die voortdurende waakzaamheid en meerdere verdedigingslagen vereisen. Door geautomatiseerd red teaming en adversarial training is Gemini 4 Argon volgens Google toonaangevend in prompt-injectierobuustheid op Gray Swan's Indirect Prompt Injection (IPI)-benchmark.
  • Monitoring van misalignment: Om te voorkomen dat Argon te ver gaat bij het uitvoeren van een taak op manieren die verder gaan dan de intenties van de gebruiker, implementeert Google mitigaties tegen misalignment die de chain-of-thought en acties van het model monitoren en zo nodig de uitvoering stopzetten. Het bedrijf gebruikte een vergelijkbaar systeem om zijn trainingsruns te monitoren en alerts te sturen naar een speciaal incidentresponsteam, waarbij zorgvuldige voorzorgsmaatregelen werden genomen om te voorkomen dat bevindingen terug in de training worden gevoerd, om te voorkomen dat Argon's redenering wordt gevormd om monitoring te ontken. Google zei dat het de rest van de sector sterk aanmoedigt om redeneringstransparantie te behouden "in deze cruciale momenten van toegenomen mogelijkheden tijdens het navigeren door alignmentrisico's," zodat de gedachten van modellen nuttig blijven bij het identificeren en diagnosticeren van misalignment.
  • Systemen verharden: Naarmate frontiermodellen steeds capabeler worden, vereist het veilig testen ervan volgens Google beveiligde omgevingen die met de systemen zelf kunnen meegroeien. In lijn met zijn agent control roadmap verhardt het bedrijf zijn sandboxomgevingen door ze te isoleren en af te sluiten voordat hoog-risico trainingen of evaluaties beginnen. Google beloofde ook deze beveiligingsbest practices voor agents te delen met partners om de beveiliging in het hele ecosysteem te verbeteren.

Binnenkort beschikbaar

Google zei dat het Gemini 4 Argon heeft gebouwd met frontiermogelijkheden op het gebied van programmeren, kenniswerk, cybersecuritydefensie en creatief schrijven, om een partner te zijn voor ontwikkelaars, professionals en ondernemingen die hun moeilijkste problemen aanpakken. Het bedrijf toonde zich dankbaar aan de eerste groep cyberverdedigers en vertrouwde testers, wiens evaluaties en feedback uit de praktijk zullen helpen zijn systemen te versterken vóór de release aan ontwikkelaars, ondernemingen en consumenten, te beginnen met betalende API-klanten en Google AI Ultra-abonnees.

Over de auteur: Koray Kavukcuoglu is een van 's werelds vooraanstaande experts op het gebied van kunstmatige intelligentie. Als SVP van Google DeepMind leidt hij de ontwikkeling van Google DeepMind's meest geavanceerde generatieve AI-modellen en de integratie ervan in Google's producten op schaal. Voorafgaand aan zijn huidige rol was hij VP of Research bij Google DeepMind, waar hij het deep learning-team oprichtte, dat belangrijke onderzoeksdoorbraken realiseerde zoals DQN (Deep Q-Network) en WaveNet.