Google DeepMind prezentuje Gemini 4 Argon, nowej generacji graniczny model AI
Najważniejsze informacje
- •Gemini 4 Argon osiąga najlepsze w branży wyniki benchmarków w różnych dziedzinach: 77,9% w DeepSWE v1.1 dla długoterminowej inżynierii oprogramowania, 51,3% w AutomationBench Zapiera i 91,7% w LVBench dla rozumienia długich filmów.
- •Limit tokenów wyjściowych modelu został rozszerzony do wiodącego w branży 1 miliona tokenów, około piętnaście razy więcej niż poprzednie 64 000, co według Google pozwala rozwiązywać trudne problemy za jednym podejściem.
- •Argon potrafi autonomicznie wykrywać, weryfikować i łatać krytyczne luki, a dzięki inicjatywie Wiz Scan for Good ujawnił krytyczną wyciek wrażliwych danych osobowych w oprogramowaniu medycznym używanym przez szpitale na całym świecie, którego wcześniejsze modele graniczne nie wykryły.
- •Dostępność odbywa się etapowo:ufani obrońcy cybernetyczni otrzymują początkowy dostęp przez program Fairwind bez zabezpieczeń cybernetycznych, a deweloperzy, przedsiębiorstwa i konsumenci uzyskają dostęp później, począwszy od klientów płatnego API i subskrybentów Google AI Ultra.
- •Wewnątrz Google agenty Argon pobiły opublikowany wynik bazowy algorytmu kwantowego o 40%, uwolniły ponad 300 TiB pamięci w centrach danych i migrują duże bazy kodu C/C++ na Rust, w tym ponad 800 000 linii jądra Zircon systemu Fuchsia OS.

Google DeepMind 30 września 2026 r. ogłosił Gemini 4 Argon, nowy graniczny model AI zbudowany, aby utrzymywać głębokie rozumowanie w złożonych, długoterminowych przepływach pracy zawodowej. Firma stwierdziła, że model osiąga graniczną wydajność w praktycznej inżynierii oprogramowania, pracy z wiedzą w przedsiębiorstwach, takiej jak prawo i finanse, oraz w obronie cybernetycznej, a jego wdrażanie rozpoczęło się od grupy zaufanych obrońców cybernetycznych w ramach programu Fairwind Google.
Koray Kavukcuoglu, wiceprezes Google DeepMind i główny architekt AI w Google, ogłosił model w wpisie na blogu, pisząc, że Argon "fundamentalnie zmienia sposób, w jaki pracujemy i tworzymy w Google". Firma podkreśliła wiodący w branży limit 1 miliona tokenów umożliwiający głębokie, wieloetapowe rozwiązywanie problemów, a także mocne strony w kodowaniu, badaniach finansowych, tworzeniu dokumentów prawnych i autonomicznym łataaniu luk w cyberbezpieczeństwie.
Etapowe udostępnianie i ceny
Google stwierdził, że bezpieczne udostępnianie zdolności granicznych na tym poziomie wymaga podejścia etapowego. Firma aktywnie uczestniczy w dobrowolnym procesie rządu USA dotyczącym dostępu do modeli przed premierą, stopniowo rozszerzając dostępność, i będzie dalej zbierać opinie od pierwszych testerów, dopracowując zabezpieczenia, zanim Argon trafi do deweloperów, przedsiębiorstw i konsumentów. Początkowy plan dost oznacza, że opisane przez Google możliwości i zabezpieczenia są najpierw oceniane w kontrolowanych warunkach, a nie natychmiast oferowane szerokiemu rynkowi.
Argon wejdzie na rynek w cenie promocyjnej 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych, przy czym tokeny wejściowe z pamięci podręcznej będą kosztować o 95% mniej niż cena tokenów wejściowych. Po zakończeniu okresu promocyjnego obowiązywać będą ceny 4 USD za 1 milion tokenów wejściowych i 20 USD za 1 milion tokenów wyjściowych. Szerokie wdrożenie rozpocznie się od klientów płatnego API i subskrybentów Google AI Ultra.
Zmiana sposobu pracy i tworzenia w Google
Gemini 4 Argon już zasila wewnętrzne przepływy pracy w Google, a tysiące pracowników firmy podkreśla mocne strony modelu w specjalistycznych zadaniach programistycznych, pogłębionych badaniach i jakości pisania. Google stwierdził, że model pomaga zespołom budować szybciej, przesuwa granice produktywności inżynierskiej i przyspiesza przełomy. Przykłady przytoczone we wpisie obejmują:
- Optymalizacja algorytmów kwantowych: Argon pomaga badaczom komputerów kwantowych w Google optymalizować zasoby czasoprzestrzenne (kubity × bramki) podprogramów, które stanowią wąskie gardło ważnych aplikacji. W jednym z przykładów model pobił opublikowany wynik bazowy o 40% w ciągu kilku minut.
- Efektywność pamięciowa: Zespół agentów Argon przeanalizował telemetrię profilowania w całej infrastrukturze, aby autonomicznie identyfikować i stosować optymalizacje pamięci w centrach danych Google, uwalniając po wdrożeniu ponad 300 TiB pamięci, przy szacowanych łącznych oszczędnościach od 500 TiB do 1 PiB.
- Wielkoskalowe migracje i optymalizacje baz kodu: Agenty Argon pracują nad migracją baz kodu C/C++ na Rust w całym Google — od dziesiątek tysięcy linii w podstawowych bibliotekach, takich jak re2 i libgav1, do ponad 800 000 linii w jądrze Zircon systemu Fuchsia OS. Ze względu na krytyczne znaczenie wielu z tych systemów tak wielkoskalowe przepisywania przechodzą rygorystyczny automatyczny i ręczny audyt, testy emulacyjne oraz przegląd przed wdrożeniem produkcyjnym. W przypadku libgav1, open source'owego oprogramowania Google do dekodowania wideo, agenty Argon wzięły istniejący port na Rust i zastąpiły 32 000 linii kodu SIMD, przeprowadzając wiele rund eksperymentów z profilowaniem, analizując wynik kompilatora i produkując bezpieczny Rust tak, aby kompilator automatycznie go zwektoryzował. Efektem jest bezpieczny pamięciowo dekoder wideo działający 2,7 raza szybciej niż port Rust, z identycznym wyjściem wideo, zbliżając się do zoptymalizowanej implementacji C++.
Limit wyjściowy 1 miliona tokenów
Aby wesprzeć możliwości Gemini 4 Argon w dłuższych, bardziej złożonych przypadkach użycia, Google stwierdził, że rozszerza limit tokenów wyjściowych modelu do wiodgo w branży 1 miliona tokenów, wobec poprzednich 64 000 tokenów. Według firmy, gdy model ma przestrzeń do głębokiego myślenia i generowania setek tysięcy tokenów w jednej sekwencji, uzyskuje nowy poziom głębi rozumowania, pozwalający rozwiązywać trudne problemy za jednym podejściem.
Kodowanie i przepływy pracy w przedsiębiorstwach w różnych dziedzinach
Google stwierdził, że możliwości Gemini 4 Argon w zakresie kodowania, rozumowania i multimodalności, wraz ze zdolnością do utrzymywania długich, wieloetapowych zadań, pozwalają mu osiągać doskonałe wyniki w szerokim zakresie przepływów pracy w przedsiębiorstwach. Inżynierowie Google używają modelu do codziennych zadań, od rutynowego debugowania po wielkoskalowe migracje baz kodu i projektowanie algorytmów. Argon ustanawia nowy stan techniki w DeepSWE v1.1, mierzącym wydajność modelu w rzeczywistych, długoterminowych zadaniach inżynierii oprogramowania, z wynikiem 77,9%.
Poza kodowaniem Google stwierdził, że Argon jest wiodącym modelem w Vals Index, mierzącym wpływ ekonomiczny w pracy z zakresu finansów, kodowania, prawa i podatków, z każdą branżą ważoną według jej wkładu do amerykańskiego PKB. Firma odnotowała podobnie wiodące wyniki w ocenach branżowych, w tym Vals Finance Agent v2, testującym wieloetapowe badania finansowe, oraz Harvey's Legal Agent Benchmark, obejmującym badania i tworzenie dokumentów prawnych. W AutomationBench, benchmarku Zapiera mierzącym end-to-end wykonanie w kluczowych funkcjach biznesowych, Argon zajmuje pierwsze miejsce z wynikiem 51,3%.
Argon jest także mocny tam, gdzie praca z wiedzą wymaga rozumienia wizualnego, według Google. Model potrafi prowadzić profesjonalną analizę wykresów, rozpoznawać szczegóły w długich filmach i podejmować działania na podstawie serii dokumentów. W LVBench, mierzącym rozumienie długich filmów, firma stwierdziła, że Argon jest najlepszy z wynikiem 91,7%.
Przewaga w defensywnym cyberbezpieczeństwie
Google stwierdził, że wytrenował Gemini Argon do wysokich kompetencji w obronie cybernetycznej, aby lepiej wyposażyć obrońców w nową erę ataków cybernetycznych. Model potrafi autonomicznie wykrywać, weryfikować i łatać krytyczne luki w oprogramowaniu. Dla zaufanych obrońców i własnych zespołów wewnętrznych Google firma udostępni Argon bez zabezpieczeń cybernetycznych, aby mogli wykorzystać pełne, graniczne możliwości modelu w obronie cybernetycznej.
Firma bezpieczeństwa Wiz już używa Argon do obrony cybernetycznej w ramach inicjatywy Scan for Good, programu poświęconego bezpłatnej ochronie krytycznej infrastruktury publicznej poprzez wykrywanie i usuwanie zagrożeń wysokiego ryzyka. We wczesnej demonstracji wpływu modelu, jak stwierdził Google, Argon ujawnił krytyczną lukę ujawniającą wrażli dane osobowe w oprogramowaniu medycznym używanym przez szpitale na całym świecie, identyfikując poważne ryzyko, które wcześniejsze modele graniczne przeoczyły.
W CWE-bench v1, oceniającym zdolność modelu do usuwania luk bezpieczeństwa, Argon dzieli pierwsze miejsce z najwyższym wynikiem 68%, bazując na granicznej wydajności 3.8 Flash Cyber w CWE-bench v0.
Google stwierdził, że Gemini 4 Argon demonstruje imponujące skoki w wykrywaniu luk w porównaniu z 3.8 Flash Cyber:
- W wewnętrznym, wszechstronnym benchmarku luk Google Argon wykrył szeroki zakres podatności w złożonych bazach kodu obejmujących 20 języków programowania.
- W wewnętrznym benchmarku testów penetracyjnych typu black-box firmy Wiz, badającym zdolność modelu do analizy działających systemów internetowych bez kodu źródłowego, Argon przewyższa 3.8 Flash Cyber w odkrywaniu powierzchni ataku, identyfikowaniu luk i tworzeniu dowodów koncepcji potwierdzających ich istnienie.
Wzmacnianie zabezpieczeń granicznych przed szeroką dostępnością
Przed szerokim wdrożeniem Gemini 4 Argon Google stwierdził, że kontynuuje wzmacnianie kluczowych zabezpieczeń granicznych w czterech głównych obszarach:
- Obrona przed nadużyciami: Aby zapobiec wykorzystywaniu Argon przez złych aktorów do ataków cybernetycznych lub chemicznych, biologicznych, radiologicznych i jądrowych (CBRN), model został zaprojektowany tak, by odmawiać szkodliwych żądań przy zachowaniu legitymnych badań naukowych o podwójnym zastosowaniu, zgodnie z Frontier Safety Framework Google DeepMind. Firma wzmacnia odporność zabezpieczeń na tę premierę, w tym doskonali techniki monitorowania wewnętrznych aktywacji modelu w celu wykrywania nadużyć. Zabezpieczenia przeszły testy odporności przeprowadzone przez wewnętrzne i zewnętrzne zespoły red, z użyciem połączenia ręcznych i zautomatyzowanych metod ataku.
- Obrona przed atakami wstrzyknięcia promptów: Google opisał Argon jako swój najodporniejszy dotąd model na pośrednie wstrzyknięcia promptów, w których złośliwe instrukcje lub kontekst służą do przejęcia zachowania modelu. Firma stwierdziła, że są to złożone ataki wymagające stałej czujności i wielu warstw obrony. Dzięki zautomatyzowanemu red teamingowi i treningowi adwersaryjnemu Gemini 4 Argon prowadzi w odporności na wstrzyknięcia promptów w benchmarku Gray Swan's Indirect Prompt Injection (IPI), według Google.
- Monitorowanie niezgodności: Aby zapobiec przekraczaniu przez Argon granic podczas wykonywania zadań w sposób wykraczający poza intencje użytkownika, Google wdraża środki zaradcze monitorujące łańcuch myślenia i działania modelu oraz w razie potrzeby zatrzymujące wykonanie. Firma użyła podobnego systemu do monitorowania przebiegów treningowych i wysyłania alertów do dedykowanego zespołu reag na incydenty, zachowując ostrożność, by nie wprowadzać ustaleń z powrotem do treningu, aby nie ryzykować kształtowania rozumowania Argon tak, by unikał monitoringu. Google oświadczył, że silnie zachęca resztę branży do zachowania przejrzystości rozumowania "w tych kluczowych momentach zwiększonych możliwości przy radzeniu sobie z ryzykami zgodności", aby myśli modelu pozostawały pomocne w identyfikowaniu i diagnozowaniu niezgodności.
- Hartowanie systemów: W miarę jak modele graniczne stają się coraz bardziej zdolne, ich bezpieczne testowanie wymaga bezpiecznych środowisk nadążających za samymi systemami, stwierdził Google. Zgodnie ze swoim planem kontroli agentów firma hartuje swoje środowiska piaskownicy, izolując i uszczelniając je przed rozpoczęciem treningów lub ocen wysokiego ryzyka. Google zobowiązał się także do dzielenia się tymi najlepszymi praktykami bezpieczeństwa agentów z partnerami, aby poprawić bezpieczeństwo w całym ekosystemie.
Wkrótce dostępny
Google stwierdził, że zbudował Gemini 4 Argon z granicznymi możliwościami w kodowaniu, pracy z wiedzą, obronie cybernetycznej i pisaniu kreatywnym, aby służyć jako partner dla deweloperów, profesjonalistów i przedsiębiorstw mierzących się z najtrudniejszymi problemami. Firma wyraziła wdzięczność pierwszej grupie obrońców cybernetycznych i zaufanych testerów, których rzeczywiste oceny i opinie pomogą wzmocnić systemy przed udostępnieniem deweloperom, przedsiębiorstwom i konsumentom, począwszy od klientów płatnego API i subskrybentów Google AI Ultra.
O autorze: Koray Kavukcuoglu jest jednym z czołowych na świecie ekspertów w dziedzinie sztucznej inteligencji. Jako wiceprezes Google DeepMind kieruje rozwojem najnowocześniejszych generatywnych modeli AI Google DeepMind i ich integracją z produktami Google na skalę. Wcześniej pełnił funkcję wiceprezesa ds. badań w Google DeepMind, gdzie założył zespół uczenia głębokiego, który stworzył przełomowe osiągnięcia badawcze, takie jak DQN (Deep Q-Network) i WaveNet.