AktualnościAkcjeGoogle DeepMind przedstawia Gemini 3.8 Flash i 3.8 Flash Cyber do przepływów agentowych i cyberbezpieczeństwa

Google DeepMind przedstawia Gemini 3.8 Flash i 3.8 Flash Cyber do przepływów agentowych i cyberbezpieczeństwa

Autor: Google DeepMind Blog·

Najważniejsze informacje

  • Google DeepMind wydało Gemini 3.8, swój najbardziej wydajny model do rozumowania i kodowania, trzy tygodnie po 3.7 Flash — trzecie wydanie Flash w ciągu sześciu tygodni.
  • Gemini 3.8 Flash jest oferowany w cenie wprowadzeniowej 0,75 USD za milion tokenów wejściowych i 3,75 USD za milion tokenów wyjściowych, przy czym stawki podwoją się 1 stycznia 2027 r.
  • Gemini 3.8 Flash Cyber osiągnął wydajność klasy frontier w wykrywaniu podatności na CyberGym i ponad 70% skuteczności na wewnętrznym benchmarku Google obejmującym 20 języków programowania.
  • Zespół Chrome Security stwierdził, że Flash Cyber wygenerował 2,6 raza więcej poprawnych łatek podatności w Chrome niż większe modele komercyjne.
  • Flash Cyber jest ograniczony do zaufanych obrońców w ramach nowego programu Fairwind, natomiast 3.8 Flash jest dostępny przez Gemini API, Gemini Enterprise i subskrypcje Google AI Pro i Ultra.
Google DeepMind przedstawia Gemini 3.8 Flash i 3.8 Flash Cyber do przepływów agentowych i cyberbezpieczeństwa

Google DeepMind przedstawiło Gemini 3.8, swój najbardziej dotąd wydajny model do rozumowania i kodowania, który trafia na rynek zaledwie trzy tygodnie po 3.7 Flash i jest trzecim wydaniem z serii Flash w ciągu sześciu tygodni. Tak przyspieszone tempo odzwierciedla obecny rytm rynku modeli frontier, na którym Google, OpenAI i Anthropic wydają kolejne premiery co kilka tygodni, a nie co kwartał, a średnie modele klasy „Flash” coraz częściej stanowią koń roboczy produkcyjnych zastosowań AI. Premiera obejmuje dwa warianty: Gemini 3.8 Flash, uniwersalny model roboczy, oraz Gemini 3.8 Flash Cyber, wyspecjalizowany model cyberbezpieczeństwa dostępny dla zweryfikowanych obrońców w ramach nowego programu Fairwind.

Zgodnie z ogłoszeniem Tulsee Doshi, Senior Director of Product Management, oraz Raluca Ady Popej, Gemini Security Lead w Google DeepMind, oba wydania oparte są na tej samej inteligencji bazowej, przyspieszanej przez długotrwałe pętle agentowe rekursywnie oceniające i doskonalące modele bazowe. Znaczące postępy w kodowaniu i rozumowaniu w ramach tego wspólnego rdzenia wynikały z kilku innowacji, wśród nich rygorystycznego treningu w wymagającej dziedzinie cyberbezpieczeństwa. To połączenie jest godne uwagi, ponieważ wykorzystuje technikę — stosowanie trudnej, weryfikowalnej domeny, takiej jak bezpieczeństwo, jako sygnału treningowego — która była już stosowana w branży do wzmacniania ogólnych zdolności rozumowania modeli.

Gemini 3.8 Flash: zaprojektowany do długoterminowego kodowania i autonomicznych agentów

Gemini 3.8 Flash zapewnia istotne ulepszenia względem 3.7 Flash w inżynierii oprogramowania, zadaniach agentowych i wieloetapowym rozumowaniu w wyspecjalizowanych domenach, często zbliżając się do wydajności droższych modeli frontier. Jest dostępny w tej samej cenie wprowadzeniowej co 3.7 Flash: 0,75 USD za milion tokenów wejściowych i 3,75 USD za milion tokenów wyjściowych. Cena wprowadzeniowa obowiązuje do 31 grudnia 2026 r.; od 1 stycznia 2027 r. będą stosowane stawki 1,50 USD za milion tokenów wejściowych i 7,50 USD za milion tokenów wyjściowych. Nawet przy pełnej stawce model jest wyceniony znacznie poniżej typowych poziomów modeli frontier, co podkreśla konkurencyjną presję na ceny per token w rywalizacji o obciążenia agentowe, konsumujące znacznie więcej tokenów niż interakcje czatowe.

Na benchmarku DeepSWE v1.1 (Long-Horizon Software Engineering) model 3.8 Flash wyprzedza większość większych modeli frontier w autonomicznym rozwiązywaniu złożonych problemów inżynieryjnych od początku do końca — ułamka kosztu. Model wykazuje również niezawodność wymaganą dla krytycznej autonomii korporacyjnej w wyspecjalizowanych domenach wiedzy. W dziedzinach ilościowych i zawodowych wymagających zaawansowanej analizy i raportowania 3.8 Flash wyprzedza 3.7 Flash i inne modele frontier w benchmarkach takich jak Vals Finance Agent V2 oraz Harvey's Legal Agent Benchmark. Osiąga też 54,9% na HLE-Verified, co odzwierciedla zdolność wieloetapowego rozumowania w naukach STEM, humanistyce i dziedzinach zawodowych.

Te postępy wynikają z kluczowej decyzji projektowej: 3.8 Flash pracuje ciężej. Przy złożonych zadaniach model wykonuje dodatkowe kroki rozumowania i iteracyjnie wywołuje narzędzia, czasem zużywając więcej tokenów, aby zmaksymalizować wydajność, szczególnie przy wyższych poziomach wysiłku. Kompromis między dokładnością a zużyciem tokenów stał się centralnym pytaniem projektowym dla agentowej AI, ponieważ autonomiczne agenty działające w wielu krokach mogą zwielokrotnić koszty inferencji; kontrola poziomu wysiłku daje deweloperom dźwignię do zarządzania tym kompromisem. W zastosowaniach ograniczonych mocą obliczeniową deweloperzy mogą stosować niższe poziomy wysiłku, aby ograniczyć zużycie tokenów, lub nadal polegać na Gemini 3.7 Flash, który pozostaje w pełni wspierany dla obciążeń priorytetowo efektywnych.

Google pokazało kilka demonstracji zbudowanych z 3.8 Flash w Google Antigravity: trójwymiarową grę z czarodziejem przemierzającym zamek, stworzoną z prostego promptu z instrukcją pętlową, z zagadkami, narracją środowiskową i teksturami wygenerowanymi przez Nano Banana; w pełni grywalną wersję Google Maps dla DOS z lokalizacjami, trasami i Street View; mapę topograficzną znanych obiektów geograficznych z przekrojami w czasie rzeczywistym, projekcjami 2D i wyjaśnieniami naukowymi opartymi na rzeczywistych danych U.S. Geological Survey; oraz Hardware Anatomy, interaktywny wizualizator 3D zbudowany w Google AI Studio, generujący realistyczne rendery Three.js sprzętu w proporcjach fizycznych, z suwakiem dekonstrukcji warstw.

Gemini 3.8 Flash Cyber: ekspercka wydajność w cyberbezpieczeństwie

Gemini 3.8 Flash Cyber zapewnia obrońcom możliwości klasy frontier w wykrywaniu podatności i automatycznym łatkowaniu, oferowane przy szybkości i kosztach klasy Flash, umożliwiających szybką iterację. Model trafia na rynek w okresie szerszej branżowej ofensywy w kierunku bezpieczeństwa wspomaganego AI — ataki na łańcuch dostaw oprogramowania i niezałatane podatności w dużych organizacjach uczyniły automatyczne wykrywanie i naprawianie aktywnym obszarem inwestycji w branży bezpieczeństwa, ale jednocześnie budzą obawy, że podobne możliwości bez ograniczeń mogłyby służyć atakującym.

Autonomiczne wykrywanie podatności. Na CyberGym, branżowym benchmarku standardowym do znajdowania podatności, 3.8 Flash Cyber wykazuje wydajność klasy frontier w autonomicznym wykrywaniu podatności, wyprzedzając zarówno 3.5 Flash Cyber, jak i znacznie większe modele frontier. Aby lepiej odzwierciedlić rzeczywiste potrzeby obronne wykraczające poza bazy kodu C/C++ objęte CyberGym, Google oceniło model także na kompleksowym wewnętrznym benchmarku wymagającym wykrywania szerokiego zakresu podatności w złożonych bazach kodu obejmujących 20 języków programowania, gdzie osiągnął wskaźnik sukcesu powyżej 70% — znaczący skok względem poprzednich modeli.

Automatyczne łatkowanie. Google podało, że skupiło się na wyposażeniu obrońców w eksperckie możliwości dające im przewagę nad atakującymi, inwestując od początku w naprawianie podatności i przedkładając je nad zdolności ofensywne, takie jak eksploitacja. Na CWE-Bench, wymagającym zewnętrznym benchmarku łatkowania prowadzonym przez Collinear, 3.8 Flash Cyber znajduje się na froncie Pareto z pass@1 47,2% wobec 47,8% dla wiodącego modelu frontier — przy znacznie niższym koszcie.

Wpływ w praktyce. Google poinformowało, że już wykorzystuje 3.8 Flash Cyber do zabezpieczania kodu w całej firmie. Zespół Chrome Security stwierdził, że model wygenerował 2,6 raza więcej poprawnych łatek podatności w Chrome niż znacznie większe najlepsze modele komercyjne. Wiz ustalił, że model osiągnął o 7,5–9,7% wyższą czułość na wewnętrznym benchmarku testów penetracyjnych przy koszcie niższym o 2,3–5,2x w porównaniu z innymi wiodącymi modelami frontier. Zespół Google Cloud Vulnerability Research użył modelu do znalezienia krytycznej podatności podstawowej w niecałe dwie godziny — proces badania i odkrycia, który zwykle zajmuje miesiące. Zewnętrzna walidacja od Wiz i benchmark Collinear daje częściowe niezależne potwierdzenie twierdzeń Google wykraczające poza wewnętrzne ewaluacje, choć szczegółowe metodologie benchmarków pozostają publikowane przez dostawców.

Zbudowane z myślą o bezpieczeństwie

Gemini 3.8 Flash ma zabezpieczenia przed nadużyciami w domenach chemicznej, biologicznej, radiologicznej i jądrowej (CBRN) oraz cyberprzestępczości, jednocześnie umożliwiając korzystne zastosowania, zgodnie z Frontier Safety Framework Google. 3.8 Flash Cyber ma łagodniejszy zestaw środków bezpieczeństwa w zakresie cyberbezpieczeństwa i z tego powodu jest dostępny wyłącznie dla zaufanych obrońców wymagających bardziej kompleksowego zestawu zdolności cyber. Podejście z ograniczonym dostępem odzwierciedla szerszą debatę w społecznościach AI i bezpieczeństwa o to, jak rozprowadzać potężne ofensywne zdolności cyber — ograniczając je do zweryfikowanych obrońców — bez tłumienia legalnych badań bezpieczeństwa. Google zaznaczyło też, że modele Gemini 3.8 poczyniły znaczący postęp w odporności na prompt injection mierzonej przez Gray Swan, chroniąc użytkowników przed złośliwymi atakami związanymi z prompt injection; prompt injection pozostaje jednym z najczęściej wymienianych zagrożeń dla agentowych systemów AI, które czytają niezaufane treści i podejmują działania w imieniu użytkownika.

Dostępność

  • Deweloperzy: Buduj z 3.8 Flash i odkrywaj przepływy zorientowane na agentów w Google Antigravity lub zacznij budować w Gemini API przez Google AI Studio i Android Studio, lub generuj interfejsy w Stitch. Dokumentacja deweloperska dostępna jest w dokumentacji Google dla deweloperów.
  • Przedsiębiorstwa: Dostęp do 3.8 Flash w Gemini Enterprise.
  • Konsumenci: 3.8 Flash jest dostępny dla subskrybentów Google AI Pro i Ultra w aplikacji Gemini, trybie AI w Wyszukiwarce Google oraz w Gemini w Arkuszach Google.
  • Cyber: Przez nowy program Fairwind zaufane organy rządowe, operatorzy infrastruktury krytycznej i opiekunowie oprogramowania otrzymują priorytetowy dostęp do Gemini 3.8 Flash Cyber. Organizacje mogą aplikować o dostęp.

Źródło: Blog Google DeepMind