Recenzja Gemini 3.7 Flash: tani model Google nie jest już głupi
Najważniejsze informacje
- •Gemini 3.7 Flash zaliczył test kodowania zero-shot, generując grywalną grę przeglądarkową w 2 minuty i 13 sekund, podczas gdy jego poprzednik Gemini 3.6 Flash stworzył niedziałający plik, który trzeba było naprawić za pomocą DeepSeek.
- •Model przegrał porównanie w pisaniu kreatywnym z Qwopus3.5-27B-v3, darmowym społecznościowym fine-tunem działającym na pojedynczym konsumenckim GPU, po złamaniu reguły strukturalnej narzuconej przez polecenie.
- •Gemini 3.7 Flash odpowiedział 17 minutami w zagadce z mostem, której poprawna odpowiedź wynosiła 10 minut, powtarzając wcześniejszy błąd Claude Fable 5 i zakładając ograniczenie do dwóch osób, którego polecenie nie podawało.
- •W zadaniu z wielomianem stopnia 19 model poprawnie zidentyfikował wielomian Dicksona i wyprowadził postać zamkniętą, ale nie obliczył p(19), podczas gdy Qwen 3.7 Max Preview dokończył pełne obliczenie.
- •Przy cenie 0,75 dolara za milion tokenów wejściowych do 31 grudnia model kosztuje połowę tego, co 3.6 Flash przy premierze, i jest o 85% tańszy od stawki GPT-5.6 Sol wynoszącej 5 dolarów, zanim 1 stycznia cena wzrośnie do 1,50 dolara.

Gemini 3.7 Flash zbudował grywalną grę przeglądarkową z jednego polecenia w 2 minuty i 13 sekund — zadanie, z którym jego poprzednik, Gemini 3.6 Flash, trzy tygodnie wcześniej całkowicie sobie nie poradził.
Nie rozwiązał naszej logicznej zagadki z mostem, podając tę samą błędną odpowiedź co Claude Fable 5, i zatrzymał się przed faktycznym obliczeniem zadania matematycznego, które poprawnie ustawił.
Model kosztuje 75 centów za milion tokenów wejściowych do 31 grudnia — czyli połowę stawki 3.6 Flash — po czym 1 stycznia podrożeje do 1,50 dolara.
Google wprowadził Gemini 3.7 Flash 13 sierpnia, a model był dostępny od pierwszego dnia w ponad 160 krajach. Obsługuje do miliona tokenów wejściowych, zwraca 64 000 tokenów, czyta obrazy, wideo, audio i pliki PDF oraz może wywoływać narzędzia i sterować komputerem.
Flash nigdy nie był modelem, po który sięga się przy trudnym problemie. To model do porządkowania tekstu, kompresowania sesji agentowych, zanim załamią się pod własnym kontekstem, oraz streszczania dokumentów, za których odczyt nie chce się płacić modelowi flagowemu. W takich zastosowaniach 3.7 Flash jest wyraźnym ulepszeniem. Na tle wszystkiego innego to kompetentny model, którego może przebić oprogramowanie możliwe do pobrania bezpłatnie.
Własna tabela wyników Google stawia 3.7 Flash przed Claude Sonnet 5 i GPT-5.6 Terra w 11 z 18 testowanych kategorii. Nagłówkowe wyniki to 1 588 Elo na planszy web development Code Arena i 30,4% w AutomationBench. Oba pochodzą z metodologii Google, więc należy traktować tę przewagę jako twierdzenie firmy, a nie rozstrzygnięty fakt.
Przetestowaliśmy model, aby sprawdzić, czy odpowiada deklaracjom Google. Oto nasze wyniki.
Kodowanie: Czy potrafi zbudować coś, co działa za pierwszym razem?
Ten test mierzy generowanie kodu zero-shot — to, czy model zamienia jedno polecenie w działające oprogramowanie bez przykładów do skopiowania i bez możliwości poprawienia się. Podajemy jedno polecenie na grę przeglądarkową i publikujemy wszystko, co wróci, wraz z błędami. Bez doprecyzowań, bez raportów o błędach, bez drugiej próby.
Gemini 3.7 Flash zaliczył test w 2 minuty i 13 sekund. Gra działała przy pierwszym uruchomieniu, składnia była czysta, logika kolizji i punktacji działała poprawnie, a jakość wizualna była wyższa, niż sugerowałby ten poziom cenowy.
Najważniejsze porównanie nie dotyczy modelu flagowego. Chodzi o Gemini 3.6 Flash, wydany 21 lipca, który w ogóle nie był w stanie wygenerować działającego pliku. HTML był uszkodzony, elementy się nie renderowały, a kolejne prośby o naprawę własnego wyniku donikąd nie prowadziły.
Ostatecznie przekazaliśmy tę ruinę DeepSeekowi, który znalazł 11 błędów i dostarczył 8 poprawek, aby gra była grywalna. Trzy tygodnie później ta sama linia produktowa nie potrzebuje już ratunku, a rezultat jest zbliżony do tego, co GPT-5.6 Sol uzyskał w naszej lipcowej recenzji.
Gemini 3.7 Flash wygrywa to bezdyskusyjnie i jest to najmocniejszy powód, by przejść na nowy model. Zastrzeżenie jest takie, że realizuje specyfikacje, a nie je wymyśla, więc nieprecyzyjne polecenie da ci nieprecyzyjną grę.
Grę Gemini 3.7 Flash możesz wypróbować tutaj.
Pisanie kreatywne: Czy potrafi utrzymać paradoks i napisać zdanie?
Ta sekcja testuje dwie rzeczy naraz: jakość literacką oraz to, czy model potrafi przestrzegać reguły strukturalnej przez tysiące słów. Polecenie wysyła Jose Lanza z 2150 roku z powrotem do roku 1000 i wymaga zamkniętej pętli przyczynowej — jego interwencja musi być tym, co tworzy przyszłość, której miał zapobiec.
O tym, czy test jest zaliczony, decyduje ostatnia klauzula: He cannot understand what he did until he is home.
Gemini 3.7 Flash wygenerował przyzwoity wynik. Jose wystrzeliwuje działko entropijne w szczelinę w Pirenejach, przypadkowo kuje obelisk, który zniewala Iberię XXII wieku, i rozumie całą pętlę, stojąc jeszcze tysiąc lat wcześniej w błocie: „It was the base of the Cinder Spire.”
Mechanika fabuły jest w zasadzie solidna. Opowieść wspomina spadającą gwiazdę, którą zobaczyli dawni mnisi, i wyjaśnia, że był to błysk własnego przybycia Jose, a broń, którą przyniósł, by usunąć anomalię, jest tym, co ją tworzy. Zdanie końcowe — „It had simply been waiting for him to complete it” — dobrze domyka deterministyczny sens, o który prosiło polecenie.
Ale dla osób przyzwyczajonych do takiego stylu tekst krzyczy „AI”. Prawie każdy rzeczownik przychodzi z dwoma dopiętymi przymiotnikami: „hyper-luminescent towers”, „damp, moss-choked earth”, „thick, obsidian hair”. To tekstura modelu wybierającego najbardziej prawdopodobne następne słowo zamiast świadomego wyboru, co daje zderzenia w rodzaju monolitu „humming with a low-frequency hum”.
Porównaliśmy go z Qwopus3.5-27B-v3, społecznościowym fine-tunem Qwen3.5-27B, który destyluje rozumowanie w stylu Claude Opus i działa na pojedynczym konsumenckim GPU bez kosztu za zapytanie. On przestrzegał reguły, którą Gemini złamał.
Jose zabija mnicha w San Millán de la Cogolla, prawdziwym klasztorze w La Rioja, który rzeczywiście miał znaczenie około roku 1000, i dopiero po powrocie do 2150 roku oraz odnalezieniu własnego DNA w woskowo zapieczętowanym kodeksie rozumie, co zrobił.
Qwopus nie jest całkowicie czysty. Wypisał cały swój roboczy szkic planowania nad historią, łącznie z literówkami, a końcowa sekcja rozbija zamkniętą pętlę, którą budował przez osiem części, pozwalając Jose wrócić i wszystko naprawić.
Mimo wszystko to Qwopus wygrywa. Gemini dostarczył czyściejszy pakiet i bardziej zdyscyplinowane zakończenie, ale nie wykonał jednej instrukcji, wokół której zbudowano polecenie, a darmowy model działający na gamingowym GPU napisał lepszą historię.
Myślenie asocjacyjne: Czy metafora może unieść argument?
Ten test mierzy rozumowanie asocjacyjne — czy model potrafi tworzyć powiązania między niepowiązanymi pojęciami bez konieczności ich wyjaśniania. Polecenie prosi o opis gałązki, używa tego opisu do wyjaśnienia wyzysku pracowników i kultu bogatych, a następnie wymaga, by argument rozpłynął się w opisie sałaty.
Najczęstszą porażką jest zbyt wyraźne sygnalizowanie. Nazwanie metafory ją zabija.
Gemini robi to w pierwszym zdaniu drugiego akapitu: „This is the precise mechanics of the modern proletariat.” Wszystko wcześniej działało.
Część obrazowania się broni. Pracownik otrzymuje „just enough bark to stay rigid for another week of output”, a upadłe gałązki są uczone, że przy dość dużej sztywności każda z nich może stać się pniem. Akapit zawierający ten pierwszy obraz zawiera też pracownika „bound to an vast, top-heavy corporate hierarchy.” Nieźle pod względem logiki i struktury.
Prawdziwym załamaniem jest rozwinięcie. Gemini opisuje przejście zamiast je wykonać — hierarchie „crumble, dissolving into the quiet, humble reality of the organic world underneath” — a potem sałata po prostu się pojawia, bez związku z tym, co było wcześniej.
GPT-5.6 Sol gnije gałązkę w ziemi i z tej ziemi wyrasta sałata: „Rain enters the grain. Fibers loosen, darken.” Argument jest też ukryty w samym obiekcie, a bogactwo zostaje przedstawione jako język cnoty, w którym „The mansion signifies intelligence.”
GPT-5.6 Sol wygrywa wyraźnie. Gemini stworzył jedno ładne zdanie, ale sam wyjaśnił własną metaforę, a potem pominął przejście, które polecenie właśnie miało sprawdzić.
Logika: Czy czyta polecenie, czy rozpoznaje zagadkę?
Ten test mierzy rozumowanie niematematyczne, a dokładniej to, czy model czyta pytanie przed sobą, czy dopasowuje je do zapamiętanego wzorca. Nasze polecenie o moście daje czterem osobom jedną latarkę i czasy przejścia 1, 2, 5 i 10 minut, a następnie pyta, jak szybko wszystkie osoby mogą przejść.
Sztuczka polega na tym, czego polecenie nie mówi. Nie wspomina, że na moście mogą być naraz tylko dwie osoby, więc odpowiedź brzmi 10 minut — wszyscy przechodzą razem tempem najwolniejszej osoby.
Gemini odpowiedział 17 minutami, odtwarzając zapamiętaną pięcioetapową sztuczkę z podręcznikowej wersji zagadki. Potraktował ograniczenie jako fakt, nie sprawdzając, czy rzeczywiście je podaliśmy.
Jego widoczne rozumowanie jest gorsze od odpowiedzi. Ślad argumentuje, że wysyłanie dwóch najwolniejszych razem byłoby nieefektywne, bo ktoś musiałby wrócić z latarką — po czym końcowa odpowiedź i tak każe im przejść razem. W jednej odpowiedzi model sam sobie przeczy i podaje wynik z pełną pewnością.
Claude Fable 5 w lipcu podał tę samą złą liczbę. Zaczął od jasnego wskazania założenia: „assuming the classic constraint that the bridge holds only two people at a time”, co odróżnia złą odpowiedź, którą można wychwycić, od takiej, której nie da się łatwo zauważyć.
Nikt nie wygrywa. Fable wygrywa wyłącznie transparentnością, a brak pewności widoczny w uruchomieniach agenta Gemini pojawia się tutaj w zagadce, którą można sprawdzić ręcznie.
Matematyka: Czy kończy zadanie?
Ten test mierzy matematykę symboliczną znacznie wykraczającą poza typowe zastosowania konsumenckie, a także coś prostszego — czy model robi to, o co został poproszony. Polecenie wymaga nieparzystego jednomianowego wielomianu stopnia 19 o rzeczywistych współczynnikach i współczynniku liniowym -19, którego wykres rozdziela się na co najmniej trzy nierozkładalne składowe, a następnie pyta o p(19).
Oba modele znalazły te same drzwi. Gemini i Qwen 3.7 Max Preview oba zidentyfikowały wielomian Dicksona, rozwiązały ograniczenie, ustawiając parametr na 1, i poprawnie wyprowadziły postać zamkniętą.
Potem Gemini się zatrzymał. Wypisał p(19) jako nieobliczony wyraz z 19. potęgą pierwiastka, nigdy nie podał liczby i nigdy nie wykazał liczby składowych, których wymagało polecenie. Wszystko to przedstawił w stylizowanej stronie HTML z CSS i cieniem, o który nikt nie prosił.
Qwen dokończył. Dał pełny rozkład na 10 składowych — jedną liniową i dziewięć kwadratowych — rozwinął rekurencję do 1 876 572 071 974 094 803 391 179 i modularnie sprawdził wynik. Zweryfikowaliśmy tę wartość niezależnie w SymPy i się zgadza.
Qwen wygrywa w jedynej kategorii, która miała znaczenie. Gemini zaczął dobrze i postanowił pominąć arytmetykę, co jest dziwnym miejscem na zatrzymanie się.
Wniosek
Gemini 3.7 Flash jest wart przejścia, jeśli już funkcjonujesz w ekosystemie Google. Jest zdecydowanie lepszy w kodowaniu niż model, który zastępuje, wystarczająco szybki do pracy agentowej i na tyle tani, że używanie go na dużą skalę to drobny koszt.
Jego mocne strony to wykonanie i struktura. Daj mu szczegółową specyfikację, a zbuduje rzecz, utrzyma fabułę i zachowa spójność przyczynową przez tysiące słów.
Jego słabości to kreatywność i rozumowanie. Pismo jest na tyle przewidywalne, że widać od razu, iż jest maszynowe, a model podaje błędne odpowiedzi bez zaznaczenia założenia, które je uczyniło błędnymi.
Cena jest jego najmocniejszym argumentem. Przy 75 centach za milion tokenów wejściowych i 3,75 dolara za wyjściowe podcina stawkę GPT-5.6 Sol wynoszącą 5 dolarów za wejściowe o 85% i kosztuje połowę tego, co 3.6 Flash przy premierze.
Argument przeciwko niemu to darmowy model 27B działający na gamingowym GPU, który napisał lepszą historię i nic za to nie pobrał. Wprowadzona przez Google stawka promocyjna kończy się 31 grudnia, kiedy wejście wzrośnie do 1,50 dolara, a wyjście do 7,50 dolara.