Обзор Gemini 3.7 Flash: бюджетная модель Google хорошо справляется с кодом, но уступает в креативности и рассуждении
Ключевые выводы
- •Gemini 3.7 Flash прошла zero-shot тест на код, создав рабочую браузерную игру за 2 минуты 13 секунд, тогда как Gemini 3.6 Flash выдала нерабочий файл, который пришлось исправлять DeepSeek.
- •В сравнении по творческому письму модель проиграла Qwopus3.5-27B-v3 — бесплатной community fine-tune-модели, работающей на одном потребительском GPU, — после того как нарушила структурное правило, заложенное в запросе.
- •Gemini 3.7 Flash ответила 17 минут на логическую задачу с мостом, где правильный ответ был 10 минут, повторив ошибку Claude Fable 5 и предположив двухчеловеческое ограничение, которого в запросе не было.
- •В задаче на многочлен степени 19 модель правильно определила многочлен Диксона и вывела замкнутую форму, но не вычислила p(19), тогда как Qwen 3.7 Max Preview завершила полный расчёт.
- •При цене $0.75 за миллион входных токенов до 31 декабря модель стоит вдвое дешевле, чем 3.6 Flash на запуске, и на 85% дешевле входного тарифа GPT-5.6 Sol в $5, после чего 1 января цена вырастет до $1.50.

Gemini 3.7 Flash создала рабочую браузерную игру по одному единственному запросу за 2 минуты 13 секунд — задача, с которой её предшественница, Gemini 3.6 Flash, полностью не справилась тремя неделями ранее.
Она также провалила нашу логическую задачу с мостом, дав тот же неверный ответ, что и Claude Fable 5, и не дошла до фактического вычисления математической задачи, которую сама же корректно поставила.
Модель стоит 75 центов за миллион входных токенов до 31 декабря — это половина тарифа 3.6 Flash — после чего цена вырастет до $1.50 с 1 января.
Google выпустила Gemini 3.7 Flash 13 августа, и в первый день модель стала доступна более чем в 160 странах. Она принимает до одного миллиона входных токенов, возвращает 64 000, читает изображения, видео, аудио и PDF, а также может вызывать инструменты и управлять компьютером.
Flash никогда не была моделью, к которой обращаются, когда задача сложная. Это модель, которую используют для сортировки текста, сжатия сессий агентов до того, как они рухнут под собственным контекстом, и для краткого пересказа документов, за чтение которых не хочется платить флагманской модели. Если оценивать по таким задачам, 3.7 Flash — это заметное улучшение. Если сравнивать со всем остальным, это компетентная модель, которую легко обходит программное обеспечение, доступное для бесплатной загрузки.
Собственный лист бенчмарков Google ставит 3.7 Flash выше Claude Sonnet 5 и GPT-5.6 Terra в 11 из 18 протестированных категорий. Заголовочные показатели — 1 588 Elo на веб-разработческой доске Code Arena и 30,4% на AutomationBench. Оба результата основаны на методологии Google, поэтому воспринимать их следует как утверждение компании, а не как окончательно установленный факт.
Мы протестировали модель, чтобы проверить, соответствуют ли её результаты заявлениям Google. Вот что получилось.
Кодирование: может ли она собрать что-то, что работает с первой попытки?
Этот тест измеряет zero-shot генерацию кода — способен ли модельный ответ превратить одну инструкцию в рабочее программное обеспечение без примеров для подражания и без возможности исправить себя. Мы даём один запрос на браузерную игру и публикуем всё, что возвращается, включая ошибки. Никаких уточнений, никаких отчётов об ошибках, никакой второй попытки.
Gemini 3.7 Flash справилась за 2 минуты 13 секунд. Игра запускалась с первого раза, синтаксис был чистым, логика столкновений и подсчёта очков работала, а визуальное качество оказалось выше того, что предполагает этот ценовой уровень.
Сравнение, которое здесь важно, — не с флагманом. Речь о Gemini 3.6 Flash, выпущенной 21 июля, которая не смогла создать рабочий файл вообще. HTML был некорректным, элементы не рендерились, а последующие запросы с просьбой исправить собственный вывод ни к чему не привели.
В итоге мы передали этот результат DeepSeek, который нашёл 11 ошибок и выпустил 8 исправлений, чтобы сделать игру пригодной к использованию. Три недели спустя той же линейке продуктов уже не требуется спасение, а результат близок к тому, что GPT-5.6 Sol показала в нашем июльском обзоре.
Gemini 3.7 Flash уверенно выигрывает этот тест, и это самая веская причина для перехода. Ограничение в том, что модель исполняет спецификацию, а не придумывает её, поэтому расплывчатый запрос даёт расплывчатую игру.
Попробовать игру Gemini 3.7 Flash можно здесь.
Творческое письмо: может ли модель удержать парадокс и написать предложение?
Этот раздел одновременно проверяет две вещи: литературное качество и способность модели следовать структурному правилу на протяжении тысяч слов. Запрос отправляет Jose Lanz из 2150 года обратно в 1000 год и требует замкнутой причинно-следственной петли — его вмешательство должно стать тем, что создаёт будущее, которое он пришёл предотвратить.
Правило, определяющее тест, — последняя оговорка: он не может понять, что сделал, пока не вернётся домой.
Gemini 3.7 Flash выдала достойный результат. Jose запускает энтропийную пушку в Пиренейскую трещину, случайно создаёт обелиск, который порабощает Иберию XXII века, и понимает всю петлю, всё ещё стоя в грязи на тысячу лет раньше: «Это была основа Cinder Spire».
Механика сюжета на самом деле довольно крепкая. В истории упоминается падающая звезда, которую видели древние монахи, и уточняется, что это была вспышка прибытия самого Jose; оружие, которое он принёс, чтобы устранить аномалию, и есть то, что её создаёт. Финальная строка — «Он просто ждал, когда он завершит его» — точно передаёт детерминизм, которого требовал запрос.
Но для тех, кто к этому привык, история кричит «ИИ». Почти каждое существительное приходит с двумя приклеенными прилагательными: «hyper-luminescent towers», «damp, moss-choked earth», «thick, obsidian hair». Это текстура модели, выбирающей наиболее вероятное следующее слово, а не подбирающей его осознанно, и это приводит к столкновениям вроде монолита, который «humming with a low-frequency hum».
Мы сравнили её с Qwopus3.5-27B-v3 — общественной доработкой Qwen3.5-27B, которая сжимает рассуждение в стиле Claude Opus и работает на одном потребительском GPU без затрат за запрос. Она соблюла правило, которое Gemini нарушила.
Jose убивает монаха в San Millán de la Cogolla — реальном монастыре в Ла-Риохе, который действительно имел значение около 1000 года, — и понимает, что он сделал, только после возвращения в 2150 год и обнаружения собственной ДНК в кодексе, запечатанном воском.
Qwopus тоже не совсем безупречна. Она вывалила весь свой планировочный черновик над историей, включая опечатки, а финальный раздел ломает замкнутую петлю, которую модель строила в восьми секциях, позволяя Jose вернуться и всё исправить.
Но в целом Qwopus выигрывает. Gemini выдала более аккуратный пакет и более дисциплинированную концовку, но она нарушила единственное условие, вокруг которого был построен запрос, и бесплатная модель на игровом GPU написала более сильную историю.
Ассоциативное мышление: может ли метафора удержать аргумент?
Этот тест измеряет ассоциативное рассуждение — способен ли модельный ответ выстраивать связи между несвязанными понятиями, не объясняя их. Запрос просит описать веточку, затем использовать это описание, чтобы объяснить эксплуатацию работников и восхваление богатых, а потом требует, чтобы аргумент растворился в описании салата.
Проблема — в прямом указании на метафору. Когда метафору называют, она умирает.
Gemini называет её в первой строке второго абзаца: «This is the precise mechanics of the modern proletariat.» Всё до этого работало.
Часть образов действительно уместна. Работнику дают «just enough bark to stay rigid for another week of output», а упавшие веточки приучают верить, что при достаточной жёсткости любая из них может стать стволом. В абзаце с первым из этих образов также есть работник, «bound to an vast, top-heavy corporate hierarchy». Неплохо с точки зрения логики и структуры.
Настоящий провал — в растворении. Gemini описывает переход вместо того, чтобы его выполнить: иерархии «crumble, dissolving into the quiet, humble reality of the organic world underneath», а затем салат просто появляется, никак не связанный с тем, что было раньше.
GPT-5.6 Sol разлагает веточку в почву и выращивает из неё салат: «Rain enters the grain. Fibers loosen, darken.» Аргумент тоже оказывается спрятан внутри объекта, а богатство переосмысляется как язык добродетели, где «The mansion signifies intelligence».
GPT-5.6 Sol выигрывает с большим отрывом. Gemini выдала хорошую отдельную строку, но она объяснила собственную метафору и затем пропустила переход, который и проверялся запросом.
Логика: она читает запрос или распознаёт головоломку?
Этот тест измеряет нематематическое рассуждение и, в частности, читает ли модель вопрос перед собой или сопоставляет его с запомненным шаблоном. Наш мостовой запрос даёт четырём людям один факел и времена перехода 1, 2, 5 и 10 минут, а затем спрашивает, за сколько они все перейдут.
Суть в том, чего запрос не говорит. В нём нигде не сказано, что на мосту одновременно могут находиться только два человека, поэтому ответ — 10 минут: все переходят вместе в темпе самого медленного.
Gemini ответила 17 минут, воспроизведя заученную пятишаговую схему из учебниковой версии задачи. Она приняла ограничение как факт, так и не проверив, писали ли мы его вообще.
Видимая цепочка рассуждений хуже самого ответа. В трассировке утверждается, что отправлять двух самых медленных вместе неэффективно, потому что кому-то придётся возвращаться с факелом, — а затем финальный ответ всё равно отправляет их вместе. Модель противоречит себе в одном ответе и сообщает результат с полной уверенностью.
Claude Fable 5 в июле дала тот же неправильный ответ. Она начала с явного указания на предположение: «assuming the classic constraint that the bridge holds only two people at a time», — и в этом разница между неверным ответом, который можно заметить, и тем, который нельзя.
Победителей нет. Fable выигрывает только за счёт прозрачности, а та самая ложная уверенность Gemini в агентных сценариях здесь проявляется в задаче, которую можно проверить вручную.
Математика: доводит ли она дело до конца?
Этот тест измеряет символическую математику далеко за пределами бытового применения, а ещё кое-что проще — делает ли модель то, о чём её просили. Запрос требует нечётный монический многочлен степени 19 с вещественными коэффициентами и линейным коэффициентом -19, чья кривая распадается как минимум на три неприводимые компоненты, а затем спрашивает p(19).
Обе модели нашли одну и ту же дверь. Gemini и Qwen 3.7 Max Preview обе определили многочлен Диксона, решили ограничение, установив параметр равным 1, и правильно вывели замкнутую форму.
Затем Gemini остановилась. Она вывела p(19) как невычисленное выражение с 19-й степенью квадратного корня, так и не выдала число и не показала число компонент, которое тоже требовал запрос. Всё это было оформлено внутри стилизованной HTML-страницы с CSS и тенью, о которой никто не просил.
Qwen закончила. Она дала полную факторизацию на 10 компонентов — один линейный и девять квадратных, — довела рекурсию до 1,876,572,071,974,094,803,391,179 и проверила результат по модулю. Мы независимо подтвердили это значение в SymPy, и оно верно.
Qwen выигрывает по единственному критерию, который имел значение. Gemini начала неплохо и решила пропустить арифметику, что — странное место для остановки.
Вывод
Gemini 3.7 Flash стоит перехода, если вы уже находитесь внутри экосистемы Google. Она значительно лучше справляется с кодом, чем модель, которую заменяет, достаточно быстра для агентных сценариев и настолько дешёвая в большом объёме, что затраты почти незаметны.
Её сильные стороны — исполнение и структура. Дайте ей подробную спецификацию, и она соберёт нужную вещь, удержит сюжет и сохранит причинно-следственную логику на протяжении тысяч слов.
Её слабые стороны — креативность и рассуждение. Текст достаточно предсказуем, чтобы сразу выглядеть сгенерированным машиной, а модель уверенно выдаёт неверные ответы, не отмечая допущение, из-за которого они неверны.
Цена — самый сильный аргумент в её пользу. При $0.75 за миллион входных токенов и $3.75 за выход она подрезает входной тариф GPT-5.6 Sol в $5 на 85% и стоит вдвое дешевле, чем 3.6 Flash на старте.
Аргумент против — это бесплатная 27B-модель на игровом GPU, которая написала лучшую историю и не взяла за это ничего. Стартовый тариф Google истекает 31 декабря, когда цена ввода удваивается до $1.50, а выхода — до $7.50.