Gemini 3.7 Flash 评测:谷歌的低价模型在代码上表现出色,但在创造力和推理上仍有不足
要点速览
- •Gemini 3.7 Flash 通过了零样本编码测试,在 2 分 13 秒内生成了一个可玩的浏览器游戏,而前代 Gemini 3.6 Flash 产出了不可运行的文件,最终还需要 DeepSeek 修复。
- •该模型在创意写作对比中输给了 Qwopus3.5-27B-v3;后者是一个可在单张消费级 GPU 上运行的免费社区微调模型,并且遵守了提示词要求的结构规则。
- •在桥梁题上,Gemini 3.7 Flash 给出了 17 分钟的错误答案,而正确答案是 10 分钟;它与 Claude Fable 5 之前的错误一样,都是假设了提示词并未给出的“两人过桥”限制。
- •在一道 19 次多项式题上,模型正确识别了 Dickson 多项式并推导出闭式形式,但没有算出 p(19);Qwen 3.7 Max Preview 则完成了完整计算。
- •在 12 月 31 日前,每百万输入 token 费用为 0.75 美元,这比 3.6 Flash 上市时便宜一半,也比 GPT-5.6 Sol 的 5 美元输入费低 85%;1 月 1 日起将翻倍至 1.50 美元。

Gemini 3.7 Flash 在 2 分 13 秒内根据单一提示词生成了一个可玩的浏览器游戏,而它的前代 Gemini 3.6 Flash 在三周前则彻底失败。
它在桥梁逻辑题上给出了与 Claude Fable 5 相同的错误答案,并且在已正确搭建好的数学题上停在了实际计算之前。
该模型在 12 月 31 日前的输入价格为每百万 token 75 美分——只有 3.6 Flash 费率的一半——随后会在 1 月 1 日翻倍至 1.50 美元。
谷歌于 8 月 13 日发布 Gemini 3.7 Flash,首日就在 160 多个国家/地区广泛可用。它最多可处理 100 万个输入 token,输出 64,000 个 token,可读取图像、视频、音频和 PDF,也可以调用工具并操作计算机。
Flash 从来都不是你在难题面前会优先选择的模型。它更适合用于整理文本、压缩代理会话,避免上下文过载而崩溃,以及总结你不想付旗舰模型费用去阅读的文档。放在这类任务上衡量,3.7 Flash 的确是一次明显升级;放在其他任务上看,它只是一个合格的模型,但其输出会被你可以免费下载安装的软件反向超越。
谷歌自己的基准测试表显示,3.7 Flash 在 18 个测试类别中的 11 个上领先于 Claude Sonnet 5 和 GPT-5.6 Terra。头条数字包括 Code Arena 网页开发榜的 1,588 Elo,以及 AutomationBench 的 30.4%。这些都来自谷歌的方法论,因此应将其视为公司自身的说法,而不是已被定论的事实。
我们测试了这款模型,看看它是否符合谷歌的说法。以下是结果。
编程:它能否一次就做出可运行的东西?
这项测试衡量的是零样本代码生成——也就是模型能否把一条指令直接变成可运行的软件,没有示例可抄,也没有机会自我修复。我们只给它一个浏览器游戏提示词,然后把返回结果 그대로 交付,连同错误一并保留。不追问,不报错,不再试一次。
Gemini 3.7 Flash 在 2 分 13 秒内通过。游戏首次运行即可游玩,语法干净,碰撞与计分逻辑正常,视觉质量也高于这个价位所预期。
这里真正重要的比较对象不是旗舰模型,而是 Gemini 3.6 Flash,它于 7 月 21 日发布,却根本无法产出可运行文件。HTML 结构损坏,元素无法渲染,而要求它修复自身输出的后续提示词也没有任何效果。
最后我们把那堆烂摊子交给 DeepSeek,后者找出了 11 个 bug,并给出 8 项修复,让它可以游玩。三周后,同一条产品线已经不再需要救援,结果也接近 我们在 7 月评测中 GPT-5.6 Sol 的表现。
Gemini 3.7 Flash 在这一项上全面胜出,也是最有力的升级理由。需要注意的是,它执行规格说明,而不是创造规格;因此,模糊提示词只会得到一个模糊的游戏。
你可以在这里试用 Gemini 3.7 Flash 的游戏。
创意写作:它能否同时保持悖论并写出一句话?
这一部分同时测试两件事:文学质量,以及模型能否在数千字中遵守结构规则。提示词让 Jose Lanz 从 2150 年回到 1000 年,并要求形成一个封闭的因果循环——他的介入必须成为创造他本来想阻止的未来的原因。
决定这项测试的最后一句规则是:在回家之前,他不能理解自己做了什么。
Gemini 3.7 Flash 生成了一个不错的结果。Jose 将一门熵炮射入比利牛斯山的一道裂缝,意外铸造出一座奴役 22 世纪伊比利亚半岛的方尖碑,并且在一千年前、脚下仍是泥地时就领悟了整个闭环:"It was the base of the Cinder Spire."
故事机制其实相当稳。文中提到一颗流星,古代僧侣目睹后被解释为 Jose 自身到来的闪光,而他带来用于抹除异常的武器,恰恰造就了这件事。结尾一句——"It had simply been waiting for him to complete it"——准确落到了提示词所要求的决定论上。
但对于熟悉这种文风的人来说,这个故事很有“AI 味”。几乎每个名词都挂着两个形容词:"hyper-luminescent towers"、"damp, moss-choked earth"、"thick, obsidian hair"。这正是模型在选择最可能的下一个词,而不是在真正挑选词语时的质感,也会产生诸如一座方尖碑 "humming with a low-frequency hum" 这样的碰撞。
我们将它与 Qwopus3.5-27B-v3 进行比较。后者是 Qwen3.5-27B 的社区微调版本,提炼了 Claude Opus 风格的推理能力,并且在一张消费级 GPU 上即可运行,查询成本为零。它遵守了 Gemini 违背的规则。
Jose 在 San Millán de la Cogolla 杀死了一名僧侣;那是拉里奥哈一个真实的修道院,在 1000 年左右确实具有重要意义。只有在返回 2150 年、并在一份蜡封抄本中发现自己的 DNA 之后,他才理解自己做了什么。
Qwopus 也并非完全干净。它把完整的规划草稿直接放在故事上方,连拼写错误都保留了;而其最后一节又通过让 Jose 回去修正事情,破坏了它花了八个部分才建立起来的闭环。
但综合来看,Qwopus 胜出。Gemini 提供了更整洁的包装和更克制的结尾,但它没有完成提示词围绕的那一条关键指令,而一个运行在游戏 GPU 上的免费模型写出了更好的故事。
联想思维:隐喻能否承载论证?
这项测试衡量的是联想推理——模型能否在不自我解释的情况下,把看似无关的概念联系起来。提示词要求先描述一根小枝,再用这段描述解释工人剥削与对富人的膜拜,最后还必须让论证自然消解为对一棵生菜的描述。
失败模式在于“点题式说明”。把隐喻说出来,隐喻就死了。
Gemini 在第二段开头就点破了隐喻:"This is the precise mechanics of the modern proletariat." 在这之前的一切都还有效。
部分意象确实站得住脚。工人得到的 "just enough bark to stay rigid for another week of output",而倒下的细枝则被训练得相信,只要足够僵硬,任何一根都可能长成树干。包含前一句的那一段,还写到一个工人 "bound to an vast, top-heavy corporate hierarchy." 逻辑和结构都不算差。
真正的崩塌发生在消解部分。Gemini 不是在表现转化,而是在叙述转化——那些层级 "crumble, dissolving into the quiet, humble reality of the organic world underneath"——随后一棵生菜就这样凭空出现,与前文完全脱节。
GPT-5.6 Sol 则把小枝烂成泥土,再从泥土里长出生菜:"Rain enters the grain. Fibers loosen, darken." 论证也同样埋在对象之中,财富被重新定义为一种美德语言,其中 "The mansion signifies intelligence."。
GPT-5.6 Sol 以明显优势胜出。Gemini 产出了一句不错的单独句子,但它把自己的隐喻解释了出来,然后跳过了提示词明确要测试的过渡部分。
逻辑:它是在读题,还是在识别套路?
这项测试衡量的是非数学推理,尤其是模型到底是在读眼前的问题,还是在模式匹配它记住的版本。我们的桥梁题提示词给出四个人、一支火把,以及 1、2、5、10 分钟的过桥时间,然后问他们全部过桥需要多久。
关键在于提示词遗漏了什么。它从未说桥上一次只能有两个人,所以答案是 10 分钟——所有人以最慢者的速度一起过去。
Gemini 回答了 17 分钟,沿用了教科书版题目的那套五步搬运法。它把一个限制当成既定事实,却从未确认我们是否真的写了这个限制。
它展示出来的推理比答案还糟。推理链先说把两个最慢的人一起送过去会很低效,因为总得有人把火把带回来——然后最终答案却又让他们一起过去。它在同一个回答里自相矛盾,却仍以十足自信给出结果。
Claude Fable 5 在 7 月也给出了同样的错误数字。它开头先声明自己在假设什么,"assuming the classic constraint that the bridge holds only two people at a time," 这就是一个你能看出来的错误答案,和一个你看不出来的错误答案之间的区别。
没有赢家。仅凭透明度,Fable 胜出;而 Gemini 在各个 agent 运行中表现出的那种错误自信,也在这道可以手算检验的题里暴露无遗。
数学:它能把题做完吗?
这项测试衡量的是远超消费级使用场景的符号数学能力,更简单地说,就是模型会不会真的照着要求做。提示词要求一个 19 次奇首一多项式,系数为实数,线性项系数为 -19,而且它的曲线必须分裂成至少三个不可约分量,然后再求 p(19)。
两个模型都找到了同一扇门。Gemini 和 Qwen 3.7 Max Preview 都识别出了 Dickson 多项式,解出约束并将参数固定为 1,也都正确推导出了闭式形式。
然后 Gemini 停下了。它把 p(19) 打印成了一个未求值的表达式,里面涉及平方根的 19 次幂,既没有给出数值,也没有展示提示词同样要求的分量数量。它还把这一切塞进了一个带 CSS 和阴影效果的样式化 HTML 页面中,而这些根本没人要求。
Qwen 则完成了全部步骤。它给出了完整分解,共 10 个分量——1 个线性项、9 个二次项——把递推一直算到 1,876,572,071,974,094,803,391,179,并通过模运算交叉验证了结果。我们在 SymPy 中独立验证了这个数值,结果成立。
Qwen 在唯一重要的标准上胜出。Gemini 一开始还不错,然后决定跳过算术,这实在是一个很奇怪的停点。
结论
如果你已经在谷歌生态系统内,Gemini 3.7 Flash 值得升级。它在代码上的表现远好于被替代的前代模型,速度足以支撑 agent 工作,而且便宜到大规模运行也只是零头。
它的强项是执行和结构。给它一个详细规格,它就能把东西做出来、把故事线维持住,并让因果逻辑在数千字中保持连贯。
它的弱项是创造力和推理。其写作风格可预测到一眼就能看出是机器产物,而模型在给出错误答案时,也没有标注导致错误的前提假设。
价格是它最有力的卖点。每百万输入 token 0.75 美元、输出 3.75 美元,使它比 GPT-5.6 Sol 的 5 美元输入费低 85%,也只有 3.6 Flash 上市时价格的一半。
反对它的理由则是:一个免费、运行在游戏 GPU 上的 27B 模型,写出了更好的故事,而且分文不收。谷歌的优惠价将在 12 月 31 日结束,届时输入价格翻倍至 1.50 美元,输出价格为 7.50 美元。