新聞股票Gemini 3.7 Flash 評測:Google 的平價模型在程式碼上表現出色,但在創意與推理上仍有不足

Gemini 3.7 Flash 評測:Google 的平價模型在程式碼上表現出色,但在創意與推理上仍有不足

作者: Decrypt·

重點速覽

  • Gemini 3.7 Flash 在 zero-shot 程式碼測試中表現出色,只用 2 分 13 秒就生成可遊玩的瀏覽器遊戲;相較之下,Gemini 3.6 Flash 產出的檔案無法運作,最後還得靠 DeepSeek 修補。
  • 在創意寫作比較中,該模型輸給了免費的社群微調模型 Qwopus3.5-27B-v3;後者在單張消費級 GPU 上執行,並且遵守了提示詞刻意設定的結構規則。
  • Gemini 3.7 Flash 在橋樑題中回答 17 分鐘,但正確答案其實是 10 分鐘;它和 Claude Fable 5 一樣,都默認了一個提示詞未寫明的雙人限制。
  • 在一題 19 次多項式問題中,該模型雖然正確辨識 Dickson 多項式並推導閉式,卻沒有算出 p(19);Qwen 3.7 Max Preview 則完成了完整計算。
  • 在 12 月 31 日前,該模型每百萬輸入 token 的價格為 0.75 美元,比 3.6 Flash 上線時便宜一半,也比 GPT-5.6 Sol 的 5 美元輸入費便宜 85%;1 月 1 日後將上漲至 1.50 美元。
Gemini 3.7 Flash 評測:Google 的平價模型在程式碼上表現出色,但在創意與推理上仍有不足

Gemini 3.7 Flash 僅用 2 分 13 秒,就從一個單一提示詞生成了可遊玩的瀏覽器遊戲——這是其前代 Gemini 3.6 Flash 在三週前完全無法完成的任務。

它在我們的橋樑邏輯題中給出了與 Claude Fable 5 相同的錯誤答案,並且在已正確建立的數學題上止步於計算之前。

該模型在 12 月 31 日前的輸入費率為每百萬 token 75 美分——是 3.6 Flash 費率的一半——並將於 1 月 1 日翻倍至 1.50 美元。

Google 於 8 月 13 日推出 Gemini 3.7 Flash,首日即在超過 160 個國家/地區可用。它最多可處理一百萬個輸入 token,輸出 64,000 個 token,可讀取圖片、影片、音訊與 PDF,並可呼叫工具與操控電腦。

Flash 從來不是你在遇到棘手問題時會先選用的模型。它更適合用來整理文字、在 agent 會話因上下文過長而崩潰前壓縮內容,以及摘要那些你不想付費讓旗艦模型閱讀的文件。若以這類工作衡量,3.7 Flash 確實是明顯升級;若以其他標準衡量,它只是個稱職的模型,甚至會被你能免費下載的軟體寫得更好。

Google 自家的基準表將 3.7 Flash 放在 Claude Sonnet 5 與 GPT-5.6 Terra 之前,在 18 項測試類別中的 11 項領先。其亮眼數字包括 Code Arena 網頁開發榜單的 1,588 Elo,以及 AutomationBench 的 30.4%。這些都出自 Google 自家方法,因此應將其視為公司主張,而非已定論的事實。

我們測試了這款模型,看它是否能兌現 Google 的說法。以下是結果。

程式碼:它能否第一次就做出能跑的東西?

這項測試衡量的是 zero-shot 程式生成——模型能否在沒有範例可抄、也沒有自我修正機會的情況下,把一條指令變成可運行的軟體。我們只給出一個瀏覽器遊戲的提示詞,然後直接採用回傳內容,連同其中的錯誤一起。沒有追問、沒有錯誤報告、沒有第二次嘗試。

Gemini 3.7 Flash 以 2 分 13 秒通過。遊戲首次執行就可遊玩,語法乾淨,碰撞與計分邏輯正常,視覺品質也高於這個價格層級所暗示的水準。

這裡真正重要的對比不是旗艦模型,而是 7 月 21 日發布的 Gemini 3.6 Flash,它根本無法產生可用檔案。HTML 結構錯誤、元素無法渲染,而要求它修復自己輸出的後續提示也毫無進展。

最後我們把那堆殘破結果交給 DeepSeek,它找出 11 個錯誤並提交 8 項修正,使其可遊玩。三週後,同一產品線已無需救援,結果也接近 GPT-5.6 Sol 在我們 7 月評測中的表現

Gemini 3.7 Flash 在這一項完全勝出,也是最強烈的升級理由。需要注意的是,它是按規格執行,而不是自行發明,因此模糊提示只會得到一款模糊的遊戲。

你可以在 這裡 試玩 Gemini 3.7 Flash 的遊戲。

創意寫作:它能否同時維持悖論並寫出句子?

這一部分同時測試兩件事:文學品質,以及模型能否在數千字中遵守一條結構規則。提示詞將 Jose Lanz 從 2150 年送回 1000 年,並要求一個封閉的因果循環——他的介入必須成為他前來阻止之未來的成因。

決定這項測試的規則是最後一個條件:他在回家之前不能理解自己做了什麼。

Gemini 3.7 Flash 生成了一個不錯的結果。Jose 將一門熵炮射入比利牛斯山裂隙,意外鑄成一座奴役 22 世紀伊比利亞的方尖碑,並且在仍站在一千年前泥地中的情況下理解整個循環:「It was the base of the Cinder Spire.」

這套情節機制其實相當完整。故事提到古代修士目擊到一顆墜落的星,而後澄清那其實是 Jose 抵達時的閃光;他帶來用來抹除異常的武器,反而正是製造異常的原因。結尾句——「It had simply been waiting for him to complete it」——也成功呈現了提示詞要求的決定論。

但對熟悉這種風格的人來說,這故事很「AI」。幾乎每個名詞都帶著兩個形容詞:「hyper-luminescent towers」、「damp, moss-choked earth」、「thick, obsidian hair」。這就是模型在挑選最可能的下一個詞,而不是在做真正選擇時的質感,並會產生像一座方尖碑「humming with a low-frequency hum」這類撞車式表述。

我們將它與 Qwopus3.5-27B-v3 比較,這是 Qwen3.5-27B 的社群微調版本,提煉了類似 Claude Opus 的推理風格,並可在單張消費級 GPU 上、每次查詢零成本執行。它遵守了 Gemini 破壞掉的規則。

Jose 在 San Millán de la Cogolla 殺死了一名修士;那是拉里奧哈一座真實存在、而且在 1000 年左右確實重要的修道院。直到他返回 2150 年、在一份蠟封抄本中找到自己的 DNA 後,他才理解自己做了什麼。

Qwopus 也並非完全乾淨。它把完整的規劃草稿直接放在故事上方,連拼字錯誤也一併保留;而且它的最後一節又打破了自己花八節建立的封閉循環,讓 Jose 回去修正事情。

但整體而言,Qwopus 更勝一籌。Gemini 的包裝更整潔、結尾也更克制,但它沒能遵守提示詞最核心的那條指令;而一個在遊戲 GPU 上跑的免費模型,寫出了更好的故事。

聯想思維:隱喻能否承載論證?

這項測試衡量的是聯想推理——模型能否在不必自我解釋的情況下,建立看似無關概念之間的連結。提示詞要求先描述一根嫩枝,再用這段描述解釋勞工剝削與對富人的崇拜,最後讓論證自然消解為對一顆萵苣的描述。

失敗模式是明示化;一旦把隱喻點名,隱喻就死了。

Gemini 在第二段開頭就把它點破了:「This is the precise mechanics of the modern proletariat.」在那之前一切都還有效。

有些意象確實站得住腳。工人得到「just enough bark to stay rigid for another week of output」,而倒下的嫩枝被訓練成相信,只要夠僵硬,任何一根都可能變成樹幹。包含前者的那段也寫到一名工人「bound to an vast, top-heavy corporate hierarchy」。就邏輯與結構而言,還算不錯。

真正的崩塌發生在消解過程。Gemini 不是在完成轉換,而是在敘述轉換——那些階層「crumble, dissolving into the quiet, humble reality of the organic world underneath」——然後萵苣就這樣憑空出現,與前文毫無關聯。

GPT-5.6 Sol 則把嫩枝腐化成土壤,再讓萵苣從土中長出來:「Rain enters the grain. Fibers loosen, darken.」論證也被埋進物件之中,將財富重新表述為一種美德語言,其中「The mansion signifies intelligence.」

GPT-5.6 Sol 大幅勝出。Gemini 雖然寫出了一句漂亮的單句,但它解釋了自己的隱喻,卻跳過了提示詞明確要測試的轉換步驟。

邏輯:它是在讀題,還是在辨識題型?

這項測試衡量的是非數學推理,特別是模型究竟是在閱讀眼前的問題,還是在套用記憶中的題型。我們的橋樑題給出四個人、一支火把,以及 1、2、5、10 分鐘的過橋時間,然後問他們全部過橋需要多久。

關鍵在於提示詞刻意省略了什麼。它從未說明一次只能有兩個人站在橋上,因此答案是 10 分鐘——每個人都以最慢者的速度一起走過去。

Gemini 回答 17 分鐘,直接套用了教科書版本的五步驟排列法。它把某個限制當作事實,卻從未確認那是不是我們實際寫出的條件。

它的可見推理甚至比答案更糟。推理鏈聲稱,讓兩個最慢的人一起過橋效率很差,因為必須有人把火把帶回來;但最後答案卻又讓他們一起過橋。它在同一次回應裡自相矛盾,卻依然以十足自信報出結果。

Claude Fable 5 早在 7 月也落在同一個錯誤數字上。它一開始就先聲明自己的假設:「assuming the classic constraint that the bridge holds only two people at a time」,這就是可被抓出的錯誤與無法被抓出的錯誤之間的差別。

沒有人勝出。僅就透明度而言,Fable 略勝一籌;而 Gemini 在 agent 測試中展現出的那種虛假自信,也在這個可以手算驗證的題目上暴露無遺。

數學:它能把題目做完嗎?

這項測試衡量的是遠超一般消費用途的符號數學能力,以及更簡單的一點——模型是否真的照做。提示詞要求一個 19 次、奇次、首一、實係數且線性係數為 -19 的多項式,其曲線至少分裂為三個不可約組件,然後求 p(19)。

兩個模型都找到了同一道門。Gemini 與 Qwen 3.7 Max Preview 都辨識出 Dickson 多項式,解出條件將參數固定為 1,並正確導出閉式。

接著 Gemini 停住了。它把 p(19) 寫成一個包含平方根 19 次方的未求值表達式,既沒有算出數字,也沒有證明提示詞要求的組件數量。更離譜的是,這一切還被塞進一個帶 CSS 與陰影效果的樣式化 HTML 頁面裡,而這根本沒人要求。

Qwen 完成了。它給出了完整分解,共 10 個組件——1 個線性、9 個二次——將遞迴推到 1,876,572,071,974,094,803,391,179,並以模運算交叉驗證結果。我們也在 SymPy 中獨立驗證了這個數值,結果成立。

Qwen 贏在唯一真正重要的標準上。Gemini 一開始表現不差,卻決定省略算術,這是個很奇怪的停下來的位置。

結論

如果你本來就身處 Google 生態系,Gemini 3.7 Flash 值得升級。它在程式碼上的表現遠勝其替代品,速度足以滿足 agent 工作,且成本低到大量使用也只是零頭。

它的強項是執行與結構。只要給它一份詳細規格,它就能把東西做出來、把情節撐住,並在數千字內維持因果邏輯一致。

它的弱項是創意與推理。它的文字風格一眼就能看出是機器生成,而且在回答錯誤時,常常不會標明導致錯誤的前提假設。

價格是它最強的賣點。每百萬輸入 token 75 美分、輸出 3.75 美元,讓它比 GPT-5.6 Sol 的 5 美元輸入費便宜 85%,也只相當於 3.6 Flash 上線時費用的一半。

反對它的理由,則是一個在遊戲 GPU 上運行的免費 27B 模型:它寫出了更好的故事,而且完全不收費。Google 的入門價格將在 12 月 31 日到期,屆時輸入價格翻倍至 1.50 美元,輸出則為 7.50 美元。