新聞股票xAI 歷經多次延遲後推出 Grok 4.7,基準測試仍落後前沿競爭對手

xAI 歷經多次延遲後推出 Grok 4.7,基準測試仍落後前沿競爭對手

作者: Decrypt·

重點速覽

  • Grok 4.7 擁有 2.1 兆個參數,較 Grok 4.6 的 1.5 兆增加 40%,定價為每百萬輸入代幣 2 美元、每百萬輸出代幣 6 美元。
  • xAI 以 SpaceX 資料補充模型訓練,包括 Starlink 衛星遙測數據、製造紀錄與工程故障日誌,旨在提升對硬體與物理系統的推理能力。
  • 早期基準測試結果顯示,Grok 4.7 在 GDPval(1695 對 1735)與 AA-Briefcase(1657 對 1678)上位居第二,落後於 Claude Fable 5.1;在 EEBench 電機工程測試上則落後於 GPT-6 Astra。
  • 此次發布之前,自 7 月下旬以來至少五次修改發布時程;模型已立即上線,無需候補名單,可在 Grok 應用程式、Cursor、Grok Build 與 xAI API 使用。
  • Musk 表示 Grok 4.7 應大致與 Anthropic 的 Claude Opus 5.0 相當,並勾勒即將推出的模型——Grok 4.8、Grok 4.9 與可能領先前沿的 Grok 5——但未給出發布日期。
xAI 歷經多次延遲後推出 Grok 4.7,基準測試仍落後前沿競爭對手

Elon Musk 旗下的 xAI 於週一下午發布迄今最強的模型 Grok 4.7,公司稱其為「在相同價格與速度下較 Grok 4.6 的顯著改進」。

早期基準測試結果顯示,該模型在 GDPval 與 AA-Briefcase 上位居第二,落後於 Claude Fable 5.1;在電機工程基準測試 EEBench 上則落後於 GPT-6 Astra。

此次發布之前經歷了一連串延期。自 7 月下旬以來,Musk 至少五次下修發布時程:先是「四週後」,接著「幾週內」,然後「3 到 4 週」,9 月 1 日說「10 天」,最後在 9 月 11 日表示「還需要幾天時間完成」。

這次沒有候補名單。Grok 4.7 已立即在 Grok 應用程式、Cursor、Grok Build 與 xAI API 上線。

Musk 隨後在 X 上發文,稱 Grok 4.7 是「智慧、速度與低成本的強大結合」。

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO

SpaceXAI (@SpaceXAI) September 21, 2026

根據 xAI 的官方公告,該模型在處理難題時會花費更長時間,並且比 Grok 4.6 更頻繁地覆核自己的答案,同時配備公司所稱迄今最強的安全防護機制。

規模、定價與 SpaceX 資料

Grok 4.7 擁有 2.1 兆個參數,較 Grok 4.6 的 1.5 兆增加 40%,而 Grok 4.6 本身則是 Grok 4.5 的改良版本。定價為每百萬輸入代幣 2 美元、每百萬輸出代幣 6 美元。參數是模型在訓練過程中調整的內部旋鈕,數量越多通常代表學習模式的能力越強;而代幣則是 AI模型可讀取或生成的基本資訊單位。

xAI 還納入了取自 SpaceX——Musk 的火箭公司——的補充訓練資料:Starlink 衛星遙測數據、製造紀錄與工程故障日誌。其賣點是一個在硬體與物理系統推理方面,優於任何僅以網路文字訓練的模型。

基準測試呈現熟悉的故事

GDPval 衡量模型在真實、具經濟價值的知識工作上的表現——包括法律備忘錄、試算表與簡報——使用由各領域在職專業人士審核的任務,並以 Elo 評分計分,也就是國際象棋所使用的對戰排名系統。Grok 4.7 在 GDPval 上獲得 1695 分,而 Claude Fable 5.1 以 1735 分居首——在 Elo 評分上差距 40 分。

由 Artificial Analysis 開發的 AA-Briefcase 測試串連研究、分析與文件製作的數小時辦公工作,同樣以 Elo 評分計分。Grok 4.7 得分 1657,對比 Fable 5.1 的 1678——差距較小的 21 分,但結果相同,只是測試不同。

CursorBench 4.0 是 Cursor 針對其編輯器內真實編碼任務的基準測試,將準確度與每項任務消耗的成本和代幣數量進行對比。Grok 4.7 落在中間:每項任務成本高於 GPT-6 Astra(GPT-5.6 Sol 的後繼者)與 Claude Sonnet 5,但仍不及 Fable 5.1——後者在圖表上的每個價格區間都勝出。

xAI 的慣性模式

該公司多次推出的旗艦模型在獨立評估中落後於競爭對手。Grok 4.5 於 7 月亮相,擁有業界最大的訓練叢集,但在 Claude 與 OpenAI 的模型之後排名第三。在此之前,Grok 4.20 以可靠性換取速度與個性,而 Grok 4.6 在編碼自主性上也落後於前沿陣營。

這些都不會讓 Grok 4.7 成為糟糕的產品——對於透過 X、獨立應用程式或 Tesla 儀表板與其對話的數百萬使用者而言。這只意味著,最有可能回答使用者問題或驅動其車輛語音助理的模型,其背後系統在自家開發商的基準測試中位列頂端之下的一級。

正是這一差距,使得對大多數人而言,價格比排行榜名次更重要。xAI 在每代幣成本上持續低於 Anthropic 與 OpenAI,即使其原始能力落後,押注「夠用、便宜、無所不在」在日常使用的大部分場景中勝過「最強但更貴」。

Musk 的期望與未來之路

Musk 在發布前數日已先調低期望,在 X 上寫道,Grok 4.7 應「大致與」Anthropic 的 Claude Opus 5.0「相當」——而非較新的 Opus 5.1——且多模態性能仍需改進。

在同一則貼文中,他勾勒了接下來的三款模型:Grok4.8 作為有意義的躍升,Grok 4.9 達到「Astra/Fable 級別」,而 Grok 5 則可能是前沿領先者。這些升級尚未確定發布日期——考慮到 Grok 4.7 自身的時程在發布前至少被下修五次,這一細節更顯分量。他寫道:「我們走著瞧。」