Z.AI 以 10 萬顆中國製晶片提供 GLM-5.3 Flash 服務,降低對輝達的依賴
重點速覽
- •Z.ai 表示,GLM-5.3 Flash 正以 10 萬顆中國製晶片處理線上查詢。
- •該公司於 8 月 20 日預覽後,於 8 月 26 日以 MIT 開源授權發布這款 3,200 億參數的模型。
- •GLM-5.3 Flash 在 9 月 9 日前的價格為每百萬輸入 token 0.075 美元、每百萬輸出 token 0.25 美元,之後將調漲。
- •該模型在盲測中吸引眾多開發者後,成為 OpenRouter 上下載次數最多的模型。
- •此一進展正值美國緊縮出口管制、以及中國政府採取行動限制採購輝達 AI 晶片之際。

中國 AI 供應商 Z.ai 表示,該公司動用 10 萬顆中國製晶片,處理其最新 AI 模型 GLM-5.3 Flash 的線上查詢。此舉顯示中國廠商正持續降低對美國晶片製造商輝達的依賴,同時也突顯 AI 模型日益走向最佳化的趨勢。
Z.ai 前身為智譜 AI,是一家源自清華大學研究社群的北京新創公司,名列中國頂尖 AI 模型開發商之一。其新模型為開放權重且多模態,意味著第三方可以下載並執行其訓練完成的參數;該模型具備低成本特性,參數量達 3,200 億。Z.ai 於 8 月 20 日以代號 Ox Alpha 首度預覽該模型,並於 8 月 26 日以 MIT 開源授權正式發布——MIT 是最寬鬆的開源授權條款之一,允許商業使用、修改與再散布。該模型專精於長情境處理、視覺驅動的代理式任務與程式碼合成。
從即日起至 9 月 9 日,GLM-5.3 Flash 的價格為每百萬輸入 token 0.075 美元、每百萬輸出 token 0.25 美元,之後將調漲為每百萬輸入 token 0.15 美元、每百萬輸出 token 0.50 美元。Token(權杖)是大約一個單字或單字片段大小的文字區塊,為模型讀取與生成的單位,也是各種 AI 服務通用的計費標準。相較之下,OpenAI 的 GPT-5.6 Luna 為每百萬輸入 token 0.20 美元、每百萬輸出 token 2 美元;Anthropic 的 Claude Opus 5 則為每百萬輸入與輸出 token 各 5 美元。
地緣政治背景
這家中國供應商決定完全採用中國晶片供應商,正值中國設法減少對輝達依賴之際。中國轉向自主,是繼美國多年來緊縮出口管制之後的發展——這套管制始於 2022 年 10 月對輝達 A100 與 H100 等先進加速器的限制——目的在於防止中國科技廠商取得最強大的輝達晶片。儘管部分管制已略有鬆綁,但 2025 年 9 月,中國政府下令阿里巴巴、字節跳動等科技巨頭停止採購輝達 AI 晶片;11 月,北京更禁止所有外國 AI 晶片進入國家出資的資料中心。
中國硬體的進展
儘管有這些舉措,許多觀察家仍認為中國在基礎設施競賽中落後。這種規模的運算叢集一直是美國最大 AI 實驗室的招牌——例如 xAI 位於曼菲斯的 Colossus 超級電腦,據報導搭載約 10 萬顆 GPU。然而,Z.ai 的策略顯示,中美兩國在 AI 晶片上的差距可能正在縮小,尤其是在過去一年代理式 AI 快速崛起、推論日益受到重視之際。推論——即執行已訓練完成的模型來回答查詢,有別於運算密集程度高得多的訓練(即建構模型的過程)——正是 Z.ai 這 10 萬顆晶片為 GLM-5.3 Flash 所執行的工作。
「在訓練最大型前沿模型方面,輝達在晶片效能、網路互連以及更廣泛的軟體生態系上,仍擁有顯著優勢,」RPA2AI Research 執行長兼創辦人 Kashyap Kompella 表示。「但推論則是另一回事。」
他補充,Z.ai 能以中國晶片大規模提供 GLM-5.3 Flash 服務,顯示中國硬體對許多大量推論工作負載而言已經足夠好用。
「這項區別很重要,因為隨著時間推移,推論很可能成為規模更大的 AI 晶片市場,」Kompella 說。「中國企業若能透過有效率的模型架構、軟體最佳化以及大規模的國產 AI 晶片叢集加以彌補,未必需要與輝達達到晶片對晶片的完全對等。」
不過,Futurum Group 分析師 Bradley Shimmin 指出,中國廠商邁向自主的最初訊號,始於 DeepSeek——這家位於杭州的實驗室,其低成本模型於 2025 年初引起全球矚目——改寫輝達 CUDA 驅動程式以加快推論速度。他表示,中國廠商一方面是在回應美國政府率先施加、中國政府隨後跟進的限制,但另一個因素是,企業「必須以手上可用的瓦時電力做到更多」。
Google(其 TPU 系列)與 Amazon(其 Trainium 晶片)等廠商則聚焦於垂直整合,亦即將 AI 技術堆疊最佳化,讓 AI 模型、基礎設施與軟體協同運用,以實現最有效率的 AI 處理。
「我們此刻見證的,是一種真實的體認:AI 的價值不僅取決於模型的能力,同樣也受到整個技術堆疊的經濟效益所驅動,」Shimmin 說。「這些廠商所做的,只是展現在硬體最佳化上投入少量資金所能創造的價值。」
模型本身
至於 GLM-5.3 Flash 本身,Kompella 表示,該模型在盲測中獲得開發者高度青睞一事意義重大。本月稍早,許多開發者在不知道該模型來自中國廠商的情況下湧入使用;它迅速成為 OpenRouter 上下載次數最多的模型。OpenRouter 是一項 API 服務,可讓開發者將請求路由至來自眾多不同供應商的模型。
「這比又一個宣稱中國模型已接近美國前沿模型的基準測試更有意思,」Kompella 說,並補充道這顯示中國開放權重模型「持續發揮制衡產業高定價的作用」。
他接著表示,對企業而言,這意味著其 AI 系統的設計必須「能依據能力、品質、成本與策略考量,將工作負載路由至不同模型,而非依賴單一模型供應商」。
儘管該模型迅速吸引大批開發者,對 Z.ai 而言是好兆頭,但這家廠商前方仍有挑戰。Kompella 表示,首先,該公司必須證明其所用的晶片能夠持續提供可靠性、經濟效益與規模。
「在模型訓練的絕對前沿,運算資源的取得仍是一項實質限制,因為輝達的優勢在那裡更難以複製,」他說。
Kompella 接著指出,這家廠商還需要說服美國與歐洲企業轉向採用——這些企業基於資料安全、法規與採購方面的疑慮,對使用由中國託管的 AI 服務仍持謹慎態度。