新闻加密货币Z.ai以10万枚中国制造芯片支撑GLM-5.3 Flash,降低对英伟达的依赖

Z.ai以10万枚中国制造芯片支撑GLM-5.3 Flash,降低对英伟达的依赖

作者: AI Business·

要点速览

  • Z.ai表示,GLM-5.3 Flash正由10万枚中国制造的芯片处理在线查询。
  • 该公司于8月20日预览该模型后,于8月26日以MIT开源许可证发布了这款拥有3200亿参数的模型。
  • 9月9日之前,GLM-5.3 Flash定价为每百万输入token 0.075美元、每百万输出token 0.25美元,此后价格将上调。
  • 该模型在盲测中吸引大量开发者后,成为OpenRouter上下载量最高的模型。
  • 这一进展发生在美国收紧出口管制、中国政府采取措施限制购买英伟达AI芯片之际。
Z.ai以10万枚中国制造芯片支撑GLM-5.3 Flash,降低对英伟达的依赖

中国AI厂商Z.ai表示,其使用了10万枚中国制造的芯片来处理其最新AI模型GLM-5.3 Flash的在线查询。此举显示中国厂商正在降低对美国芯片制造商英伟达的依赖,同时也凸显了AI模型日益优化的趋势。

Z.ai前身为智谱AI(Zhipu AI),是一家源自清华大学研究社区的北京初创公司,被视为中国领先的AI模型开发商之一。其新模型为开放权重、多模态模型,这意味着第三方可以下载并运行其训练参数;该模型成本低廉,拥有3200亿个参数。Z.ai于8月20日以代号Ox Alpha首次预览该模型,并于8月26日以MIT开源许可证(最宽松的开源许可证之一,允许商业使用、修改和再分发)正式发布。该模型专门面向长上下文处理、视觉驱动的智能体任务和代码合成。

从现在起至9月9日,GLM-5.3 Flash的价格为每百万输入token 0.075美元、每百万输出token 0.25美元。此后,价格将调整为每百万输入token 0.15美元、每百万输出token 0.50美元。Token(词元)——即模型读取和生成的文本块,大致相当于一个单词或单词片段——是各家AI服务通用的标准计费单位。相比之下,OpenAI的GPT-5.6 Luna价格为每百万输入token 0.20美元、每百万输出token 2美元,而Anthropic的Claude Opus 5为每百万输入token 5美元、每百万输出token 5美元。

地缘政治背景

这家中国厂商决定完全采用中国芯片供应商,正值中国力求减少对英伟达依赖之际。中国转向自主可控,此前美国多年来不断收紧出口管制——这一制度始于2022年10月对英伟达A100和H100等先进加速器的限制——以阻止中国科技厂商获得最强大的英伟达芯片。尽管其中一些管制已有所放松,但2025年9月,中国政府命令阿里巴巴和字节跳动等科技巨头停止购买英伟达AI芯片;同年11月,北京禁止国家资助的数据中心使用所有外国AI芯片。

中国硬件的进步

尽管有这些举措,许多观察人士仍认为中国在基础设施竞赛中处于落后地位。这种规模的集群一直是美国最大AI实验室的标志——例如,据报道,xAI位于孟菲斯的Colossus超级计算机运行在约10万枚GPU上。然而,Z.ai的策略表明,中美在AI芯片领域的差距可能正在缩小,尤其是在过去一年智能体AI急剧兴起、推理日益受到重视的背景下。推理——即运行已训练的模型来回答查询,与构建模型的训练(计算密集程度高得多的过程)相对——正是Z.ai的10万枚芯片为GLM-5.3 Flash所承担的工作。

“在训练最大规模的前沿模型方面,英伟达在芯片性能、网络互连以及更广泛的软件生态系统上仍具有显著优势,”RPA2AI Research首席执行官兼创始人Kashyap Kompella表示。“但推理则是另一回事。”

他补充说,Z.ai能够使用中国芯片大规模提供GLM-5.3 Flash服务,这表明中国硬件对于许多高吞吐量推理工作负载而言已经足够好。

“这一区别很重要,因为随着时间推移,推理很可能成为规模更大的AI芯片市场,”Kompella说。“如果中国企业能够通过高效的模型架构、软件优化以及大规模的国产AI芯片集群来弥补,它们或许不需要在芯片上与英伟达实现逐一完全对等。”

不过,Futurum Group分析师Bradley Shimmin表示,中国厂商走向独立的首批信号始于DeepSeek——这家总部位于杭州的实验室凭借低成本模型在2025年初引发全球关注——重写英伟达CUDA驱动程序以加快推理速度。他表示,中国厂商一方面是在应对最初由美国政府、随后由中国政府施加的限制,另一方面还有一个因素,即企业“需要用现有的瓦时电力做更多的事”。

谷歌(拥有TPU系列)和亚马逊(拥有Trainium芯片)等厂商正专注于垂直整合,即对AI技术栈进行优化,将AI模型、基础设施和软件结合使用,以实现最高效的AI处理。

“我们在这里看到的是一个真正的认识:AI的价值不仅取决于模型的能力,同样也取决于整个技术栈的经济学,”Shimmin说。“这些公司所做的,只是展示了在优化硬件上投入少量资金的价值。”

模型本身

Kompella表示,就GLM-5.3 Flash本身而言,它在盲测中获得开发者高度关注这一事实意义重大。本月早些时候,许多开发者在不知道该模型来自中国厂商的情况下纷纷使用它;它迅速成为OpenRouter上下载量最高的模型。OpenRouter是一项API服务,允许开发者将请求路由到来自众多不同提供商的模型。

“这比又一个声称中国模型接近美国前沿模型的基准测试更有意思,”Kompella说,并补充道,这表明中国的开放权重模型“继续发挥着制衡行业高定价的作用”。

他继续说,对企业而言,这意味着它们需要这样设计自己的AI系统:“使工作负载能够基于能力、质量、成本和战略考量在不同模型之间路由,而不是依赖于单一模型提供商。”

Kompella说,尽管该模型立即吸引大量开发者对Z.ai而言是个好迹象,但这家厂商未来仍面临挑战。首先,它必须证明其所使用的芯片能够持续提供可靠性、经济性和规模化能力。

“在模型训练的绝对前沿领域,算力获取仍然是一项重要制约因素,因为英伟达在那里的优势要难复制得多,”他说。

Kompella继续说,该厂商还需要争取美国和欧洲企业的认可,这些企业由于数据安全、监管和采购方面的顾虑,对使用由中国托管的AI服务仍持谨慎态度。