Z.AI gebruikt 100.000 in China gemaakte chips voor GLM-5.3 Flash en verkleint de afhankelijkheid van Nvidia
Belangrijkste punten
- •Z.ai zei dat GLM-5.3 Flash online zoekopdrachten verwerkt met 100.000 in China gemaakte chips.
- •Het bedrijf bracht het 320 miljard parameters tellende model op August 26 uit onder de MIT open source-licentie, na een preview op August 20.
- •GLM-5.3 Flash kost $0.075 per miljoen input tokens en $0.25 per miljoen output tokens tot Sept. 9, waarna de prijs stijgt.
- •Het model werd het meest gedownloade model op OpenRouter nadat het in een blind test veel ontwikkelaars aantrok.
- •De ontwikkeling vindt plaats tegen de achtergrond van strengere Amerikaanse exportcontroles en Chinese overheidsmaatregelen om aankopen van Nvidia AI-chips te beperken.

Chinese AI-leverancier Z.ai zei dat het 100.000 in China gemaakte chips heeft gebruikt om online zoekopdrachten af te handelen voor zijn nieuwste AI-model, GLM-5.3 Flash. De stap laat zien hoe Chinese leveranciers hun afhankelijkheid van de Amerikaanse chipmaker Nvidia verkleinen, terwijl ook de trend naar verdere optimalisatie van AI-modellen zichtbaar wordt.
Z.ai, voorheen bekend als Zhipu AI, is een startup uit Beijing die voortkwam uit de onderzoeksgemeenschap van de Tsinghua University en geldt als een van China’s toonaangevende ontwikkelaars van AI-modellen. Het nieuwe model is open-weight en multimodaal, wat betekent dat de getrainde parameters door derden kunnen worden gedownload en gebruikt, en het is laaggeprijsd, met 320 miljard parameters. Z.ai gaf het model aanvankelijk een preview onder de codenaam Ox Alpha op August 20 en bracht het op August 26 officieel uit onder de MIT open source-licentie — een van de meest permissieve open source-licenties, die commercieel gebruik, aanpassing en herdistributie toestaat. Het model is gespecialiseerd in verwerking van lange context, vision-gedreven agentische taken en code-synthese.
GLM-5.3 Flash kost $0.075 per miljoen input tokens en $0.25 per miljoen output tokens van nu tot Sept. 9. Daarna wordt de prijs $0.15 per miljoen input tokens en $0.50 per miljoen output tokens. Tokens — de tekstsegmenten, ongeveer een woord of woordfragment, die modellen lezen en genereren — zijn de standaard eenheid voor facturering binnen AI-diensten. Ter vergelijking: GPT-5.6 Luna van OpenAI kost $0.20 per miljoen input tokens en $2 per miljoen output tokens, terwijl Anthropic’s Claude Opus 5 $5 per miljoen input tokens en $5 per miljoen output tokens kost.
De geopolitieke achtergrond
De keuze van de Chinese leverancier om uitsluitend Chinese chipproviders te gebruiken komt op een moment dat China minder afhankelijk wil worden van Nvidia. China’s draai naar zelfredzaamheid volgt op jaren waarin de VS exportcontroles verscherpte — een regime dat begon met beperkingen in October 2022 op geavanceerde accelerators zoals Nvidia’s A100 en H100 — om te voorkomen dat Chinese techleveranciers de krachtigste Nvidia-chips konden verkrijgen. Hoewel een deel van die beperkingen is versoepeld, droeg de Chinese overheid in September 2025 techgiganten zoals Alibaba en ByteDance op te stoppen met het kopen van Nvidia AI-chips, en in November verbood Beijing alle buitenlandse AI-chips in datacenters die met staatsgeld worden gefinancierd.
De opmars van Chinese hardware
Ondanks deze maatregelen zagen veel waarnemers China nog steeds achterlopen in de infrastructuurstrijd. Clusters van die omvang zijn kenmerkend geweest voor de grootste AI-labs in de VS — xAI’s Colossus-supercomputer in Memphis zou bijvoorbeeld op ongeveer 100.000 GPU’s draaien. Toch suggereert Z.ai’s strategie dat de kloof tussen China en de VS op het gebied van AI-chips mogelijk kleiner wordt, vooral door de grotere focus op inference in het afgelopen jaar te midden van de sterke opkomst van agentic AI. Inference — het uitvoeren van een getraind model om vragen te beantwoorden, in tegenstelling tot training, het veel rekenintensievere proces van het bouwen van een model — is precies de taak die Z.ai’s 100.000 chips voor GLM-5.3 Flash uitvoeren.
“Voor het trainen van de grootste frontier-modellen heeft Nvidia nog steeds een aanzienlijk voordeel op het gebied van chipprestaties, netwerken en het bredere software-ecosysteem,” zei Kashyap Kompella, CEO en oprichter van RPA2AI Research. “Maar inference is een ander verhaal.”
Hij voegde eraan toe dat Z.ai’s vermogen om GLM-5.3 Flash op schaal aan te bieden met Chinese chips aangeeft dat Chinese hardware al goed genoeg is voor veel high-volume inference-workloads.
“Dit onderscheid is belangrijk omdat inference op termijn waarschijnlijk de grotere AI-chipmarkt wordt,” zei Kompella. “Chinese bedrijven hebben mogelijk geen exacte chip-voor-chip-pariteit met Nvidia nodig als ze dat kunnen compenseren met efficiënte modelarchitecturen, software-optimalisatie en grote clusters van in eigen land gemaakte AI-chips.”
De eerste signalen van de beweging van Chinese leveranciers richting onafhankelijkheid begonnen volgens Bradley Shimmin, analist bij Futurum Group, echter met DeepSeek — het in Hangzhou gevestigde lab waarvan de goedkope modellen begin 2025 wereldwijde aandacht trokken — dat Nvidia CUDA-drivers herschreef om inference sneller te maken. Hij zei dat Chinese leveranciers reageren op beperkingen die eerst door de Amerikaanse regering en later door de Chinese regering werden opgelegd, maar dat er nog een andere factor meespeelt: bedrijven “moeten meer doen met de watturen die ze tot hun beschikking hebben.”
Leveranciers zoals Google, met zijn TPU-serie, en Amazon, met zijn Trainium-chips, richten zich op verticale integratie, waarbij de AI-stack wordt geoptimaliseerd om AI-modellen, infrastructuur en software samen te gebruiken voor de meest efficiënte AI-verwerking.
“Wat we hier zien is dat men zich echt realiseert dat AI-waarde net zozeer wordt bepaald door de economie van de stack als door de capaciteiten van de modellen,” zei Shimmin. “Wat deze partijen doen, is simpelweg de waarde laten zien van een kleine investering in het optimaliseren van die hardware.”
Het model
Voor GLM-5.3 Flash zelf is het significant dat het in een blind test sterke developer mindshare kreeg, zei Kompella. Veel ontwikkelaars doken begin deze maand op het model en gebruikten het zonder te weten dat het van een Chinese leverancier kwam; het werd snel het meest gedownloade model op OpenRouter.
“Dat is interessanter dan weer een benchmark die beweert dat een Chinees model dicht in de buurt komt van een Amerikaanse frontier model,” zei Kompella, en hij voegde eraan toe dat dit laat zien dat Chinese open-weight modellen “blijven functioneren als tegenwicht tegen hogere prijzen in de sector.”
Voor ondernemingen betekent dit dat zij hun AI-systeem zo moeten ontwerpen “dat workloads kunnen worden gerouteerd over modellen op basis van capaciteit, kwaliteit, kosten en strategische overwegingen in plaats van afhankelijk te worden van één enkele modelprovider,” vervolgde hij.
Hoewel de onmiddellijke belangstelling van een groot aantal ontwikkelaars een goed teken is voor Z.ai, staat de leverancier nog voor uitdagingen. Zo moet het bedrijf bewijzen dat de chips die het gebruikt betrouwbaar, kostenefficiënt en schaalbaar kunnen blijven leveren, zei Kompella.
“Aan de absolute voorhoede van modeltraining blijft toegang tot compute ook een wezenlijke beperking, omdat Nvidia’s voordeel daar veel moeilijker te reproduceren is,” zei hij.
De leverancier zal ook Amerikaanse en Europese ondernemingen moeten overtuigen die terughoudend blijven tegenover het gebruik van AI-diensten die in China worden gehost, vanwege zorgen over dataveiligheid, regelgeving en inkoop, vervolgde Kompella.