Z.ai rilascia GLM-5.3, presentandolo come un modello open-weights leader per il coding
Punti chiave
- •GLM-5.3 è un modello da 743 miliardi di parametri di Z.ai, basato a Pechino, creato estendendo il post-training sulla base di GLM-5.2 invece di introdurre una nuova architettura.
- •Il modello ha ottenuto il 34,5% nel benchmark interno di coding di Z.ai usando circa 75.000 token in uscita per task, migliorando il 23,4% di GLM-5.2 con 96.000 token.
- •GLM-5.3 ha guidato il benchmark di exploitation CyberGym con l’84,5% e, secondo Z.ai, ha individuato 2.436 vulnerabilità in 269 progetti open-source, di cui 1.097 di gravità medio-alta.
- •I pesi del modello e l’accesso API sono attesi circa due settimane dopo il lancio, dopo le valutazioni di sicurezza, quindi la definizione di open-weights si riferisce alla release futura e non a ciò che è scaricabile oggi.
- •Tutti i confronti di benchmark provengono dal post di lancio di Z.ai e i modelli chiusi statunitensi come Claude Fable 5 e GPT-5.6 Sol restano superiori a GLM-5.3 in Terminal Bench 3.0 e DeepSWE v1.1.

Il laboratorio cinese di IA Z.ai ha rilasciato GLM-5.3 giovedì tramite il suo GLM Coding Plan e ZCode.
L’azienda descrive il modello come il "most capable open-weights model for coding."
GLM-5.3 è un modello da 743 miliardi di parametri costruito estendendo il post-training sulla base di GLM-5.2. "Open weights" significa che un laboratorio pubblica i file del modello addestrato in modo che gli sviluppatori possano scaricarli ed eseguirli sul proprio hardware, a differenza dei modelli chiusi come Claude di Anthropic o la serie GPT di OpenAI, accessibili solo tramite l’API di un fornitore.
Z.ai ha affermato che il modello è ora disponibile tramite l’abbonamento GLM Coding Plan e ZCode, mentre l’accesso API e i pesi scaricabili seguiranno dopo una revisione di sicurezza.
"Scaling post-training is all we did for GLM-5.3," ha scritto l’azienda nel post di lancio. "With GLM-5.2 we built the stack... Over the past month we kept scaling on this stack: more environments, more diverse tasks, and more compute spent training on them."
Il team ha detto di aver dato priorità all’efficienza dei token piuttosto che alla pura supremazia. GLM-5.3 ha 743 miliardi di parametri e utilizza significativamente meno token per task rispetto al suo predecessore. I parametri sono il numero di variabili che un modello utilizza durante l’elaborazione delle informazioni, mentre i token sono le unità di base di informazione che un modello può consumare o generare. L’economia dei token ha anche un effetto commerciale diretto: poiché le API vengono fatturate per token, produrre meno token in uscita per task riduce il costo di utilizzo del modello.
Z.ai ha affermato che GLM-5.3 raggiunge il 34,5% nel proprio Z.ai Code Bench interno a Max effort, utilizzando circa 75.000 token in uscita per task, contro il 23,4% di GLM-5.2 con 96.000 token. Confrontandolo con i modelli chiusi, il blog osserva che batte Claude Opus 4.8 in termini di economia dei token ma "remains behind Claude Fable 5, which reaches 39.5% at Max effort." I confronti provengono dal post di lancio di Z.ai, quindi si tratta di dati dichiarati dal fornitore e non di risultati di una valutazione indipendente.
Per quanto riguarda il coding, GLM-5.3 si comporta bene e supera il modello cinese Kimi K3 nei benchmark più rilevanti.
Nel Terminal Bench 3.0 — un test dell’uso autonomo di shell e strumenti in ambienti Linux reali — GLM-5.3 ottiene 28.3, leggermente sotto i modelli chiusi Fable 5 (33.7) e GPT-5.6 Sol (34.6). Nel DeepSWE v1.1, benchmark per risolvere problemi reali di GitHub end to end, il rivale open Kimi K3 ottiene 67.5 e Fable 5 69.7, entrambi davanti al 66.9 di GLM-5.3.
Nel complesso, i risultati mostrano GLM-5.3 davanti al proprio predecessore e ad alcuni pari categoria open-weight, mentre i modelli chiusi statunitensi mantengono la leadership nei principali benchmark di coding.
I risultati sulla cybersicurezza indicano un altro salto significativo. GLM-5.3 guida CyberGym con l’84.5% e più che raddoppia GLM-5.2 nei benchmark di exploitation. Z.ai afferma che il modello ha individuato 2.436 vulnerabilità in 269 progetti open-source, di cui 1.097 di gravità medio-alta.
"GLM-5.3 takes agentic coding to the next level, delivering a dramatic improvement over GLM-5.2 while achieving better results with fewer output tokens," ha scritto Z.ai su X. "GLM-5.3 is available now through GLM Coding Plan and ZCode. API access and open weights will be released in stages following rigorous safety evaluations."
"GLM-5.3 takes agentic coding to the next level, delivering a dramatic improvement over GLM-5.2 while achieving better results with fewer output tokens. pic.twitter.com/KGc6ZR7GHv — Z.ai (@Zai_org) August 14, 2026"
Sul prezzo, Z.ai sta posizionando il modello come un’alternativa a costo inferiore rispetto ai sistemi frontier statunitensi. Il suo GLM Coding Plan usa una quota in punti, con le chiamate fuori fascia che costano la metà, mentre l’API di Zhipu ha un prezzo pari a circa un decimo delle tariffe per token dei frontier model statunitensi. Il prezzo ufficiale di GLM-5.2 era di $1.40 in / $4.40 out per milione di token. Il confronto è con GPT-5.3-Codex a $1.75 / $14 e con Claude Opus 4.8 vicino al vertice delle fasce di prezzo di Anthropic.
Z.ai è un laboratorio di Pechino incluso nella U.S. Entity List, il che significa che le aziende statunitensi non possono esportargli tecnologia controllata. Z.ai è il marchio di Zhipu AI, una società fondata nel 2019 come spin-off della ricerca della Tsinghua University, aggiunta dal Dipartimento del Commercio degli Stati Uniti alla Entity List nel gennaio 2025. Anche così, GLM resta un modello molto utilizzato e i modelli open-weight cinesi sono già in testa a quelli americani per l’uso di token su OpenRouter; OpenRouter è un aggregatore di API che instrada le richieste su molti modelli e pubblica la quota di utilizzo per modello.
Secondo il post di lancio, i pesi di GLM-5.3 dovrebbero essere rilasciati pubblicamente tra circa due settimane. La definizione di open-weights si riferisce quindi alla prossima release, non a ciò che è scaricabile oggi. Una volta disponibili pesi e accesso API, gli sviluppatori esterni potranno eseguire il modello sulla propria infrastruttura e verificare direttamente le affermazioni del fornitore sui benchmark.