NoticiasCriptoZ.AI sirve GLM-5.3 Flash con 100,000 chips fabricados en China y reduce su dependencia de Nvidia

Z.AI sirve GLM-5.3 Flash con 100,000 chips fabricados en China y reduce su dependencia de Nvidia

Autor: AI Business·

Puntos clave

  • Z.ai afirmó que GLM-5.3 Flash atiende consultas en línea utilizando 100,000 chips fabricados en China.
  • La compañía lanzó el modelo de 320 mil millones de parámetros bajo la licencia de código abierto MIT el 26 de agosto, tras presentarlo en versión preliminar el 20 de agosto.
  • GLM-5.3 Flash tiene un precio de $0.075 por millón de tokens de entrada y $0.25 por millón de tokens de salida hasta el 9 de septiembre, antes de aumentar posteriormente.
  • El modelo se convirtió en el más descargado de OpenRouter tras atraer a numerosos desarrolladores en una prueba a ciegas.
  • El desarrollo se produce en medio de controles de exportación estadounidenses más estrictos y medidas del gobierno chino para frenar la compra de chips de IA de Nvidia.
Z.AI sirve GLM-5.3 Flash con 100,000 chips fabricados en China y reduce su dependencia de Nvidia

El proveedor chino de IA Z.ai afirmó que utilizó 100,000 chips fabricados en China para atender las consultas en línea de su modelo de IA más reciente, GLM-5.3 Flash. La medida muestra cómo los proveedores chinos están reduciendo su dependencia del fabricante estadounidense de chips Nvidia, al tiempo que destaca la tendencia hacia una mayor optimización de los modelos de IA.

Z.ai, anteriormente conocida como Zhipu AI, es una startup con sede en Beijing que surgió de la comunidad de investigación de la Universidad de Tsinghua y está considerada entre los principales desarrolladores de modelos de IA de China. Su nuevo modelo es de pesos abiertos y multimodal, lo que significa que terceros pueden descargar y ejecutar sus parámetros entrenados, y es de bajo costo, con 320 mil millones de parámetros. Z.ai presentó originalmente una vista previa del modelo bajo el nombre clave Ox Alpha el 20 de agosto y lo lanzó oficialmente bajo la licencia de código abierto MIT — una de las licencias de código abierto más permisivas, que permite el uso comercial, la modificación y la redistribución — el 26 de agosto. El modelo está especializado en procesamiento de contexto extenso, tareas de agentes basadas en visión y síntesis de código.

GLM-5.3 Flash cuesta $0.075 por millón de tokens de entrada y $0.25 por millón de tokens de salida desde ahora hasta el 9 de septiembre. Después de esa fecha, el precio será de $0.15 por millón de tokens de entrada y $0.50 por millón de tokens de salida. Los tokens — fragmentos de texto, aproximadamente una palabra o parte de una palabra, que los modelos leen y generan — son la unidad de facturación estándar en los servicios de IA. En comparación, GPT-5.6 Luna de OpenAI cuesta $0.20 por millón de tokens de entrada y $2 por millón de tokens de salida, mientras que Claude Opus 5 de Anthropic cuesta $5 por millón de tokens de entrada y $5 por millón de tokens de salida.

El trasfondo geopolítico

La decisión del proveedor chino de utilizar únicamente proveedores de chips chinos llega cuando China busca depender menos de Nvidia. El giro del país hacia la autosuficiencia sigue a años en los que Estados Unidos endureció los controles de exportación — un régimen que comenzó con las restricciones de octubre de 2022 sobre aceleradores avanzados como el A100 y el H100 de Nvidia — para impedir que los proveedores tecnológicos chinos obtuvieran los chips más potentes de Nvidia. Aunque algunos de estos controles se han flexibilizado, en septiembre de 2025 el gobierno de China ordenó a gigantes tecnológicos como Alibaba y ByteDance dejar de comprar chips de IA de Nvidia, y en noviembre Beijing prohibió todos los chips de IA extranjeros en los centros de datos financiados por el Estado.

El avance del hardware chino

A pesar de estas medidas, muchos observadores seguían viendo a China rezagada en la competencia de infraestructura. Los clústeres de ese tamaño han sido la firma de los laboratorios de IA más grandes de Estados Unidos — la supercomputadora Colossus de xAI en Memphis, por ejemplo, se informó que funcionaba con aproximadamente 100,000 GPU. Sin embargo, la estrategia de Z.ai sugiere que la brecha entre China y Estados Unidos en chips de IA podría estar reduciéndose, especialmente con el mayor enfoque en la inferencia durante el último año en medio del auge de la IA agéntica. La inferencia — ejecutar un modelo entrenado para responder consultas, a diferencia del entrenamiento, el proceso mucho más intensivo en cómputo de construir un modelo — es precisamente la tarea que los 100,000 chips de Z.ai están realizando para GLM-5.3 Flash.

“Para entrenar los modelos de frontera más grandes, Nvidia todavía tiene una ventaja significativa en rendimiento de chips, redes y el ecosistema de software más amplio”, dijo Kashyap Kompella, CEO y fundador de RPA2AI Research. “Pero la inferencia es otra historia”.

Añadió que la capacidad de Z.ai para servir GLM-5.3 Flash a escala con chips chinos indica que el hardware chino ya es suficientemente bueno para muchas cargas de trabajo de inferencia de alto volumen.

“Esta distinción es importante porque es probable que la inferencia se convierta con el tiempo en el mercado más grande de chips de IA”, dijo Kompella. “Las empresas chinas podrían no necesitar una paridad exacta chip por chip con Nvidia si pueden compensar mediante arquitecturas de modelos eficientes, optimización de software y grandes clústeres de chips de IA fabricados en el país”.

Sin embargo, las primeras señales del movimiento de los proveedores chinos hacia la independencia comenzaron con DeepSeek — el laboratorio con sede en Hangzhou cuyos modelos de bajo costo atrajeron la atención global a principios de 2025 — reescribiendo los controladores CUDA de Nvidia para acelerar la inferencia, dijo Bradley Shimmin, analista de Futurum Group. Dijo que, si bien los proveedores chinos responden a restricciones impuestas primero por el gobierno de Estados Unidos y luego por el gobierno chino, otro factor es que las empresas “necesitan hacer más con los vatios-hora de los que disponen”.

Proveedores como Google, con su serie TPU, y Amazon, con sus chips Trainium, se centran en la integración vertical, en la que la pila de IA se optimiza para usar modelos de IA, infraestructura y software en conjunto para lograr el procesamiento de IA más eficiente.

“Lo que estamos presenciando aquí es la verdadera comprensión de que el valor de la IA está impulsado tanto por la economía de la pila como por las capacidades de los modelos”, dijo Shimmin. “Lo que estos actores están haciendo es simplemente demostrar el valor de una pequeña inversión en la optimización de ese hardware”.

El modelo

En cuanto a GLM-5.3 Flash en sí, el hecho de que haya obtenido una fuerte aceptación entre los desarrolladores en una prueba a ciegas es significativo, dijo Kompella. Muchos desarrolladores acudieron al modelo a principios de este mes y lo usaron sin saber que provenía de un proveedor chino; rápidamente se convirtió en el modelo más descargado en OpenRouter, un servicio de API que permite a los desarrolladores dirigir solicitudes entre modelos de muchos proveedores diferentes.

“Eso es más interesante que otro punto de referencia que afirme que un modelo chino está cerca de un modelo de frontera estadounidense”, dijo Kompella, añadiendo que demuestra que los modelos chinos de pesos abiertos “siguen funcionando como un contrapeso a los precios más altos de la industria”.

Para las empresas, esto significa que deben diseñar su sistema de IA “de modo que las cargas de trabajo puedan dirigirse entre modelos según su capacidad, calidad, costo y consideraciones estratégicas, en lugar de depender de un único proveedor de modelos”, continuó.

Aunque la atracción inmediata de un gran número de desarrolladores hacia el modelo es una buena señal para Z.ai, el proveedor todavía enfrenta desafíos por delante. Por un lado, debe demostrar que los chips que utiliza pueden seguir ofreciendo confiabilidad, economía y escala, dijo Kompella.

“En la frontera absoluta del entrenamiento de modelos, el acceso al cómputo también sigue siendo una restricción significativa porque la ventaja de Nvidia es mucho más difícil de replicar allí”, dijo.

El proveedor también deberá convencer a las empresas estadounidenses y europeas que se mantienen cautas respecto al uso de servicios de IA alojados en China debido a preocupaciones de seguridad de datos, regulatorias y de adquisición, continuó Kompella.