Z.AI обслуживает GLM-5.3 Flash на 100 000 китайских чипах, снижая зависимость от Nvidia
Ключевые выводы
- •Z.ai сообщила, что GLM-5.3 Flash обрабатывает онлайн-запросы на 100 000 китайских чипах.
- •Компания выпустила модель с 320 миллиардами параметров под лицензией MIT 26 августа после анонса 20 августа.
- •GLM-5.3 Flash стоит $0.075 за миллион входных токенов и $0.25 за миллион выходных токенов до 9 сентября, после чего цена вырастет.
- •Модель стала самой загружаемой на OpenRouter, привлекнув множество разработчиков в слепом тестировании.
- •Это развитие происходит на фоне ужесточения экспортного контроля США и мер китайского правительства по ограничению закупок ИИ-чипов Nvidia.

Китайский ИИ-вендор Z.ai сообщил, что использовал 100 000 китайских чипов для обработки онлайн-запросов к своей новейшей модели GLM-5.3 Flash. Этот шаг демонстрирует, как китайские вендоры снижают зависимость от американского производителя чипов Nvidia, а также подчёркивает тенденцию к дальнейшей оптимизации ИИ-моделей.
Z.ai, ранее известная как Zhipu AI, — пекинский стартап, выросший из исследовательского сообщества Университета Цинхуа и входящий в число ведущих китайских разработчиков ИИ-моделей. Её новая модель имеет открытые веса и является мультимодальной: её обученные параметры можно скачивать и запускать сторонним пользователям. Модель отличается низкой стоимостью и насчитывает 320 миллиардов параметров. Z.ai первоначально анонсировала модель под кодовым названием Ox Alpha 20 августа и официально выпустила её 26 августа под лицензией MIT — одной из наиболее либеральных лицензий с открытым исходным кодом, допускающей коммерческое использование, модификацию и распространение. Модель специализируется на обработке длинного контекста, визуальных агентных задачах и синтезе кода.
GLM-5.3 Flash стоит $0.075 за миллион входных токенов и $0.25 за миллион выходных токенов с настоящего момента до 9 сентября. После этого цена составит $0.15 за миллион входных токенов и $0.50 за миллион выходных токенов. Токены — фрагменты текста, примерно слово или его часть, которые модели читают и генерируют, — являются стандартной единицей тарификации в ИИ-сервисах. Для сравнения: GPT-5.6 Luna от OpenAI стоит $0.20 за миллион входных токенов и $2 за миллион выходных токенов, а Claude Opus 5 от Anthropic — $5 за миллион входных и $5 за миллион выходных токенов.
Геополитический контекст
Решение китайского вендора использовать исключительно китайских поставщиков чипов принято на фоне стремления Китая меньше зависеть от Nvidia. Поворот Китая к самодостаточности последовал за многолетним ужесточением экспортного контроля США — режима, начавшегося с ограничений октября 2022 года на передовые ускорители, такие как A100 и H100 от Nvidia, — чтобы не допускать китайских технологических компаний к самым мощным чипам Nvidia. Хотя часть этих ограничений была смягчена, в сентябре 2025 года правительство Китая обязало технологических гигантов, таких как Alibaba и ByteDance, прекратить закупки ИИ-чипов Nvidia, а в ноябре Пекин запретил все иностранные ИИ-чипы в дата-центрах с государственным финансированием.
Прогресс китайского оборудования
Несмотря на эти меры, многие наблюдатели по-прежнему считали, что Китай отстаёт в инфраструктурной гонке. Кластеры такого масштаба были визитной карточкой крупнейших американских ИИ-лабораторий — например, суперкомпьютер Colossus компании xAI в Мемфисе, по сообщениям, работал примерно на 100 000 GPU. Однако стратегия Z.ai позволяет предположить, что разрыв между Китаем и США в области ИИ-чипов может сокращаться, особенно на фоне усилившегося за последний год внимания к инференсу на фоне стремительного роста агентного ИИ. Инференс — запуск обученной модели для ответов на запросы, в отличие от обучения, значительно более ресурсоёмкого процесса создания модели, — это именно та задача, которую выполняют 100 000 чипов Z.ai для GLM-5.3 Flash.
«Для обучения крупнейших передовых моделей Nvidia по-прежнему обладает значительным преимуществом в производительности чипов, сетевом взаимодействии и более широкой программной экосистеме, — сказал Кашьяп Компелла, генеральный директор и основатель RPA2AI Research. — Но с инференсом ситуация иная».
Он добавил, что способность Z.ai обслуживать GLM-5.3 Flash в масштабе на китайских чипах свидетельствует, что китайское оборудование уже достаточно хорошо для многих высоконагруженных инференс-задач.
«Это различие важно, поскольку со временем инференс, вероятно, станет более крупным рынком ИИ-чипов, — сказал Компелла. — Китайским компаниям может не понадобиться точное соответствие чипа чипу с Nvidia, если они смогут компенсировать это эффективными архитектурами моделей, оптимизацией программного обеспечения и большими кластерами отечественных ИИ-чипов».
Однако первые сигналы о движении китайских вендоров к независимости появились, когда DeepSeek — лаборатория из Ханчжоу, чьи недорогие модели привлекли мировое внимание в начале 2025 года, — переписала драйверы Nvidia CUDA для ускорения инференса, сообщил Брэдли Шиммин, аналитик Futurum Group. По его словам, хотя китайские вендоры реагируют на ограничения, сначала введённые правительством США, а затем и правительством Китая, есть и другой фактор: компаниям «нужно делать больше с теми ватт-часами, которые им доступны».
Такие вендоры, как Google с серией TPU и Amazon с чипами Trainium, делают ставку на вертикальную интеграцию, при которой ИИ-стек оптимизируется для совместного использования ИИ-моделей, инфраструктуры и программного обеспечения ради максимально эффективной обработки ИИ.
«Мы становимся свидетелями настоящего осознания того, что ценность ИИ определяется экономикой стека в той же мере, что и возможностями моделей, — сказал Шиммин. — То, что делают эти ребята, — просто демонстрация ценности небольших инвестиций в оптимизацию этого оборудования».
О модели
Что касается самой GLM-5.3 Flash, то значимым является тот факт, что она получила сильную поддержку разработчиков в слепом тестировании, сказал Компелла. В начале этого месяца множество разработчиков обратились к модели и использовали её, не зная, что она принадлежит китайскому вендору; она быстро стала самой загружаемой моделью на OpenRouter — API-сервисе, позволяющем разработчикам распределять запросы между моделями разных провайдеров.
«Это интереснее, чем очередной бенчмарк, заявляющий, что китайская модель близка к американской передовой модели, — сказал Компелла, добавив, что это показывает, что китайские модели с открытыми весами «продолжают выступать противовесом более высоким отраслевым ценам».
Для предприятий это означает, что им нужно проектировать свою ИИ-систему так, «чтобы рабочие нагрузки могли распределяться между моделями на основе возможностей, качества, стоимости и стратегических соображений, а не попадать в зависимость от единственного провайдера моделей», продолжил он.
Хотя мгновенное привлечение моделью большого числа разработчиков — хороший знак для Z.ai, впереди вендора ждут испытания. Во-первых, ему предстоит доказать, что используемые чипы смогут и дальше обеспечивать надёжность, экономичность и масштабируемость, сказал Компелла.
«На самом переднем крае обучения моделей доступ к вычислительным мощностям также остаётся существенным ограничением, поскольку преимущество Nvidia там гораздо труднее воспроизвести», — отметил он.
Кроме того, вендору придётся убедить американские и европейские компании, которые с осторожностью относятся к использованию ИИ-сервисов, размещённых в Китае, из-за опасений относительно защиты данных, регулирования и закупочных процедур, добавил Компелла.