НовостиКриптовалютыZ.AI обслуживает GLM-5.3 Flash на 100 000 китайских чипах, снижая зависимость от Nvidia

Z.AI обслуживает GLM-5.3 Flash на 100 000 китайских чипах, снижая зависимость от Nvidia

Автор: AI Business·

Ключевые выводы

  • Z.ai сообщила, что GLM-5.3 Flash обрабатывает онлайн-запросы на 100 000 китайских чипах.
  • Компания выпустила модель с 320 миллиардами параметров под лицензией MIT 26 августа после анонса 20 августа.
  • GLM-5.3 Flash стоит $0.075 за миллион входных токенов и $0.25 за миллион выходных токенов до 9 сентября, после чего цена вырастет.
  • Модель стала самой загружаемой на OpenRouter, привлекнув множество разработчиков в слепом тестировании.
  • Это развитие происходит на фоне ужесточения экспортного контроля США и мер китайского правительства по ограничению закупок ИИ-чипов Nvidia.
Z.AI обслуживает GLM-5.3 Flash на 100 000 китайских чипах, снижая зависимость от Nvidia

Китайский ИИ-вендор Z.ai сообщил, что использовал 100 000 китайских чипов для обработки онлайн-запросов к своей новейшей модели GLM-5.3 Flash. Этот шаг демонстрирует, как китайские вендоры снижают зависимость от американского производителя чипов Nvidia, а также подчёркивает тенденцию к дальнейшей оптимизации ИИ-моделей.

Z.ai, ранее известная как Zhipu AI, — пекинский стартап, выросший из исследовательского сообщества Университета Цинхуа и входящий в число ведущих китайских разработчиков ИИ-моделей. Её новая модель имеет открытые веса и является мультимодальной: её обученные параметры можно скачивать и запускать сторонним пользователям. Модель отличается низкой стоимостью и насчитывает 320 миллиардов параметров. Z.ai первоначально анонсировала модель под кодовым названием Ox Alpha 20 августа и официально выпустила её 26 августа под лицензией MIT — одной из наиболее либеральных лицензий с открытым исходным кодом, допускающей коммерческое использование, модификацию и распространение. Модель специализируется на обработке длинного контекста, визуальных агентных задачах и синтезе кода.

GLM-5.3 Flash стоит $0.075 за миллион входных токенов и $0.25 за миллион выходных токенов с настоящего момента до 9 сентября. После этого цена составит $0.15 за миллион входных токенов и $0.50 за миллион выходных токенов. Токены — фрагменты текста, примерно слово или его часть, которые модели читают и генерируют, — являются стандартной единицей тарификации в ИИ-сервисах. Для сравнения: GPT-5.6 Luna от OpenAI стоит $0.20 за миллион входных токенов и $2 за миллион выходных токенов, а Claude Opus 5 от Anthropic — $5 за миллион входных и $5 за миллион выходных токенов.

Геополитический контекст

Решение китайского вендора использовать исключительно китайских поставщиков чипов принято на фоне стремления Китая меньше зависеть от Nvidia. Поворот Китая к самодостаточности последовал за многолетним ужесточением экспортного контроля США — режима, начавшегося с ограничений октября 2022 года на передовые ускорители, такие как A100 и H100 от Nvidia, — чтобы не допускать китайских технологических компаний к самым мощным чипам Nvidia. Хотя часть этих ограничений была смягчена, в сентябре 2025 года правительство Китая обязало технологических гигантов, таких как Alibaba и ByteDance, прекратить закупки ИИ-чипов Nvidia, а в ноябре Пекин запретил все иностранные ИИ-чипы в дата-центрах с государственным финансированием.

Прогресс китайского оборудования

Несмотря на эти меры, многие наблюдатели по-прежнему считали, что Китай отстаёт в инфраструктурной гонке. Кластеры такого масштаба были визитной карточкой крупнейших американских ИИ-лабораторий — например, суперкомпьютер Colossus компании xAI в Мемфисе, по сообщениям, работал примерно на 100 000 GPU. Однако стратегия Z.ai позволяет предположить, что разрыв между Китаем и США в области ИИ-чипов может сокращаться, особенно на фоне усилившегося за последний год внимания к инференсу на фоне стремительного роста агентного ИИ. Инференс — запуск обученной модели для ответов на запросы, в отличие от обучения, значительно более ресурсоёмкого процесса создания модели, — это именно та задача, которую выполняют 100 000 чипов Z.ai для GLM-5.3 Flash.

«Для обучения крупнейших передовых моделей Nvidia по-прежнему обладает значительным преимуществом в производительности чипов, сетевом взаимодействии и более широкой программной экосистеме, — сказал Кашьяп Компелла, генеральный директор и основатель RPA2AI Research. — Но с инференсом ситуация иная».

Он добавил, что способность Z.ai обслуживать GLM-5.3 Flash в масштабе на китайских чипах свидетельствует, что китайское оборудование уже достаточно хорошо для многих высоконагруженных инференс-задач.

«Это различие важно, поскольку со временем инференс, вероятно, станет более крупным рынком ИИ-чипов, — сказал Компелла. — Китайским компаниям может не понадобиться точное соответствие чипа чипу с Nvidia, если они смогут компенсировать это эффективными архитектурами моделей, оптимизацией программного обеспечения и большими кластерами отечественных ИИ-чипов».

Однако первые сигналы о движении китайских вендоров к независимости появились, когда DeepSeek — лаборатория из Ханчжоу, чьи недорогие модели привлекли мировое внимание в начале 2025 года, — переписала драйверы Nvidia CUDA для ускорения инференса, сообщил Брэдли Шиммин, аналитик Futurum Group. По его словам, хотя китайские вендоры реагируют на ограничения, сначала введённые правительством США, а затем и правительством Китая, есть и другой фактор: компаниям «нужно делать больше с теми ватт-часами, которые им доступны».

Такие вендоры, как Google с серией TPU и Amazon с чипами Trainium, делают ставку на вертикальную интеграцию, при которой ИИ-стек оптимизируется для совместного использования ИИ-моделей, инфраструктуры и программного обеспечения ради максимально эффективной обработки ИИ.

«Мы становимся свидетелями настоящего осознания того, что ценность ИИ определяется экономикой стека в той же мере, что и возможностями моделей, — сказал Шиммин. — То, что делают эти ребята, — просто демонстрация ценности небольших инвестиций в оптимизацию этого оборудования».

О модели

Что касается самой GLM-5.3 Flash, то значимым является тот факт, что она получила сильную поддержку разработчиков в слепом тестировании, сказал Компелла. В начале этого месяца множество разработчиков обратились к модели и использовали её, не зная, что она принадлежит китайскому вендору; она быстро стала самой загружаемой моделью на OpenRouter — API-сервисе, позволяющем разработчикам распределять запросы между моделями разных провайдеров.

«Это интереснее, чем очередной бенчмарк, заявляющий, что китайская модель близка к американской передовой модели, — сказал Компелла, добавив, что это показывает, что китайские модели с открытыми весами «продолжают выступать противовесом более высоким отраслевым ценам».

Для предприятий это означает, что им нужно проектировать свою ИИ-систему так, «чтобы рабочие нагрузки могли распределяться между моделями на основе возможностей, качества, стоимости и стратегических соображений, а не попадать в зависимость от единственного провайдера моделей», продолжил он.

Хотя мгновенное привлечение моделью большого числа разработчиков — хороший знак для Z.ai, впереди вендора ждут испытания. Во-первых, ему предстоит доказать, что используемые чипы смогут и дальше обеспечивать надёжность, экономичность и масштабируемость, сказал Компелла.

«На самом переднем крае обучения моделей доступ к вычислительным мощностям также остаётся существенным ограничением, поскольку преимущество Nvidia там гораздо труднее воспроизвести», — отметил он.

Кроме того, вендору придётся убедить американские и европейские компании, которые с осторожностью относятся к использованию ИИ-сервисов, размещённых в Китае, из-за опасений относительно защиты данных, регулирования и закупочных процедур, добавил Компелла.