Z.AI obsługuje GLM-5.3 Flash na 100 000 chińskich chipów, ograniczając zależność od Nvidii
Najważniejsze informacje
- •Z.ai poinformowało, że GLM-5.3 Flash obsługuje zapytania online przy użyciu 100 000 chipów wyprodukowanych w Chinach.
- •Firma wydała model o 320 miliardach parametrów na licencji open source MIT 26 sierpnia, po jego zapowiedzi 20 sierpnia.
- •GLM-5.3 Flash kosztuje 0,075 USD za milion tokenów wejściowych i 0,25 USD za milion tokenów wyjściowych do 9 września, po czym cena wzrośnie.
- •Model stał się najczęściej pobieranym modelem na OpenRouter po przyciągnięciu wielu deweloperów w ślepym teście.
- •Rozwój ten następuje w warunkach zaostrzonych amerykańskich kontroli eksportowych i działań władz Chin ograniczających zakupy chipów AI od Nvidii.

Chiński dostawca rozwiązań AI Z.ai poinformował, że wykorzystał 100 000 chipów wyprodukowanych w Chinach do obsługi zapytań online kierowanych do jego najnowszego modelu AI, GLM-5.3 Flash. Ten krok pokazuje, jak chińscy dostawcy ograniczają zależność od amerykańskiego producenta chipów Nvidii, podkreślając jednocześnie trend ku coraz większej optymalizacji modeli AI.
Z.ai, wcześniej znane jako Zhipu AI, to startup z siedzibą w Pekinie, który wyrósł ze środowiska badawczego Uniwersytetu Tsinghua i zalicza się do grona czołowych chińskich twórców modeli AI. Jego nowy model ma otwarte wagi i jest multimodalny, co oznacza, że jego wytrenowane parametry mogą być pobierane i uruchamiane przez strony trzecie, a do tego jest tani — liczy 320 miliardów parametrów. Z.ai pierwotnie zapowiedziało model pod nazwą kodową Ox Alpha 20 sierpnia, a oficjalnie wydało go 26 sierpnia na licencji open source MIT — jednej z najbardziej liberalnych licencji open source, dopuszczającej komercyjne wykorzystanie, modyfikację i redystrybucję. Model jest wyspecjalizowany w przetwarzaniu długiego kontekstu, wizyjnych zadaniach agentowych i syntezie kodu.
GLM-5.3 Flash kosztuje 0,075 USD za milion tokenów wejściowych i 0,25 USD za milion tokenów wyjściowych od teraz do 9 września. Później cena wyniesie 0,15 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych. Tokeny — fragmenty tekstu, mniej więcej słowo lub część słowa, które modele odczytują i generują — to standardowa jednostka rozliczeniowa w usługach AI. Dla porównania: GPT-5.6 Luna od OpenAI kosztuje 0,20 USD za milion tokenów wejściowych i 2 USD za milion tokenów wyjściowych, natomiast Claude Opus 5 od Anthropic — 5 USD za milion tokenów wejściowych i 5 USD za milion tokenów wyjściowych.
Tło geopolityczne
Decyzja chińskiego dostawcy o korzystaniu wyłącznie z chińskich dostawców chipów zapada w momencie, gdy Chiny dążą do mniejszego polegania na Nvidii. Zwrot Chin ku samowystarczalności nastąpił po latach zaostrzania przez Stany Zjednoczone kontroli eksportowych — reżimu, który rozpoczął się od wprowadzonych w październiku 2022 r. ograniczeń dotyczących zaawansowanych akceleratorów, takich jak A100 i H100 od Nvidii — aby uniemożliwić chińskim firmom technologicznym zdobycie najpotężniejszych chipów Nvidii. Choć część tych ograniczeń zostało złagodzonych, we wrześniu 2025 r. chiński rząd nakazał gigantom technologicznym, takim jak Alibaba i ByteDance, wstrzymanie zakupów chipów AI od Nvidii, a w listopadzie Pekin zakazał stosowania wszystkich zagranicznych chipów AI w centrach danych finansowanych ze środków państwowych.
Postęp chińskiego sprzętu
Mimo tych posunięć wielu obserwatorów nadal postrzegało Chiny jako przegrywające rywalizację infrastrukturalną. Klastry takiej skali były dotąd znakiem firmowym największych amerykańskich laboratoriów AI — superkomputer Colossus firmy xAI w Memphis działał według doniesień na około 100 000 GPU. Strategia Z.ai sugeruje jednak, że luka między Chinami a Stanami Zjednoczonymi w dziedzinie chipów AI może się zacierać, zwłaszcza przy wzmożonym nacisku na inferencję w ciągu ostatniego roku, w okresie gwałtownego rozwoju AI agentowej. Inferencja — uruchamianie wytrenowanego modelu w celu odpowiadania na zapytania, w odróżnieniu od treningu, czyli znacznie bardziej intensywnego obliczeniowo procesu budowania modelu — to dokładnie zadanie, które wykonuje 100 000 chipów Z.ai dla modelu GLM-5.3 Flash.
„W przypadku treningu największych modeli frontier Nvidia nadal ma znaczącą przewagę w wydajności chipów, sieci i szerszym ekosystemie oprogramowania” — powiedział Kashyap Kompella, CEO i założyciel RPA2AI Research. „Ale inferencja to zupełnie inna historia.”
Dodał, że zdolność Z.ai do obsługi GLM-5.3 Flash na dużą skalę przy użyciu chińskich chipów wskazuje, że chiński sprzęt jest już wystarczająco dobry do wielu obciążeń inferencyjnych o wysokim wolumenie.
„To rozróżnienie jest ważne, ponieważ inferencja z czasem prawdopodobnie stanie się większym rynkiem chipów AI” — powiedział Kompella. „Chińskie firmy mogą nie potrzebować pełnej parzystości z Nvidią w ujęciu chip za chip, jeśli zdołają to skompensować efektywnymi architekturami modeli, optymalizacją oprogramowania i dużymi klastrami krajowo produkowanych chipów AI.”
Pierwsze sygnały dążenia chińskich dostawców do niezależności pojawiły się jednak wcześniej — gdy DeepSeek, działające w Hangzhou laboratorium, którego tanie modele przyciągnęły światową uwagę na początku 2025 r., przepisało sterowniki CUDA Nvidii, aby przyspieszyć inferencję, powiedział Bradley Shimmin, analityk Futurum Group. Według niego chińscy dostawcy reagują na ograniczenia wprowadzone najpierw przez rząd Stanów Zjednoczonych, a później przez rząd Chin, ale innym czynnikiem jest to, że firmy „muszą zrobić więcej z watogodzin, którymi dysponują”.
Dostawcy tacy jak Google ze swoją serią TPU czy Amazon z chipami Trainium koncentrują się na integracji pionowej, w której stos AI jest optymalizowany tak, aby modele AI, infrastruktura i oprogramowanie były wykorzystywane razem, zapewniając najbardziej wydajne przetwarzanie AI.
„Tego, czego jesteśmy teraz świadkami, jest rzeczywiste uświadomienie sobie, że wartość AI jest napędzana ekonomią całego stosu w takim samym stopniu jak możliwościami samych modeli” — powiedział Shimmin. „To, co robią ci gracze, to po prostu demonstrowanie wartości niewielkiej inwestycji w optymalizację tego sprzętu.”
Model
Co do samego GLM-5.3 Flash, istotne jest to, że w ślepym teście zdobył on silne uznanie wśród deweloperów, powiedział Kompella. Wielu deweloperów sięgnęło po model na początku tego miesiąca i korzystało z niego, nie wiedząc, że pochodzi on od chińskiego dostawcy; szybko stał się najczęściej pobieranym modelem na OpenRouter, usłudze API pozwalającej deweloperom kierować zapytania do modeli od wielu różnych dostawców.
„To ciekawsze niż kolejny benchmark twierdzący, że chiński model zbliża się do amerykańskiego modelu frontier” — powiedział Kompella, dodając, że pokazuje to, iż chińskie modele o otwartych wagach „nadal pełnią funkcję przeciwwagi dla wyższych cen w branży”.
Dla przedsiębiorstw oznacza to konieczność zaprojektowania systemu AI „tak, aby obciążenia mogły być rozdzielane między modele w oparciu o możliwości, jakość, koszty i względy strategiczne, zamiast uzależniać się od pojedynczego dostawcy modeli” — kontynuował.
Choć natychmiastowe przyciągnięcie dużej liczby deweloperów to dobry znak dla Z.ai, dostawca wciąż stoi przed wyzwaniami. Po pierwsze, musi udowodnić, że wykorzystywane przez niego chipy mogą nadal zapewniać niezawodność, opłacalność i skalę, powiedział Kompella.
„Na absolutnej granicy treningu modeli dostęp do mocy obliczeniowej pozostaje istotnym ograniczeniem, ponieważ przewaga Nvidii jest tam znacznie trudniejsza do powielenia” — powiedział.
Dostawca będzie musiał również przekonać amerykańskie i europejskie przedsiębiorstwa, które podchodzą ostrożnie do korzystania z usług AI hostowanych w Chinach ze względu na obawy dotyczące bezpieczeństwa danych, kwestii regulacyjnych i zakupowych, kontynuował Kompella.