Zespół Qwen firmy Alibaba wprowadza Qwen3.8-Flash-Next w cenie 0,16 USD za milion tokenów wejściowych
Najważniejsze informacje
- •Qwen3.8-Flash-Next to otwarto-wagowy multimodalny model MoE i wczesna zapowiedź architektury Qwen4.
- •Model ma łącznie 125 miliardów parametrów, 51 miliardów parametrów osadzeń N-gram i aktywuje 6 miliardów parametrów na token.
- •Cena API QwenCloud wynosi 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych.
- •Wyniki benchmarków obejmują 58,7% w DeepSWE 1.1, 62,5% w SWE-bench Pro oraz 73,9% w CoWorkBench.
- •Natywna długość kontekstu wynosi 262 144 tokeny i może zostać rozszerzona do jednego miliona tokenów za pomocą YaRN.

Zespół Qwen udostępnił Qwen3.8-Flash-Next, otwarto-wagowy multimodalny model typu mixture-of-experts, który stanowi wczesną zapowiedź architektury nadchodzącej serii Qwen4. Model łączy znaczną pojemność z wysoką efektywnością kosztową, oferując 125 miliardów łącznych parametrów oraz dodatkowe 51 miliardów parametrów osadzeń N-gram, przy aktywacji jedynie 6 miliardów parametrów na token.
Premiera ta kontynuuje linię zapoczątkowaną przez Qwen3-Next, który wprowadził hybrydowe projekty architektury później zaadaptowane w rodzinach Qwen3.5 do Qwen3.8. Qwen3.8-Flash-Next będzie dostępny przez API QwenCloud w cenie 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych, co pozycjonuje go jako konkurencyjną opcję dla obciążeń, w których liczą się zarówno przepustowość, jak i koszty tokenów, w tym asystentów kodowania i korporacyjnych przepływów agentowych.
Wyniki benchmarków wskazują na mocne osiągi w zadaniach inżynierii oprogramowania i autonomicznych agentów. Model uzyskał 58,7% w DeepSWE 1.1, 62,5% w SWE-bench Pro oraz 81,0% w wariancie wielojęzycznym. W długohoryzontowej automatyzacji biurowej mierzonej przez CoWorkBench uzyskał 73,9%, wyprzedzając zarówno Qwen3.7-Plus, jak i Claude-Opus-4.6.
Ogólne możliwości rozumowania pozostają solidne, z wynikami 91,7% w GPQA Diamond i 91,9% w LiveCodeBench v6. Równie silne są kompetencje multimodalne, z 84,5% w AndroidWorld i 76,6% w LVBench dla długiego rozumienia wideo. Natywna długość kontekstu sięga 262 144 tokenów i może zostać rozszerzona do jednego miliona tokenów za pomocą YaRN.
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026
Innowacje architektoniczne i integracja dla deweloperów
Architektura wprowadza cztery systemowe ulepszenia. W obszarze uwagi model łączy Gated DeltaNet z Qwen Sparse Attention, efektywnie kompresując historyczny kontekst, a jednocześnie pobierając istotne informacje poprzez indeksowanie mikroblokowe zamiast przetwarzania na poziomie tokenów. Według komunikatu takie rozwiązanie zapewnia do 7,6x przyspieszenia prefill przy jednym milionie tokenów.
Mechanizm Gated Residual rozszerza strumień rezydualny na cztery równoległe gałęzie z dynamicznym bramkowaniem, poprawiając przepływ informacji między warstwami i stabilność treningu, a jednocześnie wspierając zapis FP8 w celu ograniczenia ruchu pamięci. N-gram Embedding zwiększa pojemność poprzez wyszukiwania w lokalnym kontekście, które wymagają minimalnych obliczeń i mogą być asynchronicznie pobierane wstępnie z pamięci hosta. Trening wykorzystuje optymalizator Muon z udoskonalonymi strategiami ortogonalizacji i dzielenia parametrów, umożliwiając stabilną zbieżność przy większych rozmiarach batchy bez tradycyjnych procedur rozgrzewki.
Wagi modelu są dostępne w HuggingFace i ModelScope, a dostęp do API zapewnia QwenCloud z obsługą protokołów zgodnych z OpenAI Chat Completions oraz zgodnych z Anthropic. Deweloperzy mogą integrować model z istniejącymi przepływami pracy za pośrednictwem Claude Code, OpenAI Codex, Qoder CLI, Qwen Code i OpenClaw, z możliwością konfiguracji poziomu reasoning effort na low, medium i xhigh. Oficjalne wydanie produkcyjne z wbudowanymi narzędziami i domyślnym kontekstem jednego miliona tokenów ma pojawić się wkrótce.
The post Alibaba Prices Qwen3.8-Flash API At $0.16 Per Million Tokens, Cutting Inference Costs For 125B-Parameter Model appeared first on Metaverse Post .