Команда Qwen из Alibaba запустила Qwen3.8-Flash-Next по цене $0.16 за миллион входных токенов
Ключевые выводы
- •Qwen3.8-Flash-Next — это мультимодальная модель MoE с открытыми весами и ранний предварительный показ архитектуры Qwen4.
- •У модели 125 миллиардов общих параметров, 51 миллиард параметров N-gram embedding и активация 6 миллиардов параметров на токен.
- •Цена API QwenCloud установлена на уровне $0.16 за миллион входных токенов и $0.47 за миллион выходных токенов.
- •Результаты бенчмарков включают 58.7% в DeepSWE 1.1, 62.5% в SWE-bench Pro и 73.9% в CoWorkBench.
- •Нативная длина контекста составляет 262,144 токена и может быть расширена до одного миллиона токенов через YaRN.

Команда Qwen выпустила Qwen3.8-Flash-Next — мультимодальную модель mixture-of-experts с открытыми весами, которая служит ранним архитектурным предварительным показом будущей серии Qwen4. Модель сочетает значительную емкость с высокой экономичностью: 125 миллиардов общих параметров и дополнительные 51 миллиард параметров N-gram embedding, при этом активируя только 6 миллиардов параметров на токен.
Этот релиз следует за Qwen3-Next, который представил гибридные архитектурные решения, позднее внедренные во семейства Qwen3.5–Qwen3.8. Qwen3.8-Flash-Next будет доступна через API QwenCloud по цене $0.16 за миллион входных токенов и $0.47 за миллион выходных токенов, что делает ее конкурентоспособным вариантом для задач с высоким объемом, ассистентов для программирования и корпоративных agentic workflows.
Результаты бенчмарков указывают на высокую производительность в задачах разработки ПО и автономных агентов. Модель показала 58.7% в DeepSWE 1.1, 62.5% в SWE-bench Pro и 81.0% в мультиязычной версии. В долгосрочной офисной автоматизации, измеряемой CoWorkBench, она набрала 73.9%, опередив как Qwen3.7-Plus, так и Claude-Opus-4.6.
Общие способности к рассуждению также остаются сильными: 91.7% в GPQA Diamond и 91.9% в LiveCodeBench v6. Мультимодальные возможности тоже остаются высокими: 84.5% в AndroidWorld и 76.6% в LVBench для понимания длинных видео. Нативная длина контекста достигает 262,144 токенов и может быть расширена до одного миллиона токенов через YaRN.
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O
Архитектурные инновации и интеграция для разработчиков
Архитектура вводит четыре системных улучшения. Для механизма attention модель сочетает Gated DeltaNet с Qwen Sparse Attention, эффективно сжимая исторический контекст и извлекая релевантную информацию через micro-block indexing вместо обработки на уровне токенов. По данным релиза, такое решение обеспечивает ускорение prefill до 7.6× на одном миллионе токенов.
Механизм Gated Residual расширяет residual stream до четырех параллельных ветвей с динамическим gating. Команда Qwen заявляет, что это улучшает поток информации между слоями и стабильность обучения, а также поддерживает хранение FP8 для снижения нагрузки на память. N-gram Embedding добавляет емкость за счет обращений к локальному контексту, которые требуют минимальных вычислений и могут асинхронно подгружаться из памяти хоста.
Для обучения используется оптимизатор Muon с улучшенными стратегиями ортогонализации и разбиения параметров, что, по словам команды, позволяет стабильно сходиться при больших размерах batch без традиционных процедур warmup.
Веса модели доступны на HuggingFace и ModelScope. Доступ к API предоставляется через QwenCloud с поддержкой OpenAI-compatible Chat Completions и Anthropic-compatible протоколов. Разработчики могут интегрировать модель в существующие рабочие процессы через Claude Code, OpenAI Codex, Qoder CLI, Qwen Code и OpenClaw, при этом уровень reasoning effort можно настраивать на low, medium и xhigh. Команда заявила, что вскоре ожидается официальный production-релиз со встроенными инструментами и контекстом по умолчанию на один миллион токенов.