NoticiasAccionesEl equipo Qwen de Alibaba lanza Qwen3.8-Flash-Next a US$0.16 por millón de tokens de entrada

El equipo Qwen de Alibaba lanza Qwen3.8-Flash-Next a US$0.16 por millón de tokens de entrada

Autor: Metaverse Post·

Puntos clave

  • Qwen3.8-Flash-Next es un modelo multimodal MoE open-weight y una vista previa temprana de la arquitectura Qwen4.
  • El modelo tiene 125 mil millones de parámetros totales, 51 mil millones de parámetros de embedding N-gram y activa 6 mil millones de parámetros por token.
  • El precio de la API de QwenCloud es de US$0.16 por millón de tokens de entrada y US$0.47 por millón de tokens de salida.
  • Los resultados de evaluación incluyen 58.7% en DeepSWE 1.1, 62.5% en SWE-bench Pro y 73.9% en CoWorkBench.
  • La longitud de contexto nativa es de 262,144 tokens y puede ampliarse hasta un millón de tokens mediante YaRN.
El equipo Qwen de Alibaba lanza Qwen3.8-Flash-Next a US$0.16 por millón de tokens de entrada

El equipo Qwen ha lanzado Qwen3.8-Flash-Next, un modelo multimodal open-weight de mezcla de expertos que funciona como una vista previa arquitectónica temprana de la próxima serie Qwen4. El modelo combina una capacidad considerable con una alta eficiencia de costos, con 125 mil millones de parámetros totales y 51 mil millones adicionales de parámetros de embedding N-gram, mientras activa solo 6 mil millones de parámetros por token.

El lanzamiento sigue a Qwen3-Next, que introdujo diseños de arquitectura híbrida que luego se adoptaron en las familias Qwen3.5 a Qwen3.8. Qwen3.8-Flash-Next estará disponible a través de la API de QwenCloud a US$0.16 por millón de tokens de entrada y US$0.47 por millón de tokens de salida, lo que lo posiciona para cargas de trabajo donde importan tanto el rendimiento como los costos por token, incluidas las asistencias de programación y los flujos de trabajo agénticos empresariales.

Los resultados de evaluación indican un desempeño sólido en tareas de ingeniería de software y agentes autónomos. El modelo obtuvo 58.7% en DeepSWE 1.1, 62.5% en SWE-bench Pro y 81.0% en la variante multilingüe. En la automatización de oficina de largo horizonte medida por CoWorkBench, alcanzó 73.9%, por encima de Qwen3.7-Plus y Claude-Opus-4.6.

Su rendimiento en razonamiento general también fue sólido, con 91.7% en GPQA Diamond y 91.9% en LiveCodeBench v6. El desempeño multimodal también se mantuvo firme, incluyendo 84.5% en AndroidWorld y 76.6% en LVBench para comprensión de video largo. La longitud de contexto nativa llega a 262,144 tokens y puede ampliarse hasta un millón de tokens mediante YaRN, lo que hace que el modelo sea relevante para documentos más largos y flujos de trabajo de varios pasos que requieren ventanas de contexto más amplias.

Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026

Innovaciones arquitectónicas e integración para desarrolladores

La arquitectura introduce cuatro mejoras a nivel del sistema. Para la atención, el modelo combina Gated DeltaNet con Qwen Sparse Attention, comprimiendo el contexto histórico de forma eficiente mientras recupera información relevante mediante indexación de microbloques en lugar de procesamiento a nivel de token. Según el lanzamiento, este diseño ofrece hasta 7.6x de aceleración en prefill a un millón de tokens.

El mecanismo Gated Residual expande el flujo residual en cuatro ramas paralelas con compuertas dinámicas. El equipo Qwen señala que esto mejora el flujo de información entre capas y la estabilidad del entrenamiento, al tiempo que admite almacenamiento FP8 para reducir el tráfico de memoria. N-gram Embedding añade capacidad mediante búsquedas de contexto local que requieren un cálculo mínimo y pueden precargarse de forma asíncrona desde la memoria del host.

El entrenamiento utiliza el optimizador Muon con estrategias refinadas de ortogonalización y división de parámetros, lo que el equipo indica que permite una convergencia estable con tamaños de lote mayores sin procedimientos tradicionales de calentamiento.

Los pesos del modelo están disponibles en HuggingFace y ModelScope. El acceso mediante API se ofrece a través de QwenCloud, con compatibilidad para OpenAI-compatible Chat Completions y protocolos compatibles con Anthropic. Los desarrolladores pueden integrar el modelo en flujos de trabajo existentes mediante Claude Code, OpenAI Codex, Qoder CLI, Qwen Code y OpenClaw, con el esfuerzo de razonamiento configurable en niveles low, medium y xhigh. Se espera que pronto siga un lanzamiento oficial de producción con herramientas integradas y un contexto predeterminado de un millón de tokens.

La publicación Alibaba Prices Qwen3.8-Flash API At $0.16 Per Million Tokens, Cutting Inference Costs For 125B-Parameter Model apareció primero en Metaverse Post .