DeepSeek V4.1-Flash desafía a sistemas de IA más grandes en tareas de programación y agentes
Puntos clave
- •DeepSeek lanzó V4.1-Flash, descrito como el modelo más pequeño de una nueva familia arquitectónica, mientras la empresa supuestamente se prepara para una oferta pública inicial en el mercado STAR de Shanghái.
- •El modelo utiliza una arquitectura de mezcla de expertos de 552 mil millones de parámetros con un diseño codificador-decodificador causal que activa 8 mil millones de parámetros por token de entrada y 16 mil millones por token generado.
- •Las técnicas de eficiencia, incluido SWA Bounded Replay y Compressed Sparse Attention 2 con almacenamiento en caché FP4, reducen el requisito de KV-cache a 890 bytes por token, aproximadamente una cuarta parte del requisito del modelo Flash anterior.
- •Entrenado desde cero con 45 billones de tokens multimodales, V4.1-Flash superó a DeepSeek-V4-Pro-Base en MMLU-Pro, HumanEval y GSM8K, y aventajó ligeramente a los principales modelos Opus y GPT en Terminal-Bench 2.1 y DeepSWE v1.1.
- •El modelo quedó por detrás de los modelos de comparación más grandes en GPQA Diamond, Humanity’s Last Exam y SimpleQA, y fue inferior a Opus-5.0 en las nuevas evaluaciones Terminal-Bench 3.0 y 4.0.

La startup china de IA DeepSeek lanzó DeepSeek-V4.1-Flash, que describe como el modelo más pequeño de una nueva familia arquitectónica. El lanzamiento se produce mientras, según informes, la empresa se prepara para una oferta pública inicial en el mercado STAR de Shanghái, enfocado en tecnología.
El modelo multimodal cuenta con una arquitectura de mezcla de expertos de 552 mil millones de parámetros y admite ventanas de contexto de hasta un millón de tokens. Su principal avance es la eficiencia, más que la escala por sí misma. La arquitectura codificador-decodificador causal de DeepSeek divide 40 capas de transformadores en etapas separadas de codificación y decodificación de 20 capas cada una. Esto significa que se activan 8 mil millones de parámetros por cada token de entrada y 16 mil millones por cada token generado.
La arquitectura está dirigida a tareas de agentes con un alto volumen de entradas, en las que procesar documentos extensos, bases de código o historiales de conversaciones puede representar una parte significativa de los costos computacionales. DeepSeek afirmó que su método SWA Bounded Replay elimina la necesidad de conservar estados de atención seleccionados en almacenamiento de estado sólido, lo que reduce la huella persistente de KV-cache a aproximadamente una octava parte de la utilizada por DeepSeek-V4-Flash.
Un sistema relacionado, Compressed Sparse Attention 2, asigna modos de atención estáticos entre las capas y reutiliza índices de atención seleccionados. Combinado con el almacenamiento en caché de valores clave en formato FP4, el sistema reduce el requisito global de KV-cache a 890 bytes por token, o aproximadamente una cuarta parte del requisito del modelo Flash anterior. Estas cifras describen la memoria utilizada para conservar el contexto durante la inferencia, separada del conteo total de parámetros del modelo. V4.1-Flash también incorpora memoria condicional y decodificación especulativa, y utiliza un experto compartido y 384 expertos dirigidos por capa MoE.
DeepSeek’s official website is and the model is available at
Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. Introducing the smallest model in our new architecture family, with native visual understanding. Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 pic.twitter.com/wxJGiyX56o — DeepSeek (@deepseek_ai) September 10, 2026
El anuncio también está disponible en X: y https://x.com/deepseek_ai/status/2097930608790167907?ref_src=twsrc%5Etfw.
Resultados competitivos en razonamiento, programación y agentes
DeepSeek entrenó V4.1-Flash desde cero con 45 billones de tokens multimodales, con imágenes procesadas de forma nativa junto con texto desde el inicio del preentrenamiento. El entrenamiento con atención dispersa comenzó con 64,000 tokens, antes de ampliar la longitud de contexto a un millón de tokens en la etapa de 34 billones de tokens. El posentrenamiento combinó ajuste fino supervisado, aprendizaje por refuerzo y destilación basada en la política actual. El esfuerzo de razonamiento se puede configurar en una escala de uno a 100.
Las pruebas reportadas muestran un desempeño sólido frente a modelos mucho más grandes. La versión base obtuvo 74.1 en MMLU-Pro, 79.4 en HumanEval y 93.0 en GSM8K, frente a puntuaciones de 73.5, 76.8 y 92.6 para DeepSeek-V4-Pro-Base. Con el máximo esfuerzo de razonamiento, V4.1-Flash obtuvo 90.6 en Terminal-Bench 2.1 y 74.2 en DeepSWE v1.1, situándose ligeramente por delante de los principales modelos Opus y GPT en esas pruebas de agentes. También registró una clasificación de 3,471 en Codeforces y igualó el mejor resultado listado en MathArena Apex.
Los resultados no fueron uniformemente dominantes. V4.1-Flash permaneció por detrás de los modelos de comparación más grandes en GPQA Diamond, Humanity’s Last Exam y SimpleQA. Sus puntuaciones en las nuevas evaluaciones Terminal-Bench 3.0 y 4.0 también quedaron por debajo de Opus-5.0, aunque representaron avances importantes frente a modelos anteriores de DeepSeek.
Los resultados multimodales incluyeron puntuaciones de 56.5 en MMMU-Pro, 77.9 en CVBench y 95.6 en DocVQA. Con las herramientas de agentes activadas, el modelo obtuvo 78.9 en Chartography y 89.6 en BabyVision.
El informe original fue publicado por Metaverse Post: https://mpost.io/new-deepseek-v4-1-flash-challenges-larger-ai-systems-on-coding-and-agent-tasks/