DeepSeek V4.1-Flash 在编码和智能体任务方面挑战更大型 AI 系统
要点速览
- •DeepSeek 发布了 V4.1-Flash,并称其为全新架构系列中规模最小的模型;该公司据报道正准备在上海科创板进行首次公开募股。
- •该模型采用 5520 亿参数的混合专家骨干网络,并通过因果编码器-解码器架构实现每个输入 token 激活 80 亿个参数、每个生成 token 激活 160 亿个参数。
- •SWA Bounded Replay 和结合 FP4 缓存的 Compressed Sparse Attention 2 等效率技术,将 KV-cache 需求降至每个 token 890 字节,约为上一代 Flash 模型需求的四分之一。
- •V4.1-Flash 使用 45 万亿个多模态 token 从头训练,在 MMLU-Pro、HumanEval 和 GSM8K 上超过 DeepSeek-V4-Pro-Base,并在 Terminal-Bench 2.1 和 DeepSWE v1.1 上略微领先领先的 Opus 和 GPT 模型。
- •该模型在 GPQA Diamond、Humanity’s Last Exam 和 SimpleQA 上仍落后于规模最大的对比模型,并在更新的 Terminal-Bench 3.0 和 4.0 评测中低于 Opus-5.0。

中国 AI 初创公司 DeepSeek 发布了 DeepSeek-V4.1-Flash,并称其为全新架构系列中规模最小的模型。此次发布正值该公司据报道准备在上海以科技企业为重点的科创板进行首次公开募股之际。
该多模态模型采用 5520 亿参数的混合专家骨干网络,支持最长达一百万个 token 的上下文窗口。其主要进展在于效率,而非单纯扩大规模。DeepSeek 的因果编码器-解码器架构将 40 个 Transformer 层划分为独立的 20 层编码阶段和 20 层解码阶段。这意味着每个输入 token 会激活 80 亿个参数,每个生成 token 会激活 160 亿个参数。
该架构面向输入密集型智能体任务。在这类任务中,处理大型文档、代码库或对话历史可能占据计算成本的很大一部分。DeepSeek 表示,其 SWA Bounded Replay 方法不再需要将选定的注意力状态持久化到固态存储中,使持久化 KV-cache 的占用量降至 DeepSeek-V4-Flash 的约八分之一。
相关的 Compressed Sparse Attention 2 系统为各层分配静态注意力模式,并重复使用选定的注意力索引。结合采用 FP4 格式的键值缓存后,该系统将全局 KV-cache 需求降至每个 token 890 字节,约为上一代 Flash 模型需求的四分之一。这些数据描述的是推理过程中用于保留上下文的内存,与模型的总参数量不同。V4.1-Flash 还采用了条件记忆和推测解码,并在每个 MoE 层中使用 1 个共享专家和 384 个路由专家。
DeepSeek’s official website is and the model is available at
Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. Introducing the smallest model in our new architecture family, with native visual understanding. Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 pic.twitter.com/wxJGiyX56o — DeepSeek (@deepseek_ai) September 10, 2026
该公告也可在 X 上查看: 和 https://x.com/deepseek_ai/status/2097930608790167907?ref_src=twsrc%5Etfw。
推理、编码和智能体任务的竞争性结果
DeepSeek 从头开始使用 45 万亿个多模态 token 训练 V4.1-Flash,其中图像从预训练开始阶段就与文本一起进行原生处理。稀疏注意力训练从 64,000 个 token 开始,并在训练达到 34 万亿个 token 阶段时将上下文长度扩展至一百万个 token。后训练结合了监督微调、强化学习和在线策略蒸馏。推理强度可在 1 至 100 的范围内进行配置。
报告中的基准测试显示,该模型相较规模大得多的模型表现强劲。基础版本在 MMLU-Pro、HumanEval 和 GSM8K 上分别取得 74.1、79.4 和 93.0 分,而 DeepSeek-V4-Pro-Base 的对应得分为 73.5、76.8 和 92.6。在最高推理强度下,V4.1-Flash 在 Terminal-Bench 2.1 和 DeepSWE v1.1 上分别取得 90.6 和 74.2 分,在这两项智能体基准测试中略微领先于领先的 Opus 和 GPT 模型。该模型还获得了 3,471 的 Codeforces 评级,并追平了 MathArena Apex 上公布的最佳成绩。
这些结果并非在所有方面都占据优势。在 GPQA Diamond、Humanity’s Last Exam 和 SimpleQA 上,V4.1-Flash 仍落后于规模最大的对比模型。尽管相较早期 DeepSeek 模型取得了大幅进步,但其在更新的 Terminal-Bench 3.0 和 4.0 评测中的得分也低于 Opus-5.0。
多模态测试结果包括 MMMU-Pro 的 56.5 分、CVBench 的 77.9 分和 DocVQA 的 95.6 分。启用智能体工具后,该模型在 Chartography 和 BabyVision 上分别取得 78.9 分和 89.6 分。
The original report was published by Metaverse Post: https://mpost.io/new-deepseek-v4-1-flash-challenges-larger-ai-systems-on-coding-and-agent-tasks/