新聞股票DeepSeek V4.1-Flash 在編程與代理任務上挑戰更大型 AI 系統

DeepSeek V4.1-Flash 在編程與代理任務上挑戰更大型 AI 系統

作者: Metaverse Post·

重點速覽

  • DeepSeek 發布 V4.1-Flash,稱其為新架構系列中最小的模型;與此同時,據報該公司正準備在上海科創板進行首次公開募股。
  • 該模型採用 5,520 億參數的混合專家架構,並透過因果編碼器—解碼器架構,每個輸入 token 啟用 80 億個參數,每個生成 token 啟用 160 億個參數。
  • 包括 SWA Bounded Replay 與搭配 FP4 快取的 Compressed Sparse Attention 2 在內的效率技術,將 KV-cache 需求降至每個 token 890 bytes,約為前代 Flash 模型需求的四分之一。
  • V4.1-Flash 以 45 兆個多模態 token 從零開始訓練,在 MMLU-Pro、HumanEval 與 GSM8K 上超越 DeepSeek-V4-Pro-Base,並在 Terminal-Bench 2.1 與 DeepSWE v1.1 上略微領先主要的 Opus 與 GPT 模型。
  • 該模型在 GPQA Diamond、Humanity’s Last Exam 與 SimpleQA 上仍落後於規模最大的比較模型,並在較新的 Terminal-Bench 3.0 與 4.0 評測中低於 Opus-5.0。
DeepSeek V4.1-Flash 在編程與代理任務上挑戰更大型 AI 系統

中國 AI 新創公司 DeepSeek 發布 DeepSeek-V4.1-Flash,稱其為新架構系列中最小的模型。此次發布之際,據報該公司正準備在上海以科技產業為主的科創板進行首次公開募股。

這款多模態模型採用 5,520 億參數的混合專家架構,支援最長達 100 萬個 token 的上下文窗口。其主要進展在於效率,而非單純擴大規模。DeepSeek 的因果編碼器—解碼器架構將 40 層 Transformer 分為獨立的 20 層編碼與解碼階段。這意味著每個輸入 token 會啟用 80 億個參數,每個生成 token 則啟用 160 億個參數。

該架構針對輸入量較大的代理任務,在這類任務中,處理大型文件、程式碼庫或對話歷史可能占據相當大比例的運算成本。DeepSeek 表示,其 SWA Bounded Replay 方法不再需要將選定的注意力狀態持久化儲存在固態儲存裝置上,使持久性 KV-cache 的容量降至 DeepSeek-V4-Flash 所需容量的大約八分之一。

相關的 Compressed Sparse Attention 2 系統會在各層分配靜態注意力模式,並重複使用選定的注意力索引。結合採用 FP4 格式的鍵值快取後,該系統將全域 KV-cache 需求降至每個 token 890 bytes,約為前代 Flash 模型所需容量的四分之一。這些數據描述的是推論期間用於保留上下文的記憶體,與模型的總參數量不同。V4.1-Flash 也整合了條件式記憶體與推測解碼,並在每個 MoE 層使用 1 個共享專家與 384 個路由專家。

DeepSeek’s official website is and the model is available at

Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. Introducing the smallest model in our new architecture family, with native visual understanding. Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 pic.twitter.com/wxJGiyX56o — DeepSeek (@deepseek_ai) September 10, 2026

The announcement is also available on X: and https://x.com/deepseek_ai/status/2097930608790167907?ref_src=twsrc%5Etfw.

推理、編程與代理任務的競爭性結果

DeepSeek 從零開始,使用 45 兆個多模態 token 訓練 V4.1-Flash;從預訓練初期開始,圖像便與文字一同以原生方式處理。稀疏注意力訓練從 64,000 個 token 開始,並在 34 兆個 token 的階段將上下文長度延伸至 100 萬個 token。後訓練結合了監督式微調、強化學習與 on-policy 蒸餾,推理強度可在 1 至 100 的尺度上調整。

報告中的基準測試顯示,該模型相較於大得多的模型具有強勁表現。基礎版本在 MMLU-Pro、HumanEval 與 GSM8K 上分別取得 74.1、79.4 與 93.0 分;DeepSeek-V4-Pro-Base 的相應分數則為 73.5、76.8 與 92.6。在最高推理強度下,V4.1-Flash 在 Terminal-Bench 2.1 與 DeepSWE v1.1 上分別取得 90.6 與 74.2 分,在這些代理基準測試中略微領先主要的 Opus 與 GPT 模型。該模型的 Codeforces 評分也達到 3,471,並追平 MathArena Apex 所列出的最佳結果。

這些結果並非全面領先。V4.1-Flash 在 GPQA Diamond、Humanity’s Last Exam 與 SimpleQA 上仍落後於規模最大的比較模型。在較新的 Terminal-Bench 3.0 與 4.0 評測中,其分數也低於 Opus-5.0,儘管相較於早期 DeepSeek 模型已取得大幅進步。

多模態結果包括在 MMMU-Pro、CVBench 與 DocVQA 上分別取得 56.5、77.9 與 95.6 分。啟用代理工具後,該模型在 Chartography 與 BabyVision 上分別取得 78.9 與 89.6 分。

The original report was published by Metaverse Post: https://mpost.io/new-deepseek-v4-1-flash-challenges-larger-ai-systems-on-coding-and-agent-tasks/