新闻宏观经济DeepSeek悄然发布V4 Pro正式版,以远低于Claude Fable 5的价格提供接近前沿水平的性能

DeepSeek悄然发布V4 Pro正式版,以远低于Claude Fable 5的价格提供接近前沿水平的性能

作者: Decrypt·

要点速览

  • DeepSeek通过0813版本将V4 Pro模型转为正式发布,结束了始于4月的预览期,唯一的公开信号是API定价页面上更新的版本标签。
  • 此前对DeepSeek V4 Pro的独立基准测试评估的均为未完成的预览版本,Hugging Face上的模型卡片仍将V4系列描述为预览版本,证实了这一点。
  • DeepSeek自行发布的基准测试显示,V4 Pro在十项代理基准测试中平均落后Claude Fable 5约5.3%,而混合token费率成本约为其四十六分之一。
  • DeepSeek用于对比的十项基准测试中,DSBench-FullStack和DSBench-Hard两项为内部测试集,没有公开排行榜,限制了结果的独立验证。
  • DeepSeek的模型权重以MIT许可证在Hugging Face上发布,允许不受限制的商业使用,包括修改和再分发,无需支付版税。
DeepSeek悄然发布V4 Pro正式版,以远低于Claude Fable 5的价格提供接近前沿水平的性能

DeepSeek已悄然将其deepseek-v4-pro模型切换至0813版本,标志着这一自4月起以预览版运行的系统正式进入通用发布阶段。这家中国AI实验室在周三发布了旗舰模型的最终版本,没有发布博客文章或正式公告——唯一的信号是API定价页面上的一个表格单元格,其中"deepseek-v4-pro"对应的模型版本现已显示为DeepSeek-V4-Pro-0813。

定价保持不变,约为每百万输入token $0.435,每百万输出token $0.87,缓存输入为$0.003625。变化的是底层模型权重。API定价页面是此次更新的唯一公开标识。

DeepSeek V4 Pro自4月以来一直可用,价格比GPT-5 Pro低98%,但此前对其进行测试的每个独立实验室评估的都是预览版本。DeepSeek在7月31日承认了这一点,当时它将V4-Flash推向正式发布,并指出Pro API"保持不变",正式版将"很快推出"。Hugging Face——领先的开源AI项目托管平台——上的模型卡片仍将V4系列描述为"预览版本"。这意味着此前广泛流传的基准测试评分描述的是一个DeepSeek自己尚未定稿的版本。目前尚无公司外部人员对0813版本进行独立基准测试。

基准测试对比

DeepSeek发布了横跨10项代理基准测试的对比——这些测试衡量模型在工具使用、代码执行和数据分析等多步骤任务中的自主完成能力,而非简单的问答。在Claude Fable 5或其他竞争模型占优的八项测试中,差距并不大。Fable 5在所有基准测试中的平均相对领先幅度为5.3%。若排除无工具辅助的Humanity's Last Exam——DeepSeek在该项得分42.7,对手得分53.3,10.6%的差距对平均值影响过大——其余各项的平均差距仅为2.8%。在两个模型均有评分的九项基准测试中,DeepSeek在其中两项直接胜出。

双方的定价均为公开信息,差距十分悬殊。Fable 5的价格为每百万输入token $10、每百万输出token $50。V4 Pro同等规模的价格为$0.435和$0.87。按混合费率计算,约为$30对$0.65——大约46倍,即4,600%的成本差异。据路透社报道,研究机构已将DeepSeek的模型认定为知名AI模型中成本最低的。

每完成一个任务的成本差距更大,因为Fable 5生成更长的输出且每次响应消耗更多计算资源。Artificial Analysis测得Fable 5每项基准测试任务的成本为$3.15,而V4-Flash仅为3美分——便宜约105倍。Hugging Face CEO Clément Delangue将差距定为每项任务超过$31对约$0.04。目前尚无0813版本的单任务成本数据。

Anthropic自身的产品线也使Fable 5的高端定位变得复杂。Claude Opus 5在大多数基准测试中以一半的价格超越Fable 5

DeepSeek自行进行了这些基准测试评估,使用的是其尚未公开的基础设施。其7月的说明中指定了DeepSeek Harness minimal模式"即将发布",以最大努力和高创造力运行。十项基准测试中的两项——DSBench-FullStack和DSBench-Hard——是内部测试集,没有公开排行榜可供独立验证。

更广泛的行业背景

这一趋势在中国开放权重实验室中是一致的:它们持续以极低的成本逼近美国前沿水平几个百分点以内。Kimi K3在发布时即击败了Fable 5和GPT-5.6 Sol,而DeepSeek和小米已将前沿AI成本削减了99%,与此同时美国实验室却在朝相反方向发展。DeepSeek的权重采用MIT许可并在Hugging Face上公开,使独立验证触手可及。MIT许可证允许不受限制的商业使用,包括修改、再分发和集成到专有产品中,且无需支付版税。