新闻宏观经济DeepSeek V4.1 Flash 设计能力近乎追平 GPT-6 Astra,成本仅为其 1.4%

DeepSeek V4.1 Flash 设计能力近乎追平 GPT-6 Astra,成本仅为其 1.4%

作者: Decrypt·

要点速览

  • DeepSeek V4.1 Flash 得分为 81.2 分,仅比领先的 GPT-6 Astra(82.7 分)低 1.5 分。
  • DeepSeek 每完成一个设计的平均成本为 $0.023,低于 Astra 的 $1.61 和 Claude Fable 5.1 的 $3.66。
  • DeepSeek 完成每个设计的平均时间为 5.3 分钟,快于 Astra 的 11.1 分钟和 Fable 的 12.8 分钟。
  • 该基准测试了 13 个模型的实际设计输出,其中 11 个模型的得分低于 DeepSeek,运行成本却更高。
  • DeepSeek、Astra 和 Fable 的交付率分别为 57.7%、60% 和 56.7%,反映了无需修改即可交付的输出比例。
DeepSeek V4.1 Flash 设计能力近乎追平 GPT-6 Astra,成本仅为其 1.4%

OpenDesign Arena 在实际设计任务中为 DeepSeek V4.1 Flash 打出 81.2 分(满分 100 分),接近得分为 82.7 分的 OpenAI GPT-6 Astra。DeepSeek 的模型每完成一个设计的成本为 $0.023,而 Astra 为 $1.61,约为后者价格的 1.4%。

本周,OpenDesign——OpenDesign Arena 基准测试网站背后的公司——让 13 个 AI 模型完成了同一批设计任务。其中 11 个模型的得分低于 DeepSeek V4.1 Flash,运行成本却更高。只有 GPT-6 Astra 的得分更高。

OpenDesign Arena 以 100 分为满分,评估包括网页应用、仪表盘、移动端界面和落地页在内的日常设计工作。其中 30 分用于衡量输出是否符合任务要求,剩余 70 分则评估布局、层级、色彩以及与指定风格的匹配度等设计质量。该基准旨在回答一个比通用 AI 排行榜更具体的问题:实际从事网页设计的人员可以选择哪个模型来完成工作。

GPT-6 Astra 的平均得分为 82.7 分,每个设计平均耗时 11.1 分钟,完成一次输出的成本为 $1.61。DeepSeek V4.1 Flash 得分为 81.2 分,耗时 5.3 分钟,成本为 $0.023。Claude Fable 5.1 以 80.3 分排名第三,平均完成时间为 12.8 分钟,每个设计的成本为 $3.66。

其他受测模型包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash。它们的得分均低于 DeepSeek V4.1 Flash,运行成本也更高。总体来看,这占受测模型的 11 个。GPT-6 Astra 的得分仅比 DeepSeek 高 1.5 分。

DeepSeek 关于 V4.1 Flash 的技术报告将该模型较低的运行成本和更快的完成速度归因于其架构。该模型共拥有 5520 亿个参数——即模型在训练过程中调整的内部设置——但处理输入提示词时只激活 80 亿个参数,生成响应时则激活 160 亿个参数。DeepSeek 将这种设计称为因果编码器-解码器(Causal Encoder-Decoder)架构。

这一结果延续了 DeepSeek 以较低价格缩小能力差距的其他尝试。几周前,该公司的 V4 Pro 模型在另一项基准对比中取得了距离 Claude Fable 5 不到 5% 的成绩,同时收费仅为 Fable 价格的一小部分。DeepSeek 还一直在北京招聘工程师,开发自有的 Code Harness,目标是掌控完整的智能体技术栈,而不仅仅是提供底层模型。

OpenDesign 的测试方法限制了这些结果能够证明的范围。只有在输出首次渲染为可运行网页时,模型结果才会获得评分。空白、损坏或被截断的输出会得 0 分,且不会重新测试。因此,该基准衡量的是模型在日常设计任务中的可靠表现,而不是通用推理或编程能力。

OpenAI 于 9 月 3 日发布了 GPT-6 Astra。该模型被描述为能够完成电路板布局、起草纳税申报表和构建 3D 场景等多种任务的通用型模型,但早期测试人员认为,它的写作能力弱于被其替代的模型。在 OpenDesign 的基准测试中,Astra 的速度比 DeepSeek V4.1 Flash 更慢、价格也更高,但仍是所有受测模型中得分最高的一个。

OpenDesign 的交付率定义为被评估者认为无需修改即可交付的输出占比。DeepSeek V4.1 Flash 的交付率为 57.7%,GPT-6 Astra 为 60%,Claude Fable 5.1 为 56.7%。这一指标为基准测试的质量得分增加了实际应用维度,反映出各模型生成的输出有多大比例被评估人员认为无需进一步修改即可使用。

相关文章:OpenAI 发布 GPT-6 AstraDeepSeek 升级 V4 Pro以及 DeepSeek 的 Code Harness 计划

来源:Decrypt