DeepSeek V4.1 Flash 在設計能力上幾乎追平 GPT-6 Astra,成本僅為 1.4%
重點速覽
- •DeepSeek V4.1 Flash 得分 81.2 分,僅比 GPT-6 Astra 的最高分 82.7 分低 1.5 分。
- •DeepSeek 每完成一項設計的平均成本為 $0.023,相較之下 Astra 為 $1.61,Claude Fable 5.1 為 $3.66。
- •DeepSeek 平均在 5.3 分鐘內完成每項設計,快於 Astra 的 11.1 分鐘和 Fable 的 12.8 分鐘。
- •這項基準測試以實用設計輸出為對象評估 13 個模型,其中 11 個模型的得分低於 DeepSeek,運行成本也更高。
- •交付率方面,DeepSeek 為 57.7%、Astra 為 60%、Fable 為 56.7%,反映各模型產出無需修改即可交付的比例。

OpenDesign Arena 在真實世界設計任務中,給予 DeepSeek V4.1 Flash 81.2 分(滿分 100 分),幾乎追上得分 82.7 的 OpenAI GPT-6 Astra。DeepSeek 的模型每完成一項設計成本為 $0.023,相較 Astra 的 $1.61,約為其價格的 1.4%。
本週,OpenDesign 讓 13 個 AI 模型完成同一批設計任務。這家公司營運 OpenDesign Arena 基準測試網站,其中有 11 個模型的得分低於 DeepSeek V4.1 Flash,且運行成本更高。只有 GPT-6 Astra 的得分更高。
OpenDesign Arena 以 100 分制評估日常設計工作,包括網頁應用程式、儀表板、行動版面和登陸頁面。其中 30 分用於衡量輸出是否符合任務要求,其餘 70 分則評估設計品質,包括版面配置、層次結構、色彩以及是否符合指定風格。這項基準測試旨在回答一個比通用 AI 排行榜更狹義的問題:實際工作的網頁設計師可以使用哪個模型來完成工作。
GPT-6 Astra 平均得分 82.7 分,每項設計需時 11.1 分鐘,完成一項輸出的成本為 $1.61。DeepSeek V4.1 Flash 得分 81.2 分,耗時 5.3 分鐘,成本為 $0.023。Claude Fable 5.1 以 80.3 分排名第三,平均完成時間為 12.8 分鐘,每項設計成本為 $3.66。
其他受測模型包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash。這些模型的得分都低於 DeepSeek V4.1 Flash,運行成本也更高。總計共有 11 個模型符合這一情況。GPT-6 Astra 的得分超過 DeepSeek 1.5 分。
DeepSeek 的 V4.1 Flash 技術報告將該模型較低的運行成本與較快的完成時間歸因於其架構。模型總共擁有 552 billion 個參數,也就是在訓練期間調整的內部設定,但處理傳入提示時只啟用 8 billion 個參數,生成回覆時則啟用 16 billion 個參數。DeepSeek 將這種設計稱為 Causal Encoder-Decoder 架構。
這項結果延續了 DeepSeek 以較低價格縮小與競爭模型能力差距的其他嘗試。幾週前,該公司的 V4 Pro 模型在另一項基準比較中,得分與 Claude Fable 5 的差距不到 5%,但收費僅為 Fable 的一小部分。DeepSeek 也一直在北京招募工程師,開發自有的 Code Harness,目標是掌握完整的 agentic 技術堆疊,而不只是提供底層模型。
OpenDesign 的測試方法限制了這些結果所能證明的範圍。只有在輸出一開始就能呈現為可運作的網頁時,該輸出才會獲得評分。空白、損壞或內容不完整的輸出會得到零分,且不會重新測試。因此,這項基準測試衡量的是模型在日常設計任務上的可靠表現,而非一般推理或程式設計能力。
OpenAI 於 September 3 發布 GPT-6 Astra。這款模型被形容為通用型模型,能夠完成配置電路板、撰寫報稅表和建立 3D 場景等任務,但早期測試者認為它的寫作能力不如被其取代的模型。在 OpenDesign 的基準測試中,Astra 比 DeepSeek V4.1 Flash 更慢、成本也更高,但仍是所有受測模型中得分最高的模型。
OpenDesign 將交付率定義為被評估者認定無需修改即可交付的輸出比例。DeepSeek V4.1 Flash 的交付率為 57.7%,GPT-6 Astra 為 60%,Claude Fable 5.1 則為 56.7%。這些比率為基準測試的品質分數增加了實務層面的衡量標準:它們顯示各模型產出的結果,有多大比例被評估者認為無需進一步修改即可使用。
相關報導:OpenAI 發布 GPT-6 Astra、DeepSeek 升級 V4 Pro,以及 DeepSeek 的 Code Harness 計畫。
來源:Decrypt