DeepSeek V4.1 Flash rivalise presque avec GPT-6 Astra en design pour 1,4 % du coût
Points clés
- •DeepSeek V4.1 Flash a obtenu 81,2 points, soit seulement 1,5 point de moins que le score de tête de GPT-6 Astra, établi à 82,7.
- •Le coût moyen de DeepSeek s’est élevé à 0,023 $ par design finalisé, contre 1,61 $ pour Astra et 3,66 $ pour Claude Fable 5.1.
- •DeepSeek a réalisé chaque design en 5,3 minutes en moyenne, plus rapidement qu’Astra, à 11,1 minutes, et que Fable, à 12,8 minutes.
- •Le benchmark a testé 13 modèles sur des productions de design pratiques ; 11 ont obtenu un score inférieur à celui de DeepSeek tout en coûtant davantage à exploiter.
- •Les taux de livraison étaient de 57,7 % pour DeepSeek, 60 % pour Astra et 56,7 % pour Fable, reflétant la part des résultats jugés prêts sans révision.

OpenDesign Arena a attribué à DeepSeek V4.1 Flash un score de 81,2 sur 100 pour des tâches de design réelles, presque à égalité avec GPT-6 Astra d’OpenAI, qui a obtenu 82,7. Le modèle de DeepSeek a coûté 0,023 $ par design finalisé, contre 1,61 $ pour Astra, soit environ 1,4 % du prix.
OpenDesign, l’entreprise à l’origine du site de benchmark OpenDesign Arena, a soumis 13 modèles d’IA à la même série de tâches de design cette semaine. Onze modèles ont obtenu un score inférieur à celui de DeepSeek V4.1 Flash tout en coûtant plus cher à utiliser. Seul GPT-6 Astra a obtenu un meilleur résultat.
OpenDesign Arena évalue des travaux de design courants, notamment la création d’applications web, de tableaux de bord, d’interfaces mobiles et de pages d’atterrissage, sur une échelle de 100 points. Trente points mesurent la conformité du résultat au cahier des charges, tandis que les 70 points restants évaluent la qualité du design, notamment la mise en page, la hiérarchie visuelle, les couleurs et l’adéquation au style demandé. Le benchmark cherche à répondre à une question plus ciblée que les classements généralistes de l’IA : quel modèle un webdesigner en activité pourrait utiliser pour son travail pratique.
GPT-6 Astra a obtenu une moyenne de 82,7 points, réalisé chaque design en 11,1 minutes et coûté 1,61 $ par résultat finalisé. DeepSeek V4.1 Flash a obtenu 81,2 points, nécessité 5,3 minutes et coûté 0,023 $. Claude Fable 5.1 s’est classé troisième avec un score de 80,3, un temps moyen de réalisation de 12,8 minutes et un coût de 3,66 $ par design.
Les autres modèles testés comprenaient Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash et Gemini 3.8 Flash. Tous ont obtenu un score inférieur à celui de DeepSeek V4.1 Flash et coûté davantage à exploiter. Au total, cela représente 11 des 13 modèles testés. GPT-6 Astra a dépassé le score de DeepSeek de 1,5 point.
Le rapport technique de DeepSeek sur V4.1 Flash attribue le coût d’exploitation réduit et les délais de réalisation plus courts du modèle à son architecture. Le modèle compte 552 milliards de paramètres — les réglages internes ajustés pendant l’entraînement — mais n’en active que 8 milliards pour traiter une requête entrante et 16 milliards pour générer une réponse. DeepSeek appelle cette conception une architecture Causal Encoder-Decoder.
Ce résultat s’inscrit dans les efforts déployés par DeepSeek pour réduire l’écart de capacités tout en facturant moins que ses concurrents. Quelques semaines plus tôt, le modèle V4 Pro de l’entreprise s’était rapproché à moins de 5 % de Claude Fable 5 lors d’une comparaison sur un autre benchmark, tout en étant proposé à une fraction du tarif de Fable. DeepSeek recrute également des ingénieurs à Pékin pour développer son propre Code Harness, avec l’objectif affiché de contrôler l’ensemble de la pile agentique plutôt que de fournir uniquement le modèle sous-jacent.
La méthodologie de test d’OpenDesign limite la portée de ces résultats. Un résultat n’est évalué que s’il s’affiche initialement comme une page web fonctionnelle. Les résultats vides, défectueux ou tronqués reçoivent zéro point et ne sont pas retestés. Le benchmark mesure donc la fiabilité des performances sur des tâches de design courantes, plutôt que les capacités générales de raisonnement ou de programmation.
OpenAI a lancé GPT-6 Astra le 3 septembre. Le modèle est présenté comme un généraliste capable d’effectuer des tâches telles que concevoir le circuit imprimé d’une carte, rédiger une déclaration fiscale ou créer une scène en 3D, même si les premiers testeurs l’ont jugé moins performant à l’écrit que le modèle qu’il remplaçait. Sur le benchmark d’OpenDesign, Astra s’est montré plus lent et plus coûteux que DeepSeek V4.1 Flash, mais reste le modèle ayant obtenu le meilleur score du panel.
Le taux de livraison d’OpenDesign, défini comme la part des résultats jugés prêts à être transmis sans révision, s’est établi à 57,7 % pour DeepSeek V4.1 Flash, 60 % pour GPT-6 Astra et 56,7 % pour Claude Fable 5.1. Ces taux ajoutent une mesure pratique aux scores de qualité du benchmark : ils indiquent à quelle fréquence chaque modèle a produit un résultat que les évaluateurs considéraient comme utilisable sans retouche supplémentaire.
Articles associés : OpenAI lance GPT-6 Astra, DeepSeek met à niveau V4 Pro et les projets de DeepSeek pour Code Harness.
Source : Decrypt