DeepSeek V4.1 Flash sfiora GPT-6 Astra nel design all’1,4% del costo
Punti chiave
- •DeepSeek V4.1 Flash ha ottenuto 81,2 punti, appena 1,5 punti in meno rispetto al punteggio di GPT-6 Astra, pari a 82,7.
- •Il costo medio di DeepSeek è stato di 0,023 $ per design completato, contro 1,61 $ per Astra e 3,66 $ per Claude Fable 5.1.
- •DeepSeek ha completato ciascun design in una media di 5,3 minuti, più rapidamente degli 11,1 minuti di Astra e dei 12,8 minuti di Fable.
- •Il benchmark ha testato 13 modelli su output di design pratici: 11 hanno ottenuto un punteggio inferiore a DeepSeek e sono costati di più da eseguire.
- •I tassi di consegna sono stati del 57,7% per DeepSeek, del 60% per Astra e del 56,7% per Fable, sulla base degli output giudicati pronti senza revisioni.

OpenDesign Arena ha assegnato a DeepSeek V4.1 Flash un punteggio di 81,2 su 100 nelle attività di design reali, quasi alla pari con GPT-6 Astra di OpenAI, che ha ottenuto 82,7. Il modello di DeepSeek è costato 0,023 $ per design completato, contro 1,61 $ per Astra, pari a circa l’1,4% del prezzo.
OpenDesign, la società che gestisce il sito del benchmark OpenDesign Arena, questa settimana ha sottoposto 13 modelli di IA allo stesso insieme di attività di design. Undici modelli hanno ottenuto un punteggio inferiore a DeepSeek V4.1 Flash e sono costati di più da eseguire. Solo GPT-6 Astra ha raggiunto un punteggio superiore.
OpenDesign Arena valuta attività di design quotidiane, tra cui web app, dashboard, schermate mobile e landing page, su una scala di 100 punti. Trenta punti misurano se l’output soddisfa il brief dell’attività, mentre i restanti 70 valutano la qualità del design, inclusi layout, gerarchia, colori e adeguatezza allo stile richiesto. Il benchmark mira a rispondere a una domanda più circoscritta rispetto alle classifiche generiche dei modelli di IA: quale modello potrebbe utilizzare per attività pratiche un web designer professionista.
GPT-6 Astra ha ottenuto una media di 82,7 punti, ha completato ciascun design in 11,1 minuti e ha avuto un costo di 1,61 $ per output completato. DeepSeek V4.1 Flash ha totalizzato 81,2 punti, impiegato 5,3 minuti e avuto un costo di 0,023 $. Claude Fable 5.1 si è classificato terzo con 80,3 punti, un tempo medio di completamento di 12,8 minuti e un costo di 3,66 $ per design.
Gli altri modelli testati includevano Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash e Gemini 3.8 Flash. Tutti hanno ottenuto un punteggio inferiore a DeepSeek V4.1 Flash e sono costati di più da eseguire. Nel complesso, si tratta di 11 dei 13 modelli testati. GPT-6 Astra ha superato il punteggio di DeepSeek di 1,5 punti.
Il rapporto tecnico di DeepSeek su V4.1 Flash attribuisce il costo operativo inferiore e i tempi di completamento più rapidi all’architettura del modello. Il modello dispone di 552 miliardi di parametri, ovvero le impostazioni interne modificate durante l’addestramento, ma ne attiva soltanto 8 miliardi per elaborare un prompt in ingresso e 16 miliardi per generare una risposta. DeepSeek definisce il design un’architettura Causal Encoder-Decoder.
Il risultato si aggiunge ad altri tentativi di DeepSeek di ridurre il divario nelle capacità applicando prezzi inferiori rispetto ai modelli concorrenti. Settimane prima, il modello V4 Pro dell’azienda si era avvicinato entro il 5% a Claude Fable 5 in un confronto basato su un benchmark distinto, applicando una frazione della tariffa di Fable. DeepSeek ha inoltre iniziato ad assumere ingegneri a Pechino per sviluppare il proprio Code Harness, con l’obiettivo dichiarato di controllare l’intero stack agentico invece di fornire soltanto il modello sottostante.
La metodologia di test di OpenDesign limita ciò che i risultati possono dimostrare. Un output viene valutato solo se inizialmente viene visualizzato come una pagina web funzionante. Gli output vuoti, non funzionanti o troncati ricevono zero punti e non vengono sottoposti a un nuovo test. Di conseguenza, il benchmark misura prestazioni affidabili nelle attività di design quotidiane, non la capacità di ragionamento generale o di programmazione.
OpenAI ha rilasciato GPT-6 Astra il 3 settembre. Il modello è stato descritto come un generalista capace di svolgere attività come progettare il layout di una scheda elettronica, preparare una dichiarazione dei redditi e creare una scena 3D, anche se i primi tester lo hanno considerato uno scrittore più debole rispetto al modello che ha sostituito. Nel benchmark di OpenDesign, Astra è risultato più lento e costoso di DeepSeek V4.1 Flash, ma è rimasto il modello con il punteggio più alto del gruppo.
Il tasso di consegna di OpenDesign, definito come la quota di output giudicati pronti per essere consegnati senza revisioni, è stato del 57,7% per DeepSeek V4.1 Flash, del 60% per GPT-6 Astra e del 56,7% per Claude Fable 5.1. Questi tassi aggiungono una misura pratica ai punteggi di qualità del benchmark: indicano con quale frequenza ciascun modello ha prodotto un output che i valutatori hanno ritenuto utilizzabile senza ulteriori revisioni.
Articoli correlati: OpenAI rilascia GPT-6 Astra, DeepSeek aggiorna V4 Pro e i piani di DeepSeek per Code Harness.
Fonte: Decrypt