DeepSeek V4.1 Flash casi iguala a GPT-6 Astra en diseño por el 1.4% de su costo
Puntos clave
- •DeepSeek V4.1 Flash obtuvo 81.2 puntos, solo 1.5 puntos por debajo de la puntuación líder de 82.7 de GPT-6 Astra.
- •El costo promedio de DeepSeek fue de $0.023 por diseño terminado, frente a $1.61 de Astra y $3.66 de Claude Fable 5.1.
- •DeepSeek completó cada diseño en un promedio de 5.3 minutos, más rápido que los 11.1 minutos de Astra y los 12.8 minutos de Fable.
- •El benchmark evaluó 13 modelos en resultados de diseño práctico; 11 obtuvieron una puntuación inferior a DeepSeek y también costaron más de operar.
- •Las tasas de entrega fueron de 57.7% para DeepSeek, 60% para Astra y 56.7% para Fable, lo que refleja los resultados considerados listos sin revisiones.

OpenDesign Arena otorgó a DeepSeek V4.1 Flash una puntuación de 81.2 sobre 100 en tareas de diseño del mundo real, casi igualando a GPT-6 Astra de OpenAI, que obtuvo 82.7. El modelo de DeepSeek costó $0.023 por diseño terminado, frente a $1.61 de Astra, aproximadamente el 1.4% de su precio.
OpenDesign, la compañía detrás del sitio de benchmark OpenDesign Arena, sometió a 13 modelos de IA al mismo conjunto de tareas de diseño esta semana. Once modelos obtuvieron una puntuación inferior a DeepSeek V4.1 Flash y costaron más de operar. Solo GPT-6 Astra logró una puntuación superior.
OpenDesign Arena evalúa trabajos cotidianos de diseño, incluidas aplicaciones web, paneles de control, pantallas móviles y páginas de aterrizaje, en una escala de 100 puntos. Treinta puntos miden si el resultado cumple con las instrucciones de la tarea, mientras que los 70 restantes evalúan la calidad del diseño, incluidos el diseño de la interfaz, la jerarquía, el color y la adecuación al estilo solicitado. El benchmark busca responder una pregunta más específica que la de las clasificaciones generales de IA: qué modelo podría usar un diseñador web profesional para realizar trabajo práctico.
GPT-6 Astra promedió 82.7 puntos, completó cada diseño en 11.1 minutos y costó $1.61 por resultado terminado. DeepSeek V4.1 Flash obtuvo 81.2 puntos, tardó 5.3 minutos y costó $0.023. Claude Fable 5.1 quedó en tercer lugar con una puntuación de 80.3, un tiempo promedio de finalización de 12.8 minutos y un costo de $3.66 por diseño.
Los otros modelos evaluados incluyeron Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash y Gemini 3.8 Flash. Todos obtuvieron una puntuación inferior a DeepSeek V4.1 Flash y costaron más de operar. En total, representaron 11 de los 13 modelos evaluados. GPT-6 Astra superó la puntuación de DeepSeek por 1.5 puntos.
El informe técnico de DeepSeek sobre V4.1 Flash atribuye el menor costo operativo y los tiempos de finalización más rápidos del modelo a su arquitectura. El modelo tiene 552 mil millones de parámetros —los ajustes internos que se modifican durante el entrenamiento—, pero activa solo 8 mil millones de parámetros para procesar una instrucción entrante y 16 mil millones para generar una respuesta. DeepSeek denomina a este diseño una arquitectura Causal Encoder-Decoder.
El resultado se suma a otros esfuerzos de DeepSeek por reducir las brechas de capacidad mientras cobra menos que los modelos competidores. Semanas antes, el modelo V4 Pro de la compañía quedó a menos de 5% de Claude Fable 5 en una comparación de benchmark independiente, mientras cobraba una fracción de la tarifa de Fable. DeepSeek también ha estado contratando ingenieros en Beijing para desarrollar su propio Code Harness, con el objetivo declarado de controlar toda la infraestructura agéntica en lugar de suministrar únicamente el modelo subyacente.
La metodología de prueba de OpenDesign limita lo que demuestran los resultados. Un resultado recibe una puntuación solo si inicialmente se muestra como una página web funcional. Los resultados en blanco, dañados o incompletos reciben cero puntos y no se vuelven a evaluar. Por ello, el benchmark mide el desempeño confiable en tareas cotidianas de diseño, no la capacidad general de razonamiento o programación.
OpenAI lanzó GPT-6 Astra el 3 de septiembre. El modelo ha sido descrito como un generalista capaz de realizar tareas como diseñar la distribución de una placa de circuito, redactar una declaración de impuestos y construir una escena en 3D, aunque los primeros evaluadores lo identificaron como un escritor más débil que el modelo al que reemplazó. En el benchmark de OpenDesign, Astra fue más lento y costoso que DeepSeek V4.1 Flash, pero siguió siendo el modelo con la puntuación más alta del grupo.
La tasa de entrega de OpenDesign, definida como la proporción de resultados considerados listos para entregar sin revisiones, fue de 57.7% para DeepSeek V4.1 Flash, 60% para GPT-6 Astra y 56.7% para Claude Fable 5.1. Estas tasas añaden una medida práctica a las puntuaciones de calidad del benchmark: indican con qué frecuencia cada modelo produjo un resultado que los evaluadores consideraron utilizable sin revisiones adicionales.
Reportes relacionados: OpenAI lanza GPT-6 Astra, DeepSeek actualiza V4 Pro y los planes de Code Harness de DeepSeek.
Fuente: Decrypt