DeepSeek V4.1 Flash niemal dorównuje GPT-6 Astra w projektowaniu za 1,4% kosztu
Najważniejsze informacje
- •DeepSeek V4.1 Flash uzyskał wynik 81,2 punktu, zaledwie 1,5 punktu mniej niż lider GPT-6 Astra z wynikiem 82,7.
- •Średni koszt ukończonego projektu wyniósł 0,023 USD dla DeepSeek, w porównaniu z 1,61 USD dla Astry i 3,66 USD dla Claude Fable 5.1.
- •DeepSeek ukończył każdy projekt średnio w 5,3 minuty, szybciej niż Astra (11,1 minuty) i Fable (12,8 minuty).
- •Benchmark obejmował 13 modeli i praktyczne wyniki projektowe; 11 z nich uzyskało niższe wyniki od DeepSeek, a jednocześnie kosztowało więcej w eksploatacji.
- •Wskaźnik dostarczenia wyniósł 57,7% dla DeepSeek, 60% dla Astry i 56,7% dla Fable, odzwierciedlając odsetek wyników uznanych za gotowe bez poprawek.

OpenDesign Arena przyznała modelowi DeepSeek V4.1 Flash wynik 81,2 na 100 w rzeczywistych zadaniach projektowych, niemal dorównując OpenAI GPT-6 Astra, który uzyskał 82,7 punktu. Model DeepSeek kosztował 0,023 USD za ukończony projekt, w porównaniu z 1,61 USD w przypadku Astry — około 1,4% tej ceny.
OpenDesign, firma stojąca za serwisem benchmarkowym OpenDesign Arena, przepuściła w tym tygodniu 13 modeli AI przez ten sam zestaw zadań projektowych. Jedenaście modeli uzyskało wyniki niższe od DeepSeek V4.1 Flash i kosztowało więcej w eksploatacji. Wyższy wynik osiągnął tylko GPT-6 Astra.
OpenDesign Arena ocenia codzienną pracę projektową, w tym tworzenie aplikacji internetowych, pulpitów nawigacyjnych, ekranów mobilnych i stron docelowych, w skali 100 punktów. Trzydzieści punktów mierzy to, czy wynik spełnia założenia zadania, a pozostałe 70 ocenia jakość projektu, w tym układ, hierarchię, kolorystykę i dopasowanie do oczekiwanego stylu. Benchmark ma odpowiadać na węższe pytanie niż rankingi modeli AI ogólnego przeznaczenia: którego modelu pracujący projektant stron internetowych mógłby użyć w praktycznej pracy.
GPT-6 Astra uzyskał średnio 82,7 punktu, ukończył każdy projekt w 11,1 minuty i kosztował 1,61 USD za gotowy wynik. DeepSeek V4.1 Flash zdobył 81,2 punktu, potrzebował 5,3 minuty i kosztował 0,023 USD. Claude Fable 5.1 zajął trzecie miejsce z wynikiem 80,3 punktu, średnim czasem realizacji 12,8 minuty i kosztem 3,66 USD za projekt.
Wśród pozostałych testowanych modeli znalazły się Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash i Gemini 3.8 Flash. Każdy z nich uzyskał wynik niższy od DeepSeek V4.1 Flash i kosztował więcej w eksploatacji. Łącznie dotyczyło to 11 z 13 testowanych modeli. GPT-6 Astra przewyższyła wynik DeepSeek o 1,5 punktu.
Raport techniczny DeepSeek dotyczący V4.1 Flash przypisuje niższy koszt działania i krótszy czas realizacji architekturze modelu. Model ma łącznie 552 miliardy parametrów — wewnętrznych ustawień modyfikowanych podczas treningu — ale aktywuje tylko 8 miliardów parametrów do przetworzenia przychodzącego polecenia i 16 miliardów do wygenerowania odpowiedzi. DeepSeek nazywa tę konstrukcję architekturą Causal Encoder-Decoder.
Wynik ten jest kolejnym przykładem działań DeepSeek zmierzających do zmniejszania różnic w możliwościach przy niższych opłatach niż w przypadku konkurencyjnych modeli. Kilka tygodni wcześniej model V4 Pro tej firmy uzyskał wynik mieszczący się w granicach 5% wyniku Claude Fable 5 w osobnym porównaniu benchmarkowym, pobierając jednocześnie ułamek stawki Fable. DeepSeek rekrutuje także inżynierów w Pekinie do opracowania własnego Code Harness, dążąc — zgodnie z deklaracjami — do kontrolowania pełnego stosu agentowego, zamiast dostarczania wyłącznie bazowego modelu.
Metodologia testów OpenDesign ogranicza zakres wniosków, jakie można wyciągnąć z tych wyników. Wynik jest oceniany tylko wtedy, gdy początkowo renderuje się jako działająca strona internetowa. Puste, uszkodzone lub ucięte rezultaty otrzymują zero punktów i nie są testowane ponownie. W efekcie benchmark mierzy niezawodność w codziennych zadaniach projektowych, a nie ogólne zdolności rozumowania czy programowania.
OpenAI wypuściło GPT-6 Astra 3 września. Model jest opisywany jako wszechstronny i zdolny do wykonywania takich zadań jak projektowanie płytki drukowanej, przygotowanie zeznania podatkowego czy tworzenie sceny 3D, choć pierwsi testerzy uznali go za słabszego autora tekstów niż model, który zastąpił. W benchmarku OpenDesign Astra była wolniejsza i droższa od DeepSeek V4.1 Flash, ale pozostała modelem z najwyższym wynikiem w całej stawce.
Wskaźnik dostarczenia OpenDesign, definiowany jako odsetek wyników uznanych za gotowe do przekazania bez poprawek, wyniósł 57,7% dla DeepSeek V4.1 Flash, 60% dla GPT-6 Astra i 56,7% dla Claude Fable 5.1. Wskaźniki te uzupełniają oceny jakości benchmarku o praktyczny wymiar: pokazują, jak często każdy model generował wynik, który oceniający uznali za użyteczny bez dalszych poprawek.
Powiązane materiały: OpenAI wypuszcza GPT-6 Astra, DeepSeek ulepsza V4 Pro oraz plany DeepSeek dotyczące Code Harness.
Źródło: Decrypt