DeepSeek V4.1-Flash rzuca wyzwanie większym systemom AI w zadaniach związanych z kodowaniem i agentami
Najważniejsze informacje
- •DeepSeek udostępnił V4.1-Flash, określany jako najmniejszy model w nowej rodzinie architektur, podczas gdy firma podobno przygotowuje się do debiutu giełdowego na szanghajskim rynku STAR.
- •Model wykorzystuje bazę mixture-of-experts z 552 miliardami parametrów oraz przyczynowo-dekodującą architekturę, która aktywuje 8 miliardów parametrów na token wejściowy i 16 miliardów na każdy wygenerowany token.
- •Techniki zwiększające efektywność, w tym SWA Bounded Replay i Compressed Sparse Attention 2 z pamięcią FP4, zmniejszają zapotrzebowanie na pamięć podręczną KV do 890 bajtów na token, czyli około jednej czwartej wartości wymaganej przez poprzedni model Flash.
- •Wytrenowany od podstaw na 45 bilionach multimodalnych tokenów V4.1-Flash przewyższył DeepSeek-V4-Pro-Base w testach MMLU-Pro, HumanEval i GSM8K oraz nieznacznie wyprzedził czołowe modele Opus i GPT w testach Terminal-Bench 2.1 i DeepSWE v1.1.
- •Model pozostawał w tyle za największymi modelami porównawczymi w testach GPQA Diamond, Humanity’s Last Exam i SimpleQA, a także uzyskał słabsze wyniki niż Opus-5.0 w nowszych testach Terminal-Bench 3.0 i 4.0.

Chiński startup zajmujący się sztuczną inteligencją DeepSeek udostępnił DeepSeek-V4.1-Flash, który określa jako najmniejszy model w nowej rodzinie architektur. Premiera nastąpiła w czasie, gdy firma podobno przygotowuje się do pierwszej oferty publicznej na skoncentrowanym na technologiach rynku STAR w Szanghaju.
Multimodalny model wykorzystuje bazę mixture-of-experts z 552 miliardami parametrów i obsługuje okna kontekstowe o długości do miliona tokenów. Jego głównym postępem jest efektywność, a nie sama skala. Przyczynowo-dekodująca architektura DeepSeek dzieli 40 warstw transformera na oddzielne, 20-warstwowe etapy kodowania i dekodowania. Oznacza to, że dla każdego tokena wejściowego aktywowanych jest 8 miliardów parametrów, a dla każdego wygenerowanego tokena — 16 miliardów.
Architektura jest ukierunkowana na zadania agentowe wymagające dużej ilości danych wejściowych, w których przetwarzanie obszernych dokumentów, baz kodu lub historii rozmów może odpowiadać za znaczną część kosztów obliczeniowych. DeepSeek poinformował, że jego metoda SWA Bounded Replay eliminuje potrzebę przechowywania wybranych stanów mechanizmu uwagi na nośnikach półprzewodnikowych, zmniejszając rozmiar trwałej pamięci podręcznej KV do około jednej ósmej wartości stosowanej w DeepSeek-V4-Flash.
Powiązany system Compressed Sparse Attention 2 przypisuje statyczne tryby uwagi do poszczególnych warstw i ponownie wykorzystuje wybrane indeksy uwagi. W połączeniu z pamięcią podręczną klucz-wartość w formacie FP4 system zmniejsza globalne zapotrzebowanie na pamięć podręczną KV do 890 bajtów na token, czyli około jednej czwartej wartości wymaganej przez poprzedni model Flash. Wartości te opisują pamięć wykorzystywaną do zachowywania kontekstu podczas inferencji i są niezależne od całkowitej liczby parametrów modelu. V4.1-Flash wykorzystuje również pamięć warunkową i dekodowanie spekulatywne, a także jednego współdzielonego eksperta i 384 ekspertów kierowanych w każdej warstwie MoE.
Oficjalna strona DeepSeek znajduje się pod adresem a model jest dostępny pod adresem
Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. Introducing the smallest model in our new architecture family, with native visual understanding. Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 pic.twitter.com/wxJGiyX56o — DeepSeek (@deepseek_ai) September 10, 2026
Ogłoszenie jest również dostępne w serwisie X: oraz https://x.com/deepseek_ai/status/2097930608790167907?ref_src=twsrc%5Etfw.
Wyniki konkurencyjne w zakresie rozumowania, kodowania i agentów
DeepSeek wytrenował V4.1-Flash od podstaw na 45 bilionach multimodalnych tokenów, przy czym obrazy były natywnie przetwarzane wraz z tekstem od początku procesu pretreningu. Trening z rzadkim mechanizmem uwagi rozpoczął się od kontekstu o długości 64 000 tokenów, a następnie na etapie 34 bilionów tokenów długość kontekstu rozszerzono do miliona tokenów. Trening po właściwym procesie obejmował nadzorowane dostrajanie, uczenie ze wzmocnieniem i destylację on-policy. Poziom wysiłku związanego z rozumowaniem można konfigurować w skali od 1 do 100.
Opublikowane wyniki testów pokazują wysoką wydajność w porównaniu ze znacznie większymi modelami. Wersja bazowa uzyskała 74.1 w MMLU-Pro, 79.4 w HumanEval i 93.0 w GSM8K, w porównaniu z wynikami 73.5, 76.8 i 92.6 dla DeepSeek-V4-Pro-Base. Przy maksymalnym poziomie wysiłku związanego z rozumowaniem V4.1-Flash uzyskał 90.6 w Terminal-Bench 2.1 i 74.2 w DeepSWE v1.1, nieznacznie wyprzedzając czołowe modele Opus i GPT w tych testach agentowych. Model uzyskał także ranking 3,471 w Codeforces i wyrównał najlepszy odnotowany wynik w MathArena Apex.
Wyniki nie były jednak jednolicie dominujące. V4.1-Flash pozostawał w tyle za największymi modelami porównawczymi w testach GPQA Diamond, Humanity’s Last Exam i SimpleQA. Jego wyniki w nowszych testach Terminal-Bench 3.0 i 4.0 również były słabsze niż w przypadku Opus-5.0, choć oznaczały znaczną poprawę względem wcześniejszych modeli DeepSeek.
Wyniki multimodalne obejmowały 56.5 w MMMU-Pro, 77.9 w CVBench i 95.6 w DocVQA. Po włączeniu narzędzi agentowych model uzyskał 78.9 w Chartography i 89.6 w BabyVision.
Oryginalny raport został opublikowany przez Metaverse Post: https://mpost.io/new-deepseek-v4-1-flash-challenges-larger-ai-systems-on-coding-and-agent-tasks/