DeepSeek V4.1-Flash бросает вызов более крупным ИИ-системам в задачах программирования и работы с агентами
Ключевые выводы
- •DeepSeek выпустила V4.1-Flash, назвав ее самой компактной моделью в новом архитектурном семействе, на фоне сообщений о подготовке IPO на площадке STAR Market в Шанхае.
- •Модель использует 552-миллиардную архитектуру mixture-of-experts и каузальную архитектуру энкодер—декодер, активируя 8 миллиардов параметров на каждый входной токен и 16 миллиардов — на каждый генерируемый токен.
- •Методы SWA Bounded Replay и Compressed Sparse Attention 2 в сочетании с кэшированием FP4 снизили требования к KV-кэшу до 890 байт на токен — примерно до одной четверти показателя предыдущей Flash-модели.
- •Обученная с нуля на 45 триллионах мультимодальных токенов, V4.1-Flash превзошла DeepSeek-V4-Pro-Base в MMLU-Pro, HumanEval и GSM8K и немного опередила ведущие модели Opus и GPT в Terminal-Bench 2.1 и DeepSWE v1.1.
- •Модель уступила крупнейшим моделям сравнения в GPQA Diamond, Humanity’s Last Exam и SimpleQA, а также отстала от Opus-5.0 в новых тестах Terminal-Bench 3.0 и 4.0.

Китайский ИИ-стартап DeepSeek выпустил DeepSeek-V4.1-Flash, назвав ее самой компактной моделью в новом архитектурном семействе. Запуск состоялся на фоне сообщений о подготовке компанией первичного публичного размещения акций на технологически ориентированной площадке STAR Market в Шанхае.
Мультимодальная модель оснащена 552-миллиардной архитектурой mixture-of-experts и поддерживает контекст до одного миллиона токенов. Ее основное преимущество заключается в эффективности, а не в максимальном масштабе. Каузальная архитектура энкодер—декодер DeepSeek разделяет 40 трансформерных слоев на отдельные 20-слойные этапы кодирования и декодирования. В результате для каждого входного токена активируются 8 миллиардов параметров, а для каждого генерируемого токена — 16 миллиардов.
Архитектура ориентирована на агентные задачи с большим объемом входных данных, в которых обработка крупных документов, кодовых баз или истории диалогов может составлять значительную часть вычислительных затрат. По словам DeepSeek, метод SWA Bounded Replay устраняет необходимость сохранять выбранные состояния внимания на твердотельном накопителе, сокращая объем постоянного KV-кэша примерно до одной восьмой от показателя DeepSeek-V4-Flash.
Связанная с ним система Compressed Sparse Attention 2 назначает статические режимы внимания для разных слоев и повторно использует выбранные индексы внимания. В сочетании с кэшированием ключей и значений в формате FP4 это снижает глобальные требования к KV-кэшу до 890 байт на токен — примерно до одной четверти показателя предыдущей Flash-модели. V4.1-Flash также использует условную память и спекулятивное декодирование, а на каждом MoE-слое задействует одного общего эксперта и 384 маршрутизируемых эксперта.
Официальный сайт DeepSeek: а модель доступна по адресу
Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. Introducing the smallest model in our new architecture family, with native visual understanding. Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 pic.twitter.com/wxJGiyX56o — DeepSeek (@deepseek_ai) September 10, 2026
Объявление также доступно в X: и https://x.com/deepseek_ai/status/2097930608790167907?ref_src=twsrc%5Etfw.
Конкурентные результаты в области рассуждений, программирования и агентных задач
DeepSeek обучила V4.1-Flash с нуля на 45 триллионах мультимодальных токенов, причем изображения обрабатывались нативно вместе с текстом с самого начала предварительного обучения. Обучение с разреженным вниманием началось с контекста в 64 000 токенов, после чего на этапе с 34 триллионами токенов длина контекста была увеличена до одного миллиона токенов. Дальнейшее обучение включало обучение с учителем, обучение с подкреплением и дистилляцию по данным текущей политики. Интенсивность рассуждений можно настраивать по шкале от одного до 100.
Опубликованные результаты тестов свидетельствуют о высокой производительности по сравнению с гораздо более крупными моделями. Базовая версия получила 74.1 в MMLU-Pro, 79.4 в HumanEval и 93.0 в GSM8K против 73.5, 76.8 и 92.6 соответственно у DeepSeek-V4-Pro-Base. При максимальной интенсивности рассуждений V4.1-Flash набрала 90.6 в Terminal-Bench 2.1 и 74.2 в DeepSWE v1.1, немного опередив ведущие модели Opus и GPT в этих тестах агентных возможностей. Кроме того, модель получила рейтинг 3,471 в Codeforces и показала результат, совпавший с лучшим опубликованным показателем в MathArena Apex.
Результаты не были одинаково сильными во всех тестах. V4.1-Flash уступила крупнейшим моделям сравнения в GPQA Diamond, Humanity’s Last Exam и SimpleQA. Ее показатели в новых тестах Terminal-Bench 3.0 и 4.0 также оказались ниже, чем у Opus-5.0, хотя они продемонстрировали значительный прогресс по сравнению с предыдущими моделями DeepSeek.
Мультимодальные результаты включали 56.5 в MMMU-Pro, 77.9 в CVBench и 95.6 в DocVQA. При включенных агентных инструментах модель получила 78.9 в Chartography и 89.6 в BabyVision.
Первоначальный материал был опубликован изданием Metaverse Post: https://mpost.io/new-deepseek-v4-1-flash-challenges-larger-ai-systems-on-coding-and-agent-tasks/