ActualitésActionsDeepSeek V4.1-Flash défie les systèmes d’IA plus imposants dans le codage et les tâches d’agents

DeepSeek V4.1-Flash défie les systèmes d’IA plus imposants dans le codage et les tâches d’agents

Auteur: Metaverse Post·

Points clés

  • DeepSeek a lancé V4.1-Flash, présenté comme le plus petit modèle d’une nouvelle famille d’architectures, tandis que l’entreprise préparerait son introduction en bourse sur le STAR Market de Shanghai.
  • Le modèle repose sur une architecture mixture-of-experts de 552 milliards de paramètres et une conception encodeur-décodeur causale qui active 8 milliards de paramètres par token d’entrée et 16 milliards par token généré.
  • Les techniques d’efficacité, notamment SWA Bounded Replay et Compressed Sparse Attention 2 avec mise en cache FP4, réduisent le besoin en KV-cache à 890 octets par token, soit environ un quart de celui du précédent modèle Flash.
  • Entraîné à partir de zéro sur 45 000 milliards de tokens multimodaux, V4.1-Flash a surpassé DeepSeek-V4-Pro-Base sur MMLU-Pro, HumanEval et GSM8K, et a légèrement devancé les principaux modèles Opus et GPT sur Terminal-Bench 2.1 et DeepSWE v1.1.
  • Le modèle est resté derrière les plus grands modèles de comparaison sur GPQA Diamond, Humanity’s Last Exam et SimpleQA, et a obtenu des scores inférieurs à ceux d’Opus-5.0 sur les évaluations Terminal-Bench 3.0 et 4.0.
DeepSeek V4.1-Flash défie les systèmes d’IA plus imposants dans le codage et les tâches d’agents

La start-up chinoise spécialisée dans l’IA DeepSeek a lancé DeepSeek-V4.1-Flash, qu’elle présente comme le plus petit modèle d’une nouvelle famille d’architectures. Ce lancement intervient alors que l’entreprise préparerait son introduction en bourse sur le STAR Market de Shanghai, consacré aux entreprises technologiques.

Ce modèle multimodal repose sur une architecture mixture-of-experts de 552 milliards de paramètres et prend en charge des fenêtres de contexte allant jusqu’à un million de tokens. Sa principale avancée concerne l’efficacité plutôt que la taille proprement dite. L’architecture encodeur-décodeur causale de DeepSeek divise 40 couches Transformer en deux étapes distinctes de 20 couches consacrées à l’encodage et au décodage. Ainsi, 8 milliards de paramètres sont activés pour chaque token d’entrée et 16 milliards pour chaque token généré.

L’architecture cible les tâches d’agents fortement dépendantes des entrées, dans lesquelles le traitement de documents volumineux, de bases de code ou d’historiques de conversations peut représenter une part importante des coûts de calcul. DeepSeek affirme que sa méthode SWA Bounded Replay élimine la nécessité de conserver certains états d’attention sur un stockage à semi-conducteurs, réduisant l’empreinte persistante du KV-cache à environ un huitième de celle utilisée par DeepSeek-V4-Flash.

Un système associé, Compressed Sparse Attention 2, attribue des modes d’attention statiques aux différentes couches et réutilise certains indices d’attention. Associé à un cache clé-valeur au format FP4, il réduit le besoin global en KV-cache à 890 octets par token, soit environ un quart de celui du précédent modèle Flash. Ces chiffres correspondent à la mémoire utilisée pour conserver le contexte pendant l’inférence, indépendamment du nombre total de paramètres du modèle. V4.1-Flash intègre également une mémoire conditionnelle et un décodage spéculatif, et utilise un expert partagé ainsi que 384 experts routés par couche MoE.

Le site officiel de DeepSeek est et le modèle est disponible à l’adresse

Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. Introducing the smallest model in our new architecture family, with native visual understanding. Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 pic.twitter.com/wxJGiyX56o — DeepSeek (@deepseek_ai) September 10, 2026

L’annonce est également disponible sur X : et https://x.com/deepseek_ai/status/2097930608790167907?ref_src=twsrc%5Etfw.

Résultats comparatifs en raisonnement, codage et tâches d’agents

DeepSeek a entraîné V4.1-Flash à partir de zéro sur 45 000 milliards de tokens multimodaux, les images étant traitées nativement en parallèle du texte dès le début du préentraînement. L’entraînement avec attention éparse a commencé à 64 000 tokens, avant que la longueur du contexte ne soit étendue à un million de tokens au stade des 34 000 milliards de tokens. Le post-entraînement a combiné un réglage fin supervisé, l’apprentissage par renforcement et la distillation on-policy. L’effort de raisonnement peut être configuré sur une échelle allant de 1 à 100.

Les benchmarks publiés montrent de solides performances par rapport à des modèles beaucoup plus volumineux. La version de base a obtenu 74.1 à MMLU-Pro, 79.4 à HumanEval et 93.0 à GSM8K, contre respectivement 73.5, 76.8 et 92.6 pour DeepSeek-V4-Pro-Base. Avec un effort de raisonnement maximal, V4.1-Flash a obtenu 90.6 à Terminal-Bench 2.1 et 74.2 à DeepSWE v1.1, se plaçant légèrement devant les principaux modèles Opus et GPT sur ces benchmarks d’agents. Il a également enregistré une note de 3,471 sur Codeforces et égalé le meilleur résultat répertorié sur MathArena Apex.

Les résultats ne sont toutefois pas uniformément dominants. V4.1-Flash est resté derrière les plus grands modèles de comparaison sur GPQA Diamond, Humanity’s Last Exam et SimpleQA. Ses scores aux évaluations plus récentes Terminal-Bench 3.0 et 4.0 sont également inférieurs à ceux d’Opus-5.0, même s’ils représentent des progrès substantiels par rapport aux précédents modèles de DeepSeek.

Les résultats multimodaux comprennent 56.5 à MMMU-Pro, 77.9 à CVBench et 95.6 à DocVQA. Avec les outils d’agents activés, le modèle a obtenu 78.9 à Chartography et 89.6 à BabyVision.

Le rapport original a été publié par Metaverse Post : https://mpost.io/new-deepseek-v4-1-flash-challenges-larger-ai-systems-on-coding-and-agent-tasks/