DeepSeek dévoile un modèle de vision expérimental, évoquant des tests internes proches de l'Opus 4.8 d'Anthropic
Points clés
- •DeepSeek a annoncé DeepSeek-V4-Flash-Vision-Exp le 21 août 2026, ajoutant pour la première fois le traitement des images et des captures d'écran à sa famille de modèles V4 Flash.
- •Le modèle expérimental conserve les capacités de texte, de raisonnement, d'agent et de connaissance générale de DeepSeek-V4-Flash et est disponible pour les développeurs via l'API de DeepSeek.
- •Les évaluations internes de DeepSeek ont montré des performances similaires à celles de l'Opus 4.8 d'Anthropic dans des tests d'agents multimodaux, mais des benchmarks tiers restent nécessaires pour vérifier ces affirmations.
- •Le lancement intervient dans un contexte d'intensification de la concurrence en IA entre la Chine et les États-Unis, marqué notamment par la surveillance américaine des développeurs chinois et le plan national chinois d'investissement dans l'IA jusqu'en 2030.
- •Anthropic se préparerait, selon des informations de presse, à une éventuelle introduction en bourse qui pourrait être déposée dès ce mois-ci, avec Morgan Stanley, Goldman Sachs et JPMorgan cités comme impliqués dans les préparatifs.

DeepSeek, entreprise chinoise, a présenté un modèle d'IA multimodal expérimental capable de traiter des images et des captures d'écran, élargissant ainsi sa famille de modèles V4 à un moment où la concurrence entre les grands développeurs mondiaux d'intelligence artificielle — en Chine comme aux États-Unis — ne cesse de s'intensifier.
Cette publication, annoncée le 21 août 2026, ajoute pour la première fois le traitement visuel à la gamme V4, le système de texte existant étant maintenu plutôt que remplacé. La prise en charge des images est devenue une capacité standard des modèles de pointe d'OpenAI, de Google et d'Anthropic, et cet ajout aligne la famille de modèles la plus récente de DeepSeek sur cette référence.
DeepSeek ajoute des capacités de vision à V4 Flash
DeepSeek a annoncé DeepSeek-V4-Flash-Vision-Exp, un modèle expérimental qui ajoute le traitement visuel à sa plateforme V4 Flash. Les utilisateurs peuvent téléverser des images et des captures d'écran, puis demander au modèle d'analyser le contenu ou d'accomplir des tâches en fonction de ce qu'il voit.
L'entreprise a indiqué que le nouveau modèle conserve les capacités de texte de DeepSeek-V4-Flash, notamment le raisonnement, les tâches d'agent et les connaissances générales. DeepSeek a présenté cette publication comme une extension multimodale de sa famille de modèles la plus récente, et non comme un remplacement de son système de texte existant.
« Ce modèle multimodal expérimental égale DeepSeek-V4-Flash sur les capacités de texte — y compris les agents, le raisonnement et la connaissance du monde », a déclaré DeepSeek.
Le modèle est disponible via l'interface de programmation applicative (API) de DeepSeek, permettant aux développeurs d'ajouter des fonctions basées sur les images — comme l'analyse de captures d'écran téléversées — à leurs propres produits et services, et de construire des applications d'IA visuelle sur la plateforme.
L'annonce de cette publication a été partagée sur X par Walter Bloomberg (@DeItaone) :
DEEPSEEK CHALLENGES ANTHROPIC WITH NEW AI MODEL
DeepSeek has unveiled an experimental multimodal AI model capable of analyzing images, screenshots and text while performing autonomous tasks.
Called DeepSeek-V4-Flash-Vision-Exp, the model reportedly approaches Anthropic's Opus…
— Walter Bloomberg (@DeItaone) August 21, 2026
DeepSeek compare son modèle à l'Opus 4.8 d'Anthropic
DeepSeek a indiqué que ses évaluations internes montraient que son nouveau modèle atteint des niveaux de performance similaires à ceux de l'Opus 4.8 d'Anthropic dans des tests d'agents multimodaux. Ces tests mesurent la capacité des systèmes d'IA à accomplir des tâches nécessitant à la fois une entrée visuelle et un encadrement humain limité. Cette comparaison place le modèle expérimental directement face à l'un des systèmes haut de gamme d'Anthropic.
Anthropic a mis l'accent sur les capacités d'agent dans sa gamme Claude, notamment une fonction d'utilisation d'ordinateur introduite fin 2024 qui permet au modèle d'interpréter ce qui apparaît à l'écran et d'effectuer des tâches au sein des applications — un domaine qui recoupe les tâches fondées sur les captures d'écran que le nouveau modèle de DeepSeek est conçu pour accomplir.
Toutefois, les affirmations de DeepSeek reposent sur ses propres tests, et des benchmarks tiers plus larges seront nécessaires pour comparer les performances selon différentes charges de travail.
DeepSeek a déjà développé des modèles vision-langage via sa famille DeepSeek-VL, une gamme antérieure de modèles combinant compréhension des images et traitement du langage. Cette dernière publication intègre des fonctions visuelles similaires dans la gamme V4 plus récente, élargissant l'éventail de tâches que la plateforme peut traiter. L'entreprise, un laboratoire d'IA soutenu par le fonds spéculatif quantitatif chinois High-Flyer, a attiré pour la première fois l'attention mondiale en janvier 2025, lorsque son modèle de raisonnement R1 a obtenu des résultats compétitifs face aux principaux systèmes américains pour une fraction de leurs coûts d'entraînement rapportés.
La concurrence en IA s'intensifie entre la Chine et les États-Unis
Ce lancement intervient alors que les entreprises chinoises d'IA continuent d'étendre le développement de leurs modèles aux capacités de texte, de vision et d'agent. La Chine a également mis en place un plan national jusqu'en 2030 qui préconise des investissements accrus dans les puces d'IA, les grands systèmes de calcul, les modèles multimodaux, les agents autonomes et la technologie blockchain.
Les développeurs chinois font également face à une surveillance croissante des autorités américaines concernant la concurrence en IA avancée. Les débats récents ont notamment porté sur des préoccupations liées à la propriété intellectuelle, aux méthodes d'entraînement des modèles et à l'accès au matériel de calcul haut de gamme nécessaire à l'entraînement des grands modèles.
Parallèlement, Anthropic se préparerait, selon des informations de presse, à une éventuelle introduction en bourse. L'entreprise pourrait déposer son dossier dès ce mois-ci, Morgan Stanley, Goldman Sachs et JPMorgan étant cités parmi les impliqués dans les préparatifs.
Cette introduction potentielle a attiré l'attention après que SpaceX a mené à bien une IPO ayant levé environ 86,2 milliards de dollars, greenshoe (overallotment) inclus. Les comparaisons entre les deux entreprises restent spéculatives, car Anthropic n'a annoncé ni les conditions finales de l'offre ni une valorisation confirmée.
Le nouveau modèle de DeepSeek entre dans cet environnement concurrentiel alors que les développeurs chinois et américains continuent d'étendre les systèmes d'IA multimodaux — des modèles combinant texte, images et exécution autonome de tâches — à destination des usages grand public comme professionnels.