Black Forest Labs lance FLUX 3 : son premier modèle vidéo alimente la robotique avec Audi
Points clés
- •FLUX 3 est le premier modèle de Black Forest Labs capable de générer des clips vidéo allant jusqu’à 20 secondes avec un audio synchronisé comprenant dialogues, effets sonores et bruits d’ambiance.
- •Lors de tests de préférence, des examinateurs humains ont favorisé FLUX 3 par rapport à Runway Gen-4.5 dans 77% des comparaisons et par rapport à Luma Ray 3.2 dans 93% des comparaisons, mais les évaluations n’incluaient pas Sora d’OpenAI ni Veo de Google.
- •La même architecture multimodale sous-jacente à FLUX 3 alimente FLUX-mimic, un modèle robotique codéveloppé avec mimic robotics qu’Audi teste sur sa chaîne de production pour des tâches comme la pose de joints de portières flexibles.
- •FLUX-mimic atteint un temps de réponse système d’environ 101 millisecondes, que BFL décrit comme comparable aux réflexes visuels humains.
- •La version Dev à poids ouverts de FLUX 3, le seul niveau prévu pour un déploiement local, n’est pas attendue avant plus tard en 2026, tandis que les capacités vidéo et action sont actuellement limitées aux API et à certains partenaires.

Black Forest Labs a publié FLUX 3 en accès anticipé, marquant le premier modèle de l’entreprise capable de générer des vidéos plutôt que seulement des images fixes. Le nouveau système produit des clips allant jusqu’à 20 secondes avec un audio synchronisé et repose sur une architecture multimodale entraînée conjointement sur des images, des vidéos et du son. Ce lancement place BFL dans l’une des catégories les plus concurrentielles de l’IA, où Sora d’OpenAI, Veo de Google, Runway et Luma cherchent tous à produire de la vidéo générée par IA commercialement viable.
La même technologie sous-jacente alimente également FLUX-mimic, un modèle robotique développé en collaboration avec mimic robotics, basée à Zurich, que le constructeur automobile allemand Audi teste déjà sur sa chaîne de production. La version à poids ouverts "Dev" — le seul niveau prévu pour un déploiement local — n’est pas attendue avant plus tard en 2026. Les capacités Video et Action restent disponibles uniquement via des API et un accès réservé à certains partenaires, tandis que la génération d’images doit suivre "dans les prochaines semaines", selon BFL.
La fonctionnalité vidéo de FLUX 3 constitue sa caractéristique phare. Le modèle génère des clips avec un audio synchronisé aux événements à l’écran, notamment des dialogues, des effets sonores et des bruits d’ambiance. Lors de premières évaluations en face-à-face, des examinateurs humains ont exprimé une préférence pour les résultats de FLUX 3 par rapport à Runway Gen-4.5 dans 77% des comparaisons et par rapport à Luma Ray 3.2 dans 93% des comparaisons. Le modèle a également devancé Gemini Omni et Seedance, l’emportant dans 52% de ces évaluations. BFL précise que ces résultats relèvent de tests de préférence plutôt que d’une grille de notation fixe : les évaluateurs regardent des paires de clips et choisissent celui qui paraît le plus convaincant, BFL comptabilisant la fréquence à laquelle FLUX 3 l’emporte. Il est à noter que les évaluations n’incluaient pas de comparaisons directes avec Sora d’OpenAI ou Veo de Google, laissant la position de FLUX 3 face à ces systèmes de premier plan non testée dans les résultats communiqués par BFL.
Le modèle conserve également de solides capacités en matière d’images fixes, conformes à l’héritage de la gamme FLUX. BFL a partagé des images d’exemple démontrant une polyvalence sur un large éventail de styles au-delà du photoréalisme.
BFL présente FLUX 3 comme davantage qu’un outil de création de contenu. "A model that only learns images can only generate images," a déclaré le cofondateur et CEO Robin Rombach. La thèse de l’entreprise est que l’apprentissage de la prédiction vidéo implique l’apprentissage de la physique sous-jacente — poids, contact, synchronisation — ce qui correspond précisément à ce dont une machine a besoin pour évoluer dans le monde physique. L’idée d’utiliser des modèles génératifs à grande échelle comme base du contrôle robotique suscite un intérêt croissant dans les domaines de l’IA et de la robotique, avec des entreprises comme Google DeepMind et Tesla qui explorent des approches connexes.
Cette thèse sous-tend FLUX-mimic. Développé avec mimic robotics, le système ajoute un "décodeur" léger au moteur de prédiction vidéo de FLUX 3, traduisant la compréhension interne du mouvement par le modèle en actions robotiques réelles. Audi teste déjà le système sur des tâches telles que la pose de joints de portières flexibles — un travail que l’automatisation conventionnelle a historiquement eu du mal à gérer, car les matériaux déformables se comportent de manière imprévisible et résistent à la programmation rigide sur laquelle reposent les robots traditionnels.
"Audi represents the kind of manufacturing partner we built FLUX-mimic for," a déclaré Stephan-Daniel Gravert, cofondateur de mimic. Christoph Schneider, d’Audi, a indiqué que les robots "solve complex soft-body manipulation work" que les machines précédentes ne pouvaient pas traiter. BFL affirme que le système complet répond en environ 101 millisecondes, un niveau comparable aux réflexes visuels humains.
FLUX 3 arrive comme la dernière tentative de BFL de reprendre de l’élan. Fondée en août 2024 par des chercheurs ayant contribué à créer les modèles Stable Diffusion originaux chez Stability AI, Black Forest Labs a rapidement établi la gamme FLUX comme une force dominante. Ses modèles open source Flux Dev et Schnell ont été reconnus comme les meilleurs générateurs d’images open source, dépassant MidJourney et surpassant Stable Diffusion 3 de Stability AI, jugé décevant. FLUX 1.1 Pro a ensuite pris la tête de l’arène d’images Artificial Analysis en octobre, même si cette version n’était pas open source.
BFL a publié FLUX.2 en novembre 2025, mais il n’a pas rencontré la même popularité. La couronne open source détenue par les modèles Flux originaux a persisté jusqu’à ce que Z-Image Turbo d’Alibaba égale leur qualité sur des cartes graphiques grand public d’entrée de gamme fin 2025. "This is what SD3 was supposed to be," avait commenté à l’époque un utilisateur de CivitAI.
FLUX 3 représente le retour en forme de BFL, même s’il n’est pas encore entièrement ouvert. Les capacités Video et Action sont désormais disponibles en accès anticipé via des API et certains partenaires, dont mimic robotics. La génération d’images suivra dans les prochaines semaines. La version Dev à poids ouverts est attendue plus tard en 2026.