ActualitésActionsBlack Forest Labs lance Flux 3 pour la génération de vidéos avec audio natif jusqu'à 20 secondes

Black Forest Labs lance Flux 3 pour la génération de vidéos avec audio natif jusqu'à 20 secondes

Auteur: The Decoder·

Points clés

  • Flux 3 est un modèle fondamental multimodal de Black Forest Labs qui apprend à partir d'images, de vidéos et d'audio simultanément, et peut générer des clips vidéo allant jusqu'à 20 secondes avec un audio natif synchronisé.
  • Dans les évaluations internes préliminaires de BFL utilisant des clips de 10 secondes en 720p, Flux 3 a été préféré à Luma Ray 3.2 dans 93 pour cent des comparaisons et à Runway Gen-4.5 dans 77 pour cent, mais les marges se sont réduites à 52 pour cent face à des concurrents plus performants tels que Seedance 2.0 et Gemini Omni Flash.
  • BFL a collaboré avec Mimic Robotics pour développer Flux-mimic, un modèle vidéo-action pour les applications de robotique qui est déjà testé sur des tâches de production chez Audi.
  • Le modèle est construit sur l'approche Self-Flow de BFL, qui utilise un transformateur multimodal pour convertir les images, la vidéo et l'audio en une représentation interne partagée pour les tâches de génération et de compréhension.
  • BFL publie Flux 3 par phases, avec Flux 3 Video disponible dès maintenant, Flux 3 Image prévu pour les semaines à venir, et un accès en poids ouverts au modèle principal prévu sous le nom de Flux 3 Dev.
Black Forest Labs lance Flux 3 pour la génération de vidéos avec audio natif jusqu'à 20 secondes

L'entreprise allemande d'IA Black Forest Labs (BFL) a publié Flux 3, un modèle fondamental multimodal conçu pour apprendre à partir d'images, de vidéos et d'audio en même temps. L'entreprise affirme que le modèle peut générer des clips vidéo d'une durée allant jusqu'à 20 secondes avec un audio natif, et que les premières évaluations internes ont montré qu'il surpassait plusieurs systèmes rivaux de génération de vidéos.

BFL, fondée par des chercheurs qui avaient précédemment développé les modèles Stable Diffusion chez Stability AI, avait auparavant bâti sa réputation sur la série Flux de modèles de génération d'images en poids ouverts. Flux 3 marque l'expansion de l'entreprise, passant de la génération d'images à la vidéo et à l'audio multimodaux complets, des domaines où des concurrents tels que Runway, Luma Labs, Google et OpenAI se livrent une course pour établir leur domination.

BFL décrit Flux 3 comme un pas vers une « intelligence visuelle du monde réel », qu'elle définit comme des modèles capables de « percevoir, prédire et agir dans des environnements physiques et numériques ». L'entreprise présente cette publication comme faisant partie d'un effort plus large de l'industrie pour construire ce que l'on appelle des modèles mondiaux (world models), une approche poursuivie par de nombreux grands laboratoires d'IA cherchant à créer des systèmes qui comprennent la dynamique physique plutôt que de simplement faire correspondre des motifs de pixels.

Selon BFL, aucune modalité unique ne saisit pleinement la réalité. Les images fournissent une structure spatiale, la vidéo montre comment cette structure change au fil du temps, et l'audio peut exposer les relations entre les événements physiques ou mécaniques et les sons qu'ils produisent. L'entreprise soutient que l'entraînement simultané sur des images, des vidéos et de l'audio permet aux différentes modalités de combler les lacunes les unes des autres, fournissant au modèle des informations plus riches qu'un entraînement séparé sur chaque type de données.

Flux 3 ajoute un audio natif aux vidéos générées

Flux 3 introduit la génération d'audio natif pour les modèles vidéo de BFL, avec des clips allant jusqu'à 20 secondes. L'audio synchronisé est resté une lacune pour de nombreux systèmes de génération de vidéos, qui produisent souvent des clips silencieux ou dépendent de modèles audio distincts. Le modèle prend en charge le texte-vers-vidéo, l'image-vers-vidéo, la vidéo-vers-vidéo, les transitions basées sur des images clés, le dialogue multilingue et les connexions pilotées par des agents entre les clips pour des séquences plus longues à plusieurs plans. BFL affirme que Flux 3 performe particulièrement bien sur les expressions faciales humaines et sur la correspondance de l'audio avec les événements physiques.

Lors des premières évaluations utilisant des clips de 10 secondes en 720p, BFL a rapporté que Flux 3 était préféré à Luma Ray 3.2 dans 93 pour cent des comparaisons, à Runway Gen-4.5 dans 77 pour cent, et à Grok Imagine Video dans 69 pour cent.

Les marges rapportées étaient plus faibles contre des systèmes concurrents plus performants. BFL a déclaré que Flux 3 était préféré à Kling v3 Pro 60 pour cent du temps, à Happy Horse v1 dans 59 pour cent des comparaisons, à Happy Horse 1.1 dans 57 pour cent, et à la fois à Seedance 2.0 et Gemini Omni Flash dans 52 pour cent chacun.

BFL précise que ces résultats sont préliminaires et qu'aucun test indépendant n'est actuellement disponible. Si le modèle se comporte de manière comparable aux systèmes de pointe tels que Seedance, qui a déjà atteint Hollywood, et Gemini Omni Flash, Flux 3 serait positionné parmi les meilleurs modèles vidéo.

L'entreprise s'attend également à ce que Flux 3 améliore la génération d'images, en particulier pour les requêtes complexes et le rendu précis du texte dans plusieurs langues. BFL prévoit de publier Flux 3 Image en accès anticipé dans les prochaines semaines.

Flux-mimic cible les applications de robotique

BFL affirme que Flux 3 peut également prédire des actions en fonction de sa compréhension du monde. En collaboration avec Mimic Robotics, l'entreprise a développé Flux-mimic, un modèle vidéo-action pour des applications de robotique qui est déjà testé sur des tâches de production chez Audi. Ce travail reflète une tendance industrielle plus large consistant à appliquer des modèles vidéo et mondiaux à l'IA incarnée, où des entreprises telles que Google et Tesla ont exploré des approches similaires pour le contrôle des robots et les systèmes autonomes.

Flux 3 est basé sur Self-Flow, l'approche de BFL pour entraîner un seul modèle à la fois à générer et à comprendre du contenu. Le système utilise un transformateur multimodal avec des composants dédiés qui convertissent les images, la vidéo et l'audio en une représentation interne partagée, puis reconvertissent cette représentation en résultats.

Un composant d'action supplémentaire fournit la base pour les applications de robotique. BFL affirme que ce processus d'apprentissage unifié offre de meilleures performances que la méthode standard précédente de flux d'appariement (flow-matching), tant en termes de qualité de génération qu'en termes de compréhension du monde physique par le modèle.

BFL prévoit un déploiement par phases et un accès en poids ouverts

BFL publie les capacités de Flux 3 par phases, avec des périodes d'accès anticipé destinées à recueillir des commentaires et à soutenir les tests de sécurité. Flux 3 Video est déjà disponible, tandis que Flux 3 Image devrait suivre dans les prochaines semaines. La prédiction d'action sera initialement disponible auprès de partenaires sélectionnés.

L'entreprise prévoit également de publier un accès en poids ouverts au réseau multimodal principal sous le nom de « Flux 3 Dev ». Les publications en poids ouverts ont été une caractéristique de la stratégie de BFL, conformément à ses précédents modèles d'images Flux qui ont été largement adoptés par les développeurs et les chercheurs. À plus long terme, BFL déclare travailler sur des modèles de nouvelle génération destinés à combiner la perception, l'action et la prédiction linguistique dans un seul modèle.