Black Forest Labs veröffentlicht Flux 3 für Videogenerierung mit nativem Audio von bis zu 20 Sekunden Länge
Wichtige Erkenntnisse
- •Flux 3 ist ein multimodales Basismodell von Black Forest Labs, das gleichzeitig aus Bildern, Video und Audio lernt und Videoclips von bis zu 20 Sekunden Länge mit nativ synchronisiertem Audio generieren kann.
- •In BFLs vorläufigen internen Auswertungen mit 10-Sekunden-Clips bei 720p wurde Flux 3 in 93 Prozent der Vergleiche gegenüber Luma Ray 3.2 und in 77 Prozent gegenüber Runway Gen-4.5 bevorzugt, aber die Margen verringerten sich auf 52 Prozent gegenüber stärkeren Konkurrenten wie Seedance 2.0 und Gemini Omni Flash.
- •BFL arbeitete mit Mimic Robotics zusammen, um Flux-mimic zu entwickeln, ein Video-Aktionsmodell für Roboteranwendungen, das bereits bei Audi in Produktionsaufgaben getestet wird.
- •Das Modell basiert auf dem Self-Flow-Ansatz von BFL, der einen multimodalen Transformator verwendet, um Bilder, Video und Audio in eine gemeinsame interne Repräsentation für Generierungs- und Verstehensaufgaben umzuwandeln.
- •BFL veröffentlicht Flux 3 in Phasen: Flux 3 Video ist jetzt verfügbar, Flux 3 Image ist für die kommenden Wochen geplant, und der Open-Weight-Zugang zum Backbone ist unter dem Namen Flux 3 Dev geplant.

Das deutsche KI-Unternehmen Black Forest Labs (BFL) hat Flux 3 veröffentlicht, ein multimodales Basismodell, das darauf ausgelegt ist, gleichzeitig aus Bildern, Video und Audio zu lernen. Das Unternehmen sagt, dass das Modell Videoclips von bis zu 20 Sekunden Länge mit nativem Audio generieren kann und dass frühere interne Auswertungen zeigten, dass es mehrere konkurrierende Video-Generierungssysteme übertraf.
BFL, gegründet von Forschern, die zuvor die Stable-Diffusion-Modelle bei Stability AI entwickelt hatten, baute seinen Ruf zuvor auf der Flux-Serie von Open-Weight-Bildgenerierungsmodellen auf. Flux 3 markiert die Expansion des Unternehmens von der Bildgenerierung in den vollständigen multimodalen Video- und Audiobereich, in dem Konkurrenten wie Runway, Luma Labs, Google und OpenAI um die Vorherrschaft wetteifern.
BFL beschreibt Flux 3 als einen Schritt in Richtung „real-world visual intelligence“ (visuelle Intelligenz der realen Welt), was das Unternehmen als Modelle definiert, die „physische und digitale Umgebungen wahrnehmen, vorhersagen und in ihnen handeln können“. Das Unternehmen stellt die Veröffentlichung als Teil einer breiteren Brancheninitiative dar, sogenannte Weltmodelle (World Models) zu bauen, einen Ansatz, der von mehreren großen KI-Laboren verfolgt wird und darauf abzielt, Systeme zu schaffen, die physische Dynamiken verstehen, anstatt einfach nur Pixel mustern zu lassen.
Laut BFL erfasst keine einzelne Modalität die Realität vollständig. Bilder liefern die räumliche Struktur, Video zeigt, wie sich diese Struktur im Laufe der Zeit ändert, und Audio kann Beziehungen zwischen physischen oder mechanischen Ereignissen und den von ihnen erzeugten Geräuschen aufdecken. Das Unternehmen argumentiert, dass das gemeinsame Training mit Bildern, Video und Audio es den Modalitäten ermöglicht, gegenseitig Lücken zu schließen, was dem Modell reichhaltigere Informationen bietet als ein separates Training für jeden Datentyp.
Flux 3 fügt generierten Videos natives Audio hinzu
Flux 3 führt die native Audiogenerierung für BFL-Videomodelle ein, mit Clips von bis zu 20 Sekunden Länge. Synchronisiertes Audio blieb für viele Videogenerierungssysteme eine Lücke, die oft stumme Clips produzieren oder sich auf separate Audiomodelle verlassen. Das Modell unterstützt Text-to-Video, Image-to-Video, Video-to-Video, Keyframe-basierte Übergänge, mehrsprachigen Dialog und agentengesteuerte Verbindungen zwischen Clips für längere Multi-Shot-Sequenzen. BFL sagt, Flux 3 schneide besonders gut bei menschlichen Gesichtsausdrücken und bei der Übereinstimmung von Audio mit physischen Ereignissen ab.
In frühen Auswertungen mit 10-Sekunden-Clips bei 720p berichtete BFL, dass Flux 3 in 93 Prozent der Vergleiche gegenüber Luma Ray 3.2, in 77 Prozent gegenüber Runway Gen-4.5 und in 69 Prozent gegenüber Grok Imagine Video bevorzugt wurde.
Die berichteten Margen fielen gegenüber stärkeren konkurrierenden Systemen geringer aus. BFL sagte, Flux 3 wurde in 60 Prozent der Fälle gegenüber Kling v3 Pro bevorzugt, in 59 Prozent der Vergleiche gegenüber Happy Horse v1, in 57 Prozent gegenüber Happy Horse 1.1 und jeweils in 52 Prozent gegenüber sowohl Seedance 2.0 als auch Gemini Omni Flash.
BFL sagt, diese Ergebnisse seien vorläufig, und derzeit lägen keine unabhängigen Tests vor. Wenn das Modell vergleichbar mit führenden Systemen wie Seedance, das bereits in Hollywood Einzug gehalten hat, und Gemini Omni Flash abschneidet, würde sich Flux 3 unter den besten Videomodellen positionieren.
Das Unternehmen erwartet auch, dass Flux 3 die Bildgenerierung verbessert, insbesondere bei komplexen Prompts und genauer Textwiedergabe in mehreren Sprachen. BFL plant, Flux 3 Image in den nächsten Wochen im Early Access zu veröffentlichen.
Flux-mimic zielt auf Anwendungen in der Robotik ab
BFL sagt, Flux 3 könne auch Aktionen basierend auf seinem Verständnis der Welt vorhersagen. In Zusammenarbeit mit Mimic Robotics hat das Unternehmen Flux-mimic entwickelt, ein Video-Aktionsmodell für Roboteranwendungen, das bereits bei Audi in Produktionsaufgaben getestet wird. Die Arbeit spiegelt einen breiteren Branchentrend wider, Video- und Weltmodelle auf verkörperte KI (embodied AI) anzuwenden, bei dem Unternehmen wie Google und Tesla ähnliche Ansätze für die Robotersteuerung und autonome Systeme erforscht haben.
Flux 3 basiert auf Self-Flow, dem Ansatz von BFL, um ein Modell so zu trainieren, dass es sowohl Inhalte generiert als auch versteht. Das System verwendet einen multimodalen Transformator mit dedizierten Komponenten, die Bilder, Video und Audio in eine gemeinsame interne Repräsentation umwandeln und diese Repräsentation dann wieder in Ausgaben zurückverwandeln.
Eine zusätzliche Aktionskomponente bildet die Grundlage für Roboteranwendungen. BFL sagt, dieser einheitliche Lernprozess schneide sowohl in der Generierungsqualität als auch im physischen Weltverständnis des Modells besser ab als die zuvor standardmäßige Flow-Matching-Methode.
BFL plant schrittweise Einführung und Open-Weight-Zugang
BFL veröffentlicht die Funktionen von Flux 3 in Phasen, mit Early-Access-Phasen, die Feedback sammeln und Sicherheitstests unterstützen sollen. Flux 3 Video ist bereits verfügbar, während Flux 3 Image in den kommenden Wochen folgen soll. Die Aktionsvorhersage wird anfänglich über ausgewählte Partner verfügbar sein.
Das Unternehmen plant außerdem, den Open-Weight-Zugang zum multimodalen Backbone unter dem Namen „Flux 3 Dev“ zu veröffentlichen. Open-Weight-Veröffentlichungen waren ein Markenzeichen der Strategie von BFL, in Übereinstimmung mit seinen früheren Flux-Bildmodellen, die von Entwicklern und Forschern weit verbreitet übernommen wurden. Langfristig arbeitet BFL laut eigenen Angaben an Modellen der nächsten Generation, die darauf abzielen, Wahrnehmung, Aktion und Sprachvorhersage in einem einzigen Modell zu kombinieren.