NachrichtenAktienBlack Forest Labs startet FLUX 3: Erstes Videomodell treibt Robotik mit Audi-Partnerschaft an

Black Forest Labs startet FLUX 3: Erstes Videomodell treibt Robotik mit Audi-Partnerschaft an

Autor: Decrypt·

Wichtige Erkenntnisse

  • FLUX 3 ist das erste Modell von Black Forest Labs, das Videoclips von bis zu 20 Sekunden Länge mit synchronisiertem Audio generieren kann – einschließlich Dialogen, Soundeffekten und Umgebungsgeräuschen.
  • In Präferenztests bevorzugten menschliche Prüfer FLUX 3 gegenüber Runway Gen-4.5 in 77 % der Vergleiche und gegenüber Luma Ray 3.2 in 93 % der Vergleiche, allerdings umfassten die Bewertungen nicht OpenAIs Sora oder Googles Veo.
  • Dieselbe Multimodal-Architektur, die FLUX 3 zugrunde liegt, treibt FLUX-mimic an – ein mit mimic robotics co-entwickeltes Robotikmodell, das Audi an seiner Produktionslinie für Aufgaben wie das Einsetzen flexibler Türdichtungen testet.
  • FLUX-mimic erreicht eine Systemreaktionszeit von ungefähr 101 Millisekunden, die BFL als vergleichbar mit menschlichen visuellen Reflexen beschreibt.
  • Die Open-Weight-Dev-Version von FLUX 3, die einzige für den lokalen Einsatz geplante Stufe, wird erst später im Jahr 2026 erwartet, während Video- und Action-Funktionen derzeit auf API- und ausgewählten Partnerzugang begrenzt sind.
Black Forest Labs startet FLUX 3: Erstes Videomodell treibt Robotik mit Audi-Partnerschaft an

Black Forest Labs hat FLUX 3 im Early Access veröffentlicht – das erste Modell des Unternehmens, das Video statt nur Standbilder generieren kann. Das neue System erzeugt Clips von bis zu 20 Sekunden Länge mit synchronisiertem Audio und basiert auf einer Multimodal-Architektur, die gemeinsam auf Bildern, Video und Ton trainiert wurde. Der Launch platziert BFL in einer der wettbewerbsintensivsten KI-Kategorien, in der OpenAIs Sora, Googles Veo, Runway und Luma alle darum wetteifern, kommerziell nutzbare KI-generierte Videos zu produzieren.

Dieselbe zugrundeliegende Technologie treibt auch FLUX-mimic an – ein Robotikmodell, das in Zusammenarbeit mit dem in Zürich ansässigen Unternehmen mimic robotics entwickelt wurde und das der deutsche Automobilhersteller Audi bereits an seiner Produktionslinie testet. Die Open-Weight-„Dev"-Version – die einzige für den lokalen Einsatz geplante Stufe – wird erst später im Jahr 2026 erwartet. Video- und Action-Funktionen bleiben vorerst ausschließlich über APIs und ausgewählten Partnerzugang verfügbar, wobei die Bildgenerierung laut BFL „in den kommenden Wochen" folgen soll.

Die Videofunktionalität von FLUX 3 ist das Aushängeschild des Modells. Es generiert Clips mit Audio, das auf die Bildschirmereignisse synchronisiert ist – einschließlich Dialogen, Soundeffekten und Umgebungsgeräuschen. In frühen Direktvergleichen bevorzugten menschliche Prüfer die Ausgabe von FLUX 3 gegenüber Runway Gen-4.5 in 77 % der Vergleiche und gegenüber Luma Ray 3.2 in 93 % der Vergleiche. Das Modell setzte sich auch gegen Gemini Omni und Seedance durch und gewann in 52 % dieser Bewertungen. BFL stellt fest, dass diese Ergebnisse Präferenztests und keinem festen Bewertungsschema entsprechen – die Prüfer betrachten jeweils zwei Clips und wählen den überzeugenderen aus, wobei BFL zählt, wie oft FLUX 3 gewinnt. Bemerkenswerterweise enthielten die Bewertungen keine direkten Vergleiche mit OpenAIs Sora oder Googles Veo, sodass die Positionierung von FLUX 3 gegenüber diesen prominenten Systemen in den von BFL gemeldeten Ergebnissen ungetestet bleibt.

Das Modell behält zudem starke Standbildfunktionen, die der Tradition der FLUX-Linie entsprechen. BFL teilte Beispielsbilder, die Vielseitigkeit über ein breites Spektrum von Stilen hinaus über den Fotorealismus demonstrieren.

BFL positioniert FLUX 3 als mehr als nur ein Werkzeug für kreative Inhalte. „Ein Modell, das nur Bilder lernt, kann nur Bilder generieren", sagte Mitgründer und CEO Robin Rombach. Die These des Unternehmens besagt, dass das Erlernen der Videovorhersage auch das Erlernen der zugrundeliegenden Physik beinhaltet – Gewicht, Kontakt, Timing –, was genau das ist, was eine Maschine benötigt, um sich in der physischen Welt zu bewegen. Die Idee, große generative Modelle als Grundlage für Robotersteuerung zu nutzen, hat in den Bereichen KI und Robotik wachsendes Interesse geweckt, wobei Unternehmen wie Google DeepMind und Tesla verwandte Ansätze erforschen.

Diese These ist die Grundlage von FLUX-mimic. Das in Zusammenarbeit mit mimic robotics entwickelte System fügt der Videovorhersage-Engine von FLUX 3 einen kompakten „Decoder" hinzu, der das interne Bewegungsverständnis des Modells in tatsächliche Roboteraktionen übersetzt. Audi testet das System bereits an Aufgaben wie dem Einsetzen flexibler Türdichtungen – eine Arbeit, die herkömmliche Automatisierung historisch schwer bewältigen konnte, da sich verformbare Materialien unvorhersehbar verhalten und der starren Programmierung widersetzen, auf die traditionelle Roboter angewiesen sind.

„Audi repräsentiert die Art von Fertigungspartner, für den wir FLUX-mimic entwickelt haben", sagte mimic-Mitgründer Stephan-Daniel Gravert. Audis Christoph Schneider erklärte, dass die Roboter nun „komplexe Soft-Body-Manipulationsarbeiten" lösen, die frühere Maschinen nicht bewältigen konnten. BFL gibt an, dass das gesamte System in etwa 101 Millisekunden reagiert – vergleichbar mit menschlichen visuellen Reflexen.

FLUX 3 erscheint als der neueste Versuch von BFL, Schwung zurückzugewinnen. Gegründet im August 2024 von Forschern, die beim Aufbau der ursprünglichen Stable-Diffusion-Modelle bei Stability AI geholfen hatten, etablierte Black Forest Labs die FLUX-Linie schnell als dominierende Kraft. Die Open-Source-Modelle Flux Dev und Schnell erwarben sich Anerkennung als beste Open-Source-Bildgeneratoren, übertrafen MidJourney und liefen Stability AIs eigenes Stable Diffusion 3 aus. FLUX 1.1 Pro führte anschließend im Oktober die Artificial-Analysis-Bildarena an, allerdings war diese Version nicht Open Source.

BFL veröffentlichte FLUX.2 im November 2025, konnte jedoch nicht die gleiche Beliebtheit erreichen. Die Open-Source-Krone der ursprünglichen Flux-Modelle hielt bis Ende 2025 an, als Alibabas Z-Image Turbo ihre Qualität auf preiswerteren Consumer-Grafikkarten erreichte. „Das ist das, was SD3 hätte sein sollen", kommentierte damals ein CivitAI-Nutzer.

FLUX 3 repräsentiert BFLs Rückkehr zur Form, ist jedoch noch nicht vollständig offen. Video- und Action-Funktionen sind jetzt im Early Access über APIs und ausgewählte Partner verfügbar, darunter mimic robotics. Die Bildgenerierung wird in den kommenden Wochen folgen. Die Open-Weight-Dev-Version wird für später im Jahr 2026 erwartet.