NieuwsAandelenBlack Forest Labs brengt Flux 3 uit voor videogeneratie met oorspronkelijke audio tot 20 seconden

Black Forest Labs brengt Flux 3 uit voor videogeneratie met oorspronkelijke audio tot 20 seconden

Auteur: The Decoder·

Belangrijkste punten

  • Flux 3 is een multimodaal basismodel van Black Forest Labs dat tegelijkertijd leert van beelden, video en audio en videoclips kan genereren van maximaal 20 seconden met oorspronkelijke, gesynchroniseerde audio.
  • In de voorlopige interne evaluaties van BFL met clips van 10 seconden op 720p, kreeg Flux 3 de voorkeur boven Luma Ray 3.2 in 93 procent van de vergelijkingen en boven Runway Gen-4.5 in 77 procent, maar de marges namen af tot 52 procent tegenover sterkere concurrenten zoals Seedance 2.0 en Gemini Omni Flash.
  • BFL werkte samen met Mimic Robotics aan de ontwikkeling van Flux-mimic, een video-actiemodel voor robotica-toepassingen dat al wordt getest op productietaken bij Audi.
  • Het model is gebouwd op de Self-Flow-benadering van BFL, die een multimodale transformer gebruikt om beelden, video en audio om te zetten in een gedeelde interne representatie voor zowel generatie- als begripstaken.
  • BFL brengt Flux 3 in fasen uit, waarbij Flux 3 Video nu beschikbaar is, Flux 3 Image gepland staat voor de komende weken en open-weight toegang tot de kern gepland is onder de naam Flux 3 Dev.
Black Forest Labs brengt Flux 3 uit voor videogeneratie met oorspronkelijke audio tot 20 seconden

Het Duitse AI-bedrijf Black Forest Labs (BFL) heeft Flux 3 uitgebracht, een multimodaal basismodel dat is ontworpen om tegelijkertijd van beelden, video en audio te leren. Het bedrijf zegt dat het model videoclips van maximaal 20 seconden lang kan genereren met oorspronkelijke audio (native audio), en dat uit vroege interne evaluaties bleek dat het verschillende rivaliserende videogeneratiesystemen overtrof.

BFL, opgericht door onderzoekers die eerder de Stable Diffusion-modellen bij Stability AI ontwikkelden, bouwde eerder zijn reputatie op met de Flux-serie van open-weight beeldgeneratiemodellen. Flux 3 markeert de uitbreiding van het bedrijf van beeldgeneratie naar volledige multimodale video en audio, gebieden waar concurrenten waaronder Runway, Luma Labs, Google en OpenAI racen om dominantie te vestigen.

BFL beschrijft Flux 3 als een stap richting "real-world visual intelligence", wat zij definiëren als modellen die kunnen "waarnemen, voorspellen en handelen in fysieke en digitale omgevingen." Het bedrijf presenteert de release als onderdeel van een bredere branche-inspanning om zogenaamde wereldmodellen (world models) te bouwen, een benadering die door meerdere grote AI-labs wordt nagestreefd met als doel systemen te creëren die de fysieke dynamiek begrijpen in plaats van simpelweg pixels te matchen.

Volgens BFL legt geen enkele modaliteit de werkelijkheid volledig vast. Beelden bieden een ruimtelijke structuur, video laat zien hoe die structuur in de loop van de tijd verandert, en audio kan relaties blootleggen tussen fysieke of mechanische gebeurtenissen en de geluiden die ze produceren. Het bedrijf stelt dat gelijktijdige training op beelden, video en audio de modaliteiten in staat stelt om elkaars hiaten op te vullen, waardoor het model meer informatie krijgt dan bij afzonderlijke training per gegevenstype.

Flux 3 voegt oorspronkelijke audio toe aan gegenereerde video's

Flux 3 introduceert oorspronkelijke audiogeneratie voor BFL-videomodellen, met clips van maximaal 20 seconden. Gesynchroniseerde audio is een hiaat gebleven voor veel videogeneratiesystemen, die vaak stille clips produceren of afhankelijk zijn van aparte audiomodellen. Het model ondersteunt tekst-naar-video, beeld-naar-video, video-naar-video, overgangen op basis van keyframes, meertalige dialogen en door agents aangestuurde verbindingen tussen clips voor langere multi-shot reeksen. BFL zegt dat Flux 3 vooral goed presteert op menselijke gezichtsuitdrukkingen en op het matchen van audio aan fysieke gebeurtenissen.

In vroege evaluaties met behulp van clips van 10 seconden op 720p, rapporteerde BFL dat Flux 3 de voorkeur kreeg boven Luma Ray 3.2 in 93 procent van de vergelijkingen, boven Runway Gen-4.5 in 77 procent, en boven Grok Imagine Video in 69 procent.

De gerapporteerde marges waren kleiner tegenover sterkere concurrerende systemen. BFL zei dat Flux 3 de voorkeur kreeg boven Kling v3 Pro in 60 procent van de gevallen, boven Happy Horse v1 in 59 procent van de vergelijkingen, boven Happy Horse 1.1 in 57 procent, en boven zowel Seedance 2.0 als Gemini Omni Flash in elk 52 procent van de gevallen.

BFL zegt dat deze resultaten voorlopig zijn en dat er momenteel geen onafhankelijke tests beschikbaar zijn. Als het model vergelijkbaar presteert met toonaangevende systemen zoals Seedance, dat Hollywood al heeft bereikt, en Gemini Omni Flash, zou Flux 3 behoren tot de top videomodellen.

Het bedrijf verwacht ook dat Flux 3 de beeldgeneratie zal verbeteren, in het bijzonder voor complexe prompts en nauwkeurige tekstweergave in meerdere talen. BFL is van plan om Flux 3 Image binnen de komende weken in vroege toegang (early access) uit te brengen.

Flux-mimic richt zich op robotica-toepassingen

BFL zegt dat Flux 3 op basis van zijn begrip van de wereld ook acties kan voorspellen. In samenwerking met Mimic Robotics ontwikkelde het bedrijf Flux-mimic, een video-actiemodel voor robotica-toepassingen dat al wordt getest op productietaken bij Audi. Het werk weerspiegelt een bredere brichtrend van het toepassen van video- en wereldmodellen op belichaamde AI (embodied AI), waarbij bedrijven zoals Google en Tesla vergelijkbare benaderingen hebben verkend voor robotbesturing en autonome systemen.

Flux 3 is gebaseerd op Self-Flow, de benadering van BFL om één model te trainen voor zowel het genereren als het begrijpen van inhoud. Het systeem gebruikt een multimodale transformer met speciale componenten die beelden, video en audio omzetten in een gedeelde interne representatie en die representatie vervolgens terug omzetten in outputs.

Een extra actiecomponent vormt de basis voor robotica-toepassingen. BFL zegt dat dit uniforme leerproces betere resultaten oplevert dan de voorheen standaard flow-matching methode, zowel wat betreft de generatiekwaliteit als het begrip van de fysieke wereld door het model.

BFL plant gefaseerde uitrol en open-weight toegang

BFL brengt de mogelijkheden van Flux 3 in fasen uit, met periodes voor vroege toegang die bedoeld zijn om feedback te verzamelen en veiligheidstests te ondersteunen. Flux 3 Video is al beschikbaar, terwijl Flux 3 Image gepland staat voor de komende weken. Actievoorspelling zal in eerste instantie via geselecteerde partners worden aangeboden.

Het bedrijf is ook van plan om open-weight toegang tot de multimodale kern (backbone) uit te brengen onder de naam "Flux 3 Dev." Open-weight releases zijn een kenmerk van de strategie van BFL geweest, in lijn met hun eerdere Flux-beeldmodellen die veel werden overgenomen door ontwikkelaars en onderzoekers. Op de lange termijn zegt BFL te werken aan modellen van de volgende generatie die bedoeld zijn om waarneming, actie en taalvoorspelling te combineren in één model.