Black Forest Labs lanceert FLUX 3: een multimodaal frontiermodel voor beelden, video, audio en robotacties
Belangrijkste punten
- •FLUX 3 is binnen één architectuur gezamenlijk getraind voor beeld, video, audio en robotische actievoorspelling met Black Forest Labs' Self-Flow-methode, in plaats van afzonderlijke gespecialiseerde modellen te combineren.
- •FLUX 3 Video kan clips tot 20 seconden genereren met gesynchroniseerde native audio vanuit één prompt, vergelijkbaar met de duur die eerder werd bereikt door OpenAI's stopgezette Sora-model.
- •Voorlopige voorkeursbenchmarks tonen dat FLUX 3 beter presteert dan Luma Ray 3.2 en Runway Gen-4.5, maar op 52% gelijk staat met Google's Gemini Omni Flash in kwaliteitsvergelijkingen voor tekst-naar-video van 10 seconden.
- •Via de FLUX-mimic-samenwerking met Mimic Robotics kan het model worden gefinetuned voor nieuwe robotische manipulatietaken met slechts 30 minuten demonstratiedata, een 60x vermindering ten opzichte van de eerder vereiste 30-plus uur.
- •Black Forest Labs heeft bij de lancering geen prijzen, service-level commitments, evaluatiemethodologie of licentievoorwaarden voor open weights bekendgemaakt, waardoor zakelijke kopers de totale eigendomskosten nog niet kunnen beoordelen.

Black Forest Labs (BFL), het AI-lab uit Freiburg, Duitsland, heeft FLUX 3 gelanceerd, een multimodaal frontiermodel dat is ontworpen om beelden, gecombineerde audio/videoclips tot 20 seconden vanuit één tekstprompt en fysieke acties voor robotica te begrijpen en te genereren. Het bedrijf beschrijft FLUX 3 als gezamenlijk getraind over al deze modaliteiten binnen één architectuur, in plaats van afzonderlijke beeld-, video- en audiomodellen achter een gemeenschappelijke interface samen te voegen.
Dat architecturale onderscheid staat centraal in de positionering van BFL. Het bedrijf wil dat ondernemingen creatieve generatie, simulatie, computergebruik en robotica zien als onderling verbonden toepassingen van wat het "visuele intelligentie" noemt — modellen die, in de woorden van BFL, "kunnen waarnemen, voorspellen en handelen in fysieke en digitale omgevingen." De lancering markeert ook BFL's eerste publiek beschikbare videogeneratiemodel en plaatst het bedrijf, met ongeveer 100 medewerkers, rechtstreeks tegenover veel grotere Amerikaanse platforms, waaronder Google's Gemini Omni, en een groep gespecialiseerde videostartups die samen in de afgelopen twee jaar honderden miljoenen hebben opgehaald.
Productlijnen en beschikbaarheid
FLUX 3 wordt geleverd via vier productlijnen:
- FLUX 3 Video — met optionele native audiogeneratie
- FLUX 3 Image — wordt in de komende weken uitgerold
- FLUX 3 Action — voor fysieke AI en robotica
- FLUX 3 Dev — een aankomende open-weightrelease
FLUX 3 Video en FLUX 3 Action gaan nu een afgesloten Early Access-programma in waarvoor iedereen zich kan aanmelden, maar BFL moet elke aanvrager goedkeuren. Er is nog geen publieke API-toegang via BFL of zijn partners. Het bedrijf zegt dat FLUX 3 Image in de komende weken wordt uitgerold, gevolgd door bredere algemene beschikbaarheid.
De gefaseerde releasestrategie lijkt op recente benaderingen van andere Amerikaanse frontierlabs, waaronder Anthropic en OpenAI, al werden die beperkingen toegeschreven aan veiligheidszorgen en verzoeken van de overheid. Bij BFL lijkt de toegangspoort eerder te worden ingegeven door infrastructuurgereedheid en doorlopende ontwikkeling dan door veiligheidsclassificaties.
Wat BFL niet heeft aangekondigd
Meerdere cruciale details ontbreken bij de lancering. BFL heeft geen prijzen, productie-SLA's, evaluatiemethodologie, steekproefgroottes, aantallen beoordelaars of benchmarks voor beeldmodellen bekendgemaakt. Zakelijke kopers kunnen daardoor nog niet de totale eigendomskosten berekenen of de door het bedrijf gepubliceerde videovergelijkingen onafhankelijk reproduceren.
FLUX 3 wordt ook niet gelanceerd met downloadbare gewichten of een opensourcelicentie. BFL zegt dat snellere en open-weightversies later dit jaar zullen verschijnen. Zijn technische blog noemt FLUX 3 Dev "open-weight access to a multimodal backbone, for content creation (video, audio and image) and action prediction" — een bredere toezegging dan enige eerdere FLUX Dev-release, die allemaal alleen beelden betroffen. FLUX 3 Dev komt echter als laatste in de releasevolgorde. Ontwikkelaars die gewend zijn om tegelijk met, of kort na, een grote modelaankondiging een lokaal inzetbare FLUX-variant te krijgen, zullen moeten wachten.
Die vertraging is opvallend omdat BFL's open-weightreleases een belangrijke motor voor adoptie zijn geweest. Lokaal inzetbare FLUX-modellen zijn geïntegreerd in workflows van ComfyUI en Hugging Face Diffusers, en het ontbreken van een downloadbare FLUX 3-variant bij de lancering betekent dat dit ontwikkelaarsecosysteem de nieuwe architectuur nog niet op eigen hardware kan testen.
Voorlopige benchmarkresultaten
BFL heeft verschillende benchmarkvergelijkingen gepubliceerd, allemaal met de kwalificatie voorlopig. Volledige resultaten en methodologie worden beloofd voor de bredere fase van algemene beschikbaarheid.
In vroege head-to-head voorkeurstests op 10 seconden durende 720p tekst-naar-videoclips met audio meldt BFL dat FLUX 3 de voorkeur kreeg boven:
- Luma Ray 3.2 in 93% van de vergelijkingen
- Runway Gen-4.5 in 77%
- Grok Imagine Video in 69%
- Kling v3 Pro in 60%
- Happy Horse v1 in 59%
- Happy Horse 1.1 in 57%
- Seedance 2.0 in 52%
- Google's Gemini Omni Flash in 52%
Bij deze cijfers hoort een belangrijke kanttekening. De grafiek met de resultaten is aangeduid als een "preliminary evaluation of an early FLUX 3 candidate", wat betekent dat de cijfers een prereleasecheckpunt beschrijven en niet het model dat nu early access ingaat. Het uitgeleverde model kan beter of slechter presteren; niets dat vandaag is gepubliceerd meet wat klanten daadwerkelijk zullen gebruiken.
Luma Ray 3.2 en Runway Gen-4.5, waartegen FLUX 3 zijn sterkste resultaten boekte, zijn gevestigde producten, maar niet de modellen die momenteel bovenaan onafhankelijke videoranglijsten staan. Seedance 2.0, waarmee FLUX 3 op 52% gelijk eindigde, is een product dat de meeste westerse ondernemingen momenteel niet kunnen aanschaffen — ByteDance stelde de internationale uitrol voor onbepaalde tijd uit nadat Netflix, Warner Bros., Disney, Paramount en Sony juridische dreigementen hadden geuit wegens vermeende systematische auteursrechtschending, en die opschorting blijft van kracht.
Gemini Omni Flash, eveneens op 52%, is de belangrijkere vergelijking. Omni is de dichtstbijzijnde grote-platformanalogon van FLUX 3's multimodale aanpak, en volgens BFL's eigen meting zijn de twee niet van elkaar te onderscheiden op tekst-naar-videokwaliteit voor clips van 10 seconden. Google's voordeel is beschikbaarheid: Omni is toegankelijk via de Gemini API voor $0.10 per seconde gegenereerde 720p-video, of ongeveer $1.00 voor een clip van 10 seconden. Het bewerken van geüploade video is echter niet beschikbaar voor Omni Flash-gebruikers in de Europese Economische Ruimte, Zwitserland en het Verenigd Koninkrijk — al is het bewerken van video die het model zelf heeft gegenereerd wel toegestaan. Een Europese onderneming die bestaande beelden door een generatieve bewerkingsstap wil halen, kan dat momenteel niet doen op Omni Flash. Die geografische leemte biedt BFL, met hoofdkantoor in Duitsland, een kans als FLUX 3 zonder vergelijkbare regionale beperkingen wordt geleverd.
Vergelijking van videomodellen voor ondernemingen
| Model | Maximale generatieduur | Maximale resolutie | Belangrijkste beperkingen | Prijs per clip van 10s (720p) | Prijs per clip van 10s (1080p) | Prijs per clip van 10s (4K) |
|---|---|---|---|---|---|---|
| FLUX 3 Video | 20 seconden | Niet vermeld; evaluaties op 720p | Early access; geen gepubliceerde SLA of prijs | Niet aangekondigd | Niet aangekondigd | Niet aangekondigd |
| HappyHorse 1.1 | 15 seconden | 1080p | Geen 4K; gesloten gewichten | Niet gepubliceerd (v1.0 reseller rate ~$1.82) | Niet gepubliceerd (v1.0 reseller rate ~$3.12) | n/a |
| Veo 3.1 | Afrekening per seconde | 4K | Ondersteunt clipverlenging; preview | $4.00 | $4.00 | $6.00 |
| Veo 3.1 Fast | Afrekening per seconde | 4K | Preview | $1.00 | $1.20 | $3.00 |
| Veo 3.1 Lite | Afrekening per seconde | 1080p | Geen 4K, geen clipverlenging; preview | $0.50 | $0.80 | n/a |
| Gemini Omni Flash | 10 seconden (minimum 3s) | 720p bij 24 FPS | Preview; geen EU-toegang voor bewerking van geüploade video | $1.00 | n/a | n/a |
Geünificeerde architectuur: Self-Flow
FLUX 3 bouwt voort op Self-Flow, BFL's methode om multimodaal begrip en generatie binnen één architectuur op elkaar af te stemmen, voor het eerst publiek gemaakt in maart 2026. Het bedrijf zegt dat het rekenkracht en data aanzienlijk heeft opgeschaald om gelijktijdig over video, beelden en audio te trainen, en dat tests aantoonden dat videogeneratie en actievoorspelling geen afzonderlijke fundamenten vereisen — dezelfde architectuur kon worden uitgebreid naar actievoorspelling zonder op te offeren wat zij uit video had geleerd.
"We place vision at the center of our approach because it is the most signal-rich medium of the physical world. Images convey structure, images and video teach spatial relationships, video teaches dynamics, and actions reveal causal relationships. But vision alone is not the complete picture," zei Robin Rombach, medeoprichter en CEO van BFL, in een prereleaseverklaring aan VentureBeat. "True intelligence means perceiving the world: predicting how it will change, taking action, and learning from the results. Joint training within one unified architecture is what will get us there, because each training modality strengthens the others. Audio conveys timing, prosody, and physical events that elude vision. Language conveys goals, abstractions, and instructions that pixels cannot easily express."
Rombach voegde elders in de aankondiging toe: "You can't cheat reality. A model that only learns images can only generate images. But the world is not made of still frames. It moves, sounds, changes, and responds."
BFL zegt dat FLUX 3 zich richt op creatieve tooling, media, ontwerp, e-commerce en fysieke AI, met ondersteuning voor videogeneratie met gesynchroniseerde audio, nauwkeurige beeldbewerking, consistentie van producten en materialen in beweging, meertalige generatie en robotische actievoorspelling. Het wordt al getest door Canva, Burda, Magnific (voorheen Freepik), Krea en Picsart.
Voor creatieve softwarebedrijven is de aantrekkingskracht consolidatie — één foundationmodel dat storyboarding, beeldbewerking, productrendering, videovariatie en lokalisatie zou kunnen ondersteunen zonder assets telkens tussen losstaande modellen te vertalen. Voor roboticsteams ligt de potentiële waarde in data-efficiëntie: modellen die al beweging, objectgedrag en fysieke verandering coderen, hebben mogelijk minder taakspecifieke robottraining nodig dan systemen die beginnen met ruwe demonstraties. Deze convergentie van generatieve media en foundationmodellen voor robotica weerspiegelt een bredere verschuiving in de sector, nu bedrijven waaronder Google DeepMind en meerdere roboticastartups grote voorgetrainde modellen gaan toepassen op manipulatie- en locomotietaken.
Mogelijkheden van FLUX 3 Video
De videolaag is het meest concreet gespecificeerde deel van de lancering. FLUX 3 genereert clips tot 20 seconden met native audio vanuit één prompt. Elke video-output bevat gesynchroniseerde audio. Ter vergelijking: HappyHorse 1.0 komt uit op maximaal 15 seconden 1080p met gesynchroniseerde audio. BFL heeft niet vermeld op welke resolutie zijn clips van 20 seconden draaien, en gepubliceerde evaluaties zijn uitgevoerd op 720p. Een generatie van 20 seconden vanuit één prompt behoort tot de langste die tot nu toe is bereikt, vergelijkbaar met OpenAI's stopgezette Sora-model.
De gepubliceerde lijst met mogelijkheden omvat:
- Tekst-naar-videogeneratie
- Beeld-naar-videogeneratie, door te animeren vanaf een startframe of beelden als visuele referenties te gebruiken
- Video-naar-videogeneratie vanuit een referentieclip, waarbij elementen zoals een specifiek personage naar een nieuwe scène of context worden meegenomen
- Generatieve video-audiovoortzetting vanuit bestaande video- en audio-input
- Keyframe-naar-videogeneratie voor gecontroleerde overgangen tussen gedefinieerde momenten
- Meertalige dialoog
- Een breed scala aan visuele stijlen en beeldverhoudingen, van spontane camcorderbeelden tot animatie en cinematografie
- Typografiegeneratie en geanimeerd ontwerp
- Agentische koppeling van afzonderlijke clips tot langere sequenties met meerdere shots
Dat laatste onderdeel — agentische koppeling — is de mogelijkheid waar videoteams in ondernemingen het scherpst naar moeten kijken. BFL stelt dat de gecombineerde functies sequenties van meerdere minuten kunnen produceren, waarbij visuele referenties personages consistent houden over scènes heen. Als dat onder productieomstandigheden standhoudt, zou het de beperking aanpakken die generatieve video uit de meeste commerciële pipelines heeft gehouden: niet clipkwaliteit, maar continuïteit tussen shots.
De concurrentie rond personageconsistentie is hevig. De belangrijkste upgrade van HappyHorse 1.1 is R2V, of Reference-to-Video, dat meerdere referentiebeelden van personages accepteert om identiteit stabiel te houden in gegenereerde beelden. Alibaba claimt zero-drift lipsynchronisatie en richt zich specifiek op artefacten die commerciële AI-video als synthetisch herkenbaar maken, waaronder een olieachtige huid en overscherpte beelden.
BFL zegt dat FLUX 3 Video al bijzonder sterk is in menselijke gezichtsuitdrukkingen, het koppelen van geluiden aan fysieke gebeurtenissen en meertalige output. Aan de beeldkant tonen voorlopige evaluaties tijdens midtraining volgens het bedrijf aanzienlijke verbeteringen ten opzichte van eerdere FLUX-versies in het verwerken van complexe prompts en tekstgeneratie, inclusief zeer nauwkeurige tekst in meerdere talen. Er zijn geen beeldbenchmarks of winpercentages gepubliceerd.
FLUX-mimic: van videomodellen naar robotmodellen
BFL past zijn these van een geünificeerde architectuur toe via FLUX-mimic, een video-actiemodel dat is gebouwd op FLUX 3 en ontwikkeld met het Zwitserse Mimic Robotics, een van de eerste partners die early access kreeg.
De technische blog beschrijft twee routes naar actievoorspelling: native actievoorspelling rechtstreeks integreren in FLUX 3 door het oorspronkelijke Self-Flow-werk op te schalen, en de voorgetrainde videobackbone gebruiken als een dynamiekbewuste basis waaruit gespecialiseerde actiemodellen met beperkte taakspecifieke data kunnen worden gefinetuned. FLUX-mimic kiest de tweede route en combineert de FLUX 3-backbone met de expertise van Mimic Robotics in robotleren en productie-implementatie voor behendige manipulatie.
FLUX-mimic is ontworpen voor algemene robotische manipulatie: het helpt robots een visuele scène te begrijpen, de gevolgen van een actie te voorspellen en zich met minimale taakspecifieke data aan nieuwe taken aan te passen. BFL en Mimic Robotics zeggen dat het model, afhankelijk van de moeilijkheid van de taak, kan worden gefinetuned voor een specifieke manipulatietaak met slechts 30 minuten robotdata, waar eerdere benaderingen 30 uur of meer vereisten.
"The hardest part of robotics is data," zei Elvis Nava, CTO van Mimic Robotics, in een verklaring aan VentureBeat. "Every new task normally means hours of a robot repeating itself. Because FLUX-mimic is built on top of frontier video models that already understand how the physical world behaves, it picks up a new task in minutes, not days. This way, we can leapfrog the current state of the art in robot learning."
De 60x vermindering van benodigde demonstratiedata — van 30 uur naar 30 minuten — richt zich op een van de hardnekkigste knelpunten in toegepaste robotica, waar elke nieuwe manipulatietaak doorgaans uitgebreide fysieke dataverzameling vereist die niet overdraagbaar is tussen taken of omgevingen.
De claim rond wereldmodellen
BFL stelt dat een model dat alleen op beelden is getraind geen wereld kan begrijpen die "moves, sounds, changes, and responds", en dat fysiek begrip overtuigende gegenereerde beelden oplevert. Google doet een vrijwel identieke claim voor Gemini Omni. De ontwikkelaarsdocumentatie verwijst naar "world knowledge" dat "an understanding of physics" combineert met Gemini's begrip van geschiedenis, wetenschap en culturele context. Google's marketing stelt: "Most AI models just predict the next pixel to build a narrative or an image. Gemini Omni is different," en schrijft het model "an intuitive understanding of forces like gravity, kinetic energy, and fluid dynamics for more realistic movements that follow real-world logic" toe.
De praktische consequentie voor zakelijke kopers is dat taal over wereldmodellen geen onderscheidende factor is. Twee van de drie leidende videosystemen presenteren fysiek begrip nu als hun centrale voordeel, en geen van beide heeft een benchmark gepubliceerd die dat meet. Er is geen standaardtest voor de vraag of gegenereerd water zich als water gedraagt, of een vallend object met een plausibele snelheid valt, of dat een geluid klinkt op het moment van impact. Menselijke voorkeursratings vangen een deel hiervan indirect op; verder meet niets in het aanbod dit echt.
Open weights en bedrijfsachtergrond
BFL werd in de zomer van 2024 officieel gelanceerd en bouwde zijn reputatie op met het open sourcen van hoogwaardige AI-beeldmodellen die breed zijn overgenomen door ontwikkelaars, creatieven en ondernemingen. De oprichters van het bedrijf — Rombach, Andreas Blattmann en Patrick Esser — hielpen eerder bij de ontwikkeling van VQGAN, latent diffusion en Stable Diffusion, de opensourcetechnologie die brede AI-generatiemogelijkheden voor consumenten aanwakkerde en momenteel door veel AI-beeldgeneratoren en bedrijven wordt gebruikt.
Dat bereik vertaalde zich in commerciële distributie. FLUX-modellen ondersteunen nu generatieve functies in onder meer Adobe Photoshop, Picsart en Nous Research's Hermes Agent. Het bedrijf noemt filmregisseur Martin Scorsese onder zijn professionele gebruikers. Wired magazine beschreef Black Forest Labs als een relatief klein bedrijf dat toch een leidende concurrent werd van de grootste AI-labs in Silicon Valley, met FLUX-modellen die hoog scoren in beeldbenchmarks en behoren tot de meest gedownloade tekst-naar-beeldmodellen op Hugging Face. BFL zegt nu een team van 100 mensen te hebben verspreid over Freiburg en San Francisco.
FLUX.1 Dev, FLUX.1 Kontext Dev, FLUX.1 Fill Dev en gerelateerde controlemodellen — kort na de lancering van het bedrijf uitgebracht — gaven onderzoekers en ontwikkelaars van creatieve tools toegang tot downloadbare checkpoints, lokale inferentie en integraties met frameworks waaronder Hugging Face Diffusers en ComfyUI. FLUX.1 Kontext Dev werd bijvoorbeeld uitgebracht als open-weightmodel voor onderzoek en niet-commercieel gebruik, waarbij gegenereerde outputs onder de toepasselijke licentie voor commerciële doeleinden waren toegestaan.
Het bedrijf zette dat patroon voort met FLUX.2 Dev eind 2025, een open-weightmodel met 32 miljard parameters dat generatie en multi-referentiebewerking combineert. BFL noemde het bij de lancering het sterkste beschikbare open-weightmodel voor beeldgeneratie en -bewerking en bracht gewichten, referentie-inferentiecode en geoptimaliseerde implementaties voor consumenten-GPU's van Nvidia uit.
FLUX 3 Dev verhoogt de inzet. Eerdere Dev-releases waren beeldmodellen. FLUX 3 Dev wordt beschreven als een multimodale backbone voor video, audio, beeld en actievoorspelling — wat betekent dat één licentie zal bepalen of een bedrijf lokaal een model kan inzetten dat zowel contentproductie als fysieke machines raakt. BFL heeft nog geen informatie gedeeld over zijn licentie, aantal parameters, kwantisaties of hardwarevereisten. Het bedrijf presenteert open weights als een enterprisefunctie in plaats van als een gebaar naar de community, met het argument dat ze veilige lokale implementatie met lage latency mogelijk maken voor toepassingen zoals robotische besturingssystemen en teams in staat stellen FLUX 3 aan te passen aan hun eigen data, producten en workflows. Of de open-weightlicentie commercieel roboticagebruik zal toestaan — waar fysieke veiligheid en aansprakelijkheid anders liggen dan bij beeldgeneratie — blijft een open vraag die het bedrijf nog niet heeft beantwoord.
Financiële steun
Black Forest Labs wordt gewaardeerd op $3.25 miljard en heeft meer dan $450 miljoen opgehaald bij investeerders waaronder a16z, AMP, Salesforce Ventures, Nvidia, General Catalyst, Adobe Ventures, Figma Ventures, Canva en Deutsche Telekom's T.Capital. De investeerderslijst omvat zowel kapitaalverschaffers als commerciële partners — Adobe, Figma en Canva zijn ook integratiepartners — wat BFL's financiering afstemt op distributiekanalen voor de creatieve en mediacapaciteiten van FLUX 3.