Black Forest Labs uruchamia FLUX 3: multimodalny model frontierowy do obrazów, wideo, audio i działań robotycznych
Najważniejsze informacje
- •FLUX 3 jest trenowany wspólnie w zakresie obrazów, wideo, audio i przewidywania działań robotycznych w ramach jednej architektury wykorzystującej metodę Self-Flow Black Forest Labs, zamiast łączyć oddzielne wyspecjalizowane modele.
- •FLUX 3 Video może generować klipy trwające do 20 sekund ze zsynchronizowanym natywnym audio z pojedynczego promptu, dorównując długości wcześniej osiągniętej przez wycofany model Sora OpenAI.
- •Wstępne benchmarki preferencji pokazują, że FLUX 3 wyprzedza Luma Ray 3.2 i Runway Gen-4.5, ale remisuje z Google's Gemini Omni Flash na poziomie 52% w porównaniach jakości 10-sekundowego text-to-video.
- •Dzięki partnerstwu FLUX-mimic z Mimic Robotics model można dostrajać do nowych zadań manipulacji robotycznej przy użyciu zaledwie 30 minut danych demonstracyjnych, co oznacza 60-krotną redukcję względem ponad 30 godzin wymaganych wcześniej.
- •Black Forest Labs nie ujawniło przy premierze cen, zobowiązań dotyczących poziomu usług, metodologii ewaluacji ani warunków licencji otwartych wag, przez co nabywcy korporacyjni nie mogą ocenić całkowitego kosztu posiadania.

Black Forest Labs (BFL), laboratorium AI z Freiburga w Niemczech, uruchomiło FLUX 3, multimodalny model frontierowy zaprojektowany do rozumienia i generowania obrazów, połączonych klipów audio/wideo trwających do 20 sekund z pojedynczego promptu tekstowego oraz działań fizycznych dla robotyki. Firma opisuje FLUX 3 jako model trenowany wspólnie we wszystkich tych modalnościach w ramach jednej architektury, zamiast zestawiania oddzielnych modeli obrazu, wideo i audio za wspólnym interfejsem.
To rozróżnienie architektoniczne jest kluczowe dla pozycjonowania BFL. Firma chce, aby przedsiębiorstwa traktowały generowanie kreatywne, symulację, korzystanie z komputera i robotykę jako powiązane zastosowania tego, co nazywa „inteligencją wizualną” — modeli, które według słów BFL „potrafią postrzegać, przewidywać i działać w środowiskach fizycznych i cyfrowych”. Premiera oznacza także pierwszy publicznie dostępny model generowania wideo BFL i stawia firmę, zatrudniającą około 100 osób, bezpośrednio naprzeciw znacznie większych platform z USA, w tym Google Gemini Omni, oraz grupy wyspecjalizowanych startupów wideo, które łącznie pozyskały setki milionów dolarów w ciągu ostatnich dwóch lat.
Linie produktowe i dostępność
FLUX 3 będzie dostarczany w czterech liniach produktowych:
- FLUX 3 Video — z opcjonalnym natywnym generowaniem audio
- FLUX 3 Image — wdrażany w nadchodzących tygodniach
- FLUX 3 Action — dla fizycznej AI i robotyki
- FLUX 3 Dev — nadchodzące wydanie z otwartymi wagami
FLUX 3 Video i FLUX 3 Action trafiają teraz do ograniczonego programu Early Access, do którego każdy może aplikować, ale BFL musi zatwierdzić każdego kandydata. Nie ma jeszcze publicznego dostępu przez API BFL ani przez partnerów firmy. Spółka zapowiada, że FLUX 3 Image zostanie wdrożony w nadchodzących tygodniach, a następnie nastąpi szersza ogólna dostępność.
Etapowa strategia wydania przypomina niedawne podejścia innych amerykańskich laboratoriów frontierowych, w tym Anthropic i OpenAI, choć tamte ograniczenia przypisywano kwestiom bezpieczeństwa i wnioskom rządowym. W przypadku BFL ograniczenie dostępu wydaje się wynikać raczej z gotowości infrastruktury i trwających prac rozwojowych niż z klasyfikacji bezpieczeństwa.
Czego BFL nie ogłosiło
W premierze brakuje kilku krytycznych szczegółów. BFL nie ujawniło cen, zobowiązań dotyczących poziomu usług produkcyjnych, metodologii ewaluacji, wielkości próbek, liczby oceniających ani żadnych benchmarków modeli obrazowych. Nabywcy korporacyjni nie mogą więc jeszcze obliczyć całkowitego kosztu posiadania ani niezależnie odtworzyć porównań wideo opublikowanych przez firmę.
FLUX 3 nie debiutuje także z wagami do pobrania ani licencją open source. BFL zapowiada, że szybsze wersje oraz wersje z otwartymi wagami pojawią się jeszcze w tym roku. Jej blog techniczny określa FLUX 3 Dev jako „dostęp z otwartymi wagami do multimodalnego rdzenia, do tworzenia treści (wideo, audio i obrazów) oraz przewidywania działań” — to szersze zobowiązanie niż w przypadku jakiegokolwiek wcześniejszego wydania FLUX Dev, z których wszystkie obejmowały wyłącznie obrazy. Jednak FLUX 3 Dev pojawi się jako ostatni w sekwencji wydań. Deweloperzy przyzwyczajeni do otrzymywania lokalnie wdrażalnego wariantu FLUX równolegle z dużym ogłoszeniem modelu lub niedługo po nim będą musieli poczekać.
Opóźnienie jest istotne, ponieważ wydania BFL z otwartymi wagami były głównym motorem adopcji. Lokalnie wdrażalne modele FLUX są zintegrowane z przepływami pracy ComfyUI i Hugging Face Diffusers, a brak wariantu FLUX 3 do pobrania w dniu premiery oznacza, że ekosystem deweloperski nie może jeszcze testować nowej architektury na własnym sprzęcie.
Wstępne wyniki benchmarków
BFL opublikowało kilka porównań benchmarkowych, wszystkie określone jako wstępne. Pełne wyniki i metodologia mają zostać przedstawione na etapie szerszej ogólnej dostępności.
We wczesnych bezpośrednich testach preferencji na 10-sekundowych klipach text-to-video w 720p z audio BFL informuje, że FLUX 3 był preferowany względem:
- Luma Ray 3.2 w 93% porównań
- Runway Gen-4.5 w 77%
- Grok Imagine Video w 69%
- Kling v3 Pro w 60%
- Happy Horse v1 w 59%
- Happy Horse 1.1 w 57%
- Seedance 2.0 w 52%
- Google's Gemini Omni Flash w 52%
Tym liczbom towarzyszy istotne zastrzeżenie. Wykres z wynikami opisano jako „wstępną ocenę wczesnego kandydata FLUX 3”, co oznacza, że liczby dotyczą punktu kontrolnego sprzed wydania, a nie modelu, który właśnie trafia do wczesnego dostępu. Model produkcyjny może działać lepiej lub gorzej; nic z opublikowanych dziś materiałów nie mierzy tego, z czego faktycznie będą korzystać klienci.
Luma Ray 3.2 i Runway Gen-4.5, wobec których FLUX 3 uzyskał najsilniejsze wyniki, są uznanymi produktami, ale nie modelami, które obecnie prowadzą w niezależnych rankingach wideo. Seedance 2.0, z wynikiem 52%, to produkt, którego większość zachodnich przedsiębiorstw obecnie nie może nabyć — ByteDance bezterminowo odłożyło jego międzynarodowe wdrożenie po tym, jak Netflix, Warner Bros., Disney, Paramount i Sony wystosowały groźby prawne w związku z domniemanym systematycznym naruszaniem praw autorskich, a zawieszenie nadal obowiązuje.
Gemini Omni Flash, również z wynikiem 52%, jest bardziej znaczącym porównaniem. Omni reprezentuje najbliższy dużoplatformowy odpowiednik multimodalnego podejścia FLUX 3, a według własnych pomiarów BFL oba modele są nierozróżnialne pod względem jakości 10-sekundowego text-to-video. Przewagą Google jest dostępność: Omni jest dostępny przez Gemini API w cenie $0.10 za sekundę wygenerowanego wideo 720p, czyli około $1.00 za 10-sekundowy klip. Jednak edycja przesłanego wideo nie jest dostępna dla użytkowników Omni Flash w Europejskim Obszarze Gospodarczym, Szwajcarii i Wielkiej Brytanii — choć edycja wideo wygenerowanego przez sam model jest dozwolona. Europejskie przedsiębiorstwo chcące przetworzyć istniejący materiał przez generatywną edycję nie może obecnie zrobić tego w Omni Flash. Ta luka geograficzna jest szansą dla BFL, z siedzibą w Niemczech, jeśli FLUX 3 zostanie udostępniony bez podobnych ograniczeń regionalnych.
Porównanie modeli wideo dla przedsiębiorstw
| Model | Maksymalny czas generowania | Maksymalna rozdzielczość | Kluczowe ograniczenia | Cena za klip 10s (720p) | Cena za klip 10s (1080p) | Cena za klip 10s (4K) |
|---|---|---|---|---|---|---|
| FLUX 3 Video | 20 seconds | Nie podano; ewaluacje w 720p | Wczesny dostęp; brak opublikowanego SLA lub cen | Nie ogłoszono | Nie ogłoszono | Nie ogłoszono |
| HappyHorse 1.1 | 15 seconds | 1080p | Brak 4K; zamknięte wagi | Nie opublikowano (stawka resellera v1.0 ~$1.82) | Nie opublikowano (stawka resellera v1.0 ~$3.12) | n/a |
| Veo 3.1 | Rozliczanie za sekundę | 4K | Obsługuje przedłużanie klipów; preview | $4.00 | $4.00 | $6.00 |
| Veo 3.1 Fast | Rozliczanie za sekundę | 4K | Preview | $1.00 | $1.20 | $3.00 |
| Veo 3.1 Lite | Rozliczanie za sekundę | 1080p | Brak 4K, brak przedłużania klipów; preview | $0.50 | $0.80 | n/a |
| Gemini Omni Flash | 10 seconds (minimum 3s) | 720p przy 24 FPS | Preview; brak dostępu w UE do edycji przesłanego wideo | $1.00 | n/a | n/a |
Zunifikowana architektura: Self-Flow
FLUX 3 bazuje na Self-Flow, metodzie BFL służącej do wyrównywania multimodalnego rozumienia i generowania w ramach jednej architektury, po raz pierwszy upublicznionej w marcu 2026 r. Firma twierdzi, że znacząco zwiększyła moc obliczeniową i dane, aby trenować jednocześnie na wideo, obrazach i audio, a testy wykazały, że generowanie wideo i przewidywanie działań nie wymagają oddzielnych fundamentów — tę samą architekturę można rozszerzyć na przewidywanie działań bez utraty wiedzy zdobytej z wideo.
„Stawiamy widzenie w centrum naszego podejścia, ponieważ jest to medium świata fizycznego najbogatsze w sygnały. Obrazy przekazują strukturę, obrazy i wideo uczą relacji przestrzennych, wideo uczy dynamiki, a działania ujawniają relacje przyczynowe. Ale samo widzenie nie jest pełnym obrazem” — powiedział Robin Rombach, współzałożyciel i CEO BFL, w oświadczeniu przedpremierowym przekazanym VentureBeat. „Prawdziwa inteligencja oznacza postrzeganie świata: przewidywanie, jak się zmieni, podejmowanie działań i uczenie się z wyników. Wspólne trenowanie w ramach jednej zunifikowanej architektury jest drogą do tego celu, ponieważ każda modalność treningowa wzmacnia pozostałe. Audio przekazuje czas, prozodię i zdarzenia fizyczne, które umykają widzeniu. Język przekazuje cele, abstrakcje i instrukcje, których piksele nie potrafią łatwo wyrazić”.
Rombach dodał w innym miejscu ogłoszenia: „Nie da się oszukać rzeczywistości. Model, który uczy się tylko obrazów, może generować tylko obrazy. Ale świat nie składa się z nieruchomych klatek. Porusza się, brzmi, zmienia i reaguje”.
BFL twierdzi, że FLUX 3 jest kierowany do narzędzi kreatywnych, mediów, designu, e-commerce i fizycznej AI, wspierając generowanie wideo z zsynchronizowanym audio, precyzyjną edycję obrazów, spójność produktów i materiałów w ruchu, generowanie wielojęzyczne oraz przewidywanie działań robotycznych. Model jest już testowany przez Canva, Burda, Magnific (dawniej Freepik), Krea i Picsart.
Dla firm tworzących oprogramowanie kreatywne atrakcyjna jest konsolidacja — jeden model bazowy, który mógłby obsługiwać storyboardy, edycję obrazów, renderowanie produktów, warianty wideo i lokalizację bez wielokrotnego tłumaczenia zasobów między niepołączonymi modelami. Dla zespołów robotycznych potencjalna wartość leży w efektywności danych: modele, które już kodują ruch, zachowanie obiektów i zmiany fizyczne, mogą wymagać mniej treningu robotów specyficznego dla zadań niż systemy zaczynające od surowych demonstracji. Ta konwergencja generatywnych mediów i bazowych modeli robotycznych odzwierciedla szerszą zmianę w branży, ponieważ firmy takie jak Google DeepMind oraz wiele startupów robotycznych zaczęły stosować duże modele wstępnie trenowane do zadań manipulacji i lokomocji.
Możliwości FLUX 3 Video
Warstwa wideo jest najbardziej konkretnie opisaną częścią premiery. FLUX 3 generuje klipy trwające do 20 sekund z natywnym audio z pojedynczego promptu. Każdy wynik wideo zawiera zsynchronizowane audio. Dla porównania HappyHorse 1.0 osiąga maksymalnie 15 sekund w 1080p ze zsynchronizowanym audio. BFL nie podało, w jakiej rozdzielczości działają jego 20-sekundowe klipy, a opublikowane ewaluacje przeprowadzono w 720p. Generowanie 20-sekundowego klipu z jednego promptu należy do najdłuższych dotąd osiągniętych i dorównuje wycofanemu modelowi Sora OpenAI.
Opublikowana lista możliwości obejmuje:
- Generowanie text-to-video
- Generowanie image-to-video, animowanie od klatki początkowej lub używanie obrazów jako referencji wizualnych
- Generowanie video-to-video z klipu referencyjnego, przenoszące elementy, takie jak konkretna postać, do nowej sceny lub kontekstu
- Generatywną kontynuację wideo-audio z istniejącego wejścia wideo i audio
- Generowanie keyframe-to-video dla kontrolowanych przejść między określonymi momentami
- Dialog wielojęzyczny
- Szeroki zakres stylów wizualnych i proporcji obrazu, od spontanicznych nagrań kamerą po animację i formy filmowe
- Generowanie typografii i animowany design
- Agentowe łączenie pojedynczych klipów w dłuższe, wieloujęciowe sekwencje
Ostatni punkt — agentowe łączenie — to funkcja, której zespoły wideo w przedsiębiorstwach powinny przyjrzeć się najdokładniej. BFL twierdzi, że połączone możliwości mogą tworzyć sekwencje trwające kilka minut, z referencjami wizualnymi utrzymującymi spójność postaci między scenami. Jeśli sprawdzi się to w warunkach produkcyjnych, rozwiązałoby ograniczenie, które trzymało generatywne wideo poza większością komercyjnych pipeline'ów: nie jakość pojedynczego klipu, lecz ciągłość między ujęciami.
Konkurencja w zakresie spójności postaci jest intensywna. Główną aktualizacją HappyHorse 1.1 jest R2V, czyli Reference-to-Video, które przyjmuje wiele obrazów referencyjnych postaci, aby utrzymać stabilność tożsamości w wygenerowanym materiale. Alibaba deklaruje zerowy dryf synchronizacji ruchu ust i konkretnie celuje w artefakty oznaczające komercyjne wideo AI jako syntetyczne, w tym nadmierną oleistość twarzy i nadmierne wyostrzenie.
BFL twierdzi, że FLUX 3 Video jest już szczególnie mocny w ludzkiej mimice, kojarzeniu dźwięków ze zdarzeniami fizycznymi i wynikach wielojęzycznych. Po stronie obrazów wstępne ewaluacje z połowy treningu pokazują znaczącą poprawę względem wcześniejszych wersji FLUX w obsłudze złożonych promptów i generowaniu tekstu, w tym tekstu o wysokiej dokładności w wielu językach. Nie opublikowano żadnych benchmarków obrazowych ani wskaźników zwycięstw.
FLUX-mimic: od modeli wideo do modeli robotycznych
BFL stosuje swoją tezę o zunifikowanej architekturze poprzez FLUX-mimic, model wideo-działanie zbudowany na FLUX 3 i opracowany ze szwajcarską firmą Mimic Robotics, jednym z pierwszych partnerów, którzy otrzymali wczesny dostęp.
Blog techniczny opisuje dwie drogi do przewidywania działań: bezpośrednią integrację natywnego przewidywania działań z FLUX 3 przez skalowanie początkowych prac Self-Flow oraz użycie wstępnie wytrenowanego rdzenia wideo jako fundamentu świadomego dynamiki, z którego specjalizowane modele działań można dostrajać przy ograniczonej ilości danych specyficznych dla zadania. FLUX-mimic wybiera drugą drogę, łącząc rdzeń FLUX 3 z doświadczeniem Mimic Robotics w uczeniu robotów i wdrożeniach produkcyjnych w precyzyjnej manipulacji.
FLUX-mimic jest przeznaczony do ogólnego zastosowania w manipulacji robotycznej: pomaga robotom rozumieć scenę wizualną, przewidywać konsekwencje działania i adaptować się do nowych zadań przy minimalnej ilości danych specyficznych dla zadania. BFL i Mimic Robotics twierdzą, że model można dostroić do konkretnego zadania manipulacyjnego przy użyciu zaledwie 30 minut danych z robota, podczas gdy wcześniejsze podejścia wymagały 30 lub więcej godzin.
„Najtrudniejszą częścią robotyki są dane” — powiedział Elvis Nava, CTO Mimic Robotics, w oświadczeniu przekazanym VentureBeat. „Każde nowe zadanie zwykle oznacza godziny powtarzania tej samej czynności przez robota. Ponieważ FLUX-mimic jest zbudowany na frontierowych modelach wideo, które już rozumieją, jak zachowuje się świat fizyczny, przyswaja nowe zadanie w minuty, a nie dni. W ten sposób możemy przeskoczyć obecny stan techniki w uczeniu robotów”.
60-krotna redukcja wymaganych danych demonstracyjnych — z 30 godzin do 30 minut — celuje w jedno z najbardziej uporczywych wąskich gardeł robotyki stosowanej, gdzie każde nowe zadanie manipulacyjne zwykle wymaga rozległego zbierania danych fizycznych, które nie przenoszą się między zadaniami ani środowiskami.
Twierdzenie o modelu świata
BFL argumentuje, że model trenowany wyłącznie na obrazach nie może zrozumieć świata, który „porusza się, brzmi, zmienia i reaguje”, a zrozumienie fizyczne jest tym, co daje przekonujący wygenerowany materiał. Google formułuje niemal identyczne twierdzenie w przypadku Gemini Omni. Dokumentacja deweloperska wskazuje na „wiedzę o świecie” łączącą „rozumienie fizyki” z opanowaniem przez Gemini historii, nauki i kontekstu kulturowego. Marketing Google stwierdza: „Większość modeli AI po prostu przewiduje następny piksel, aby zbudować narrację lub obraz. Gemini Omni jest inny”, przypisując modelowi „intuicyjne rozumienie sił takich jak grawitacja, energia kinetyczna i dynamika płynów, co pozwala uzyskać bardziej realistyczne ruchy zgodne z logiką świata rzeczywistego”.
Praktyczna konsekwencja dla nabywców korporacyjnych jest taka, że język modeli świata nie jest wyróżnikiem. Dwa z trzech wiodących systemów wideo promują obecnie zrozumienie fizyczne jako swoją centralną przewagę, a żaden nie opublikował benchmarku, który to mierzy. Nie istnieje standardowy test sprawdzający, czy wygenerowana woda zachowuje się jak woda, czy upuszczony obiekt spada w wiarygodnym tempie ani czy dźwięk pojawia się w momencie uderzenia. Oceny preferencji ludzkich ujmują część tego pośrednio; nic innego z dostępnych rozwiązań tego nie mierzy.
Otwarte wagi i tło firmy
BFL oficjalnie wystartowało latem 2024 r. i zbudowało reputację na udostępnianiu w open source wysokiej jakości modeli obrazowych AI szeroko przyjętych przez deweloperów, twórców i przedsiębiorstwa. Założyciele firmy — Rombach, Andreas Blattmann i Patrick Esser — wcześniej pomagali tworzyć VQGAN, latent diffusion oraz Stable Diffusion, technologię open source, która uruchomiła szerokie możliwości generatywnej AI dla konsumentów i jest obecnie wykorzystywana przez wiele generatorów obrazów AI oraz firm.
Ten zasięg przełożył się na dystrybucję komercyjną. Modele FLUX napędzają dziś funkcje generatywne w Adobe Photoshop, Picsart i Nous Research's Hermes Agent, między innymi platformami. Firma wskazuje reżysera Martina Scorsese wśród profesjonalnych użytkowników. Magazyn Wired opisał Black Forest Labs jako stosunkowo małą firmę, która stała się wiodącym konkurentem największych laboratoriów AI z Doliny Krzemowej, z modelami FLUX plasującymi się blisko szczytu benchmarków obrazowych i należącymi do najczęściej pobieranych modeli text-to-image w Hugging Face. BFL twierdzi, że obecnie prowadzi 100-osobowy zespół we Freiburgu i San Francisco.
FLUX.1 Dev, FLUX.1 Kontext Dev, FLUX.1 Fill Dev oraz powiązane modele kontrolne — wydane krótko po starcie firmy — dały badaczom i deweloperom narzędzi kreatywnych dostęp do punktów kontrolnych do pobrania, lokalnego inferowania oraz integracji z frameworkami, w tym Hugging Face Diffusers i ComfyUI. FLUX.1 Kontext Dev został na przykład wydany jako model z otwartymi wagami do badań i użytku niekomercyjnego, przy czym wygenerowane wyniki dopuszczono do celów komercyjnych na podstawie właściwej licencji.
Firma kontynuowała ten schemat wraz z FLUX.2 Dev pod koniec 2025 r., modelem z otwartymi wagami o 32 miliardach parametrów, łączącym generowanie i edycję z wieloma referencjami. BFL nazwało go najsilniejszym modelem generowania i edycji obrazów z otwartymi wagami dostępnym w chwili premiery oraz udostępniło wagi, referencyjny kod inferencji i zoptymalizowane implementacje dla konsumenckich GPU Nvidia.
FLUX 3 Dev podnosi stawkę. Poprzednie wydania Dev były modelami obrazowymi. FLUX 3 Dev jest opisywany jako multimodalny rdzeń obejmujący wideo, audio, obraz i przewidywanie działań — co oznacza, że jedna licencja będzie regulować, czy firma może lokalnie wdrożyć model dotykający zarówno produkcji treści, jak i maszyn fizycznych. BFL nie udostępniło jeszcze informacji o licencji, liczbie parametrów, kwantyzacjach ani wymaganiach sprzętowych. Firma przedstawia otwarte wagi jako funkcję korporacyjną, a nie gest wobec społeczności, argumentując, że umożliwiają bezpieczne, lokalne wdrożenia o niskich opóźnieniach dla aplikacji takich jak systemy sterowania robotami i pozwalają zespołom dostosowywać FLUX 3 do własnych danych, produktów i przepływów pracy. To, czy licencja otwartych wag dopuści komercyjne zastosowania robotyczne — gdzie kwestie bezpieczeństwa fizycznego i odpowiedzialności różnią się od generowania obrazów — pozostaje otwartym pytaniem, którego firma jeszcze nie rozstrzygnęła.
Finansowanie
Black Forest Labs jest wyceniane na $3.25 billion i pozyskało ponad $450 million od inwestorów, w tym a16z, AMP, Salesforce Ventures, Nvidia, General Catalyst, Adobe Ventures, Figma Ventures, Canva i Deutsche Telekom's T.Capital. Lista inwestorów obejmuje zarówno dostawców kapitału, jak i partnerów komercyjnych — Adobe, Figma i Canva są również partnerami integracyjnymi — co łączy finansowanie BFL z kanałami dystrybucji kreatywnych i medialnych możliwości FLUX 3.