Black Forest Labs wydało Flux 3 do generowania wideo z natywnym dźwiękiem o długości do 20 sekund
Najważniejsze informacje
- •Flux 3 to wielomodalny model podstawowy od Black Forest Labs, który uczy się jednocześnie z obrazów, wideo i dźwięku, i potrafi generować klipy wideo o długości do 20 sekund z natywnym, zsynchronizowanym dźwiękiem.
- •We wstępnych, wewnętrznych ocenach BFL, wykorzystujących 10-sekundowe klipy 720p, Flux 3 był preferowany zamiast Luma Ray 3.2 w 93 procentach porównań i zamiast Runway Gen-4.5 w 77 procentach, jednak różnice stopniały się do 52 procent w obliczu silniejszej konkurencji, takiej jak Seedance 2.0 i Gemini Omni Flash.
- •BFL współpracowało z Mimic Robotics nad opracowaniem Flux-mimic – modelu wideo-akcji do zastosowań w robotyce, który jest już testowany w zadaniach produkcyjnych w Audi.
- •Model jest oparty na podejściu BFL o nazwie Self-Flow, które wykorzystuje transformator wielomodalny do konwersji obrazów, wideo i dźwięku na wspólną wewnętrzną reprezentację zarówno do zadań generowania, jak i rozumienia.
- •BFL udostępnia Flux 3 w fazach: Flux 3 Video jest już dostępny, Flux 3 Image ma zostać wydany w nadchodzących tygodniach, a otwarty dostęp do szkieletu modelu jest planowany pod nazwą Flux 3 Dev.

Niemiecka firma zajmująca się sztuczną inteligencją, Black Forest Labs (BFL), wydała Flux 3 – wielomodalny model podstawowy zaprojektowany do jednoczesnego uczenia się z obrazów, wideo i dźwięku. Firma twierdzi, że model potrafi generować klipy wideo o długości do 20 sekund z natywnym dźwiękiem, a wczesne wewnętrzne oceny wykazały, że przewyższa kilka rywalizujących systemów generowania wideo.
BFL, założona przez badaczy, którzy wcześniej opracowali modele Stable Diffusion w Stability AI, zbudowała wcześniej swoją reputację na serii Flux modeli generowania obrazów z otwartymi wagami. Flux 3 oznacza ekspansję firmy z generowania obrazów na pełną wielomodalność obejmującą wideo i dźwięk – obszary, na których konkurenci, w tym Runway, Luma Labs, Google i OpenAI, ścigają się, aby zdominować rynek.
BFL opisuje Flux 3 jako krok w stronę „prawdziwej wizualnej inteligencji”, którą definiuje jako modele zdolne do „postrzegania, przewidywania i działania w środowiskach fizycznych i cyfrowych”. Firma traktuje premierę jako część szerszego wysiłku branży na rzecz budowy tak zwanych modeli świata – podejścia realizowanego przez wiele głównych laboratoriów AI, dążących do stworzenia systemów rozumiejących fizyczną dynamikę, zamiast po prostu dopasowywać wzorce pikseli.
Według BFL żaden pojedynczy format danych nie oddaje w pełni rzeczywistości. Obrazy zapewniają strukturę przestrzenną, wideo pokazuje, jak ta struktura zmienia się w czasie, a dźwięk może ujawniać relacje między zdarzeniami fizycznymi lub mechanicznymi a wydawanymi przez nie dźwiękami. Firma argumentuje, że jednoczesne uczenie na obrazach, wideo i dźwięku pozwala tym modalnościom wzajemnie uzupełniać luki, dostarczając modelowi bogatszych informacji niż osobne szkolenie na każdym typie danych.
Flux 3 dodaje natywny dźwięk do generowanego wideo
Flux 3 wprowadza generowanie natywnego dźwięku dla modeli wideo BFL, z klipami o długości do 20 sekund. Zsynchronizowany dźwięk był dotąd luką w wielu systemach generowania wideo, które często tworzą nieme klipy lub polegają na oddzielnych modelach audio. Model obsługuje konwersję tekstu na wideo, obrazu na wideo, wideo na wideo, przejścia oparte na klatkach kluczowych, wielojęzyczne dialogi oraz połączenia między klipami sterowane przez agentów, pozwalające na tworzenie dłuższych sekwencji wieloujęciowych. BFL twierdzi, że Flux 3 radzi sobie szczególnie dobrze z mimiką twarzy człowieka oraz z dopasowywaniem dźwięku do zdarzeń fizycznych.
We wczesnych ocenach z wykorzystaniem 10-sekundowych klipów w rozdzielczości 720p BFL podało, że Flux 3 był preferowany zamiast Luma Ray 3.2 w 93 procentach porównań, zamiast Runway Gen-4.5 w 77 procentach, a zamiast Grok Imagine Video w 69 procentach.
Podane różnice okazały się mniejsze w porównaniu z silniejszymi systemami konkurencyjnymi. BFL poinformowało, że Flux 3 był wybierany zamiast Kling v3 Pro w 60 procentach przypadków, zamiast Happy Horse v1 w 59 procentach porównań, zamiast Happy Horse 1.1 w 57 procentach, a także zamiast Seedance 2.0 i Gemini Omni Flash – w 52 procentach przypadków każdy.
BFL zaznacza, że wyniki te są wstępne i nie ma obecnie dostępnych niezależnych testów. Jeśli model będzie działał na poziomie porównywalnym z wiodącymi systemami, takimi jak Seedance, który trafił już do Hollywood, oraz Gemini Omni Flash, Flux 3 znajdzie się w gronie najlepszych modeli wideo.
Firma spodziewa się również, że Flux 3 poprawi generowanie obrazów, szczególnie w przypadku złożonych podpowiedzi i dokładnego renderowania tekstu w wielu językach. BFL planuje udostępnić Flux 3 Image we wczesnym dostępie w ciągu najbliższych kilku tygodni.
Flux-mimic celuje w zastosowania robotyczne
BFL twierdzi, że Flux 3 potrafi również przewidywać działania na podstawie swojego rozumienia świata. We współpracy z Mimic Robotics firma opracowała Flux-mimic, model wideo-akcji do zastosowań w robotyce, który jest już testowany podczas zadań produkcyjnych w Audi. Praca ta odzwierciedla szerszy trend branży polegający na stosowaniu modeli wideo i modeli świata w dziedzinie ucieleśnionej sztucznej inteligencji (embodied AI), gdzie firmy takie jak Google i Tesla badały podobne podejścia do sterowania robotami i systemami autonomicznymi.
Flux 3 opiera się na Self-Flow – podejściu BFL do uczenia jednego modelu tak, aby potrafił zarówno generować, jak i rozumieć treści. System wykorzystuje transformator wielomodalny ze specjalizowanymi komponentami, które konwertują obrazy, wideo i dźwięk na wspólną wewnętrzną reprezentację, a następnie konwertują tę reprezentację z powrotem na dane wyjściowe.
Dodatkowy komponent akcji stanowi podstawę dla zastosowań w robotyce. BFL twierdzi, że ten ujednolicony proces uczenia osiąga lepsze wyniki niż stosowana wcześniej standardowa metoda dopasowywania przepływu (flow-matching), zarówno pod względem jakości generowania, jak i rozumienia fizycznego świata przez model.
BFL planuje etapowe wdrożenie i otwarty dostęp do wag
BFL udostępnia możliwości Flux 3 etapami, z okresami wczesnego dostępu mającymi na celu zbieranie opinii i wspieranie testów bezpieczeństwa. Flux 3 Video jest już dostępny, natomiast Flux 3 Image ma pojawić się w nadchodzących tygodniach. Przewidywanie akcji będzie początkowo dostępne dla wybranych partnerów.
Firma planuje również wydać model z otwartymi wagami (open-weight) wielomodalnego szkieletu pod nazwą „Flux 3 Dev”. Publikacja z otwartymi wagami była znakiem rozpoznawczym strategii BFL, co pozostaje w zgodzie z ich wcześniejszymi modelami obrazów Flux, które były szeroko stosowane przez programistów i badaczy. W dłuższej perspektywie BFL pracuje nad modelami nowej generacji, które mają łączyć percepcję, akcję i przewidywanie języka w jednym modelu.