Black Forest Labs lancia FLUX 3: il primo modello video al servizio della robotica con la partnership Audi
Punti chiave
- •FLUX 3 è il primo modello di Black Forest Labs in grado di generare clip video fino a 20 secondi con audio sincronizzato, inclusi dialoghi, effetti sonori e rumori ambientali.
- •Nei test di preferenza, i revisori umani hanno favorito FLUX 3 rispetto a Runway Gen-4.5 nel 77% dei confronti e rispetto a Luma Ray 3.2 nel 93% dei confronti, ma le valutazioni non hanno incluso Sora di OpenAI o Veo di Google.
- •La stessa architettura multimodale alla base di FLUX 3 alimenta FLUX-mimic, un modello robotico co-sviluppato con mimic robotics che Audi sta testando sulla propria linea di produzione per compiti come il montaggio di guarnizioni flessibili delle porte.
- •FLUX-mimic raggiunge un tempo di risposta del sistema di circa 101 millisecondi, che BFL descrive come paragonabile ai riflessi visivi umani.
- •La versione open-weight Dev di FLUX 3, l'unico livello previsto per il deployment locale, non è attesa prima della seconda metà del 2026, mentre le capacità video e di azione sono attualmente limitate all'accesso tramite API e partner selezionati.

Black Forest Labs ha rilasciato FLUX 3 in early access, segnando il primo modello dell'azienda in grado di generare video e non solo immagini statiche. Il nuovo sistema produce clip fino a 20 secondi con audio sincronizzato ed è basato su un'architettura multimodale addestrata congiuntamente su immagini, video e suono. Il lancio colloca BFL in una delle categorie più competitive dell'IA, dove Sora di OpenAI, Veo di Google, Runway e Luma gareggiano tutte per produrre video generati dall'IA commercialmente validi.
La stessa tecnologia sottostante alimenta anche FLUX-mimic, un modello robotico sviluppato in collaborazione con mimic robotics, con sede a Zurigo, che il costruttore automobilistico tedesco Audi sta già testando sulla propria linea di produzione. La versione open-weight "Dev" — l'unico livello previsto per il deployment locale — non è attesa prima della seconda metà del 2026. Le capacità Video e Action rimangono disponibili esclusivamente tramite API e accesso a partner selezionati, mentre la generazione di immagini è prevista "nelle prossime settimane," secondo BFL.
La funzionalità video di FLUX 3 rappresenta la sua caratteristica principale. Il modello genera clip con audio sincronizzato agli eventi sullo schermo, inclusi dialoghi, effetti sonori e rumori ambientali. Nelle prime valutazioni comparative, i revisori umani hanno espresso una preferenza per l'output di FLUX 3 rispetto a Runway Gen-4.5 nel 77% dei confronti e rispetto a Luma Ray 3.2 nel 93% dei confronti. Il modello ha inoltre superato leggermente Gemini Omni e Seedance, prevalendo nel 52% di quelle valutazioni. BFL precisa che questi risultati riflettono test di preferenza e non un sistema di punteggio fisso — i valutatori guardano coppie di clip e selezionano la più convincente, con BFL che conta con quale frequenza FLUX 3 vince. In particolare, le valutazioni non hanno incluso confronti diretti con Sora di OpenAI o Veo di Google, lasciando inesperto il posizionamento di FLUX 3 rispetto a quei sistemi di rilievo nei risultati riportati da BFL.
Il modello mantiene inoltre solide capacità di generazione di immagini statiche, in linea con l'eredità della serie FLUX. BFL ha condiviso immagini di esempio che dimostrano versatilità in un'ampia gamma di stili oltre al fotorealismo.
BFL posiziona FLUX 3 come più di un semplice strumento per contenuti creativi. «Un modello che impara solo le immagini può generare solo immagini,» ha dichiarato il co-fondatore e CEO Robin Rombach. La tesi dell'azienda è che imparare a prevedere i video significhi anche apprendere la fisica sottostante — peso, contatto, tempistica — che è esattamente ciò di cui una macchina ha bisogno per navigare il mondo fisico. L'idea di utilizzare modelli generativi su larga scala come base per il controllo robotico ha suscitato un interesse crescente nei settori dell'IA e della robotica, con aziende tra cui Google DeepMind e Tesla che esplorano approcci correlati.
Questa tesi è alla base di FLUX-mimic. Sviluppato con mimic robotics, il sistema aggiunge un "decoder" leggero al motore di predizione video di FLUX 3, traducendo la comprensione interna del modello del movimento in azioni robotiche effettive. Audi sta già testando il sistema su compiti come il montaggio di guarnizioni flessibili delle porte — un lavoro che l'automazione convenzionale ha storicamente faticato a gestire perché i materiali deformabili si comportano in modo imprevedibile e resistono alla programmazione rigida da cui i robot tradizionali dipendono.
«Audi rappresenta il tipo di partner manifatturiero per cui abbiamo costruito FLUX-mimic,» ha affermato Stephan-Daniel Gravert, co-fondatore di mimic robotics. Christoph Schneider di Audi ha dichiarato che i robot ora «risolvono complessi lavori di manipolazione di corpi deformabili» che le macchine precedenti non potevano affrontare. BFL riferisce che il sistema completo risponde in circa 101 millisecondi, paragonabile ai riflessi visivi umani.
FLUX 3 arriva come l'ultimo tentativo di BFL di riconquistare slancio. Fondata nell'agosto 2024 da ricercatori che avevano contribuito a costruire i modelli Stable Diffusion originali presso Stability AI, Black Forest Labs ha rapidamente affermato la serie FLUX come una forza dominante. I suoi modelli open-source Flux Dev e Schnell hanno ottenuto il riconoscimento come migliori generatori di immagini open-source, superando MidJourney e superando le prestazioni del stesso Stable Diffusion 3 di Stability AI. FLUX 1.1 Pro ha successivamente raggiunto la vetta della classifica image arena di Artificial Analysis a ottobre, sebbene quella versione non fosse open-source.
BFL ha rilasciato FLUX.2 a novembre 2025, ma non ha raggiunto la stessa popolarità. La corona open-source detenuta dai modelli Flux originali è persistita fino a quando Z-Image Turbo di Alibaba ne ha eguagliato la qualità su schede grafiche consumer di fascia bassa alla fine del 2025. «Questo è ciò che SD3 avrebbe dovuto essere,» ha commentato un utente di CivitAI all'epoca.
FLUX 3 rappresenta il ritorno in forma di BFL, sebbene non sia ancora completamente open-source. Le capacità Video e Action sono disponibili ora in early access tramite API e partner selezionati, tra cui mimic robotics. La generazione di immagini seguirà nelle prossime settimane. La versione open-weight Dev è attesa nella seconda metà del 2026.