Black Forest Labs、最大20秒のネイティブオーディオ付き動画生成に向けたFlux 3をリリース
重要ポイント
- •Flux 3は、Black Forest Labsによるマルチモーダル基盤モデルであり、画像、動画、音声から同時に学習し、最大20秒のネイティブ同期オーディオ付き動画クリップを生成できます。
- •10秒の720pクリップを使用したBFLの予備的な内部評価では、Flux 3は比較の93%でLuma Ray 3.2より、77%でRunway Gen-4.5より好まれましたが、Seedance 2.0やGemini Omni Flashなどの強力な競合に対してはマージンが52%に縮小しました。
- •BFLはMimic Roboticsと協力して、ロボット工学アプリケーション向けのビデオアクションモデルであるFlux-mimicを開発し、すでにアウディでの生産タスクでテストしています。
- •このモデルはBFLのSelf-Flowアプローチに基づいており、マルチモーダルトランスフォーマーを使用して画像、動画、音声を生成タスクと理解タスクのための共有内部表現に変換します。
- •BFLはFlux 3を段階的にリリースしており、Flux 3 Videoは現在利用可能で、Flux 3 Imageは今後数週間以内に予定されており、Flux 3 Devという名前でバックボーンへのオープンウェイトアクセスを計画しています。

ドイツのAI企業であるBlack Forest Labs(BFL)は、画像、動画、音声から同時に学習するように設計されたマルチモーダル基盤モデル「Flux 3」をリリースしました。同社によると、このモデルはネイティブオーディオ付きで最大20秒の動画クリップを生成でき、初期の内部評価では複数の競合動画生成システムを上回る性能を示しました。
Stability AIでStable Diffusionモデルを開発していた研究者たちによって設立されたBFLは、これまでオープンウェイトの画像生成モデルであるFluxシリーズで高い評価を得てきました。Flux 3は、同社が画像生成から完全なマルチモーダルの動画および音声へと事業を拡大する画期的なものであり、Runway、Luma Labs、Google、OpenAIなどの競合他社が支配権を確立しようと競い合っている領域です。
BFLはFlux 3を「現実世界の視覚的知能(real-world visual intelligence)」への一歩と表現しており、これを「物理的およびデジタル環境全体で知覚、予測、行動できるモデル」と定義しています。同社は今回のリリースを、いわゆるワールドモデルを構築するという業界全体の取り組みの一部と位置づけています。これは、単にピクセルのパターンマッチングを行うのではなく、物理的なダイナミクスを理解するシステムを作り出すことを目指す複数の主要AI研究所が追求しているアプローチです。
BFLによると、単一のモダリティでは現実を完全に捉えることはできません。画像は空間構造を提供し、動画はその構造が時間とともにどのように変化するかを示し、音声は物理的または機械的なイベントとそれらが生成する音との関係を明らかにすることができます。同社は、画像、動画、音声を一緒に学習することで、各モダリティが互いのギャップを埋め合い、各データタイプを個別に学習するよりも豊富な情報をモデルに与えることができると主張しています。
Flux 3が生成動画にネイティブオーディオを追加
Flux 3は、BFLの動画モデルにネイティブオーディオ生成を導入し、最大20秒のクリップに対応します。同期オーディオは、多くの動画生成システムにとって未解決の課題であり、これまでは無音のクリップが生成されたり、別の音声モデルに依存したりしていました。このモデルは、テキストから動画(text-to-video)、画像から動画(image-to-video)、動画から動画(video-to-video)、キーフレームベースのトランジション、多言語ダイアログ、および長いマルチショットシーケンス用のクリップ間のエージェント駆動型接続をサポートしています。BFLによると、Flux 3は人間の表情や、物理的イベントへの音声の同期において特に優れた性能を発揮します。
720pの10秒クリップを使用した初期評価で、BFLはFlux 3が比較の93パーセントでLuma Ray 3.2より好まれ、77パーセントでRunway Gen-4.5より好まれ、69パーセントでGrok Imagine Videoより好まれたと報告しました。
より強力な競合システムに対しては、報告されたマージンは小さくなりました。BFLによると、Flux 3は60パーセントの確率でKling v3 Proより好まれ、比較の59パーセントでHappy Horse v1より、57パーセントでHappy Horse 1.1より好まれ、Seedance 2.0およびGemini Omni Flashの両方に対してはそれぞれ52パーセントで好まれました。
BFLはこれらの結果は予備的なものであり、現在利用可能な独立したテストはないと述べています。すでにハリウッドに到達しているSeedanceやGemini Omni Flashなどの主要システムと同等の性能を発揮すれば、Flux 3はトップクラスの動画モデルに位置づけられるでしょう。
また同社は、Flux 3が画像生成の改善、特に複雑なプロンプトや複数の言語にわたる正確なテキストレンダリングにおいて向上することを期待しています。BFLは今後数週間以内にFlux 3 Imageの早期アクセスをリリースする計画です。
Flux-mimicがロボット工学アプリケーションをターゲットに
BFLは、Flux 3が世界の理解に基づいてアクションを予測することもできると述べています。同社はMimic Roboticsと協力して、ロボット工学アプリケーション向けのビデオアクションモデルであるFlux-mimicを開発し、すでにアウディでの生産タスクにおいてテストが行われています。この取り組みは、動画やワールドモデルを身体性AIに応用するという業界全体の傾向を反映しており、GoogleやTeslaなどの企業がロボット制御や自律システムのために同様のアプローチを探求しています。
Flux 3は、1つのモデルでコンテンツの生成と理解の両方を学習させるBFLのアプローチであるSelf-Flowに基づいています。このシステムは、専用のコンポーネントを持つマルチモーダルトランスフォーマーを使用して、画像、動画、音声を共有の内部表現に変換し、それを出力に戻します。
追加のアクションコンポーネントがロボット工学アプリケーションの基盤を提供します。BFLによると、この統合された学習プロセスは、生成品質と物理世界の理解の両方において、以前の標準的なフローマッチング手法よりも優れた性能を発揮します。
BFLが段階的ロールアウトとオープンウェイトアクセスを計画
BFLはFlux 3の機能を段階的にリリースしており、フィードバックを収集し安全性テストをサポートするための早期アクセス期間を設けています。Flux 3 Videoはすでに利用可能であり、Flux 3 Imageは今後数週間以内にリリースされる予定です。アクション予測は当初、選ばれたパートナーを通じて利用可能になります。
また同社は、「Flux 3 Dev」という名前でマルチモーダルバックボーンへのオープンウェイトアクセスをリリースする計画です。オープンウェイトでのリリースはBFLの戦略の特徴であり、開発者や研究者に広く採用された以前のFlux画像モデルと一致しています。長期的には、BFLは知覚、アクション、言語予測を1つのモデルに組み合わせることを目的とした次世代モデルの開発に取り組んでいます。