Black Forest LabsがFLUX 3を発表:初の動画生成モデルがAudi提携でロボティクスに応用
重要ポイント
- •FLUX 3はBlack Forest Labs初の動画生成モデルで、会話、効果音、環境音を含む同期音声付きで最大20秒のクリップを生成可能
- •嗜好テストでは、ヒューマンレビュアーがRunway Gen-4.5との比較の77%、Luma Ray 3.2との比較の93%でFLUX 3を優先したが、評価にOpenAIのSoraやGoogleのVeoは含まれていない
- •FLUX 3の基盤となるマルチモーダルアーキテクチャはmimic roboticsと共同開発されたロボティクスモデル「FLUX-mimic」にも活用されており、Audiが柔軟なドアシールの取り付け等のタスクについて生産ラインでテスト中
- •FLUX-mimicのシステム応答時間は約101ミリ秒で、BFLはこれを人間の視覚反射に匹敵する水準と説明
- •ローカル展開が計画されている唯一のティアであるオープンウェイト版Devバージョンは2026年後半まで提供されず、動画およびアクション機能は現時点ではAPIおよび一部のパートナーアクセスに限定

Black Forest Labsは、FLUX 3を早期アクセスでリリースし、同社初となる静止画のみならず動画を生成できるモデルを発表しました。新システムは最大20秒の同期音声付きクリップを生成し、画像、動画、音声を共同で学習したマルチモーダルアーキテクチャ上に構築されています。今回のリリースにより、BFLはAI分野で最も競争の激しいカテゴリーのひとつに参入することとなります。同カテゴリーでは、OpenAIのSora、GoogleのVeo、Runway、Lumaがいずれも商業的に実現可能なAI生成動画の実現に向けて競争を繰り広げています。
同じ基盤技術は、チューリッヒを拠点とするmimic roboticsと共同開発されたロボティクスモデル「FLUX-mimic」にも活用されており、ドイツの自動車メーカーAudiはすでに自社の生産ラインでテストを実施しています。ローカル環境での展開が計画されている唯一のティアであるオープンウェイト版「Dev」バージョンは、2026年後半まで提供されない予定です。動画およびアクション機能は現時点ではAPIおよび一部のパートナーアクセスのみで利用可能であり、画像生成機能はBFLによると「今後数週間以内」に追加される予定です。
FLUX 3の動画機能は同モデルの旗艦機能です。このモデルは、画面上のイベント(会話、効果音、環境音を含む)に同期した音声付きでクリップを生成します。早期の直接比較評価では、ヒューマンレビュアーはRunway Gen-4.5との比較の77%、Luma Ray 3.2との比較の93%においてFLUX 3の出力を好むと回答しました。また、Gemini OmniおよびSeedanceを52%の評価で上回りました。BFLは、これらの結果が固定の採点基準ではなく嗜好テストに基づくものであると注記しています。評価者はペアになったクリップを視聴し、より説得力のあるものを選択し、BFLがFLUX 3の勝率を集計します。注目すべきは、評価にOpenAIのSoraやGoogleのVeoとの直接比較が含まれていなかった点で、BFLの報告結果においてFLUX 3とこれらの主要システムとの相対的な位置づけは検証されていません。
また、このモデルはFLUXシリーズの伝統に沿った強力な静止画生成能力も維持しています。BFLは、フォトリアリズムを超えた幅広いスタイルでの汎用性を示すサンプル画像を公開しました。
BFLはFLUX 3を単なるクリエイティブコンテンツツール以上のものとして位置づけています。「画像のみを学習したモデルは画像しか生成できない」と、共同創業者兼CEOのRobin Rombachは述べています。同社の仮説は、動画予測を学習することはその根底にある物理法則(重量、接触、タイミング)を学習することを意味し、それこそが機械が物理世界を移動するために必要な要素であるというものです。大規模な生成モデルをロボット制御の基盤として活用するという考えは、AIおよびロボティクス分野全体で関心を集めており、Google DeepMindやTeslaを含む企業が関連するアプローチを模索しています。
この仮説がFLUX-mimicの基盤となっています。mimic roboticsと共同開発されたこのシステムは、FLUX 3の動画予測エンジンに軽量な「デコーダー」を追加し、モデルの運動に関する内部理解を実際のロボット動作に変換します。Audiはすでに柔軟なドアシールの取り付けなどのタスクでこのシステムのテストを実施しています。これは、変形する素材が予測不可能に挙動し、従来のロボットが依存する固定プログラミングに抵抗するため、従来の自動化では歴史的に対応が困難だった作業です。
「Audiは、私たちがFLUX-mimicを構築するにあたって想定していた製造パートナーの典型です」と、mimic roboticsの共同創業者Stephan-Daniel Gravertは述べています。AudiのChristoph Schneiderは、ロボットが現在「従来の機械では対応できなかった複雑な軟体操作作業を解決している」と述べました。BFLによると、システム全体の応答時間は約101ミリ秒で、人間の視覚反射に匹敵する水準です。
FLUX 3は、BFLが勢いを取り戻すための最新の取り組みとして登場しました。2024年8月にStability AIで元となるStable Diffusionモデルの構築に貢献した研究者たちによって設立されたBlack Forest Labsは、FLUXシリーズを瞬く間に支配的な存在として確立しました。同社のオープンソースFlux DevおよびSchnellモデルは、最高のオープンソース画像ジェネレーターとしての評価を獲得し、MidJourneyを凌駕し、Stability AI自身のStable Diffusion 3をも上回る性能を示しました。FLUX 1.1 Proはその後10月にArtificial Analysis画像アリーナで首位に立ちましたが、このバージョンはオープンソースではありませんでした。
BFLは2025年11月にFLUX.2をリリースしましたが、同程度の人気を得るには至りませんでした。オリジナルのFluxモデルが保持していたオープンソースの王座は、AlibabaのZ-Image Turboが2025年後半にローエンド向けコンシューマーグラフィックカードで同等の品質を実現するまで続きました。「これこそSD3があるべき姿だった」と、当時あるCivitAIユーザーはコメントしました。
FLUX 3はBFLの復帰を象徴するモデルですが、完全なオープン化には至っていません。動画およびアクション機能は現在、APIおよびmimic roboticsを含む一部のパートナーを通じて早期アクセスで利用可能です。画像生成機能は今後数週間以内に追加される予定です。オープンウェイト版Devバージョンは2026年後半に提供される予定です。