ニュースマクロBlack Forest LabsがFLUX 3を発表:画像、20秒の音声付き動画、ロボット動作を生成できるマルチモーダル前沿モデル

Black Forest LabsがFLUX 3を発表:画像、20秒の音声付き動画、ロボット動作を生成できるマルチモーダル前沿モデル

著者: VentureBeat AI·

重要ポイント

  • FLUX 3はBlack Forest LabsのSelf-Flow手法を用い、画像、動画、音声、ロボットアクション予測にまたがる学習を別々の専門モデルを組み合わせるのではなく、単一アーキテクチャ内で統合的に行っています。
  • FLUX 3 Videoは単一プロンプトから同期ネイティブ音声付きで最大20秒のクリップを生成でき、これはOpenAIの廃止されたSoraモデルが以前達成した再生時間に匹敵します。
  • 暫定的な偏好ベンチマークではFLUX 3がLuma Ray 3.2やRunway Gen-4.5を上回っていますが、10秒テキストから動画への品質比較ではGoogleのGemini Omni Flashと52%で並んでいます。
  • Mimic RoboticsとのFLUX-mimicパートナーシップを通じて、モデルはわずか30分のデモンストレーションデータで新しいロボット操作タスクにファインチューニング可能であり、以前必要とされた30時間以上から60分の1に削減されました。
  • Black Forest Labsは価格、サービスレベルコミットメント、評価手法、オープンウェイトライセンス条項を発表時に開示しておらず、企業の購買担当者は総保有コストを評価できません。
Black Forest LabsがFLUX 3を発表:画像、20秒の音声付き動画、ロボット動作を生成できるマルチモーダル前沿モデル

Black Forest Labs(BFL)は、ドイツ・フライブルクを拠点とするAI研究所で、画像、単一のテキストプロンプトから最大20秒の音声・動画クリップ、ロボット工学向けの物理的アクションを理解・生成するよう設計されたマルチモーダル前沿モデル「FLUX 3」を発表しました。同社は、FLUX 3を共通インターフェースの背後に画像、動画、音声の各モデルを個別に組み合わせるのではなく、単一アーキテクチャ内でこれらすべてのモダリティを統合的に学習させたモデルとして説明しています。

このアーキテクチャ上の違いは、BFLの位置づけの中核です。同社は企業に対して、創作生成、シミュレーション、コンピュータ操作、ロボット工学を、BFLが「視覚的知能」と呼ぶ単一能力の相互接続された応用として捉えることを求めています。BFLの言葉を借りれば、「物理的およびデジタル環境において知覚、予測、行動できる」モデルです。今回の発表は、BFL初の公開動画生成モデルでもあり、従業員約100名の規模で、GoogleのGemini Omniや過去2年間で総額数億ドルを調達した専門動画スタートアップ群といった、はるかに大規模な米国プラットフォームと直接競合することになります。

製品ラインと提供状況

FLUX 3は4つの製品ラインで提供されます:

  • FLUX 3 Video — オプションのネイティブ音声生成付き
  • FLUX 3 Image — 今後数週間で展開予定
  • FLUX 3 Action — 物理AIおよびロボット工学向け
  • FLUX 3 Dev — 近日公開のオープンウェイト版

FLUX 3 VideoとFLUX 3 Actionは現在、誰でも申請できるゲート付き早期アクセスプログラムに参加していますが、BFLが各申請者を承認する必要があります。BFLやパートナーを通じた公開APIアクセスはまだありません。同社はFLUX 3 Imageが今後数週間で展開され、その後より広範な一般提供に至ると述べています。

段階的なリリース戦略は、AnthropicOpenAIなど、米国の他の前沿研究室が最近採用したアプローチと同様ですが、それらの制限はセキュリティ上の懸念や政府の要請によるものでした。BFLの場合、ゲートはインフラの準備状況や継続的な開発が要因と思われ、安全性分類によるものではありません。

BFLが発表していないこと

今回の発表にはいくつかの重要な詳細が欠けています。BFLは価格、本番環境のサービスレベルコミットメント、評価手法、サンプルサイズ、評価者数、画像モデルのベンチマーク結果を一切開示していません。企業の購買担当者は総保有コストを計算したり、同社が公開した動画比較結果を独自に再現したりすることができません。

また、FLUX 3はダウンロード可能なウェイトやオープンソースライセンスの提供なしに発表されました。BFLはより高速なオープンウェイト版が今年後半に登場すると述べています。技術ブログでは、FLUX 3 Devを「コンテンツ作成(動画、音声、画像)およびアクション予測のためのマルチモーダルバックボーンへのオープンウェイトアクセス」と位置づけており、これは画像のみを対象としていた以前のFLUX Devリリースすべてと比較して幅広いコミットメントです。ただし、FLUX 3 Devはリリース順序の最後に位置します。主要モデルの発表と同時または直後にローカル展開可能なFLUXバリアントを受け取ることに慣れているデベロッパーは待たなければなりません。

この遅れは注目すべき点です。BFLのオープンウェイトリリースは主要な普及要因であったからです。ローカル展開可能なFLUXモデルはComfyUIやHugging Face Diffusersのワークフローに統合されており、発表時にダウンロード可能なFLUX 3バリアントがないことは、そのデベロッパーエコシステムが独自のハードウェアで新アーキテクチャをテストできないことを意味します。

暫定的なベンチマーク結果

BFLはいくつかのベンチマーク比較結果を公開していますが、すべて暫定的なものとされています。完全な結果と手法は、より広範な一般提供フェーズで公開される予定です。

音声付き10秒・720pのテキストから動画へのクリップに関する初期の直接比較テストでは、BFLはFLUX 3が以下のモデルより優先選択されたと報告しています:

  • Luma Ray 3.2 — 比較の93%で優位
  • Runway Gen-4.5 — 77%
  • Grok Imagine Video — 69%
  • Kling v3 Pro — 60%
  • Happy Horse v1 — 59%
  • Happy Horse 1.1 — 57%
  • Seedance 2.0 — 52%
  • Google Gemini Omni Flash — 52%

これらの数値には重要な注意点が伴います。結果を掲載したチャートは「初期のFLUX 3候補の暫定評価」とラベル付けされており、これらの数値が早期アクセスに参加しているモデルではなく、リリース前のチェックポイントを表していることを意味します。出荷版モデルのパフォーマンスは良い方にも悪い方にも変動する可能性があり、本日公開された内容は顧客が実際に使用するものを測定したものではありません。

FLUX 3が最も高い数値を記録したLuma Ray 3.2とRunway Gen-4.5は、確立された製品ですが、独立系動画ランキングで現在トップを走っているモデルではありません。52%で並んだSeedance 2.0は、現在多くの欧米企業が入手できない製品です。ByteDanceは、Netflix、Warner Bros.、Disney、Paramount、Sonyが組織的な著作権侵害の疑いで法的脅迫を行った後、Seedance 2.0の国際展開を無期限延期し、その停止は現在も続いています。

同じく52%のGemini Omni Flashは、より重要な比較です。OmniはFLUX 3のマルチモーダルアプローチに最も近い大規模プラットフォームの類似存在であり、BFL自身の測定でも、10秒のテキストから動画への品質において両者は区別がつきません。Googleの優位性は可用性にあります。OmniはGemini API経由で利用可能で、生成720p動画1秒あたり0.10ドル、10秒クリップで約1.00ドルです。ただし、欧州経済領域、スイス、イギリスのOmni Flashユーザーはアップロード動画の編集が利用できません。ただし、モデル自身が生成した動画の編集は許可されています。既存の映像を生成編集プロセスにかけたい欧州企業は、現在Omni Flashではそれを行えません。この地理的ギャップは、ドイツに本社を置くBFLが、FLUX 3に同様の地域制限がない形で提供されれば活用できる機会となります。

企業向け動画モデル比較

モデル最大生成時間最大解像度主な制約10秒クリップ価格(720p)10秒クリップ価格(1080p)10秒クリップ価格(4K)
FLUX 3 Video20秒非公開、評価は720p早期アクセス、SLA・価格非公開未発表未発表未発表
HappyHorse 1.115秒1080p4K非対応、クローズウェイト非公開(v1.0リセラー価格〜$1.82)非公開(v1.0リセラー価格〜$3.12)n/a
Veo 3.1秒課金4Kクリップ延長対応、プレビュー$4.00$4.00$6.00
Veo 3.1 Fast秒課金4Kプレビュー$1.00$1.20$3.00
Veo 3.1 Lite秒課金1080p4K非対応、クリップ延長なし、プレビュー$0.50$0.80n/a
Gemini Omni Flash10秒(最小3秒)720p 24 FPSプレビュー、EUではアップロード動画編集不可$1.00n/an/a

統合アーキテクチャ:Self-Flow

FLUX 3は、BFLが2026年3月に発表した、マルチモーダルな理解と生成を単一アーキテクチャ内で統合する手法であるSelf-Flowを基盤として構築されています。同社は、動画、画像、音声にまたがる学習のためにコンピュートとデータを大幅に拡張し、テストの結果、動画生成とアクション予渞に別々の基盤は不要であることが示されたと述べています。動画から学習した内容を犠牲にすることなく、同じアーキテクチャをアクション予測に拡張できます。

「視覚は物理世界において最も情報量の豊かな媒体であるため、私たちはアプローチの中心に視覚を据えています。画像は構造を伝え、画像と動画は空間的関係を教え、動画は動的変化を教え、アクションは因果関係を明らかにします。しかし視覚だけでは完全な姿を捉えることはできません」と、VentureBeatに提供された事前リリース声明の中で、BFLの共同創設者兼CEOのRobin Rombachは述べています。「真の知能とは、世界を知覚すること、つまり世界がどう変化するかを予測し、行動し、結果から学習することです。単一の統合アーキテクチャ内での合同学習こそが、その実現に向けた道であり、各学習モダリティが他を強化し合うからです。音声は視覚では捉えられないタイミング、韻律、物理的イベントを伝えます。言語はピクセルでは容易に表現できない目標、抽象概念、指示を伝えます。」

Rombachは発表文の別の場所でより率直に次のように述べました。「現実をごまかすことはできません。画像だけを学習したモデルは画像しか生成できません。しかし世界は静止フレームで構成されていません。動き、音、変化、そして応答があるのです。」

BFLはFLUX 3がクリエイティブツール、メディア、デザイン、eコマース、物理AIを対象とし、同期音声付き動画生成、精密な画像編集、動きを通じた製品・素材の一致性、多言語生成、ロボットアクション予測をサポートすると述べています。すでにCanva、Burda、Magnific(旧Freepik)、Krea、Picsartでテストされています。

クリエイティブソフトウェア企業にとっての魅力は統合です。ストーリーボーディング、画像編集、プロダクトレンダリング、動画バリエーション、ローカライズを、切断されたモデル間で繰り返しアセットや指示を変換することなく、単一の基盤モデルでサポートできる可能性があります。ロボット工学チームにとっての潜在的価値はデータ効率にあります。すでに動き、オブジェクトの挙動、物理的変化をエンコードしているモデルは、生のデモから始めるシステムよりも、タスク固有のロボット学習が少なくて済む可能性があります。生成メディアとロボット工学の基盤モデルのこの収束は、より広範な業界の変化を反映しています。Google DeepMindをはじめとする企業や複数のロボット工学スタートアップが、マニピュレーションや移動タスクに大規模な事前学習済みモデルを適用し始めています。

FLUX 3 Videoの機能

動画ティアは今回の発表で最も具体的に仕様が示された部分です。FLUX 3は単一のプロンプトからネイティブ音声付きで最大20秒のクリップを生成します。すべての動画出力に同期音声が含まれます。比較として、HappyHorse 1.0は同期音声付き1080pで最大15秒です。BFLは20秒クリップの解像度を明記しておらず、公開された評価は720pで実施されました。単一プロンプトからの20秒生成は、これまで達成された中で最も長い部類に入り、OpenAIの廃止されたSoraモデルに匹敵します。

公開された機能一覧:

  • テキストから動画への生成
  • 画像から動画への生成、開始フレームからのアニメーション化または画像の視覚的参照としての使用
  • 参照クリップからの動画から動画への生成、特定キャラクターなどの要素を新しいシーンや文脈に引き継ぐ
  • 既存の動画と音声入力からの生成的動画・音声の続き
  • 定義された瞬間間の制御されたトランジションのためのキーフレームから動画への生成
  • 多言語ダイアログ
  • カジュアルなビデオカメラ映像からアニメーションやシネマティクスまで、幅広い視覚スタイルとアスペクト比
  • タイポグラフィ生成とアニメーションデザイン
  • 個別クリップのより長いマルチショットシーケンスへのエージェント的チェーン

最後の項目、エージェント的チェーンは、企業の動画チームが最も注目すべき機能です。BFLはこれらの機能の組み合わせにより、視覚的参照でキャラクターの一致性を保ちながら数分続くシーケンスを生成できると主張しています。これが本番環境で成り立てば、生成動画のほとんどの商用パイプラインへの導入を阻んできた制約、つまりクリップ品質ではなくショット間の連続性の問題に対処することになります。

キャラクター一致性の分野での競争は激しいです。HappyHorse 1.1の目玉アップグレードはR2V(Reference-to-Video)で、複数のキャラクター参照画像を受け入れ、生成映像全体でアイデンティティの安定性を維持します。Alibabaはゼロドリフトのリップシンクを主張し、顔の油っぽさや過度なシャープ化など、商用AI動画が合成品であることを示すアーティファクトを特に対象としています。

BFLはFLUX 3 Videoが人間の顔の表情、音と物理的イベントの関連付け、多言語出力においてすでに特に強いと述べています。画像面では、学習途中段階の暫定評価で、複雑なプロンプト処理とテキスト生成において以前のFLUXバージョンから大幅な改善が示されています。複数言語の高精度テキストも含まれます。画像のベンチマークや勝率は公開されていません。

FLUX-mimic:動画モデルからロボットモデルへ

BFLは、FLUX 3上に構築され、最初の早期アクセスパートナーの1つであるスイスのMimic Roboticsと共同開発された動画アクションモデル「FLUX-mimic」を通じて、統合アーキテクチャのテーゼを適用しています。

技術ブログでは、アクション予測への2つの経路が説明されています。初期のSelf-Flowの成果を拡張してネイティブなアクション予測をFLUX 3に直接統合する方法と、事前学習済みの動画バックボーンを動特性を理解する基盤として利用し、限られたタスク固有データで専門的なアクションモデルをファインチューニングする方法です。FLUX-mimicは後者を採用し、FLUX 3バックボーンとMimic Roboticsのロボット学習および器用な操作の本番展開の専門知識を組み合わせています。

FLUX-mimicは汎用的なロボット操作を目的として設計され、ロボットが視覚的なシーンを理解し、アクションの結果を予測し、最小限のタスク固有データで新しいタスクに適応するのを支援します。BFLとMimic Roboticsは、タスクの難易度に応じて、モデルを特定の操作タスク向けにわずか30分のロボットデータでファインチューニングでき、これは以前のアプローチで30時間以上を要していたのと比較して大幅な改善だとしています。

「ロボット工学で最も困難なのはデータです」と、VentureBeatに提供された声明の中でMimic RoboticsのCTOであるElvis Navaは述べています。「新しいタスクごとに、通常はロボットが同じ動作を何時間も繰り返すことを意味します。FLUX-mimicは、すでに物理世界がどう振る舞うかを理解している前沿動画モデルの上に構築されているため、新しいタスクを数日ではなく数分で習得します。これにより、ロボット学習の現在の最先端を飛び越えることができます。」

必要なデモデータの60分の1の削減(30時間から30分へ)は、応用ロボット工学における最も持続的なボトルネックの1つを対象としています。各新しい操作タスクは典型的には、タスクや環境をまたいで転移しない広範な物理的データ収集を必要とします。

ワールドモデルの主張

BFLは、画像のみで学習されたモデルは「動き、音、変化、応答する」世界を理解できないと主張し、物理的理解こそが説得力のある生成映像を生み出すと論じています。GoogleはGemini Omniについてほぼ同じ主張を行っています。同社のデベロッパー向けドキュメントでは、歴史、科学、文化的文脈に対するGeminiの理解と組み合わされた「物理学の理解」を含む「世界知識」が引用されています。Googleのマーケティングはさらに率直です。「ほとんどのAIモデルは物語や画像を構築するために次のピクセルを予測するだけです。Gemini Omniは違います」と同社は6月に投稿し、モデルが「重力、運動エネルギー、流体力学のような力の直感的な理解により、現実世界の論理に従うよりリアルな動きを実現する」と評価しています。

企業の購買担当者にとっての実用的な影響は、ワールドモデルの言語が差別化要因ではないということです。主要な動画システム3つのうち2つが物理的理解を中心的な優位性として売り込んでいますが、それを測定するベンチマークを公開しているのはどちらもありません。生成された水が水らしく振る舞うか、落とした物体が妥当な速度で落下するか、衝突時に音が到着するかを検証する標準テストは存在しません。人間の好みによる評価が間接的にその一部を捉えていますが、それ以外にこれを捉える手段は提供されていません。

オープンウェイトと企業背景

BFLは2024年夏に正式に設立され、デベロッパー、クリエイター、企業に広く採用された高品質なAI画像モデルのオープンソース化へのコミットメントで名声を築きました。同社の創設者であるRombach、Andreas Blattmann、Patrick Esserは、以前にVQGAN、潜在拡散、そしてStable Diffusionの開発に貢献しました。Stable Diffusionは、コンシューマー向けの広範なAI生成能力を触発したオープンソース技術であり、現在多くのAI画像ジェネレーターや企業で使用されています。

このリーチは商業的展開につながりました。FLUXモデルは現在、Adobe Photoshop、Picsart、Nous ResearchのHermes Agentなどのプラットフォーム内で生成機能を支えています。同社は映画監督のMartin Scorseseをプロフェッショナルユーザーの1人として挙げています。Wired誌は、Black Forest Labsを比較的小規模な企業ながらシリコンバレー最大のAI研究室の有力な競合になったと評し、FLUXモデルは画像ベンチマークでトップクラスに位置し、Hugging Faceで最もダウンロードされたテキストから画像へのモデルの一部になっています。BFLは現在フライブルクとサンフランシスコにまたがる100名のチームを運営しています。

FLUX.1 Dev、FLUX.1 Kontext Dev、FLUX.1 Fill Dev、および関連コントロールモデルは、設立直後にリリースされ、研究者やクリエイティブツールのデベロッパーにダウンロード可能なチェックポイント、ローカル推論、Hugging Face DiffusersやComfyUIなどのフレームワークとの統合へのアクセスを提供しました。例えばFLUX.1 Kontext Devは、研究および非商用目的のオープンウェイトモデルとしてリリースされ、適用されるライセンスの下で商用目的での生成出力が許可されていました。

同社は2025年後半にFLUX.2 Devでこのパターンを継続しました。これは生成とマルチ参照編集を組み合わせた320億パラメータのオープンウェイトモデルです。BFLはこれを発表時点で利用可能な最も強力なオープンウェイト画像生成・編集モデルと呼び、ウェイト、参照推論コード、コンシューマー向けNvidia GPUの最適化実装をリリースしました。

FLUX 3 Devはその評価の基準を引き上げます。以前のDevリリースは画像モデルでした。FLUX 3 Devは動画、音声、画像、アクション予測にまたがるマルチモーダルバックボーンとして説明されており、単一のライセンスが、コンテンツ制作と物理的機械の両方に関わるモデルを企業がローカル展開できるかどうかを決めることになります。BFLはライセンス、パラメータ数、量子化、ハードウェア要件に関する情報をまだ共有していません。同社はオープンウェイトをコミュニティへのジェスチャーではなくエンタープライズ機能として位置づけ、ロボット制御システムなどのアプリケーション向けのセキュアで低レイテンシのローカル展開を可能にし、チームがFLUX 3を独自のデータ、製品、ワークフローに適応させることを可能にすると主張しています。オープンウェイトライセンスが商用ロボット工学での使用を許可するかどうかは、画像生成とは異なる物理的安全性や責任の考慮事項が絡むため、同社がまだ言及していない未解決の問題です。

資金的支援

Black Forest Labsの評価額は32億5000万ドルで、a16z、AMP、Salesforce Ventures、Nvidia、General Catalyst、Adobe Ventures、Figma Ventures、Canva、Deutsche TelekomのT.Capitalなどの投資家から4億5000万ドル以上を調達しています。投資家名簿には資金提供者と商業パートナーの両方が含まれており、Adobe、Figma、Canvaは統合パートナーでもあります。これにより、BFLの資金調達はFLUX 3のクリエイティブおよびメディア機能の配信チャネルと連動しています。