新聞宏觀經濟Black Forest Labs 發布 FLUX 3 多模態模型,支援影像、影片、音訊與機器人動作預測

Black Forest Labs 發布 FLUX 3 多模態模型,支援影像、影片、音訊與機器人動作預測

作者: MarkTechPost·

重點速覽

  • FLUX 3 設計為使用單一共享權重架構,從影像、影片與音訊中學習。
  • 該模型建基於 BFL 的 Self-Flow 方法;該公司指出主要變化在於提升了運算與資料規模。
  • FLUX 3 Video 支援文字轉影片、影像轉影片、影片轉影片、關鍵影格轉影片,以及影片音訊延續模式。
  • BFL 報告的初步人類偏好結果顯示,FLUX 3 領先多個競爭影片模型,但部分比較結果相當接近。
  • 存取仍受限制,Video 與 Action 處於早期存取階段,開放權重計畫於後續階段推出。
Black Forest Labs 發布 FLUX 3 多模態模型,支援影像、影片、音訊與機器人動作預測

Black Forest Labs (BFL) 已發布 FLUX 3,這是一款多模態基礎模型,設計目標是在單一架構中從影像、影片與音訊學習。該公司將其描述為首個可由一組共享權重提供影片、音訊與動作預測能力的 FLUX 模型。

BFL 研究團隊表示,該模型基於一項觀點:任何單一模態都無法完整描述世界。影像能捕捉單一時刻的空間結構,影片加入時間與物理動態,而音訊則可揭示機械事件與聲音之間的因果關係。在 BFL 的框架中,每一種模態都是同一底層現實的有損投影。

透過同時跨這些模態進行訓練,BFL 表示各資料來源會相互約束:聲音必須對應衝擊,運動也必須與質量一致。研究團隊稱 FLUX 3 是其首個完全圍繞這一原則打造的模型;其共享權重設計也讓此次發布不僅與媒體生成相關,因為 BFL 正將同一骨幹應用於機器人動作預測。

Self-Flow 作為底層方法

FLUX 3 建基於 Self-Flow,這是 BFL 用於在單一架構中對齊多模態生成與理解的方法。Self-Flow 將 flow matching 目標與自監督特徵重建目標結合在一起。

GitHub 上的參考實作以 Apache-2.0 授權發布,並使用 SiT-XL/2 搭配逐 token 的時間步條件化。它以 25% 的逐 token 遮罩比例進行訓練,並使用從第 20 層 EMA teacher 到第 8 層 student 的自蒸餾。

該已發布的 checkpoint 是 ImageNet 256×256 研究模型,而不是 FLUX 3。BFL 表示,其使用相同方法「大幅擴大了運算與資料資源」,以同時跨影片、影像與音訊訓練 FLUX 3。Self-Flow 於 2026 年 3 月推出,因此該方法本身並非此次發布的新內容;BFL 指出新的要素在於規模。

FLUX 3 Video 的能力

FLUX 3 Video 可在單次生成中產生最長 20 秒的片段,並包含原生音訊。支援模式包括文字轉影片、影像轉影片、由參考片段進行影片轉影片、用於受控轉場的關鍵影格轉影片,以及從輸入影片與音訊進行生成式影片音訊延續。

BFL 也將多語對話、將片段以代理式方式串接成多鏡頭序列,以及具動畫設計的強大字體生成列為該系統能力。團隊表示,系統在人類臉部表情生成,以及將聲音與物理事件關聯方面尤其具備優勢;這兩個領域的時間一致性與音訊影片對齊,對使用者感知生成片段至關重要。

根據 BFL,影片預測佔訓練運算量的 95% 以上,而音訊在 token 中的占比低於 0.5%。該公司也表示,同一骨幹驅動 FLUX-mimic,這是一項可在單張 RTX 5090 上以低於 80 ms 執行的機器人策略。

初步效能結果

BFL 發布了初步的人類偏好結果,測試使用 720p、含音訊的 10 秒文字轉影片片段。在這些比較中,FLUX 3 相較 Luma Ray 3.2 在 93% 的案例中更受偏好,相較 Runway Gen-4.5 則為 77%。

相較 Grok Imagine Video,BFL 報告的偏好率最高達 69%。報告中的數據還包括相較 Kling v3 Pro 為 60%、相較 Happy Horse v1 為 59%,以及相較 Happy Horse 1.1 為 57%。相較 Seedance 2.0 與 Gemini Omni Flash,報告結果為 52%,消息來源形容這接近擲硬幣的結果。

存取仍維持受限。BFL 表示 Video 與 Action 處於早期存取階段,Image 存取將隨後開放,開放權重則會最後推出。這種分階段推出意味著,外部評估將取決於更廣泛存取、模型細節與權重何時可用。

BFL 透過 FLUX 3 發布公告、FLUX 3 x mimic 技術文章以及 Self-Flow 論文發布了更多資料。