新聞宏觀經濟Black Forest Labs 推出 FLUX 3:可用於影像、影片、音訊及機器人動作的多模態前沿模型

Black Forest Labs 推出 FLUX 3:可用於影像、影片、音訊及機器人動作的多模態前沿模型

作者: VentureBeat AI·

重點速覽

  • FLUX 3 使用 Black Forest Labs 的 Self-Flow 方法,在單一架構內跨影像、影片、音訊和機器人動作預測進行聯合訓練,而非組合獨立的專業模型。
  • FLUX 3 Video 可從單一提示生成最長 20 秒帶同步原生音訊的片段,與 OpenAI 已停產的 Sora 模型先前達到的時長相當。
  • 初步偏好基準測試顯示 FLUX 3 超越了 Luma Ray 3.2 和 Runway Gen-4.5,但在 10 秒文字轉影片品質比較中與 Google Gemini Omni Flash 以 52% 持平。
  • 透過與 Mimic Robotics 的 FLUX-mimic 合作,模型只需 30 分鐘的示範資料即可針對新的機器人操控任務進行微調,比先前所需的 30 小時以上減少了 60 倍。
  • Black Forest Labs 在發布時尚未公布定價、服務等級承諾、評測方法或開源權重授權條款,企業買方無法評估總持有成本。
Black Forest Labs 推出 FLUX 3:可用於影像、影片、音訊及機器人動作的多模態前沿模型

Black Forest Labs(BFL)是總部位於德國弗萊堡的 AI 實驗室,今日推出 FLUX 3——一款多模態前沿模型,能夠理解與生成影像、從單一文字提示生成最長 20 秒的音訊影片片段,以及用於機器人的物理動作。該公司表示,FLUX 3 是在單一架構內跨模態聯合訓練,而非將獨立的影像、影片和音訊模型組合在同一介面背後。

這一架構差異是 BFL 定位的核心。該公司希望企業將創意生成、模擬、電腦操作和機器人技術,視為其稱之為「視覺智慧」的單一能力的互聯應用——用 BFL 的話說,是「能夠在物理與數位環境中感知、預測和行動」的模型。此次發布也標誌著 BFL 首款公開的影片生成模型,並將這家約 100 人的公司直接置於與 Google Gemini Omni 等規模大得多的美國平台,以及過去兩年累計融資數億美元的專業影片新創公司競爭的位置。

產品線與可用性

FLUX 3 將透過四條產品線交付:

  • FLUX 3 Video — 可選原生音訊生成
  • FLUX 3 Image — 將在未來數週內推出
  • FLUX 3 Action — 用於物理 AI 與機器人
  • FLUX 3 Dev — 即將推出的開源權重版本

FLUX 3 Video 與 FLUX 3 Action 現正進入限量早鳥體驗計畫,任何人皆可申請,但須經 BFL 審核批准。目前尚無透過 BFL 或其合作夥伴的公开 API 存取。該公司表示,FLUX 3 Image 將在未來數週內推出,隨後進入更廣泛的正式可用階段。

這種分階段發布策略,呼應了近期其他美國前沿實驗室(包括 AnthropicOpenAI)所採取的做法,不過那些限制是出於安全考量及政府要求。對 BFL 而言,此限制似乎是由基礎設施就緒度與持續開發所驅動,而非安全分級。

BFL 尚未公布的事項

此次發布缺少若干關鍵細節。BFL 未公布定價、正式服務等級承諾、評測方法、樣本數量、評測者人數或任何影像模型基準測試結果。企業買方因此無法計算總持有成本,也無法獨立重現該公司發布的影片比較結果。

FLUX 3 在發布時也未提供可下載的權重或開源授權。BFL 表示,更快且開源權重的版本將於今年稍晚推出。其技術部落格將 FLUX 3 Dev 描述為「開源權重方式存取多模態骨幹,用於內容創作(影片、音訊和影像)及動作預測」——這比以往任何 FLUX Dev 版本(均僅涵蓋影像)的承諾更為廣泛。然而,FLUX 3 Dev 在發布序列中最後推出。習慣在重大模型發布時同時或不久後即獲得可本地部署 FLUX 變體的開發者,將需要等待。

這一延遲值得注意,因為 BFL 的開源權重版本一直是推動採用的主要因素。可本地部署的 FLUX 模型已整合至 ComfyUI 和 Hugging Face Diffusers 工作流程中,在發布時缺少可下載的 FLUX 3 變體,意味著該開發者生態系統目前尚無法在自己的硬體上測試新架構。

初步基準測試結果

BFL 已發布數項基準比較,但均標註為初步結果。完整結果與方法論承諾在更廣泛的正式可用階段公布。

在針對 10 秒、720p 含音訊的文字轉影片片段的早期對比偏好測試中,BFL 報告 FLUX 3 在以下比例中更受偏好:

  • Luma Ray 3.2 在 93% 的比較中勝出
  • Runway Gen-4.5 在 77% 中勝出
  • Grok Imagine Video 在 69% 中勝出
  • Kling v3 Pro 在 60% 中勝出
  • Happy Horse v1 在 59% 中勝出
  • Happy Horse 1.1 在 57% 中勝出
  • Seedance 2.0 在 52% 中勝出
  • Google Gemini Omni Flash 在 52% 中勝出

這些數據伴隨一個重要但書。承載結果的圖表標註為「FLUX 3 早期候選版本的初步評估」,意味著這些數字描述的是發布前檢查點,而非目前進入早鳥體驗的模型。正式推出的模型可能表現更好或更差;目前發布的內容均未測量客戶實際將使用的版本。

FLUX 3 對 Luma Ray 3.2 和 Runway Gen-4.5 取得了最強成績,但這兩者是成熟產品,並非目前在獨立影片排行榜上領先的模型。Seedance 2.0 以 52% 持平,是大多數西方企業目前無法取得的產品——在 Netflix、Warner Bros.、Disney、Paramount 和 Sony 就涉嫌系統性版權侵權發出法律威脅後,ByteDance 無限期推遲了其國際推廣,該暫停狀態至今仍然有效。

Gemini Omni Flash 同樣以 52% 持平,是更具實質意義的比較。Omni 代表與 FLUX 3 多模態方法最接近的大型平台類比,且根據 BFL 自身的測量,兩者在 10 秒文字轉影片品質上難以區分。Google 的優勢在於可用性:Omni 可透過 Gemini API 存取,每秒 720p 影片生成收費 0.10 美元,即 10 秒片段約 1.00 美元。然而,在歐洲經濟區、瑞士和英國,Omni Flash 使用者無法編輯上傳的影片——但編輯模型本身生成的影片是被允許的。一家希望透過生成式編輯處理現有素材的歐洲企業,目前無法在 Omni Flash 上做到這一點。如果 FLUX 3 推出時沒有類似的區域限制,這一地理差距將是總部設於德國的 BFL 可以利用的機會。

企業級影片模型比較

模型最大單次生成時長最高解析度主要限制每 10 秒片段價格(720p)每 10 秒片段價格(1080p)每 10 秒片段價格(4K)
FLUX 3 Video20 秒未說明;評測在 720p 進行早鳥體驗;無公布 SLA 或定價未公布未公布未公布
HappyHorse 1.115 秒1080p無 4K;封閉權重未公布(v1.0 經銷商費率約 $1.82)未公布(v1.0 經銷商費率約 $3.12)不適用
Veo 3.1按秒計費4K支援片段延伸;預覽版$4.00$4.00$6.00
Veo 3.1 Fast按秒計費4K預覽版$1.00$1.20$3.00
Veo 3.1 Lite按秒計費1080p無 4K、無片段延伸;預覽版$0.50$0.80不適用
Gemini Omni Flash10 秒(最低 3 秒)720p,24 FPS預覽版;歐盟地區無法編輯上傳影片$1.00不適用不適用

統一架構:Self-Flow

FLUX 3 建立在 Self-Flow 之上,這是 BFL 於 2026 年 3 月首次公開的方法,用於在單一架構內對齊多模態理解與生成。該公司表示,其大幅擴展了運算資源和資料,以同時跨影片、影像和音訊進行訓練,測試結果顯示影片生成和動作預測不需要各自獨立的基礎——同一架構可以延伸到動作預測,而不會犧牲從影片中學到的能力。

「我們將視覺置於方法的中心,因為它是物理世界中訊號最豐富的媒介。影像傳達結構,影像和影片傳授空間關係,影片傳授動態,動作則揭示因果關係。但僅有視覺並非全貌,」BFL 共同創辦人兼執行長 Robin Rombach 在提供給 VentureBeat 的預發布聲明中表示。「真正的智慧意味著感知世界:預測它將如何變化、採取行動、並從結果中學習。在單一統一架構內進行聯合訓練,將帶領我們達成目標,因為每種訓練模態都會強化其他模態。音訊傳達了時機、韻律和視覺無法捕捉的物理事件。語言則傳達了像素無法輕易表達的目標、抽象概念和指令。」

Rombach 在公告中另一處更直白地表達了這一觀點:「你無法欺騙現實。一個只學習影像的模型只能生成影像。但世界不是由靜止畫面組成的。它會移動、發聲、變化和回應。」

BFL 表示,FLUX 3 面向創意工具、媒體、設計、電子商務和物理 AI,支援帶同步音訊的影片生成、精確影像編輯、運動中的產品和材質一致性、多語言生成以及機器人動作預測。目前正在由 Canva、Burda、Magnific(前身為 Freepik)、Krea 和 Picsart 進行測試。

對創意軟體公司而言,其吸引力在於整合——單一基礎模型即可支援分鏡腳本、影像編輯、產品渲染、影片變體和在地化,而無需在互不相連的模型之間反覆轉換素材。對機器人團隊而言,潛在價值在於資料效率:已編碼運動、物體行為和物理變化的模型,可能比從原始示範開始的系統需要更少的任務專屬機器人訓練。生成式媒體與機器人基礎模型的融合反映了更廣泛的產業趨勢,Google DeepMind 等公司和多家機器人新創企業已開始將大型預訓練模型應用於操控和運動任務。

FLUX 3 Video 的實際能力

影片層級是此次發布中最具體的部分。FLUX 3 可從單一提示生成最長 20 秒帶原生音訊的片段。每個影片輸出都包含同步音訊。作為比較,HappyHorse 1.0 上限為 15 秒 1080p 帶同步音訊。BFL 未說明其 20 秒片段的解析度,而已發布的評測均在 720p 下進行。20 秒的單一提示生成是目前為止最長的紀錄之一,與 OpenAI 已停產的 Sora 模型相當。

已公布的能力清單包括:

  • 文字轉影片生成
  • 影像轉影片生成,從起始畫面進行動畫化或使用影像作為視覺參考
  • 影片轉影片生成,從參考片段中將特定角色等元素帶入新場景或情境
  • 從現有影片和音訊輸入進行生成式影音延續
  • 關鍵影格轉影片生成,用於定義時刻之間的受控轉場
  • 多語言對話
  • 多種視覺風格和長寬比,從紀實風格的攝影機畫面到動畫和電影級畫面
  • 字體生成和動態設計
  • 將個別片段進行代理式鏈結以組成更長的多鏡頭序列

最後一項——代理式鏈結——是企業影片團隊最應仔細檢視的能力。BFL 宣稱,組合功能可生成持續數分鐘的序列,並透過視覺參考保持場景間角色一致性。如果在生產條件下也成立,這將解決一直阻礙生成式影片進入大多數商業流程的限制:不是片段品質,而是鏡頭間的連續性。

角色一致性方面的競爭十分激烈。HappyHorse 1.1 的招牌升級是 R2V(Reference-to-Video),接受多張角色參考影像以在生成畫面中維持身分穩定。阿里巴巴則宣稱實現了零偏移唇形同步,並特別針對標誌商業 AI 影片為合成品的偽影進行改善,包括面部油光感和過度銳化。

BFL 表示,FLUX 3 Video 已在人類面部表情、將聲音與物理事件關聯以及多語言輸出方面表現尤為出色。在影像方面,訓練中期進行的初步評估顯示,在複雜提示處理和文字生成方面較早期 FLUX 版本有顯著改善,包括多語言的高準確度文字。尚未發布任何影像基準測試或勝率數據。

FLUX-mimic:從影片模型到機器人模型

BFL 正透過 FLUX-mimic 應用其統一架構論點,這是一款基於 FLUX 3 構建的影片動作模型,與瑞士公司 Mimic Robotics 共同開發,後者是最早獲得早鳥體驗權限的合作夥伴之一。

技術部落格描述了兩條動作預測路徑:將原生動作預測直接整合到 FLUX 3 中,擴展最初的 Self-Flow 工作;以及使用預訓練影片骨幹作為具備動力學感知的基礎,從中以有限的任務專屬資料微調出專業動作模型。FLUX-mimic 採取第二條路徑,將 FLUX 3 骨幹與 Mimic Robotics 在機器人學習和靈巧操控生產部署方面的專業知識相結合。

FLUX-mimic 專為通用的機器人操控而設計,協助機器人理解視覺場景、預測動作後果,並以極少的任務專屬資料適應新任務。BFL 和 Mimic Robotics 表示,根據任務難度,模型只需 30 分鐘的機器人資料即可為特定操控任務進行微調,而先前的方法需要 30 小時以上。

「機器人技術最困難的部分是資料,」Mimic Robotics 技術長 Elvis Nava 在提供給 VentureBeat 的聲明中表示。「每個新任務通常意味著機器人要重複動作數小時。因為 FLUX-mimic 建構在已經理解物理世界運作方式的前沿影片模型之上,它能在幾分鐘而非幾天內學會新任務。如此一來,我們可以超越目前機器人學習的最先進水準。」

所需示範資料的 60 倍減少——從 30 小時降至 30 分鐘——針對的是應用機器人技術中最持久的瓶頸之一,在該領域中,每個新的操控任務通常都需要大量的實體資料收集,而這些資料無法跨任務或跨環境轉移。

世界模型的主張

BFL 認為,僅在影像上訓練的模型無法理解一個「會移動、發聲、變化和回應」的世界,而物理理解正是產生令人信服的生成畫面的關鍵。Google 對 Gemini Omni 提出了幾乎相同的主張。其開發者文件引用了「世界知識」,結合了「對物理學的理解」與 Gemini 對歷史、科學和文化背景的掌握。Google 的行銷更直白地表示:「大多數 AI 模型只是預測下一個像素來建立敘事或影像。Gemini Omni 不同,」並將此歸功於該模型「對重力、動能和流體動力學等作用力的直觀理解,從而產生遵循現實世界邏輯的更真實動作。」

對企業買方而言,實際後果是世界模型的論述並非差異化因素。三大領先影片系統中的兩個現今都將物理理解作為核心優勢來行銷,但兩者都未發布衡量這一點的基準測試。目前沒有標準測試來判斷生成的水是否表現得像水、掉落的物體是否以合理速度落下,或聲音是否在撞擊時到達。人類偏好評分間接捕捉了其中一部分;其他現有方案則完全無法捕捉。

開源權重與公司背景

BFL 於 2024 年夏季正式成立,並在隨後兩年間以其開源高品質 AI 影像模型的承諾,贏得了開發者、創作者和企業的青睞,在 AI 產業中建立了聲譽。該公司的創辦人——Rombach、Andreas Blattmann 和 Patrick Esser——先前曾參與創建 VQGAN、潛在擴散和 Stable Diffusion,後者是推動大眾化 AI 生成能力普及的開源技術,目前被許多 AI 影像生成器和公司使用。

這一影響力轉化為了商業分發。FLUX 模型現在驅動著 Adobe Photoshop、Picsart 和 Nous Research 的 Hermes Agent 等平台中的生成功能。該公司引用電影導演 Martin Scorsese 為專業使用者之一。Wired 雜誌將 Black Forest Labs 描述為一家相對較小的公司,卻成為了矽谷最大 AI 實驗室的主要競爭對手,其 FLUX 模型在影像基準測試中排名接近頂尖,並成為 Hugging Face 上下載次數最多的文字轉影像模型之一。BFL 表示,其目前在弗萊堡和舊金山兩地擁有約 100 人的團隊。

FLUX.1 Dev、FLUX.1 Kontext Dev、FLUX.1 Fill Dev 及相關控制模型——在公司成立後不久發布——為研究人員和創意工具開發者提供了可下載的檢查點、本地推論以及與 Hugging Face Diffusers 和 ComfyUI 等框架的整合。例如,FLUX.1 Kontext Dev 作為開源權重模型發布,供研究和非商業用途使用,生成的輸出則可在適用授權條款下用於商業目的。

該公司在 2025 年底延續了這一模式,推出了 FLUX.2 Dev,這是一個 320 億參數的開源權重模型,結合了生成和多參考編輯。BFL 稱其為發布時最強大的開源權重影像生成和編輯模型,並發布了權重、參考推論程式碼以及針對消費級 Nvidia GPU 的優化實作。

FLUX 3 Dev 提高了門檻。先前的 Dev 版本是影像模型。FLUX 3 Dev 被描述為涵蓋影片、音訊、影像和動作預測的多模態骨幹——意味著單一授權將決定一家公司是否能在本地部署同時觸及內容製作和實體機械的模型。BFL 尚未分享有關其授權、參數數量、量化或硬體需求的資訊。該公司將開源權重定位為企業功能而非社群貢獻,認為開源權重能為機器人控制系統等應用實現安全、低延遲的本地部署,並讓團隊能將 FLUX 3 適應至自己的資料、產品和工作流程。開源權重授權是否允許商業機器人用途——在這一領域中,物理安全和責任考量與影像生成不同——仍然是該公司尚未解決的開放性問題。

資金支持

Black Forest Labs 的估值為 32.5 億美元,已從投資者籌集超過 4.5 億美元,投資者包括 a16z、AMP、Salesforce Ventures、Nvidia、General Catalyst、Adobe Ventures、Figma Ventures、Canva 和 Deutsche Telekom 的 T.Capital。投資者名單涵蓋了資金提供者和商業合作夥伴——Adobe、Figma 和 Canva 同時也是整合合作夥伴——這使 BFL 的融資與 FLUX 3 創意和媒體能力的分發管道保持一致。