新聞股票Black Forest Labs 發布 Flux 3,可生成長達 20 秒的原生音訊影片

Black Forest Labs 發布 Flux 3,可生成長達 20 秒的原生音訊影片

作者: The Decoder·

重點速覽

  • Flux 3 是來自 Black Forest Labs 的多模態基礎模型,同時從影像、影片和音訊中學習,能夠生成長達 20 秒且帶有原生同步音訊的短片。
  • 在 BFL 使用 720p 畫質 10 秒短片進行的初步內部評估中,Flux 3 在 93% 的比較中勝過 Luma Ray 3.2,在 77% 中勝過 Runway Gen-4.5,但與 Seedance 2.0 和 Gemini Omni Flash 等更強大的競爭對手相比,優勢縮小至 52%。
  • BFL 與 Mimic Robotics 合作開發了 Flux-mimic,這是一個用於機器人應用的視訊動作模型,目前已經在奧迪的生產任務中進行測試。
  • 該模型建構於 BFL 的 Self-Flow 方法之上,使用多模態轉換器將影像、影片和音訊轉換為共享的內部表示,以同時進行生成和理解任務。
  • BFL 正在分階段推出 Flux 3,Flux 3 Video 現已提供使用,Flux 3 Image 預計在接下來的幾週內推出,並計畫以 Flux 3 Dev 的名稱提供對模型骨幹的開放權重存取。
Black Forest Labs 發布 Flux 3,可生成長達 20 秒的原生音訊影片

德國人工智慧公司 Black Forest Labs (BFL) 發布了 Flux 3,這是一個多模態基礎模型,旨在同時從影像、影片和音訊中學習。該公司表示,此模型可以生成長達 20 秒且帶有原生音訊的短片,且早期的內部評估顯示其表現優於幾個競爭的影片生成系統。

BFL 由之前在 Stability AI 開發 Stable Diffusion 模型的研究人員創立,早期以 Flux 系列的開放權重影像生成模型建立聲譽。Flux 3 標誌著該公司從影像生成擴展到全面的多模態影片與音訊領域,而在這些領域中,包含 Runway、Luma Labs、Google 和 OpenAI 等競爭對手一直致力於建立主導地位。

BFL 將 Flux 3 描述為邁向「真實世界視覺智慧」的一步,並將其定義為能夠「在物理與數位環境中感知、預測和行動」的模型。該公司將這次發布定位為業界建立所謂「世界模型」的更廣泛努力的一部分,這是多家主要人工智慧實驗室正在追求的方法,旨在創建能夠理解物理動態,而不僅僅是對像素進行圖案匹配的系統。

根據 BFL 的說法,沒有任何單一模態可以完全捕捉現實。影像提供空間結構,影片顯示該結構如何隨時間變化,而音訊則可以揭示物理或機械事件與其產生聲音之間的關係。該公司主張,同時對影像、影片和音訊進行訓練,可以讓不同模態互相填補資訊缺口,為模型提供比單獨訓練每種數據類型更豐富的資訊。

Flux 3 為生成的影片加入原生音訊

Flux 3 為 BFL 影片模型引入了原生音訊生成功能,短片長度可達 20 秒。同步音訊一直是許多影片生成系統的缺口,這些系統通常生成無聲短片或依賴獨立的音訊模型。該模型支援文字轉影片、影像轉影片、影片轉影片、基於關鍵影格的轉場、多語言對話,以及用於較長多鏡頭序列的代理驅動剪輯連接。BFL 表示,Flux 3 在人類臉部表情以及將音訊與物理事件匹配方面表現得尤為出色。

在使用 720p 畫質的 10 秒短片進行的早期評估中,BFL 報告指出 Flux 3 在 93% 的比較中勝過 Luma Ray 3.2,在 77% 的比較中勝過 Runway Gen-4.5,並在 69% 的比較中勝過 Grok Imagine Video。

面對更強大的競爭系統時,報告的優勢幅度較小。BFL 表示,Flux 3 在 60% 的時間裡勝過 Kling v3 Pro,在 59% 的比較中勝過 Happy Horse v1,在 57% 中勝過 Happy Horse 1.1,以及在 52% 中勝過 Seedance 2.0 和 Gemini Omni Flash。

BFL 表示這些結果是初步的,目前尚無獨立的測試。如果該模型的表現可與已經打入好萊塢的 Seedance 以及 Gemini Omni Flash 等領先系統相媲美,Flux 3 將躋身頂尖影片模型之列。

該公司還期望 Flux 3 能改善影像生成,特別是對於複雜的提示和多種語言的準確文字渲染。BFL 計畫在未來幾週內釋出 Flux 3 Image 的早期測試版。

Flux-mimic 瞄準機器人應用

BFL 表示,Flux 3 還可以根據其對世界的理解來預測行動。該公司與 Mimic Robotics 合作開發了 Flux-mimic,這是一個用於機器人應用的視訊動作模型,目前已經在奧迪的生產任務中進行測試。這項工作反映了將影片與世界模型應用於具身 AI 的更廣泛產業趨勢,包含 Google 和 Tesla 在內的公司也已經探索了類似的機器人控制和自主系統方法。

Flux 3 基於 Self-Flow,這是 BFL 用來訓練單一模型同時生成和理解內容的方法。該系統使用具備專用組件的多模態轉換器,將影像、影片和音訊轉換為共享的內部表示,然後再將該表示轉換回輸出。

額外的動作組件為機器人應用提供了基礎。BFL 表示,這種統一的學習過程在生成質量和對物理世界的理解上,都比之前標準的流匹配方法表現得更好。

BFL 計畫分階段推出並提供開放權重存取

BFL 正在分階段發布 Flux 3 的功能,並設有早期測試期以收集回饋和支援安全測試。Flux 3 Video 已經提供使用,而 Flux 3 Image 預計在接下來的幾週內跟進。動作預測最初將透過選定的合作夥伴提供。

該公司還計畫以「Flux 3 Dev」的名稱發布多模態骨幹的開放權重存取。開放權重發布一直是 BFL 策略的標誌,這與其早期的 Flux 影像模型一致,這些模型被開發人員和研究人員廣泛採用。從長遠來看,BFL 表示正在開發次世代模型,旨在將感知、動作和語言預測結合在一個單一的模型中。