Black Forest Labs 发布 FLUX 3 多模态模型,用于图像、视频、音频和机器人动作预测
要点速览
- •FLUX 3 旨在使用单一共享权重架构从图像、视频和音频中学习。
- •该模型基于 BFL 的 Self-Flow 方法构建,公司指出主要变化在于计算资源和数据规模的提升。
- •FLUX 3 Video 支持文本到视频、图像到视频、视频到视频、关键帧到视频和视频-音频延续模式。
- •BFL 报告的初步人类偏好结果显示,FLUX 3 领先于多款竞争视频模型,不过部分比较结果较为接近。
- •访问仍受限制,Video 和 Action 处于早期访问阶段,开放权重计划在后续阶段推出。

Black Forest Labs(BFL)发布了 FLUX 3,这是一款多模态基础模型,旨在通过单一架构从图像、视频和音频中学习。该公司称,这是首个能够通过一组共享权重提供视频、音频和动作预测能力的 FLUX 模型。
BFL 研究团队表示,该模型基于这样一种观点:任何单一模态都无法完整描述世界。图像捕捉某一时刻的空间结构,视频加入时间和物理动态,而音频可以揭示机械事件与声音之间的因果关系。在 BFL 的表述中,每种模态都是同一底层现实的一种有损投影。
BFL 表示,通过同时在这些模态上训练,不同数据源会相互约束:声音必须对应冲击,运动必须符合质量。研究团队称 FLUX 3 是其首个完全围绕这一原则构建的模型;由于采用共享权重设计,该发布也不只与媒体生成相关,因为 BFL 正在将同一骨干网络应用于机器人动作预测。
Self-Flow 作为底层方法
FLUX 3 基于 Self-Flow 构建,这是 BFL 用于在一个架构中对齐多模态生成与理解的方法。Self-Flow 将流匹配目标与自监督特征重建目标相结合。
其 GitHub 上的参考实现 以 Apache-2.0 协议发布,使用 SiT-XL/2,并采用逐 token 时间步条件化。它以 25% 的逐 token 掩码比例进行训练,并使用自蒸馏,即从第 20 层的 EMA 教师模型蒸馏到第 8 层的学生模型。
已发布的该检查点是一个 ImageNet 256×256 研究模型,并非 FLUX 3。BFL 表示,其使用同一方法“显著扩大了计算和数据资源”,以同时在视频、图像和音频上训练 FLUX 3。Self-Flow 于 2026 年 3 月推出,因此该方法本身并不是此次发布的新内容;BFL 将新的要素归结为规模。
FLUX 3 Video 的能力
FLUX 3 Video 可以在单次生成中生成最长 20 秒的视频片段,并包含原生音频。支持的模式包括文本到视频、图像到视频、基于参考片段的视频到视频、用于受控转场的关键帧到视频,以及基于输入视频和音频的生成式视频-音频延续。
BFL 还将多语言对话、将片段代理式串联为多镜头序列,以及带动画设计的强文本排版生成列为该系统的能力。团队报告称,该系统在生成人类面部表情以及将声音与物理事件关联方面尤其突出,而时间一致性和音视频对齐是用户感知生成视频片段的两个核心方面。
据 BFL 称,视频预测占训练计算量的 95% 以上,而音频在 token 中占比低于 0.5%。该公司还表示,同一骨干网络驱动 FLUX-mimic,这是一项机器人策略,可在一张 RTX 5090 上以低于 80 ms 的延迟运行。
初步性能结果
BFL 发布了初步的人类偏好结果,测试使用的是带音频的 720p、10 秒文本到视频片段。在这些比较中,FLUX 3 相比 Luma Ray 3.2 在 93% 的案例中更受偏好,相比 Runway Gen-4.5 在 77% 的案例中更受偏好。
相较 Grok Imagine Video,BFL 报告的偏好率最高为 69%。报告中的数据还包括:相较 Kling v3 Pro 为 60%,相较 Happy Horse v1 为 59%,相较 Happy Horse 1.1 为 57%。相较 Seedance 2.0 和 Gemini Omni Flash,报告结果为 52%,消息源将其描述为接近抛硬币。
访问仍然受限。BFL 表示,Video 和 Action 处于早期访问阶段,Image 访问将随后开放,开放权重将最后推出。这种分阶段发布意味着外部评估将取决于更广泛访问、模型细节和权重何时可用。
BFL 通过 FLUX 3 公告、FLUX 3 x mimic 技术文章 和 Self-Flow 论文 发布了更多材料。