新闻股票Black Forest Labs 发布 Flux 3,可生成最长 20 秒原生音频视频

Black Forest Labs 发布 Flux 3,可生成最长 20 秒原生音频视频

作者: The Decoder·

要点速览

  • Flux 3 是 Black Forest Labs 推出的多模态基础模型,可同时从图像、视频和音频中学习,并能生成最长 20 秒、带原生同步音频的视频片段。
  • 在 BFL 使用 10 秒 720p 片段进行的初步内部评测中,Flux 3 相较 Luma Ray 3.2 的偏好率为 93 percent,相较 Runway Gen-4.5 为 77 percent,但相较 Seedance 2.0 和 Gemini Omni Flash 等更强竞争者时,优势缩小至 52 percent。
  • BFL 与 Mimic Robotics 合作开发了 Flux-mimic,这是一款面向机器人应用的视频动作模型,目前已在 Audi 的生产任务中测试。
  • 该模型基于 BFL 的 Self-Flow 方法,使用多模态 Transformer 将图像、视频和音频转换为共享内部表示,用于生成和理解任务。
  • BFL 正在分阶段发布 Flux 3:Flux 3 Video 已可用,Flux 3 Image 计划在未来几周推出,并计划以 Flux 3 Dev 的名称开放主干模型权重访问。
Black Forest Labs 发布 Flux 3,可生成最长 20 秒原生音频视频

德国 AI 公司 Black Forest Labs(BFL)发布了 Flux 3,这是一款多模态基础模型,旨在同时从图像、视频和音频中学习。该公司表示,该模型能够生成最长 20 秒、带原生音频的视频片段,早期内部评测显示其表现优于多个竞争性视频生成系统。

BFL 由此前在 Stability AI 开发 Stable Diffusion 模型的研究人员创立,早先凭借 Flux 系列开放权重图像生成模型建立了声誉。Flux 3 标志着该公司从图像生成扩展到完整的多模态视频和音频领域,而 Runway、Luma Labs、Google 和 OpenAI 等竞争者也一直在这些领域争夺领先地位。

BFL 将 Flux 3 描述为迈向“现实世界视觉智能”的一步,并将其定义为能够“在物理和数字环境中感知、预测并行动”的模型。该公司将此次发布定位为更广泛行业努力的一部分,即构建所谓的世界模型;多家主要 AI 实验室也在推进这一方向,目标是创建能够理解物理动态、而不只是对像素进行模式匹配的系统。

据 BFL 称,任何单一模态都无法完整捕捉现实。图像提供空间结构,视频展示这种结构如何随时间变化,而音频可以揭示物理或机械事件与其产生声音之间的关系。该公司认为,同时基于图像、视频和音频进行训练,可以让这些模态相互补足信息缺口,使模型获得比单独基于每类数据训练更丰富的信息。

Flux 3 为生成视频加入原生音频

Flux 3 为 BFL 的视频模型引入了原生音频生成能力,视频片段最长可达 20 秒。同步音频一直是许多视频生成系统的短板,这些系统通常生成无声片段,或依赖独立音频模型。该模型支持文本到视频、图像到视频、视频到视频、基于关键帧的转场、多语言对话,以及由智能体驱动的片段连接,以生成更长的多镜头序列。BFL 表示,Flux 3 在人物面部表情以及将音频与物理事件匹配方面表现尤其出色。

在使用 720p、10 秒片段进行的早期评测中,BFL 报告称,在对比中 Flux 3 相较 Luma Ray 3.2 的偏好率为 93 percent,相较 Runway Gen-4.5 为 77 percent,相较 Grok Imagine Video 为 69 percent。

面对更强的竞争系统时,报告中的优势幅度有所缩小。BFL 表示,Flux 3 相较 Kling v3 Pro 的偏好率为 60 percent,相较 Happy Horse v1 为 59 percent,相较 Happy Horse 1.1 为 57 percent,相较 Seedance 2.0 和 Gemini Omni Flash 均为 52 percent。

BFL 表示,这些结果仍属初步阶段,目前尚无独立测试。如果该模型能够达到 Seedance 和 Gemini Omni Flash 等领先系统的相近表现,Flux 3 将跻身顶级视频模型之列;其中 Seedance 已经进入 Hollywood。

该公司还预计 Flux 3 将改进图像生成能力,尤其是在复杂提示词以及多语言准确文本渲染方面。BFL 计划在未来几周内以早期访问形式发布 Flux 3 Image。

Flux-mimic 面向机器人应用

BFL 表示,Flux 3 还可以基于其对世界的理解来预测动作。该公司与 Mimic Robotics 合作开发了 Flux-mimic,这是一款面向机器人应用的视频动作模型,目前已在 Audi 的生产任务中进行测试。这项工作反映了行业中更广泛的趋势,即将视频模型和世界模型应用于具身 AI;Google 和 Tesla 等公司也探索了类似方法,用于机器人控制和自动化系统。

Flux 3 基于 Self-Flow,这是 BFL 用于训练一个模型同时生成并理解内容的方法。该系统使用多模态 Transformer,并配备专门组件,将图像、视频和音频转换为共享的内部表示,再将该表示转换回输出。

额外的动作组件为机器人应用提供了基础。BFL 表示,与此前标准的 flow-matching 方法相比,这种统一学习流程在生成质量以及模型对物理世界的理解方面表现更好。

BFL 计划分阶段推出并开放权重访问

BFL 正在分阶段发布 Flux 3 的能力,并设置早期访问期,以收集反馈并支持安全测试。Flux 3 Video 目前已经可用,Flux 3 Image 计划在未来几周推出。动作预测最初将通过选定合作伙伴提供。

该公司还计划以“Flux 3 Dev”的名称开放多模态主干的权重访问。开放权重发布一直是 BFL 战略的标志,这与其早期被开发者和研究人员广泛采用的 Flux 图像模型一脉相承。从更长期来看,BFL 表示正在开发下一代模型,目标是在单一模型中结合感知、动作和语言预测能力。