新闻宏观经济Black Forest Labs发布FLUX 3:面向图像、视频、音频与机器人动作的多模态前沿模型

Black Forest Labs发布FLUX 3:面向图像、视频、音频与机器人动作的多模态前沿模型

作者: VentureBeat AI·

要点速览

  • FLUX 3在单一架构内使用Black Forest Labs的Self-Flow方法,跨图像、视频、音频和机器人动作预测进行联合训练,而非组合独立的专用模型。
  • FLUX 3 Video可通过单个提示生成最长20秒带同步原生音频的片段,与OpenAI已停产的Sora模型此前实现的时长相当。
  • 初步偏好基准测试显示FLUX 3优于Luma Ray 3.2和Runway Gen-4.5,但在10秒文生视频质量对比中与Google的Gemini Omni Flash以52%打平。
  • 通过FLUX-mimic与Mimic Robotics的合作,该模型仅需30分钟的演示数据即可针对新机器人操控任务进行微调,相比此前所需的30小时以上减少了60倍。
  • Black Forest Labs在发布时尚未披露定价、服务级别承诺、评估方法论或开放权重许可条款,使企业买家无法评估总拥有成本。
Black Forest Labs发布FLUX 3:面向图像、视频、音频与机器人动作的多模态前沿模型

Black Forest Labs(BFL)是总部位于德国弗赖堡的AI实验室,现已发布FLUX 3——一款多模态前沿模型,旨在理解并生成图像、通过单个文本提示生成最长20秒的音视频组合片段,以及用于机器人的物理动作。该公司将FLUX 3描述为在单一架构内跨所有模态进行联合训练,而非在通用接口背后拼装独立的图像、视频和音频模型。

这一架构上的区别是BFL市场定位的核心。该公司希望企业将创意生成、仿真、计算机操作和机器人技术视为其所称的"视觉智能"的相互关联的应用——用BFL的话说,即"能够感知、预测并作用于物理和数字环境"的模型。此次发布也标志着BFL首个公开可用的视频生成模型,使这家约100人的公司直接对标包括Google的Gemini Omni在内的大规模美国平台,以及过去两年间累计融资数亿美元的众多专业视频初创公司。

产品线与可用性

FLUX 3将通过四条产品线交付:

  • FLUX 3 Video — 支持可选的原生音频生成
  • FLUX 3 Image — 将在未来几周内推出
  • FLUX 3 Action — 面向物理AI和机器人技术
  • FLUX 3 Dev — 即将推出的开放权重版本

FLUX 3 Video和FLUX 3 Action目前正在进入一项受限的抢先体验计划,任何人都可以申请参加,但BFL必须审批每位申请者。目前尚无通过BFL或其合作伙伴的公共API访问渠道。该公司表示FLUX 3 Image将在未来几周内推出,随后将实现更广泛的正式发布。

这一分阶段发布策略与近期其他美国前沿实验室的做法相似,包括AnthropicOpenAI,不过那些限制据称是出于安全考量和政府要求。对于BFL而言,限制访问似乎是由基础设施就绪程度和持续开发所驱动,而非安全分类。

BFL尚未公布的信息

此次发布缺少若干关键细节。BFL尚未披露定价、生产级服务级别承诺、评估方法论、样本量、评分者人数或任何图像模型基准测试。企业买家因此无法计算总拥有成本,也无法独立复现该公司已发布的视频对比结果。

FLUX 3在发布时也未提供可下载权重或开源许可证。BFL表示更快和开放权重的版本将于今年晚些时候推出。其技术博客将FLUX 3 Dev定义为"开放权重方式访问多模态骨干网络,用于内容创作(视频、音频和图像)及动作预测"——这比以往任何FLUX Dev版本(全部仅涵盖图像)的承诺范围更广。然而,FLUX 3 Dev在发布序列中排在最后。习惯于在重大模型发布同时或之后不久获得可本地部署的FLUX变体的开发者将不得不等待。

这一延迟值得注意,因为BFL的开放权重发布一直是推动其采用的主要因素。可本地部署的FLUX模型已集成到ComfyUI和Hugging Face Diffusers工作流中,发布时缺少可下载的FLUX 3变体意味着该开发者生态系统尚无法在自己的硬件上测试新架构。

初步基准测试结果

BFL已发布了若干基准测试对比,全部标注为初步结果。完整结果和方法论承诺将在更广泛的正式发布阶段公布。

在对带音频的10秒、720p文生视频片段进行的早期正面偏好测试中,BFL报告FLUX 3优于:

  • Luma Ray 3.2,在93%的对比中胜出
  • Runway Gen-4.5,在77%的对比中胜出
  • Grok Imagine Video,在69%的对比中胜出
  • Kling v3 Pro,在60%的对比中胜出
  • Happy Horse v1,在59%的对比中胜出
  • Happy Horse 1.1,在57%的对比中胜出
  • Seedance 2.0,在52%的对比中胜出
  • Google的Gemini Omni Flash,在52%的对比中胜出

这些数据附带一个重要注意事项。承载结果的图表标注为"早期FLUX 3候选模型的初步评估",这意味着这些数字描述的是预发布检查点,而非现在进入抢先体验的模型。正式发布的模型可能表现更好或更差;目前发布的所有内容均未衡量客户实际将使用的模型。

FLUX 3取得最强结果的Luma Ray 3.2和Runway Gen-4.5是成熟产品,但并非当前在独立视频排名中领先的模型。以52%打平的Seedance 2.0是一款大多数西方企业目前无法获取的产品——在Netflix、Warner Bros.、Disney、Paramount和Sony因涉嫌系统性版权侵权发出法律威胁后,ByteDance无限期推迟了其国际推广,且该暂停状态至今仍然有效。

同样以52%打平的Gemini Omni Flash是更具影响力的对比。Omni代表了与FLUX 3多模态方法最接近的大型平台类比产品,且根据BFL自己的测量,两者在10秒文生视频质量上无法区分。Google的优势在于可用性:Omni可通过Gemini API访问,生成720p视频的价格为每秒0.10美元,10秒片段约1.00美元。然而,在欧洲经济区、瑞士和英国,Omni Flash用户无法编辑上传的视频——不过编辑模型自身生成的视频是被允许的。想要通过生成式编辑处理现有素材的欧洲企业目前无法在Omni Flash上实现。这一地理上的空白为总部位于德国的BFL提供了机会——如果FLUX 3发布时没有类似的区域限制,BFL有望利用这一优势。

企业级视频模型对比

模型最长单次生成时长最高分辨率关键限制每10秒片段价格(720p)每10秒片段价格(1080p)每10秒片段价格(4K)
FLUX 3 Video20秒未公布;评估在720p下进行抢先体验;无已公布的SLA或定价未公布未公布未公布
HappyHorse 1.115秒1080p无4K;封闭权重未公开(v1.0经销商费率约$1.82)未公开(v1.0经销商费率约$3.12)不适用
Veo 3.1按秒计费4K支持片段延展;预览版$4.00$4.00$6.00
Veo 3.1 Fast按秒计费4K预览版$1.00$1.20$3.00
Veo 3.1 Lite按秒计费1080p无4K,无片段延展;预览版$0.50$0.80不适用
Gemini Omni Flash10秒(最低3秒)720p,24 FPS预览版;欧洲无法编辑上传视频$1.00不适用不适用

统一架构:Self-Flow

FLUX 3建立在Self-Flow之上,这是BFL在2026年3月首次公开的、在单一架构内对齐多模态理解与生成的方法。该公司表示,其大幅扩展了计算资源和数据量,以同时跨视频、图像和音频进行训练,测试表明视频生成和动作预测不需要独立的基础——同一架构可以扩展到动作预测,而不会牺牲从视频中学到的能力。

"我们将视觉置于方法的中心,因为它是物理世界中信号最丰富的媒介。图像传达结构,图像和视频教授空间关系,视频教授动态变化,而动作揭示因果关系。但仅有视觉并不能呈现完整的图景,"BFL联合创始人兼首席执行官Robin Rombach在提供给VentureBeat的预发布声明中表示。"真正的智能意味着感知世界:预测它将如何变化、采取行动,并从结果中学习。在统一架构内的联合训练将带我们到达那里,因为每种训练模态都会增强其他模态。音频传达了视觉无法捕捉的时序、韵律和物理事件。语言传达了像素无法轻易表达的目标、抽象和指令。"

Rombach在公告的其他部分更直白地表达了这一观点:"你无法欺骗现实。一个只学习图像的模型只能生成图像。但世界不是由静止帧组成的。它运动、发出声音、变化和回应。"

BFL表示FLUX 3面向创意工具、媒体、设计、电子商务和物理AI,支持带同步音频的视频生成、精确的图像编辑、运动中的产品和材质一致性、多语言生成以及机器人动作预测。目前已有Canva、Burda、Magnific(前身为Freepik)、Krea和Picsart在测试该模型。

对于创意软件公司而言,其吸引力在于整合——单一基础模型即可支持分镜、图像编辑、产品渲染、视频变体和本地化,而无需在断开连接的模型之间反复转换资产。对于机器人团队而言,潜在价值在于数据效率:已经编码了运动、物体行为和物理变化的模型可能比从原始演示开始的系统需要更少的任务特定机器人训练。这种生成式媒体与机器人基础模型的融合反映了更广泛的行业趋势,包括Google DeepMind在内的多家公司和机器人初创企业已开始将大规模预训练模型应用于操控和移动任务。

FLUX 3 Video功能

视频层是此次发布中定义最为具体的部分。FLUX 3能够通过单个提示生成最长20秒的带原生音频的片段。每个视频输出都包含同步音频。作为比较,HappyHorse 1.0最长支持15秒1080p同步音频。BFL尚未说明其20秒片段的分辨率,且已发布的评估均在720p下进行。20秒单提示生成是迄今最长的之一,与OpenAI已停产的Sora模型相当。

已公布的功能列表包括:

  • 文生视频
  • 图生视频,从起始帧制作动画或使用图像作为视觉参考
  • 视频到视频生成,从参考片段中携带特定角色等元素进入新场景或语境
  • 从现有视频和音频输入生成式延续视频音频
  • 关键帧到视频生成,在定义时刻之间实现可控过渡
  • 多语言对话
  • 多种视觉风格和宽高比,从写实摄像机录像到动画和电影效果
  • 字体生成和动态设计
  • 智能体式链接,将单个片段组合为更长的多镜头序列

最后一项——智能体式链接——是企业视频团队应重点审视的功能。BFL声称这些组合功能可以生成持续数分钟的序列,并通过视觉参考在不同场景间保持角色一致性。如果这在生产条件下成立,将解决阻碍生成式视频进入大多数商业流程的制约因素:不是片段质量,而是镜头之间的连续性。

角色一致性方面的竞争十分激烈。HappyHorse 1.1的核心升级是R2V(Reference-to-Video),它接受多个角色参考图像,以在生成的素材中保持身份稳定。阿里巴巴声称实现了零漂移唇形同步,并专门针对标记商业AI视频为合成内容的瑕疵,包括面部油腻感和过度锐化。

BFL表示FLUX 3 Video在人类面部表情、将声音与物理事件关联以及多语言输出方面已经特别出色。在图像方面,训练中期进行的初步评估显示,在复杂提示处理和文本生成方面较早期FLUX版本有显著改善,包括多语言高精度文本。目前尚未发布任何图像基准测试或胜率数据。

FLUX-mimic:从视频模型到机器人模型

BFL正在通过FLUX-mimic应用其统一架构理念,这是一款基于FLUX 3构建的视频-动作模型,由瑞士公司Mimic Robotics协助开发,后者是最早获得抢先体验权限的合作伙伴之一。

技术博客描述了两条动作预测路径:通过扩大初始Self-Flow工作的规模,将原生动作预测直接集成到FLUX 3中;以及使用预训练的视频骨干网络作为具有动态感知能力的基础,从中用有限的特定任务数据微调专门的动作模型。FLUX-mimic采取第二种路径,将FLUX 3骨干网络与Mimic Robotics在灵巧操控方面的机器人学习和生产部署专长相结合。

FLUX-mimic专为通用机器人操控设计,帮助机器人理解视觉场景、预测动作后果,并以最少的特定任务数据适应新任务。BFL和Mimic Robotics表示,根据任务难度,该模型可以仅用30分钟的机器人数据微调以适应特定操控任务,而此前的方法需要30小时以上。

"机器人技术最难的部分是数据,"Mimic Robotics首席技术官Elvis Nava在提供给VentureBeat的声明中表示。"每个新任务通常意味着机器人要重复操作数小时。因为FLUX-mimic建立在已经理解物理世界运作方式的前沿视频模型之上,它可以在几分钟内而非几天内学会新任务。这样,我们就能超越当前机器人学习领域的最新水平。"

所需演示数据减少60倍——从30小时降至30分钟——瞄准的是应用机器人领域中最为持久的瓶颈之一,即每个新操控任务通常需要大量的物理数据采集,而这些数据无法跨任务或环境迁移。

世界模型主张

BFL认为,仅用图像训练的模型无法理解一个"运动、发声、变化和回应"的世界,而物理理解才是产生令人信服的生成素材的关键。Google对Gemini Omni提出了几乎相同的主张。其开发者文档引用了结合"对物理学的理解"与Gemini对历史、科学和文化背景掌握的"世界知识"。Google的营销更为直接:"大多数AI模型只是预测下一个像素来构建叙事或图像。Gemini Omni与众不同,"该公司将模型归功于"对重力、动能和流体力学等作用力的直观理解,从而产生遵循现实世界逻辑的更真实的运动。"

对企业买家而言,实际后果是世界模型语言并不构成差异化优势。三大领先视频系统中的两个现在都将物理理解作为其核心卖点进行推广,而两者均未发布衡量这一能力的基准测试。目前没有标准测试来验证生成的水是否表现得像水、掉落的物体是否以合理的速率下落,或者声音是否在撞击时同步到达。人类偏好评级间接地捕捉了其中一部分;其他现有方案完全无法捕捉。

开放权重与公司背景

BFL于2024年夏季正式成立,并在随后两年中凭借开源高质量AI图像模型赢得了行业声誉,这些模型受到开发者、创意人士和企业的广泛采用。该公司的创始人——Rombach、Andreas Blattmann和Patrick Esser——此前参与创建了VQGAN、latent diffusion和Stable Diffusion,后者是一项开源技术,为大众催生了广泛的AI生成能力,目前被许多AI图像生成器和公司使用。

这种影响力转化为了商业分发。FLUX模型现在为Adobe Photoshop、Picsart和Nous Research的Hermes Agent等平台中的生成功能提供支持。该公司引用电影导演Martin Scorsese作为专业用户之一。Wired杂志将Black Forest Labs描述为一家相对较小的公司,却成为了硅谷最大AI实验室的有力竞争者,FLUX模型在图像基准测试中排名接近榜首,并成为Hugging Face上下载量最高的文生图模型之一。BFL表示其目前在弗赖堡和旧金山运营着一支100人的团队。

FLUX.1 Dev、FLUX.1 Kontext Dev、FLUX.1 Fill Dev及相关控制模型——在公司成立后不久发布——为研究人员和创意工具开发者提供了可下载的检查点、本地推理以及与Hugging Face Diffusers和ComfyUI等框架的集成。例如,FLUX.1 Kontext Dev作为开放权重模型发布,供研究和非商业用途使用,在适用许可证下允许将生成输出用于商业目的。

该公司在2025年底继续了这一模式,发布了FLUX.2 Dev,一款320亿参数的开放权重模型,结合了生成和多参考编辑功能。BFL称其为发布时可用的最强开放权重图像生成和编辑模型,并发布了权重、参考推理代码以及针对消费级Nvidia GPU的优化实现。

FLUX 3 Dev提高了这一标准的门槛。以往的Dev版本都是图像模型。FLUX 3 Dev被描述为跨越视频、音频、图像和动作预测的多模态骨干网络——这意味着单一许可证将决定一家公司是否能在本地部署一个同时涉及内容生产和物理机械的模型。BFL尚未分享有关其许可证、参数量、量化或硬件需求的信息。该公司将开放权重定位为企业级功能而非社区馈赠,认为它们支持如机器人控制系统等应用的安全、低延迟本地部署,并允许团队将FLUX 3适配到自己的数据、产品和工作流程中。开放权重许可证是否允许商业机器人使用——在这一领域,物理安全和责任考量与图像生成不同——仍然是该公司尚未解决的悬而未决的问题。

资金支持

Black Forest Labs的估值为32.5亿美元,已从包括a16z、AMP、Salesforce Ventures、Nvidia、General Catalyst、Adobe Ventures、Figma Ventures、Canva和Deutsche Telekom的T.Capital在内的投资者处筹集了超过4.5亿美元。投资者名单涵盖资本提供者和商业合作伙伴——Adobe、Figma和Canva同时也是集成合作伙伴——这使得BFL的融资与FLUX 3创意和媒体能力的分发渠道保持一致。