新闻股票Black Forest Labs 发布 FLUX 3:首个视频模型通过与奥迪合作驱动机器人技术

Black Forest Labs 发布 FLUX 3:首个视频模型通过与奥迪合作驱动机器人技术

作者: Decrypt·

要点速览

  • FLUX 3 是 Black Forest Labs 首个能够生成最长 20 秒视频片段的模型,带有同步音频,包括对话、音效和环境噪声。
  • 在偏好测试中,人工评审员在 77% 的对比中更青睐 FLUX 3 而非 Runway Gen-4.5,在 93% 的对比中更青睐 FLUX 3 而非 Luma Ray 3.2,但评估未包括 OpenAI 的 Sora 或 Google 的 Veo。
  • FLUX 3 底层的多模态架构同样驱动了 FLUX-mimic,这是一个由 mimic robotics 联合开发的机器人模型,奥迪正在其生产线上测试用于安装柔性车门密封条等任务。
  • FLUX-mimic 的系统响应时间约为 101 毫秒,BFL 称其可与人类视觉反射速度相媲美。
  • FLUX 3 的开放权重 Dev 版本是唯一计划用于本地部署的版本,预计要到 2026 年晚些时候才会推出,而视频和动作功能目前仅限于 API 和特定合作伙伴访问。
Black Forest Labs 发布 FLUX 3:首个视频模型通过与奥迪合作驱动机器人技术

Black Forest Labs 已推出 FLUX 3 抢先体验版,标志着该公司首个能够生成视频而非仅生成静态图像的模型。新系统可制作最长 20 秒、带有同步音频的片段,基于在图像、视频和声音上联合训练的多模态架构。此次发布使 BFL 进入 AI 领域最具竞争力的赛道之一,OpenAI 的 Sora、Google 的 Veo、Runway 和 Luma 都在竞相生产可商业化的 AI 生成视频。

同样的底层技术还驱动了 FLUX-mimic,这是一个与总部位于苏黎世的 mimic robotics 合作开发的机器人模型,德国汽车制造商奥迪已在其生产线上进行测试。开放权重的 "Dev" 版本——唯一计划用于本地部署的版本——预计要到 2026 年晚些时候才会推出。视频和动作功能目前仅通过 API 和特定合作伙伴访问提供,图像生成功能预计将在"未来几周内"跟进,据 BFL 表示。

FLUX 3 的视频功能是其旗舰特性。该模型生成的片段配有与屏幕事件同步的音频,包括对话、音效和环境噪声。在早期正面交锋评估中,人工评审员在 77% 的对比中更偏好 FLUX 3 的输出而非 Runway Gen-4.5,在 93% 的对比中更偏好 FLUX 3 而非 Luma Ray 3.2。该模型还略微胜过 Gemini Omni 和 Seedance,在 52% 的评估中获胜。BFL 指出,这些结果反映的是偏好测试而非固定评分标准——评审员观看配对片段并选择更有说服力的一方,BFL 统计 FLUX 3 获胜的频率。值得注意的是,评估中并未包括与 OpenAI 的 Sora 或 Google 的 Veo 的直接对比,这意味着在 BFL 公布的结果中,FLUX 3 与这些知名系统的相对地位尚未得到检验。

该模型还保持了与 FLUX 系列传统一致的出色静态图像能力。BFL 分享了示例图像,展示了超越照片写实主义的广泛风格多样性。

BFL 将 FLUX 3 定位为不仅仅是创意内容工具。"一个只学习图像的模型只能生成图像,"联合创始人兼首席执行官 Robin Rombach 表示。该公司的核心理念是,学习预测视频意味着学习其背后的物理学——重量、接触、时机——而这正是一台机器在物理世界中运动所需要的。将大规模生成模型用作机器人控制基础的想法,在 AI 和机器人领域引起了越来越多的关注,包括 Google DeepMind 和 Tesla 在内的公司都在探索相关方法。

这一理念支撑着 FLUX-mimic。该系统由 mimic robotics 开发,在 FLUX 3 的视频预测引擎上添加了一个轻量级"解码器",将模型对运动的内部理解转化为实际的机器人动作。奥迪已经在测试该系统执行诸如安装柔性车门密封条等任务——这类工作传统自动化一直难以应对,因为可变形材料的行为不可预测,难以适应传统机器人所依赖的刚性编程。

"奥迪代表了我们为 FLUX-mimic 打造的那类制造合作伙伴,"mimic robotics 联合创始人 Stephan-Daniel Gravert 表示。奥迪的 Christoph Schneider 表示,这些机器人现在能够"解决复杂的软体操作工作",这是早期机器无法处理的。BFL 报告称,整个系统的响应时间约为 101 毫秒,可与人类视觉反射速度相媲美。

FLUX 3 的推出是 BFL 重新夺回势头的最新尝试。公司于 2024 年 8 月由曾参与在 Stability AI 构建原始 Stable Diffusion 模型的研究人员创立,Black Forest Labs 迅速将 FLUX 系列确立为主导力量。其开源的 Flux Dev 和 Schnell 模型获得了最佳开源图像生成器的认可,超越了 MidJourney 并击败了 Stability AI 自家的 Stable Diffusion 3。FLUX 1.1 Pro 随后在 10 月份登顶 Artificial Analysis 图像竞技场,不过该版本并非开源。

BFL 于 2025 年 11 月发布了 FLUX.2,但未能获得同等的人气。原始 Flux 模型持有的开源桂冠一直保持到 2025 年底,直到阿里巴巴的 Z-Image Turbo 在低端消费级显卡上匹配了其质量。"这才是 SD3 本应有的样子,"一位 CivitAI 用户当时评论道。

FLUX 3 代表着 BFL 的回归,但目前尚未完全开放。视频和动作功能现已通过 API 和特定合作伙伴(包括 mimic robotics)在抢先体验中提供。图像生成功能将在未来几周内跟进。开放权重的 Dev 版本预计将于 2026 年晚些时候发布。