Black Forest Labs представила FLUX 3: мультимодальную frontier-модель для изображений, видео, аудио и роботизированных действий
Ключевые выводы
- •FLUX 3 совместно обучена для предсказания изображений, видео, аудио и роботизированных действий в единой архитектуре с использованием метода Self-Flow от Black Forest Labs, а не путем объединения отдельных специализированных моделей.
- •FLUX 3 Video может генерировать клипы длительностью до 20 секунд с синхронизированным встроенным аудио по одному запросу, что соответствует длительности, ранее достигнутой прекращенной моделью Sora от OpenAI.
- •Предварительные бенчмарки предпочтений показывают, что FLUX 3 превосходит Luma Ray 3.2 и Runway Gen-4.5, но сравнивается с Google's Gemini Omni Flash на уровне 52% в оценках качества 10-секундного text-to-video.
- •Через партнерство FLUX-mimic с Mimic Robotics модель можно дообучать для новых задач роботизированной манипуляции всего на 30 минутах демонстрационных данных, что дает сокращение в 60x по сравнению с ранее требовавшимися 30-plus часами.
- •Black Forest Labs на момент запуска не раскрыла цены, обязательства по уровню обслуживания, методологию оценки или условия лицензирования открытых весов, из-за чего корпоративные покупатели не могут оценить совокупную стоимость владения.

Black Forest Labs (BFL), AI-лаборатория из Фрайбурга, Германия, представила FLUX 3 — мультимодальную frontier-модель, предназначенную для понимания и генерации изображений, комбинированных аудио/видеоклипов длительностью до 20 секунд по одному текстовому запросу, а также физических действий для робототехники. Компания описывает FLUX 3 как модель, совместно обученную по всем этим модальностям в рамках единой архитектуры, а не как набор отдельных моделей для изображений, видео и аудио, объединенных общим интерфейсом.
Это архитектурное различие занимает центральное место в позиционировании BFL. Компания хочет, чтобы предприятия рассматривали креативную генерацию, симуляцию, использование компьютера и робототехнику как взаимосвязанные применения того, что она называет «визуальным интеллектом», — моделей, которые, по словам BFL, «могут воспринимать, предсказывать и действовать в физических и цифровых средах». Запуск также стал первой публично доступной моделью BFL для генерации видео и напрямую выводит компанию, насчитывающую около 100 сотрудников, на конкуренцию с гораздо более крупными американскими платформами, включая Google's Gemini Omni, а также с группой специализированных видеостартапов, которые совокупно привлекли сотни миллионов долларов за последние два года.
Продуктовые линейки и доступность
FLUX 3 будет поставляться через четыре продуктовые линейки:
- FLUX 3 Video — с опциональной встроенной генерацией аудио
- FLUX 3 Image — запуск ожидается в ближайшие недели
- FLUX 3 Action — для физического AI и робототехники
- FLUX 3 Dev — предстоящий релиз с открытыми весами
FLUX 3 Video и FLUX 3 Action сейчас переходят в закрытую программу Early Access, на которую любой желающий может подать заявку, но BFL должна одобрить каждого заявителя. Публичного API-доступа через BFL или ее партнеров пока нет. Компания заявляет, что FLUX 3 Image будет запущена в ближайшие недели, после чего последует более широкая общая доступность.
Поэтапная стратегия релиза напоминает недавние подходы других американских frontier-лабораторий, включая Anthropic и OpenAI, хотя те ограничения объяснялись соображениями безопасности и запросами правительства. В случае BFL закрытый доступ, по-видимому, связан скорее с готовностью инфраструктуры и продолжающейся разработкой, чем с классификациями безопасности.
Что BFL не объявила
В запуске отсутствует несколько критически важных деталей. BFL не раскрыла цены, обязательства по уровню обслуживания в продакшене, методологию оценки, размеры выборок, число оценщиков или какие-либо бенчмарки моделей изображений. Поэтому корпоративные покупатели пока не могут рассчитать совокупную стоимость владения или независимо воспроизвести опубликованные компанией видеосравнения.
FLUX 3 также не запускается с загружаемыми весами или лицензией open source. BFL заявляет, что более быстрые версии и версии с открытыми весами появятся позднее в этом году. В ее техническом блоге FLUX 3 Dev описывается как «доступ с открытыми весами к мультимодальному backbone для создания контента (видео, аудио и изображения) и предсказания действий» — это более широкое обязательство, чем любой предыдущий релиз FLUX Dev, каждый из которых охватывал только изображения. Однако FLUX 3 Dev появляется последним в последовательности релизов. Разработчикам, привыкшим получать локально развертываемый вариант FLUX одновременно с крупным анонсом модели или вскоре после него, придется ждать.
Эта задержка заметна, поскольку релизы BFL с открытыми весами были одним из главных факторов внедрения. Локально развертываемые модели FLUX интегрированы в рабочие процессы ComfyUI и Hugging Face Diffusers, а отсутствие загружаемого варианта FLUX 3 на старте означает, что экосистема разработчиков пока не может протестировать новую архитектуру на собственном оборудовании.
Предварительные результаты бенчмарков
BFL опубликовала несколько сравнений в бенчмарках, все они обозначены как предварительные. Полные результаты и методология обещаны на этапе более широкой общей доступности.
В раннем прямом тестировании предпочтений на 10-секундных 720p text-to-video клипах с аудио BFL сообщает, что FLUX 3 предпочитали по сравнению с:
- Luma Ray 3.2 в 93% сравнений
- Runway Gen-4.5 в 77%
- Grok Imagine Video в 69%
- Kling v3 Pro в 60%
- Happy Horse v1 в 59%
- Happy Horse 1.1 в 57%
- Seedance 2.0 в 52%
- Google's Gemini Omni Flash в 52%
Эти цифры сопровождаются существенной оговоркой. Диаграмма с результатами помечена как «предварительная оценка раннего кандидата FLUX 3», то есть числа описывают предрелизную контрольную точку, а не модель, которая сейчас входит в ранний доступ. Финальная поставляемая модель может работать лучше или хуже; ничто из опубликованного сегодня не измеряет именно то, чем фактически будут пользоваться клиенты.
Luma Ray 3.2 и Runway Gen-4.5, против которых FLUX 3 показала самые сильные результаты, являются устоявшимися продуктами, но не моделями, которые сейчас лидируют в независимых видеорейтингах. Seedance 2.0, с которой результат составил 52%, — это продукт, который большинство западных предприятий сейчас не могут приобрести: ByteDance на неопределенный срок отложила международный запуск Seedance 2.0 после того, как Netflix, Warner Bros., Disney, Paramount и Sony направили юридические угрозы из-за предполагаемого систематического нарушения авторских прав, и эта приостановка остается в силе.
Gemini Omni Flash, также с 52%, является более значимым сравнением. Omni представляет собой ближайший крупноплатформенный аналог мультимодального подхода FLUX 3, и по собственным измерениям BFL две модели неотличимы по качеству 10-секундного text-to-video. Преимущество Google — доступность: Omni доступна через Gemini API по цене $0.10 за секунду сгенерированного 720p-видео, или примерно $1.00 за 10-секундный клип. Однако редактирование загруженного видео недоступно пользователям Omni Flash в Европейской экономической зоне, Швейцарии и Великобритании — хотя редактирование видео, сгенерированного самой моделью, разрешено. Европейское предприятие, желающее обработать существующие материалы с помощью генеративного редактирования, сейчас не может сделать это на Omni Flash. Этот географический пробел открывает возможность для BFL, штаб-квартира которой находится в Германии, если FLUX 3 будет поставляться без аналогичных региональных ограничений.
Сравнение корпоративных видеомоделей
| Модель | Максимальная длительность генерации | Максимальное разрешение | Ключевые ограничения | Цена за 10-секундный клип (720p) | Цена за 10-секундный клип (1080p) | Цена за 10-секундный клип (4K) |
|---|---|---|---|---|---|---|
| FLUX 3 Video | 20 seconds | Не указано; оценки проводились в 720p | Ранний доступ; нет опубликованных SLA или цен | Не объявлено | Не объявлено | Не объявлено |
| HappyHorse 1.1 | 15 seconds | 1080p | Нет 4K; закрытые веса | Не опубликовано (реселлерская ставка v1.0 ~$1.82) | Не опубликовано (реселлерская ставка v1.0 ~$3.12) | n/a |
| Veo 3.1 | Посекундная тарификация | 4K | Поддерживает продление клипа; preview | $4.00 | $4.00 | $6.00 |
| Veo 3.1 Fast | Посекундная тарификация | 4K | Preview | $1.00 | $1.20 | $3.00 |
| Veo 3.1 Lite | Посекундная тарификация | 1080p | Нет 4K, нет продления клипа; preview | $0.50 | $0.80 | n/a |
| Gemini Omni Flash | 10 seconds (минимум 3s) | 720p при 24 FPS | Preview; нет доступа в ЕС для редактирования загруженного видео | $1.00 | n/a | n/a |
Единая архитектура: Self-Flow
FLUX 3 построена на Self-Flow, методе BFL для согласования мультимодального понимания и генерации в рамках единой архитектуры, впервые представленном публично в March 2026. Компания заявляет, что существенно увеличила вычислительные мощности и объем данных для одновременного обучения на видео, изображениях и аудио, а тестирование показало, что генерация видео и предсказание действий не требуют отдельных основ: ту же архитектуру можно расширить до предсказания действий без потери того, что она усвоила из видео.
«Мы ставим зрение в центр нашего подхода, потому что это самый насыщенный сигналами носитель физического мира. Изображения передают структуру, изображения и видео обучают пространственным отношениям, видео обучает динамике, а действия раскрывают причинно-следственные связи. Но одного зрения недостаточно для полной картины», — сказал Robin Rombach, сооснователь и CEO BFL, в предрелизном заявлении, предоставленном VentureBeat. «Истинный интеллект означает восприятие мира: предсказание того, как он изменится, совершение действий и обучение на результатах. Совместное обучение в одной унифицированной архитектуре — это путь к этой цели, потому что каждая обучающая модальность усиливает другие. Аудио передает тайминг, просодию и физические события, ускользающие от зрения. Язык передает цели, абстракции и инструкции, которые пиксели не могут легко выразить».
В другом месте анонса Rombach сформулировал это резче: «Нельзя обмануть реальность. Модель, которая учится только на изображениях, может генерировать только изображения. Но мир не состоит из неподвижных кадров. Он движется, звучит, меняется и реагирует».
BFL заявляет, что FLUX 3 ориентирована на креативные инструменты, медиа, дизайн, e-commerce и физический AI, поддерживая генерацию видео с синхронизированным аудио, точное редактирование изображений, согласованность продуктов и материалов в движении, мультиязычную генерацию и предсказание роботизированных действий. Модель уже тестируют Canva, Burda, Magnific (formerly Freepik), Krea и Picsart.
Для компаний, разрабатывающих креативное ПО, привлекательность заключается в консолидации — единой foundation-модели, которая потенциально может поддерживать сторибординг, редактирование изображений, рендеринг продуктов, вариации видео и локализацию без постоянного переноса ассетов между разрозненными моделями. Для робототехнических команд потенциальная ценность связана с эффективностью данных: модели, которые уже кодируют движение, поведение объектов и физические изменения, могут требовать меньше специализированного обучения роботов, чем системы, начинающие с сырых демонстраций. Это сближение генеративных медиа и робототехнических foundation-моделей отражает более широкий отраслевой сдвиг, поскольку компании, включая Google DeepMind и несколько робототехнических стартапов, начали применять крупные предобученные модели к задачам манипуляции и локомоции.
Возможности FLUX 3 Video
Видеоуровень — наиболее конкретно описанная часть запуска. FLUX 3 генерирует клипы длительностью до 20 секунд со встроенным аудио по одному запросу. Каждый видеовывод включает синхронизированное аудио. Для сравнения, HappyHorse 1.0 ограничивается 15 секундами 1080p с синхронизированным аудио. BFL не указала, в каком разрешении работают ее 20-секундные клипы, а опубликованные оценки проводились в 720p. Генерация 20-секундного клипа по одному запросу относится к самым длинным достигнутым на данный момент и соответствует прекращенной модели Sora от OpenAI.
Опубликованный список возможностей включает:
- Генерацию text-to-video
- Генерацию image-to-video: анимацию из начального кадра или использование изображений как визуальных референсов
- Генерацию video-to-video из референсного клипа с переносом таких элементов, как конкретный персонаж, в новую сцену или контекст
- Генеративное продолжение видео-аудио на основе существующего видео- и аудиоввода
- Генерацию keyframe-to-video для контролируемых переходов между заданными моментами
- Мультиязычный диалог
- Широкий диапазон визуальных стилей и соотношений сторон — от съемки на бытовую камеру до анимации и кинематографичных роликов
- Генерацию типографики и анимированный дизайн
- Агентное связывание отдельных клипов в более длинные многокадровые последовательности
Последний пункт — агентное связывание — является возможностью, на которую корпоративным видеокомандам следует обратить особое внимание. BFL утверждает, что сочетание функций может создавать последовательности длительностью несколько минут, при этом визуальные референсы сохраняют согласованность персонажей между сценами. Если это подтвердится в производственных условиях, это решит ограничение, из-за которого генеративное видео не попадало в большинство коммерческих пайплайнов: не качество клипа, а непрерывность между кадрами.
Конкуренция в области согласованности персонажей высока. Главным обновлением HappyHorse 1.1 является R2V, или Reference-to-Video, которое принимает несколько референсных изображений персонажа, чтобы сохранять стабильность идентичности во всем сгенерированном материале. Alibaba заявляет о lip sync без дрейфа и специально нацеливается на артефакты, которые выдают коммерческое AI-видео как синтетическое, включая маслянистость лиц и чрезмерную резкость.
BFL заявляет, что FLUX 3 Video уже особенно сильна в человеческой мимике, связывании звуков с физическими событиями и мультиязычном выводе. Что касается изображений, предварительные оценки на этапе midtraining показывают значительное улучшение по сравнению с более ранними версиями FLUX в обработке сложных запросов и генерации текста, включая высокоточную генерацию текста на нескольких языках. Бенчмарки изображений или показатели побед опубликованы не были.
FLUX-mimic: от видеомоделей к роботизированным моделям
BFL применяет тезис о единой архитектуре через FLUX-mimic — видео-действующую модель, построенную на FLUX 3 и разработанную совместно со швейцарской компанией Mimic Robotics, одним из первых партнеров, получивших ранний доступ.
В техническом блоге описаны два пути к предсказанию действий: интеграция встроенного предсказания действий напрямую в FLUX 3 за счет масштабирования первоначальной работы Self-Flow и использование предобученного видеобэкбона как основы, осведомленной о динамике, на базе которой специализированные модели действий можно дообучать с ограниченным объемом данных по конкретной задаче. FLUX-mimic использует второй путь, объединяя backbone FLUX 3 с экспертизой Mimic Robotics в обучении роботов и производственном внедрении для ловкой манипуляции.
FLUX-mimic предназначена для роботизированной манипуляции общего назначения: она помогает роботам понимать визуальную сцену, предсказывать последствия действия и адаптироваться к новым задачам с минимальным объемом данных по конкретной задаче. BFL и Mimic Robotics заявляют, что модель можно дообучить для конкретной задачи манипуляции всего на 30 минутах данных робота, тогда как предыдущие подходы требовали 30 или более часов.
«Самая сложная часть робототехники — это данные», — сказал Elvis Nava, CTO Mimic Robotics, в заявлении, предоставленном VentureBeat. «Каждая новая задача обычно означает часы, в течение которых робот повторяет одно и то же. Поскольку FLUX-mimic построена поверх frontier-видеомоделей, которые уже понимают, как ведет себя физический мир, она осваивает новую задачу за минуты, а не за дни. Таким образом мы можем перепрыгнуть текущее состояние искусства в обучении роботов».
Сокращение требуемых демонстрационных данных в 60x — с 30 часов до 30 минут — нацелено на один из самых устойчивых узких мест в прикладной робототехнике, где каждая новая задача манипуляции обычно требует масштабного физического сбора данных, которые плохо переносятся между задачами или средами.
Заявление о world-model
BFL утверждает, что модель, обученная только на изображениях, не может понять мир, который «движется, звучит, меняется и реагирует», и что именно физическое понимание создает убедительные сгенерированные кадры. Google делает почти идентичное заявление о Gemini Omni. В ее документации для разработчиков упоминаются «знания о мире», объединяющие «понимание физики» с пониманием Gemini истории, науки и культурного контекста. Маркетинг Google формулирует это еще прямее: «Большинство AI-моделей просто предсказывают следующий пиксель, чтобы построить повествование или изображение. Gemini Omni отличается», — заявляет компания, приписывая модели «интуитивное понимание таких сил, как гравитация, кинетическая энергия и гидродинамика, для более реалистичных движений, следующих логике реального мира».
Практическое следствие для корпоративных покупателей заключается в том, что язык world-model не является дифференциатором. Две из трех ведущих видеосистем теперь продвигают физическое понимание как свое центральное преимущество, и ни одна из них не опубликовала бенчмарк, который это измеряет. Не существует стандартного теста на то, ведет ли себя сгенерированная вода как вода, падает ли брошенный объект с правдоподобной скоростью или появляется ли звук в момент удара. Оценки человеческих предпочтений косвенно улавливают часть этого; больше ничего из доступного это не измеряет.
Открытые веса и история компании
BFL официально запустилась летом 2024 года и построила репутацию на открытии исходного доступа к высококачественным AI-моделям изображений, широко принятым разработчиками, креаторами и предприятиями. Основатели компании — Rombach, Andreas Blattmann и Patrick Esser — ранее помогали создавать VQGAN, latent diffusion и Stable Diffusion, open source-технологию, которая дала массовый импульс широким возможностям AI-генерации для потребителей и сейчас используется многими генераторами AI-изображений и компаниями.
Этот охват перешел в коммерческую дистрибуцию. Модели FLUX теперь обеспечивают генеративные функции внутри Adobe Photoshop, Picsart и Nous Research's Hermes Agent, а также на других платформах. Компания называет кинорежиссера Martin Scorsese среди профессиональных пользователей. Журнал Wired описал Black Forest Labs как сравнительно небольшую компанию, которая стала ведущим конкурентом крупнейших AI-лабораторий Кремниевой долины: модели FLUX находятся в верхней части бенчмарков изображений и стали одними из самых скачиваемых text-to-image моделей на Hugging Face. BFL заявляет, что сейчас у нее команда из 100 человек во Фрайбурге и Сан-Франциско.
FLUX.1 Dev, FLUX.1 Kontext Dev, FLUX.1 Fill Dev и связанные control-модели — выпущенные вскоре после запуска компании — дали исследователям и разработчикам креативных инструментов доступ к загружаемым checkpoint, локальному инференсу и интеграциям с фреймворками, включая Hugging Face Diffusers и ComfyUI. FLUX.1 Kontext Dev, например, была выпущена как модель с открытыми весами для исследовательского и некоммерческого использования, при этом сгенерированные результаты разрешалось применять в коммерческих целях в рамках соответствующей лицензии.
Компания продолжила этот подход с FLUX.2 Dev в конце 2025 года — моделью с 32 миллиардами параметров и открытыми весами, объединяющей генерацию и multi-reference редактирование. BFL назвала ее самой сильной моделью генерации и редактирования изображений с открытыми весами на момент запуска и выпустила веса, референсный код инференса и оптимизированные реализации для потребительских Nvidia GPU.
FLUX 3 Dev повышает ставки. Предыдущие Dev-релизы были моделями изображений. FLUX 3 Dev описывается как мультимодальный backbone, охватывающий видео, аудио, изображения и предсказание действий, — это означает, что единая лицензия будет определять, может ли компания локально развернуть модель, затрагивающую как производство контента, так и физическое оборудование. BFL пока не поделилась информацией о лицензии, количестве параметров, квантизациях или требованиях к оборудованию. Компания представляет открытые веса как корпоративную функцию, а не жест в сторону сообщества, утверждая, что они обеспечивают безопасное локальное развертывание с низкой задержкой для приложений вроде систем роботизированного управления и позволяют командам адаптировать FLUX 3 к собственным данным, продуктам и рабочим процессам. Разрешит ли лицензия с открытыми весами коммерческое использование в робототехнике, где вопросы физической безопасности и ответственности отличаются от генерации изображений, остается открытым вопросом, на который компания пока не ответила.
Финансирование
Black Forest Labs оценивается в $3.25 billion и привлекла более $450 million от инвесторов, включая a16z, AMP, Salesforce Ventures, Nvidia, General Catalyst, Adobe Ventures, Figma Ventures, Canva и Deutsche Telekom's T.Capital. Список инвесторов охватывает как поставщиков капитала, так и коммерческих партнеров — Adobe, Figma и Canva также являются интеграционными партнерами, — что связывает финансирование BFL с каналами распространения креативных и медийных возможностей FLUX 3.