НовостиАкцииBlack Forest Labs запускает FLUX 3: первая видеомодель компании будет использоваться в робототехнике в партнерстве с Audi

Black Forest Labs запускает FLUX 3: первая видеомодель компании будет использоваться в робототехнике в партнерстве с Audi

Автор: Decrypt·

Ключевые выводы

  • FLUX 3 — первая модель Black Forest Labs, способная генерировать видеоролики длиной до 20 секунд с синхронизированным звуком, включая диалоги, звуковые эффекты и фоновый шум.
  • В тестировании предпочтений рецензенты выбирали FLUX 3 чаще, чем Runway Gen-4.5, в 77% сравнений и чаще, чем Luma Ray 3.2, в 93% сравнений, однако оценки не включали OpenAI Sora или Google Veo.
  • Та же мультимодальная архитектура, лежащая в основе FLUX 3, используется в FLUX-mimic — робототехнической модели, совместно разработанной с mimic robotics, которую Audi тестирует на производственной линии для задач вроде установки гибких дверных уплотнителей.
  • FLUX-mimic достигает времени отклика системы примерно 101 миллисекунда, что BFL описывает как сопоставимое с человеческими зрительными рефлексами.
  • Версия FLUX 3 Dev с открытыми весами, единственный уровень, запланированный для локального развертывания, ожидается не ранее второй половины 2026 года, тогда как возможности видео и действий сейчас ограничены доступом через API и избранных партнеров.
Black Forest Labs запускает FLUX 3: первая видеомодель компании будет использоваться в робототехнике в партнерстве с Audi

Black Forest Labs выпустила FLUX 3 в раннем доступе, представив первую модель компании, способную генерировать видео, а не только статичные изображения. Новая система создает ролики длиной до 20 секунд с синхронизированным звуком и построена на мультимодальной архитектуре, совместно обученной на изображениях, видео и звуке. Запуск выводит BFL в одну из самых конкурентных категорий ИИ, где OpenAI Sora, Google Veo, Runway и Luma соперничают за создание коммерчески пригодного ИИ-видео.

Та же базовая технология также используется в FLUX-mimic — робототехнической модели, разработанной в сотрудничестве с базирующейся в Цюрихе mimic robotics, которую немецкий автопроизводитель Audi уже тестирует на своей производственной линии. Версия "Dev" с открытыми весами — единственный уровень, запланированный для локального развертывания, — ожидается не ранее второй половины 2026 года. Возможности Video и Action пока доступны только через API и избранным партнерам, а генерация изображений, по данным BFL, должна появиться "в ближайшие недели".

Видеофункциональность FLUX 3 является ее ключевой особенностью. Модель генерирует ролики со звуком, синхронизированным с событиями на экране, включая диалоги, звуковые эффекты и фоновый шум. В ранних прямых сравнениях рецензенты отдавали предпочтение результатам FLUX 3 по сравнению с Runway Gen-4.5 в 77% случаев и по сравнению с Luma Ray 3.2 — в 93% случаев. Модель также немного опередила Gemini Omni и Seedance, победив в 52% таких оценок. BFL отмечает, что эти результаты отражают тестирование предпочтений, а не фиксированную систему баллов: оценщики смотрят пары роликов и выбирают более убедительный, после чего BFL подсчитывает, как часто побеждает FLUX 3. Примечательно, что в оценках не было прямых сравнений с OpenAI Sora или Google Veo, поэтому положение FLUX 3 относительно этих заметных систем в представленных BFL результатах осталось непроверенным.

Модель также сохраняет сильные возможности генерации статичных изображений, соответствующие наследию линейки FLUX. BFL показала примеры изображений, демонстрирующие универсальность в широком диапазоне стилей за пределами фотореализма.

BFL позиционирует FLUX 3 как нечто большее, чем инструмент для создания креативного контента. "A model that only learns images can only generate images," — сказал соучредитель и CEO Robin Rombach. Согласно тезису компании, обучение предсказанию видео предполагает изучение базовой физики — веса, контакта, тайминга, — то есть именно того, что машине необходимо для навигации в физическом мире. Идея использования крупномасштабных генеративных моделей в качестве основы для управления роботами вызывает растущий интерес в сферах ИИ и робототехники; связанные подходы изучают, в частности, Google DeepMind и Tesla.

На этом тезисе основана FLUX-mimic. Система, разработанная совместно с mimic robotics, добавляет к движку предсказания видео FLUX 3 легкий "декодер", который переводит внутреннее понимание движения моделью в реальные действия робота. Audi уже тестирует систему на задачах вроде установки гибких дверных уплотнителей — работе, с которой традиционная автоматизация исторически справлялась с трудом, поскольку деформируемые материалы ведут себя непредсказуемо и плохо поддаются жесткому программированию, на которое опираются классические роботы.

"Audi represents the kind of manufacturing partner we built FLUX-mimic for," — сказал соучредитель mimic Stephan-Daniel Gravert. Christoph Schneider из Audi заявил, что теперь роботы "solve complex soft-body manipulation work", с которой более ранние машины не могли справиться. BFL сообщает, что полная система реагирует примерно за 101 миллисекунду, что сопоставимо с человеческими зрительными рефлексами.

FLUX 3 выходит как новая попытка BFL вернуть динамику. Основанная в августе 2024 года исследователями, участвовавшими в создании оригинальных моделей Stable Diffusion в Stability AI, Black Forest Labs быстро сделала линейку FLUX заметной силой. Ее открытые модели Flux Dev и Schnell получили признание как лучшие генераторы изображений с открытым исходным кодом, превзойдя MidJourney и опередив собственную Stable Diffusion 3 от Stability AI, не оправдавшую ожиданий. Позднее FLUX 1.1 Pro заняла первое место в арене изображений Artificial Analysis в октябре, хотя эта версия не была открытой.

BFL выпустила FLUX.2 в ноябре 2025 года, но она не смогла добиться такой же популярности. Статус лидера среди открытых моделей, удерживаемый оригинальными моделями Flux, сохранялся до конца 2025 года, когда Alibaba Z-Image Turbo сравнялась с ними по качеству на потребительских видеокартах нижнего сегмента. "This is what SD3 was supposed to be," — прокомментировал тогда пользователь CivitAI.

FLUX 3 означает возвращение BFL к прежней форме, хотя модель пока не является полностью открытой. Возможности Video и Action уже доступны в раннем доступе через API и избранным партнерам, включая mimic robotics. Генерация изображений появится в ближайшие недели. Версия Dev с открытыми весами ожидается позднее в 2026 году.