Black Forest Labs выпускает Flux 3 для генерации видео со встроенным звуком продолжительностью до 20 секунд
Ключевые выводы
- •Flux 3 — это мультимодальная базовая модель от Black Forest Labs, которая одновременно обучается на изображениях, видео и аудио и может генерировать видеоролики продолжительностью до 20 секунд со встроенным синхронизированным звуком.
- •В ходе предварительных внутренних оценок BFL с использованием 10-секундных роликов в разрешении 720p Flux 3 предпочитали вместо Luma Ray 3.2 в 93 процентах случаев и вместо Runway Gen-4.5 в 77 процентах, однако отрыв сократился до 52 процентов в сравнении с более сильными конкурентами, такими как Seedance 2.0 и Gemini Omni Flash.
- •BFL сотрудничала с Mimic Robotics для разработки Flux-mimic — видео-модели действий для применения в робототехнике, которая уже проходит испытания на производственных задачах в Audi.
- •Модель построена на подходе BFL под названием Self-Flow, который использует мультимодальный трансформер для преобразования изображений, видео и аудио в общее внутреннее представление для задач как генерации, так и понимания.
- •BFL выпускает Flux 3 поэтапно: Flux 3 Video уже доступен, выпуск Flux 3 Image запланирован на ближайшие недели, а предоставление открытого доступа к базовой архитектуре запланировано под названием Flux 3 Dev.

Немецкая ИИ-компания Black Forest Labs (BFL) выпустила Flux 3 — мультимодальную базовую модель, предназначенную для одновременного обучения на изображениях, видео и аудио. Компания заявляет, что модель способна генерировать видеоролики продолжительностью до 20 секунд со встроенным звуком, и что ранние внутренние оценки показали ее превосходство над несколькими конкурирующими системами генерации видео.
BFL, основанная исследователями, которые ранее разработали модели Stable Diffusion в Stability AI, изначально заработала репутацию на серии Flux моделей генерации изображений с открытыми весами (open-weight). Flux 3 ознаменовал расширение деятельности компании от генерации изображений до полноценного мультимодального видео и аудио — областей, где конкуренты, включая Runway, Luma Labs, Google и OpenAI, соревнуются за лидерство.
BFL описывает Flux 3 как шаг на пути к «визуальному интеллекту реального мира» (real-world visual intelligence), что компания определяет как модели, способные «воспринимать, прогнозировать и действовать в физических и цифровых средах». Компания представляет этот релиз как часть более широкой отраслевой инициативы по созданию так называемых мировых моделей (world models) — подхода, которого придерживаются несколько крупных ИИ-лабораторий, стремящихся создать системы, понимающие физическую динамику, а не просто сопоставляющие пиксели.
По словам BFL, ни одна модальность не может полностью отразить реальность. Изображения дают пространственную структуру, видео показывает, как эта структура меняется с течением времени, а аудио может выявить взаимосвязь между физическими или механическими событиями и производимыми ими звуками. Компания утверждает, что совместное обучение на изображениях, видео и аудио позволяет модальностям заполнять пробелы друг друга, предоставляя модели больше информации, чем отдельное обучение на каждом типе данных.
Flux 3 добавляет встроенный звук в генерируемые видео
Flux 3 внедряет генерацию встроенного звука для видео моделей BFL с роликами продолжительностью до 20 секунд. Синхронизированное аудио оставалось слабым местом для многих систем генерации видео, которые часто создают немые ролики или полагаются на отдельные аудиомодели. Модель поддерживает text-to-video, image-to-video, video-to-video, переходы на основе ключевых кадров, многоязычные диалоги и соединения между клипами, управляемые агентами, для создания более длинных многосценных последовательностей. BFL отмечает, что Flux 3 особенно хорошо справляется с мимикой человека и сопоставлением звука с физическими событиями.
В ходе ранних оценок с использованием 10-секундных роликов в разрешении 720p BFL сообщила, что Flux 3 предпочитали вместо Luma Ray 3.2 в 93 процентах случаев, вместо Runway Gen-4.5 — в 77 процентах, а вместо Grok Imagine Video — в 69 процентах.
Заявленные отрывы были меньше по сравнению с более сильными конкурирующими системами. BFL отметила, что Flux 3 предпочитали вместо Kling v3 Pro в 60 процентах случаев, вместо Happy Horse v1 — в 59 процентах, вместо Happy Horse 1.1 — в 57 процентах, а вместо Seedance 2.0 и Gemini Omni Flash — в 52 процентах случаев для каждой.
BFL отмечает, что эти результаты являются предварительными, и независимых тестов в настоящее время не существует. Если модель покажет результаты, сопоставимые с ведущими системами, такими как Seedance, которая уже добралась до Голливуда, и Gemini Omni Flash, Flux 3 займет место среди лучших видео моделей.
Компания также ожидает, что Flux 3 улучшит генерацию изображений, особенно для сложных запросов и точного рендеринга текста на нескольких языках. BFL планирует выпустить Flux 3 Image в раннем доступе в ближайшие несколько недель.
Flux-mimic нацелен на применение в робототехнике
BFL заявляет, что Flux 3 также может прогнозировать действия на основе своего понимания мира. Совместно с Mimic Robotics компания разработала Flux-mimic — видео-модель действий для робототехники, которая уже проходит испытания на производственных задачах в Audi. Эта работа отражает более широкую отраслевую тенденцию по применению видео и мировых моделей в embodied AI (воплощенном ИИ), где такие компании, как Google и Tesla, уже исследовали подобные подходы для управления роботами и автономными системами.
Flux 3 основан на Self-Flow — подходе BFL для обучения одной модели одновременно генерировать и понимать контент. Система использует мультимодальный трансформер со специализированными компонентами, которые преобразуют изображения, видео и аудио в общее внутреннее представление, а затем превращают это представление обратно в выходные данные.
Дополнительный компонент действий обеспечивает основу для применения в робототехнике. BFL утверждает, что этот единый процесс обучения работает лучше, чем ранее стандартный метод flow-matching, как по качеству генерации, так и по пониманию физического мира моделью.
BFL планирует поэтапное внедрение и предоставление открытых весов
BFL выпускает возможности Flux 3 поэтапно, с периодами раннего доступа, предназначенными для сбора отзывов и обеспечения тестирования безопасности. Flux 3 Video уже доступен, а выпуск Flux 3 Image запланирован на ближайшие недели. Прогнозирование действий изначально будет доступно через отдельных партнеров.
Компания также планирует предоставить открытый доступ к весам мультимодальной базовой архитектуры под названием "Flux 3 Dev". Выпуск моделей с открытыми весами был отличительной чертой стратегии BFL, что согласуется с ее более ранними моделями Flux для генерации изображений, которые были широко приняты разработчиками и исследователями. В долгосрочной перспективе BFL заявляет, что работает над моделями следующего поколения, предназначенными для объединения восприятия, действий и прогнозирования языка в одной модели.