НовостиМакроBlack Forest Labs выпустила мультимодальную модель FLUX 3 для прогнозирования изображений, видео, аудио и действий роботов

Black Forest Labs выпустила мультимодальную модель FLUX 3 для прогнозирования изображений, видео, аудио и действий роботов

Автор: MarkTechPost·

Ключевые выводы

  • FLUX 3 предназначена для обучения на изображениях, видео и аудио с использованием единой архитектуры с общими весами.
  • Модель основана на методе Self-Flow от BFL, а главным изменением компания называет увеличение масштаба вычислений и данных.
  • FLUX 3 Video поддерживает режимы text-to-video, image-to-video, video-to-video, keyframe-to-video и продолжение видео-аудио.
  • BFL сообщила предварительные результаты человеческих предпочтений, в которых FLUX 3 опередила несколько конкурирующих видеомоделей, хотя некоторые сравнения были близкими.
  • Доступ остается ограниченным: Video и Action находятся в раннем доступе, а открытые веса запланированы на более поздний этап.
Black Forest Labs выпустила мультимодальную модель FLUX 3 для прогнозирования изображений, видео, аудио и действий роботов

Black Forest Labs (BFL) выпустила FLUX 3 — мультимодальную фундаментальную модель, предназначенную для обучения на изображениях, видео и аудио в рамках единой архитектуры. Компания описывает ее как первую модель FLUX, которая обеспечивает прогнозирование видео, аудио и действий на основе одного общего набора весов.

Исследовательская команда BFL заявляет, что модель основана на представлении о том, что ни одна отдельная модальность не дает полного описания мира. Изображения фиксируют пространственную структуру в один конкретный момент, видео добавляет время и физическую динамику, а аудио может раскрывать причинно-следственные связи между механическими событиями и звуком. В трактовке BFL каждая модальность является сжатой с потерями проекцией одной и той же базовой реальности.

По словам BFL, одновременное обучение на этих модальностях заставляет источники данных взаимно ограничивать друг друга: звук должен соответствовать удару, а движение — согласовываться с массой. Исследовательская команда называет FLUX 3 своей первой моделью, полностью построенной вокруг этого принципа; архитектура с общими весами также делает релиз значимым не только для генерации медиа, поскольку BFL применяет тот же базовый механизм для прогнозирования действий роботов.

Self-Flow как базовый метод

FLUX 3 основана на Self-Flow, методе BFL для согласования мультимодальной генерации и понимания в одной архитектуре. Self-Flow объединяет цель flow matching с целью самоконтролируемой реконструкции признаков.

Эталонная реализация на GitHub выпущена под лицензией Apache-2.0 и использует SiT-XL/2 с пошаговым временным кондиционированием на уровне токенов. Обучение проводится с 25% долей маскирования на токен и использует самодистилляцию от EMA-учителя на слое 20 к студенту на слое 8.

Выпущенный чекпойнт представляет собой исследовательскую модель ImageNet 256×256, а не FLUX 3. BFL заявляет, что «значительно увеличила вычислительные и информационные ресурсы», используя тот же подход для одновременного обучения FLUX 3 на видео, изображениях и аудио. Self-Flow был представлен в March 2026, поэтому сам метод не является новым для этого релиза; новым элементом BFL называет масштаб.

Возможности FLUX 3 Video

FLUX 3 Video может генерировать клипы длительностью до 20 секунд за один проход генерации и включает встроенное аудио. Поддерживаемые режимы включают text-to-video, image-to-video, video-to-video на основе референсного клипа, keyframe-to-video для контролируемых переходов, а также генеративное продолжение видео и аудио на основе входных видео и аудио.

BFL также указывает среди возможностей системы многоязычные диалоги, агентное связывание клипов в многокадровые последовательности и развитую генерацию типографики с анимированным дизайном. Команда отмечает особую силу модели в генерации человеческой мимики и связывании звуков с физическими событиями — двух областях, где временная согласованность и синхронизация аудио с видео имеют ключевое значение для восприятия сгенерированных клипов пользователями.

По данным BFL, прогнозирование видео приходится более чем на 95% обучительных вычислений, тогда как аудио составляет менее 0.5% токенов. Компания также заявляет, что тот же базовый механизм лежит в основе FLUX-mimic — роботизированной политики, которая работает менее чем за 80 ms на одной RTX 5090.

Предварительные результаты производительности

BFL опубликовала предварительные результаты человеческих предпочтений с использованием 10-секундных text-to-video клипов в 720p с аудио. В этих сравнениях FLUX 3 предпочитали Luma Ray 3.2 в 93% случаев и Runway Gen-4.5 в 77%.

В сравнении с Grok Imagine Video BFL сообщила о доле предпочтений до 69%. Заявленные показатели составили 60% против Kling v3 Pro, 59% против Happy Horse v1 и 57% против Happy Horse 1.1. В сравнении с Seedance 2.0 и Gemini Omni Flash заявленный результат составил 52%, что источник описал как близкое к подбрасыванию монеты.

Доступ остается ограниченным. BFL сообщает, что Video и Action находятся в раннем доступе, доступ к Image последует позже, а открытые веса появятся последними. Такой поэтапный запуск означает, что внешняя оценка будет зависеть от того, когда станут доступны более широкий доступ, подробности модели и ее веса.

BFL опубликовала дополнительные материалы в анонсе FLUX 3, технической публикации FLUX 3 x mimic и статье Self-Flow.