NoticiasMacroBlack Forest Labs lanza FLUX 3, un modelo multimodal para predicción de imágenes, video, audio y acciones robóticas

Black Forest Labs lanza FLUX 3, un modelo multimodal para predicción de imágenes, video, audio y acciones robóticas

Autor: MarkTechPost·

Puntos clave

  • FLUX 3 está diseñado para aprender de imágenes, video y audio mediante una arquitectura única de pesos compartidos.
  • El modelo se basa en el método Self-Flow de BFL, con el principal cambio identificado por la compañía como un aumento en la escala de cómputo y datos.
  • FLUX 3 Video admite modos de texto a video, imagen a video, video a video, fotograma clave a video y continuación de video-audio.
  • BFL reportó resultados preliminares de preferencia humana que muestran a FLUX 3 por delante de varios modelos de video competidores, aunque algunas comparaciones fueron estrechas.
  • El acceso sigue restringido, con Video y Action en acceso anticipado y pesos abiertos previstos para una etapa posterior.
Black Forest Labs lanza FLUX 3, un modelo multimodal para predicción de imágenes, video, audio y acciones robóticas

Black Forest Labs (BFL) lanzó FLUX 3, un modelo fundacional multimodal diseñado para aprender de imágenes, video y audio dentro de una sola arquitectura. La compañía lo describe como el primer modelo FLUX en ofrecer predicción de video, audio y acciones a partir de un conjunto compartido de pesos.

El equipo de investigación de BFL afirma que el modelo se basa en la idea de que ninguna modalidad por sí sola ofrece una descripción completa del mundo. Las imágenes capturan la estructura espacial en un momento específico, el video agrega tiempo y dinámica física, y el audio puede revelar relaciones causales entre eventos mecánicos y sonido. Según el enfoque de BFL, cada modalidad es una proyección con pérdida de la misma realidad subyacente.

Al entrenar estas modalidades al mismo tiempo, BFL señala que las fuentes de datos se restringen entre sí: el sonido debe corresponder al impacto y el movimiento debe ser consistente con la masa. El equipo de investigación llama a FLUX 3 su primer modelo construido completamente en torno a ese principio, y el diseño de pesos compartidos también hace que el lanzamiento sea relevante más allá de la generación de medios, porque BFL está aplicando la misma columna vertebral a la predicción de acciones robóticas.

Self-Flow como método subyacente

FLUX 3 se basa en Self-Flow, el método de BFL para alinear la generación y la comprensión multimodal en una sola arquitectura. Self-Flow combina un objetivo de flow matching con un objetivo de reconstrucción de características autosupervisado.

La implementación de referencia en GitHub se publica bajo Apache-2.0 y utiliza SiT-XL/2 con condicionamiento temporal por token. Se entrena con una proporción de máscara por token del 25% y usa autodestilación desde un maestro EMA en la capa 20 hacia un estudiante en la capa 8.

Ese checkpoint publicado es un modelo de investigación ImageNet 256×256, no FLUX 3. BFL afirma que “aumentó significativamente los recursos de cómputo y datos” usando el mismo enfoque para entrenar FLUX 3 simultáneamente con video, imágenes y audio. Self-Flow fue presentado en marzo de 2026, por lo que el método en sí no es nuevo en este lanzamiento; BFL identifica la escala como el elemento nuevo.

Capacidades de FLUX 3 Video

FLUX 3 Video puede generar clips de hasta 20 segundos en una sola generación e incluye audio nativo. Los modos admitidos incluyen texto a video, imagen a video, video a video a partir de un clip de referencia, fotograma clave a video para transiciones controladas y continuación generativa de video-audio a partir de video y audio de entrada.

BFL también enumera entre las capacidades del sistema el diálogo multilingüe, el encadenamiento agéntico de clips en secuencias de múltiples tomas y una sólida generación tipográfica con diseños animados. El equipo reporta una fortaleza particular en la generación de expresiones faciales humanas y en la asociación de sonidos con eventos físicos, dos áreas en las que la consistencia temporal y la alineación audio-video son centrales para la percepción de los usuarios sobre los clips generados.

Según BFL, la predicción de video representa más del 95% del cómputo de entrenamiento, mientras que el audio representa menos del 0.5% de los tokens. La compañía también afirma que la misma columna vertebral impulsa FLUX-mimic, una política robótica que se ejecuta en menos de 80 ms en una RTX 5090.

Resultados preliminares de rendimiento

BFL publicó resultados preliminares de preferencia humana utilizando clips de texto a video de 10 segundos a 720p con audio. En esas comparaciones, FLUX 3 fue preferido frente a Luma Ray 3.2 en el 93% de los casos y frente a Runway Gen-4.5 en el 77%.

Frente a Grok Imagine Video, BFL reportó una tasa de preferencia de hasta el 69%. Las cifras informadas fueron del 60% frente a Kling v3 Pro, 59% frente a Happy Horse v1 y 57% frente a Happy Horse 1.1. Frente a Seedance 2.0 y Gemini Omni Flash, el resultado reportado fue del 52%, que la fuente describió como cercano a un lanzamiento de moneda.

El acceso sigue siendo restringido. BFL afirma que Video y Action están en acceso anticipado, que el acceso a Image llegará después y que los pesos abiertos serán lo último. Ese despliegue por etapas significa que la evaluación externa dependerá de cuándo estén disponibles un acceso más amplio, los detalles del modelo y los pesos.

BFL publicó materiales adicionales mediante el anuncio de FLUX 3, la publicación técnica de FLUX 3 x mimic y el artículo de Self-Flow.