NoticiasAccionesBlack Forest Labs lanza FLUX 3: su primer modelo de video que impulsa la robótica con una alianza con Audi

Black Forest Labs lanza FLUX 3: su primer modelo de video que impulsa la robótica con una alianza con Audi

Autor: Decrypt·

Puntos clave

  • FLUX 3 es el primer modelo de Black Forest Labs capaz de generar clips de video de hasta 20 segundos de duración con audio sincronizado, incluyendo diálogos, efectos de sonido y ruido ambiental.
  • En pruebas de preferencia, los revisores humanos favorecieron FLUX 3 sobre Runway Gen-4.5 en el 77% de las comparaciones y sobre Luma Ray 3.2 en el 93% de las comparaciones, pero las evaluaciones no incluyeron a Sora de OpenAI ni a Veo de Google.
  • La misma arquitectura multimodal subyacente de FLUX 3 impulsa FLUX-mimic, un modelo de robótica desarrollado en conjunto con mimic robotics que Audi está probando en su línea de producción para tareas como la instalación de sellos flexibles de puertas.
  • FLUX-mimic logra un tiempo de respuesta del sistema de aproximadamente 101 milisegundos, que BFL describe como comparable a los reflejos visuales humanos.
  • La versión Dev de pesos abiertos de FLUX 3, el único nivel previsto para implementación local, no se espera hasta más adelante en 2026, mientras que las capacidades de video y acción están actualmente limitadas a acceso por API y socios seleccionados.
Black Forest Labs lanza FLUX 3: su primer modelo de video que impulsa la robótica con una alianza con Audi

Black Forest Labs ha lanzado FLUX 3 en acceso anticipado, marcando el primer modelo de la empresa capaz de generar video en lugar de únicamente imágenes fijas. El nuevo sistema produce clips de hasta 20 segundos de duración con audio sincronizado y está construido sobre una arquitectura multimodal entrenada conjuntamente con imágenes, video y sonido. El lanzamiento sitúa a BFL en una de las categorías más competitivas de la IA, donde Sora de OpenAI, Veo de Google, Runway y Luma compiten por producir video generado por IA comercialmente viable.

La misma tecnología subyacente también impulsa FLUX-mimic, un modelo de robótica desarrollado en colaboración con mimic robotics, con sede en Zúrich, que el fabricante de automóviles alemán Audi ya está probando en su línea de producción. La versión "Dev" de pesos abiertos —el único nivel previsto para implementación local— no se espera hasta más adelante en 2026. Las capacidades de Video y Action permanecen disponibles exclusivamente a través de APIs y acceso de socios seleccionados, con la generación de imágenes prevista para "en las próximas semanas", según BFL.

La funcionalidad de video de FLUX 3 representa su característica principal. El modelo genera clips con audio sincronizado con los eventos en pantalla, incluyendo diálogos, efectos de sonido y ruido ambiental. En evaluaciones tempranas de comparación directa, los revisores humanos expresaron una preferencia por el resultado de FLUX 3 sobre Runway Gen-4.5 en el 77% de las comparaciones y sobre Luma Ray 3.2 en el 93% de las comparaciones. El modelo también superó ligeramente a Gemini Omni y Seedance, imponiéndose en el 52% de esas evaluaciones. BFL señala que estos resultados reflejan pruebas de preferencia y no un sistema de puntuación fijo: los evaluadores observan pares de clips y seleccionan el más convincente, y BFL contabiliza la frecuencia con la que FLUX 3 resulta ganador. Cabe destacar que las evaluaciones no incluyeron comparaciones directas contra Sora de OpenAI ni Veo de Google, por lo que la posición de FLUX 3 frente a esos destacados sistemas permanece sin probar en los resultados reportados por BFL.

El modelo también mantiene sólidas capacidades de imagen fija, consistentes con el legado de la línea FLUX. BFL compartió imágenes de muestra que demuestran versatilidad en una amplia variedad de estilos más allá del fotorrealismo.

BFL posiciona a FLUX 3 como más que una herramienta de creación de contenido. "Un modelo que solo aprende imágenes solo puede generar imágenes", dijo el cofundador y CEO Robin Rombach. La tesis de la empresa sostiene que aprender a predecir video implica aprender la física subyacente —peso, contacto, sincronización—, que es precisamente lo que una máquina necesita para navegar por el mundo físico. La idea de utilizar modelos generativos a gran escala como base para el control robótico ha despertado un interés creciente en los campos de la IA y la robótica, con empresas como Google DeepMind y Tesla explorando enfoques relacionados.

Esa tesis sustenta FLUX-mimic. Desarrollado con mimic robotics, el sistema añade un "decodificador" ligero al motor de predicción de video de FLUX 3, que traduce la comprensión interna del modelo sobre el movimiento en acciones robóticas reales. Audi ya está probando el sistema en tareas como la instalación de sellos flexibles de puertas, un trabajo que la automatización convencional ha tenido dificultades para manejar históricamente, porque los materiales deformables se comportan de manera impredecible y resisten la programación rígida de la que dependen los robots tradicionales.

"Audi representa el tipo de socio de fabricación para el que construimos FLUX-mimic", dijo Stephan-Daniel Gravert, cofundador de mimic robotics. Christoph Schneider, de Audi, afirmó que los robots ahora "resuelven trabajos complejos de manipulación de cuerpos blandos" que las máquinas anteriores no podían abordar. BFL informa que el sistema completo responde en aproximadamente 101 milisegundos, comparable a los reflejos visuales humanos.

FLUX 3 llega como el último esfuerzo de BFL para recuperar el impulso. Fundada en agosto de 2024 por investigadores que ayudaron a construir los modelos originales de Stable Diffusion en Stability AI, Black Forest Labs estableció rápidamente la línea FLUX como una fuerza dominante. Sus modelos de código abierto Flux Dev y Schnell obtuvieron reconocimiento como los mejores generadores de imágenes de código abierto, superando a MidJourney y al propio Stable Diffusion 3 de Stability AI. FLUX 1.1 Pro posteriormente encabezó la arena de imágenes de Artificial Analysis en octubre, aunque esa versión no fue de código abierto.

BFL lanzó FLUX.2 en noviembre de 2025, pero no logró la misma popularidad. La corona de código abierto ostentada por los modelos Flux originales persistió hasta que Z-Image Turbo de Alibaba igualó su calidad en tarjetas gráficas de consumo de gama baja a finales de 2025. "Esto es lo que SD3 debería haber sido", comentó un usuario de CivitAI en aquel entonces.

FLUX 3 representa el regreso de BFL a su mejor forma, aunque aún no es completamente abierto. Las capacidades de Video y Action están disponibles ahora en acceso anticipado a través de APIs y socios seleccionados, incluyendo a mimic robotics. La generación de imágenes seguirá en las próximas semanas. Se espera que la versión Dev de pesos abiertos llegue más adelante en 2026.