Google DeepMind lanza Gemini Omni 1.1 Flash con extensión de escenas, control de fotogramas clave y escalado a 4K
Puntos clave
- •Gemini Omni 1.1 Flash puede extender escenas de video en incrementos de 10 segundos hasta un máximo acumulado de 40 segundos, analizando hasta 10 segundos de contexto previo en comparación con el segundo único de modelos anteriores.
- •Los desarrolladores pueden especificar fotogramas clave inicial y final, y el modelo genera video continuo entre ambos para admitir órbitas de cámara, transiciones de zoom y bucles sin cortes.
- •Las vistas previas de borrador en 360p se generan hasta 60% más rápido y a un tercio del costo de la resolución estándar 720p, según la comparación de rendimiento del sistema de Google, mientras que los proyectos finales pueden renderizarse en 1080p o 4K.
- •Adobe integró Gemini Omni Flash en Adobe Firefly, y socios como Figma Weave, GMI Cloud y Runway informan que usan el modelo en flujos creativos de producción.
- •El modelo está disponible para desarrolladores a través de Google AI Studio y Gemini Enterprise Agent Platform, y también se está desplegando para suscriptores de Google AI Plus, Pro y Ultra en Google Flow, con la extensión de escenas disponible en la app de Gemini.

Google DeepMind lanza Gemini Omni 1.1 Flash con extensión de escenas, control de fotogramas clave y escalado a 4K
Google DeepMind, la división de investigación en IA de Google detrás de la familia de modelos Gemini, presentó Gemini Omni 1.1 Flash, una actualización lista para producción que ofrece a los desarrolladores un mejor control sobre el video generativo. Anunciado el 27 de agosto de 2026 por Anish Nangia y Alisa Fortin, Product Managers de Google DeepMind, el lanzamiento aporta capacidades de producción de video con calidad de estudio, incluida la posibilidad de extender una escena, interpolación de fotogramas inicial y final, escalado nítido a 4K y prototipado más rápido. Los desarrolladores pueden empezar a construir hoy accediendo al modelo a través de Google AI Studio o de Gemini Enterprise Agent Platform.
Según Google, Gemini Omni llevó el razonamiento del mundo real a la creación generativa, y las nuevas actualizaciones hacen que Omni 1.1 esté listo para producción y uso profesional a través de la API de Gemini en Google AI Studio. Tanto si los desarrolladores están creando flujos de trabajo de video generativo, herramientas creativas o software de edición multimedia, la actualización está diseñada para hacer el video generativo más controlable, más rápido de iterar y más pulido para su despliegue en el mundo real. El conjunto de funciones apunta a la brecha práctica entre la generación en bruto y el trabajo de producción final: mantener la coherencia del material durante duraciones más largas, dirigir la cámara de forma deliberada e iterar de manera económica antes de comprometerse con los renders finales.
Las capacidades principales son:
- Extender escenas hasta 40 segundos con mejor consistencia visual y flujo narrativo.
- Establecer fotogramas inicial y final para crear movimientos de cámara y transiciones suaves y profesionales.
- Usar vistas previas en 360p para iterar más rápido y ahorrar dinero durante el proceso creativo.
- Escalar los proyectos finales a resolución 4K para un acabado pulido y profesional.
Extensión de escenas para historias más largas
La extensión de escenas toma un video existente y continúa generando metraje sin interrupciones desde donde se detuvo. Con Omni 1.1, el modelo ahora puede analizar hasta 10 segundos de contexto previo, un salto frente a modelos anteriores que solo tomaban como referencia el último segundo. Google dice que el resultado es una mejor consistencia visual y adhesión narrativa, lo que permite a los desarrolladores construir historias más largas o ramificarse hacia nuevas direcciones creativas. Los videos pueden extenderse en incrementos de 10 segundos hasta una longitud acumulada total de 40 segundos. Mantener la coherencia en segmentos más largos ha sido uno de los problemas más difíciles en el video generativo, donde los modelos suelen producir clips cortos que se desvían visualmente cuando el material se prolonga más allá de su longitud original.
Las cadenas de prompts de ejemplo publicadas con el anuncio ilustran la función:
- Prompt 1: Camera slightly pans and we now see she is talking to a man with curly hair, we see man's back, he says "I see it too" dramatic music score
- Prompt 2: Camera slowly pulls out, forgotten dusty catacombs, dramatic music score.
- Prompt 3: Camera slowly pulls out, a vast library where shelves and books float weightlessly in a dusty void, dramatic music score.
Una segunda secuencia muestra la continuidad cinematográfica de la cámara:
- Prompt 1: Continue the video. Execute a cinematic optical dolly-zoom shot. The camera dollies forward while simultaneously zooming out, keeping the character's frozen shocked face locked at the exact same size. The long corridor of stone pillars in the background dramatically stretches and deepens with intense optical perspective distortion. Clean architecture, continuous unbroken shot.
- Prompt 2: Continue the video. The camera executes a fast mechanical snap-zoom directly into the character's wide eyes. Stylized cinematic camera control.
- Prompt 3: Continue the video. Time completely freezes into a static moment: the character, their windblown coat. The camera performs a smooth, high-speed 360-degree orbital rotation around the frozen character, showcasing dramatic 3D depth and parallax across the colonnade. Flawless continuity.
Más ejemplos muestran extensiones basadas en diálogo:
- Prompt 1: The man in the blue sweater replies: "Did your father go out on the boat too?"
- Prompt 2: The camera pulls back in one continuous movement as he continues his story: "He used to say that this harbour had a soul. And that the boats were a part of us." The music swells.
Otra pareja de prompts cubre continuaciones de estilo presentador:
- Prompt 1: The looks directly at the camera and talks about what the final chapter will end with!
- Prompt 2: He then stands up walks around the desk to the camera and says "what would you choose?"
Google también documenta cómo extender una escena con la API de Gemini.
Especificación de fotogramas inicial y final
Los desarrolladores pueden lograr transiciones suaves y movimientos de cámara especificando los fotogramas de inicio y de fin de una toma. Omni 1.1 genera video continuo entre dos fotogramas clave, lo que lo hace adecuado para órbitas complejas de cámara, transiciones de zoom o clips en bucle sin cortes. Entre los prompts de ejemplo figuran:
- Prompt 1: A close-up low-angle shot of a stylish drummer in a beige suit playing a red drum kit in a grand hall transitions as the camera whip-pans to the side, revealing an older saxophonist playing alongside a ballet dancer spinning in a white outfit under soft purple stage lights. One continuous shot, no jump cuts.
- Prompt 2: The camera zooms into the TV screen, where we see the same woman and the same scene from the beginning. Seamless video. One continuous shot, no jump cuts.
Borradores más eficientes en 360p
Omni 1.1 puede generar vistas previas ligeras en resolución 360p hasta 60% más rápido y a un tercio del costo en comparación con la resolución estándar 720p del modelo. Google señala que esto es útil para prototipado rápido, iteración de storyboards y renderizado rápido en plataformas para desarrolladores. La empresa añade una nota al pie: la cifra de hasta 60% más rapidez se basa en el rendimiento del sistema de 360p frente a 720p.
Un prompt de ejemplo dice: A microscopic view of iridescent marine diatoms, displaying intricate, glass-like silica shells with breathtaking natural symmetry. The colors range from deep volcanic amber and warm copper to vibrant turquoise and violet, mimicking the rich palette of earth and ocean. Tiny, delicate structures glow softly against a clean dark field background. High-fidelity scientific imaging, sharp details, organic textures, micro-photography. Maintain the microscope lens effect throughout the entire video.
Escalado hasta 4K
El modelo genera salidas pulidas en alta resolución 1080p o 4K que están listas para producción profesional. Los prompts de ejemplo incluyen:
- Prompt 1: Fish swimming, tracking shot
- Prompt 2: A little chipmunk darting out of the woods from the left side of the screen and sniffing the air inquisitively before darting out of frame on the right side
- Prompt 3: Cinematic macro close-up of vibrant golden-orange Japanese maple leaves on a delicate branch, gently rustling and swaying in a soft, rhythmic autumn breeze. Sunlight filters through the translucent foliage, creating a warm, glowing effect. Shallow depth of field, dreamy bokeh background, hyper-detailed textures, photorealistic, 4k.
Referencias de video en la entrada multimodal
Los desarrolladores pueden hacer referencia a hasta tres segundos de video al crear una escena, lo que les permite mantener el contexto visual y la consistencia de los personajes basándose en referencias de video, un enfoque que ancla la generación al material proporcionado en lugar de depender solo de prompts de texto. Un prompt de ejemplo:
Use the three uploaded videos of dancers and replace them with the provided characters. Have them perform their individual dances from the reference videos, all together in the large, open space from the provided image. The dog character dog.png should do the classical dance from dance3.mp4. The octopus octo.png should do the hip hop dance from dance1.mp4, and the bear bear.png should do the breakdance from dance2.mp4. The final result should be one continuous shot with no scene cuts.
Conceptos de lo que los desarrolladores pueden construir
Google compartió varios conceptos que muestran cómo las nuevas capacidades pueden aplicarse en herramientas personalizadas y flujos de trabajo creativos:
- Una app de transición de fotogramas clave en la que los usuarios insertan un fotograma inicial y uno final y generan la transición entre ambos con ajustes preestablecidos o un cuadro de prompt, con el razonamiento de contexto completo de Omni produciendo movimientos de cámara que parecen reales.
- Una app de recorrido por habitaciones que mueve la cámara por los espacios — trazando arcos, acercándose y alejándose — mostrando una casa en un estado aspiracional a la hora perfecta del día, sin añadir muebles ni detalles que no existan.
- The Draft Room, que hace que la exploración creativa sea barata y estructurada: generar 3-4 variantes de borrador en 360p, variando una sola cosa a la vez, y compararlas lado a lado. Google señala que los creadores ya generan varios videos antes de encontrar el adecuado.
Clientes que ponen Omni Flash en producción
Google dice que los clientes ya están impulsando producción en el mundo real con Gemini Omni Flash a través de la API de Agent Platform. Adobe integró Gemini Omni Flash en Adobe Firefly, la familia de herramientas creativas de IA generativa de Adobe, y la empresa remite a un video que muestra sus capacidades de edición de video. La lista de socios — que abarca herramientas de diseño, plataformas creativas e infraestructura en la nube — ilustra cómo el video generativo se está incorporando a flujos de trabajo profesionales consolidados en lugar de ofrecerse solo como un modelo independiente.
Los socios describieron cómo están usando el modelo:
"Gemini Omni Flash is one of the strongest video models available in Figma Weave, where the canvas helps creative teams build on every generation — attaching references, branching different versions, and shaping something unique. With extensions, richer reference material, and 4K resolution, Gemini Omni Flash takes teams beyond generating videos to truly directing them." — Itay Schiff, Creative Director, Figma Weave.
"At GMI Cloud, we give creators centralized access to the world's most capable models. What stands out about Gemini Omni Flash is its accuracy: the details hold up under scrutiny. For customers creating educational and explanatory content, where getting things right is essential, that reliability matters more than any single feature. Omni has made AI video viable for a segment that previously couldn't rely on it." — Louisa Guo, VP of Marketing, GMI Cloud.
"Omni Flash fits naturally into how people already use Runway: start with a prompt, an image or a video, then generate or edit from there. It's another way for our users to move quickly between ideas." — Jamie Umpherson, Chief Creative Officer, Runway.
Disponibilidad y precios
Omni 1.1 se está desplegando en todo el ecosistema de desarrolladores de Google:
- Empieza a construir en Google AI Studio: los desarrolladores pueden probar Omni 1.1 directamente en Google AI Studio.
- Despliega en Gemini Enterprise Agent Platform: los desarrolladores empresariales pueden desplegar Omni 1.1 en la plataforma.
- Explora la documentación para desarrolladores: la documentación oficial, el cookbook y las guías de prompts explican cómo integrar extensiones de escenas, referencias de video y escalado en las aplicaciones.
Omni 1.1 también está disponible desde hoy para todos los suscriptores de Google AI Plus, Pro y Ultra a nivel mundial en Google Flow. La extensión de escenas está disponible para todos los suscriptores de Google AI Plus, Pro y Ultra a nivel mundial en la app de Gemini. El lanzamiento simultáneo para desarrolladores y suscriptores de consumo continúa el patrón de Google de publicar sus modelos generativos en superficies de API y de aplicaciones.
Más detalles, incluida la tabla de precios, están disponibles en el anuncio original en el blog de Google DeepMind y en la página del modelo Gemini Omni.