Google DeepMind lance Gemini Omni 1.1 Flash avec extension de scène, contrôle des images clés et mise à l’échelle 4K
Points clés
- •Gemini Omni 1.1 Flash peut étendre des scènes vidéo par incréments de 10 secondes jusqu’à 40 secondes au total, en analysant jusqu’à 10 secondes de contexte antérieur, contre une seule seconde pour les modèles précédents.
- •Les développeurs peuvent définir les premières et dernières images clés, et le modèle génère une vidéo continue entre elles pour prendre en charge les orbites de caméra, les transitions de zoom et les boucles sans couture.
- •Les aperçus en 360p sont générés jusqu’à 60 % plus rapidement et à un tiers du coût du 720p standard, selon la comparaison de débit système de Google, tandis que les projets finaux peuvent être rendus en 1080p ou en 4K.
- •Adobe a intégré Gemini Omni Flash dans Adobe Firefly, et des partenaires comme Figma Weave, GMI Cloud et Runway indiquent utiliser le modèle dans des workflows créatifs de production.
- •Le modèle est accessible aux développeurs via Google AI Studio et Gemini Enterprise Agent Platform, et est également déployé pour les abonnés Google AI Plus, Pro et Ultra dans Google Flow, avec l’extension de scène disponible dans l’application Gemini.

Google DeepMind lance Gemini Omni 1.1 Flash avec extension de scène, contrôle des images clés et mise à l’échelle 4K
Google DeepMind, la division de recherche en IA de Google à l’origine de la famille de modèles Gemini, a présenté Gemini Omni 1.1 Flash, une mise à jour prête pour la production qui offre aux développeurs un meilleur contrôle sur la vidéo générative. Annoncée le 27 août 2026 par Anish Nangia et Alisa Fortin, chefs de produit chez Google DeepMind, cette version apporte des capacités de production vidéo de qualité studio, notamment l’extension d’une scène, l’interpolation des premières et dernières images, une mise à l’échelle 4K nette et un prototypage plus rapide. Les développeurs peuvent commencer dès aujourd’hui en accédant au modèle via Google AI Studio ou la Gemini Enterprise Agent Platform.
Selon Google, Gemini Omni a apporté un raisonnement appliqué au monde réel à la création générative, et les nouvelles mises à jour rendent Omni 1.1 prêt pour un usage professionnel via l’API Gemini dans Google AI Studio. Que les développeurs construisent des workflows de vidéo générative, des outils créatifs ou des logiciels de montage multimédia, cette mise à jour vise à rendre la vidéo générative plus contrôlable, plus rapide à itérer et plus aboutie pour un déploiement concret. L’ensemble des fonctionnalités cible l’écart pratique entre la génération brute et le travail de production final : conserver la cohérence des séquences sur des durées plus longues, diriger la caméra de manière intentionnelle et itérer à moindre coût avant de lancer les rendus finaux.
Les principales capacités sont les suivantes :
- Étendre des scènes jusqu’à 40 secondes avec une cohérence visuelle et un flux narratif améliorés.
- Définir des images de début et de fin pour créer des mouvements de caméra et des transitions fluides et professionnels.
- Utiliser des aperçus en 360p pour itérer plus vite et réduire les coûts pendant le processus créatif.
- Mettre les projets finaux à l’échelle en 4K pour un rendu soigné et professionnel.
Extension de scène pour des récits plus longs
L’extension de scène permet de prendre une vidéo existante et de poursuivre la génération de manière fluide là où elle s’est arrêtée. Avec Omni 1.1, le modèle peut désormais analyser jusqu’à 10 secondes de contexte précédent — une avancée par rapport aux modèles précédents qui ne tenaient compte que de la dernière seconde. Google indique que le résultat est une meilleure cohérence visuelle et une meilleure fidélité au récit, ce qui permet de créer des histoires plus longues ou d’explorer de nouvelles directions créatives. Les vidéos peuvent être prolongées par incréments de 10 secondes jusqu’à une durée cumulée totale de 40 secondes. Le maintien de la cohérence sur des séquences plus longues a été l’un des problèmes les plus difficiles en vidéo générative, où les modèles produisent généralement de courts extraits dont l’apparence dérive lorsque la séquence est prolongée au-delà de sa longueur initiale.
Des chaînes d’instructions d’exemple publiées avec l’annonce illustrent cette fonctionnalité :
- Prompt 1: Camera slightly pans and we now see she is talking to a man with curly hair, we see man's back, he says "I see it too" dramatic music score
- Prompt 2: Camera slowly pulls out, forgotten dusty catacombs, dramatic music score.
- Prompt 3: Camera slowly pulls out, a vast library where shelves and books float weightlessly in a dusty void, dramatic music score.
Une deuxième séquence montre la continuité cinématographique de la caméra :
- Prompt 1: Continue the video. Execute a cinematic optical dolly-zoom shot. The camera dollies forward while simultaneously zooming out, keeping the character's frozen shocked face locked at the exact same size. The long corridor of stone pillars in the background dramatically stretches and deepens with intense optical perspective distortion. Clean architecture, continuous unbroken shot.
- Prompt 2: Continue the video. The camera executes a fast mechanical snap-zoom directly into the character's wide eyes. Stylized cinematic camera control.
- Prompt 3: Continue the video. Time completely freezes into a static moment: the character, their windblown coat. The camera performs a smooth, high-speed 360-degree orbital rotation around the frozen character, showcasing dramatic 3D depth and parallax across the colonnade. Flawless continuity.
D’autres exemples montrent des prolongations fondées sur le dialogue :
- Prompt 1: The man in the blue sweater replies: "Did your father go out on the boat too?"
- Prompt 2: The camera pulls back in one continuous movement as he continues his story: "He used to say that this harbour had a soul. And that the boats were a part of us." The music swells.
Une autre paire d’instructions couvre des prolongements de type présentation :
- Prompt 1: The looks directly at the camera and talks about what the final chapter will end with!
- Prompt 2: He then stands up walks around the desk to the camera and says "what would you choose?"
Google documente également la manière d’étendre une scène avec l’API Gemini.
Définition des premières et dernières images
Les développeurs peuvent obtenir des transitions et des mouvements de caméra fluides en spécifiant les images de début et de fin d’un plan. Omni 1.1 génère une vidéo continue entre deux images clés, ce qui le rend adapté aux orbites de caméra complexes, aux transitions de zoom ou aux boucles sans couture. Exemples d’instructions :
- Prompt 1: A close-up low-angle shot of a stylish drummer in a beige suit playing a red drum kit in a grand hall transitions as the camera whip-pans to the side, revealing an older saxophonist playing alongside a ballet dancer spinning in a white outfit under soft purple stage lights. One continuous shot, no jump cuts.
- Prompt 2: The camera zooms into the TV screen, where we see the same woman and the same scene from the beginning. Seamless video. One continuous shot, no jump cuts.
Création plus efficace en 360p
Omni 1.1 peut générer des aperçus légers en 360p jusqu’à 60 % plus rapidement et pour un tiers du coût du 720p standard du modèle. Google indique que cela est utile pour le prototypage rapide, l’itération de storyboards et le rendu rapide dans les plateformes pour développeurs. L’entreprise ajoute une note : l’indication de génération jusqu’à 60 % plus rapide est basée sur le débit système du 360p par rapport au 720p.
Un exemple d’instruction indique : A microscopic view of iridescent marine diatoms, displaying intricate, glass-like silica shells with breathtaking natural symmetry. The colors range from deep volcanic amber and warm copper to vibrant turquoise and violet, mimicking the rich palette of earth and ocean. Tiny, delicate structures glow softly against a clean dark field background. High-fidelity scientific imaging, sharp details, organic textures, micro-photography. Maintain the microscope lens effect throughout the entire video.
Mise à l’échelle jusqu’en 4K
Le modèle génère des sorties soignées en 1080p ou en 4K, prêtes pour une production professionnelle. Exemples d’instructions :
- Prompt 1: Fish swimming, tracking shot
- Prompt 2: A little chipmunk darting out of the woods from the left side of the screen and sniffing the air inquisitively before darting out of frame on the right side
- Prompt 3: Cinematic macro close-up of vibrant golden-orange Japanese maple leaves on a delicate branch, gently rustling and swaying in a soft, rhythmic autumn breeze. Sunlight filters through the translucent foliage, creating a warm, glowing effect. Shallow depth of field, dreamy bokeh background, hyper-detailed textures, photorealistic, 4k.
Références vidéo dans l’entrée multimodale
Les développeurs peuvent faire référence à jusqu’à trois secondes de vidéo lors de la création d’une scène, ce qui leur permet de conserver le contexte visuel et la cohérence des personnages à partir de vidéos de référence, une approche qui ancre la génération dans des images fournies plutôt que dans le seul texte des instructions. Exemple d’instruction :
Use the three uploaded videos of dancers and replace them with the provided characters. Have them perform their individual dances from the reference videos, all together in the large, open space from the provided image. The dog character dog.png should do the classical dance from dance3.mp4. The octopus octo.png should do the hip hop dance from dance1.mp4, and the bear bear.png should do the breakdance from dance2.mp4. The final result should be one continuous shot with no scene cuts.
Idées de ce que les développeurs peuvent construire
Google a partagé plusieurs concepts montrant comment ces nouvelles capacités peuvent être mises en œuvre dans des outils personnalisés et des workflows créatifs :
- Une application de transition par images clés dans laquelle les utilisateurs déposent une image de début et une image de fin, puis génèrent la transition entre elles à l’aide de préréglages ou d’une zone de saisie, le raisonnement à contexte complet d’Omni produisant des mouvements de caméra qui paraissent réels.
- Une application de visite de maison qui déplace la caméra à travers les pièces — en arc de cercle, en s’avançant puis en reculant — en montrant une maison dans un état valorisant au moment idéal de la journée, sans ajouter de mobilier ni de détails inexistants.
- Le Draft Room, qui rend l’exploration créative peu coûteuse et structurée : générer 3-4 variantes en 360p, en ne faisant varier qu’un seul élément à la fois, puis les comparer côte à côte. Google note que les créateurs génèrent déjà plusieurs vidéos avant d’obtenir la bonne.
Des clients qui déploient Omni Flash en production
Google indique que des clients utilisent déjà Gemini Omni Flash en production réelle via l’API Agent Platform. Adobe a intégré Gemini Omni Flash dans Adobe Firefly, la suite d’outils créatifs génératifs d’Adobe, et l’entreprise renvoie vers une vidéo démontrant ses capacités de montage vidéo. Le groupe de partenaires — couvrant outils de conception, plateformes créatives et infrastructure cloud — montre comment la vidéo générative s’intègre dans des workflows professionnels établis plutôt que d’être proposée uniquement comme modèle autonome.
Les partenaires ont décrit l’usage qu’ils font du modèle :
"Gemini Omni Flash is one of the strongest video models available in Figma Weave, where the canvas helps creative teams build on every generation — attaching references, branching different versions, and shaping something unique. With extensions, richer reference material, and 4K resolution, Gemini Omni Flash takes teams beyond generating videos to truly directing them." — Itay Schiff, Creative Director, Figma Weave.
"At GMI Cloud, we give creators centralized access to the world's most capable models. What stands out about Gemini Omni Flash is its accuracy: the details hold up under scrutiny. For customers creating educational and explanatory content, where getting things right is essential, that reliability matters more than any single feature. Omni has made AI video viable for a segment that previously couldn't rely on it." — Louisa Guo, VP of Marketing, GMI Cloud.
"Omni Flash fits naturally into how people already use Runway: start with a prompt, an image or a video, then generate or edit from there. It's another way for our users to move quickly between ideas." — Jamie Umpherson, Chief Creative Officer, Runway.
Disponibilité et tarification
Omni 1.1 est déployé progressivement dans l’écosystème développeur de Google :
- Commencer à construire dans Google AI Studio : les développeurs peuvent essayer Omni 1.1 directement dans Google AI Studio.
- Déployer sur la Gemini Enterprise Agent Platform : les développeurs d’entreprise peuvent déployer Omni 1.1 sur la plateforme.
- Explorer la documentation développeur : la documentation officielle, le cookbook et les guides de prompting expliquent comment intégrer les extensions de scène, les références vidéo et la mise à l’échelle dans les applications.
Omni 1.1 est également disponible dès aujourd’hui pour tous les abonnés Google AI Plus, Pro et Ultra dans Google Flow, dans le monde entier. L’extension de scène est disponible pour tous les abonnés Google AI Plus, Pro et Ultra dans le monde entier dans l’application Gemini. Le déploiement simultané pour les développeurs et les abonnés grand public s’inscrit dans la continuité de la stratégie de Google consistant à publier ses modèles génératifs à la fois via l’API et dans les applications.
D’autres détails, y compris le tableau des tarifs, sont disponibles dans l’annonce originale sur le blog Google DeepMind et sur la page du modèle Gemini Omni.