AktualnościAkcjeGoogle DeepMind uruchamia Gemini Omni 1.1 Flash z rozszerzaniem scen, kontrolą klatek kluczowych i skalowaniem do 4K

Google DeepMind uruchamia Gemini Omni 1.1 Flash z rozszerzaniem scen, kontrolą klatek kluczowych i skalowaniem do 4K

Autor: Google DeepMind Blog·

Najważniejsze informacje

  • Gemini Omni 1.1 Flash może rozszerzać sceny w krokach co 10 sekund do łącznego limitu 40 sekund, analizując do 10 sekund wcześniejszego kontekstu zamiast jednej sekundy w starszych modelach.
  • Deweloperzy mogą określać pierwszą i ostatnią klatkę kluczową, a model generuje ciągłe wideo między nimi, wspierając orby kamery, przejścia zoom i płynne pętle.
  • Podglądy robocze w 360p generują się nawet o 60% szybciej i za jedną trzecią kosztu standardowego 720p, według porównania przepustowości Google, a finalne projekty można renderować w 1080p lub 4K.
  • Adobe zintegrowało Gemini Omni Flash z Adobe Firefly, a partnerzy tacy jak Figma Weave, GMI Cloud i Runway deklarują wykorzystanie modelu w produkcyjnych przepływach kreatywnych.
  • Model jest dostępny dla deweloperów przez Google AI Studio i Gemini Enterprise Agent Platform, a także trafia globalnie do subskrybentów Google AI Plus, Pro i Ultra w Google Flow; rozszerzanie scen jest dostępne w aplikacji Gemini.
Google DeepMind uruchamia Gemini Omni 1.1 Flash z rozszerzaniem scen, kontrolą klatek kluczowych i skalowaniem do 4K

Google DeepMind uruchamia Gemini Omni 1.1 Flash z rozszerzaniem scen, kontrolą klatek kluczowych i skalowaniem do 4K

Google DeepMind, dział badawczy AI Google stojący za rodziną modeli Gemini, wprowadziło Gemini Omni 1.1 Flash — gotową do produkcji aktualizację, która daje deweloperom większą kontrolę nad generatywnym wideo. Ogłoszona 27 sierpnia 2026 roku przez Anisha Nangię i Alisę Fortin, Product Managerów w Google DeepMind, aktualizacja zapewnia możliwości produkcji wideo na poziomie studyjnym, w tym rozszerzanie scen, interpolację pierwszej i ostatniej klatki, wyraźne skalowanie do 4K oraz szybsze prototypowanie. Deweloperzy mogą zacząć pracę już dziś, uzyskując dostęp do modelu przez Google AI Studio lub Gemini Enterprise Agent Platform.

Według Google Gemini Omni wprowadził rozumowanie zbliżone do rzeczywistego świata do generatywnego tworzenia, a nowe aktualizacje czynią Omni 1.1 gotowym do produkcyjnego użytku w zastosowaniach profesjonalnych poprzez Gemini API w Google AI Studio. Niezależnie od tego, czy deweloperzy budują przepływy pracy z generatywnym wideo, narzędzia kreatywne czy oprogramowanie do edycji mediów, aktualizacja ma sprawić, że generatywne wideo będzie bardziej sterowalne, szybsze w iteracji i dopracowane do rzeczywistego wdrożenia. Zestaw funkcji odpowiada na praktyczną lukę między surową generacją a gotową produkcją: utrzymaniem spójności materiału przy dłuższych ujęciach, świadomym prowadzeniem kamery i tanimi iteracjami przed zatwierdzeniem finalnych renderów.

Najważniejsze możliwości to:

  • Rozszerzanie scen do 40 sekund z lepszą spójnością wizualną i ciągłością narracji.
  • Ustawianie klatek początkowej i końcowej, aby tworzyć płynne, profesjonalne ruchy kamery i przejścia.
  • Korzystanie z podglądów 360p, aby szybciej iterować i oszczędzać podczas procesu twórczego.
  • Skalowanie finalnych projektów do rozdzielczości 4K, aby uzyskać dopracowany, profesjonalny efekt.

Rozszerzanie scen dla dłuższej narracji

Rozszerzanie scen pozwala wziąć istniejące wideo i kontynuować generowanie materiału płynnie od miejsca, w którym się zakończyło. W Omni 1.1 model może teraz analizować do 10 sekund wcześniejszego kontekstu — to znaczący skok względem wcześniejszych modeli, które odwoływały się tylko do ostatniej sekundy. Google podaje, że efektem jest lepsza spójność wizualna i zgodność z narracją, co pozwala tworzyć dłuższe historie lub przechodzić do nowych kierunków kreatywnych. Wideo można rozszerzać w 10-sekundowych krokach, do łącznej długości 40 sekund. Utrzymanie spójności przez dłuższy czas było jednym z trudniejszych problemów w generatywnym wideo, gdzie modele zwykle tworzyły krótkie klipy, które wizualnie dryfowały po wydłużeniu poza pierwotną długość.

Przykładowe ciągi promptów opublikowane wraz z ogłoszeniem pokazują tę funkcję:

  • Prompt 1: Camera slightly pans and we now see she is talking to a man with curly hair, we see man's back, he says "I see it too" dramatic music score
  • Prompt 2: Camera slowly pulls out, forgotten dusty catacombs, dramatic music score.
  • Prompt 3: Camera slowly pulls out, a vast library where shelves and books float weightlessly in a dusty void, dramatic music score.

Druga sekwencja pokazuje kinetyczną kontynuację kamery:

  • Prompt 1: Continue the video. Execute a cinematic optical dolly-zoom shot. The camera dollies forward while simultaneously zooming out, keeping the character's frozen shocked face locked at the exact same size. The long corridor of stone pillars in the background dramatically stretches and deepens with intense optical perspective distortion. Clean architecture, continuous unbroken shot.
  • Prompt 2: Continue the video. The camera executes a fast mechanical snap-zoom directly into the character's wide eyes. Stylized cinematic camera control.
  • Prompt 3: Continue the video. Time completely freezes into a static moment: the character, their windblown coat. The camera performs a smooth, high-speed 360-degree orbital rotation around the frozen character, showcasing dramatic 3D depth and parallax across the colonnade. Flawless continuity.

Dalsze przykłady pokazują rozszerzenia oparte na dialogu:

  • Prompt 1: The man in the blue sweater replies: "Did your father go out on the boat too?"
  • Prompt 2: The camera pulls back in one continuous movement as he continues his story: "He used to say that this harbour had a soul. And that the boats were a part of us." The music swells.

Inna para promptów dotyczy kontynuacji w stylu prezentera:

  • Prompt 1: The looks directly at the camera and talks about what the final chapter will end with!
  • Prompt 2: He then stands up walks around the desk to the camera and says "what would you choose?"

Google dokumentuje również, jak rozszerzyć scenę przy użyciu Gemini API.

Określanie pierwszej i ostatniej klatki

Deweloperzy mogą uzyskać płynne przejścia i ruchy kamery, określając klatki początkową i końcową ujęcia. Omni 1.1 generuje ciągłe wideo pomiędzy dwiema klatkami kluczowymi, co sprawia, że nadaje się do złożonych orbit kamery, przejść typu zoom lub płynnych pętli. Przykładowe prompty obejmują:

  • Prompt 1: A close-up low-angle shot of a stylish drummer in a beige suit playing a red drum kit in a grand hall transitions as the camera whip-pans to the side, revealing an older saxophonist playing alongside a ballet dancer spinning in a white outfit under soft purple stage lights. One continuous shot, no jump cuts.
  • Prompt 2: The camera zooms into the TV screen, where we see the same woman and the same scene from the beginning. Seamless video. One continuous shot, no jump cuts.

Tworzenie draftów bardziej efektywnie w 360p

Omni 1.1 może generować lekkie podglądy w rozdzielczości 360p nawet o 60% szybciej i za jedną trzecią kosztu w porównaniu ze standardową rozdzielczością 720p modelu. Google wskazuje, że jest to przydatne przy szybkim prototypowaniu, iteracji storyboardów i szybkim renderowaniu w platformach dla deweloperów. Firma dodaje przypis: wartość do 60% szybszego generowania opiera się na przepustowości systemu dla 360p względem 720p.

Jeden z przykładowych promptów brzmi: A microscopic view of iridescent marine diatoms, displaying intricate, glass-like silica shells with breathtaking natural symmetry. The colors range from deep volcanic amber and warm copper to vibrant turquoise and violet, mimicking the rich palette of earth and ocean. Tiny, delicate structures glow softly against a clean dark field background. High-fidelity scientific imaging, sharp details, organic textures, micro-photography. Maintain the microscope lens effect throughout the entire video.

Skalowanie do rozdzielczości 4K

Model generuje dopracowane, wysokiej jakości wyjścia 1080p lub 4K, gotowe do profesjonalnej produkcji. Przykładowe prompty obejmują:

  • Prompt 1: Fish swimming, tracking shot
  • Prompt 2: A little chipmunk darting out of the woods from the left side of the screen and sniffing the air inquisitively before darting out of frame on the right side
  • Prompt 3: Cinematic macro close-up of vibrant golden-orange Japanese maple leaves on a delicate branch, gently rustling and swaying in a soft, rhythmic autumn breeze. Sunlight filters through the translucent foliage, creating a warm, glowing effect. Shallow depth of field, dreamy bokeh background, hyper-detailed textures, photorealistic, 4k.

Odwołania do wideo w danych multimodalnych

Deweloperzy mogą odwołać się do maksymalnie trzech sekund wideo podczas tworzenia sceny, co pozwala utrzymać kontekst wizualny i spójność postaci na podstawie referencji wideo — podejście to zakotwicza generowanie w dostarczonym materiale, a nie wyłącznie w promptach tekstowych. Przykładowy prompt:

Use the three uploaded videos of dancers and replace them with the provided characters. Have them perform their individual dances from the reference videos, all together in the large, open space from the provided image. The dog character dog.png should do the classical dance from dance3.mp4. The octopus octo.png should do the hip hop dance from dance1.mp4, and the bear bear.png should do the breakdance from dance2.mp4. The final result should be one continuous shot with no scene cuts.

Koncepcje zastosowań dla deweloperów

Google przedstawiło kilka koncepcji pokazujących, jak nowe możliwości można wykorzystać w niestandardowych narzędziach i przepływach pracy kreatywnej:

  • Aplikacja do przejść między klatkami kluczowymi, w której użytkownicy wstawiają klatkę początkową i końcową, a następnie generują przejście między nimi przy użyciu presetów lub pola promptu, przy czym pełnokontekstowe rozumowanie Omni tworzy ruchy kamery wyglądające realistycznie.
  • Aplikacja do zwiedzania wnętrz, która prowadzi kamerę przez pomieszczenia — wykonując łuki, najazdy i odjazdy — pokazując dom w aspiracyjnym stanie o idealnej porze dnia, bez dodawania mebli ani szczegółów, które nie istnieją.
  • Draft Room, który sprawia, że eksploracja kreatywna jest tania i uporządkowana: generuj 3–4 wersje robocze w 360p, zmieniając po jednej rzeczy naraz, i porównuj je obok siebie. Google zauważa, że twórcy i tak generują kilka filmów, zanim wybiorą właściwy.

Klienci wdrażający Omni Flash w produkcji

Google twierdzi, że klienci już wykorzystują Gemini Omni Flash w rzeczywistej produkcji za pośrednictwem Agent Platform API. Adobe zintegrowało Gemini Omni Flash z Adobe Firefly, rodziną narzędzi kreatywnych AI Adobe, a firma odsyła do wideo pokazującego możliwości edycji. Zestaw partnerów — obejmujący narzędzia projektowe, platformy kreatywne i infrastrukturę chmurową — pokazuje, że generatywne wideo jest osadzane w ugruntowanych profesjonalnych przepływach pracy, a nie oferowane wyłącznie jako samodzielny model.

Partnerzy opisali, jak korzystają z modelu:

"Gemini Omni Flash is one of the strongest video models available in Figma Weave, where the canvas helps creative teams build on every generation — attaching references, branching different versions, and shaping something unique. With extensions, richer reference material, and 4K resolution, Gemini Omni Flash takes teams beyond generating videos to truly directing them." — Itay Schiff, Creative Director, Figma Weave.

"At GMI Cloud, we give creators centralized access to the world's most capable models. What stands out about Gemini Omni Flash is its accuracy: the details hold up under scrutiny. For customers creating educational and explanatory content, where getting things right is essential, that reliability matters more than any single feature. Omni has made AI video viable for a segment that previously couldn't rely on it." — Louisa Guo, VP of Marketing, GMI Cloud.

"Omni Flash fits naturally into how people already use Runway: start with a prompt, an image or a video, then generate or edit from there. It's another way for our users to move quickly between ideas." — Jamie Umpherson, Chief Creative Officer, Runway.

Dostępność i ceny

Omni 1.1 jest udostępniany w całym ekosystemie deweloperskim Google:

  • Start building in Google AI Studio: developers can try out Omni 1.1 directly in Google AI Studio.
  • Deploy on the Gemini Enterprise Agent Platform: enterprise developers can deploy Omni 1.1 on the platform.
  • Explore the developer documentation: the official documentation, the cookbook and prompting guides cover how to integrate scene extensions, video references and upscaling into applications.

Omni 1.1 is also available to all Google AI Plus, Pro and Ultra subscribers globally in Google Flow, starting today. Scene extension is available to all Google AI Plus, Pro and Ultra subscribers globally in the Gemini app. Udostępnienie deweloperom i subskrybentom konsumenckim w tym samym czasie kontynuuje podejście Google polegające na publikowaniu modeli generatywnych zarówno w interfejsach API, jak i aplikacjach.

Dalsze szczegóły, w tym tabela cen, są dostępne w oryginalnym ogłoszeniu na blogu Google DeepMind oraz na stronie modelu Gemini Omni.