AktualnościMakroGoogle DeepMind wprowadza agentic video understanding dla Gemini

Google DeepMind wprowadza agentic video understanding dla Gemini

Autor: Google DeepMind Blog·

Najważniejsze informacje

  • Agentic video understanding jest dostępne już dziś dla przesyłanych plików wideo i filmów z YouTube przez Google AI Studio oraz Gemini Enterprise Agent Platform.
  • Google DeepMind podał, że funkcja może obniżyć zużycie tokenów nawet o 88%, zmniejszyć koszty nawet o 66% i poprawić dokładność nawet o 7%.
  • Narzędzie pozwala Gemini dynamicznie wybierać momenty wideo, klatki, dźwięk lub transkrypty do analizy zamiast korzystać ze stałego przetwarzania.
  • Google wskazał, że funkcja jest szczególnie przydatna w zadaniach związanych z długimi materiałami wideo, takich jak wyszukiwanie momentów, wykrywanie anomalii, zliczanie i złożone wyszukiwanie w wielogodzinnych klipach.
  • Możliwość zostanie wkrótce rozszerzona na aplikację Gemini, a później wesprze funkcję YouTube „Ask YouTube” na stronie odtwarzania wideo.
Google DeepMind wprowadza agentic video understanding dla Gemini

Google DeepMind uruchamia agentic video understanding dla Gemini

1 wrz. 2026

Google DeepMind uruchomił agentic video understanding dla Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite. Firma twierdzi, że nowa funkcja pozwala modelowi dynamicznie skanować fragmenty wideo, poprawiając dokładność przy jednoczesnym ograniczeniu zużycia tokenów nawet o 88% i kosztów nawet o 66%.

Możliwość jest już dostępna dla przesyłanych plików wideo i filmów z YouTube za pośrednictwem Gemini API w Google AI Studio oraz Gemini Enterprise Agent Platform. Deweloperzy mogą ją włączyć, ustawiając przetwarzanie API na "agentic".

Rohan Doshi, Senior Product Manager w Google DeepMind, oraz Mario Lučić, Research Director w Google DeepMind, powiedzieli, że nowa funkcja agentic do analizy wideo może obniżyć zużycie tokenów nawet o 88%, zmniejszyć koszty nawet o 66% i poprawić jakość nawet o 7%.

Według Google DeepMind, agentic video understanding jest podobne do agentic vision, które łączy wykonywanie kodu z natywnym rozumieniem obrazów przez modele Gemini. Firma podała, że narzędzie wideo wykorzystuje natywne możliwości Gemini w zakresie wideo, aby poprawić wydajność i wspierać zastosowania takie jak wyszukiwanie momentów z dokładnością poniżej sekundy, dokładniejsze wykrywanie anomalii, precyzyjne zliczanie i inne zadania związane z przetwarzaniem wideo. Ma to największe znaczenie dla deweloperów pracujących z długimi materiałami, gdzie przetwarzanie ze stałą częstotliwością może pomijać krótkotrwałe szczegóły lub wymuszać wyższe zużycie tokenów.

Benchmarki

Google DeepMind podał, że obecne statyczne przetwarzanie zazwyczaj wczytuje wideo ze stałą liczbą klatek na sekundę, domyślnie 1 FPS, którą można dostosować przez API. W przeciwieństwie do tego agentic video understanding łączy podstawowe rozumowanie modelu z natywnymi narzędziami wideo, aby dynamicznie wyszukiwać, skanować i analizować docelowe fragmenty wideo w obrębie klatek wizualnych, dźwięku i transkryptów.

W standardowych benchmarkach analizy wideo modele Gemini z agentic video understanding obniżają koszty analizy nawet o 66% i zużycie tokenów nawet o 88%, jednocześnie poprawiając dokładność nawet o 7% — poinformowała firma.

Firma dodała, że korzyści te są szczególnie widoczne w przypadku długich materiałów wideo, w tym 10-minutowych poradników, 90-minutowych wykładów i wielogodzinnych nagrań, gdzie statyczne przetwarzanie zmusza deweloperów do wyboru między wysokimi kosztami tokenów a metodami, które mogą pomijać istotne szczegóły.

Google DeepMind podał, że aktywacja agentic video understanding obniża zużycie tokenów nawet o 88% i zwiększa dokładność nawet o 7% w przypadku Gemini 3.7 Flash. Firma dodała, że choć korzyści dotyczą wszystkich trzech obsługiwanych modeli, Gemini 3.7 Flash z agentic understanding oferuje najlepszą ogólną jakość i najsilniejsze połączenie jakości oraz efektywności kosztowej spośród modeli testowanych pod kątem rozumienia wideo.

Jak to działa

Zamiast statycznego przetwarzania, w którym model wczytuje strumienie multimediów ze stałą liczbą klatek na sekundę, agentic video understanding pozwala Gemini decydować, co oglądać, z jaką szybkością i przy użyciu których danych — klatek, dźwięku lub transkryptu. System pobiera tylko te momenty i sygnały, które są potrzebne do wykonania zadania.

Google DeepMind podał, że wcześniej deweloperzy mogli wykonywać ten proces ręcznie, ale dzięki agentic video understanding Gemini może obsłużyć go w ramach agentic loop, wywołując wewnętrzne narzędzie do wczytania odpowiedniej części pliku wideo. Firma dodała, że znacząco zmniejsza to nakład pracy związany z tworzeniem rozwiązań.

Możliwości i zastosowania

Google DeepMind podał, że agentic video understanding zmienia sposób, w jaki deweloperzy mogą przetwarzać długie materiały wideo w wielu wymagających zastosowaniach.

  • Wyszukiwanie momentów z dokładnością poniżej sekundy: wskazywanie zmian stanu zachodzących w ułamkach sekund i ciasnych granic cięć, które łatwo przeoczyć przy 1 FPS, umożliwiając precyzyjną automatyczną edycję wideo.
  • Długie wyszukiwanie typu „igła w stogu siana”: odpowiadanie na złożone pytania w wielogodzinnych materiałach bez zużywania milionów tokenów.
  • Wykrywanie anomalii: ponowne próbkowanie interesujących okien czasowych z wyższym FPS w celu analizy szybkiego ruchu i subtelnych artefaktów wizualnych.
  • Zliczanie akcji i obiektów: dokładne śledzenie powtarzających się ruchów fizycznych i odrębnych obiektów w czasie.

Efektywna tokenowo analiza długich materiałów wideo

Google DeepMind podał, że Gemini 3.7 Flash wykazuje duże redukcje zużycia tokenów i poprawę dokładności dzięki agentic video understanding w LongVideoBench, benchmarku rozumienia długich materiałów wideo. Dla zespołów budujących narzędzia do przeglądu, moderacji, wyszukiwania lub analityki takie korzyści mogą zmniejszyć kompromis między szerokością pokrycia a kosztem sprawdzania każdej klatki.

Dokładna analiza szybkiej akcji z dynamicznym FPS

Dzięki agentic video understanding 3.7 Flash może dokładnie zliczać szybkie ruchy, skanując i odtwarzając ponownie wideo z różną liczbą klatek na sekundę, zależnie od potrzeb.

Efektywne tokenowo wyszukiwanie typu „igła w stogu siana”

Korzystając z agentic video understanding, Gemini 3.7 może odpowiadać na złożone pytania na podstawie treści wideo, zużywając znacznie mniej tokenów niż w przypadku statycznej analizy — podał Google DeepMind.

Wyniki w praktyce

Google DeepMind podał, że wielu partnerów z wczesnego dostępu odnotowało dobrą wydajność podczas testów agentic video understanding.

Jak zacząć

Agentic video understanding jest dostępne przez Gemini API w Google AI Studio i Gemini Enterprise Agent Platform, wprowadzane w modelach Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite. Google DeepMind poinformował, że korzysta ze standardowych cen tokenów Gemini API bez dodatkowej opłaty za funkcję.

Aby włączyć tę funkcję, deweloperzy powinni ustawić processing na "agentic" w konfiguracji API. Google DeepMind skierował też czytelników do przewodnika dla deweloperów z dodatkowymi informacjami o rozpoczęciu pracy.

Firma podała również, że przenosi usprawnienia w zakresie efektywności i jakości agentic video understanding do użytkowników w produktach Google. Funkcja zostanie wkrótce udostępniona wszystkim użytkownikom aplikacji Gemini w modelach Flash i Flash-Lite. W najbliższych miesiącach Google DeepMind poinformował, że agentic video understanding będzie także napędzać funkcję YouTube „Ask YouTube” na stronie odtwarzania wideo, wykorzystując Gemini do dostarczania odpowiedzi wyższej jakości, opartych na obrazie.

Google DeepMind podziękował za wkład w tę pracę Sergi Caellesowi, Filipowi Pavetićowi, Ahmetowi Iscenowi, Suhasowi Yoginowi oraz zespołowi Agentic Vision.