Google DeepMind führt agentisches Video-Verständnis für Gemini ein
Wichtige Erkenntnisse
- •Agentisches Video-Verständnis ist ab heute für Video-Uploads und YouTube-Videos über Google AI Studio und die Gemini Enterprise Agent Platform verfügbar.
- •Google DeepMind sagte, die Funktion könne den Tokenverbrauch um bis zu 88% senken, die Kosten um bis zu 66% reduzieren und die Genauigkeit um bis zu 7% verbessern.
- •Das Tool lässt Gemini dynamisch entscheiden, welche Videomomente, Frames, Audios oder Transkripte geprüft werden, statt eine feste Verarbeitung zu verwenden.
- •Google sagte, die Funktion sei besonders nützlich für Langform-Videotasks wie Momentenabruf, Anomalieerkennung, Zählen und komplexe Suchen über mehrstündige Clips hinweg.
- •Die Funktion wird bald in die Gemini-App ausgeweitet und später YouTubes Funktion „Ask YouTube“ auf der Wiedergabeseite unterstützen.

Google DeepMind führt agentisches Video-Verständnis für Gemini ein
- Sep. 2026
Google DeepMind hat agentisches Video-Verständnis für Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite eingeführt. Das Unternehmen sagt, die neue Funktion ermögliche es dem Modell, Videosegmente dynamisch zu scannen, wodurch die Genauigkeit verbessert und der Tokenverbrauch um bis zu 88% sowie die Kosten um bis zu 66% gesenkt werden.
Die Funktion ist ab heute für Video-Uploads und YouTube-Videos über die Gemini API in Google AI Studio und der Gemini Enterprise Agent Platform verfügbar. Entwickler können sie aktivieren, indem sie die API-Verarbeitung auf "agentic" setzen.
Rohan Doshi, Senior Product Manager bei Google DeepMind, und Mario Lučić, Research Director bei Google DeepMind, sagten, die neue agentische Funktion für die Videoanalyse könne den Tokenverbrauch um bis zu 88% senken, die Kosten um bis zu 66% reduzieren und die Qualität um bis zu 7% verbessern.
Laut Google DeepMind ähnelt agentisches Video-Verständnis dem agentischen Sehen, das Code-Ausführung mit dem nativen Bildverständnis von Gemini-Modellen kombiniert. Das Unternehmen erklärte, das Video-Tool nutze Geminis native Videofunktionen, um die Leistung zu verbessern und Anwendungsfälle wie die Abrufung von Momenten im Subsekundenbereich, genauere Anomalieerkennung, präzises Zählen und weitere Videoverarbeitungsaufgaben zu unterstützen. Besonders relevant ist das für Entwickler, die mit längeren Clips arbeiten, bei denen die Verarbeitung mit fester Rate kurzlebige Details verpassen oder zu höherem Tokenverbrauch führen kann.
Benchmarks
Google DeepMind erklärte, dass die derzeitige statische Verarbeitung Video in der Regel mit einer festen Bilder-pro-Sekunde-Rate einliest, standardmäßig 1 FPS, die über die API angepasst werden kann. Im Gegensatz dazu kombiniert agentisches Video-Verständnis das Kernschlussfolgern des Modells mit nativen Video-Tools, um gezielt Videosegmente über Bildraten, Audio und Transkripte hinweg dynamisch zu durchsuchen, zu scannen und zu prüfen.
In standardisierten Videoanalyse-Benchmarks senken Gemini-Modelle mit agentischem Video-Verständnis laut Unternehmen die Analysekosten um bis zu 66% und den Tokenverbrauch um bis zu 88%, während sie die Genauigkeit um bis zu 7% verbessern.
Das Unternehmen sagte, diese Vorteile seien besonders bei Langform-Videos auffällig, darunter 10-minütige Anleitungen, 90-minütige Vorlesungen und mehrstündige Aufzeichnungen, in denen die statische Verarbeitung Entwickler zwingt, zwischen hohen Tokenkosten und Verfahren zu wählen, die wichtige Details auslassen können.
Google DeepMind sagte, dass die Aktivierung von agentischem Video-Verständnis den Tokenverbrauch bei Gemini 3.7 Flash um bis zu 88% senkt und die Genauigkeit um bis zu 7% erhöht. Das Unternehmen ergänzte, dass Gemini 3.7 Flash mit agentischem Verständnis zwar über alle drei unterstützten Modelle hinweg von den Verbesserungen profitiere, aber insgesamt die beste Qualität sowie die stärkste Balance aus Qualität und Kosteneffizienz unter den getesteten Modellen für Videoverständnis biete.
Wie es funktioniert
Statt statischer Verarbeitung, bei der das Modell Medienströme mit einer festen Bildrate einliest, ermöglicht agentisches Video-Verständnis Gemini zu entscheiden, was beobachtet werden soll, mit welcher Geschwindigkeit und über welche Modalität (Bilder, Audio oder Transkript). Das System ruft nur die für die Aufgabe benötigten Momente und Signale ab.
Google DeepMind erklärte, dass Entwickler diesen Prozess zuvor manuell durchführen konnten. Mit agentischem Video-Verständnis kann Gemini dies jedoch in einer agentischen Schleife erledigen, indem ein internes Tool aufgerufen wird, um den relevanten Teil der Videodatei zu laden. Das Unternehmen sagte, dies reduziere den Entwicklungsaufwand erheblich.
Fähigkeiten und Anwendungsfälle
Google DeepMind sagte, agentisches Video-Verständnis verändere, wie Entwickler Langform-Videoinhalte für eine Reihe anspruchsvoller Anwendungen verarbeiten können.
- Abruf von Momenten im Subsekundenbereich: Erkennen Sie Zustandsänderungen im Bruchteil einer Sekunde und enge Schnittgrenzen, die bei 1 FPS leicht übersehen werden, und ermöglichen Sie so präzises automatisiertes Videoschneiden.
- Langform-Suche nach der Nadel im Heuhaufen: Beantworten Sie komplexe Fragen über mehrstündige Videos hinweg, ohne Millionen von Tokens zu verbrauchen.
- Anomalieerkennung: Wichtige Zeitfenster mit höherer FPS erneut abtasten, um schnelle Bewegungen und subtile visuelle Artefakte zu untersuchen.
- Zählen von Aktionen & Objekten: Wiederholte körperliche Bewegungen und unterschiedliche Objekte im Zeitverlauf präzise verfolgen.
Token-effiziente Analyse von Langform-Videos
Google DeepMind sagte, dass Gemini 3.7 Flash auf LongVideoBench, einem Benchmark für das Verständnis von Langform-Videos, mit agentischem Video-Verständnis deutliche Reduzierungen beim Tokenverbrauch und Verbesserungen bei der Genauigkeit zeigt. Für Teams, die Tools für Review, Moderation, Suche oder Analytik entwickeln, könnten diese Vorteile den Kompromiss zwischen Abdeckungstiefe und den Kosten für die Prüfung jedes einzelnen Frames verringern.
Präzise Analyse schneller Bewegungen mit dynamischer FPS
Mit agentischem Video-Verständnis kann 3.7 Flash eine schnelle Bewegung präzise zählen, indem das Video je nach Bedarf mit unterschiedlichen Bildern pro Sekunde gescannt und erneut angesehen wird.
Token-effiziente Suche nach der Nadel im Heuhaufen
Mit agentischem Video-Verständnis kann Gemini 3.7 komplexe Fragen auf Basis des Videoinhalts beantworten und dabei laut Google DeepMind deutlich weniger Tokens verbrauchen als bei statischer Analyse.
Ergebnisse aus der Praxis
Google DeepMind sagte, viele Early-Access-Partner hätten beim Testen von agentischem Video-Verständnis eine starke Leistung beobachtet.
Einstieg
Agentisches Video-Verständnis ist über die Gemini API in Google AI Studio und der Gemini Enterprise Agent Platform verfügbar und startet auf Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite. Google DeepMind sagte, es gelte die reguläre Gemini-API-Token-Bepreisung ohne zusätzliche Funktionsgebühr.
Um die Funktion zu aktivieren, sollten Entwickler die Verarbeitung in der API-Konfiguration auf "agentic" setzen. Google DeepMind verwies außerdem auf seinen Entwicklerleitfaden für weitere Informationen zum Einstieg.
Das Unternehmen sagte, es bringe die Effizienz- und Qualitätsverbesserungen des agentischen Video-Verständnisses auch zu Nutzern in Google-Produkten. Die Funktion wird in Kürze für alle Nutzer in der Gemini-App über Flash- und Flash-Lite-Modelle ausgerollt. In den kommenden Monaten wird agentisches Video-Verständnis laut Google DeepMind auch YouTubes Funktion „Ask YouTube“ auf der Wiedergabeseite des Videos antreiben und Gemini nutzen, um höherwertige Antworten zu liefern, die auf den visuellen Inhalten basieren.
Google DeepMind würdigte die Beiträge von Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin und dem Agentic Vision-Team.