Google DeepMind lanza comprensión de video agentic para Gemini
Puntos clave
- •La comprensión de video agentic está disponible hoy para cargas de video y videos de YouTube a través de Google AI Studio y la Gemini Enterprise Agent Platform.
- •Google DeepMind dijo que la función puede reducir el consumo de tokens hasta en 88%, bajar los costos hasta en 66% y mejorar la precisión hasta en 7%.
- •La herramienta permite que Gemini elija dinámicamente qué momentos, cuadros, audio o transcripciones revisar, en lugar de usar un procesamiento a velocidad fija.
- •Google dijo que la función es especialmente útil para tareas de video de larga duración, como recuperación de momentos, detección de anomalías, conteo y búsquedas complejas en clips de varias horas.
- •La capacidad se expandirá pronto a la app de Gemini y más adelante dará soporte a la función “Ask YouTube” de YouTube en la página de reproducción de video.

Google DeepMind lanza comprensión de video agentic para Gemini
1 de sep. de 2026
Google DeepMind ha lanzado la comprensión de video agentic para Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. La compañía afirma que la nueva función permite al modelo escanear dinámicamente segmentos de video, lo que mejora la precisión al tiempo que reduce el uso de tokens hasta en 88% y los costos hasta en 66%.
La capacidad está disponible hoy para cargas de video y videos de YouTube a través de la API de Gemini en Google AI Studio y la Gemini Enterprise Agent Platform. Los desarrolladores pueden habilitarla configurando el procesamiento de la API en "agentic".
Rohan Doshi, Senior Product Manager de Google DeepMind, y Mario Lučić, Research Director de Google DeepMind, dijeron que la nueva función agentic para el análisis de video puede reducir el consumo de tokens hasta en 88%, bajar los costos hasta en 66% y elevar la calidad hasta en 7%.
Según Google DeepMind, la comprensión de video agentic es similar a agentic vision, que combina la ejecución de código con la comprensión nativa de imágenes de los modelos Gemini. La compañía afirmó que la herramienta de video usa las capacidades nativas de Gemini para mejorar el rendimiento y admitir casos de uso como recuperación de momentos de menos de un segundo, detección de anomalías más precisa, conteo exacto y otras tareas de procesamiento de video. Esto resulta especialmente relevante para desarrolladores que trabajan con clips de larga duración, donde el procesamiento a velocidad fija puede pasar por alto detalles breves o exigir un mayor uso de tokens.
Benchmarks
Google DeepMind señaló que el procesamiento estático actual normalmente ingiere video a una tasa fija de cuadros por segundo, con un valor predeterminado de 1 FPS que puede ajustarse mediante la API. En contraste, la comprensión de video agentic combina el razonamiento central del modelo con herramientas nativas de video para buscar, examinar e inspeccionar dinámicamente segmentos de video específicos a través de cuadros visuales, audio y transcripciones.
En benchmarks estándar de análisis de video, los modelos Gemini con comprensión de video agentic reducen los costos de análisis hasta en 66% y el consumo de tokens hasta en 88%, al tiempo que mejoran la precisión hasta en 7%, dijo la compañía.
La compañía indicó que estas mejoras son especialmente notables en video de larga duración, incluidos tutoriales de 10 minutos, clases de 90 minutos y grabaciones de varias horas, donde el procesamiento estático obliga a los desarrolladores a elegir entre costos altos de tokens y métodos que pueden omitir detalles importantes.
Google DeepMind dijo que activar la comprensión de video agentic reduce el consumo de tokens hasta en 88% y aumenta la precisión hasta en 7% con Gemini 3.7 Flash. La compañía añadió que, aunque las mejoras se aplican a los tres modelos compatibles, Gemini 3.7 Flash con comprensión agentic ofrece la mejor calidad general y el equilibrio más sólido entre calidad y eficiencia de costos entre los modelos probados para comprensión de video.
Cómo funciona
En lugar del procesamiento estático, en el que el modelo ingiere flujos de medios a una velocidad fija de cuadros, la comprensión de video agentic permite que Gemini decida qué mirar, a qué velocidad verlo y si usar cuadros, audio o datos de la transcripción. El sistema recupera solo los momentos y señales necesarios para la tarea.
Google DeepMind dijo que antes los desarrolladores podían realizar este proceso manualmente, pero con la comprensión de video agentic, Gemini puede manejarlo mediante un ciclo agentic al invocar una herramienta interna para cargar la parte relevante del archivo de video. La compañía afirmó que esto reduce de forma significativa la sobrecarga de desarrollo.
Capacidades y casos de uso
Google DeepMind señaló que la comprensión de video agentic cambia la forma en que los desarrolladores pueden procesar contenido de video de larga duración en una variedad de aplicaciones exigentes.
- Recuperación de momentos en menos de un segundo: Identifica cambios de estado de fracciones de segundo y límites de corte muy precisos que se pueden pasar por alto fácilmente a 1 FPS, lo que permite una edición automatizada de video precisa.
- Búsqueda de larga duración tipo needle-in-a-haystack: Responde consultas complejas en videos de varias horas sin consumir millones de tokens.
- Detección de anomalías: Vuelve a muestrear ventanas de tiempo interesantes a FPS más altos para inspeccionar movimientos rápidos y artefactos visuales sutiles.
- Conteo de acción & objeto: Sigue con precisión movimientos físicos repetidos y objetos distintos a lo largo del tiempo.
Análisis de video de larga duración eficiente en tokens
Google DeepMind dijo que Gemini 3.7 Flash muestra grandes reducciones de tokens y mejoras de precisión con la comprensión de video agentic en LongVideoBench, un benchmark de comprensión de video de larga duración. Para los equipos que construyen herramientas de revisión, moderación, búsqueda o analítica, esas mejoras podrían reducir la disyuntiva entre amplitud de cobertura y el costo de inspeccionar cada cuadro.
Análisis preciso de acciones rápidas con FPS dinámico
Con la comprensión de video agentic, 3.7 Flash puede contar con precisión un movimiento rápido al escanear y volver a ver el video a diferentes cuadros por segundo, según sea necesario.
Búsqueda eficiente de tipo needle-in-a-haystack
Usando la comprensión de video agentic, Gemini 3.7 puede responder con precisión preguntas complejas basadas en el contenido del video mientras consume significativamente menos tokens que el análisis estático, dijo Google DeepMind.
Resultados en el mundo real
Google DeepMind señaló que muchos socios de acceso temprano reportaron un rendimiento sólido mientras probaban la comprensión de video agentic.
Cómo comenzar
La comprensión de video agentic está disponible a través de la API de Gemini en Google AI Studio y Gemini Enterprise Agent Platform, y se lanza en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. Google DeepMind dijo que utiliza los precios estándar de tokens de la API de Gemini sin cargo adicional por la función.
Para habilitarla, los desarrolladores deben configurar el procesamiento como "agentic" en la API. Google DeepMind también remitió a los lectores a su guía para desarrolladores para obtener más información sobre cómo comenzar.
La compañía dijo que también está llevando las mejoras de eficiencia y calidad de la comprensión de video agentic a los usuarios de los productos de Google. La función se desplegará pronto para todos los usuarios en la app de Gemini en los modelos Flash y Flash-Lite. En los próximos meses, Google DeepMind dijo que la comprensión de video agentic también impulsará la función “Ask YouTube” de YouTube en la página de reproducción de video, usando Gemini para ofrecer respuestas de mayor calidad fundamentadas en las imágenes.
Google DeepMind agradeció las contribuciones de Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin y el equipo de Agentic Vision.