ActualitésMacroGoogle DeepMind lance la compréhension vidéo agentique pour Gemini

Google DeepMind lance la compréhension vidéo agentique pour Gemini

Auteur: Google DeepMind Blog·

Points clés

  • La compréhension vidéo agentique est disponible dès aujourd’hui pour les téléversements vidéo et les vidéos YouTube via Google AI Studio et la Gemini Enterprise Agent Platform.
  • Google DeepMind a indiqué que cette fonctionnalité peut réduire la consommation de tokens jusqu’à 88 %, abaisser les coûts jusqu’à 66 % et améliorer la précision jusqu’à 7 %.
  • L’outil permet à Gemini de choisir dynamiquement quels moments, images, audios ou transcriptions vidéo analyser, au lieu d’utiliser un traitement à cadence fixe.
  • Google a indiqué que cette fonctionnalité est particulièrement utile pour les tâches vidéo longues, comme la récupération de moments, la détection d’anomalies, le comptage et la recherche complexe dans des clips de plusieurs heures.
  • La fonctionnalité sera bientôt étendue à l’application Gemini puis prendra en charge « Ask YouTube » sur la page de lecture de YouTube.
Google DeepMind lance la compréhension vidéo agentique pour Gemini

Google DeepMind lance la compréhension vidéo agentique pour Gemini

1er sept. 2026

Google DeepMind a lancé la compréhension vidéo agentique pour Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite. L’entreprise indique que cette nouvelle fonctionnalité permet au modèle d’analyser dynamiquement des segments vidéo, améliorant la précision tout en réduisant l’utilisation de tokens jusqu’à 88 % et les coûts jusqu’à 66 %.

La fonctionnalité est disponible dès aujourd’hui pour les téléversements vidéo et les vidéos YouTube via l’API Gemini dans Google AI Studio et la Gemini Enterprise Agent Platform. Les développeurs peuvent l’activer en définissant le traitement sur "agentic".

Rohan Doshi, Senior Product Manager chez Google DeepMind, et Mario Lučić, Research Director chez Google DeepMind, ont indiqué que cette nouvelle fonctionnalité agentique pour l’analyse vidéo peut réduire la consommation de tokens jusqu’à 88 %, diminuer les coûts jusqu’à 66 % et améliorer la qualité jusqu’à 7 %.

Selon Google DeepMind, la compréhension vidéo agentique est similaire à agentic vision, qui associe l’exécution de code à la compréhension native des images par les modèles Gemini. L’entreprise a précisé que l’outil vidéo utilise les capacités vidéo natives de Gemini pour améliorer les performances et prendre en charge des cas d’usage tels que la récupération de moments à la sous-seconde, une détection d’anomalies plus précise, un comptage exact et d’autres tâches de traitement vidéo. Cela est particulièrement important pour les développeurs travaillant sur des contenus longs, où un traitement à cadence fixe peut manquer des détails brefs ou imposer une utilisation plus élevée de tokens.

Benchmarks

Google DeepMind a expliqué que le traitement statique actuel ingère généralement la vidéo à un rythme fixe en images par seconde, avec une valeur par défaut de 1 FPS pouvant être ajustée via l’API. À l’inverse, la compréhension vidéo agentique associe le raisonnement central du modèle à des outils vidéo natifs afin de rechercher, analyser et inspecter dynamiquement des segments vidéo ciblés à travers les images, l’audio et les transcriptions.

Sur des benchmarks standard d’analyse vidéo, les modèles Gemini dotés de la compréhension vidéo agentique réduisent les coûts d’analyse jusqu’à 66 % et la consommation de tokens jusqu’à 88 %, tout en améliorant la précision jusqu’à 7 %, selon l’entreprise.

L’entreprise a indiqué que ces gains sont particulièrement marqués pour les vidéos longues, notamment des tutoriels de 10 minutes, des conférences de 90 minutes et des enregistrements de plusieurs heures, où le traitement statique oblige les développeurs à choisir entre des coûts élevés en tokens et des méthodes susceptibles d’omettre des détails importants.

Google DeepMind a précisé que l’activation de la compréhension vidéo agentique réduit la consommation de tokens jusqu’à 88 % et augmente la précision jusqu’à 7 % avec Gemini 3.7 Flash. L’entreprise a ajouté que, même si ces gains s’appliquent aux trois modèles pris en charge, Gemini 3.7 Flash avec la compréhension agentique offre la meilleure qualité globale et le meilleur équilibre entre qualité et efficacité des coûts parmi les modèles testés pour la compréhension vidéo.

Fonctionnement

Au lieu d’un traitement statique, où le modèle ingère des flux multimédias à cadence fixe, la compréhension vidéo agentique permet à Gemini de décider de manière active et orientée vers un objectif ce qu’il faut regarder, à quelle vitesse et via quel mode (images, audio ou transcription). Le système ne récupère que les moments et signaux nécessaires à la tâche.

Google DeepMind a indiqué que les développeurs pouvaient auparavant réaliser ce processus manuellement, mais qu’avec la compréhension vidéo agentique, Gemini peut le prendre en charge via une boucle agentique en invoquant un outil interne pour charger la partie pertinente du fichier vidéo. Selon l’entreprise, cela réduit considérablement la charge de développement.

Capacités et cas d’usage

Google DeepMind a déclaré que la compréhension vidéo agentique transforme la manière dont les développeurs peuvent traiter des contenus vidéo longs dans un large éventail d’applications exigeantes.

  • Récupération de moments à la sous-seconde : identifie des changements d’état en une fraction de seconde et des limites de coupe très serrées, faciles à manquer à 1 FPS, ce qui rend possible un montage vidéo automatisé précis.
  • Recherche longue de type aiguille dans une botte de foin : répond à des requêtes complexes dans des vidéos de plusieurs heures sans consommer des millions de tokens.
  • Détection d’anomalies : rééchantillonne des fenêtres temporelles intéressantes à un FPS plus élevé pour inspecter des mouvements rapides et des artefacts visuels subtils.
  • Comptage d’actions et d’objets : suit avec précision des mouvements physiques répétés et des objets distincts dans le temps.

Analyse vidéo longue et économe en tokens

Google DeepMind a indiqué que Gemini 3.7 Flash montre d’importantes réductions de tokens et des améliorations de précision avec la compréhension vidéo agentique sur LongVideoBench, un benchmark de compréhension vidéo longue durée. Pour les équipes qui développent des outils de revue, de modération, de recherche ou d’analyse, ces gains pourraient réduire le compromis entre l’étendue de la couverture et le coût de l’inspection de chaque image.

Analyse précise des actions rapides avec FPS dynamique

Avec la compréhension vidéo agentique, 3.7 Flash peut compter avec précision un mouvement rapide en analysant et en revisionnant la vidéo à différents nombres d’images par seconde, selon les besoins.

Recherche économe en tokens de type aiguille dans une botte de foin

En utilisant la compréhension vidéo agentique, Gemini 3.7 peut répondre avec précision à des questions complexes basées sur le contenu vidéo tout en consommant nettement moins de tokens que le traitement statique, a indiqué Google DeepMind.

Résultats concrets

Google DeepMind a indiqué que de nombreux partenaires en accès anticipé ont observé de bonnes performances lors des tests de compréhension vidéo agentique.

Premiers pas

La compréhension vidéo agentique est disponible via l’API Gemini dans Google AI Studio et la Gemini Enterprise Agent Platform, et est lancée sur Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite. Google DeepMind a précisé qu’elle utilise la tarification standard des tokens de l’API Gemini, sans frais supplémentaires liés à la fonctionnalité.

Pour l’activer, il suffit de définir le traitement sur "agentic" dans la configuration de l’API. Google DeepMind renvoie également à son guide développeur pour obtenir davantage d’informations sur la fonctionnalité et sur la manière de commencer.

L’entreprise a également indiqué qu’elle apporte les gains d’efficacité et de qualité de la compréhension vidéo agentique à des milliards d’utilisateurs dans l’ensemble des produits Google. La fonctionnalité sera bientôt déployée auprès de tous les utilisateurs de l’application Gemini sur les modèles Flash et Flash-Lite. Dans les mois à venir, la compréhension vidéo agentique alimentera également la fonctionnalité « Ask YouTube » de YouTube sur la page de lecture des vidéos, en s’appuyant sur Gemini pour fournir des réponses de meilleure qualité fondées sur les éléments visuels.

Remerciements pour leur contribution à ce travail : Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin et l’équipe Agentic Vision.

Recevez les dernières actualités de Google dans votre boîte de réception

Inscrivez-vous à nos newsletters pour recevoir des mises à jour produit, des informations sur les événements, des offres spéciales et bien plus encore.

C’est fait. Une étape encore.

Vérifiez votre boîte de réception pour confirmer votre abonnement.

Vous pouvez également vous abonner avec une autre adresse e-mail.

Vos informations seront utilisées conformément à la politique de confidentialité de Google. Vous pouvez vous désabonner à tout moment.

Articles associés

Les dernières actualités sur l’IA que nous avons annoncées en août 2026

Gemini Omni 1.1 Flash vous permet de créer avec davantage de contrôle

Transcription intelligente avec Gemini 3.5 Transcribe

Que signifie réellement l’IA « full-stack » ?

Présentation de Gemini 3.7 Flash

Des experts Omni expliquent ce qui les enthousiasme le plus à propos du modèle