Google DeepMind lancia la comprensione video agentica per Gemini
Punti chiave
- •La comprensione video agentica è disponibile da oggi per upload video e video YouTube tramite Google AI Studio e la Gemini Enterprise Agent Platform.
- •Google DeepMind ha affermato che la funzionalità può ridurre il consumo di token fino all’88%, abbassare i costi fino al 66% e migliorare l’accuratezza fino al 7%.
- •Lo strumento consente a Gemini di scegliere dinamicamente quali momenti, frame, audio o trascrizioni video ispezionare invece di usare un’elaborazione a ritmo fisso.
- •Google ha affermato che la funzionalità è particolarmente utile per attività video di lunga durata come il recupero di momenti, il rilevamento di anomalie, il conteggio e la ricerca complessa su clip di più ore.
- •La capacità sarà presto estesa all’app Gemini e successivamente supporterà la funzione “Ask YouTube” di YouTube nella pagina di visione del video.

Google DeepMind lancia la comprensione video agentica per Gemini
1 set 2026
Google DeepMind ha lanciato la comprensione video agentica per Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. L’azienda afferma che la nuova funzionalità consente al modello di analizzare dinamicamente i segmenti video, migliorando l’accuratezza e riducendo l’uso di token fino all’88% e i costi fino al 66%.
La funzionalità è disponibile da oggi per upload video e video YouTube tramite la Gemini API in Google AI Studio e nella Gemini Enterprise Agent Platform. Gli sviluppatori possono abilitarla impostando l’elaborazione API su "agentic".
Rohan Doshi, Senior Product Manager di Google DeepMind, e Mario Lučić, Research Director di Google DeepMind, hanno affermato che la nuova funzionalità agentica per l’analisi video può ridurre il consumo di token fino all’88%, abbassare i costi fino al 66% e migliorare la qualità fino al 7%.
Secondo Google DeepMind, la comprensione video agentica è simile all’agentic vision, che combina l’esecuzione di codice con la comprensione nativa delle immagini dei modelli Gemini. L’azienda ha affermato che lo strumento video utilizza le capacità video native di Gemini per migliorare le prestazioni e supportare casi d’uso tra cui il recupero di momenti in meno di un secondo, un rilevamento delle anomalie più accurato, il conteggio preciso e altre attività di elaborazione video. Ciò è particolarmente rilevante per gli sviluppatori che lavorano con clip di lunga durata, in cui l’elaborazione a ritmo fisso può perdere dettagli di breve durata o comportare un uso più elevato di token.
Benchmark
Google DeepMind ha affermato che l’attuale elaborazione statica in genere acquisisce il video a un frame rate fisso, con un valore predefinito di 1 FPS che può essere modificato tramite l’API. Al contrario, la comprensione video agentica abbina il ragionamento principale del modello agli strumenti video nativi per cercare, analizzare e ispezionare dinamicamente segmenti video mirati attraverso frame visivi, audio e trascrizioni.
Secondo l’azienda, sui benchmark standard di analisi video, i modelli Gemini con comprensione video agentica riducono i costi di analisi fino al 66% e il consumo di token fino all’88%, migliorando al tempo stesso l’accuratezza fino al 7%.
L’azienda ha affermato che questi vantaggi sono particolarmente evidenti nei video di lunga durata, inclusi tutorial da 10 minuti, lezioni da 90 minuti e registrazioni di più ore, dove l’elaborazione statica costringe gli sviluppatori a scegliere tra costi elevati in token e metodi che possono omettere dettagli importanti.
Google DeepMind ha affermato che l’attivazione della comprensione video agentica riduce il consumo di token fino all’88% e aumenta l’accuratezza fino al 7% con Gemini 3.7 Flash. L’azienda ha aggiunto che, sebbene i vantaggi valgano per tutti e tre i modelli supportati, Gemini 3.7 Flash con comprensione agentica offre la migliore qualità complessiva e il miglior equilibrio tra qualità ed efficienza dei costi tra i modelli testati per la comprensione video.
Come funziona
Invece dell’elaborazione statica, in cui il modello acquisisce i flussi multimediali a un frame rate fisso, la comprensione video agentica consente a Gemini di decidere attivamente cosa guardare, a quale velocità e tramite quale modalità (frame, audio o trascrizione). Il sistema recupera solo i momenti e i segnali necessari per l’attività.
Google DeepMind ha affermato che in precedenza gli sviluppatori potevano eseguire questo processo manualmente, ma con la comprensione video agentica Gemini può gestirlo tramite un ciclo agentico, richiamando uno strumento interno per caricare la parte pertinente del file video. L’azienda ha affermato che ciò riduce in modo significativo il carico di sviluppo.
Capacità e casi d’uso
Google DeepMind ha affermato che la comprensione video agentica cambia il modo in cui gli sviluppatori possono elaborare contenuti video di lunga durata in una serie di applicazioni complesse.
- Recupero di momenti in meno di un secondo: individua cambiamenti di stato in frazioni di secondo e confini di taglio molto ravvicinati che sono facili da perdere a 1 FPS, consentendo un editing video automatico preciso.
- Ricerca needle-in-a-haystack su contenuti di lunga durata: risponde a domande complesse su video di più ore senza consumare milioni di token.
- Rilevamento anomalie: ricampiona finestre temporali interessanti a FPS più elevati per esaminare movimenti rapidi e sottili artefatti visivi.
- Conteggio di azioni e oggetti: traccia con precisione movimenti fisici ripetuti e oggetti distinti nel tempo.
Analisi video di lunga durata efficiente in termini di token
Google DeepMind ha affermato che Gemini 3.7 Flash mostra forti riduzioni dei token e miglioramenti dell’accuratezza con la comprensione video agentica su LongVideoBench, un benchmark per la comprensione video di lunga durata. Per i team che sviluppano strumenti di revisione, moderazione, ricerca o analisi, questi vantaggi potrebbero ridurre il compromesso tra ampiezza della copertura e costo dell’ispezione di ogni frame.
Analisi accurata di azioni rapide con FPS dinamico
Con la comprensione video agentica, 3.7 Flash può contare con precisione un movimento rapido analizzando e rivedendo il video a diversi frame per secondo, secondo necessità.
Ricerca needle-in-a-haystack efficiente in termini di token
Utilizzando la comprensione video agentica, Gemini 3.7 può rispondere con precisione a domande complesse basate sul contenuto del video consumando significativamente meno token rispetto all’analisi statica, ha affermato Google DeepMind.
Risultati nel mondo reale
Google DeepMind ha affermato che molti partner in accesso anticipato hanno registrato prestazioni solide durante i test della comprensione video agentica.
Come iniziare
La comprensione video agentica è disponibile tramite la Gemini API in Google AI Studio e nella Gemini Enterprise Agent Platform, ed è in rollout su Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. Google DeepMind ha affermato che utilizza la tariffazione standard dei token della Gemini API, senza costi aggiuntivi per la funzionalità.
Per abilitarla, gli sviluppatori devono semplicemente impostare l’elaborazione su "agentic" nella configurazione API. Google DeepMind ha inoltre rimandato alla propria guida per sviluppatori per ulteriori informazioni su come iniziare.
L’azienda ha anche affermato di stare portando i miglioramenti di efficienza e qualità della comprensione video agentica a utenti di tutti i prodotti Google. La funzionalità sarà estesa presto a tutti gli utenti dell’app Gemini sui modelli Flash e Flash-Lite. Nei prossimi mesi, Google DeepMind ha affermato che la comprensione video agentica alimenterà anche la funzione di YouTube “Ask YouTube” nella pagina di visione del video, sfruttando Gemini per fornire risposte di qualità superiore basate sugli elementi visivi.
Google DeepMind ha riconosciuto il contributo di Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin e del team Agentic Vision.