Google DeepMind 為 Gemini 推出 agentic 影片理解
重點速覽
- •Agentic 影片理解現已可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API,用於影片上傳與 YouTube 影片。
- •Google DeepMind 表示,這項功能可將 token 消耗最多降低 88%、成本最多降低 66%,並將準確度最多提升 7%。
- •該工具讓 Gemini 可動態選擇要檢視哪些影片時刻、影格、音訊或逐字稿,而不是使用固定速率處理。
- •Google 表示,這項功能特別適合長篇影片任務,例如時刻檢索、異常偵測、計數,以及跨數小時影片的複雜搜尋。
- •這項能力將很快擴展到 Gemini app,之後也會支援 YouTube 觀看頁面的 “Ask YouTube” 功能。

Google DeepMind 為 Gemini 推出 agentic 影片理解
2026 年 9 月 1 日
Google DeepMind 已為 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 推出 agentic 影片理解。公司表示,這項新功能可讓模型動態掃描影片片段,在提升準確度的同時,將 token 使用量最多降低 88%,成本最多降低 66%。
這項能力現已可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API,用於影片上傳與 YouTube 影片。開發者可在 API 中將處理模式設為 "agentic" 以啟用此功能。
Google DeepMind 的 Senior Product Manager Rohan Doshi 與 Research Director Mario Lučić 表示,這項新推出的影片分析 agentic 功能可將 token 消耗最多降低 88%、成本最多降低 66%,並將品質最多提升 7%。
根據 Google DeepMind 的說法,agentic 影片理解與 agentic vision 類似,後者結合了程式碼執行與 Gemini 模型原生的影像理解能力。公司表示,這項影片工具利用 Gemini 的原生影片能力提升效能,並支援包括次秒級時刻檢索、更準確的異常偵測、精準計數,以及其他影片處理任務等應用。對於處理長篇影片的開發者而言,這尤其重要,因為固定速率處理可能錯過短暫細節,或迫使使用更高的 token。
基準測試
Google DeepMind 表示,目前的靜態處理通常會以固定的每秒影格數匯入影片,預設為 1 FPS,但可透過 API 調整。相較之下,agentic 影片理解會將模型的核心推理與原生影片工具結合,動態搜尋、掃描並檢查目標影片片段,涵蓋視覺影格、音訊與逐字稿。
公司表示,在標準影片分析基準測試中,具備 agentic 影片理解能力的 Gemini 模型可將分析成本最多降低 66%、token 消耗最多降低 88%,同時將準確度最多提升 7%。
公司指出,這些效益在長篇影片上尤其明顯,包括 10 分鐘的操作教學、90 分鐘的講座,以及數小時的錄影;在這些情境下,靜態處理會迫使開發者在高 token 成本與可能遺漏重要細節的方法之間做出取捨。
Google DeepMind 表示,在 Gemini 3.7 Flash 上啟用 agentic 影片理解後,token 消耗最多可降低 88%,準確度最多可提升 7%。公司補充說,雖然這些收益適用於三個支援的模型,但具備 agentic 理解能力的 Gemini 3.7 Flash 在整體品質與品質/成本效率的平衡上表現最佳,位居影片理解測試模型的 accuracy-to-cost pareto frontier。
運作方式
不同於模型以固定影格速率匯入媒體串流的靜態處理方式,agentic 影片理解讓 Gemini 主動決定要看哪些內容、以多快的速度觀看,以及透過哪種模態(影格、音訊或逐字稿)進行分析,只取得任務所需的時刻與訊號。
Google DeepMind 表示,開發者過去可以手動完成這項流程;而在 agentic 影片理解下,Gemini 可透過 agentic loop 呼叫內部工具載入影片檔案的相關部分,進而大幅降低開發負擔。
功能與使用情境
Google DeepMind 表示,agentic 影片理解改變了開發者處理長篇影片內容的方式,適用於多種高要求應用。
- 次秒級時刻檢索: 精準定位在 1 FPS 下容易錯過的瞬間狀態變化與緊密剪輯邊界,讓精準的自動化影片剪輯成為可能。
- 長篇海底撈針式搜尋: 在數小時影片中回答複雜問題,而不必消耗數百萬個 token。
- 異常偵測: 以更高 FPS 重新取樣有趣的時間區段,以檢查快速動作與細微視覺瑕疵。
- 動作與物件計數: 準確追蹤重複的身體動作與不同物件隨時間的變化。
高 token 效率的長篇影片分析
Google DeepMind 表示,Gemini 3.7 Flash 在 LongVideoBench 這項長篇影片理解基準上,搭配 agentic 影片理解時可顯著降低 token 並提升準確度。對於建立審核、檢索或分析工具的團隊而言,這些效益可降低覆蓋廣度與逐幀檢查成本之間的取捨。
以動態 FPS 進行準確的快速動作分析
在 agentic 影片理解下,3.7 Flash 可依需要以不同每秒影格數掃描並重看影片,準確計數快速動作。
高 token 效率的海底撈針式搜尋
Google DeepMind 表示,使用 agentic 影片理解時,Gemini 3.7 可根據影片內容準確回答複雜問題,同時消耗的 token 明顯少於靜態分析。
真實世界結果
Google DeepMind 表示,許多早期存取合作夥伴在測試 agentic 影片理解時都看到了強勁表現。
如何開始使用
Agentic 影片理解可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API 使用,並將隨 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 一同推出。Google DeepMind 表示,此功能採用標準 Gemini API token 計價,沒有額外功能費用。
要啟用此功能,只需在 API 設定中將 processing 設為 "agentic"。Google DeepMind 也建議讀者參考其開發者指南,以了解更多功能細節與入門資訊。
公司表示,也正在將 agentic 影片理解的效率與品質提升帶給 Google 產品中的數十億使用者。此功能將很快向 Gemini app 中所有 Flash 與 Flash-Lite 模型使用者推出。未來幾個月內,agentic 影片理解也將支援 YouTube 影片觀看頁面的 “Ask YouTube” 功能,利用 Gemini 提供更高品質、以視覺內容為基礎的答案。
Google DeepMind 感謝 Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin,以及 Agentic Vision 團隊對此工作的貢獻。