Google DeepMind 推出面向 Gemini 的智能代理式视频理解
要点速览
- •agentic video understanding 现已可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 用于视频上传和 YouTube 视频。
- •Google DeepMind 表示,该功能可将 token 消耗最多减少 88%、成本最多降低 66%,并将准确性最多提升 7%。
- •该工具允许 Gemini 动态选择要检查的视频时刻、帧、音频或转录文本,而不是采用固定速率处理。
- •Google 表示,该功能尤其适用于亚秒级时刻检索、异常检测、计数以及跨数小时视频的复杂搜索等长视频任务。
- •该能力将很快扩展至 Gemini 应用,并在后续支持 YouTube 视频观看页面上的 “Ask YouTube” 功能。

Google DeepMind 推出面向 Gemini 的智能代理式视频理解
2026年9月1日
Google DeepMind 已为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能代理式视频理解。公司表示,这项新功能可让模型动态扫描视频片段,在提升准确性的同时,将 token 使用量最多减少 88%,并将成本最多降低 66%。
该能力现已可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 用于视频上传和 YouTube 视频。开发者可通过将 API 处理设置为 "agentic" 来启用该功能。
Google DeepMind 的 Senior Product Manager Rohan Doshi 和 Research Director Mario Lučić 表示,这项用于视频分析的智能代理式功能可将 token 消耗最多减少 88%,成本最多降低 66%,并将质量最多提升 7%。
据 Google DeepMind 介绍,agentic video understanding 与 agentic vision 类似,后者将代码执行与 Gemini 模型原生图像理解相结合。公司表示,这一视频工具利用 Gemini 的原生视频能力提升性能,并支持包括亚秒级时刻检索、更准确的异常检测、精确计数以及其他视频处理任务在内的用例。对于处理长视频片段的开发者而言,这一点尤为重要,因为固定速率处理可能错过短暂细节,或迫使使用更多 token。
基准测试
Google DeepMind 表示,当前的静态处理通常以固定的每秒帧数摄入视频,默认值为 1 FPS,但可通过 API 调整。相比之下,agentic video understanding 将模型的核心推理与原生视频工具结合起来,可在视觉帧、音频和转录文本之间动态搜索、扫描和检查目标视频片段。
公司表示,在标准视频分析基准上,具备智能代理式视频理解能力的 Gemini 模型可将分析成本最多降低 66%,token 消耗最多降低 88%,同时将准确性最多提升 7%。
公司称,这些提升在长视频内容上尤为明显,包括 10 分钟教程、90 分钟讲座以及数小时录制内容;在这些场景中,静态处理会迫使开发者在高 token 成本与可能遗漏重要细节的方法之间做出选择。
Google DeepMind 表示,在 Gemini 3.7 Flash 中启用 agentic video understanding 后,token 消耗最多可降低 88%,准确性最多可提升 7%。公司补充称,尽管这些提升适用于全部三款受支持模型,但在视频理解测试中,带有智能代理式理解能力的 Gemini 3.7 Flash 提供了最佳整体质量,以及在质量与成本效率之间最强的平衡。
工作原理
与模型以固定帧率摄入媒体流的静态处理不同,agentic video understanding 允许 Gemini 决定要查看什么、以多快速度查看,以及使用哪种模态(帧、音频或转录文本),并只提取任务所需的时刻和信号。
Google DeepMind 表示,开发者此前可以手动完成这一流程;而在 agentic video understanding 下,Gemini 可通过智能代理循环自动完成,调用内部工具加载视频文件的相关部分,从而显著降低开发开销。
能力与用例
Google DeepMind 表示,agentic video understanding 改变了开发者处理长视频内容的方式,适用于多种高要求应用。
- 亚秒级时刻检索: 精确定位数秒内的状态变化和紧密剪切边界,这些内容在 1 FPS 下很容易被遗漏,从而支持精确的自动化视频编辑。
- 长视频“海底捞针”检索: 在数小时视频中回答复杂问题,而不会消耗数百万 token。
- 异常检测: 以更高 FPS 对感兴趣的时间窗口重新采样,以检查快速运动和细微视觉伪影。
- 动作与对象计数: 准确跟踪重复的物理动作和不同对象随时间的变化。
面向长视频的高 token 效率分析
Google DeepMind 表示,在 LongVideoBench 这一长视频理解基准上,Gemini 3.7 Flash 在启用 agentic video understanding 后显示出显著的 token 减少和准确性提升。对于构建审核、内容管理、搜索或分析工具的团队而言,这些提升有助于缓解覆盖范围与逐帧检查成本之间的权衡。
借助动态 FPS 进行准确的快速动作分析
在 agentic video understanding 下,3.7 Flash 可根据需要以不同每秒帧数扫描并重放视频,从而准确统计高速动作。
高 token 效率的“海底捞针”检索
Google DeepMind 表示,使用 agentic video understanding 时,Gemini 3.7 可基于视频内容准确回答复杂问题,同时相比静态分析消耗显著更少的 token。
实际结果
Google DeepMind 表示,许多早期访问合作伙伴在测试 agentic video understanding 时都观察到了良好表现。
开始使用
agentic video understanding 可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 使用,并将率先登陆 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。Google DeepMind 表示,该功能采用标准 Gemini API token 定价,不收取额外功能费用。
要启用该功能,开发者只需在 API 配置中将 processing 设置为 "agentic"。Google DeepMind 还指引读者查看其开发者指南,以了解更多上手信息。
公司表示,也将把 agentic video understanding 的效率和质量提升带给 Google 各产品中的数十亿用户。该功能将很快向 Gemini 应用中所有用户开放,覆盖 Flash 和 Flash-Lite 模型。未来几个月内,Google DeepMind 还表示,agentic video understanding 将为 YouTube 视频观看页面上的 “Ask YouTube” 功能提供支持,利用 Gemini 基于视觉信息提供更高质量的答案。
Google DeepMind 对 Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin 以及 Agentic Vision 团队为该工作作出的贡献表示感谢。