НовостиМакроGoogle DeepMind запускает агентное понимание видео для Gemini

Google DeepMind запускает агентное понимание видео для Gemini

Автор: Google DeepMind Blog·

Ключевые выводы

  • Агентное понимание видео уже доступно для загрузок видео и видео с YouTube через Google AI Studio и Gemini Enterprise Agent Platform.
  • Google DeepMind заявила, что функция может сократить потребление токенов до 88%, снизить затраты до 66% и повысить точность до 7%.
  • Инструмент позволяет Gemini динамически выбирать, какие моменты видео, кадры, аудио или транскрипты анализировать, вместо обработки с фиксированной частотой.
  • Google заявила, что функция особенно полезна для длинных видео-задач, таких как поиск моментов, выявление аномалий, подсчёт и сложный поиск по многчасовым роликам.
  • Вскоре возможность появится в приложении Gemini, а позже будет поддерживать функцию YouTube «Ask YouTube» на странице просмотра видео.
Google DeepMind запускает агентное понимание видео для Gemini

Google DeepMind запускает агентное понимание видео для Gemini

1 сент. 2026

Google DeepMind запустила агентное понимание видео для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Компания заявляет, что новая функция позволяет модели динамически сканировать фрагменты видео, повышая точность и одновременно сокращая использование токенов до 88% и затраты до 66%.

Функция уже доступна для загрузок видео и видео с YouTube через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Разработчики могут включить её, установив параметр обработки API на "agentic".

Rohan Doshi, Senior Product Manager в Google DeepMind, и Mario Lučić, Research Director в Google DeepMind, заявили, что новая агентная функция для анализа видео может сократить потребление токенов до 88%, снизить затраты до 66% и повысить качество до 7%.

По словам Google DeepMind, агентное понимание видео похоже на agentic vision, которое объединяет выполнение кода с нативным пониманием изображений моделями Gemini. Компания заявила, что видеоинструмент использует нативные возможности Gemini для работы с видео, чтобы повысить производительность и поддержать такие сценарии, как поиск моментов длительностью менее секунды, более точное выявление аномалий, точный подсчёт и другие задачи обработки видео. Это особенно важно для разработчиков, работающих с длинными роликами, где обработка с фиксированной частотой может упускать кратковременные детали или требовать большего числа токенов.

Бенчмарки

Google DeepMind заявила, что текущая статическая обработка обычно загружает видео с фиксированной частотой кадров в секунду, по умолчанию 1 FPS, которую можно изменить через API. В отличие от этого, агентное понимание видео сочетает основное рассуждение модели с нативными видеоинструментами, чтобы динамически искать, сканировать и проверять целевые фрагменты видео по визуальным кадрам, аудио и транскриптам.

По стандартным бенчмаркам анализа видео модели Gemini с агентным пониманием видео сокращают затраты на анализ до 66% и потребление токенов до 88%, одновременно повышая точность до 7%, заявила компания.

Компания отметила, что эти преимущества особенно заметны для длинного видео, включая 10-минутные обучающие ролики, 90-минутные лекции и многчасовые записи, где статическая обработка заставляет разработчиков выбирать между высокими затратами на токены и методами, которые могут упускать важные детали.

Google DeepMind заявила, что включение агентного понимания видео снижает потребление токенов до 88% и повышает точность до 7% в Gemini 3.7 Flash. Компания добавила, что, хотя преимущества распространяются на все три поддерживаемые модели, Gemini 3.7 Flash с агентным пониманием обеспечивает наилучшее общее качество и наиболее удачное сочетание качества и эффективности по затратам среди протестированных моделей для понимания видео.

Как это работает

Вместо статической обработки, при которой модель загружает медиапотоки с фиксированной частотой кадров, агентное понимание видео позволяет Gemini самостоятельно определять, что смотреть, с какой скоростью смотреть и использовать ли кадры, аудио или данные транскрипта. Система извлекает только те моменты и сигналы, которые нужны для задачи.

Google DeepMind заявила, что раньше разработчики могли выполнять этот процесс вручную, но с агентным пониманием видео Gemini может делать это через агентный цикл, вызывая внутренний инструмент для загрузки соответствующей части видеофайла. Компания отметила, что это значительно снижает трудозатраты на разработку.

Возможности и сценарии использования

Google DeepMind заявила, что агентное понимание видео меняет подход разработчиков к обработке длинного видеоконтента в ряде требовательных сценариев.

  • Поиск моментов длительностью менее секунды: точно определять изменения состояния, происходящие за доли секунды, и тесные монтажные границы, которые легко пропустить при 1 FPS, что делает возможным точный автоматизированный видеомонтаж.
  • Поиск иголки в стоге сена в длинных видео: отвечать на сложные запросы по многчасовым видео без расходования миллионов токенов.
  • Выявление аномалий: пересэмплировать интересные временные окна с более высокой FPS, чтобы изучать быстрое движение и тонкие визуальные артефакты.
  • Подсчёт действий и объектов: точно отслеживать повторяющиеся физические движения и отдельные объекты во времени.

Эффективный по токенам анализ длинных видео

Google DeepMind заявила, что Gemini 3.7 Flash показывает значительное сокращение токенов и улучшение точности при использовании агентного понимания видео на LongVideoBench, бенчмарке для понимания длинного видео. Для команд, создающих инструменты проверки, модерации, поиска или аналитики, эти результаты могут снизить компромисс между широтой охвата и стоимостью проверки каждого кадра.

Точный анализ быстрых действий с динамической FPS

С агентным пониманием видео 3.7 Flash может точно подсчитывать быстрое движение, сканируя и пересматривая видео при разной частоте кадров в секунду по мере необходимости.

Эффективный поиск иголки в стоге сена

Используя агентное понимание видео, Gemini 3.7 может отвечать на сложные вопросы на основе содержимого видео, потребляя значительно меньше токенов, чем при статическом анализе, заявила Google DeepMind.

Практические результаты

Google DeepMind заявила, что многие партнёры раннего доступа показали высокие результаты при тестировании агентного понимания видео.

Начало работы

Агентное понимание видео доступно через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, начиная с Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Google DeepMind заявила, что используется стандартное ценообразование Gemini API на токены без дополнительной платы за функцию.

Чтобы включить функцию, разработчикам нужно установить обработку на "agentic" в конфигурации API. Google DeepMind также направила читателей к руководству для разработчиков, чтобы получить больше информации о начале работы.

Компания также заявила, что переносит преимущества агентного понимания видео по эффективности и качеству на пользователей во всех продуктах Google. Функция скоро станет доступна всем пользователям приложения Gemini во всех моделях Flash и Flash-Lite. В ближайшие месяцы, по словам Google DeepMind, агентное понимание видео также будет использоваться в функции YouTube «Ask YouTube» на странице просмотра видео, где Gemini поможет давать более качественные ответы, основанные на визуальном содержимом.

Google DeepMind поблагодарила Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin и команду Agentic Vision за вклад в эту работу.