Google внедряет агентный подход к анализу видео в моделях Gemini
Google представила функцию агентного понимания видео для моделей Gemini, которая снижает потребление токенов до 88% и повышает точность за счет динамического сканирования медиафайлов.
Google представила функцию агентного понимания видео для моделей Gemini, которая снижает потребление токенов до 88% и повышает точность за счет динамического сканирования медиафайлов.
2 мин

Google DeepMind анонсировала запуск функции «агентного понимания видео» (agentic video understanding) для своего семейства моделей Gemini, включая версии 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Это обновление предлагает фундаментально иной подход к обработке видеоданных, который позволяет существенно снизить затраты при одновременном повышении качества анализа.
Традиционно мультимодальные модели обрабатывают видео «статично». Они разбивают видеоряд на кадры с фиксированной частотой (по умолчанию — один кадр в секунду) и анализируют их последовательно. Такой метод имеет очевидные недостатки: при работе с длинными видео (лекциями, записями конференций или обучающими материалами) разработчикам приходится выбирать между огромными затратами токенов на детальный анализ и риском упустить важные моменты при снижении частоты кадров.

Graphs analyzing token efficiency and accuracy gains
Агентный подход меняет эту парадигму. Теперь модель берет на себя активную, целенаправленную роль. Вместо пассивного поглощения всех кадров подряд, Gemini использует внутренние инструменты для динамического поиска и сканирования. Модель сама решает, какие фрагменты видео, аудиодорожки или текстовой расшифровки (транскрипта) требуют детального изучения, а какие можно пропустить.
Цифры подтверждают эффективность такого подхода. Согласно тестам на стандартных бенчмарках, использование агентного понимания видео снижает потребление токенов на величину до 88% и сокращает затраты на анализ до 66%. При этом точность ответов не только не падает, но и возрастает на величину до 7%. Модель Gemini 3.7 Flash с активированной функцией демонстрирует наилучшее соотношение цены и качества среди протестированных решений.

Graph with "Cost per query" on the x-axis and "Accuracy" on the y-axis
Новые возможности открывают путь к более сложным сценариям использования. Среди них — поиск конкретных моментов с точностью до долей секунды, что критично для автоматизированного монтажа. Также значительно упрощается поиск ответов на сложные вопросы в многочасовых видео (задача «иголка в стоге сена») и обнаружение аномалий, когда модель может локально повысить частоту кадров для изучения быстрых движений.
Функция уже доступна разработчикам через API в Google AI Studio и на платформе Gemini Enterprise Agent. Для ее активации достаточно указать параметр обработки как «agentic», при этом дополнительных сборов за использование функции не предусмотрено. В ближайшем будущем Google планирует развернуть эту технологию для обычных пользователей в приложении Gemini и интегрировать ее в функцию «Ask YouTube», что сделает глубокий анализ видео доступным массовой аудитории.
Переход от покадровой обработки видео к динамическому агентному сканированию позволяет нейросетям анализировать медиафайлы быстрее, дешевле и точнее.
Делегирование модели права самостоятельно решать, как именно смотреть видео (выбор скорости и фокуса внимания), парадоксальным образом решает проблему высокой стоимости обработки длинных медиафайлов.