Google запустила агентную обработку видео в Gemini: до 88% меньше токенов

Google запустила новую функцию для своих моделей Gemini, agentic video understanding (агентное понимание видео). Она доступна с сегодняшнего дня в трёх моделях: Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite, через Gemini API в Google AI Studio и через Gemini Enterprise Agent Platform, для загруженных видео и роликов YouTube.
Суть изменения, в способе обработки видео. Раньше модель обрабатывала ролик статично: разбивала его на кадры с фиксированной частотой (по умолчанию 1 кадр в секунду, частоту можно менять через API) и анализировала все кадры подряд. Это заставляло разработчиков выбирать между высоким расходом токенов и приёмами, которые теряют важные детали. В агентном режиме модель сама, в рамках внутреннего цикла вызовов инструментов, решает, какие фрагменты видео просмотреть, с какой скоростью и через какой канал, кадры, звук или транскрипт, и подгружает только нужные моменты.
По данным Google, на стандартных бенчмарках анализа видео агентный режим снижает стоимость анализа до 66%, расход токенов, до 88%, и при этом повышает точность до 7% по сравнению со статичной обработкой. Эффект сильнее всего проявляется на длинных видео, от десятиминутных туториалов до полуторачасовых лекций и многочасовых записей. Отдельно выделена модель Gemini 3.7 Flash: с агентным режимом она сокращает расход токенов до 88% и повышает точность до 7%, оказываясь на «парето-фронтире» соотношения точности и стоимости среди протестированных моделей для анализа видео.
Новый режим открывает несколько сценариев использования: субсекундный поиск конкретных моментов и точных границ склейки кадров (для автоматизированного видеомонтажа), поиск ответов на сложные запросы в многочасовых видео без траты миллионов токенов, обнаружение аномалий за счёт пересэмплирования интересных отрезков на повышенной частоте кадров, а также точный подсчёт повторяющихся действий и объектов в кадре.
Цена не меняется: используется стандартная тарификация Gemini API по токенам, без дополнительной платы за саму функцию. Включить агентный режим можно, указав значение processing: "agentic" в конфигурации API-запроса, Google опубликовала пример кода на Python с использованием клиента google.genai и модели gemini-3.7-flash.
Google планирует распространить агентный режим на миллиарды пользователей своих продуктов: функция «скоро» появится для всех пользователей приложения Gemini на моделях Flash и Flash-Lite, а в ближайшие месяцы будет задействована в функции YouTube «Ask YouTube» на странице просмотра видео, там она будет давать более качественные ответы, опираясь на визуальный контент ролика. В блоге также поблагодарили за вклад в разработку функции сотрудников Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin и команду Agentic Vision.
Ключевые факты
- Google включила агентный режим анализа видео в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite, уже доступен через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform
- Вместо разбора видео с фиксированной частотой кадров (1 кадр/сек по умолчанию) модель сама выбирает, что смотреть и через какой канал, кадры, звук или транскрипт
- На бенчмарках: расход токенов ниже до 88%, стоимость анализа ниже до 66%, точность выше до 7% по сравнению со статичной обработкой; эффект сильнее всего на длинных видео
- Новые сценарии: субсекундный поиск моментов, поиск по многочасовым видео, обнаружение аномалий, точный подсчёт действий и объектов
- Тарификация не меняется, стандартная цена Gemini API за токены; функция включается параметром processing: "agentic"; в планах, приложение Gemini и функция YouTube «Ask YouTube»
Почему это важно
Статичная обработка видео с фиксированной частотой кадров, дорогой и грубый инструмент: чтобы не потерять важные детали, приходится либо повышать частоту кадров и платить за лишние токены, либо снижать её и рисковать пропустить нужный момент. Агентный подход решает это иначе, модель сама решает, какие части видео важны, и обрабатывает только их. Результат, сразу три улучшения одновременно (дешевле, быстрее по токенам, точнее), что для видео обычно требует компромисса.
Кому это важно
В первую очередь, разработчикам, которые строят продукты на Gemini API и Gemini Enterprise Agent Platform: сервисы модерации видео, автоматического монтажа, аналитики длинных записей (лекции, вебинары, совещания), видеонаблюдения. Во вторую, обычным пользователям: Google обещает довести функцию до приложения Gemini и до функции YouTube «Ask YouTube», где она должна повысить качество ответов о содержании ролика.
Как это применить
Функция уже доступна для загруженных видео и роликов YouTube через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform на моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Включается она указанием processing: "agentic" в конфигурации API-запроса, дополнительная плата за саму функцию не взимается, действует обычная тарификация по токенам.
Можно ли доверять
Источник, официальный блог Google DeepMind, и это первичное объявление о запуске. Но все ключевые цифры (66%, 88%, 7%), собственные бенчмарки Google, поданные как «до X%» без указания конкретных наборов данных или тестов, на которых они получены, и без абсолютных базовых значений стоимости или токенов. Раздел с отзывами партнёров раннего доступа заявлен заголовком, но сам текст отзывов в материале отсутствует, проверить эти оценки независимо по доступному тексту нельзя.
Риски и подводные камни
Все заявленные улучшения, это верхняя граница («до»), а не гарантированный результат для любого видео или сценария; насколько типичен выигрыш в среднем, из текста не следует. Сроки распространения функции на приложение Gemini и на YouTube указаны расплывчато, «скоро» и «в ближайшие месяцы», без конкретных дат.