Gemini научилась искать моменты в длинных видео: до 88% меньше токенов

Google добавила в Gemini API агентный режим анализа видео. Вместо того чтобы заранее извлекать кадры с постоянной частотой и помещать весь материал в контекст, модель сама перемещается по временной шкале, читает расшифровку и загружает только нужные кадры, звук или фрагменты записи.
По данным Google, на длинных видео новый подход использует до 88% меньше токенов и даёт примерно на 7% более высокое качество по сравнению со статической обработкой. Режим доступен в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash Lite через Gemini API.
Как Gemini анализировала видео раньше
Статический режим остаётся стандартным вариантом для всех моделей Gemini. Система извлекает один кадр в секунду, обрабатывает аудио и помещает полученные данные в контекст модели одним проходом. Такой подход предсказуем: расход токенов растёт почти пропорционально длительности записи.
- при низком разрешении один кадр занимает 66 токенов;
- при более высоком разрешении — 258 токенов;
- аудио добавляет около 32 токенов на каждую секунду;
- итоговый расход составляет примерно 100 токенов в секунду при низком разрешении или около 300 при высоком.
Для короткого ролика это удобно, особенно если важен каждый кадр. Но при анализе часовой лекции, записи совещания, трансляции с камер наблюдения или технического процесса большая часть переданной информации может не иметь отношения к вопросу пользователя.
Что делает агентный режим
В агентном режиме Gemini сначала определяет, что именно нужно найти. Затем модель может просмотреть расшифровку, перейти к вероятному участку видео, увеличить частоту выборки кадров и повторно проверить короткий момент. Кадры, звук и текст загружаются по мере необходимости, а не целиком заранее.
Это полезно для вопросов вроде: «В какой момент оператор заменил деталь?», «Найдите эпизод, где спикер назвал бюджет», «Был ли автомобиль в опасной близости к пешеходу?» или «Покажите монтажную склейку». Быстрые события легче проверять повторным просмотром участка с более высокой частотой кадров.
- Static: фиксированная выборка кадров, стабильный расход токенов, хороший вариант для коротких записей и покадрового анализа.
- Agentic: динамическая навигация, выборочная загрузка данных и более эффективная работа с длинными видео или поиском конкретного момента.
Где возникает экономия
Снижение расхода до 88% — максимальная оценка для длинного контента, а не гарантированный результат каждого запроса. Фактическая экономия зависит от сложности вопроса, структуры записи и числа участков, которые модели приходится пересматривать.
В статистике API начальный запрос учитывается как входные токены, навигационное рассуждение — как thought tokens, а подгруженные расшифровки, кадры и аудио — как tool use tokens. Это позволяет отдельно видеть, сколько ресурсов модель потратила на поиск и проверку нужной сцены.
На коротких роликах продолжительностью менее пяти минут агентная навигация может немного увеличить время до первого токена: системе требуется сначала спланировать просмотр и выполнить внутренние обращения к инструментам. Поэтому Google советует выбирать режим с учётом длительности и характера задачи, а не включать его автоматически для любого файла.
Практические сценарии для Узбекистана
- Контакт-центры и обучение: поиск нужных эпизодов в записях тренингов, демонстраций продукта и видеоконсультаций.
- Промышленность: анализ длинных записей технологического процесса и поиск момента остановки, ошибки или замены оборудования.
- Медиа: автоматический поиск цитат, сцен и монтажных точек в интервью и трансляциях.
- Ритейл и логистика: проверка отдельных событий в длительных видеозаписях без полного покадрового анализа.
- Образование: навигация по лекциям, ответы с временными метками и поиск объяснения конкретной темы.
Для компаний с большим архивом записей экономия токенов может существенно повлиять на стоимость сервиса. Однако расчёт следует делать на собственных данных: сравнить одинаковые вопросы в статическом и агентном режимах, измерить качество найденных моментов, задержку и итоговое потребление токенов.
Что проверить разработчику
- Выбрать поддерживаемую модель. Агентный режим заявлен для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash Lite.
- Разделить короткие и длинные записи. Для коротких клипов статический режим может быть быстрее и проще.
- Проверить точность временных меток. Тестовый набор должен содержать быстрые события, речь, тишину и монтажные переходы.
- Считать все категории токенов. Нужно учитывать не только финальный ответ, но и reasoning и tool use.
- Добавить человеческую проверку. Google предупреждает, что генеративные модели могут давать неточные или неожиданные ответы.
Если записи содержат персональные данные, коммерческую тайну или изображения с камер наблюдения, до загрузки необходимо проверить законность обработки, правила хранения и передачи данных, договор с облачным провайдером и внутренние политики доступа. AI-анализ не отменяет требований информационной безопасности и приватности.
Главный вывод
Агентный анализ превращает видео из большого монолитного контекста в источник, по которому модель может целенаправленно перемещаться. Для разработчиков это означает меньший расход токенов на длинных записях и более точный поиск коротких эпизодов. Но режим нужно оценивать вместе с задержкой, ценой конкретной модели и качеством на реальных данных.
Приведённые показатели основаны на документации Google и не гарантируют такую же экономию в каждом проекте. Цены, модели и параметры API могут изменяться.









