Skip to main contentSkip to footer

Gemini научилась искать моменты в длинных видео: до 88% меньше токенов

Специалист анализирует длинную видеозапись с помощью агентной системы поиска нужных моментов

Google добавила в Gemini API агентный режим анализа видео. Вместо того чтобы заранее извлекать кадры с постоянной частотой и помещать весь материал в контекст, модель сама перемещается по временной шкале, читает расшифровку и загружает только нужные кадры, звук или фрагменты записи.

По данным Google, на длинных видео новый подход использует до 88% меньше токенов и даёт примерно на 7% более высокое качество по сравнению со статической обработкой. Режим доступен в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash Lite через Gemini API.

Как Gemini анализировала видео раньше

Статический режим остаётся стандартным вариантом для всех моделей Gemini. Система извлекает один кадр в секунду, обрабатывает аудио и помещает полученные данные в контекст модели одним проходом. Такой подход предсказуем: расход токенов растёт почти пропорционально длительности записи.

  • при низком разрешении один кадр занимает 66 токенов;
  • при более высоком разрешении — 258 токенов;
  • аудио добавляет около 32 токенов на каждую секунду;
  • итоговый расход составляет примерно 100 токенов в секунду при низком разрешении или около 300 при высоком.

Для короткого ролика это удобно, особенно если важен каждый кадр. Но при анализе часовой лекции, записи совещания, трансляции с камер наблюдения или технического процесса большая часть переданной информации может не иметь отношения к вопросу пользователя.

Что делает агентный режим

В агентном режиме Gemini сначала определяет, что именно нужно найти. Затем модель может просмотреть расшифровку, перейти к вероятному участку видео, увеличить частоту выборки кадров и повторно проверить короткий момент. Кадры, звук и текст загружаются по мере необходимости, а не целиком заранее.

Это полезно для вопросов вроде: «В какой момент оператор заменил деталь?», «Найдите эпизод, где спикер назвал бюджет», «Был ли автомобиль в опасной близости к пешеходу?» или «Покажите монтажную склейку». Быстрые события легче проверять повторным просмотром участка с более высокой частотой кадров.

  • Static: фиксированная выборка кадров, стабильный расход токенов, хороший вариант для коротких записей и покадрового анализа.
  • Agentic: динамическая навигация, выборочная загрузка данных и более эффективная работа с длинными видео или поиском конкретного момента.

Где возникает экономия

Снижение расхода до 88% — максимальная оценка для длинного контента, а не гарантированный результат каждого запроса. Фактическая экономия зависит от сложности вопроса, структуры записи и числа участков, которые модели приходится пересматривать.

В статистике API начальный запрос учитывается как входные токены, навигационное рассуждение — как thought tokens, а подгруженные расшифровки, кадры и аудио — как tool use tokens. Это позволяет отдельно видеть, сколько ресурсов модель потратила на поиск и проверку нужной сцены.

На коротких роликах продолжительностью менее пяти минут агентная навигация может немного увеличить время до первого токена: системе требуется сначала спланировать просмотр и выполнить внутренние обращения к инструментам. Поэтому Google советует выбирать режим с учётом длительности и характера задачи, а не включать его автоматически для любого файла.

Практические сценарии для Узбекистана

  • Контакт-центры и обучение: поиск нужных эпизодов в записях тренингов, демонстраций продукта и видеоконсультаций.
  • Промышленность: анализ длинных записей технологического процесса и поиск момента остановки, ошибки или замены оборудования.
  • Медиа: автоматический поиск цитат, сцен и монтажных точек в интервью и трансляциях.
  • Ритейл и логистика: проверка отдельных событий в длительных видеозаписях без полного покадрового анализа.
  • Образование: навигация по лекциям, ответы с временными метками и поиск объяснения конкретной темы.

Для компаний с большим архивом записей экономия токенов может существенно повлиять на стоимость сервиса. Однако расчёт следует делать на собственных данных: сравнить одинаковые вопросы в статическом и агентном режимах, измерить качество найденных моментов, задержку и итоговое потребление токенов.

Что проверить разработчику

  1. Выбрать поддерживаемую модель. Агентный режим заявлен для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash Lite.
  2. Разделить короткие и длинные записи. Для коротких клипов статический режим может быть быстрее и проще.
  3. Проверить точность временных меток. Тестовый набор должен содержать быстрые события, речь, тишину и монтажные переходы.
  4. Считать все категории токенов. Нужно учитывать не только финальный ответ, но и reasoning и tool use.
  5. Добавить человеческую проверку. Google предупреждает, что генеративные модели могут давать неточные или неожиданные ответы.

Если записи содержат персональные данные, коммерческую тайну или изображения с камер наблюдения, до загрузки необходимо проверить законность обработки, правила хранения и передачи данных, договор с облачным провайдером и внутренние политики доступа. AI-анализ не отменяет требований информационной безопасности и приватности.

Главный вывод

Агентный анализ превращает видео из большого монолитного контекста в источник, по которому модель может целенаправленно перемещаться. Для разработчиков это означает меньший расход токенов на длинных записях и более точный поиск коротких эпизодов. Но режим нужно оценивать вместе с задержкой, ценой конкретной модели и качеством на реальных данных.

Приведённые показатели основаны на документации Google и не гарантируют такую же экономию в каждом проекте. Цены, модели и параметры API могут изменяться.

Первоисточники

Интересное