Agentic Video Understanding in Gemini
Агентное понимание видео в Gemini использует цикл активного рассуждения для динамического сканирования сегментов видео, сокращая потребление токенов до 88% и повышая точность для длинного контента.
Агентное понимание видео в Gemini использует цикл активного рассуждения для динамического сканирования сегментов видео, сокращая потребление токенов до 88% и повышая точность для длинного контента.
Назначение продукта и его официальное позиционирование
Агентное понимание видео в Gemini повышает эффективность и точность анализа видео, отказываясь от приема кадров с фиксированной частотой. Модель берет на себя активную роль в определении того, какие именно моменты и сигналы необходимы для ответа на запрос.
Эта функция интегрирована в семейство моделей Gemini Flash и доступна через платформы для разработчиков. Она оптимизирована для длинного контента, такого как лекции и многочасовые записи, где традиционная статическая обработка часто приводит к высоким затратам токенов.
Сценарии, подтверждённые официальными источниками
Определение изменений состояния за доли секунды и точных границ монтажных склеек, которые обычно пропускаются при стандартной частоте кадров.
Обнаружение аномалий путем повторной выборки определенных временных окон с более высокой частотой кадров для проверки быстрого движения.
Точный подсчет повторяющихся движений или отслеживание отдельных объектов на протяжении всего видео.
Описанный в документации процесс, если он доступен
Разработчик устанавливает параметр обработки видео на 'agentic' в настройках конфигурации Gemini API.
Пользователь предоставляет источник видео, например, загруженный файл или URL-адрес YouTube, вместе с запросом на естественном языке.
Модель использует внутренний инструмент для извлечения только соответствующих сегментов видео, аудио или транскрипции, необходимых для выполнения задачи.
Система возвращает запрошенную информацию, такую как краткое резюме, конкретную временную метку или количество событий.
Традиционные модели анализа видео обычно используют статическую обработку, при которой видео поглощается с фиксированной скоростью. Этот подход может быть неэффективным для длинных видео, так как он либо потребляет огромное количество токенов, либо пропускает критические детали между выборками кадров.
Агентное понимание видео меняет это, позволяя модели действовать как агент, который решает, что смотреть и с какой скоростью. Вызывая внутренние инструменты для загрузки только необходимых данных, модель может достичь более высокой точности при значительно меньшем потреблении ресурсов.
Проверки на собственных материалах и рабочих процессах
Какие источники и когда были проверены
Ответы на основе карточки продукта с проверенными источниками
Функция доступна для моделей Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite.
Она снижает затраты до 66%, извлекая только необходимые сегменты видео вместо обработки всего потока с фиксированной скоростью.
Да, функция поддерживает как прямую загрузку видео, так и видео с YouTube через Gemini API и Google AI Studio.
Модель может динамически выбирать для проверки визуальные кадры, аудиодорожки или транскрипции видео в зависимости от поставленной цели.
Нет, функция использует стандартные тарифы на токены Gemini API без каких-либо дополнительных сборов за конкретную функцию.