Agentic Video Understanding in Gemini
Gemini의 에이전트 기반 비디오 이해 기능은 능동적 추론 루프를 사용하여 비디오 세그먼트를 동적으로 스캔함으로써, 긴 분량의 콘텐츠에 대한 정확도를 높이는 동시에 토큰 소비를 최대 88%까지 절감합니다.
Gemini의 에이전트 기반 비디오 이해 기능은 능동적 추론 루프를 사용하여 비디오 세그먼트를 동적으로 스캔함으로써, 긴 분량의 콘텐츠에 대한 정확도를 높이는 동시에 토큰 소비를 최대 88%까지 절감합니다.
제품의 기능과 공식 포지셔닝
Gemini의 에이전트 기반 비디오 이해는 고정된 속도의 프레임 섭취 방식에서 벗어나 비디오 분석의 효율성과 정확성을 개선합니다. 모델은 쿼리에 답변하는 데 필요한 특정 순간과 신호를 결정하는 데 능동적인 역할을 수행합니다.
이 기능은 Gemini Flash 모델 제품군에 통합되어 있으며 개발자 플랫폼을 통해 액세스할 수 있습니다. 기존의 정적 처리 방식에서 높은 토큰 비용이 발생하던 강의나 수 시간 분량의 녹화본과 같은 장문형 콘텐츠에 최적화되어 있습니다.
공식 출처로 확인된 활용 사례
표준 프레임 속도에서는 놓치기 쉬운 찰나의 상태 변화와 정밀한 컷 경계 지점을 정확하게 찾아냅니다.
빠른 움직임을 조사하기 위해 특정 시간 창을 더 높은 초당 프레임 수로 재샘플링하여 이상 징후를 감지합니다.
비디오가 진행되는 동안 반복되는 동작을 정확하게 계산하거나 개별 객체의 움직임을 추적합니다.
공식 문서에 안내된 사용 절차
개발자는 Gemini API 구성 설정 내에서 비디오 처리 매개변수를 'agentic'으로 설정하여 기능을 활성화합니다.
사용자는 파일 업로드 또는 YouTube URL과 같은 비디오 소스를 자연어 프롬프트와 함께 제공합니다.
모델은 내부 도구를 사용하여 작업에 필요한 비디오, 오디오 또는 스크립트의 관련 세그먼트만 가져옵니다.
시스템은 요약, 특정 타임스탬프 또는 이벤트 횟수와 같이 요청된 정보를 최종적으로 반환합니다.
전통적인 비디오 분석 모델은 일반적으로 비디오를 고정된 속도로 섭취하는 정적 처리 방식을 사용합니다. 이 접근 방식은 긴 비디오의 경우 방대한 양의 토큰을 소비하거나 샘플링된 프레임 사이에서 발생하는 중요한 세부 정보를 놓칠 수 있어 비효율적일 수 있습니다.
에이전트 기반 비디오 이해는 모델이 무엇을 어떤 속도로 시청할지 결정하는 에이전트 역할을 하도록 하여 이를 변화시킵니다. 필요한 데이터만 로드하기 위해 내부 도구를 호출함으로써 모델은 훨씬 적은 리소스 소비로 더 높은 정확도를 달성할 수 있습니다.
본인의 자료와 작업 흐름으로 직접 확인할 항목
확인한 출처와 확인 시점
출처를 확인한 제품 정보를 바탕으로 한 답변
이 기능은 현재 Gemini 3.7 Flash, Gemini 3.6 Flash 및 Gemini 3.5 Flash-Lite 모델에서 사용할 수 있습니다.
전체 스트림을 고정된 속도로 처리하는 대신 필요한 비디오 세그먼트만 가져오기 때문에 분석 비용을 최대 66%까지 줄일 수 있습니다.
네, 이 기능은 Gemini API 및 Google AI Studio를 통해 직접 비디오 업로드와 YouTube 비디오 분석을 모두 지원합니다.
모델은 분석 목표에 따라 시각적 프레임, 오디오 트랙 또는 비디오 스크립트를 동적으로 선택하여 검사할 수 있습니다.
아니요, 이 기능은 별도의 기능별 수수료 없이 표준 Gemini API 토큰 가격 정책을 그대로 따르며 추가 비용은 없습니다.