Agentic Video Understanding in Gemini
Geminiのエージェンティックなビデオ理解は、能動的な推論ループを使用してビデオセグメントを動的にスキャンし、精度を向上させながらトークン消費量を最大88%削減します。
Geminiのエージェンティックなビデオ理解は、能動的な推論ループを使用してビデオセグメントを動的にスキャンし、精度を向上させながらトークン消費量を最大88%削減します。
製品の機能と公式な位置づけ
Geminiのエージェンティックなビデオ理解は、固定レートのフレーム取り込みを廃止し、ビデオ分析の効率と精度を向上させます。モデルは、クエリに回答するために必要な特定の瞬間や信号を能動的に判断します。
この機能はGemini Flashモデルファミリーに統合されており、開発者プラットフォームを通じて利用可能です。講義や数時間に及ぶ録画などの長尺コンテンツに最適化されており、従来の静的処理で発生していた高いトークンコストを抑制します。
公式情報で確認できる活用例
標準的なフレームレートでは見逃されがちな、一瞬の状態変化や正確なカットの境界線を特定します。
特定の時間枠を高いフレームレートで再サンプリングし、高速な動きを検査することで異常を検知します。
ビデオ全体を通じて、繰り返される動作を正確にカウントしたり、特定のオブジェクトを追跡したりします。
公式情報に記載された利用手順
開発者はGemini APIの設定内で、ビデオ処理パラメータを「agentic」に設定します。
ユーザーは、ファイルのアップロードやYouTubeのURLなどのビデオソースと、自然言語のプロンプトを提供します。
モデルは内部ツールを使用して、タスクに必要なビデオ、オーディオ、または文字起こしの関連セグメントのみを取得します。
システムは、要約、特定のタイムスタンプ、イベントのカウントなど、要求された情報を返します。
従来のビデオ分析モデルは通常、ビデオを固定レートで取り込む静的処理を使用します。この手法は、大量のトークンを消費するか、サンプリングされたフレーム間の重要な詳細を見逃す可能性があるため、長尺ビデオでは非効率になることがあります。
エージェンティックなビデオ理解は、モデルが「何を」「どの速度で」見るかを決定するエージェントとして機能することで、これを変革します。必要なデータのみをロードする内部ツールを呼び出すことで、リソース消費を大幅に抑えつつ、高い精度を実現します。
自分の素材とワークフローで確認したい項目
確認した情報源とその日時
情報源を確認した製品情報に基づく回答
この機能は、Gemini 3.7 Flash、Gemini 3.6 Flash、およびGemini 3.5 Flash-Liteモデルで利用可能です。
ストリーム全体を固定レートで処理するのではなく、必要なビデオセグメントのみを取得することで、コストを最大66%削減します。
はい、この機能はGemini APIおよびGoogle AI Studioを介して、直接のビデオアップロードとYouTube動画の両方をサポートしています。
モデルは、目的に応じて、視覚フレーム、オーディオトラック、またはビデオの文字起こしを動的に選択して検査できます。
いいえ、この機能は標準のGemini APIトークン価格を使用しており、機能固有の追加料金は発生しません。