Agentic Video Understanding in Gemini
Gemini 中的代理式视频理解使用主动推理循环动态扫描视频片段,在提高长内容分析准确性的同时,可将 Token 消耗降低高达 88%。
Gemini 中的代理式视频理解使用主动推理循环动态扫描视频片段,在提高长内容分析准确性的同时,可将 Token 消耗降低高达 88%。
产品用途与官方定位
Gemini 中的代理式视频理解通过摆脱固定速率的帧摄取,显著提高了视频分析的效率和准确性。模型在确定回答查询所需的特定时刻和信号方面发挥着积极作用。
该功能已集成到 Gemini Flash 模型系列中,并可通过开发者平台访问。它针对讲座和数小时的录像等长内容进行了优化,而传统的静态处理在这些内容中通常会导致高昂的 Token 成本。
有官方来源支持的使用场景
精确锁定标准帧率通常会错过的瞬时状态变化和紧凑的剪辑边界。
通过以更高的每秒帧数对特定时间窗口进行重新采样来检测异常,从而检查快速运动。
在视频播放过程中准确计数重复的身体动作或追踪不同的特定物体。
官网提供的使用流程
开发者在 Gemini API 配置设置中将视频处理参数设置为“agentic”。
用户提供视频源(如文件上传或 YouTube 网址)以及自然语言提示词。
模型使用内部工具仅获取完成任务所需的视频、音频或转录文本的相关片段。
系统返回请求的信息,例如摘要、特定时间戳或事件计数。
传统的视频分析模型通常使用静态处理,即以固定速率摄取视频。对于长视频,这种方法可能效率低下,因为它要么消耗大量 Token,要么错过采样帧之间发生的关键细节。
代理式视频理解改变了这一点,它允许模型作为一个代理来决定观看什么以及以什么速度观看。通过调用内部工具仅加载必要的数据,模型可以以显著降低的资源消耗实现更高的准确性。
用自己的素材和工作流完成验证
核对了哪些信息以及核对时间
基于已核对产品资料的回答
该功能目前适用于 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 模型。
它通过仅获取必要的视频片段而不是以固定速率处理整个流,将 Token 成本降低了高达 66%。
是的,该功能支持通过 Gemini API 和 Google AI Studio 直接上传视频文件或使用 YouTube 视频链接。
模型可以根据分析目标,动态地选择检查视觉视频帧、音频轨道或者视频转录文本等不同模态。
不需要,该功能使用标准的 Gemini API Token 定价,目前没有额外的特定功能使用费用。