Agentic Video Understanding in Gemini favicon

Agentic Video Understanding in Gemini

Gemini 中的代理式视频理解使用主动推理循环动态扫描视频片段,在提高长内容分析准确性的同时,可将 Token 消耗降低高达 88%。

视频用于精确视频编辑的亚秒级时刻检索跨多小时录制内容的长时间“大海捞针”式搜索通过有针对性的窗口重采样进行异常检测对重复身体动作和不同物体的准确计数
Agentic Video Understanding in Gemini product interface screenshot
预计月访问量
900万
数据月份:
收录于 AIToolly

Agentic Video Understanding in Gemini 是什么?产品概览

产品用途与官方定位

Gemini 中的代理式视频理解通过摆脱固定速率的帧摄取,显著提高了视频分析的效率和准确性。模型在确定回答查询所需的特定时刻和信号方面发挥着积极作用。

该功能已集成到 Gemini Flash 模型系列中,并可通过开发者平台访问。它针对讲座和数小时的录像等长内容进行了优化,而传统的静态处理在这些内容中通常会导致高昂的 Token 成本。

Agentic Video Understanding in Gemini 可以用来做什么?

有官方来源支持的使用场景

自动化视频编辑

精确锁定标准帧率通常会错过的瞬时状态变化和紧凑的剪辑边界。

安全与质量控制

通过以更高的每秒帧数对特定时间窗口进行重新采样来检测异常,从而检查快速运动。

身体活动追踪

在视频播放过程中准确计数重复的身体动作或追踪不同的特定物体。

如何使用 Agentic Video Understanding in Gemini

官网提供的使用流程

  1. 1

    API 配置

    开发者在 Gemini API 配置设置中将视频处理参数设置为“agentic”。

  2. 2

    媒体输入

    用户提供视频源(如文件上传或 YouTube 网址)以及自然语言提示词。

  3. 3

    有针对性的检查

    模型使用内部工具仅获取完成任务所需的视频、音频或转录文本的相关片段。

  4. 4

    分析交付

    系统返回请求的信息,例如摘要、特定时间戳或事件计数。

代理式与静态视频处理

传统的视频分析模型通常使用静态处理,即以固定速率摄取视频。对于长视频,这种方法可能效率低下,因为它要么消耗大量 Token,要么错过采样帧之间发生的关键细节。

代理式视频理解改变了这一点,它允许模型作为一个代理来决定观看什么以及以什么速度观看。通过调用内部工具仅加载必要的数据,模型可以以显著降低的资源消耗实现更高的准确性。

  • 与静态方法相比,Token 消耗降低高达 88%。
  • 为开发者降低高达 66% 的分析成本。
  • 在标准基准测试中,整体准确率提高约 7%。
  • 实现识别状态变化的亚秒级精度。

选择 Agentic Video Understanding in Gemini 前需要测试什么

用自己的素材和工作流完成验证

  • 确认模型能够识别发生时间少于一秒的特定视觉变化。
  • 验证在分析超过十分钟的视频时 Token 使用量的减少情况。
  • 检查模型在音频和视觉信号之间切换以回答复杂查询的能力。
  • 审查在快速身体运动期间物体计数的准确性。

Agentic Video Understanding in Gemini 来源与核对时间

核对了哪些信息以及核对时间

最后核对
分类
视频

Agentic Video Understanding in Gemini 常见问题

基于已核对产品资料的回答

哪些 Gemini 模型支持代理式视频理解?

该功能目前适用于 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 模型。

此功能如何为开发者降低成本?

它通过仅获取必要的视频片段而不是以固定速率处理整个流,将 Token 成本降低了高达 66%。

模型可以直接分析 YouTube 视频吗?

是的,该功能支持通过 Gemini API 和 Google AI Studio 直接上传视频文件或使用 YouTube 视频链接。

模型在分析过程中可以检查哪些模态?

模型可以根据分析目标,动态地选择检查视觉视频帧、音频轨道或者视频转录文本等不同模态。

使用代理式视频理解是否需要额外付费?

不需要,该功能使用标准的 Gemini API Token 定价,目前没有额外的特定功能使用费用。

继续查看同一分类中近期收录的其他工具。