Agentic video understanding with Gemini icon

Agentic video understanding with Gemini

Agentic video understanding with Gemini:Gemini 的智能视频分析模式,帮助开发者更精准地选择视频内容进行检查,提升准确性并减少 Token 使用,可通过 Gemini API 访问。

Agentic video understanding with Gemini

概览

智能视频理解是 Gemini 的一种视频分析模式,可让模型主动决定检查视频中的哪些部分,而不是依赖固定的帧采样。Google 表示,这种方式能够提升准确性,同时降低长视频和细节密集型视频任务的 Token 使用量和成本。

此次发布涵盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。开发者可以通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,使用该功能分析上传的视频和 YouTube 视频,并将处理方式设置为“agentic”。同一篇文章还表示,该功能采用标准 Gemini API Token 定价,不收取额外的功能费用。

核心能力

智能视频搜索

模型可以动态搜索、扫描和检查目标视频片段,而不是以固定帧率处理每个片段。

多模态视频检查

借助 Gemini 原生视频工具,结合视觉帧、音频和转录内容来提升分析质量。

API 和平台访问

开发者可以通过 Google AI Studio 或 Gemini Enterprise Agent Platform 中的 Gemini API 请求视频分析。

视频上传和 YouTube 支持

该功能支持视频上传和 YouTube 视频,扩展了可用于分析的输入类型。

降低 Token 使用量和成本

与静态帧采样相比,该工作流旨在减少 Token 使用量和成本。

简单的配置开关

页面称,开发者只需将处理方式设置为“agentic”即可启用该能力,从而减少手动实现视频搜索循环的需要。

实际使用场景

  • 瞬间定位和精准剪辑

    查找使用每秒一帧采样难以捕捉的瞬间变化或精确剪辑边界,例如录制内容中的剪辑或流程视频中的短暂状态变化。

  • 长视频问答

    在数小时的视频素材中搜索特定答案或事件,无需为静态覆盖每一帧而消耗 Token。

  • 视频流异常检测

    检查快速运动、细微瑕疵或不规则行为;当模型需要更多细节时,可提高选定时间窗口的采样帧率。

  • 动作和对象计数

    随时间跟踪重复出现的动作或对象,适用于计数准确性比简单总结视频片段更重要的场景。

  • Gemini 应用和 API 项目中的视频工作流

    将模型用作上传视频或 YouTube 内容的高效初步分析器;如有需要,再通过定向的后续查询进一步完善结果。

Pros and Cons

Pros

  • 根据 Google 的基准测试,与静态处理相比,Token 消耗最多可降低 88%,成本最多可降低 66%。
  • 在标准视频分析基准测试中,准确率最高可提升 7%。
  • 通过仅搜索所需片段,而不是以固定速率处理每一帧,更高效地处理长视频。
  • 支持亚秒级片段定位、异常检测和计数等实际任务。
  • 可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中熟悉的 Gemini 工作流使用,且不收取额外的功能费用。

Cons

  • 发布文章未提供详细的限制列表或支持格式矩阵,除视频上传和 YouTube 视频之外没有更多说明。
  • 文中所述的最大收益主要针对长视频和基准测试类任务,因此较短或较简单的视频可能不会获得同样明显的效果。
  • 发布时仅说明特定 Gemini 模型可用,因此具体支持情况可能因模型和产品界面而异。

FAQ

开发者可以在哪里使用智能视频理解?

可通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 使用。发布文章还表示,该功能将很快在 Flash 和 Flash-Lite 模型的 Gemini 应用中推出。

如何开启该功能?

发布文章称,可在 API 配置中将视频处理设置为“agentic”来启用该功能。

哪些 Gemini 模型支持该功能?

发布公告列出的首发支持模型包括 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。

该功能是否有单独定价?

页面称,该功能采用标准 Gemini API Token 定价,且不收取额外的功能费用。

该功能适用于哪些类型的任务?

源文将其描述为一种主动式视频分析工作流,可跨视频帧、音频和转录内容搜索、扫描并检查目标片段。它适用于片段定位、异常检测和计数等任务。

Quick Facts

类别
开发者工具
产品域名
blog.google
主要任务
智能视频分析
可用平台
Google AI Studio 和 Gemini Enterprise Agent Platform
首发模型
Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite
定价方式
标准 Gemini API Token 定价;不收取额外的功能费用