智能视频搜索
模型可以动态搜索、扫描和检查目标视频片段,而不是以固定帧率处理每个片段。
智能视频理解是 Gemini 的一种视频分析模式,可让模型主动决定检查视频中的哪些部分,而不是依赖固定的帧采样。Google 表示,这种方式能够提升准确性,同时降低长视频和细节密集型视频任务的 Token 使用量和成本。
此次发布涵盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。开发者可以通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,使用该功能分析上传的视频和 YouTube 视频,并将处理方式设置为“agentic”。同一篇文章还表示,该功能采用标准 Gemini API Token 定价,不收取额外的功能费用。
模型可以动态搜索、扫描和检查目标视频片段,而不是以固定帧率处理每个片段。
借助 Gemini 原生视频工具,结合视觉帧、音频和转录内容来提升分析质量。
开发者可以通过 Google AI Studio 或 Gemini Enterprise Agent Platform 中的 Gemini API 请求视频分析。
该功能支持视频上传和 YouTube 视频,扩展了可用于分析的输入类型。
与静态帧采样相比,该工作流旨在减少 Token 使用量和成本。
页面称,开发者只需将处理方式设置为“agentic”即可启用该能力,从而减少手动实现视频搜索循环的需要。
查找使用每秒一帧采样难以捕捉的瞬间变化或精确剪辑边界,例如录制内容中的剪辑或流程视频中的短暂状态变化。
在数小时的视频素材中搜索特定答案或事件,无需为静态覆盖每一帧而消耗 Token。
检查快速运动、细微瑕疵或不规则行为;当模型需要更多细节时,可提高选定时间窗口的采样帧率。
随时间跟踪重复出现的动作或对象,适用于计数准确性比简单总结视频片段更重要的场景。
将模型用作上传视频或 YouTube 内容的高效初步分析器;如有需要,再通过定向的后续查询进一步完善结果。
可通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 使用。发布文章还表示,该功能将很快在 Flash 和 Flash-Lite 模型的 Gemini 应用中推出。
发布文章称,可在 API 配置中将视频处理设置为“agentic”来启用该功能。
发布公告列出的首发支持模型包括 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。
页面称,该功能采用标准 Gemini API Token 定价,且不收取额外的功能费用。
源文将其描述为一种主动式视频分析工作流,可跨视频帧、音频和转录内容搜索、扫描并检查目标片段。它适用于片段定位、异常检测和计数等任务。
AakarDev AI 帮助团队在一个仪表板中管理 AI provider 访问、项目级设置、日志和分析,支持 BYOK 工作流,并涵盖 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI 和 Perplexity AI。
DeepMotion 是一款基于网页的 AI 动作捕捉与 3D 动画平台,提供 Animate 3D 视频转动画和 SayMotion 文本生成动画,支持浏览器创作并导出常用制作格式。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
hob 是面向编码 agent 的独立工作区,可将 agent 会话、终端、历史记录和后续工作围绕你已在用的工具与提供商有序管理,适合重视本地路由、历史和工作区结构控制的开发者。
Ably Chat 是用于构建自定义实时聊天应用的 chat API 平台,支持房间消息、输入指示、在线状态、表情回应与消息更新,并提供按使用量计费选项。