Agentic video understanding with Gemini icon

Agentic video understanding with Gemini

Agentic video understanding 是 Gemini 的影片分析模式,協助開發者更精準地檢視影片、降低 token 用量;可透過 Gemini API 在 Google AI Studio 與 Gemini Enterprise Agent Platform 使用。

Agentic video understanding with Gemini

概覽

Agentic video understanding 是 Gemini 的影片分析模式,可讓模型主動決定要檢視影片中的哪些部分,而不是依賴固定的影格取樣。Google 表示,這種方式能提升準確度,同時降低長篇及細節密集型影片任務的 token 用量與成本。

此次推出涵蓋 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite。開發者可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API,使用這項功能分析上傳的影片與 YouTube 影片,並將處理設定為 "agentic"。同一篇文章表示,這項功能採用標準 Gemini API token 定價,不收取額外功能費用。

核心功能

Agentic 影片搜尋

模型可以動態搜尋、掃描及檢視目標影片片段,而不是以固定影格速率處理每個片段。

多模態影片檢視

運用 Gemini 原生影片工具處理視覺影格、音訊與逐字稿,以提升分析品質。

API 與平台存取

開發者可以透過 Google AI Studio 或 Gemini Enterprise Agent Platform 中的 Gemini API 要求影片分析。

影片上傳與 YouTube 支援

這項功能支援影片上傳與 YouTube 影片,擴大可用於分析的輸入來源。

降低 token 用量與成本

相較於靜態影格取樣,這項工作流程旨在降低 token 用量與成本。

簡易設定切換

頁面表示,開發者只需將處理設定為 "agentic" 即可啟用這項能力,減少手動實作影片搜尋迴圈的需求。

實際使用情境

  • 片段時刻擷取與精確剪輯

    找出以每秒一個影格取樣難以捕捉的瞬間變化或精確剪輯邊界,例如錄製內容中的剪輯,或流程影片中的短暫狀態變化。

  • 長篇影片問答

    在數小時的影片素材中搜尋特定答案或事件,而不必為每個影格的完整靜態涵蓋範圍耗用 token。

  • 影片串流中的異常偵測

    在模型需要更多細節時,以更高影格速率重新取樣選定視窗,檢視快速動作、細微瑕疵或不規則行為。

  • 動作與物件計數

    隨時間追蹤重複出現的動作或物件,適用於計數準確度比單純摘要片段更重要的情境。

  • Gemini 應用程式與 API 專案中的影片工作流程

    將模型用作上傳影片或 YouTube 內容的高效率第一階段分析器;如有需要,再透過針對性後續查詢進一步精煉結果。

Pros and Cons

Pros

  • 根據 Google 的基準測試,相較於靜態處理,token 用量最多可降低 88%,成本最多可降低 66%。
  • 在標準影片分析基準測試中,準確度最高可提升 7%。
  • 透過僅搜尋所需片段,而非以固定速率匯入每個影格,更有效率地處理長篇影片。
  • 支援次秒級片段時刻擷取、異常偵測與計數等實用任務。
  • 可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中熟悉的 Gemini 工作流程使用,且不收取額外功能費用。

Cons

  • 發布文章未提供詳細的限制清單,除了影片上傳與 YouTube 影片之外,也未提供支援格式對照表。
  • 文中所述的最大效益主要針對長篇影片與基準測試類任務,因此較短或較簡單的片段可能較難感受到明顯改善。
  • 推出時的可用性僅描述為適用於特定 Gemini 模型,因此支援情況可能依模型與產品介面而異。

FAQ

開發者可以在哪裡使用 agentic video understanding?

可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API 使用。發布文章也表示,這項功能即將在 Flash 與 Flash-Lite 模型上推送至 Gemini 應用程式。

如何啟用這項功能?

發布文章表示,您可以在 API 設定中將影片處理設定為 "agentic" 來啟用這項功能。

哪些 Gemini 模型支援這項功能?

發布公告列出 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 為推出時支援這項功能的模型。

這項功能有另外的定價嗎?

頁面表示,這項功能採用標準 Gemini API token 定價,且不收取額外功能費用。

這項功能適合哪些類型的任務?

來源將其描述為主動式影片分析工作流程,可跨越影格、音訊與逐字稿搜尋、掃描及檢視目標片段。這項功能適用於片段時刻擷取、異常偵測與計數等任務。

Quick Facts

類別
開發者工具
產品網域
blog.google
主要任務
Agentic 影片分析
可用性
Google AI Studio 與 Gemini Enterprise Agent Platform
推出時支援的模型
Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite
定價方式
標準 Gemini API token 定價;不收取額外功能費用