Agentic 影片搜尋
模型可以動態搜尋、掃描及檢視目標影片片段,而不是以固定影格速率處理每個片段。
Agentic video understanding 是 Gemini 的影片分析模式,可讓模型主動決定要檢視影片中的哪些部分,而不是依賴固定的影格取樣。Google 表示,這種方式能提升準確度,同時降低長篇及細節密集型影片任務的 token 用量與成本。
此次推出涵蓋 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite。開發者可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API,使用這項功能分析上傳的影片與 YouTube 影片,並將處理設定為 "agentic"。同一篇文章表示,這項功能採用標準 Gemini API token 定價,不收取額外功能費用。
模型可以動態搜尋、掃描及檢視目標影片片段,而不是以固定影格速率處理每個片段。
運用 Gemini 原生影片工具處理視覺影格、音訊與逐字稿,以提升分析品質。
開發者可以透過 Google AI Studio 或 Gemini Enterprise Agent Platform 中的 Gemini API 要求影片分析。
這項功能支援影片上傳與 YouTube 影片,擴大可用於分析的輸入來源。
相較於靜態影格取樣,這項工作流程旨在降低 token 用量與成本。
頁面表示,開發者只需將處理設定為 "agentic" 即可啟用這項能力,減少手動實作影片搜尋迴圈的需求。
找出以每秒一個影格取樣難以捕捉的瞬間變化或精確剪輯邊界,例如錄製內容中的剪輯,或流程影片中的短暫狀態變化。
在數小時的影片素材中搜尋特定答案或事件,而不必為每個影格的完整靜態涵蓋範圍耗用 token。
在模型需要更多細節時,以更高影格速率重新取樣選定視窗,檢視快速動作、細微瑕疵或不規則行為。
隨時間追蹤重複出現的動作或物件,適用於計數準確度比單純摘要片段更重要的情境。
將模型用作上傳影片或 YouTube 內容的高效率第一階段分析器;如有需要,再透過針對性後續查詢進一步精煉結果。
可透過 Google AI Studio 與 Gemini Enterprise Agent Platform 中的 Gemini API 使用。發布文章也表示,這項功能即將在 Flash 與 Flash-Lite 模型上推送至 Gemini 應用程式。
發布文章表示,您可以在 API 設定中將影片處理設定為 "agentic" 來啟用這項功能。
發布公告列出 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 為推出時支援這項功能的模型。
頁面表示,這項功能採用標準 Gemini API token 定價,且不收取額外功能費用。
來源將其描述為主動式影片分析工作流程,可跨越影格、音訊與逐字稿搜尋、掃描及檢視目標片段。這項功能適用於片段時刻擷取、異常偵測與計數等任務。
AakarDev AI 讓團隊透過單一儀表板管理 AI 供應商權限、專案設定、日誌與分析,支援 BYOK 工作流程,並可連接 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI、Perplexity AI。
DeepMotion 是一個基於網頁的 AI 動作捕捉與 3D 動畫平台,提供 Animate 3D 影片轉動畫與 SayMotion 文字轉動畫,讓創作者與團隊可在瀏覽器中產生動作並匯出常見製作格式。
ByteAsk 是專為 C 與 C++ 打造的終端機優先 AI coding agent,先編輯儲存庫再用真實編譯器、除錯器、sanitizer 與測試驗證變更,並提供免費方案與付費方案。
CreateOS Sandbox 是以 Firecracker micro-VM 執行程式與 agent 工作負載的隔離運算環境,支援私有網路、SDK、CLI 與 MCP 程式化控制。
hob 是一個獨立的 coding agents 工作區,整合 agent sessions、終端機、歷史紀錄與後續工作,並維持你既有的工具與供應商設定。適合想保有本機路由、歷史與工作區結構控制權的開發者。
Ably Chat 是一個聊天 API 平台,適合打造自訂即時聊天應用程式。支援聊天室訊息、輸入中提示、在線狀態、表情回應與訊息更新,並提供依使用量計費選項。