Agentic video understanding with Gemini icon

Agentic video understanding with Gemini

Agentic video understandingは、動画を選択的に解析して精度向上とトークン使用量削減を支援するGeminiの動画分析モード。Gemini APIで利用可能

Agentic video understanding with Gemini

概要

Agentic video understandingは、固定フレームサンプリングに頼るのではなく、動画のどの部分を検査するかをモデルが能動的に判断できるGeminiの動画分析モードです。Googleによると、このアプローチは精度を向上させながら、長時間の動画や詳細な動画タスクでのトークン使用量とコストを削減します。

このローンチでは、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteが対象です。開発者は、Google AI StudioとGemini Enterprise Agent PlatformのGemini APIを通じて、動画のアップロードやYouTube動画にこの機能を利用でき、処理は「agentic」に設定します。同じ投稿では、この機能に標準のGemini APIトークン料金が適用され、追加の機能料金はないと説明されています。

主な機能

エージェント型動画検索

モデルは、すべてのクリップを固定フレームレートで処理するのではなく、対象となる動画セグメントを動的に検索、スキャン、検査できます。

マルチモーダル動画検査

Gemini固有の動画ツールを使い、映像フレーム、音声、トランスクリプトを横断して分析品質を高めます。

APIとプラットフォームへのアクセス

Google AI StudioまたはGemini Enterprise Agent PlatformのGemini APIを通じて、動画分析をリクエストできます。

動画アップロードとYouTube対応

動画のアップロードとYouTube動画に対応し、分析に利用できる入力の範囲を広げます。

トークン使用量とコストの削減

静的なフレームサンプリングと比較して、トークン使用量とコストを削減するよう設計されています。

シンプルな設定切り替え

このページによると、処理を「agentic」に設定することで機能を有効化でき、独自の動画検索ループを手動で実装する必要性を減らせます。

実用的なユースケース

  • モーメント検索と精密な編集

    1秒あたり1フレームのサンプリングでは捉えにくい、一瞬の変化や精密なカット境界を見つけます。録画コンテンツの編集や、工程動画における短時間の状態変化などが対象です。

  • 長時間動画の質問応答

    すべてのフレームを静的に網羅するためにトークンを消費することなく、数時間に及ぶ映像から特定の回答やイベントを検索します。

  • 動画ストリームの異常検知

    モデルがより詳細な情報を必要とする場合、選択した区間をより高いフレームレートで再サンプリングし、高速な動き、微細なアーティファクト、通常とは異なる挙動を検査します。

  • 動作と物体のカウント

    単にクリップを要約するのではなく、カウントの正確さが重要な場面で、時間の経過に伴う反復動作や物体を追跡します。

  • GeminiアプリとAPIプロジェクトでの動画ワークフロー

    アップロードした動画やYouTubeコンテンツのより効率的な初回分析にモデルを使用し、必要に応じて対象を絞った追加クエリで結果を精緻化します。

Pros and Cons

Pros

  • Googleのベンチマークによると、静的処理と比較してトークン消費量を最大88%、コストを最大66%削減できます。
  • 標準的な動画分析ベンチマークで、精度を最大7%向上させます。
  • 一定のレートですべてのフレームを取り込むのではなく、必要なセグメントだけを検索することで、長時間の動画をより効率的に処理します。
  • 1秒未満のモーメント検索、異常検知、カウントなどの実用的なタスクに対応します。
  • 追加の機能料金なしで、Google AI StudioとGemini Enterprise Agent Platformの使い慣れたGeminiワークフローから利用できます。

Cons

  • ローンチ記事では、動画のアップロードとYouTube動画以外について、詳細な制限事項一覧や対応形式の一覧は提供されていません。
  • 最大の効果は長時間の動画やベンチマーク形式のタスクで説明されているため、短い動画や単純なクリップでは目に見えるメリットが小さい可能性があります。
  • ローンチ時点では特定のGeminiモデルでの提供と説明されているため、対応状況はモデルや製品の提供先によって異なる可能性があります。

FAQ

Agentic video understandingはどこで利用できますか?

Gemini APIを通じて、Google AI StudioとGemini Enterprise Agent Platformで利用できます。ローンチ記事では、近日中にFlashおよびFlash-Liteモデル全体のGeminiアプリにも展開される予定だと説明されています。

どのように有効にしますか?

ローンチ記事によると、API設定で動画処理を「agentic」に設定すると有効になります。

どのGeminiモデルが対応していますか?

ローンチ時点では、Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Liteが対応モデルとして発表されています。

個別の料金設定はありますか?

このページによると、標準のGemini APIトークン料金が適用され、追加の機能料金はありません。

どのようなタスク向けに設計されていますか?

ソースでは、フレーム、音声、トランスクリプトにまたがって対象セグメントを検索・スキャン・検査できるアクティブな動画分析ワークフローとして説明されています。モーメント検索、異常検知、カウントなどのタスクを想定しています。

Quick Facts

カテゴリー
開発者向けツール
製品ドメイン
blog.google
主なタスク
エージェント型動画分析
提供先
Google AI StudioとGemini Enterprise Agent Platform
ローンチ時の対応モデル
Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite
料金体系
標準のGemini APIトークン料金。追加の機能料金なし

Agentic video understanding with Geminiの代替品

AakarDev AI icon

AakarDev AI

AakarDev AIは、AIプロバイダーのアクセス管理、プロジェクト別設定、ログ、分析を1つのダッシュボードで管理できるチーム向けツールです。BYOKに対応し、OpenAI、Google Gemini、Anthropic、Groq、Mistral AI、Perplexity AIをサポートします。

DeepMotion icon

DeepMotion

DeepMotionは、動画から3Dアニメーションを生成するAnimate 3Dと、テキストから動きを作るSayMotionを備えたWebベースのAIモーションキャプチャ&3Dアニメーションプラットフォームです。

ByteAsk icon

ByteAsk

ByteAskは、C/C++向けのターミナル起点AIコーディングエージェント。リポジトリを編集し、コンパイラやデバッガ、サニタイザ、テストで変更を検証してから差分を表示。無料枠あり。

CreateOS Sandbox icon

CreateOS Sandbox

CreateOS Sandboxは、FirecrackerマイクロVM上でコードやエージェントのワークロードを実行できる分離型コンピュート環境です。SDK、CLI、MCPで制御可能。

hob icon

hob

hobは、エージェントのセッション、ターミナル、履歴、後続作業を、既存のツールやプロバイダーに合わせて整理できる独立したコーディングエージェント向けワークスペース。ローカルでの制御を重視する開発者に最適。

Ably Chat icon

Ably Chat

Ably Chatは、カスタムのリアルタイムチャットアプリを構築できるチャットAPIプラットフォームです。ルーム単位のメッセージ、入力中表示、プレゼンス、リアクション、メッセージ更新に対応し、利用量ベースの料金も選べます。