マルチモーダル動画生成
テキスト、画像、音声、動画入力から高品質・高解像度の動画を生成します。モデルカードでは、複数の入力タイプと音声付き動画出力への対応が説明されています。
Gemini Omni は、さまざまな入力から動画を作成・編集するための Google DeepMind のモデルです。製品ページでは、動画を起点に「何からでも何でも作る」方法として位置づけられており、モデルカードでは、テキスト、画像、音声、動画からメディアを生成・編集する次の段階として説明されています。
この製品は、対話的な編集とマルチモーダル作成を中心に設計されています。例では、ユーザーがシーンを変更したり、動きを再構成したり、複数の参照情報を 1 つの出力にまとめたりする様子が示されており、モデルカードでは、音声付きの高品質・高解像度動画を生成し、Gemini App と Google Flow での利用に対応すると説明されています。
テキスト、画像、音声、動画入力から高品質・高解像度の動画を生成します。モデルカードでは、複数の入力タイプと音声付き動画出力への対応が説明されています。
自然な対話で動画を編集できるため、新しい指示を出すたびにやり直すのではなく、前の内容を踏まえて変更を重ねられます。
素材の変更、スタイルの切り替え、シーンの変換などのプロンプトを使って、入力動画の見た目、動き、効果を調整できます。
画像、テキスト、動画、音声を出発点にして、さまざまな参照情報を 1 つの一貫した出力にまとめられます。
幅広い世界知識と物理理解を適用し、リアルさのあるシーンだけでなく、様式化されたりシュールなシーンにも対応します。
製品ページとモデルページで示されているように、Gemini または Google Flow から同じモデルを利用できます。
プロンプトから始めて、テキストやその他の参照情報から高品質に生成する機能を使い、動画コンテンツをゼロから作成します。
段階的な編集を依頼して既存の動画を反復改善し、各ターンでシーン全体を置き換えるのではなく同じシーンを洗練させます。
素材の変更、人物の別表現への変換、環境全体の別メディア化などにより、クリップのスタイルや効果を変換します。
テキスト、画像、音声、動画など複数の参照情報を 1 つの出力にまとめ、混在した素材から一貫した結果が必要なプロジェクトに対応します。
Google のホスト環境を使うほうがワークフローに適している場合は、Gemini または Google Flow でモデルを利用します。
Gemini Omni は、テキスト、画像、音声、動画入力から動画を作成・編集するためのモデルとして説明されています。製品ページで示されているワークフローに応じて、Gemini と Google Flow で使用できます。
提供資料では、Gemini Omni は Gemini App と Google Flow から利用できると示されています。モデルカードでは、これらのチャネルで提供されると説明されており、製品ページにも Gemini と Google Flow で試すためのリンクがあります。
モデルカードによると、Gemini Omni Flash は高品質・高解像度の音声付き動画を出力します。製品ページでも、対話ベースの編集と、参照情報を 1 つの一貫した結果にまとめる点が強調されています。
モデルカードでは、編集全体で完全な一貫性を保つこと、複雑な動きのあるシーンを扱うこと、そして完全に正確な文字を描画することが、引き続き課題であると述べられています。
料金ページには、Gemini Omni 固有の価格は記載されていません。Google DeepMind のモデル群の一部として Gemini Omni が表示されているだけです。
艺映AIは、テキスト・画像・既存動画から生成できる無料のAI動画制作ツール。短尺SNS動画、プロモーション映像、スタイル化AI動画に対応。
Courseboxは、スクリプト、スライド、アバター設定から研修動画を作成できるAI動画ジェネレーター。撮影機材や手動編集なしで教材制作を効率化します。
VIDEOAI.MEは、台本からスポークスパーソン風動画、広告、解説、SNS向けコンテンツを生成できるAI動画生成ツール。撮影なしで作成できます。
Video Effects SDKは、背景ぼかし、背景置換・削除、ノイズ除去、画面の自動フレーミング、美肌補正、カラー調整などのリアルタイムWebカメラエフェクトを追加します。Web、デスクトップ、モバイル向けのライブ動画体験を提供するチーム向けです。
HeyGen Developersの公式APIドキュメント。AIアバター動画、翻訳、lipsync、インタラクティブ動画エージェントの開発に対応。API、MCP、CLIで利用可能。
DeepMotionは、動画から3Dアニメーションを生成するAnimate 3Dと、テキストから動きを作るSayMotionを備えたWebベースのAIモーションキャプチャ&3Dアニメーションプラットフォームです。