Gemini Omni icon

Gemini Omni

Gemini Omni は、テキスト、画像、音声、動画から動画を生成・編集できる Google DeepMind のモデルです。Gemini と Google Flow で対話的なマルチモーダル制作に対応します。

Gemini Omni

概要

Gemini Omni は、さまざまな入力から動画を作成・編集するための Google DeepMind のモデルです。製品ページでは、動画を起点に「何からでも何でも作る」方法として位置づけられており、モデルカードでは、テキスト、画像、音声、動画からメディアを生成・編集する次の段階として説明されています。

この製品は、対話的な編集とマルチモーダル作成を中心に設計されています。例では、ユーザーがシーンを変更したり、動きを再構成したり、複数の参照情報を 1 つの出力にまとめたりする様子が示されており、モデルカードでは、音声付きの高品質・高解像度動画を生成し、Gemini App と Google Flow での利用に対応すると説明されています。

機能

マルチモーダル動画生成

テキスト、画像、音声、動画入力から高品質・高解像度の動画を生成します。モデルカードでは、複数の入力タイプと音声付き動画出力への対応が説明されています。

会話ベースの編集

自然な対話で動画を編集できるため、新しい指示を出すたびにやり直すのではなく、前の内容を踏まえて変更を重ねられます。

既存映像の変換

素材の変更、スタイルの切り替え、シーンの変換などのプロンプトを使って、入力動画の見た目、動き、効果を調整できます。

参照主導の作成

画像、テキスト、動画、音声を出発点にして、さまざまな参照情報を 1 つの一貫した出力にまとめられます。

世界認識を伴うシーン生成

幅広い世界知識と物理理解を適用し、リアルさのあるシーンだけでなく、様式化されたりシュールなシーンにも対応します。

Google の各面で利用可能

製品ページとモデルページで示されているように、Gemini または Google Flow から同じモデルを利用できます。

使用例

  • 新しい動画コンセプトを生成する

    プロンプトから始めて、テキストやその他の参照情報から高品質に生成する機能を使い、動画コンテンツをゼロから作成します。

  • 会話で映像を編集する

    段階的な編集を依頼して既存の動画を反復改善し、各ターンでシーン全体を置き換えるのではなく同じシーンを洗練させます。

  • 見た目のスタイルと動きを再構成する

    素材の変更、人物の別表現への変換、環境全体の別メディア化などにより、クリップのスタイルや効果を変換します。

  • 複数の参照情報を統合する

    テキスト、画像、音声、動画など複数の参照情報を 1 つの出力にまとめ、混在した素材から一貫した結果が必要なプロジェクトに対応します。

  • Google の各面で作業する

    Google のホスト環境を使うほうがワークフローに適している場合は、Gemini または Google Flow でモデルを利用します。

Pros and Cons

Pros

  • テキスト、画像、音声、動画を含む複数の入力形式に対応しています。
  • シーンをゼロから作り直すのではなく、自然な会話で編集できます。
  • 複数のやり取りにわたって、変更を前の指示の上に積み重ねられます。
  • Gemini の推論と生成メディア機能を組み合わせ、より現実に根ざした出力を目指しています。
  • Gemini App と Google Flow を含む、複数の Google 面から利用できます。

Cons

  • モデルカードでは、編集のあらゆる段階で完全な一貫性を保つことは依然として課題だとされています。
  • 複雑な動きのあるシーンも難しい点として挙げられています。
  • 完全に正確な文字の描画には、まだ制限があります。

FAQ

Gemini Omni は何に使われますか?

Gemini Omni は、テキスト、画像、音声、動画入力から動画を作成・編集するためのモデルとして説明されています。製品ページで示されているワークフローに応じて、Gemini と Google Flow で使用できます。

Gemini Omni はどこで試せますか?

提供資料では、Gemini Omni は Gemini App と Google Flow から利用できると示されています。モデルカードでは、これらのチャネルで提供されると説明されており、製品ページにも Gemini と Google Flow で試すためのリンクがあります。

Gemini Omni は何を出力しますか?

モデルカードによると、Gemini Omni Flash は高品質・高解像度の音声付き動画を出力します。製品ページでも、対話ベースの編集と、参照情報を 1 つの一貫した結果にまとめる点が強調されています。

Gemini Omni の主な制限は何ですか?

モデルカードでは、編集全体で完全な一貫性を保つこと、複雑な動きのあるシーンを扱うこと、そして完全に正確な文字を描画することが、引き続き課題であると述べられています。

Gemini Omni は個別に課金されますか?

料金ページには、Gemini Omni 固有の価格は記載されていません。Google DeepMind のモデル群の一部として Gemini Omni が表示されているだけです。

Quick Facts

カテゴリ
AI 動画生成・編集
製品ファミリー
Gemini
入力
テキスト、画像、音声、動画
出力
音声付きの高品質動画
アクセス先
Gemini App と Google Flow
ソースドメイン
deepmind.google