Gemini 3.1 Flash TTS icon

Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTSは、表現力の高いAI音声を生成し、スタイルや話し方を細かく制御できるGoogleのプレビュー音声合成モデルです。Gemini API、Google AI Studio、Vertex AI、Google Vidsで利用できます。

Gemini 3.1 Flash TTS

概要

Gemini 3.1 Flash TTS は、音声の聞こえ方をより細かく制御しながら、表現力の高い AI 音声を生成するための Google の音声合成モデルです。発表では、自然さの向上、より明確な間の制御、新しい音声タグにより、自然言語の指示を通じて開発者が声のスタイルや話し方を指定できることが強調されています。

このモデルは、開発者向けに Gemini API と Google AI Studio で、企業向けに Vertex AI で、Workspace ユーザー向けに Google Vids でプレビュー提供されています。70+ 言語、ネイティブな複数話者の対話、そして生成されるすべての音声出力への SynthID 透かしをサポートします。

機能

音声品質の向上

このモデルは、これまでの Google の音声合成モデルの中で最も自然で表現力が高いものとして紹介されており、音声品質と制御性が向上しています。

きめ細かな audio tags

Audio tags により、テキスト入力に埋め込まれた自然言語の指示で、声のスタイル、話速、話し方、トーン、アクセントを指定できます。

Studio 主導の演出制御

Google AI Studio では、シーン演出、話者ごとの指定、インラインタグを設定でき、開発者が複数ターンのパフォーマンスを調整しやすくなります。

API コードへのシームレスなエクスポート

開発者は Google AI Studio で設定した正確な音声パラメータを Gemini API コードとしてエクスポートでき、プロジェクトやプラットフォームをまたいで一貫して再利用できます。

複数話者・多言語対応

このモデルは、ネイティブな複数話者の対話と 70+ 言語に対応しており、ローカライズされた会話型音声体験に適しています。

SynthID の透かし

生成されるすべての音声には SynthID の透かしが付与され、AI 生成コンテンツの検出を支援します。

ユースケース

  • 開発者向け音声アプリ

    キャラクターボイス、ナレーション体験、対話型アシスタントなど、制御された話し方を伴う合成音声を必要とするアプリケーションを構築できます。

  • 音声ワークフローの試作

    Google AI Studio で音声体験を試作し、タグやノートで間やトーンを調整して、得られた設定を Gemini API コードにエクスポートできます。

  • 多言語コンテンツ制作

    スタイルやアクセントの制御を一貫して保ちながら、複数言語にわたるローカライズされた音声体験を作成できます。

  • Workspace 動画ナレーション

    Workspace のメディアワークフローで AI 生成音声が必要なときに、Google Vids でこのモデルを使用できます。

  • 透かし付き合成音声

    より安全な配信のために検出可能な AI 生成音声が必要な場合、組み込みの SynthID 透かし付きで音声を生成できます。

Pros and Cons

Pros

  • 音声タグを使って、声のスタイル、話速、トーン、アクセントをきめ細かく制御できます。
  • 70+ 言語とネイティブな複数話者の対話に対応しています。
  • Studio の設定を Gemini API コードとしてエクスポートでき、再現性のあるワークフローを構築できます。
  • 生成されるすべての音声に SynthID の透かしが含まれます。
  • Gemini API、Google AI Studio、Vertex AI、Google Vids など、複数の Google サーフェスで利用できます。

Cons

  • ソースには、価格、プラン上限、地域ごとの提供状況の詳細が含まれていません。
  • 高度な制御機能は主に発表内容として説明されており、特定のワークフローで評価するには実際に試す必要がある場合があります。

FAQ

Gemini 3.1 Flash TTS はどこで利用できますか?

Gemini API と Google AI Studio では開発者向けにプレビュー提供され、Vertex AI では企業向けにプレビュー提供され、Google Vids では Workspace ユーザー向けに提供されています。

何言語に対応していますか?

発表では 70+ 言語に対応し、ネイティブな複数話者の対話を含むとされています。

音声出力に対して開発者はどのような制御ができますか?

開発者は Google AI Studio で audio tags、Audio Profiles、Director’s Notes、inline tags を使って、声のスタイル、間、話し方、トーン、アクセント、話者の表現を調整し、同じパラメータを Gemini API コードとしてエクスポートできます。

生成された音声には透かしが入りますか?

Gemini 3.1 Flash TTS で生成されたすべての音声には SynthID の透かしが付与され、AI 生成音声を検出できる不可視の透かしとして説明されています。

価格はいくらですか?

製品ページには価格情報がなく、調査セット内でリンクされている価格ページは 404 でした。

Quick Facts

カテゴリ
AI 音声 / 音声合成
主なユーザー
開発者、企業、Workspace ユーザー
提供状況
プレビュー提供
対応プラットフォーム
Gemini API、Google AI Studio、Vertex AI、Google Vids
言語
70+ 言語
透かし
SynthID