音声品質の向上
このモデルは、これまでの Google の音声合成モデルの中で最も自然で表現力が高いものとして紹介されており、音声品質と制御性が向上しています。
Gemini 3.1 Flash TTS は、音声の聞こえ方をより細かく制御しながら、表現力の高い AI 音声を生成するための Google の音声合成モデルです。発表では、自然さの向上、より明確な間の制御、新しい音声タグにより、自然言語の指示を通じて開発者が声のスタイルや話し方を指定できることが強調されています。
このモデルは、開発者向けに Gemini API と Google AI Studio で、企業向けに Vertex AI で、Workspace ユーザー向けに Google Vids でプレビュー提供されています。70+ 言語、ネイティブな複数話者の対話、そして生成されるすべての音声出力への SynthID 透かしをサポートします。
このモデルは、これまでの Google の音声合成モデルの中で最も自然で表現力が高いものとして紹介されており、音声品質と制御性が向上しています。
Audio tags により、テキスト入力に埋め込まれた自然言語の指示で、声のスタイル、話速、話し方、トーン、アクセントを指定できます。
Google AI Studio では、シーン演出、話者ごとの指定、インラインタグを設定でき、開発者が複数ターンのパフォーマンスを調整しやすくなります。
開発者は Google AI Studio で設定した正確な音声パラメータを Gemini API コードとしてエクスポートでき、プロジェクトやプラットフォームをまたいで一貫して再利用できます。
このモデルは、ネイティブな複数話者の対話と 70+ 言語に対応しており、ローカライズされた会話型音声体験に適しています。
生成されるすべての音声には SynthID の透かしが付与され、AI 生成コンテンツの検出を支援します。
キャラクターボイス、ナレーション体験、対話型アシスタントなど、制御された話し方を伴う合成音声を必要とするアプリケーションを構築できます。
Google AI Studio で音声体験を試作し、タグやノートで間やトーンを調整して、得られた設定を Gemini API コードにエクスポートできます。
スタイルやアクセントの制御を一貫して保ちながら、複数言語にわたるローカライズされた音声体験を作成できます。
Workspace のメディアワークフローで AI 生成音声が必要なときに、Google Vids でこのモデルを使用できます。
より安全な配信のために検出可能な AI 生成音声が必要な場合、組み込みの SynthID 透かし付きで音声を生成できます。
Gemini API と Google AI Studio では開発者向けにプレビュー提供され、Vertex AI では企業向けにプレビュー提供され、Google Vids では Workspace ユーザー向けに提供されています。
発表では 70+ 言語に対応し、ネイティブな複数話者の対話を含むとされています。
開発者は Google AI Studio で audio tags、Audio Profiles、Director’s Notes、inline tags を使って、声のスタイル、間、話し方、トーン、アクセント、話者の表現を調整し、同じパラメータを Gemini API コードとしてエクスポートできます。
Gemini 3.1 Flash TTS で生成されたすべての音声には SynthID の透かしが付与され、AI 生成音声を検出できる不可視の透かしとして説明されています。
製品ページには価格情報がなく、調査セット内でリンクされている価格ページは 404 でした。
蓝藻AIは、テキストを音声に変換できるオンラインAI音声合成・配音ツールです。自助式の音声クローンにも対応し、短編動画やオーディオブックのナレーションに最適です。
Ondokuは、ブラウザで使える文字起こし・音声化ソフトです。テキストを.mp3でダウンロードでき、無料枠と有料プラン、多言語読み上げ、画像読み上げ、条件付き商用利用に対応します。
Typecastは、テキストを感情豊かな自然な音声に変換するオンラインAI音声生成ツールです。高精細な音声をブラウザで手軽に作成できます。
Noiz AIは、テキストから自然な音声を生成できるAI音声合成、音声クローン、音声デザインツールです。感情表現も同一ワークフローで調整できます。
魔音工坊 (Moying Gongfang) は、書かれたテキストをリアルな人間の声と様々なアクセントを使用して高品質のナレーションに変換するインテリジェントなオンラインテキスト読み上げ (TTS) プラットフォームです。
TADAはHume AIのオープンソース音声言語モデル。テキストと音声を1対1で整合し、より高速で信頼性の高い音声システムの構築に最適。