提升的語音品質
此模型被介紹為 Google 迄今最自然且最具表現力的文字轉語音模型,並具備更好的語音品質與可控性。
Gemini 3.1 Flash TTS 是 Google 的文字轉語音模型,可生成富有表現力的 AI 語音,並更精細地控制音訊聽起來的方式。發布公告強調了更好的自然度、更清楚的節奏控制,以及新的音訊標籤,讓開發者能透過自然語言指示來引導語音風格與呈現方式。
此模型正以預覽版逐步向開發者透過 Gemini API 與 Google AI Studio 開放,向企業透過 Vertex AI 開放,並向 Workspace 使用者透過 Google Vids 開放。它支援 70+ 種語言、原生多說話者對話,以及每個生成音訊輸出的 SynthID 浮水印。
此模型被介紹為 Google 迄今最自然且最具表現力的文字轉語音模型,並具備更好的語音品質與可控性。
Audio tags 可讓使用者透過嵌入在文字輸入中的自然語言指示,引導語音風格、速度、呈現方式、語氣與口音。
Google AI Studio 新增可設定的控制項,包含場景指導、說話者層級的細節指定與 inline tags,協助開發者塑造多輪表現。
開發者可以將 Google AI Studio 中的精確語音參數匯出為 Gemini API code,以便在不同專案與平台間一致重用。
此模型支援原生多說話者對話與 70+ 種語言,因此適合用於在地化與對話式語音體驗。
所有生成的音訊都會以 SynthID 加上浮水印,以支援 AI 生成內容的偵測。
建立需要可控呈現方式的合成語音應用,例如角色配音、旁白體驗或互動式助理。
在 Google AI Studio 中原型化語音體驗,利用標籤與註記調整節奏與語氣,並將結果設定匯出到 Gemini API code。
為跨多種語言的受眾建立在地化語音體驗,同時維持一致的風格與口音控制。
當你需要為 Workspace 媒體工作流程提供 AI 生成語音時,可在 Google Vids 中使用此模型。
當你需要可偵測的 AI 生成語音以便更安全地散布時,可生成內建 SynthID 浮水印的音訊。
它正以預覽版形式,透過 Gemini API 與 Google AI Studio 提供給開發者,透過 Vertex AI 提供給企業,並透過 Google Vids 提供給 Workspace 使用者。
公告指出它支援 70+ 種語言,並包含原生多說話者對話。
開發者可在 Google AI Studio 中使用 audio tags、Audio Profiles、Director’s Notes 與 inline tags 來引導語音風格、節奏、呈現方式、口音與說話者表達,之後再將相同參數匯出為 Gemini API code。
Gemini 3.1 Flash TTS 產生的所有音訊都會以 SynthID 加上浮水印,這被描述為一種不可感知、用於偵測 AI 生成音訊的浮水印。
來源未提供產品頁上的價格細節,而研究集中連結的定價頁面是 404。
藍藻AI 是線上 AI 配音與語音合成工具,可將文字轉成語音,支援自助聲音克隆,適合短影音、有聲書等需要快速配音的內容場景。
Ondoku 是一款可直接在瀏覽器使用的文字轉語音工具,可將文字轉成可下載的 .mp3 語音,提供免費額度與付費方案,支援多語朗讀、圖片朗讀與按規則商用。
Typecast 是一款線上 AI 聲音生成器,可將文字轉為擬真語音,支援情感表達與多種超擬真聲音,適合在瀏覽器中快速製作配音內容。
Noiz AI 是一款 AI 文字轉語音、聲音克隆與聲音設計工具,可將文字轉為逼真語音,並在同一流程中調整情緒等聲音表現。
魔音工坊 (Moying Gongfang) 是一個智慧化的線上文字轉語音 (TTS) 平台,它能利用逼真的人類聲音和多種口音,將書面文字轉換成高品質的旁白。
TADA 是 Hume AI 的開源語音語言模型,支援文字與聲學一對一對齊的語音生成,適合開發者與研究者打造更快速、更可靠的語音系統,亦可用於裝置端與長篇語音應用。