提升的語音品質
此模型被介紹為 Google 迄今最自然且最具表現力的文字轉語音模型,並具備更好的語音品質與可控性。
Gemini 3.1 Flash TTS 是 Google 的文字轉語音模型,可生成富有表現力的 AI 語音,並更精細地控制音訊聽起來的方式。發布公告強調了更好的自然度、更清楚的節奏控制,以及新的音訊標籤,讓開發者能透過自然語言指示來引導語音風格與呈現方式。
此模型正以預覽版逐步向開發者透過 Gemini API 與 Google AI Studio 開放,向企業透過 Vertex AI 開放,並向 Workspace 使用者透過 Google Vids 開放。它支援 70+ 種語言、原生多說話者對話,以及每個生成音訊輸出的 SynthID 浮水印。
此模型被介紹為 Google 迄今最自然且最具表現力的文字轉語音模型,並具備更好的語音品質與可控性。
Audio tags 可讓使用者透過嵌入在文字輸入中的自然語言指示,引導語音風格、速度、呈現方式、語氣與口音。
Google AI Studio 新增可設定的控制項,包含場景指導、說話者層級的細節指定與 inline tags,協助開發者塑造多輪表現。
開發者可以將 Google AI Studio 中的精確語音參數匯出為 Gemini API code,以便在不同專案與平台間一致重用。
此模型支援原生多說話者對話與 70+ 種語言,因此適合用於在地化與對話式語音體驗。
所有生成的音訊都會以 SynthID 加上浮水印,以支援 AI 生成內容的偵測。
建立需要可控呈現方式的合成語音應用,例如角色配音、旁白體驗或互動式助理。
在 Google AI Studio 中原型化語音體驗,利用標籤與註記調整節奏與語氣,並將結果設定匯出到 Gemini API code。
為跨多種語言的受眾建立在地化語音體驗,同時維持一致的風格與口音控制。
當你需要為 Workspace 媒體工作流程提供 AI 生成語音時,可在 Google Vids 中使用此模型。
當你需要可偵測的 AI 生成語音以便更安全地散布時,可生成內建 SynthID 浮水印的音訊。
它正以預覽版形式,透過 Gemini API 與 Google AI Studio 提供給開發者,透過 Vertex AI 提供給企業,並透過 Google Vids 提供給 Workspace 使用者。
公告指出它支援 70+ 種語言,並包含原生多說話者對話。
開發者可在 Google AI Studio 中使用 audio tags、Audio Profiles、Director’s Notes 與 inline tags 來引導語音風格、節奏、呈現方式、口音與說話者表達,之後再將相同參數匯出為 Gemini API code。
Gemini 3.1 Flash TTS 產生的所有音訊都會以 SynthID 加上浮水印,這被描述為一種不可感知、用於偵測 AI 生成音訊的浮水印。
來源未提供產品頁上的價格細節,而研究集中連結的定價頁面是 404。
Fylom 是 AI Podcast 生成器,能將主題或問題轉化為經查證的旁白節目;支援文字或語音提示、聲音選擇,以及定期更新的節目式收聽體驗。
藍藻AI 是線上 AI 配音與語音合成工具,可將文字轉成語音,支援自助聲音克隆,適合短影音、有聲書等需要快速配音的內容場景。
Ondoku 是一款可直接在瀏覽器使用的文字轉語音工具,可將文字轉成可下載的 .mp3 語音,提供免費額度與付費方案,支援多語朗讀、圖片朗讀與按規則商用。
Typecast 是一款線上 AI 聲音生成器,可將文字轉為擬真語音,支援情感表達與多種超擬真聲音,適合在瀏覽器中快速製作配音內容。
Noiz AI 是一款 AI 文字轉語音、聲音克隆與聲音設計工具,可將文字轉為逼真語音,並在同一流程中調整情緒等聲音表現。
魔音工坊 (Moying Gongfang) 是一個智慧化的線上文字轉語音 (TTS) 平台,它能利用逼真的人類聲音和多種口音,將書面文字轉換成高品質的旁白。