提升的语音质量
该模型被介绍为 Google 迄今最自然、最具表现力的文本转语音模型,具备更好的语音质量和可控性。
Gemini 3.1 Flash TTS 是 Google 的文本转语音模型,可生成富有表现力的 AI 语音,并对音频听感提供更精细的控制。发布公告强调了更好的自然度、更清晰的节奏控制,以及新的音频标签,可让开发者通过自然语言指令来引导语音风格和表达方式。
该模型正以预览版形式面向开发者通过 Gemini API 和 Google AI Studio 推出,面向企业通过 Vertex AI 推出,并面向 Workspace 用户通过 Google Vids 提供。它支持 70+ 种语言、原生多说话人对话,以及为每个生成的音频输出提供 SynthID 水印标记。
该模型被介绍为 Google 迄今最自然、最具表现力的文本转语音模型,具备更好的语音质量和可控性。
音频标签可让用户通过嵌入文本输入的自然语言指令来控制声音风格、语速、表达方式、语调和口音。
Google AI Studio 提供可配置的场景指挥、说话人级别的具体设定和内嵌标签,帮助开发者塑造多轮表演。
开发者可以将 Google AI Studio 中的精确声音参数导出为 Gemini API 代码,以便在不同项目和平台间一致复用。
该模型支持原生多说话人对话和 70+ 种语言,因此适合本地化和对话式语音体验。
所有生成的音频都会经过 SynthID 水印标记,以支持对 AI 生成内容的检测。
构建需要可控表达方式的合成语音应用,例如角色声音、旁白体验或交互式助手。
在 Google AI Studio 中原型化语音体验,用标签和注释优化语速与语调,并将结果设置导出到 Gemini API 代码。
为多个语言受众创建本地化语音体验,同时保持风格和口音控制的一致性。
当你需要为 Workspace 媒体工作流生成 AI 语音时,可在 Google Vids 中使用该模型。
当你需要可检测的 AI 生成语音以便更安全分发时,生成内置 SynthID 水印的音频。
它正在通过 Gemini API 和 Google AI Studio 向开发者以预览版形式推出,通过 Vertex AI 向企业以预览版形式推出,并通过 Google Vids 向 Workspace 用户提供。
公告称它支持 70+ 种语言,并包含原生多说话人对话。
开发者可以在 Google AI Studio 中使用音频标签、Audio Profiles、Director’s Notes 和内嵌标签来控制声音风格、语速、语调、口音和说话表现,然后将相同参数导出为 Gemini API 代码。
Gemini 3.1 Flash TTS 生成的所有音频都会用 SynthID 进行水印标记;文中将其描述为用于检测 AI 生成音频的不可感知水印。
来源未在产品页面提供定价信息,而研究集中链接的定价页面返回 404。
蓝藻AI是一款在线AI配音与语音合成工具,可将文字转成语音,并支持自助声音克隆,适用于短视频、有声书等配音场景。
Ondoku 是一款基于浏览器的文字转语音软件,可将文本转换为可下载的 .mp3 语音,提供免费额度与付费方案,支持多语言朗读、图片朗读,并可按规则商用。
Typecast 是一款在线 AI 配音生成器,可将文本转换为自然逼真的语音,支持情感表达与多种超写实音色,适合在浏览器中快速制作口播音频。
Noiz AI 是一款 AI 文本转语音、声音克隆与声音设计工具,可将文本生成逼真的语音,并在同一流程中调节情感等声音表现。
魔音工坊 (Moying Gongfang) 是一个智能在线文本转语音 (TTS) 平台,它使用逼真的人声和各种口音,将书面文本转换为高质量的画外音。
TADA 是 Hume AI 的开源语音语言模型,支持文本与语音一一对齐生成,更适合构建高速度、高可靠性的语音系统,适用于端侧部署与长文本语音应用。