富有表现力的语音生成
生成自然的语音,并提供表达控制,包括悲伤、低声和兴奋等情绪标签。
MAI-Voice-2 是 Microsoft AI 的文本转语音模型,用于为语音质量会影响用户体验的产品和服务生成自然、富有表现力的语音。微软将其定位于助手、客户支持、有声书、无障碍体验以及其他长篇或品牌敏感型语音工作流。
该模型可在 Microsoft Foundry 中使用,也正在集成到 VS Code 和 Dynamics 365 Contact Center 中。微软表示,它支持 15 种语言/地区、通过标签进行情绪控制、基于短参考音频的零样本语音提示,以及针对特定语言对的代码切换,同时在较长的生成过程中保持说话人身份一致。
生成自然的语音,并提供表达控制,包括悲伤、低声和兴奋等情绪标签。
将覆盖范围从仅英语扩展到 15 种语言/地区,同时尽量保持相同的自然度和表现力。
使用 5–60 秒的参考音频创建自定义声音,无需重新训练或微调。
在有声书、播客和讲座等长篇输出中保持说话人身份一致。
支持印地语-英语和西班牙语-英语等特定语言对的代码切换。
包含同意保护机制,确保生产环境中只能合成经过授权、已获许可的声音。
使用 MAI-Voice-2 为助手或客服产品提供品牌化、统一的声音,使其与用户从产品中听到的体验保持一致。
为有声书、播客和讲座等长篇音频生成旁白,在较长输出中保持稳定的说话人身份。
为视障用户或依赖语音输出作为主要交互方式的用户创建无障碍语音界面。
为游戏、AR/VR 或脚本化媒体构建角色声音,并控制情绪和表达风格。
使用短参考音频在 Microsoft Foundry 中创建自定义声音,适合希望拥有专属声音但不想训练单独模型的产品团队。
MAI-Voice-2 可在 Microsoft Foundry 中使用,微软还表示它也正在集成到 VS Code 和 Dynamics 365 Contact Center 中。
页面将 MAI-Voice-2 描述为一款文本转语音模型,支持 15 种语言/地区、情绪标签、基于 5–60 秒参考音频的零样本语音提示、针对特定语言对的代码切换,以及在长篇输出中保持稳定的说话人身份。
微软表示,可以在 Microsoft Foundry 中使用一小段参考音频创建自定义声音,无需重新训练或微调,但生产环境中只能合成经过授权、已获许可的声音。
发布页面列出了支持的语言/地区,包括英语(美国)、英语(澳大利亚)、意大利语、法语、德语、印地语、西班牙语(西班牙)、西班牙语(墨西哥)、葡萄牙语(巴西)、葡萄牙语(葡萄牙)、韩语、中文(简体)、土耳其语、俄语、泰语、荷兰语、罗马尼亚语和匈牙利语。
Wallie 是一款开源 AI 直播助手,能观看屏幕、聆听聊天并以可配置人设生成实时解说。支持本地运行、使用自有密钥,适合无真人出镜内容、自动化直播和实时互动。
Fylom 是一款 AI 播客生成器,可将主题或问题转化为经过资料研究的播客单集,支持文字或语音提示、音色选择,以及日常、每周或按需更新的连续节目式收听。
BeFreed 是一款个性化音频学习应用,可将书籍和其他知识源转化为有声聆听体验。支持按需学习、可选声音与内置学习工具。
Gemini 3.1 Flash TTS 是 Google 的预览版文本转语音模型,可生成富有表现力的 AI 语音,并支持对风格、语速和表达方式进行细粒度控制,适用于 Gemini API、Google AI Studio、Vertex AI 和 Google Vids。
蓝藻AI是一款在线AI配音与语音合成工具,可将文字转成语音,并支持自助声音克隆,适用于短视频、有声书等配音场景。
Speko 是一款语音 AI 路由器,可按语言基准测试语音模型,并通过一个 API 路由 STT、LLM 和 TTS;还提供打包基础设施方案与企业合同路径。