Fylom 是一款 AI 播客生成器,可将主题或问题转化为经过资料研究的播客单集,支持文字或语音提示、音色选择,以及日常、每周或按需更新的连续节目式收听。
Seed Audio AI 是一款基于浏览器的文本转语音和语音克隆工具,可将脚本转为可预览的语音音频,适合配音、旁白、播客、课程和广告草稿制作。
Vois 是适用于 Mac 和 Windows 的本地 AI 配音生成工作室,可在本机完成语音生成、编辑、母带处理和导出,支持语音克隆、平台导出预设及不限量生成付费方案。
SKI 是一款适用于 Mac 和 Windows 的桌面应用,让开发者可与 AI 编码代理语音对话并听到回复。主语音循环本地离线运行,并支持可选的会议转录和代理协助通话功能。
Chariot 是一款 AI 文字转语音产品,可将文本生成英文、印地语和 Hinglish 语音,支持低延迟流式输出与开发者 API,适用于语音代理、应用音频及自然语音生产流程。
gstack 将 Garry Tan 的开源专家角色以语音机器人形式接入实时会议,支持 Google Meet,并提到可用于 Zoom 和 Teams,通过本地编码代理会话运行。
PodcastorAI 是一款 AI 播客工作室,可将内容转为播客脚本、音频节目和视频播客。支持话题、文档、URL、笔记或录音,一站式生成可发布节目,无需传统录音棚。
VocalVia 将 PDF、文章、笔记、Markdown 和网页内容转换为可编辑播客草稿与音频,先审阅大纲和脚本再生成最终文件。
SpeechifyAI 是一个语音 AI 平台,支持语音生成、声音克隆和语音代理构建。面向开发者,通过单一 API 提供文本转语音、多语言音频和通话工作流。
Alvoff Inference 是面向开发者的 OpenAI 兼容 API,支持语音转文字、文字转语音、embeddings 和聊天/代码生成;只需更换基础 URL,即可沿用熟悉的 SDK,按请求计费。
speech-core 是一款用于本地端语音编排的 C++17 库,支持 VAD、流式与批量 STT、说话人分离、TTS 和语音代理流水线。可本地运行,支持可选 ONNX Runtime 或 LiteRT 后端进行模型推理。
Voiser AI Voiceover 可将文本快速转为配音音频,支持多语言语音选项与风格控制,适合旁白制作、内容本地化及网页工作流。
Tico 是一款适用于 Windows 的 AI 助手,能跟随鼠标指针、识别屏幕内容并用语音引导操作。支持免费每日额度及付费方案,提供更多使用次数与优先支持。
Yeta AI 是一款基于浏览器的 AI 配音工具,可实时翻译并为公开 YouTube 视频配音,适合教程、讲座等长视频观看,支持 10 多种语言,无需字幕。
Morph 是一款基于网页的经典公版读物平台,融合文本、同步朗读和 AI 助手,支持阅读、听读切换,并可浏览精选书库和获取书籍帮助。
FlowSpeech 是一款上下文感知的文本转语音工作室,可将脚本和上传文件转为自然人声。支持多种生成模式、停顿与情绪控制,并提供免费方案及付费套餐。
xAI 的 Grok Speech to Text and Text to Speech APIs 为应用提供转录与语音生成,支持 REST 和 WebSocket、25+语言、自然 TTS,以及按用量计费。
Gemini 3.1 Flash TTS 是 Google 的预览版文本转语音模型,可生成富有表现力的 AI 语音,并支持对风格、语速和表达方式进行细粒度控制,适用于 Gemini API、Google AI Studio、Vertex AI 和 Google Vids。
Guardrails 2.0 是 ElevenLabs 为 ElevenAgents 提供的控制层,帮助 AI 语音代理保持话题聚焦、符合政策,并更安全地部署到生产环境,适用于支持、销售、营销、前台和内部流程团队。
HeyGen Developers 官方 API 文档,支持制作 AI 头像视频、视频翻译、口型同步和交互式视频代理会话;适合开发者通过 API、MCP 和 CLI 工作流接入。