批量和流式转录
通过 REST 工作流从大型音频文件生成转录,或使用低延迟的 WebSocket API 在语音发生时实时转录。
Grok Speech to Text and Text to Speech APIs 是 xAI 面向开发者提供的独立音频端点,适用于需要在应用中实现语音识别和语音合成的场景。该产品提供两个独立 API:用于转录的 Grok STT,以及用于生成语音的 Grok TTS。
这些 API 基于驱动 Grok Voice、Tesla 车辆和 Starlink 客户支持的同一技术栈。xAI 将其定位于语音代理、实时转录工具、无障碍解决方案、播客以及其他交互式音频工作流。
通过 REST 工作流从大型音频文件生成转录,或使用低延迟的 WebSocket API 在语音发生时实时转录。
通过词级时间戳、说话人分离、多通道处理以及针对数字、日期、货币和类似文本的逆文本规范化,提升转录内容的可用性。
支持 25+ 语言,并可在不中断转录流程的情况下切换语言。
通过 REST 或实时 WebSocket 端点,将文本转换为自然、富有表现力的语音。
使用内联和包裹式语音标签控制输出,例如 `[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>` 和 `<pause>`。
采用按用量计费,并为批量 STT、流式 STT 和 TTS 设有不同费率。
为面向客户或内部的工具添加语音识别,这些工具需要对上传的音频进行批量转录,或在对话过程中进行实时转录。
构建能够监听口语输入并返回带有时间戳、说话人标签和标准化实体的结构化文本的助手。
为旁白内容、交互式体验或无障碍功能生成语音输出,在这些场景中自然的表达很重要。
处理会议、访谈或支持通话等多说话人录音,其中说话人分离和多通道输入有助于提升可读性。
支持跨语言协作的团队,并需要一种无需更改工作流即可在多种语言之间切换的转录系统。
这些 API 是面向开发者的独立音频端点,用于向应用添加语音识别或语音合成。页面强调的使用场景包括语音代理、实时转录工具、无障碍工具、播客以及交互式音频体验。
Speech to Text 可通过批量 REST API 和实时 WebSocket API 使用。Text to Speech 也可通过 REST 和 WebSocket 端点使用,因此开发者可以选择批处理或流式工作流。
这些语音 API 支持覆盖 25+ 语言的多语言转录。页面还强调了词级时间戳、说话人分离、多通道支持,以及用于结构化转录输出的逆文本规范化。
Text to Speech 支持自然、富有表现力的声音,并提供语音标签以便对韵律和情感进行精细控制。页面列出的示例包括内联和包裹式标签,如 `[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>` 和 `<pause>`。
定价按用量计费。页面说明 Speech to Text 按批处理和流式使用的每小时计费,Text to Speech 按每百万字符计费。当前费率限制和完整详情可在 xAI API 控制台中查看。
SpeakoFlow 是一款适用于 Windows、macOS 和 Linux 的免费开源桌面语音转文字应用,支持在任意应用中口述输入、Flow 语音写作、文本清理、翻译和屏幕感知助手。
Sanota 将口述回忆、反思和访谈转写为清晰书面故事,支持个人叙事、家族史与共享记忆,提供引导提示和订阅方案。
Carbon Voice 是一款适用于团队和个人的异步语音消息应用,支持转录、AI 快速补课和跨设备访问,让你无需实时通话也能顺畅沟通。
Talkpal 是一款 AI 语言学习 Web 和移动应用,支持口语、听力、写作和发音练习,提供 130+ 种语言的课程、角色扮演和电话式对话练习。
QuickQuill 是一款适用于 macOS 的本地语音输入与转写应用,可在设备上录制会议、转写音频、生成摘要并导出笔记,无需使用云服务。
Zen Whisper 是一款适用于运行 macOS 14 或更高版本的 Apple Silicon Mac 的本地优先听写与转写应用。可在大多数 Mac 文本框直接语音输入,并转写媒体或受支持的公开链接,支持 110 种口语选项。