语音代理编排
该库提供一个用于本地端语音处理的 C++17 语音代理流水线,包括轮次检测、中断处理、音频工具和对话跟踪。
speech-core 是一款用于构建本地端语音系统和语音代理流水线的 C++17 库。它将编排逻辑与语音转文本、文本转语音、语音活动检测、说话人分离、增强、回声消除以及可选语言模型钩子的抽象接口结合在一起。
该项目设计为在 CPU 上本地运行,并通过可选的 ONNX Runtime 或 LiteRT 后端添加模型推理。文档将其定位为适用于 Linux、Windows 和 Android 的可移植核心,Apple 支持则通过一个单独的 Swift 兄弟库提供。
该库提供一个用于本地端语音处理的 C++17 语音代理流水线,包括轮次检测、中断处理、音频工具和对话跟踪。
它在同一个核心包中支持本地语音活动检测、批量转写、实时流式转写、说话人分离和文本转语音。
模型推理通过 ONNX Runtime 或 LiteRT 按需启用,文档还列出了各后端可用的具体模型。
编排层只依赖抽象接口,因此调用方可以接入自定义实现,例如 CPU、GPU、CoreML/MLX 或远程 API。
仓库包含面向 Linux、Windows、Android 和 macOS 的平台与后端指南,并说明了 CUDA、TensorRT、NNAPI 和 QNN 等硬件加速路径。
文档中的示例代码展示了直接使用 C++ 接口进行转写、流式部分结果、说话人分离和 TTS 合成。
构建一个本地助手流水线,检测语音、流式输出转写、将事件传给 LLM,并生成响应,而无需通过云服务路由音频。
为桌面或移动应用添加低延迟转写,包括音频仍在持续到达时的部分结果。
按说话人对音频进行分段,用于会议纪要、访谈分析或感知说话人分离的后处理。
将 VAD 和 TTS 直接嵌入需要本地音频交互的产品中,例如离线助手或嵌入式语音功能。
仅集成编排层,并用自定义的 CPU、GPU、CoreML、MLX 或远程实现替换参考模型。
它是一个用于本地语音代理工作流的 C++17 语音核心,模型实现可选使用 ONNX Runtime 和 LiteRT 后端。
仓库文档说明支持 Linux、Windows 和 Android,也提到可通过一个 Swift 兄弟库支持 Apple 平台。
可以。核心编排层可以在没有模型后端的情况下运行;使用者可以启用 ONNX、LiteRT、两者都启用,或者都不启用,同时提供自己的实现。
文档展示了批量转写、带部分结果的流式转写、语音活动检测、说话人分离、文本转语音,以及将这些部分组合起来的语音代理流水线。
QuickQuill 是一款适用于 macOS 的本地语音输入与转写应用,可在设备上录制会议、转写音频、生成摘要并导出笔记,无需使用云服务。
Speech to Text Converter 是一款基于浏览器的语音转文字工具,支持实时听写和上传音频、视频文件转录。提供免费版满足短任务,Pro 版支持无限转录、AI 摘要、翻译、说话人识别和高级导出。
Sanota 将口述回忆、反思和访谈转写为清晰书面故事,支持个人叙事、家族史与共享记忆,提供引导提示和订阅方案。
Carbon Voice 是一款适用于团队和个人的异步语音消息应用,支持转录、AI 快速补课和跨设备访问,让你无需实时通话也能顺畅沟通。
Talkpal 是一款 AI 语言学习 Web 和移动应用,支持口语、听力、写作和发音练习,提供 130+ 种语言的课程、角色扮演和电话式对话练习。
OpenAI API 指南,帮助开发者为实时音频、翻译、转录、语音生成和支持音频的聊天选择合适的语音架构,并匹配对应会话类型、端点与连接方式。