语音代理编排
该库提供一个用于本地端语音处理的 C++17 语音代理流水线,包括轮次检测、中断处理、音频工具和对话跟踪。
speech-core 是一款用于构建本地端语音系统和语音代理流水线的 C++17 库。它将编排逻辑与语音转文本、文本转语音、语音活动检测、说话人分离、增强、回声消除以及可选语言模型钩子的抽象接口结合在一起。
该项目设计为在 CPU 上本地运行,并通过可选的 ONNX Runtime 或 LiteRT 后端添加模型推理。文档将其定位为适用于 Linux、Windows 和 Android 的可移植核心,Apple 支持则通过一个单独的 Swift 兄弟库提供。
该库提供一个用于本地端语音处理的 C++17 语音代理流水线,包括轮次检测、中断处理、音频工具和对话跟踪。
它在同一个核心包中支持本地语音活动检测、批量转写、实时流式转写、说话人分离和文本转语音。
模型推理通过 ONNX Runtime 或 LiteRT 按需启用,文档还列出了各后端可用的具体模型。
编排层只依赖抽象接口,因此调用方可以接入自定义实现,例如 CPU、GPU、CoreML/MLX 或远程 API。
仓库包含面向 Linux、Windows、Android 和 macOS 的平台与后端指南,并说明了 CUDA、TensorRT、NNAPI 和 QNN 等硬件加速路径。
文档中的示例代码展示了直接使用 C++ 接口进行转写、流式部分结果、说话人分离和 TTS 合成。
构建一个本地助手流水线,检测语音、流式输出转写、将事件传给 LLM,并生成响应,而无需通过云服务路由音频。
为桌面或移动应用添加低延迟转写,包括音频仍在持续到达时的部分结果。
按说话人对音频进行分段,用于会议纪要、访谈分析或感知说话人分离的后处理。
将 VAD 和 TTS 直接嵌入需要本地音频交互的产品中,例如离线助手或嵌入式语音功能。
仅集成编排层,并用自定义的 CPU、GPU、CoreML、MLX 或远程实现替换参考模型。
它是一个用于本地语音代理工作流的 C++17 语音核心,模型实现可选使用 ONNX Runtime 和 LiteRT 后端。
仓库文档说明支持 Linux、Windows 和 Android,也提到可通过一个 Swift 兄弟库支持 Apple 平台。
可以。核心编排层可以在没有模型后端的情况下运行;使用者可以启用 ONNX、LiteRT、两者都启用,或者都不启用,同时提供自己的实现。
文档展示了批量转写、带部分结果的流式转写、语音活动检测、说话人分离、文本转语音,以及将这些部分组合起来的语音代理流水线。
SpeakoFlow 是一款适用于 Windows、macOS 和 Linux 的免费开源桌面语音转文字应用,支持在任意应用中口述输入、Flow 语音写作、文本清理、翻译和屏幕感知助手。
QuickQuill 是一款适用于 macOS 的本地语音输入与转写应用,可在设备上录制会议、转写音频、生成摘要并导出笔记,无需使用云服务。
Zen Whisper 是一款适用于运行 macOS 14 或更高版本的 Apple Silicon Mac 的本地优先听写与转写应用。可在大多数 Mac 文本框直接语音输入,并转写媒体或受支持的公开链接,支持 110 种口语选项。
Speech to Text Converter 是一款基于浏览器的语音转文字工具,支持实时听写和上传音频、视频文件转录。提供免费版满足短任务,Pro 版支持无限转录、AI 摘要、翻译、说话人识别和高级导出。
Sanota 将口述回忆、反思和访谈转写为清晰书面故事,支持个人叙事、家族史与共享记忆,提供引导提示和订阅方案。
Carbon Voice 是一款适用于团队和个人的异步语音消息应用,支持转录、AI 快速补课和跨设备访问,让你无需实时通话也能顺畅沟通。