語音代理編排
此函式庫提供一個用於裝置端語音處理的 C++17 語音代理流程,包含輪次偵測、中斷處理、音訊工具與對話追蹤。
speech-core 是一套用於裝置端語音編排的 C++17 函式庫,用於建構本機語音系統與語音代理流程。它結合了編排邏輯,以及語音轉文字、文字轉語音、語音活動偵測、說話人分離、增強、回音消除與可選語言模型掛鉤的抽象介面。
此專案設計為在 CPU 上本機執行,並可透過可選的 ONNX Runtime 或 LiteRT 後端加入模型推論。文件將其定位為適用於 Linux、Windows 與 Android 的可攜式核心,而 Apple 支援則透過另一個獨立的 Swift 兄弟函式庫提供。
此函式庫提供一個用於裝置端語音處理的 C++17 語音代理流程,包含輪次偵測、中斷處理、音訊工具與對話追蹤。
它在同一個核心套件中支援裝置端語音活動偵測、批次轉錄、即時串流轉錄、說話人分離與文字轉語音。
模型推論透過 ONNX Runtime 或 LiteRT 按需啟用,文件也列出各後端可用的特定模型。
編排層只依賴抽象介面,因此呼叫端可插入自訂實作,例如 CPU、GPU、CoreML/MLX 或遠端 API。
儲存庫包含 Linux、Windows、Android 與 macOS 的平台與後端指引,並附有 CUDA、TensorRT、NNAPI 與 QNN 等硬體加速路徑的說明。
文件中的範例程式碼展示了如何直接使用 C++ 介面進行轉錄、串流部分結果、說話人分離與 TTS 合成。
建構本機助理流程,偵測語音、串流轉錄、將事件傳遞給 LLM,並產生回應,而不需要把音訊透過雲端服務轉送。
為桌面或行動應用加入低延遲轉錄功能,包括音訊仍在輸入時就提供部分結果。
依說話者切分音訊,用於會議記錄、訪談分析或具說話人分離意識的後處理。
將 VAD 與 TTS 直接嵌入需要本機音訊互動的產品,例如離線助理或嵌入式語音功能。
只整合編排層,並以自訂的 CPU、GPU、CoreML、MLX 或遠端實作替換參考模型。
它是一個用於本機語音代理工作流程的 C++17 語音核心,並可選用 ONNX Runtime 與 LiteRT 來實作模型。
儲存庫文件說明支援 Linux、Windows 與 Android,也提到可透過一個 Swift 兄弟函式庫支援 Apple。
不一定。核心編排層可在沒有模型後端的情況下執行,而使用者可以啟用 ONNX、LiteRT、兩者皆用,或都不用,同時提供自己的實作。
文件展示了批次轉錄、帶部分結果的串流轉錄、語音活動偵測、說話人分離、文字轉語音,以及整合這些元件的語音代理流程。
SpeakoFlow 是適用於 Windows、macOS 與 Linux 的免費開源桌面語音轉文字應用,支援對任何 App 進行聽寫、Flow 語音寫作、AI 清理、翻譯與螢幕感知助理。
QuickQuill 是一款適用於 macOS 的本機語音輸入與轉錄 App,可在裝置上錄音、逐字轉寫、生成摘要與匯出筆記,無需使用雲端服務。
Zen Whisper 是適用於 Apple Silicon Mac、支援 macOS 14 或以上版本的本機優先聽寫與轉錄 app,可在多數 Mac 文字欄位直接口述輸入,並轉錄媒體或支援的公開連結,提供 110 種語言選項。
Speech to Text Converter 是一款瀏覽器語音轉文字工具,支援即時口述與上傳音訊、影片檔。提供免費方案處理短任務,Pro 方案可無限轉錄,並支援 AI 摘要、翻譯、說話者辨識與進階匯出。
Sanota 是一款將口述回憶、反思與訪談轉成清楚文字故事的 App,支援個人敘事、家族歷史與共享記憶,並提供引導提示與訂閱方案。
Carbon Voice 是專為團隊與個人打造的非同步語音訊息 app,提供逐字稿、AI 快速跟進與跨裝置存取,讓你不用即時通話也能順暢溝通。