語音代理編排
此函式庫提供一個用於裝置端語音處理的 C++17 語音代理流程,包含輪次偵測、中斷處理、音訊工具與對話追蹤。
speech-core 是一套用於裝置端語音編排的 C++17 函式庫,用於建構本機語音系統與語音代理流程。它結合了編排邏輯,以及語音轉文字、文字轉語音、語音活動偵測、說話人分離、增強、回音消除與可選語言模型掛鉤的抽象介面。
此專案設計為在 CPU 上本機執行,並可透過可選的 ONNX Runtime 或 LiteRT 後端加入模型推論。文件將其定位為適用於 Linux、Windows 與 Android 的可攜式核心,而 Apple 支援則透過另一個獨立的 Swift 兄弟函式庫提供。
此函式庫提供一個用於裝置端語音處理的 C++17 語音代理流程,包含輪次偵測、中斷處理、音訊工具與對話追蹤。
它在同一個核心套件中支援裝置端語音活動偵測、批次轉錄、即時串流轉錄、說話人分離與文字轉語音。
模型推論透過 ONNX Runtime 或 LiteRT 按需啟用,文件也列出各後端可用的特定模型。
編排層只依賴抽象介面,因此呼叫端可插入自訂實作,例如 CPU、GPU、CoreML/MLX 或遠端 API。
儲存庫包含 Linux、Windows、Android 與 macOS 的平台與後端指引,並附有 CUDA、TensorRT、NNAPI 與 QNN 等硬體加速路徑的說明。
文件中的範例程式碼展示了如何直接使用 C++ 介面進行轉錄、串流部分結果、說話人分離與 TTS 合成。
建構本機助理流程,偵測語音、串流轉錄、將事件傳遞給 LLM,並產生回應,而不需要把音訊透過雲端服務轉送。
為桌面或行動應用加入低延遲轉錄功能,包括音訊仍在輸入時就提供部分結果。
依說話者切分音訊,用於會議記錄、訪談分析或具說話人分離意識的後處理。
將 VAD 與 TTS 直接嵌入需要本機音訊互動的產品,例如離線助理或嵌入式語音功能。
只整合編排層,並以自訂的 CPU、GPU、CoreML、MLX 或遠端實作替換參考模型。
它是一個用於本機語音代理工作流程的 C++17 語音核心,並可選用 ONNX Runtime 與 LiteRT 來實作模型。
儲存庫文件說明支援 Linux、Windows 與 Android,也提到可透過一個 Swift 兄弟函式庫支援 Apple。
不一定。核心編排層可在沒有模型後端的情況下執行,而使用者可以啟用 ONNX、LiteRT、兩者皆用,或都不用,同時提供自己的實作。
文件展示了批次轉錄、帶部分結果的串流轉錄、語音活動偵測、說話人分離、文字轉語音,以及整合這些元件的語音代理流程。
QuickQuill 是一款適用於 macOS 的本機語音輸入與轉錄 App,可在裝置上錄音、逐字轉寫、生成摘要與匯出筆記,無需使用雲端服務。
Speech to Text Converter 是一款瀏覽器語音轉文字工具,支援即時口述與上傳音訊、影片檔。提供免費方案處理短任務,Pro 方案可無限轉錄,並支援 AI 摘要、翻譯、說話者辨識與進階匯出。
Sanota 是一款將口述回憶、反思與訪談轉成清楚文字故事的 App,支援個人敘事、家族歷史與共享記憶,並提供引導提示與訂閱方案。
Carbon Voice 是專為團隊與個人打造的非同步語音訊息 app,提供逐字稿、AI 快速跟進與跨裝置存取,讓你不用即時通話也能順暢溝通。
Talkpal 是一款 AI 語言學習網頁與手機應用,提供口說、聽力、寫作與發音練習;具引導式課程、角色扮演與對話式通話練習,支援 130+ 種語言。
OpenAI API 指南,協助選擇即時音訊、翻譯、轉錄、語音生成與可音訊聊天的正確語音架構,對應各應用的 session 類型、端點與連線方式。