音声エージェントのオーケストレーション
このライブラリは、オンデバイスの音声処理向けにC++17で音声エージェント処理パイプラインを提供し、ターン検出、割り込み処理、音声ユーティリティ、会話トラッキングを含みます。
speech-coreは、オンデバイスの音声システムと音声エージェントパイプラインを構築するためのC++17ライブラリです。音声認識、音声合成、音声アクティビティ検出、話者分離、強調、エコーキャンセル、任意の言語モデルフック向けの抽象インターフェースと、オーケストレーションロジックを組み合わせています。
このプロジェクトはCPU上でローカルに動作するよう設計されており、モデル推論は任意のONNX RuntimeまたはLiteRTバックエンドを通じて追加されます。ドキュメントでは、Linux、Windows、Android向けの移植性の高いコアとして位置づけられており、Appleのサポートは別のSwift姉妹ライブラリで提供されます。
このライブラリは、オンデバイスの音声処理向けにC++17で音声エージェント処理パイプラインを提供し、ターン検出、割り込み処理、音声ユーティリティ、会話トラッキングを含みます。
同じコアパッケージから、オンデバイスの音声アクティビティ検出、バッチ文字起こし、リアルタイムのストリーミング文字起こし、話者分離、音声合成をサポートします。
モデル推論はONNX RuntimeまたはLiteRT経由で任意に有効化でき、ドキュメントには各バックエンドで利用可能な特定のモデルが一覧されています。
オーケストレーション層は抽象インターフェースのみに依存するため、呼び出し側はCPU、GPU、CoreML/MLX、リモートAPIなどの独自実装を差し込めます。
リポジトリにはLinux、Windows、Android、macOS向けのプラットフォームおよびバックエンドのガイダンスに加え、CUDA、TensorRT、NNAPI、QNNのようなハードウェアアクセラレーション経路の注記も含まれています。
ドキュメントのサンプルコードでは、文字起こし、ストリーミングの部分結果、話者分離、TTS合成にC++インターフェースを直接使う方法が示されています。
音声を検出し、文字起こしをストリーミングし、イベントをLLMに渡し、音声をクラウドサービスに送らずに応答を生成するローカルアシスタントのパイプラインを構築します。
音声がまだ入力中でも部分結果を含む、低遅延の文字起こしをデスクトップアプリやモバイルアプリに追加します。
会議メモ、インタビュー分析、話者分離を意識した後処理のために、音声を話者ごとに区切ります。
ローカル音声対話が必要な製品、たとえばオフラインアシスタントや組み込み音声機能にVADとTTSを直接組み込みます。
オーケストレーション層だけを統合し、参照モデルをカスタムのCPU、GPU、CoreML、MLX、またはリモート実装に置き換えます。
speech-coreは、ローカルの音声エージェントワークフロー向けに設計されたC++17の音声コアで、モデル実装には任意でONNX RuntimeとLiteRTのバックエンドを利用できます。
リポジトリではLinux、Windows、Androidの対応が案内されており、AppleのサポートはSwiftの姉妹ライブラリ経由で利用できることも記載されています。
はい。コアのオーケストレーション層はモデルバックエンドなしでも動作し、利用者は独自実装を用意しながら、ONNX、LiteRT、両方、またはどちらも使わない構成を選べます。
ドキュメントでは、バッチ文字起こし、途中結果付きのストリーミング文字起こし、音声アクティビティ検出、話者分離、音声合成、これらを組み合わせた音声エージェント処理が示されています。
QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。
Speech to Text Converter は、ブラウザで使える文字起こしツールです。ライブ音声入力や音声・動画ファイルのアップロードに対応し、短い作業向けの無料プランと、無制限の文字起こし、AI要約、翻訳、話者識別、詳細な書き出し機能を備えたProプランがあります。
Sanotaは、話した思い出や振り返り、インタビューを分かりやすい文章の物語に変えるアプリ。家族史や共有の記憶づくりを、ガイド付きプロンプトと月額・年額プランで支援します。
Carbon Voiceは、チームと個人向けの非同期音声メッセージアプリ。文字起こし、AI要約、端末間アクセスで、通話なしのコミュニケーションを実現します。
Talkpalは、130以上の言語でスピーキング、リスニング、ライティング、発音を練習できるAI搭載の語学学習Web・モバイルアプリ。ガイド付きコースやロールプレイ、通話形式の会話練習に対応。
Realtime and audio は、ライブ音声の翻訳、文字起こし、音声生成、音声対応チャットに最適な speech architecture を選ぶための OpenAI API ガイドです。各用途に合う session type、endpoint、接続方法を案内します。