バッチおよびストリーミング文字起こし
REST ワークフローで大容量の音声ファイルから文字起こしを生成したり、低遅延の WebSocket API で発話中の音声をそのまま文字起こししたりできます。
Grok Speech to Text and Text to Speech APIs は、アプリケーションに音声認識と音声合成を必要とする開発者向けの xAI の独立した音声エンドポイントです。この製品は、文字起こし用の Grok STT と、生成音声用の Grok TTS という 2 つの পৃথ अलगな API を提供します。
これらの API は、Grok Voice、Tesla 車両、Starlink のカスタマーサポートを支えるのと同じスタック上に構築されています。xAI は、音声エージェント、リアルタイム文字起こしツール、アクセシビリティソリューション、ポッドキャスト、その他のインタラクティブな音声ワークフロー向けに位置づけています。
REST ワークフローで大容量の音声ファイルから文字起こしを生成したり、低遅延の WebSocket API で発話中の音声をそのまま文字起こししたりできます。
単語レベルのタイムスタンプ、話者ダイアライゼーション、マルチチャネル対応、数値・日付・通貨などのテキストに対するインバーステキスト正規化で、文字起こしの使いやすさを向上します。
25以上の言語に対応し、文字起こしの流れを中断せずに言語を切り替えられます。
REST またはリアルタイムの WebSocket エンドポイントを通じて、自然で表現力豊かな音声をテキストから生成できます。
`[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>` などのインラインタグやラップタグを使って、話し方を細かく制御できます。
バッチ STT、ストリーミング STT、TTS でそれぞれ異なる料金が設定された従量課金を利用できます。
アップロードされた音声のバッチ文字起こしや、会話中のライブ文字起こしが必要な、顧客向けまたは社内向けツールに音声認識を追加します。
音声入力を聞き取り、タイムスタンプ、話者ラベル、正規化されたエンティティを含む構造化テキストを返すアシスタントを構築します。
ナレーション付きコンテンツ、インタラクティブ体験、または自然な話し方が重要なアクセシビリティ機能向けに、音声出力を生成します。
会議、インタビュー、サポート通話などの複数話者の録音を扱い、話者分離とマルチチャネル入力によって読みやすさを向上させます。
複数の言語にまたがって作業し、ワークフローを変えずに多くの言語を切り替えられる文字起こしシステムを必要とするチームをサポートします。
これらのAPIは、アプリケーションに音声認識や音声合成を追加したい開発者向けの独立した音声エンドポイントです。ページでは、音声エージェント、リアルタイム文字起こし、アクセシビリティツール、ポッドキャスト、インタラクティブな音声体験などの用途が挙げられています。
Speech to Text は、バッチ処理の REST API とリアルタイムの WebSocket API の両方で利用できます。Text to Speech も REST と WebSocket のエンドポイントで利用できるため、開発者はバッチ処理とストリーミングのワークフローを選択できます。
音声APIは、25以上の言語にわたる多言語文字起こしをサポートしています。ページでは、構造化された文字起こし出力のための単語レベルのタイムスタンプ、話者ダイアライゼーション、マルチチャネル対応、数値・日付・通貨などのインバーステキスト正規化も強調されています。
Text to Speech は、自然で表現力豊かな音声と、韻律や感情を細かく制御できる speech tags をサポートしています。ページには例として、`[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>` などのインラインタグやラップタグが挙げられています。
価格は従量課金です。ページでは、Speech to Text はバッチ利用とストリーミング利用で時間単位、Text to Speech は100万文字単位で課金されると説明されています。現在のレート制限と詳細は xAI API コンソールで確認できます。
SpeakoFlowは、Windows、macOS、Linux対応の無料・オープンソースのデスクトップ音声入力アプリ。あらゆるアプリに дикationでき、Flow、要約整理、翻訳、画面認識アシスタントにも対応。
Sanotaは、話した思い出や振り返り、インタビューを分かりやすい文章の物語に変えるアプリ。家族史や共有の記憶づくりを、ガイド付きプロンプトと月額・年額プランで支援します。
Carbon Voiceは、チームと個人向けの非同期音声メッセージアプリ。文字起こし、AI要約、端末間アクセスで、通話なしのコミュニケーションを実現します。
Talkpalは、130以上の言語でスピーキング、リスニング、ライティング、発音を練習できるAI搭載の語学学習Web・モバイルアプリ。ガイド付きコースやロールプレイ、通話形式の会話練習に対応。
QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。
Zen Whisperは、Apple Silicon搭載MacのmacOS 14以降向けローカルファーストの音声入力・文字起こしアプリ。ほとんどのMacテキスト欄へ入力でき、メディアや対応公開リンクも文字起こし可能。110言語に対応。