Grok Speech to Text and Text to Speech APIs icon

Grok Speech to Text and Text to Speech APIs

xAIのGrok Speech to Text and Text to Speech APIsは、RESTとWebSocketでアプリに文字起こしと音声生成を追加できる開発者向けAPI。多言語STT、表現豊かなTTS、従量課金に対応。

Grok Speech to Text and Text to Speech APIs

概要

Grok Speech to Text and Text to Speech APIs は、アプリケーションに音声認識と音声合成を必要とする開発者向けの xAI の独立した音声エンドポイントです。この製品は、文字起こし用の Grok STT と、生成音声用の Grok TTS という 2 つの পৃথ अलगな API を提供します。

これらの API は、Grok Voice、Tesla 車両、Starlink のカスタマーサポートを支えるのと同じスタック上に構築されています。xAI は、音声エージェント、リアルタイム文字起こしツール、アクセシビリティソリューション、ポッドキャスト、その他のインタラクティブな音声ワークフロー向けに位置づけています。

主な機能

バッチおよびストリーミング文字起こし

REST ワークフローで大容量の音声ファイルから文字起こしを生成したり、低遅延の WebSocket API で発話中の音声をそのまま文字起こししたりできます。

構造化された文字起こし出力

単語レベルのタイムスタンプ、話者ダイアライゼーション、マルチチャネル対応、数値・日付・通貨などのテキストに対するインバーステキスト正規化で、文字起こしの使いやすさを向上します。

多言語対応

25以上の言語に対応し、文字起こしの流れを中断せずに言語を切り替えられます。

テキスト読み上げ生成

REST またはリアルタイムの WebSocket エンドポイントを通じて、自然で表現力豊かな音声をテキストから生成できます。

きめ細かな音声制御

`[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>` などのインラインタグやラップタグを使って、話し方を細かく制御できます。

シンプルな従量課金

バッチ STT、ストリーミング STT、TTS でそれぞれ異なる料金が設定された従量課金を利用できます。

実用的なユースケース

  • 文字起こしパイプライン

    アップロードされた音声のバッチ文字起こしや、会話中のライブ文字起こしが必要な、顧客向けまたは社内向けツールに音声認識を追加します。

  • 音声エージェントとアシスタント

    音声入力を聞き取り、タイムスタンプ、話者ラベル、正規化されたエンティティを含む構造化テキストを返すアシスタントを構築します。

  • テキスト読み上げ出力

    ナレーション付きコンテンツ、インタラクティブ体験、または自然な話し方が重要なアクセシビリティ機能向けに、音声出力を生成します。

  • 会議と通話の分析

    会議、インタビュー、サポート通話などの複数話者の録音を扱い、話者分離とマルチチャネル入力によって読みやすさを向上させます。

  • 多言語オーディオワークフロー

    複数の言語にまたがって作業し、ワークフローを変えずに多くの言語を切り替えられる文字起こしシステムを必要とするチームをサポートします。

Pros and Cons

Pros

  • このページでは 1 つのオールインワン価格は公開されておらず、課金は STT と TTS の利用タイプごとに分かれています。
  • 完全なレート制限は発表ページには記載されておらず、xAI API コンソールで参照するよう案内されています。
  • 発表ページでは、SDK、対応プログラミング言語、統合パートナーは明示されていません。

Cons

  • 異なる音声ワークフロー向けに、STT と TTS の個別 API を提供しています。
  • バッチ利用とリアルタイム利用の両方に対して、REST と WebSocket のアクセスをサポートしています。
  • タイムスタンプ、ダイアライゼーション、マルチチャネル対応、インバーステキスト正規化などの文字起こし機能を備えています。
  • 25以上の言語にわたる多言語 STT を提供します。
  • TTS 利用者は、強調、間、ささやき、その他の表現をインラインで制御できる speech tags を利用できます。

FAQ

Grok STT と TTS API は何のためのものですか?

これらのAPIは、アプリケーションに音声認識や音声合成を追加したい開発者向けの独立した音声エンドポイントです。ページでは、音声エージェント、リアルタイム文字起こし、アクセシビリティツール、ポッドキャスト、インタラクティブな音声体験などの用途が挙げられています。

これらのAPIはどのインターフェースに対応していますか?

Speech to Text は、バッチ処理の REST API とリアルタイムの WebSocket API の両方で利用できます。Text to Speech も REST と WebSocket のエンドポイントで利用できるため、開発者はバッチ処理とストリーミングのワークフローを選択できます。

Grok STT にはどのような文字起こし機能がありますか?

音声APIは、25以上の言語にわたる多言語文字起こしをサポートしています。ページでは、構造化された文字起こし出力のための単語レベルのタイムスタンプ、話者ダイアライゼーション、マルチチャネル対応、数値・日付・通貨などのインバーステキスト正規化も強調されています。

Grok TTS は音声スタイルや表現をどのように扱いますか?

Text to Speech は、自然で表現力豊かな音声と、韻律や感情を細かく制御できる speech tags をサポートしています。ページには例として、`[laugh]`、`[sigh]`、`[whisper]`、`<emphasis>`、`<slow>`、`<pause>` などのインラインタグやラップタグが挙げられています。

料金体系はどのようになっていますか?

価格は従量課金です。ページでは、Speech to Text はバッチ利用とストリーミング利用で時間単位、Text to Speech は100万文字単位で課金されると説明されています。現在のレート制限と詳細は xAI API コンソールで確認できます。

Quick Facts

カテゴリ
Developer Tool
ソースドメイン
x.ai
主要製品
Grok Speech to Text and Grok Text to Speech
アクセス方法
REST API and WebSocket API
料金モデル
従量課金
言語サポート
25+ languages for STT

Grok Speech to Text and Text to Speech APIsの代替品