Realtime and audio icon

Realtime and audio

Realtime and audio は、ライブ音声の翻訳、文字起こし、音声生成、音声対応チャットに最適な speech architecture を選ぶための OpenAI API ガイドです。各用途に合う session type、endpoint、接続方法を案内します。

Realtime and audio

概要

Realtime and audio は、特定のアプリケーションに適した speech architecture を選ぶための OpenAI API ガイドです。ライブで低遅延の音声向けの Realtime session と、ファイルベース、境界が明確な、または生成された音声ワークフロー向けの request-based audio API を区別します。

このガイドでは、voice agent、ライブ翻訳、realtime transcription、speech generation、audio-capable chat model を扱います。また、session type、transport の選択、安全識別子、beta の Realtime 統合を GA interface に移行する際に必要な変更についても説明します。

コア機能

さまざまな音声ワークフロー向けの session type

アプリが応答、ライブ翻訳、または transcript のみの出力のどれを必要とするかに応じて、voice-agent、translation、transcription の各 session type を選択できます。

持続するライブ音声接続

クライアントが音声を送信し、イベントを受け取り、session state をリアルタイムで更新している間、Realtime セッションを開いたまま維持できます。

ブラウザー対応の voice-agent パス

Agents SDK と WebRTC を使ってブラウザー向け voice agent を構築し、サーバー側ツールへ接続することもできます。

専用の realtime translation フロー

標準の assistant turn lifecycle ではなく、専用の translation endpoint を使って連続的な音声翻訳を行えます。

調整可能な realtime transcription の遅延

gpt-realtime-whisper の latency control を調整して、早い partial text と transcript quality のバランスを取れます。

音声ソースに合わせた transport オプション

音声の取得元と再生先に応じて、ブラウザークライアントから電話システムまで、WebRTC、WebSocket、または SIP を選択します。

一般的なユースケース

  • Voice agents

    ライブ音声を聞き取り、ユーザーに応答し、ツールを呼び出し、同じ session 内で会話状態を維持する assistant を構築します。

  • Live translation

    専用の realtime translation session を使用して、話されたそばから音声を翻訳し、translated audio と transcript delta をストリーミングします。

  • Transcription

    ストリーミング音声を transcript delta に変換するか、モデル生成の音声応答が不要な場合は音声ファイルを text に処理します。

  • Speech generation

    request-based speech generation model を使って、テキストから自然に聞こえる音声を生成します。

  • Audio-capable chat

    音声対応の Chat Completions app に audio を追加して、text-first のワークフローを拡張します。

Pros and Cons

Pros

  • voice agent、translation、transcription、request-based audio path のどれを選ぶべきかを開発者に分かりやすく示します。
  • 各 session type に適した endpoint や pattern を説明します。
  • ブラウザー、サーバー、モバイル、telephony の接続方法を網羅しています。
  • beta の Realtime 統合から GA interface への移行ガイダンスを含みます。
  • safety identifier と latency tuning に関する実用的な注意点を追加しています。

Cons

  • このガイドは architecture と workflow selection に限定されているため、価格や performance benchmark は提供しません。
  • 特定の connection method と model は、使用前に対応状況の確認が必要な場合があります。特に translation や transcription における SIP です。

FAQ

Realtime ガイドと request-based audio API は、どのように使い分ければよいですか?

Realtime and audio のガイダンスは、ライブセッションとリクエストベースの音声 API のどちらを選ぶかを判断するときに使用します。Realtime セッションは低遅延が必要なライブ音声に最適で、リクエストベースの音声 API は、ファイル、範囲が限定されたリクエスト、またはライブセッションを必要としない生成音声に適しています。

どのようなアプリで voice-agent セッションを使うべきですか?

アプリケーションがユーザーに応答し、ツールを呼び出し、会話の状態を管理する必要がある場合は、voice-agent セッションを使用します。ガイドでは、ブラウザー音声向けに Agents SDK と WebRTC を使う Voice agents ガイドも案内しており、サーバー側ツールに接続することもできます。

translation セッションと transcription セッションの違いは何ですか?

アプリが音声を受信したそばから継続的に翻訳する必要がある場合は translation セッションを使用し、モデル生成の音声応答なしにストリーミング音声からライブの transcript delta を必要とする場合は transcription セッションを使用します。

どの接続方法を選べばよいですか?

WebRTC は、音声を直接キャプチャまたは再生するブラウザーおよびモバイルクライアント向けです。WebSocket は、すでに生の音声を受け取っているサーバー側メディアパイプライン、通話システム、またはワーカー向けで、SIP は電話音声エージェント向けです。

Realtime セッションは safety identifier をサポートしていますか?

ガイドでは、アプリケーションが個々のエンドユーザーを識別する場合、Realtime API リクエストに対して安定したプライバシー保護された safety identifier を追加することを推奨しています。これは OpenAI-Safety-Identifier ヘッダーで送信し、同じユーザーについてはセッション間で一貫して維持する必要があります。

Quick Facts

カテゴリ
Developer Tool
製品分野
OpenAI API
主な焦点
Realtime の speech と audio ワークフロー
ソースドメイン
developers.openai.com
主な session type
Voice-agent、translation、transcription sessions
関連 transport オプション
WebRTC、WebSocket、SIP