さまざまな音声ワークフロー向けの session type
アプリが応答、ライブ翻訳、または transcript のみの出力のどれを必要とするかに応じて、voice-agent、translation、transcription の各 session type を選択できます。
Realtime and audio は、ライブ音声の翻訳、文字起こし、音声生成、音声対応チャットに最適な speech architecture を選ぶための OpenAI API ガイドです。各用途に合う session type、endpoint、接続方法を案内します。
Realtime and audio は、特定のアプリケーションに適した speech architecture を選ぶための OpenAI API ガイドです。ライブで低遅延の音声向けの Realtime session と、ファイルベース、境界が明確な、または生成された音声ワークフロー向けの request-based audio API を区別します。
このガイドでは、voice agent、ライブ翻訳、realtime transcription、speech generation、audio-capable chat model を扱います。また、session type、transport の選択、安全識別子、beta の Realtime 統合を GA interface に移行する際に必要な変更についても説明します。
アプリが応答、ライブ翻訳、または transcript のみの出力のどれを必要とするかに応じて、voice-agent、translation、transcription の各 session type を選択できます。
クライアントが音声を送信し、イベントを受け取り、session state をリアルタイムで更新している間、Realtime セッションを開いたまま維持できます。
Agents SDK と WebRTC を使ってブラウザー向け voice agent を構築し、サーバー側ツールへ接続することもできます。
標準の assistant turn lifecycle ではなく、専用の translation endpoint を使って連続的な音声翻訳を行えます。
gpt-realtime-whisper の latency control を調整して、早い partial text と transcript quality のバランスを取れます。
音声の取得元と再生先に応じて、ブラウザークライアントから電話システムまで、WebRTC、WebSocket、または SIP を選択します。
ライブ音声を聞き取り、ユーザーに応答し、ツールを呼び出し、同じ session 内で会話状態を維持する assistant を構築します。
専用の realtime translation session を使用して、話されたそばから音声を翻訳し、translated audio と transcript delta をストリーミングします。
ストリーミング音声を transcript delta に変換するか、モデル生成の音声応答が不要な場合は音声ファイルを text に処理します。
request-based speech generation model を使って、テキストから自然に聞こえる音声を生成します。
音声対応の Chat Completions app に audio を追加して、text-first のワークフローを拡張します。
Realtime and audio のガイダンスは、ライブセッションとリクエストベースの音声 API のどちらを選ぶかを判断するときに使用します。Realtime セッションは低遅延が必要なライブ音声に最適で、リクエストベースの音声 API は、ファイル、範囲が限定されたリクエスト、またはライブセッションを必要としない生成音声に適しています。
アプリケーションがユーザーに応答し、ツールを呼び出し、会話の状態を管理する必要がある場合は、voice-agent セッションを使用します。ガイドでは、ブラウザー音声向けに Agents SDK と WebRTC を使う Voice agents ガイドも案内しており、サーバー側ツールに接続することもできます。
アプリが音声を受信したそばから継続的に翻訳する必要がある場合は translation セッションを使用し、モデル生成の音声応答なしにストリーミング音声からライブの transcript delta を必要とする場合は transcription セッションを使用します。
WebRTC は、音声を直接キャプチャまたは再生するブラウザーおよびモバイルクライアント向けです。WebSocket は、すでに生の音声を受け取っているサーバー側メディアパイプライン、通話システム、またはワーカー向けで、SIP は電話音声エージェント向けです。
ガイドでは、アプリケーションが個々のエンドユーザーを識別する場合、Realtime API リクエストに対して安定したプライバシー保護された safety identifier を追加することを推奨しています。これは OpenAI-Safety-Identifier ヘッダーで送信し、同じユーザーについてはセッション間で一貫して維持する必要があります。
Lemonは、fnキーを押して話すだけで、Mac上の文章作成や各種タスクを完了へ導く音声アシスタント。無料Basicと有料Proを提供。
QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。
Speech to Text Converter は、ブラウザで使える文字起こしツールです。ライブ音声入力や音声・動画ファイルのアップロードに対応し、短い作業向けの無料プランと、無制限の文字起こし、AI要約、翻訳、話者識別、詳細な書き出し機能を備えたProプランがあります。
Pewbeamは、説教を聞き取り、聖書箇所をリアルタイムで検出して、該当箇所を画面に表示する教会向けプレゼンテーションアプリです。牧師、映写チーム、教会メディア担当に最適です。
画像、動画、音声、ライティング、チャットのツールを統合したオールインワンAIプラットフォームで、創造性とコラボレーションを高めます。
Gemma AIは、プッシュ通知の代わりに予定に合わせて電話でリマインドする通話型リマインダーアプリです。Googleカレンダー同期と会話形式の操作に対応。