さまざまな音声ワークフロー向けの session type
アプリが応答、ライブ翻訳、または transcript のみの出力のどれを必要とするかに応じて、voice-agent、translation、transcription の各 session type を選択できます。
Realtime and audio は、ライブ音声の翻訳、文字起こし、音声生成、音声対応チャットに最適な speech architecture を選ぶための OpenAI API ガイドです。各用途に合う session type、endpoint、接続方法を案内します。
Realtime and audio は、特定のアプリケーションに適した speech architecture を選ぶための OpenAI API ガイドです。ライブで低遅延の音声向けの Realtime session と、ファイルベース、境界が明確な、または生成された音声ワークフロー向けの request-based audio API を区別します。
このガイドでは、voice agent、ライブ翻訳、realtime transcription、speech generation、audio-capable chat model を扱います。また、session type、transport の選択、安全識別子、beta の Realtime 統合を GA interface に移行する際に必要な変更についても説明します。
アプリが応答、ライブ翻訳、または transcript のみの出力のどれを必要とするかに応じて、voice-agent、translation、transcription の各 session type を選択できます。
クライアントが音声を送信し、イベントを受け取り、session state をリアルタイムで更新している間、Realtime セッションを開いたまま維持できます。
Agents SDK と WebRTC を使ってブラウザー向け voice agent を構築し、サーバー側ツールへ接続することもできます。
標準の assistant turn lifecycle ではなく、専用の translation endpoint を使って連続的な音声翻訳を行えます。
gpt-realtime-whisper の latency control を調整して、早い partial text と transcript quality のバランスを取れます。
音声の取得元と再生先に応じて、ブラウザークライアントから電話システムまで、WebRTC、WebSocket、または SIP を選択します。
ライブ音声を聞き取り、ユーザーに応答し、ツールを呼び出し、同じ session 内で会話状態を維持する assistant を構築します。
専用の realtime translation session を使用して、話されたそばから音声を翻訳し、translated audio と transcript delta をストリーミングします。
ストリーミング音声を transcript delta に変換するか、モデル生成の音声応答が不要な場合は音声ファイルを text に処理します。
request-based speech generation model を使って、テキストから自然に聞こえる音声を生成します。
音声対応の Chat Completions app に audio を追加して、text-first のワークフローを拡張します。
Realtime and audio のガイダンスは、ライブセッションとリクエストベースの音声 API のどちらを選ぶかを判断するときに使用します。Realtime セッションは低遅延が必要なライブ音声に最適で、リクエストベースの音声 API は、ファイル、範囲が限定されたリクエスト、またはライブセッションを必要としない生成音声に適しています。
アプリケーションがユーザーに応答し、ツールを呼び出し、会話の状態を管理する必要がある場合は、voice-agent セッションを使用します。ガイドでは、ブラウザー音声向けに Agents SDK と WebRTC を使う Voice agents ガイドも案内しており、サーバー側ツールに接続することもできます。
アプリが音声を受信したそばから継続的に翻訳する必要がある場合は translation セッションを使用し、モデル生成の音声応答なしにストリーミング音声からライブの transcript delta を必要とする場合は transcription セッションを使用します。
WebRTC は、音声を直接キャプチャまたは再生するブラウザーおよびモバイルクライアント向けです。WebSocket は、すでに生の音声を受け取っているサーバー側メディアパイプライン、通話システム、またはワーカー向けで、SIP は電話音声エージェント向けです。
ガイドでは、アプリケーションが個々のエンドユーザーを識別する場合、Realtime API リクエストに対して安定したプライバシー保護された safety identifier を追加することを推奨しています。これは OpenAI-Safety-Identifier ヘッダーで送信し、同じユーザーについてはセッション間で一貫して維持する必要があります。
SpeakoFlowは、Windows、macOS、Linux対応の無料・オープンソースのデスクトップ音声入力アプリ。あらゆるアプリに дикationでき、Flow、要約整理、翻訳、画面認識アシスタントにも対応。
Lemonは、fnキーを押して話すだけで、Mac上の文章作成や各種タスクを完了へ導く音声アシスタント。無料Basicと有料Proを提供。
QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。
Zen Whisperは、Apple Silicon搭載MacのmacOS 14以降向けローカルファーストの音声入力・文字起こしアプリ。ほとんどのMacテキスト欄へ入力でき、メディアや対応公開リンクも文字起こし可能。110言語に対応。
FlunkeyはWindows向けの音声入力中心の生産性レイヤー。話した内容をテキスト化し、AI支援の出力や記憶した文脈に変換。作業中のアプリを離れずに使えます。
画像、動画、音声、ライティング、チャットのツールを統合したオールインワンAIプラットフォームで、創造性とコラボレーションを高めます。