适用于不同语音工作流的会话类型
根据应用是否需要响应、实时翻译或仅输出转录,选择语音代理、翻译或转录会话类型。
Realtime and audio 是一份 OpenAI API 指南,用于为特定应用选择合适的语音架构。它区分了用于实时、低延迟音频的 Realtime 会话,以及用于基于文件、有边界或生成式语音工作流的基于请求音频 API。
该指南涵盖语音代理、实时翻译、实时转录、语音生成以及支持音频的聊天模型。它还解释了会话类型、传输方式、安全标识符,以及将 beta 版 Realtime 集成迁移到 GA 接口时需要进行的更改。
根据应用是否需要响应、实时翻译或仅输出转录,选择语音代理、翻译或转录会话类型。
在客户端发送音频、接收事件并实时更新会话状态时,保持 Realtime 会话持续打开。
使用 Agents SDK 和 WebRTC 构建浏览器语音代理,并可选择连接到服务器端工具。
使用专门的翻译端点进行持续语音翻译,而不是标准的助手轮次生命周期。
通过 gpt-realtime-whisper 延迟控制调节实时转录,在更早的部分文本和转录质量之间进行权衡。
根据音频的采集和播放位置选择 WebRTC、WebSocket 或 SIP,从浏览器客户端到电话系统都适用。
构建一个助手,它能聆听实时音频、回应用户、调用工具,并在同一会话中维护对话状态。
使用专门的实时翻译会话,在语音说出时进行翻译,并流式输出翻译后的音频和转录增量。
将流式音频转为转录增量,或者在不需要模型生成口语回复时把音频文件处理为文本。
使用基于请求的语音生成模型,将文本生成自然听感的口语音频。
当你想扩展以文本为主的工作流时,使用支持音频的聊天模型为现有的 Chat Completions 应用添加音频。
当你在实时会话和基于请求的音频 API 之间进行选择时,使用 Realtime and audio 指南。对于需要低延迟的实时音频,Realtime 会话最合适;对于文件、有限请求或不需要实时会话的生成语音,基于请求的音频 API 更合适。
当应用需要响应用户、调用工具并管理对话状态时,使用语音代理会话。该指南还会将浏览器语音代理指向 Voice agents 指南,该指南使用 Agents SDK 和 WebRTC 处理浏览器音频,并且可以连接到服务器端工具。
当应用应在语音到达时持续翻译它时,使用翻译会话;当应用需要从流式音频中获取实时转录增量,但不需要模型生成的口语回复时,使用转录会话。
WebRTC 适用于直接采集或播放音频的浏览器和移动客户端。WebSocket 适用于已经接收原始音频的服务器端媒体管道、呼叫系统或工作进程,而 SIP 适用于电话语音代理。
当应用会识别单个最终用户时,指南建议为 Realtime API 请求添加一个稳定、保护隐私的安全标识符。它应通过 OpenAI-Safety-Identifier 请求头发送,并且在同一用户的不同会话中保持稳定。
SpeakoFlow 是一款适用于 Windows、macOS 和 Linux 的免费开源桌面语音转文字应用,支持在任意应用中口述输入、Flow 语音写作、文本清理、翻译和屏幕感知助手。
Lemon 是一款 Mac 语音助手,按下 fn 即可将口述指令转为成稿或任务完成。提供免费 Basic 方案与付费 Pro 方案,支持在同一标签页内完成工作。
QuickQuill 是一款适用于 macOS 的本地语音输入与转写应用,可在设备上录制会议、转写音频、生成摘要并导出笔记,无需使用云服务。
Zen Whisper 是一款适用于运行 macOS 14 或更高版本的 Apple Silicon Mac 的本地优先听写与转写应用。可在大多数 Mac 文本框直接语音输入,并转写媒体或受支持的公开链接,支持 110 种口语选项。
Flunkey 是适用于 Windows 的语音优先效率工具层,可将语音转为文本、AI 辅助输出和可记忆上下文,帮助你在当前应用中捕捉想法与待办。
一个集成图像、视频、语音、写作和聊天工具的全能AI平台,以增强创造力和协作。