跨 18 种语言的原生代码切换
发布文章称该模型可在 18 种语言中原生处理代码切换,因此转写结果可以跟随实际说出的语言,而无需单独进行语言识别流程。
Universal-3.5 Pro 是 AssemblyAI 的旗舰异步语音转文字模型,适用于录音和视频。它是 Pre-recorded Speech-to-Text API 的一部分,并定位为支持语言及复杂真实场景音频中准确率最高的模型。
发布文章强调了三项主要能力:跨 18 种语言的原生代码切换、改进的说话人分离以及上下文提示。定价页面显示基础费率为每提交 1 小时音频 $0.21,另外针对说话人分离、医疗模式、keyterms prompting 和 general prompting 等能力提供可选附加功能。
在实际应用中,该模型面向语音较混乱、多语言或说话人较多的转写任务。这包括会议、呼叫中心录音、字幕、可搜索档案以及其他已录制工作流,在这些场景中,准确率和说话人归属比实时延迟更重要。
发布文章称该模型可在 18 种语言中原生处理代码切换,因此转写结果可以跟随实际说出的语言,而无需单独进行语言识别流程。
AssemblyAI 将这一版本描述为其迄今最准确的说话人分离模型,旨在即使在多人插话和嘈杂对话中也保持说话人归属与转写内容一致。
上下文提示允许你提供领域知识或前置信息来影响转写输出,从而提升专业术语或歧义音频的准确率。
定价说明列出了 Universal-3.5 Pro 的 keyterms prompting,最多支持 1,000 个术语,便于团队将识别结果偏向项目专属词汇。
Universal-3.5 Pro 是 AssemblyAI 语音转文字产品线中的异步预录音模型,价格为每提交 1 小时音频 $0.21。
定价页面显示该模型提供可选附加功能,包括医疗模式和说话人分离,可与基础转写费率组合使用。
当录音中同一段对话包含多种语言,并且你希望转写结果保留每个时点实际说出的语言时,使用 Universal-3.5 Pro。
用于会议纪要或内部讨论,其中简短轮次、插话和重叠语音会让说话人归属变得困难。
用于呼叫中心通话或其他客户互动场景,因为准确的说话人标注会影响后续分析和质检。
在转写包含项目名称、领域术语或其他可能被误识别词汇的专业讨论时,使用上下文提示或 keyterms prompting。
当音频已经录制完成,并且你可以用延迟换取转写质量时,使用异步 API 处理档案、字幕或数据集准备。
Universal-3.5 Pro 是 AssemblyAI 的异步预录音语音转文字模型。它适用于录音和视频,而不是实时流式转写。
发布文章称它支持跨 18 种语言的原生代码切换。产品页面将其标识为受支持语言中准确率最高的预录音模型。
发布文章强调了上下文提示,而定价说明显示 general prompting 作为 Universal-3.5 Pro 的付费异步附加功能可用。
定价页面将 Universal-3.5 Pro 的异步说话人分离列为付费附加功能,并提供标准版和实验版。发布文章则将说话人分离列为该模型的核心改进之一。
定价页面显示,Universal-3.5 Pro 的预录音音频提交价格为每小时 $0.21。说话人分离、医疗模式、keyterms prompting 和 general prompting 等附加功能需单独计费。
QuickQuill 是一款适用于 macOS 的本地语音输入与转写应用,可在设备上录制会议、转写音频、生成摘要并导出笔记,无需使用云服务。
Speech to Text Converter 是一款基于浏览器的语音转文字工具,支持实时听写和上传音频、视频文件转录。提供免费版满足短任务,Pro 版支持无限转录、AI 摘要、翻译、说话人识别和高级导出。
OpenAI API 指南,帮助开发者为实时音频、翻译、转录、语音生成和支持音频的聊天选择合适的语音架构,并匹配对应会话类型、端点与连接方式。
Pewbeam 是一款教会演示应用,可在讲道中实时聆听并识别圣经经文引用,自动在屏幕上显示对应经文,帮助牧师、投影团队和教会媒体志愿者减少现场手动切换幻灯片。
Dictato 是一款适用于 Mac 的语音听写应用,可在任何 App 中将语音转写为文字,支持本地离线处理、多种转写引擎、可选润色与翻译,并提供一次性买断授权。
Voicenotes 是一款 AI 记事与会议录音应用,可将对话转写为文字,生成摘要和待办事项,并通过 Ask AI 检索历史录音;还支持语音听写、Pro 版导入音频及多语言转写。