说话人分离
Voxtral Mini Transcribe V2 可生成带说话人标注的转写内容,并提供精确的开始和结束时间,适合需要知道谁在何时说了什么的场景。
Voxtral Transcribe 2 是 Mistral AI 的语音转文字产品,作为两款下一代转写模型推出:用于批量转写的 Voxtral Mini Transcribe V2,以及用于实时应用的 Voxtral Realtime。此次发布重点在于转写质量、说话人分离、低延迟和语言覆盖,而非更广泛的对话或智能体平台。
产品页说明 Voxtral Mini Transcribe V2 提供业界领先的转写能力,支持说话人分离、上下文偏置和逐词时间戳,并覆盖 13 种语言;Voxtral Realtime 则为流式音频设计,延迟可配置至 200 毫秒以下。Mistral 还表示 Realtime 模型以 Apache 2.0 许可的开源权重形式提供,并且 Mistral Studio 中的音频 playground 可让用户在对接 API 之前先测试带说话人分离和时间戳的转写。
来源将 Voxtral 定位于会议转写、语音智能体、呼叫中心自动化、媒体字幕制作和合规文档等工作流。文章中的定价信息显示,两种模型都可通过 API 使用,其中 Mini Transcribe V2 为每分钟 $0.003,Realtime 为每分钟 $0.006,此外 Realtime 还在 Hugging Face 上发布了开源权重。
Voxtral Mini Transcribe V2 可生成带说话人标注的转写内容,并提供精确的开始和结束时间,适合需要知道谁在何时说了什么的场景。
你可以提供最多 100 个词或短语来引导模型更倾向于识别姓名、技术术语和其他标准转写系统可能遗漏的词汇。
该模型可返回逐词时间戳,支持字幕制作、可搜索归档以及与时间轴对齐的内容工作流。
两种模型都支持 13 种语言:英语、中文、印地语、西班牙语、阿拉伯语、法语、葡萄牙语、俄语、德语、日语、韩语、意大利语和荷兰语。
Voxtral Realtime 面向实时音频构建,并支持可配置至 200 毫秒以下的延迟;而 Mini Transcribe V2 则定位于批量转写。
产品说明强调在 Mistral Studio 中提供音频 playground,可立即测试说话人分离、时间戳和音频文件上传。
对重复举行的会议进行转写,附带说话人标注和时间戳,方便团队在通话后回顾决策、任务分配和讨论脉络。
为需要足够低转写延迟、以保持语音交互响应性的对话式智能体和助手体验提供支持。
实时处理客户支持或销售通话,利用说话人分离区分坐席和客户发言,便于后续分析或录入 CRM。
为多语言媒体生成实时或近实时字幕,低延迟和逐词时间信息有助于将语音与屏幕字幕对齐。
使用说话人分离和时间戳记录受监管或敏感的对话,以便形成更清晰的审计轨迹,支持审查和文档记录。
Voxtral Transcribe 2 是一个语音转文字产品系列,提供两种模型选项:用于批量转写的 Voxtral Mini Transcribe V2,以及用于实时应用的 Voxtral Realtime。文章还提到可直接在 Mistral Studio 中的音频 playground 里测试转写。
来源将 Voxtral Mini Transcribe V2 描述为批量转写模型,而将 Voxtral Realtime 描述为面向实时应用、强调低延迟的流式模型。除了这些产品名称和 Mistral Studio playground 之外,文章并未提供完整的 API 或 SDK 工作流程。
根据来源,Mistral Studio 的音频 playground 支持上传最多 10 个音频文件、切换说话人分离、选择时间戳粒度,以及添加上下文偏置词。它接受 .mp3、.wav、.m4a、.flac 和 .ogg 文件,每个文件最大 1GB。
文章说明 Voxtral Mini Transcribe V2 可通过 API 使用,价格为每分钟 $0.003;Voxtral Realtime 可通过 API 使用,价格为每分钟 $0.006,同时也以 Hugging Face 上的开源权重形式提供。定价页面还确认 Mistral 提供 API 使用和 Studio 仪表盘,但未补充 Voxtral 的具体打包细节。
来源称 Voxtral Realtime 采用 Apache 2.0 许可下的开源权重,并可部署到边缘设备。还提到两个模型都支持安全的本地部署或私有云部署,适用于符合 GDPR 和 HIPAA 的场景,但文章没有提供具体实施步骤。
QuickQuill 是一款适用于 macOS 的本地语音输入与转写应用,可在设备上录制会议、转写音频、生成摘要并导出笔记,无需使用云服务。
Speech to Text Converter 是一款基于浏览器的语音转文字工具,支持实时听写和上传音频、视频文件转录。提供免费版满足短任务,Pro 版支持无限转录、AI 摘要、翻译、说话人识别和高级导出。
Dictato 是一款适用于 Mac 的语音听写应用,可在任何 App 中将语音转写为文字,支持本地离线处理、多种转写引擎、可选润色与翻译,并提供一次性买断授权。
Sanota 将口述回忆、反思和访谈转写为清晰书面故事,支持个人叙事、家族史与共享记忆,提供引导提示和订阅方案。
Carbon Voice 是一款适用于团队和个人的异步语音消息应用,支持转录、AI 快速补课和跨设备访问,让你无需实时通话也能顺畅沟通。
OpenAI API 指南,帮助开发者为实时音频、翻译、转录、语音生成和支持音频的聊天选择合适的语音架构,并匹配对应会话类型、端点与连接方式。