智能实时转写
即使音频包含噪音、行话或自我修正,该模型也能将语音转写为精炼文本。
Gemini 3.5 Transcribe 是 Google 的语音转文字模型,用于智能转写。公告将其定位为一种更精准的方案,适用于实时语音交互,以及将录音转换为清晰、格式化文本。
该模型旨在处理常见的转写问题,例如背景噪音、行话、口吃和句中修正。它可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 使用,也为 Google 产品中的语音功能提供支持,例如 macOS 版 Gemini 应用和 Android 上的 Rambler。
即使音频包含噪音、行话或自我修正,该模型也能将语音转写为精炼文本。
Live API 支持连续双向流式传输,延迟低于一秒,适用于交互式语音应用。
Interactions API 可处理录音、会议和通话日志,并可返回说话人标注和词级时间戳。
该模型可自动检测并转写 85 种以上语言,包括地区口音和方言,并可处理实时语言切换。
可通过用户提供的自定义词汇识别专业术语和特殊拼写。
该模型可通过函数调用委派图像生成和文件分析等任务,目前可在 Gemini macOS 应用中使用。
构建需要低延迟连续语音转文字和双向流式传输的语音代理及其他交互式应用。
转写会议、通话录音和音频日志,然后使用说话人标注和时间戳回顾内容及发言者。
创建需要在音频仍在采集时就输出转写结果的实时字幕工具。
在 macOS 版 Gemini 应用或 Android 工作流中使用语音命令进行口述、编辑、总结,或将语音整理为精炼文本。
处理录音音频,用于需要准确格式化文本的后通话分析流程和下游分析。
开发者可以通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 访问 Gemini 3.5 Transcribe。公告还说明它已向开发者开放公测。
页面描述了两条 API 路径:用于实时流式传输、具备亚秒级延迟的 Live API,以及用于预录音频并支持说话人标注和词级时间戳的 Interactions API。
它旨在处理背景噪音、复杂行话、流畅性修正、用户自定义词汇,以及 85 种以上语言,包括地区口音和方言。
公告称,该模型已向所有人开放,可在 macOS 版 Gemini 应用中以英语使用,也可在部分国家和语言的 Android 版 Rambler 中使用,并且即将登陆 Chrome。
来源没有提供公开定价信息。它只说明该模型在开发者和企业访问入口中处于公测阶段。
SpeakoFlow 是一款适用于 Windows、macOS 和 Linux 的免费开源桌面语音转文字应用,支持在任意应用中口述输入、Flow 语音写作、文本清理、翻译和屏幕感知助手。
QuickQuill 是一款适用于 macOS 的本地语音输入与转写应用,可在设备上录制会议、转写音频、生成摘要并导出笔记,无需使用云服务。
Zen Whisper 是一款适用于运行 macOS 14 或更高版本的 Apple Silicon Mac 的本地优先听写与转写应用。可在大多数 Mac 文本框直接语音输入,并转写媒体或受支持的公开链接,支持 110 种口语选项。
Speech to Text Converter 是一款基于浏览器的语音转文字工具,支持实时听写和上传音频、视频文件转录。提供免费版满足短任务,Pro 版支持无限转录、AI 摘要、翻译、说话人识别和高级导出。
Sanota 将口述回忆、反思和访谈转写为清晰书面故事,支持个人叙事、家族史与共享记忆,提供引导提示和订阅方案。
Carbon Voice 是一款适用于团队和个人的异步语音消息应用,支持转录、AI 快速补课和跨设备访问,让你无需实时通话也能顺畅沟通。