Google 发布 Gemini 3.5 Transcribe

Google 发布 Gemini 3.5 Transcribe

8 月 26 日,Google 正式发布 Gemini 3.5 Transcribe,这是一款面向语音转文字任务的 Gemini 音频模型。Google 称其为目前精度最高的语音转写模型,可直接将原始语音转换为经过整理和格式化的文本。

Gemini 3.5 Transcribe 支持超过 85 种语言及会话中的语言切换,并提供自定义词汇、智能去除口头填充词和格式化等能力。录音转写模式还支持说话人分离与词级时间戳。模型分别提供 gemini-3.5-transcribe 和实时流式版本 gemini-3.5-transcribe-live,后者通过 Live API 提供亚秒级实时转写。

Google 公布的 FLEURS 测试结果显示,该模型在流式模式下的词错误率(WER)为 5.50%,非流式模式为 5.04%;相较此前的 Chirp 3,从语音输入到最终转写结果的延迟降低约 70%。

目前 Gemini 3.5 Transcribe 已通过 Gemini API、Google AI Studio 和 Google Antigravity 开放公开预览,并进入 Gemini Enterprise Agent Platform。面向普通用户的版本已用于 macOS 版 Gemini 应用以及部分地区 Android Gboard 的 Rambler 功能,Chrome 支持将在后续推出。

Google

0 评论

发表评论

您是本站第4548名访客 今日有45篇新文章/评论