谷歌发布Gemini 3.5 Transcribe语音转文字模型
近日,谷歌发布了名为Gemini 3.5 Transcribe的新型语音转文字模型。该模型分为两个端点:gemini-3.5-transcribe和gemini-3.5-transcribe-live,分别处理预录制文件和双向流媒体。在85种以上语言中,非实时模式下的平均词错误率为2.6%,而实时模式下为4.0%。Gemini 3.5 Transcribe的时间转录速度比前代产品Chirp 3快70%。自动检测支持超过85种语言,并能处理句子中的代码切换。两个端点不共享相同的功能集、限制或价格,因此需要根据具体需求进行规划。该模型适用于客服中心和客户体验平台、临床文档记录、媒体字幕和本地化、法律和保险业务录入、会议工具以及语音驱动的开发工具等场景。
