NVIDIA发布NemotronLabs VoiceChat 11B:实时全双工语音模型
近日,英伟达发布了名为NemotronLabs VoiceChat 11B的开源全双工语音到语音模型。该模型在单一网络中实现了流式语音理解和生成,消除了传统级联架构中的多模态协调和API调用延迟,实测平滑换言过程时间为448毫秒。此外,它支持工具呼叫功能,在对话持续进行时通过独立输出通道执行脚本,并使用操作员定义的“等待”行填补API运行期间的空白时间。该模型适用于实时语音代理、内部API上的语音前端和实时查询助手等应用,但目前仅限于研究用途,需要至少80GB VRAM的GPU支持。此外,尽管模型已经开源且可以用于初步测试,但由于存在一些实际限制如两分钟音频上下文上限以及多次对话后可能出现的非恢复性乱码等问题,英伟达团队明确表示该模型仅供科研使用。
