业内高管认为语音AI尚未迎来属于自己的“ChatGPT时刻”
“语音将成为下一代主流交互界面”的观点近来声势渐长,投资者已向语音AI初创公司投入数十亿美元,覆盖模型开发、企业客服、会议记录和AI听写等多个领域。几乎每周都有新模型或新工具发布,声称听起来像真人、能像真人一样对话,但实际情况未必如此。企业语音AI平台PolyAI首席技术官Shawn Wen认为,尽管能够边听边说的全双工模型已经问世,语音AI仍未迎来自己的“ChatGPT时刻”。他上月在HumanX大会的台上表示,开发出全双工模型已是一个里程碑,下一个挑战是让推理变得非常快,使模型能迅速给出答案,让对话显得自然。他还认为,客服领域的AI智能体不应听起来像机器人,而应让来电者有足够信心相信它能解决问题;当语音足够好、客户愿意与其进行最初两三轮交流时,信任便开始建立,久而久之,客户会觉得如果智能体能解决问题,也许就不必找真人。会议记录工具Otter的首席营销官Alex Gay则认为,识别说话人、捕捉意图并结合组织知识整理成文字,是实现自动化的关键一步。该公司还在开发可代表用户参加会议的数字分身,他表示这项技术最重要的是输出的语音要具备与真人开会时相同的情感表达;最好的会议往往包含辩论和战略讨论,并以彼此之间的关系为基础,如果与虚拟形象无法做到这一点,它就只是一个问答聊天机器人。文章还指出,虽然语音AI模型有所进步,但AI助手常常无法理解用户,会议记录工具也可能给出错误的转写或摘要。Wen认为,自动语音识别模型经常漏掉重要关键词,这会导致难以把握完整的上下文。
