语音作为下一代核心交互界面的叙事正获得强劲的市场支撑,风险资本已向语音人工智能初创企业注资数十亿美元。

尽管每周都有新型号或工具宣称具备拟人化的声音与对话能力,但业界高管认为,这并不完全符合现实。PolyAI 首席技术官 Shawn Wen 指出,即便全双工模型(Full-Duplex Models)已发布,行业仍面临挑战。
“我们已经达到了开发全双工模型的里程碑,”Wen 表示,“下一个挑战是实现极快的推理速度,让模型能够迅速找到答案。”
他进一步强调,在客户服务场景中,人工智能代理人不应听起来像机器人。
“我认为下一阶段会有所不同。一旦声音质量足够好,客户在前几轮互动中愿意与其接触,他们就会开始建立信心。随着时间推移,他们会觉得如果代理能解决我的问题,我可能不需要再与人类交谈,”他说。
Otter.ai 首席营销官 Alex Gay 认为,识别发言者、捕获发言意图并将其与组织知识相结合,是实现自动化的关键步骤。该公司正在研发代表会议参与者的“数字双胞胎”。Gay 表示,对于这项技术而言,输出语音的情感表达至关重要,需达到在会议中与人类交谈的自然程度。
“如果你想想现在参加的会议,最好的对话是那些可以进行辩论和战略讨论的时刻。如果你不能用化身实现这一点,那么它只是一个问答聊天机器人,”Gay 指出。
语音人工智能的理解力与透明度
虽然语音人工智能模型不断改进,但人工智能助理往往难以准确理解用户意图。
Wen 认为,自动语音识别(ASR)模型经常遗漏重要的关键词。
他补充说,公司仍在努力改进转录功能,并指出语言处理是需要改进语音模型的一个领域。
对于 Otter.ai 而言,转录本身并非终点,而是推动生产力增长的基础层。“但如果你的原始转录没有所需的准确性,所有后续行动都是有缺陷的。当你基于错误的信息采取行动时,没有人会告诉你这是错的,你只会失去对平台的信任。因此,继续改进 ASR 模型至关重要,因为下游影响巨大,”他说。
新的语音工具还引发了透明度问题。工具应向客户明确声明他们正在被录制或与人工智能进行交互。即使在机器人不在场的会议中,也应尝试通知聊天中的每个人会议正在录制。目前,人们已在企业电话中与人工智能进行交谈。





