喝点VC|BVP语音AI最新研究:语音到语音模型突破使语音转文本模型成为历史,语音AI迎来新一波创业机遇
Z Highlights
语音AI近期的发展不仅仅是软件用户界面的升级,它还正在改变企业与客户之间的连接方式。 近期,语音到语音(STS)模型有了突破性进展,这些模型专为处理基于语音的任务而设计,不需要将音频转录为文本。这些模型解决了传统级联架构的关键局限性,特别是在延迟和对话动态方面。 质量对于语音应用至关重要。构建高质量的产品需结合正确的模型、集成、对话流和错误处理,创造一个能够高效解决用户问题的agent。
语音AI革命:重塑客户旅程,引领企业未来
语音技术的演进:从IVR到STS模型
语音AI的挑战与创新:重塑企业服务与客户体验
优化延迟和可靠性:维护可扩展且高效的实时语音agent基础设施是一项重大负担,通常需要整个工程团队来管理。 管理对话线索、背景噪音和非文本信息:许多STT模型难以判断用户何时结束发言,因此开发者通常需要自己构建“结束点”检测来解决这个问题。此外,开发者还需要增强现有模型提供的背景噪声过滤以及情感和情绪检测功能。这些看似微小的功能对于提升通话质量至关重要,并且能够弥合演示和生产环境中客户更高期望之间的差距。 高效的错误处理和重试机制:语音模型API偶尔会失败,导致对话中断。构建可靠应用的关键在于能够快速识别失败的API调用,通过插入填充词争取时间,并将API调用重试到另一个模型,这一过程需要非常迅速地完成。 与第三方系统的集成和对检索增强生成(RAG)的支持:大多数商业用例需要访问知识库并与第三方系统集成,以提供更智能的响应并代表用户采取行动。在低延迟的情况下以自然的方式融入对话系统,这并非易事。 对话流控制:对话流控制允许开发者指定对话的确定性流程,给予他们比仅提供提示来引导对话时更多的控制权。这些流控制系统在敏感或受监管的对话中尤为重要,比如医疗呼叫,在这种情况下,语音agent必须确认正确的患者身份后才能继续进行下一步。 可观察性、分析和测试:语音agent的可观察性和测试在许多方面仍处于初级阶段,开发者正在寻找更好的方法来评估其在开发和生产中的表现,理想情况下,还能进行A/B测试。此外,跟踪这些agent在生产环境中规模化的对话质量和性能仍然是一个重大挑战。
完全“为客户完成工作”,处理从头到尾的完整功能并提供有价值的成果的应用; 利用AI的按需扩展能力的应用——例如,在高峰时段同时处理成千上万的电话; 构建高度专业化、垂直聚焦的解决方案,深度集成相关的第三方系统的应用。这些能力使得语音应用能够获得高客户年收入(ACV),特别是在用于创造收入的场景中。
语音AI的创业蓝图:从原型到市场主导
客户流失率:客户流失率将是产品质量的明显指标,尽管它是滞后的数据。我们发现许多语音应用在早期阶段面临较高的客户流失率,特别是在客户将重要工作流程从人工转移到语音agent时,若agent未能提供可靠和一致的用户体验,最终导致客户不满意。 自助解决率:自助解决率越高,语音agent在无需人工干预的情况下完全解决最终用户问题的效果越好。 客户满意度评分:该指标反映了与语音agent互动的客户的整体满意度,提供有关体验质量的洞察。 通话终止率:高通话终止率表明用户体验不满意,问题未得到解决,意味着语音agent可能未能按预期执行。 用户群体通话量扩展:该指标衡量客户是否随着时间的推移增加了对语音agent的使用量,是衡量产品价值和最终用户参与度的关键指标。