Transcript
00:00:00好的,大家好。我叫 Midam Kim,是 ServiceNow 的一名机器学习工程师。
00:00:25今天我要分享的主题是语音 AI 的语言学框架。先简单介绍一下我的背景,以便大家了解我的专业视角。
00:00:37正如我刚才提到的,我是 ServiceNow 的机器学习工程师,但同时
00:00:42我也一直坚持研究真实场景下的言语交流。所以我的
00:00:48座右铭是践行语言学。而我今天要做的是
00:00:54带大家学会用语言学的视角来看问题。请问大家遇到过语音 AI 出现故障的情况吗?相信大家
00:01:05都遇到过。下面我来分享一个我亲身经历的例子。
00:01:15机器客服问我:“能请您拼写一下您的名字(First Name)吗?”然后我就开始放慢速度拼写
00:01:22我的名字:“好的,是 M-I-D-A-M。”结果机器人说:“跟您确认一下,是 M-I-D-A-N 吗?”我接着说:“不,是 M-I-D-A-M。”
00:01:40然后我感到越来越不爽,因为我的名字明明是 M-I-D-A-M,而不是 M-I-D-A-N。接着它又问我:“现在请问您的账号是多少?”这时我有点懵了,账号又是什么?于是我试图寻找相关的信息。
00:02:09到底选哪个?肯定就是这个了,接着我开始缓慢报出账号:“是 A-X-4-5-1。”因为我不习惯朗读这种生疏的号码,所以花了一点时间,结果机器人直接打断了我。它说:“未能找到您的记录。”并且
00:02:14它甚至都没再尝试理解,就要求我重新报一遍:“能请您重复一遍吗?”这让我非常火大。“未能找到您的记录。”接着它说:“未能找到您的记录。”然后没有任何尝试就让我重重复一遍:“能请您重复一遍吗?”这真的让我感到无比抓狂。
00:02:21A、X、4、5、1,然后我稍微停顿了一下,因为我不习惯报这种
00:02:30奇怪的号码,结果机器人直接打断了我,并说“没有找到您的
00:02:36记录”,然后它甚至都没有尝试重新识别,就让我再重复一遍,“能请您
00:02:42再重复一遍吗?”这时我变得超级烦躁,然后我可能会说:“能让
00:02:46人工客服接听吗?我真的不想再跟你废话了。”这就是目前语音 AI 极其
00:02:51典型的一种故障模式。因此我
00:02:57想探讨一下如何运用语言学来解决这个问题。虽然语音 AI 正蓬勃发展,
00:03:06但用户往往依然更倾向于人工客服,而不是语音
00:03:11助手。我们该如何改善这个问题呢?首先,最核心的
00:03:19问题到底出在哪里?我认为我们需要建立一个基础框架来
00:03:25理解语音 AI 的端到端架构,这个框架就是语言学。众所周知,
00:03:35人类的沟通是一项共同参与的协同活动,正如
00:03:41我们现在正在做的一样:我向你们传递声音和文字,你们倾听;
00:03:48如果是双向对话,你们也会回应你们的声音和
00:03:53文字,这样就在相互交互中形成了来回的互动。在这个
00:04:02过程中,我们一直在持续处理并更新彼此的心智模型。这就是
00:04:09人类沟通作为一项协同活动的本质。我想强调的是,在语音 AI 的
00:04:18人机沟通中,它也必须是这样一种协同活动。因为这是
00:04:25人类对于沟通唯一的既有认知。作为人类,我们
00:04:30经过了数千年的演化成为交流者,而这就是我们的沟通模式,
00:04:35因此我们对机器人也有着同样的预期。接下来,让我们在这个框架下重温一下我和语音助手通话的失败场景。
00:04:45大家可以看到,对话双方都包含“倾听”和“表达”两个环节。
00:04:53当我开始拼写名字时,机器人没能准确听出
00:05:04M 和 N 的区别。这是倾听层面上语音识别(STT)的失败。接着,TTS 语音合成只使用了
00:05:14以英语为中心的发音规则来读我的名字。在美式英语中,M-I-D-A-M 会被念成类似“Midam”,
00:05:22这让我很困惑。但当时我还是挺包容的,因为这种情况很常见,
00:05:29即便是在人与人的沟通中也会发生,所以我没太介意。然而,当它提到
00:05:36账号时,因为我不知道那是什么,我又感到了困惑。但我适应能力强,可以去
00:05:44找找看。当我找到号码并开始念出来时,STT 没能准确识别词汇
00:05:52单元,直接打断了我,甚至最后抢了我的话,这真的让我非常恼火。
00:06:06随后它让我重复同样的信息,此时很明显
00:06:14这个机器人根本没有和我保持同步的心智模型。非常无礼的是,它甚至都没有尝试
00:06:22进行交互式的澄清——而这本是人类沟通中很常用的策略。所以我不想再理它了,
00:06:28直接说“能换人工接听吗?”让我们重新看一下这个框架。以下是
00:06:38人类日常交流中所预期的、且维持得很好的语言学要素。
00:06:47这里分为倾听通道和表达通道,包含不同的维度,
00:06:52如声音、词汇、交互和心智模型。第一个要素是:机器人能否很好地识别用户的
00:06:59语音?所有的相关技术术语都归于此类。接着是
00:07:09第二个要素,即倾听通道中的词汇层面:机器人能否理解用户所说的词汇?
00:07:17第三个要素是:机器人能否等到合适的时机再切入发言?这涉及倾听通道中的交互策略。
00:07:28最后一部分是心智模型:机器人能否在倾听过程中准确理解用户的意图?
00:07:38接下来看表达通道。声音层面涉及的是发音问题;
00:07:43词汇层面则是:机器人能否理解用户使用的词汇?机器人是否选择了用户能够听懂的词汇?
00:07:53在交互部分,机器人说话的时机是否恰当?最后,机器人表达出的
00:08:01信息是否真正满足用户的需求?
00:08:05这里涉及到许多工程学、语言学或认知科学领域的专业术语。
00:08:13大家可以看到,所有这些术语在这个语言学框架中都有其对应的位置。
00:08:23更重要的是,这些要素之间是互相依存的,并非孤立或彼此独立。
00:08:30它们紧密相连、协同配合。因此,当你想在声音层面做好时,
00:08:36你必须兼顾词汇层面;而当你想在声音和词汇层面都做到位时,
00:08:43还必须考虑到交互,比如话语权的轮替和发言时机的检测。
00:08:50最终,如果你想高效完成任务(这也是心智模型层的终极目标),就必须打通所有这些环节。
00:09:02缺乏其中任何一个要素,你的语音助手都将面临失败。
00:09:09最后,所有这些层面都必须保持高度的一致与协同。
00:09:17此外,大家必须牢记,整个沟通过程是在时间线上动态推进的。
00:09:26我的意思是,它是被无形追踪的。不像文字聊天,你可以实时看到历史对话
00:09:34文本;但在语音交互体验中,你说一句,机器人回应一句,来来回回,
00:09:45那些声波——空气中的物理振动——转瞬即逝。
00:09:53最终唯一沉淀下来的,只有用户心中的心智模型,而这才是关键所在。
00:10:00声音、词汇和交互在说出口的瞬间就消逝了,
00:10:04但心智模型却会在时间线上不断延续和演进。
00:10:09因此,这就是大家提升
00:10:12用户满意度时需要精准发力的目标。
00:10:16那么,我们能做什么
00:10:19来让机器人达到用户的预期标准呢?
00:10:25我们能做的举措当然包括选择优秀的 ASR(语音识别)模型或参数配置,并做好后处理;
00:10:34挑选出色的 TTS(语音合成)模型及配置,做好前处理;
00:10:38精心构建机器人与用户之间通用的词汇库;
00:10:46在轮替检测、响应时延和话语权控制上做好优化;
00:10:52此外非常关键的一点是,如果能做好情绪感知和应对,那就太棒了;
00:10:59还有上下文的保持,这里所说的上下文,指的是上述所有层面的综合上下文。
00:11:07更重要的是,这一切必须是动态的,因为在整个通话过程中,情况时刻都在发生变化。
00:11:16因此我们需要沿着时间线,对这些要素进行动态管理,
00:11:21以应对不同类型的用户。
00:11:24比如儿童或其他不同人群都有着不同的期望,我们需要去满足它们——
00:11:32不仅要在他们开心时做到,更要在他们不满意时妥善处理。
00:11:36唯有如此,才能实现动态且具备真正可扩展性的语音 AI 编排。
00:11:42所以,这是一项非常艰巨的工作。
00:11:48我们总说语音是最自然的沟通方式,但实际上这绝非易事。
00:11:54看似顺畅的背后,全赖于这种语言学层面的精密编排。
00:11:59如果你的机器人在这方面做得不好,后果将是灾难性的。
00:12:07因此,重视这个语言学框架能带来巨大的商业价值,因为它能帮助你
00:12:17全面减少用户受挫、任务失败、转接人工客服、中途挂断以及隐性失败等问题。
00:12:28在 ServiceNow,我们打造了一个优秀的端到端基准测试工具,叫做 eva bench,大家可以用它来诊断自家的语音助手状态。
00:12:43核心要点总结:
00:12:45首先,语音 AI 是机器人与用户之间
00:12:49的一项协同活动,而不仅仅是一条单向处理流水线;
00:12:54其次,我们必须在多个层面上实时满足用户的需求。
00:12:59今天我并不是来给大家提供某种一劳永逸的解决方案的,因为根本不存在这种东西;
00:13:04真正的解法隐藏在大家自己及其系统之中。
00:13:10但我今天带给大家的是一个语言学框架,大家可以用它来
00:13:16诊断自己的系统,并在此基础上去构建系统。
00:13:21大家可以尝试使用 eva,也可以去学习语言学并聘请语言学家。
00:13:28我还想提醒大家的一点是,
00:13:31商业价值与语言学影响是相辅相成、互为因果的。
00:13:35在语音 AI 这个领域,
00:13:37因为语音从根本上讲是一种语言学的、高度人性化且涉及复杂认知的体验。
00:13:45最后,我想抛出一个更具长期价值的问题:
00:13:50说话者是具备适应能力的。我很确定,通过今天我和大家的这场分享,
00:13:59大家对我已经有了更多的了解,比如我的表达风格、口音特色以及
00:14:05常用的词汇。所以下一次如果我们线下见面,大家交流起来会感到更加顺畅,
00:14:12因为大家之前用心关注过我,对吧?说话者总是在不断适应。因此,用户
00:14:18在整个通话过程中也会不断适应你的语音助手。那么,你的系统准备好了吗?
00:14:27以便让用户下一次能更好地使用你的语音助手?
00:14:31此外,语言总是在演变,你的语音助手准备好应对一年甚至半年后的语言变化了吗?
00:14:44你的语音助手下次表现会更好吗?谢谢大家。
00:14:57非常感谢。
00:14:57非常感谢。
00:14:57谢谢大家。
00:15:04谢谢。
Community Posts
No posts yet. Be the first to write about this video!
Write about this video