Google DeepMind 的语音到语音模型研究 —— Valeria Wu Fon & Tom Ouyang,Google DeepMind
AAI Engineer
Computing/SoftwareConsumer Electronics
Transcript
00:00:00在几乎没有噪音、密封的环境中,它们随时随地发生,在火车上,当
00:00:04你在散步时,而这正是我们希望通过语音到语音模型
00:00:08促进的体验。最后,我们感到非常兴奋的另一件事不仅是语音输出,还有多模态
00:00:15输出。我们坚信,真正的通用人工智能(AGI)对话前沿也将需要
00:00:20视觉存在,因此我们很高兴在云端与 Citi 推出我们的第一种试点演示
00:00:26它支持定制的实时虚拟形象,你可以将任何东西个性化,从
00:00:33超逼真的人类到卡通外观以及介于两者之间的所有内容,并且由相同的
00:00:38语音到语音模型驱动,正如我们一直展示的那样,它允许进行低延迟、多语言的唇形同步
00:00:43以及真正持续流畅、具有视觉存在的对话,所以让我
00:00:48向您展示一个演示,它也将我们的文氏图汇集在一起,我们对这一切感到兴奋的是
00:00:54让我想起了我女儿的大学基金,我们目前的进展如何?
00:01:00你进展得很顺利,杰克逊。我还发现了一个新机会,也许能让你更快达成目标。
00:01:06哦,我看到丽莎刚刚加入你们了。嗨,丽莎,她一定为自己被大学录取感到非常兴奋吧?
00:01:12恭喜你们,看到你们的储蓄目标变为现实真是太棒了。
00:01:16太好了,这是个好消息。我总是开玩笑说,用户的西班牙语音频比音频模型的回复还要糟糕,但嗯,这只是为了展示我们的文氏图如何结合了
00:01:34多模态输入和输出,你知道的,比如通过工具调用来调取用户的相关示例
00:01:40以及对话的流畅性,这些正在这些类型的演示中慢慢融合在一起
00:01:45我们很高兴能继续突破前沿,因此带着这个离别寄语,我想最后一个
00:01:50想法我们要带给您的是,我们坚信 AGI 不会是通过打字来实现的,而是通过
00:01:57语音来实现的,为了实现语音交互,有许多东西需要在单一的、
00:02:01可提示的多功能模型中协同工作,允许用户在各种对话模式之间切换
00:02:06我们所关注的内容,从翻译到采取行动、头脑风暴再到闲聊,我们
00:02:12坚信这些语音到语音模型实现这种无缝切换的力量,
00:02:17因此我们很高兴能在此基础上推动前沿发展,如果您感到兴奋或想了解更多信息,
00:02:22所以我们很高兴能在这方面推动前沿进展,如果你感兴趣或想了解更多
00:02:26欢迎来和我们交流,非常感谢大家的到来
00:02:46你
00:02:56谢谢。
Community Posts
No posts yet. Be the first to write about this video!
Write about this video