Google DeepMind 的语音到语音模型研究 —— Valeria Wu Fon & Tom Ouyang,Google DeepMind

AAI Engineer
Computing/SoftwareConsumer Electronics

Transcript

00:00:00在几乎没有噪音、密封的环境中,它们随时随地发生,在火车上,当
00:00:04你在散步时,而这正是我们希望通过语音到语音模型
00:00:08促进的体验。最后,我们感到非常兴奋的另一件事不仅是语音输出,还有多模态
00:00:15输出。我们坚信,真正的通用人工智能(AGI)对话前沿也将需要
00:00:20视觉存在,因此我们很高兴在云端与 Citi 推出我们的第一种试点演示
00:00:26它支持定制的实时虚拟形象,你可以将任何东西个性化,从
00:00:33超逼真的人类到卡通外观以及介于两者之间的所有内容,并且由相同的
00:00:38语音到语音模型驱动,正如我们一直展示的那样,它允许进行低延迟、多语言的唇形同步
00:00:43以及真正持续流畅、具有视觉存在的对话,所以让我
00:00:48向您展示一个演示,它也将我们的文氏图汇集在一起,我们对这一切感到兴奋的是
00:00:54让我想起了我女儿的大学基金,我们目前的进展如何?
00:01:00你进展得很顺利,杰克逊。我还发现了一个新机会,也许能让你更快达成目标。
00:01:06哦,我看到丽莎刚刚加入你们了。嗨,丽莎,她一定为自己被大学录取感到非常兴奋吧?
00:01:12恭喜你们,看到你们的储蓄目标变为现实真是太棒了。
00:01:16太好了,这是个好消息。我总是开玩笑说,用户的西班牙语音频比音频模型的回复还要糟糕,但嗯,这只是为了展示我们的文氏图如何结合了
00:01:34多模态输入和输出,你知道的,比如通过工具调用来调取用户的相关示例
00:01:40以及对话的流畅性,这些正在这些类型的演示中慢慢融合在一起
00:01:45我们很高兴能继续突破前沿,因此带着这个离别寄语,我想最后一个
00:01:50想法我们要带给您的是,我们坚信 AGI 不会是通过打字来实现的,而是通过
00:01:57语音来实现的,为了实现语音交互,有许多东西需要在单一的、
00:02:01可提示的多功能模型中协同工作,允许用户在各种对话模式之间切换
00:02:06我们所关注的内容,从翻译到采取行动、头脑风暴再到闲聊,我们
00:02:12坚信这些语音到语音模型实现这种无缝切换的力量,
00:02:17因此我们很高兴能在此基础上推动前沿发展,如果您感到兴奋或想了解更多信息,
00:02:22所以我们很高兴能在这方面推动前沿进展,如果你感兴趣或想了解更多
00:02:26欢迎来和我们交流,非常感谢大家的到来
00:02:46你
00:02:56谢谢。

Key Takeaway

Google DeepMind 推出的语音到语音模型通过结合多模态输入输出、工具调用以及实时虚拟形象,实现了低延迟的多语言流畅对话。

Highlights

  • Google DeepMind 推出了支持定制实时虚拟形象的语音到语音模型,并与花旗银行在云端推出了首个试点演示。

  • 该语音到语音模型支持低延迟、多语言的唇形同步以及持续流畅的视觉存在对话。

  • 演示展示了多模态输入输出的结合,包括通过工具调用来调取用户的相关示例。

  • AGI 的交互前沿将通过语音和视觉存在来实现,而不仅是通过打字。

Timeline

语音到语音模型与多模态虚拟形象演示

  • 语音到语音模型旨在促进日常生活环境中的流畅体验。
  • 云端与花旗银行推出的试点演示支持定制的实时虚拟形象。
  • 虚拟形象由语音到语音模型驱动,支持低延迟、多语言唇形同步。

该模型不仅支持语音输出,还拓展至多模态输出,涵盖视觉存在。演示中的虚拟形象可以从超逼真的人类外观定制为卡通外观,并在实际对话中展示了大学基金储蓄目标的互动。

多模态融合与语音交互的未来

  • 演示中结合了多模态输入和输出以及工具调用的用户示例。
  • AGI 的发展将通过语音而非打字来实现。
  • 单一款可提示的多功能模型允许用户在翻译、行动、头脑风暴和闲聊等多种模式之间无缝切换。

未来的交互前沿需要视觉存在和单一模型的协同工作。语音到语音模型具备在各种对话模式之间切换的强大能力,推动了通用人工智能对话前沿的发展。

Community Posts

No posts yet. Be the first to write about this video!

Write about this video