Recherche sur les modèles de synthèse vocale (Speech-to-Speech) chez Google DeepMind — Valeria Wu Fon & Tom Ouyang, Google DeepMind

AAI Engineer
컴퓨터/소프트웨어가전제품/카메라

스크립트

00:00:00avec pour ainsi dire aucun bruit vous savez dans un environnement étanche elles se produisent en déplacement dans le train pendant
00:00:04que vous marchez et c'est le type d'expériences que nous voulons faciliter avec le modèle
00:00:08de parole à parole. Enfin, un autre point qui nous enthousiasme beaucoup est non seulement la sortie vocale, mais aussi la sortie
00:00:15multimodale. Nous croyons que la véritable frontière conversationnelle de l'AGI exigera également
00:00:20une présence visuelle. Nous sommes donc ravis de lancer notre première sorte de démo pilote avec Citi dans Cloud Next
00:00:26qui prend en charge des avatars en temps réel personnalisés et vous pouvez personnaliser n'importe quoi, d'un
00:00:33humain hyper réaliste à une apparence de dessin animé et tout ce qui se trouve entre les deux, et propulsé par le même
00:00:38modèle de parole à parole que nous avons présenté, cela permet d'avoir, vous savez, une synchronisation labiale multilingue à faible latence
00:00:43et une conversation vraiment continue et fluide qui possède une présence visuelle. Laissez-moi donc
00:00:48vous montrer une démo qui rassemble également notre diagramme de Venn et ce qui nous enthousiasme dans tout cela, c'est
00:00:54que cela me rappelle le fonds d'études de ma fille, où en sommes-nous à ce sujet ?
00:01:00Tu es en bonne voie, Jackson. J'ai également identifié une nouvelle opportunité qui pourrait t'y mener encore plus tôt.
00:01:06Oh, et je vois que Lisa vient de se joindre à vous. Salut Lisa ! Elle doit être tellement excitée par son admission à l'université.
00:01:12Félicitations, c'est merveilleux de voir vos objectifs d'épargne se concrétiser.
00:01:16Excellent, ce sont de bonnes nouvelles. Je plaisante toujours en disant que l'audio de l'utilisateur en espagnol est pire que l'audio du modèle qui répond, mais bon,
00:01:34ceci est juste pour montrer comment notre diagramme de Venn combinant, vous savez,
00:01:40la multimodalité en entrée et en sortie, l'appel d'outils pour extraire les exemples pertinents de l'utilisateur
00:01:45ainsi que la fluidité conversationnelle avec l'ITNN commencent lentement à se rassembler dans ces types
00:01:50de démos que nous sommes impatients de continuer à faire progresser. Donc, avec cette dernière pensée,
00:01:57la dernière idée que nous avons pour vous est que nous croyons que l'AGI ne sera pas tapée au clavier, qu'elle sera
00:02:01parlée. Et pour qu'elle soit parlée, il y a beaucoup de choses qui doivent fonctionner ensemble dans un seul
00:02:06modèle polyvalent et prompteable qui permet à un utilisateur de basculer entre toutes sortes de modes de conversation
00:02:12que nous examinons, de la traduction à l'action, du brainstorming au bavardage, et nous
00:02:17croyons fermement en la puissance de ces modèles de parole à parole pour réaliser cette transition transparente.
00:02:22Nous sommes donc ravis de repousser les frontières dans ce domaine. Alors, si cela vous passionne ou si vous voulez en savoir plus,
00:02:26venez nous parler et merci beaucoup d'être venus.
00:02:46vous
00:02:56Merci.

핵심 요약

Google DeepMind développe des modèles de parole à parole multimodaux intégrant une présence visuelle et des avatars personnalisés pour rendre les conversations fluides et continues.

하이라이트

  • Google DeepMind lance une démo pilote avec Citi lors de Cloud Next qui prend en charge des avatars en temps réel personnalisés.

  • Le modèle de parole à parole permet une synchronisation labiale multilingue à faible latence et une conversation continue.

  • La vision de Google DeepMind est que l'AGI ne sera pas tapée au clavier mais sera parlée grâce à des modèles de parole à parole.

타임라인

Modèles de parole à parole et multimodalité

  • Les modèles facilitent les expériences en déplacement avec un bruit réduit.
  • La sortie multimodale et la présence visuelle sont essentielles pour la frontière conversationnelle de l'AGI.
  • Une démo pilote avec Citi intègre des avatars en temps réel personnalisés et multilingues.

Les environnements réels exigent des interactions fluides en marchant ou dans les transports. La véritable frontière conversationnelle de l'AGI intègre une présence visuelle via des avatars personnalisables, allant d'humains hyper réalistes à des dessins animés, propulsés par un modèle de parole à parole à faible latence.

Perspectives et avenir des modèles conversationnels

  • La multimodalité en entrée et en sortie combine l'appel d'outils et la fluidité conversationnelle.
  • L'AGI sera parlée plutôt que tapée au clavier.
  • Un modèle polyvalent permet de basculer entre la traduction, l'action, le brainstorming et le bavardage.

L'intégration de la multimodalité, de l'appel d'outils et de la fluidité conversationnelle permet de progresser vers des interactions plus naturelles. L'objectif final repose sur un modèle unique et prompteable capable de gérer tous les modes de conversation de manière transparente.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기