Recherche sur les modèles de synthèse vocale (Speech-to-Speech) chez Google DeepMind — Valeria Wu Fon & Tom Ouyang, Google DeepMind
AAI Engineer
컴퓨터/소프트웨어가전제품/카메라
스크립트
00:00:00avec pour ainsi dire aucun bruit vous savez dans un environnement étanche elles se produisent en déplacement dans le train pendant
00:00:04que vous marchez et c'est le type d'expériences que nous voulons faciliter avec le modèle
00:00:08de parole à parole. Enfin, un autre point qui nous enthousiasme beaucoup est non seulement la sortie vocale, mais aussi la sortie
00:00:15multimodale. Nous croyons que la véritable frontière conversationnelle de l'AGI exigera également
00:00:20une présence visuelle. Nous sommes donc ravis de lancer notre première sorte de démo pilote avec Citi dans Cloud Next
00:00:26qui prend en charge des avatars en temps réel personnalisés et vous pouvez personnaliser n'importe quoi, d'un
00:00:33humain hyper réaliste à une apparence de dessin animé et tout ce qui se trouve entre les deux, et propulsé par le même
00:00:38modèle de parole à parole que nous avons présenté, cela permet d'avoir, vous savez, une synchronisation labiale multilingue à faible latence
00:00:43et une conversation vraiment continue et fluide qui possède une présence visuelle. Laissez-moi donc
00:00:48vous montrer une démo qui rassemble également notre diagramme de Venn et ce qui nous enthousiasme dans tout cela, c'est
00:00:54que cela me rappelle le fonds d'études de ma fille, où en sommes-nous à ce sujet ?
00:01:00Tu es en bonne voie, Jackson. J'ai également identifié une nouvelle opportunité qui pourrait t'y mener encore plus tôt.
00:01:06Oh, et je vois que Lisa vient de se joindre à vous. Salut Lisa ! Elle doit être tellement excitée par son admission à l'université.
00:01:12Félicitations, c'est merveilleux de voir vos objectifs d'épargne se concrétiser.
00:01:16Excellent, ce sont de bonnes nouvelles. Je plaisante toujours en disant que l'audio de l'utilisateur en espagnol est pire que l'audio du modèle qui répond, mais bon,
00:01:34ceci est juste pour montrer comment notre diagramme de Venn combinant, vous savez,
00:01:40la multimodalité en entrée et en sortie, l'appel d'outils pour extraire les exemples pertinents de l'utilisateur
00:01:45ainsi que la fluidité conversationnelle avec l'ITNN commencent lentement à se rassembler dans ces types
00:01:50de démos que nous sommes impatients de continuer à faire progresser. Donc, avec cette dernière pensée,
00:01:57la dernière idée que nous avons pour vous est que nous croyons que l'AGI ne sera pas tapée au clavier, qu'elle sera
00:02:01parlée. Et pour qu'elle soit parlée, il y a beaucoup de choses qui doivent fonctionner ensemble dans un seul
00:02:06modèle polyvalent et prompteable qui permet à un utilisateur de basculer entre toutes sortes de modes de conversation
00:02:12que nous examinons, de la traduction à l'action, du brainstorming au bavardage, et nous
00:02:17croyons fermement en la puissance de ces modèles de parole à parole pour réaliser cette transition transparente.
00:02:22Nous sommes donc ravis de repousser les frontières dans ce domaine. Alors, si cela vous passionne ou si vous voulez en savoir plus,
00:02:26venez nous parler et merci beaucoup d'être venus.
00:02:46vous
00:02:56Merci.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기