Pesquisa de Modelos de Fala para Fala no Google DeepMind — Valeria Wu Fon & Tom Ouyang, Google DeepMind
AAI Engineer
컴퓨터/소프트웨어가전제품/카메라
스크립트
00:00:00sem nenhum ruído, sabe, num ambiente isolado, elas acontecem em movimento, no trem, enquanto
00:00:04você está caminhando, e esse é o tipo de experiência que queremos facilitar com o modelo
00:00:08de fala para fala. Por fim, outra coisa que nos deixa muito empolgados não é apenas a saída de voz, mas também a saída
00:00:15multimodal. Acreditamos que a verdadeira fronteira da conversação em AGI também exigirá
00:00:20presença visual, então ficamos felizes em lançar nossa primeira demonstração piloto com o Citi no Cloud Next
00:00:26que suporta avatares em tempo real personalizados, e você pode personalizar qualquer coisa, desde um
00:00:33humano hiper-realista até uma aparência de desenho animado e tudo o mais, e impulsionado pelo mesmo
00:00:38modelo de fala para fala que temos mostrado, ele permite ter, sabe, sincronização labial multilíngue de baixa latência
00:00:43e uma conversa realmente fluida e contínua que possui presença visual, então deixe-me
00:00:48mostrar uma demonstração que também junta nosso diagrama de Venn e o que nos empolga em tudo isso é
00:00:54me lembrando do fundo de faculdade da minha filha, como estamos indo com isso?
00:01:00Você está indo bem, Jackson. Também identifiquei uma nova oportunidade que pode fazer você chegar lá ainda mais rápido.
00:01:06Oh, e posso ver que a Lisa acabou de se juntar a vocês. Oi, Lisa. Ela deve estar muito empolgada com a aceitação na faculdade.
00:01:12Parabéns, é maravilhoso ver suas metas de economia ganhando vida.
00:01:16Excelente, isso é uma boa notícia. Eu sempre brinco que o áudio do usuário em espanhol é pior do que o áudio
00:01:34do modelo respondendo, mas, hã, isso é meio que apenas para mostrar como nosso diagrama de Venn combinando, sabe,
00:01:40multimodalidade de entrada e saída, chamada de ferramentas para puxar os exemplos relevantes do usuário
00:01:45e também a fluidez conversacional com o ITNN estão começando a se juntar lentamente nesses tipos
00:01:50de demonstrações que estamos entusiasmados em continuar empurrando a fronteira, hã, então com esse pensamento final, acho que o último
00:01:57tipo de pensamento que temos para vocês é que acreditamos que a AGI não será digitada, mas que será
00:02:01falada, hã, e para ser falada há muitas coisas que precisam funcionar juntas em um único
00:02:06modelo versátil e prontificável que permite ao usuário alternar entre todos os tipos de modos de conversação
00:02:12que estamos observando, desde a tradução até a tomada de ação, o brainstorming e conversas aleatórias, e nós
00:02:17acreditamos verdadeiramente no poder desses modelos de fala para fala para alcançar essa troca perfeita, hã,
00:02:22então estamos empolgados em avançar nessa fronteira, então se você está empolgado ou quer saber mais
00:02:26por favor venha falar conosco e muito obrigado por virem.
00:02:46você
00:02:56Obrigado.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기