Pesquisa de Modelos de Fala para Fala no Google DeepMind — Valeria Wu Fon & Tom Ouyang, Google DeepMind

AAI Engineer
컴퓨터/소프트웨어가전제품/카메라

스크립트

00:00:00sem nenhum ruído, sabe, num ambiente isolado, elas acontecem em movimento, no trem, enquanto
00:00:04você está caminhando, e esse é o tipo de experiência que queremos facilitar com o modelo
00:00:08de fala para fala. Por fim, outra coisa que nos deixa muito empolgados não é apenas a saída de voz, mas também a saída
00:00:15multimodal. Acreditamos que a verdadeira fronteira da conversação em AGI também exigirá
00:00:20presença visual, então ficamos felizes em lançar nossa primeira demonstração piloto com o Citi no Cloud Next
00:00:26que suporta avatares em tempo real personalizados, e você pode personalizar qualquer coisa, desde um
00:00:33humano hiper-realista até uma aparência de desenho animado e tudo o mais, e impulsionado pelo mesmo
00:00:38modelo de fala para fala que temos mostrado, ele permite ter, sabe, sincronização labial multilíngue de baixa latência
00:00:43e uma conversa realmente fluida e contínua que possui presença visual, então deixe-me
00:00:48mostrar uma demonstração que também junta nosso diagrama de Venn e o que nos empolga em tudo isso é
00:00:54me lembrando do fundo de faculdade da minha filha, como estamos indo com isso?
00:01:00Você está indo bem, Jackson. Também identifiquei uma nova oportunidade que pode fazer você chegar lá ainda mais rápido.
00:01:06Oh, e posso ver que a Lisa acabou de se juntar a vocês. Oi, Lisa. Ela deve estar muito empolgada com a aceitação na faculdade.
00:01:12Parabéns, é maravilhoso ver suas metas de economia ganhando vida.
00:01:16Excelente, isso é uma boa notícia. Eu sempre brinco que o áudio do usuário em espanhol é pior do que o áudio
00:01:34do modelo respondendo, mas, hã, isso é meio que apenas para mostrar como nosso diagrama de Venn combinando, sabe,
00:01:40multimodalidade de entrada e saída, chamada de ferramentas para puxar os exemplos relevantes do usuário
00:01:45e também a fluidez conversacional com o ITNN estão começando a se juntar lentamente nesses tipos
00:01:50de demonstrações que estamos entusiasmados em continuar empurrando a fronteira, hã, então com esse pensamento final, acho que o último
00:01:57tipo de pensamento que temos para vocês é que acreditamos que a AGI não será digitada, mas que será
00:02:01falada, hã, e para ser falada há muitas coisas que precisam funcionar juntas em um único
00:02:06modelo versátil e prontificável que permite ao usuário alternar entre todos os tipos de modos de conversação
00:02:12que estamos observando, desde a tradução até a tomada de ação, o brainstorming e conversas aleatórias, e nós
00:02:17acreditamos verdadeiramente no poder desses modelos de fala para fala para alcançar essa troca perfeita, hã,
00:02:22então estamos empolgados em avançar nessa fronteira, então se você está empolgado ou quer saber mais
00:02:26por favor venha falar conosco e muito obrigado por virem.
00:02:46você
00:02:56Obrigado.

핵심 요약

O modelo de fala para fala do Google DeepMind integra multimodalidade de saída, avatares em tempo real e sincronização labial multilíngue para viabilizar conversas contínuas em ambientes dinâmicos.

하이라이트

  • As conversas reais acontecem em movimento, como no trem ou durante caminhadas, e não apenas em ambientes isolados.

  • A demonstração piloto com o Citi no Cloud Next suporta avatares em tempo real personalizados, desde humanos hiper-realistas até desenhos animados.

  • O modelo de fala para fala possui sincronização labial multilíngue de baixa latência para conversas contínuas com presença visual.

  • A inteligência geral artificial (AGI) será baseada na fala e não na digitação.

  • O modelo versátil permite alternar entre tradução, tomada de ação, brainstorming e conversas aleatórias.

타임라인

Experiências de fala em movimento e avatares multimodais

  • As experiências de fala acontecem em ambientes dinâmicos, como no trem ou caminhando.
  • A saída multimodal inclui presença visual com avatares em tempo real personalizados.
  • O sistema suporta desde humanos hiper-realistas até aparências de desenho animado.

As interações reais ocorrem em movimento e exigem modelos de fala flexíveis. A demonstração piloto com o Citi no Cloud Next integra avatares customizáveis em tempo real, impulsionados pela tecnologia de fala para fala.

Demonstração prática e integração de ferramentas

  • A demonstração combina fundos de faculdade e metas financeiras dos usuários.
  • A chamada de ferramentas puxa exemplos relevantes do usuário durante a conversa.
  • A multimodalidade de entrada e saída une-se à fluidez conversacional.

A demonstração prática ilustra o uso de metas de economia e verificação de aceitação em faculdade. A integração de ferramentas e a multimodalidade demonstram a fluidez conversacional alcançada pelo ITNN.

O futuro da AGI baseado na fala

  • A AGI será falada e não digitada.
  • Um único modelo versátil permite alternar entre tradução, ação e brainstorming.
  • Os modelos de fala para fala viabilizam a troca conversacional perfeita.

A evolução da conversação em AGI depende de um modelo versátil e prontificável que agrupe tradução, tomada de ação e conversas aleatórias. A fala substitui a digitação como principal interface de interação.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기