Investigación de modelos de voz a voz en Google DeepMind — Valeria Wu Fon y Tom Ouyang, Google DeepMind

AAI Engineer
컴퓨터/소프트웨어가전제품/카메라

스크립트

00:00:00con algo sin ruido, ya sabes, en un entorno cerrado, ocurren sobre la marcha, en el tren mientras
00:00:04vas caminando, y ese es el tipo de experiencias que queremos facilitar con el modelo
00:00:08de voz a voz. Por último, otra cosa que nos entusiasma mucho no es solo la salida de voz, sino también la salida
00:00:15multimodal. Creemos que la verdadera frontera conversacional de la AGI también requerirá
00:00:20presencia visual, así que nos emociona lanzar nuestra primera demostración piloto con City in Cloud Next,
00:00:26que admite avatares personalizados en tiempo real y te permite personalizar cualquier cosa, desde un
00:00:33humano hiperrealista hasta una apariencia de dibujos animados y todo lo intermedio. Impulsado por el mismo
00:00:38modelo de voz a voz que hemos estado mostrando, permite tener una sincronización de labios multilingüe de baja latencia
00:00:43y una conversación continua y fluida que cuenta con presencia visual. Así que déjenme
00:00:48mostrarles una demostración que también une nuestro diagrama de Venn y lo que nos entusiasma de todo esto es
00:00:54me recuerda al fondo universitario de mi hija, ¿cómo vamos con eso?
00:01:00Vas muy bien, Jackson. También he identificado una nueva oportunidad que podría llevarte allí aún más rápido.
00:01:06Oh, y veo que Lisa se acaba de unir. Hola, Lisa, debe estar muy emocionada por su aceptación en la universidad.
00:01:12Felicitaciones, es maravilloso ver que tus objetivos de ahorro cobran vida.
00:01:16Excelente, son buenas noticias. Siempre bromeo con que el audio del usuario en español es peor que el del modelo hablando de vuelta, pero esto es solo para mostrar cómo nuestro diagrama de Venn de combinar
00:01:34multimodalidad de entrada y salida, ya sabes, llamadas a herramientas para extraer los ejemplos relevantes del usuario
00:01:40y también la fluidez conversacional con ITNN están comenzando lentamente a unirse en este tipo
00:01:45de demostraciones que nos entusiasma seguir impulsando en la frontera, así que con este último pensamiento,
00:01:50supongo que el último tipo de pensamiento que tenemos para ustedes es que creemos que la AGI no se escribirá con teclado, sino que se
00:01:57hablará, y para que se hable hay muchas cosas que deben funcionar juntas en un solo
00:02:01modelo versátil y integrable que permita al usuario cambiar entre todo tipo de modos de conversación
00:02:06que estamos viendo, desde la traducción hasta la ejecución de acciones, la lluvia de ideas y desvariar, y
00:02:12creemos firmemente en el poder de estos modelos de voz a voz para lograr ese cambio fluido;
00:02:17así que nos entusiasma seguir avanzando en esta frontera. Si estás emocionado o quieres saber más,
00:02:22ven a hablar con nosotros y muchas gracias por asistir.
00:02:26Gracias.
00:02:46tú
00:02:56Gracias.

핵심 요약

La verdadera frontera de la inteligencia artificial conversacional requiere modelos de voz a voz con presencia visual, avatares en tiempo real y soporte multimodal para lograr una interacción fluida y sin teclado.

하이라이트

  • Las experiencias de voz a voz ocurren sobre la marcha en entornos ruidosos como trenes o durante caminatas.

  • La primera demostración piloto con City in Cloud Next admite avatares personalizados en tiempo real, desde un humano hiperrealista hasta una apariencia de dibujos animados.

  • El modelo de voz a voz permite una sincronización de labios multilingüe de baja latencia y una conversación fluida con presencia visual.

  • La interacción combina la multimodalidad de entrada y salida, llamadas a herramientas para extraer ejemplos y la fluidez conversacional con ITNN.

  • La AGI no se escribirá con teclado, sino que se hablará mediante un modelo versátil e integrable.

타임라인

Experiencias móviles y presencia visual

  • Las interacciones conversacionales ocurren en entornos cotidianos dinámicos.
  • La salida multimodal requiere presencia visual en la frontera conversacional de la AGI.
  • La demostración piloto con City in Cloud Next admite avatares personalizados en tiempo real.

Las conversaciones avanzadas ocurren sobre la marcha durante los desplazamientos diarios. La integración de avatares personalizados abarca desde diseños hiperrealistas hasta estilos de dibujos animados con sincronización de labios multilingüe de baja latencia.

Demostración y unificación multimodal

  • El sistema identifica nuevas oportunidades financieras en tiempo real durante la conversación.
  • La arquitectura combina multimodalidad de entrada y salida con llamadas a herramientas externas.
  • Los modelos integran la extracción de datos de usuarios con la fluidez conversacional.

La demostración práctica expone cómo los sistemas combinan consultas de fondos y notificaciones de aceptación universitaria de forma natural. La unión de llamadas a herramientas y la multimodalidad consolidan experiencias fluidas.

El futuro de la interacción hablada

  • La inteligencia artificial general se operará mediante la voz en lugar del teclado.
  • Un solo modelo versátil permite alternar entre traducción, ejecución de acciones y lluvia de ideas.
  • Los modelos de voz a voz impulsan el cambio hacia interfaces puramente conversacionales.

El uso de la AGI depende de la capacidad de hablar con modelos integrados que gestionan múltiples modos de conversación simultáneamente. La transición hacia la voz elimina la fricción de los teclados tradicionales.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기