"Mi nombre es... mi nombre es...": Un mapa lingüístico para agentes de voz — Midam Kim, ServiceNow
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Hola a todos. Me llamo Midam Kim. Soy ingeniera de ML en ServiceNow y voy a
00:00:25hablar sobre un marco lingüístico para IA de voz. Un breve contexto sobre mí para que
00:00:37sepan de dónde vengo. Como dije, soy ingeniera de ML en ServiceNow, pero también
00:00:42soy investigadora, investigadora de por vida de la comunicación oral en entornos reales. Mi
00:00:48lema es hacer lingüística, y lo que voy a hacer hoy es entregarles
00:00:54esa perspectiva de la lingüística. ¿Han experimentado fallos en IA de voz? Sí, como
00:01:05todo el mundo. Voy a presentar un ejemplo que viví yo misma. El
00:01:15bot me preguntó: “¿Podría deletrear su nombre?” Y empecé a deletrearlo despacio.
00:01:22Sí, es M-I-D-A-M. Y el bot dice: “Confirmando con usted, ¿es M-I-D-A-N?” Y le digo: “No, es M-I-D-A-M”.
00:01:40Y me molesto un poco más, porque mi nombre es M-I-D-A-M, no M-I-D-A-N. Luego me pregunta: “Ahora, ¿cuál es su número de cuenta?” Y empiezo a confundirme. ¿Qué es eso del número de cuenta? Intento buscar esa información.
00:02:09Entonces, ¿cuál? Debe ser... y empiezo a deletrear despacio el número de cuenta: A-X-4-5-1. Me tomo mi tiempo porque no estoy acostumbrada a leer este número tan raro. Y el bot me interrumpe. Y me dice: “No pude encontrar su registro”. Y sin siquiera
00:02:14intentarlo, me pide que lo repita de nuevo: “¿Podría repetirlo, por favor?”. Y me estreso. “No pude encontrar su registro”. Y luego dice: “No pude encontrar su registro”. Y sin intentar nada, me pide repetirlo de nuevo. “¿Podría repetirlo?”. Y me estreso. Luego dice: “No pude encontrar su registro”. Y entonces,
00:02:21A, X, 4, 5, 1 y me tomo mi tiempo porque no estoy acostumbrada a leer este
00:02:30número tan raro, y luego el bot me interrumpe y dice: “No pude encontrar su
00:02:36registro”, y sin siquiera intentarlo me pide que lo repita otra vez: “¿Podría
00:02:42repetirlo, por favor?”. Me molesto muchísimo y le digo: “¿Puedo hablar
00:02:46con una persona? Ya no quiero lidiar más contigo”. Este es un patrón muy
00:02:51típico de la IA de voz hoy en día, lamentablemente. Así que solo
00:02:57quiero orientar sobre cómo solucionar esto con la lingüística. La IA de voz
00:03:06está en auge, pero los usuarios suelen preferir agentes humanos antes que agentes
00:03:11de voz. ¿Cómo mitigamos esto? Pero en primer lugar, ¿cuáles son los
00:03:19problemas reales? Creo que podemos pensar en un marco fundamental para
00:03:25entender esta arquitectura extremo a extremo de la IA de voz, que se llama lingüística.
00:03:35Como todos sabemos, la comunicación humana es una actividad conjunta, como
00:03:41lo que estamos haciendo ahora. Yo les doy mis sonidos y palabras, ustedes los escuchan
00:03:48y, si fuera una conversación, me darían sus sonidos y sus
00:03:53palabras, y esto va y viene mediante la interacción. En este
00:04:02proceso, procesamos y actualizamos continuamente nuestros modelos mentales. Es una
00:04:09actividad conjunta en la comunicación humana. Y diría que en la IA de voz,
00:04:18la comunicación humana también debe ser una actividad conjunta así, porque es
00:04:25lo único que sabemos de la comunicación humana. Como seres humanos, hemos
00:04:30evolucionado miles de años como comunicadores y esto es lo que conocemos,
00:04:35así que esperamos lo mismo de los bots. Repasemos el fallo de mi llamada
00:04:45con el agente de voz en este marco. Ven que hay escuchar y hablar para cada
00:04:53parte. Empiezo deletreando mi nombre y el bot no escucha correctamente
00:05:04la diferencia entre M y N. Es un fallo de STT al escuchar. Luego el TTS aplica reglas de lectura
00:05:14centradas solo en el inglés a mi nombre. M-I-D-A-M se leería M-I-D-A-M en la versión de inglés
00:05:22americano. Estoy confundida, pero soy comprensiva porque esto pasa a menudo,
00:05:29incluso con personas, así que está bien. Pero cuando sacó
00:05:36el tema del número de cuenta, como no sé qué es, me confundo de nuevo, pero me adapto y puedo buscarlo.
00:05:44Encuentro el número, empiezo a leerlo, pero el STT no reconoció la palabra
00:05:52correctamente, así que me interrumpe y finalmente acaba hablando encima de mí, por lo que me irrito mucho.
00:06:06Y cuando me pide repetir la misma información, queda claro
00:06:14que este bot no comparte mi modelo mental y, de forma muy grosera, ni siquiera intenta
00:06:22una aclaración interactiva, una estrategia habitual entre personas. Ya no quiero lidiar con esto,
00:06:28así que digo: “¿Puedo hablar con una persona?”. Volvamos a repasar el marco. Estos son los
00:06:38componentes lingüísticos que se esperan y se mantienen bien en la conversación entre humanos.
00:06:47Hay canales de escucha, un canal de escucha y uno de habla, y hay diferentes componentes
00:06:52como sonidos, palabras, interacción y modelo mental. El primer componente es: ¿el bot reconoce bien el habla
00:06:59del usuario? Todos estos términos técnicos entran aquí. Y luego está este
00:07:09segundo componente, que son las palabras en el canal de escucha: ¿el bot entiende las palabras del usuario?
00:07:17El tercero es: ¿el bot espera al momento adecuado para su turno? Trata sobre la interacción en el canal de escucha.
00:07:28Y la última parte es el modelo mental: ¿entiende el bot la intención del usuario al escuchar?
00:07:38Pasando al canal de habla, trataría de la pronunciación de los sonidos,
00:07:43y también de si el bot elige las palabras que el usuario pueda entender.
00:07:53En la interacción, ¿habla el bot en el momento oportuno? Y por último, ¿habla con la
00:08:01información que el usuario realmente necesita?
00:08:05Hay muchos términos de ingeniería, lingüística o ciencia cognitiva aquí presentes,
00:08:13así que ven que todos ocupan su lugar en este marco lingüístico.
00:08:23Importante: estos componentes son interdependientes, no están separados ni aislados.
00:08:30Son interdependientes y están alineados. Si quieren hacer las cosas bien con los sonidos,
00:08:36deben pensar a nivel de palabras. Y si quieren hacerlo bien con sonidos y palabras,
00:08:43también deben tener en cuenta la interacción, la toma de turnos o su detección.
00:08:50Por último, para completar la tarea con éxito, que es la meta del modelo mental, deben integrar todo esto.
00:09:02Sin cualquiera de estos componentes, su agente de voz fallará.
00:09:09Y todo debe estar bien alineado.
00:09:17Además, deben recordar que esto ocurre en una línea de tiempo.
00:09:26Me refiero a que se rastrea en silencio, no como en un chat. En el chat ves el historial de lo dicho
00:09:34en texto, pero con el agente de voz dices algo, el bot responde, conversan
00:09:45y todas las ondas sonoras, la vibración en el aire, desaparecen.
00:09:53Solo queda el modelo mental del usuario, y eso es lo que importa.
00:10:00Los sonidos, palabras e interacciones se esfuman al pronunciarse,
00:10:04pero el modelo mental permanece y se desarrolla con el tiempo.
00:10:09Esto es lo que deben
00:10:12buscar para la satisfacción del usuario.
00:10:16¿Y qué podemos hacer
00:10:19para que el bot cumpla con los estándares del usuario?
00:10:25Lo que podemos hacer incluye elegir buenos modelos de ASR o configuraciones y hacer posprocesamiento,
00:10:34elegir buenos modelos de TTS, configuraciones y preprocesamiento,
00:10:38preparar cuidadosamente el vocabulario que compartirán el bot y el usuario,
00:10:46y gestionar bien la latencia de detección entre turnos y la toma de turnos.
00:10:52Y muy importante: sería genial detectar y gestionar bien las emociones,
00:10:59así como retener el contexto, refiriéndome al contexto de todo esto.
00:11:07Y, sobre todo, debe ser dinámico, porque las cosas cambian a lo largo de la llamada.
00:11:16Así que debemos hacer esta gestión dinámica en la línea de tiempo
00:11:21para distintos tipos de personas.
00:11:24Los niños u otro tipo de personas tendrán expectativas distintas que debemos satisfacer,
00:11:32no solo cuando estén contentos, sino también cuando no lo estén.
00:11:36Solo así se puede buscar una orquestación dinámica y escalable de la IA de voz.
00:11:42Es una labor muy difícil.
00:11:48Decimos que la voz es la vía más natural de comunicación, pero no es fácil;
00:11:54detrás de escena todo funciona gracias a esta orquestación lingüística.
00:11:59Si el bot no es bueno en esto, es un fallo catastrófico.
00:12:07Prestar atención a este marco lingüístico tiene implicaciones comerciales, ya que se pueden
00:12:17reducir la frustración del usuario, las tareas fallidas, el desvío a agentes, las llamadas abandonadas y los fallos silenciosos.
00:12:28En ServiceNow creamos una evaluación de referencia llamada EVA Bench que pueden usar para diagnosticar el estado de su agente de voz.
00:12:43Puntos clave:
00:12:45La IA de voz es una actividad conjunta
00:12:49entre el bot y el usuario, no solo un flujo de proceso.
00:12:54Y debemos atender sus necesidades en múltiples capas en tiempo real.
00:12:59No les he traído una solución rápida hoy, porque no existe tal cosa;
00:13:04la solución está en ustedes y en su sistema.
00:13:10Lo que les he presentado hoy es el marco lingüístico que pueden usar
00:13:16para diagnosticar su sistema y construir sobre él.
00:13:21Pueden probar EVA, pero también aprender lingüística y contratar lingüistas.
00:13:28Otra cosa que quiero recordarles es que
00:13:31las implicaciones comerciales son implicaciones lingüísticas y viceversa
00:13:35en este panorama de la IA de voz,
00:13:37porque la voz es fundamentalmente una experiencia lingüística, humana y cognitiva.
00:13:45Me gustaría plantearles una pregunta a más largo plazo.
00:13:50Los hablantes se adaptan. Estoy segura de que en esta charla que he tenido hoy con ustedes
00:13:59han aprendido algo sobre mí, mi estilo al hablar, mi acento
00:14:05o las palabras que uso. La próxima vez que nos veamos en persona les resultará más cómodo
00:14:12hablar conmigo porque me han prestado atención, ¿verdad? Los hablantes siempre se adaptan, así que el usuario
00:14:18se adaptará a su agente de voz durante la llamada. ¿Está su sistema preparado para que
00:14:27puedan usar mejor su agente de voz la próxima vez?
00:14:31El lenguaje siempre cambia. ¿Está su agente listo para el cambio lingüístico en seis meses o un año?
00:14:44¿Será mejor su agente de voz la próxima vez? Muchas gracias.
00:14:57Muchas gracias.
00:14:57Muchas gracias.
00:14:57Muchas gracias.
00:15:04Gracias.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기