"Mi nombre es... mi nombre es...": Un mapa lingüístico para agentes de voz — Midam Kim, ServiceNow

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Hola a todos. Me llamo Midam Kim. Soy ingeniera de ML en ServiceNow y voy a
00:00:25hablar sobre un marco lingüístico para IA de voz. Un breve contexto sobre mí para que
00:00:37sepan de dónde vengo. Como dije, soy ingeniera de ML en ServiceNow, pero también
00:00:42soy investigadora, investigadora de por vida de la comunicación oral en entornos reales. Mi
00:00:48lema es hacer lingüística, y lo que voy a hacer hoy es entregarles
00:00:54esa perspectiva de la lingüística. ¿Han experimentado fallos en IA de voz? Sí, como
00:01:05todo el mundo. Voy a presentar un ejemplo que viví yo misma. El
00:01:15bot me preguntó: “¿Podría deletrear su nombre?” Y empecé a deletrearlo despacio.
00:01:22Sí, es M-I-D-A-M. Y el bot dice: “Confirmando con usted, ¿es M-I-D-A-N?” Y le digo: “No, es M-I-D-A-M”.
00:01:40Y me molesto un poco más, porque mi nombre es M-I-D-A-M, no M-I-D-A-N. Luego me pregunta: “Ahora, ¿cuál es su número de cuenta?” Y empiezo a confundirme. ¿Qué es eso del número de cuenta? Intento buscar esa información.
00:02:09Entonces, ¿cuál? Debe ser... y empiezo a deletrear despacio el número de cuenta: A-X-4-5-1. Me tomo mi tiempo porque no estoy acostumbrada a leer este número tan raro. Y el bot me interrumpe. Y me dice: “No pude encontrar su registro”. Y sin siquiera
00:02:14intentarlo, me pide que lo repita de nuevo: “¿Podría repetirlo, por favor?”. Y me estreso. “No pude encontrar su registro”. Y luego dice: “No pude encontrar su registro”. Y sin intentar nada, me pide repetirlo de nuevo. “¿Podría repetirlo?”. Y me estreso. Luego dice: “No pude encontrar su registro”. Y entonces,
00:02:21A, X, 4, 5, 1 y me tomo mi tiempo porque no estoy acostumbrada a leer este
00:02:30número tan raro, y luego el bot me interrumpe y dice: “No pude encontrar su
00:02:36registro”, y sin siquiera intentarlo me pide que lo repita otra vez: “¿Podría
00:02:42repetirlo, por favor?”. Me molesto muchísimo y le digo: “¿Puedo hablar
00:02:46con una persona? Ya no quiero lidiar más contigo”. Este es un patrón muy
00:02:51típico de la IA de voz hoy en día, lamentablemente. Así que solo
00:02:57quiero orientar sobre cómo solucionar esto con la lingüística. La IA de voz
00:03:06está en auge, pero los usuarios suelen preferir agentes humanos antes que agentes
00:03:11de voz. ¿Cómo mitigamos esto? Pero en primer lugar, ¿cuáles son los
00:03:19problemas reales? Creo que podemos pensar en un marco fundamental para
00:03:25entender esta arquitectura extremo a extremo de la IA de voz, que se llama lingüística.
00:03:35Como todos sabemos, la comunicación humana es una actividad conjunta, como
00:03:41lo que estamos haciendo ahora. Yo les doy mis sonidos y palabras, ustedes los escuchan
00:03:48y, si fuera una conversación, me darían sus sonidos y sus
00:03:53palabras, y esto va y viene mediante la interacción. En este
00:04:02proceso, procesamos y actualizamos continuamente nuestros modelos mentales. Es una
00:04:09actividad conjunta en la comunicación humana. Y diría que en la IA de voz,
00:04:18la comunicación humana también debe ser una actividad conjunta así, porque es
00:04:25lo único que sabemos de la comunicación humana. Como seres humanos, hemos
00:04:30evolucionado miles de años como comunicadores y esto es lo que conocemos,
00:04:35así que esperamos lo mismo de los bots. Repasemos el fallo de mi llamada
00:04:45con el agente de voz en este marco. Ven que hay escuchar y hablar para cada
00:04:53parte. Empiezo deletreando mi nombre y el bot no escucha correctamente
00:05:04la diferencia entre M y N. Es un fallo de STT al escuchar. Luego el TTS aplica reglas de lectura
00:05:14centradas solo en el inglés a mi nombre. M-I-D-A-M se leería M-I-D-A-M en la versión de inglés
00:05:22americano. Estoy confundida, pero soy comprensiva porque esto pasa a menudo,
00:05:29incluso con personas, así que está bien. Pero cuando sacó
00:05:36el tema del número de cuenta, como no sé qué es, me confundo de nuevo, pero me adapto y puedo buscarlo.
00:05:44Encuentro el número, empiezo a leerlo, pero el STT no reconoció la palabra
00:05:52correctamente, así que me interrumpe y finalmente acaba hablando encima de mí, por lo que me irrito mucho.
00:06:06Y cuando me pide repetir la misma información, queda claro
00:06:14que este bot no comparte mi modelo mental y, de forma muy grosera, ni siquiera intenta
00:06:22una aclaración interactiva, una estrategia habitual entre personas. Ya no quiero lidiar con esto,
00:06:28así que digo: “¿Puedo hablar con una persona?”. Volvamos a repasar el marco. Estos son los
00:06:38componentes lingüísticos que se esperan y se mantienen bien en la conversación entre humanos.
00:06:47Hay canales de escucha, un canal de escucha y uno de habla, y hay diferentes componentes
00:06:52como sonidos, palabras, interacción y modelo mental. El primer componente es: ¿el bot reconoce bien el habla
00:06:59del usuario? Todos estos términos técnicos entran aquí. Y luego está este
00:07:09segundo componente, que son las palabras en el canal de escucha: ¿el bot entiende las palabras del usuario?
00:07:17El tercero es: ¿el bot espera al momento adecuado para su turno? Trata sobre la interacción en el canal de escucha.
00:07:28Y la última parte es el modelo mental: ¿entiende el bot la intención del usuario al escuchar?
00:07:38Pasando al canal de habla, trataría de la pronunciación de los sonidos,
00:07:43y también de si el bot elige las palabras que el usuario pueda entender.
00:07:53En la interacción, ¿habla el bot en el momento oportuno? Y por último, ¿habla con la
00:08:01información que el usuario realmente necesita?
00:08:05Hay muchos términos de ingeniería, lingüística o ciencia cognitiva aquí presentes,
00:08:13así que ven que todos ocupan su lugar en este marco lingüístico.
00:08:23Importante: estos componentes son interdependientes, no están separados ni aislados.
00:08:30Son interdependientes y están alineados. Si quieren hacer las cosas bien con los sonidos,
00:08:36deben pensar a nivel de palabras. Y si quieren hacerlo bien con sonidos y palabras,
00:08:43también deben tener en cuenta la interacción, la toma de turnos o su detección.
00:08:50Por último, para completar la tarea con éxito, que es la meta del modelo mental, deben integrar todo esto.
00:09:02Sin cualquiera de estos componentes, su agente de voz fallará.
00:09:09Y todo debe estar bien alineado.
00:09:17Además, deben recordar que esto ocurre en una línea de tiempo.
00:09:26Me refiero a que se rastrea en silencio, no como en un chat. En el chat ves el historial de lo dicho
00:09:34en texto, pero con el agente de voz dices algo, el bot responde, conversan
00:09:45y todas las ondas sonoras, la vibración en el aire, desaparecen.
00:09:53Solo queda el modelo mental del usuario, y eso es lo que importa.
00:10:00Los sonidos, palabras e interacciones se esfuman al pronunciarse,
00:10:04pero el modelo mental permanece y se desarrolla con el tiempo.
00:10:09Esto es lo que deben
00:10:12buscar para la satisfacción del usuario.
00:10:16¿Y qué podemos hacer
00:10:19para que el bot cumpla con los estándares del usuario?
00:10:25Lo que podemos hacer incluye elegir buenos modelos de ASR o configuraciones y hacer posprocesamiento,
00:10:34elegir buenos modelos de TTS, configuraciones y preprocesamiento,
00:10:38preparar cuidadosamente el vocabulario que compartirán el bot y el usuario,
00:10:46y gestionar bien la latencia de detección entre turnos y la toma de turnos.
00:10:52Y muy importante: sería genial detectar y gestionar bien las emociones,
00:10:59así como retener el contexto, refiriéndome al contexto de todo esto.
00:11:07Y, sobre todo, debe ser dinámico, porque las cosas cambian a lo largo de la llamada.
00:11:16Así que debemos hacer esta gestión dinámica en la línea de tiempo
00:11:21para distintos tipos de personas.
00:11:24Los niños u otro tipo de personas tendrán expectativas distintas que debemos satisfacer,
00:11:32no solo cuando estén contentos, sino también cuando no lo estén.
00:11:36Solo así se puede buscar una orquestación dinámica y escalable de la IA de voz.
00:11:42Es una labor muy difícil.
00:11:48Decimos que la voz es la vía más natural de comunicación, pero no es fácil;
00:11:54detrás de escena todo funciona gracias a esta orquestación lingüística.
00:11:59Si el bot no es bueno en esto, es un fallo catastrófico.
00:12:07Prestar atención a este marco lingüístico tiene implicaciones comerciales, ya que se pueden
00:12:17reducir la frustración del usuario, las tareas fallidas, el desvío a agentes, las llamadas abandonadas y los fallos silenciosos.
00:12:28En ServiceNow creamos una evaluación de referencia llamada EVA Bench que pueden usar para diagnosticar el estado de su agente de voz.
00:12:43Puntos clave:
00:12:45La IA de voz es una actividad conjunta
00:12:49entre el bot y el usuario, no solo un flujo de proceso.
00:12:54Y debemos atender sus necesidades en múltiples capas en tiempo real.
00:12:59No les he traído una solución rápida hoy, porque no existe tal cosa;
00:13:04la solución está en ustedes y en su sistema.
00:13:10Lo que les he presentado hoy es el marco lingüístico que pueden usar
00:13:16para diagnosticar su sistema y construir sobre él.
00:13:21Pueden probar EVA, pero también aprender lingüística y contratar lingüistas.
00:13:28Otra cosa que quiero recordarles es que
00:13:31las implicaciones comerciales son implicaciones lingüísticas y viceversa
00:13:35en este panorama de la IA de voz,
00:13:37porque la voz es fundamentalmente una experiencia lingüística, humana y cognitiva.
00:13:45Me gustaría plantearles una pregunta a más largo plazo.
00:13:50Los hablantes se adaptan. Estoy segura de que en esta charla que he tenido hoy con ustedes
00:13:59han aprendido algo sobre mí, mi estilo al hablar, mi acento
00:14:05o las palabras que uso. La próxima vez que nos veamos en persona les resultará más cómodo
00:14:12hablar conmigo porque me han prestado atención, ¿verdad? Los hablantes siempre se adaptan, así que el usuario
00:14:18se adaptará a su agente de voz durante la llamada. ¿Está su sistema preparado para que
00:14:27puedan usar mejor su agente de voz la próxima vez?
00:14:31El lenguaje siempre cambia. ¿Está su agente listo para el cambio lingüístico en seis meses o un año?
00:14:44¿Será mejor su agente de voz la próxima vez? Muchas gracias.
00:14:57Muchas gracias.
00:14:57Muchas gracias.
00:14:57Muchas gracias.
00:15:04Gracias.

핵심 요약

El marco lingüístico para la IA de voz exige orquestar de forma dinámica las capas interdependientes de sonidos, palabras, interacción y modelo mental para evitar fallas catastróficas en tiempo real.

하이라이트

  • La comunicación humana funciona como una actividad conjunta donde el modelo mental se actualiza continuamente mientras los sonidos y palabras se esfuman en el aire.

  • Las fallas comunes en la IA de voz ocurren cuando el reconocimiento automático del habla (STT) confunde fonemas similares como 'M' y 'N' o interrumpe la lectura del usuario.

  • El marco lingüístico de voz exige la alineación interdependiente entre cuatro capas: sonidos, palabras, interacción y modelo mental.

  • ServiceNow desarrolló EVA Bench, una evaluación de referencia diseñada para diagnosticar el estado operativo y lingüístico de los agentes de voz.

  • Optimizar la orquestación lingüística en tiempo real reduce el desvío hacia agentes humanos, las tareas fallidas, las llamadas abandonadas y las frustraciones del usuario.

타임라인

Fallas estructurales en la interacción actual de la IA de voz

  • Los usuarios prefieren interactuar con agentes humanos debido a los constantes errores de procesamiento en los sistemas automáticos de voz.
  • Los sistemas de voz actuales fallan al interpretar deletreos simples y confunden fonemas acústicamente cercanos.
  • La interrupción abrupta por parte del bot interrumpe la dinámica natural de la llamada y genera fricción.

Un intento típico de autenticación muestra cómo el procesamiento de voz falla al no distinguir entre consonantes como la 'M' y la 'N'. El problema se agrava cuando el usuario intenta leer códigos o números de cuenta complejos a un ritmo más lento. El sistema interrumpe al usuario antes de que termine, exige repeticiones innecesarias y termina forzando la transferencia de la llamada hacia un operador humano.

La comunicación humana como marco de actividad conjunta

  • La interacción oral entre seres humanos requiere un intercambio bidireccional constante para construir y actualizar modelos mentales compartidos.
  • Las reglas de síntesis de voz (TTS) diseñadas para un solo idioma o acento distorsionan los nombres propios e identidades del usuario.
  • La incapacidad del bot para realizar una aclaración interactiva rompe la expectativa comunicativa del usuario.

Los seres humanos han evolucionado durante miles de años para comunicarse mediante modelos de intercambio continuo de información. Cuando un agente de voz no reconoce un patrón de voz o aplica reglas de pronunciación en inglés americano a nombres de otros orígenes, el flujo de la interacción se quiebra. Si el bot no implementa estrategias de aclaración interactiva frente a un error, el modelo mental compartido se destruye y la tarea fracasa.

Las cuatro capas interdependientes del marco lingüístico

  • El marco lingüístico abarca los canales de escucha y habla divididos en sonidos, palabras, interacción y modelo mental.
  • Las capas del marco lingüístico son estrictamente interdependientes y requieren una alineación simultánea.
  • Los elementos acústicos y léxicos desaparecen al pronunciarse, dejando únicamente el modelo mental persistente en la memoria del usuario.

El canal de escucha requiere reconocimiento de habla (ASR), comprensión de vocabulario, detección oportuna de turnos e inferencia de la intención del usuario. El canal de habla exige pronunciación correcta, selección léxica adecuada, sincronización en las respuestas y entrega de información precisa. Dado que las ondas sonoras se esfuman al instante a diferencia de un chat de texto, la satisfacción del usuario depende exclusivamente de cómo evoluciona su modelo mental a lo largo del tiempo.

Orquestación dinámica e impacto en métricas de negocio

  • La gestión exitosa de un agente de voz requiere ajustar parámetros de latencia, vocabulario y retención de contexto en tiempo real.
  • El rendimiento de un sistema de voz impacta directamente en las métricas de negocio como las llamadas abandonadas y los fallos silenciosos.
  • EVA Bench de ServiceNow permite evaluar y diagnosticar la calidad de los agentes de IA de voz.

Para cumplir con las expectativas de hablantes diversos como niños o usuarios frustrados, el sistema debe adaptar dinámicamente sus modelos de ASR, TTS y procesamiento de vocabulario. Resolver la orquestación lingüística reduce costos operativos al disminuir el desvío a agentes humanos y la tasa de llamadas abandonadas. Las empresas deben preparar sus agentes para adaptarse a la evolución del lenguaje y al comportamiento dinámico de los usuarios a lo largo del tiempo.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기