"Meu nome é... meu nome é...": Um Mapa Linguístico para Agentes de Voz — Midam Kim, ServiceNow

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00Olá a todos. O meu nome é Midam Kim. Sou engenheiro de ML na ServiceNow e vou
00:00:25falar sobre uma estrutura linguística para a IA de Voz. Um breve enquadramento sobre mim, para
00:00:37saberem de onde venho. Como disse, sou engenheiro de ML na ServiceNow, mas
00:00:42também sou investigador, investigador há vários anos, de comunicação de voz no mundo real. O meu
00:00:48lema é fazer linguística e o que vou fazer hoje é dar-vos
00:00:54essa perspetiva da linguística. Já experienciaram falhas na IA de Voz? Sim, como
00:01:05toda a gente. Vou apresentar um exemplo que eu próprio vivenciei. O
00:01:15bot perguntou-me: “Pode, por favor, soletrar o seu primeiro nome?” E eu comecei devagar a soletrar
00:01:22o meu nome: “Sim, é M-I-D-A-M.” E o bot diz: “A confirmar consigo, é M-I-D-A-N?” E eu digo: “Não, é M-I-D-A-M.”
00:01:40E fico um pouco irritado, mais irritado, porque o meu nome é M-I-D-A-M, não M-I-D-A-N. Depois pergunta-me: “Qual é o seu número de conta?” E eu fico confuso. O que é isso do número de conta? Então tento encontrar essa informação. Tento procurar essa informação.
00:02:09Qual deles? Deve ser, e começo devagar a soletrar o número de conta. “É A-X-4-5-1.” E levo o meu tempo porque não estou habituado a ler este número estranho. E o bot interrompe-me. E diz: “Não consegui encontrar o seu registo.” E, sem sequer
00:02:14tentar, pede-me para repetir. “Pode, por favor, repetir?” E eu fico estressado: “Não consegui encontrar o seu registo.” E ele diz: “Não consegui encontrar o seu registo.” E, sem sequer tentar, pede para repetir. “Pode, por favor, repetir?” E eu fico super estressado. E ele diz: “Não consegui encontrar o seu registo.” E depois,
00:02:21A, X, 4, 5, 1, e levo o meu tempo porque não estou habituado a ler este
00:02:30número estranho. O bot interrompe-me e diz: “Não consegui encontrar o seu
00:02:36registo”. E depois, sem sequer tentar, pede-me para repetir. “Pode
00:02:42repetir, por favor?” Fico super irritado e acabo por dizer: “Posso falar
00:02:46com uma pessoa? Já não quero lidar mais contigo.” Este é um padrão muito
00:02:51típico da IA de voz atualmente, infelizmente. Por isso,
00:02:57quero analisar como resolver este problema com a linguística. A IA de voz está
00:03:06em expansão, mas os utilizadores ainda preferem frequentemente agentes humanos em vez de agentes
00:03:11de voz. Como podemos mitigar este problema? Mas, em primeiro lugar, quais são os
00:03:19verdadeiros problemas? Acho que podemos pensar numa estrutura fundamental para
00:03:25compreender esta arquitetura ponta a ponta da IA de voz, que é a linguística. Como
00:03:35todos já sabemos, a comunicação humana é uma atividade conjunta, tal como
00:03:41o que estamos a fazer agora. Eu dou-vos os meus sons e palavras, vocês ouvem-nos
00:03:48e, se for uma conversa, vão dar-me os vossos sons e as vossas
00:03:53palavras. Isto vai alternando através da interação e, neste
00:04:02processo, estamos continuamente a processar e a atualizar os nossos modelos mentais. É uma
00:04:09atividade conjunta na comunicação humana. Gostaria de dizer que, na IA de voz,
00:04:18a comunicação humana também tem de ser uma atividade conjunta como esta, porque é
00:04:25a única coisa que conhecemos sobre a comunicação humana. Como seres humanos, temos
00:04:30evolvido há milhares de anos como comunicadores e é isto que sabemos,
00:04:35pelo que esperamos o mesmo dos bots. Vamos analisar a cena de falha da minha chamada
00:04:45com o agente de voz nesta estrutura. Veem que há um canal de escuta e de fala para cada
00:04:53parte. Eu começo a soletrar o meu primeiro nome e o bot não ouve
00:05:04a diferença entre M e N corretamente. É uma falha de STT ao nível da escuta. Depois, o TTS aplica apenas
00:05:14regras de leitura focadas no inglês ao meu nome. M-I-D-A-M seria lido como M-I-D-A-N na versão
00:05:22de inglês americano. Fico confuso, mas nesta altura sou tolerante porque
00:05:29acontece muito, até com seres humanos. Por isso, tudo bem. Mas quando trouxe
00:05:36a questão do número de conta, como não sei o que é, fico confuso outra vez. Mas sou adaptável, consigo procurar.
00:05:44Encontro o número e começo a lê-lo, mas o STT não reconheceu a unidade de palavra
00:05:52corretamente. Por isso, interrompe-me e acaba por falar por cima de mim. Fico muito irritado.
00:06:06E quando me pede para repetir a mesma informação, fica claro
00:06:14que este bot não está a acompanhar o modelo mental comigo. Muito indelicadamente, nem sequer tenta
00:06:22uma clarificação interativa, que é uma estratégia comum nos seres humanos. Já não quero lidar com isto,
00:06:28por isso digo: “Posso falar com uma pessoa?” Vamos rever a estrutura novamente. Estes são os
00:06:38componentes linguísticos esperados e bem mantidos numa conversa entre humanos.
00:06:47Há canais de escuta, um canal de escuta e um canal de fala, e há diferentes componentes
00:06:52como sons, palavras, interação e modelo mental. O primeiro componente é: o bot reconhece bem a fala
00:06:59do utilizador? Todos estes termos técnicos enquadram-se aqui. Depois, temos este
00:07:09segundo componente, que são as palavras no canal de escuta: o bot entende as palavras do utilizador?
00:07:17O terceiro é: o bot espera pelo momento certo para a sua vez? Isto relaciona-se com a interação no canal de escuta.
00:07:28A última parte é o modelo mental: o bot compreende a intenção do utilizador na parte da escuta?
00:07:38Também podemos passar para o canal de fala. Será sobre a pronúncia, para o som,
00:07:43e também: o bot escolhe as palavras que o utilizador consegue entender?
00:07:53Na parte da interação: o bot fala no momento certo? E, por último, o bot fala com
00:08:01a informação de que o utilizador realmente precisa?
00:08:05Há muitos termos de engenharia, linguística ou ciência cognitiva apresentados aqui.
00:08:13Podem ver agora que todos eles têm o seu devido lugar nesta estrutura linguística.
00:08:23Importante: estes componentes são interdependentes, não são separados ou independentes entre si.
00:08:30São interdependentes e estão alinhados. Quando querem obter bons resultados nos sons,
00:08:36têm de pensar ao nível das palavras. E para ter bons resultados nos sons e palavras,
00:08:43também têm de considerar a interação, como a alternância ou deteção de turnos de fala.
00:08:50Por fim, para alcançar uma boa conclusão da tarefa, que é o objetivo da camada do modelo mental, precisam de ter tudo isto.
00:09:02Sem qualquer um destes componentes, o vosso agente de voz vai falhar.
00:09:09E, finalmente, tudo isto tem de estar bem alinhado.
00:09:17Além disso, têm de ter em mente que isto acontece numa linha do tempo.
00:09:26O que quero dizer com isto é que é acompanhado silenciosamente. Ao contrário do chat, onde veem o histórico do que foi
00:09:34dito em texto, na experiência do agente de voz, vocês dizem algo, o bot diz algo, e há uma troca constante.
00:09:45Reparem em todas estas formas de onda, a vibração no ar... tudo isso desaparece.
00:09:53E apenas o modelo mental do utilizador permanece, e é isso que importa.
00:10:00Sons, palavras e interações desvanecem-se no momento em que são ditos,
00:10:04mas o modelo mental avança e desenvolve-se ao longo do tempo.
00:10:09Isto é o que têm de
00:10:12focar para a satisfação do utilizador.
00:10:16E o que podemos fazer
00:10:19para o bot corresponder aos padrões do utilizador?
00:10:25O que podemos fazer inclui, claro, escolher bons modelos ou configurações de ASR e fazer pós-processamento,
00:10:34escolher bons modelos de TTS, configurações e pré-processamento,
00:10:38e selecionar cuidadosamente o vocabulário que pode ser partilhado entre o bot e o utilizador,
00:10:46além de gerir bem a latência na deteção e na alternância de turnos.
00:10:52E, muito importante, seria excelente conseguirmos uma boa deteção e gestão de emoções
00:10:59e retenção de contexto — e por contexto quero dizer o contexto de tudo isto.
00:11:07E, acima de tudo, tem de ser dinâmico, pois as coisas estão sempre a mudar ao longo da chamada.
00:11:16Teríamos de fazer esta gestão dinamicamente ao longo da linha do tempo
00:11:21para diferentes tipos de pessoas.
00:11:24Crianças ou diferentes tipos de pessoas terão expetativas distintas que precisamos de satisfazer,
00:11:32não apenas quando estão satisfeitas, mas também quando não estão.
00:11:36Só assim se pode alcançar uma orquestração dinâmica e verdadeiramente escalável da IA de voz.
00:11:42É uma tarefa bastante difícil.
00:11:48Dizemos sempre que a voz é a forma de comunicação mais natural, mas na verdade não é fácil.
00:11:54Nos bastidores, tudo se deve a esta orquestração linguística.
00:11:59Quando o vosso bot não é bom nisso, é uma falha catastrófica.
00:12:07Prestar atenção a esta estrutura linguística traz muitas implicações de negócio, pois permite
00:12:17reduzir a frustração do utilizador, falhas nas tarefas, encaminhamento para agentes humanos, chamadas abandonadas ou falhas silenciosas.
00:12:28Na ServiceNow, criámos um bom benchmark ponta a ponta chamado evaBench, que podem usar para diagnosticar o estado do vosso agente de voz.
00:12:43Principais conclusões:
00:12:45A IA de voz é uma atividade conjunta
00:12:49entre o bot e o utilizador, não apenas um fluxo sequencial.
00:12:54E temos de responder às necessidades dos utilizadores em múltiplas camadas em tempo real.
00:12:59Não vos trouxe uma solução pronta hoje, porque isso não existe.
00:13:04A solução está em vocês e no vosso sistema.
00:13:10O que vos trouxe hoje foi a estrutura linguística que podem utilizar
00:13:16para diagnosticar o vosso sistema e construir sobre ela.
00:13:21Podem experimentar o eva, mas também aprender linguística e contratar linguistas.
00:13:28Outro ponto que quero recordar-vos é que
00:13:31as implicações de negócio são implicações linguísticas e vice-versa,
00:13:35neste cenário da IA de voz,
00:13:37porque a voz é fundamentalmente uma experiência linguística, humana e cognitiva.
00:13:45Gostaria de vos fazer uma pergunta a longo prazo.
00:13:50Os falantes adaptam-se. Tenho a certeza de que nesta apresentação hoje
00:13:59aprenderam algo sobre mim, sobre o meu estilo de falar, o meu sotaque,
00:14:05as palavras que utilizo. Da próxima vez que nos encontrarmos pessoalmente, será mais confortável
00:14:12falar comigo porque me prestaram atenção, certo? Os falantes estão sempre a adaptar-se, pelo que o utilizador
00:14:18vai adaptar-se ao vosso agente de voz ao longo da chamada. O vosso sistema está preparado para que eles
00:14:27consigam utilizar melhor o agente de voz da próxima vez?
00:14:31E as línguas mudam constantemente. O vosso agente de voz está preparado para a mudança da linguagem daqui a um ano ou seis meses?
00:14:44O vosso agente de voz estará melhor da próxima vez? Muito obrigado.
00:14:57Muito obrigado.
00:14:57Muito obrigado.
00:14:57Muito obrigado.
00:15:04Obrigado.

Key Takeaway

Construir agentes de voz eficientes exige estruturar a arquitetura em camadas linguísticas interdependentes que alinhem som, vocabulário, alternância de turnos e o modelo mental do utilizador em tempo real.

Highlights

  • A comunicação por IA de voz falha quando os sistemas tratam a conversa como um fluxo sequencial e não como uma atividade conjunta de processamento contínuo.

  • O reconhecimento de voz (STT) e a síntese de fala (TTS) falham frequentemente ao aplicar regras rígidas de pronúncia em inglês para nomes próprios não anglófonos.

  • Sons, palavras e interações desvanecem no momento em que são ditos, permanecendo apenas o modelo mental no utilizador ao longo do tempo.

  • Sistemas de voz eficientes exigem orquestração dinâmica entre reconhecimento de som, vocabulário partilhado, gestão de latência na troca de turnos e retenção de contexto.

  • O evaBench é uma ferramenta de avaliação criada para diagnosticar o estado de desempenho ponta a ponta de agentes de IA de voz.

Timeline

A experiência de falha nos agentes de IA de voz

  • A maioria dos utilizadores prefere o atendimento por agentes humanos devido a falhas recorrentes na IA de voz.
  • Sistemas atuais de STT e TTS cometem erros na diferenciação de fonemas e na leitura correta de nomes não padronizados.
  • A interrupção precoce da fala do utilizador por parte da IA gera frustração e abandono da chamada.

Erros de transcrição ocorrem quando o STT confunde fonemas semelhantes, como 'M' e 'N', no momento em que o utilizador soletra o próprio nome. Modelos de TTS ajustados para o inglês americano leem incorretamente palavras e nomes fora desse padrão. A ausência de estratégias de clarificação interativa faz com que o bot peça repetições sem ajustar a interpretação, levando o utilizador a solicitar atendimento humano.

Comunicação humana como atividade conjunta

  • A comunicação interpessoal funciona como uma atividade de colaboração e atualização contínua de modelos mentais.
  • Os utilizadores esperam que a IA siga a mesma dinâmica de troca contínua desenvolvida pela evolução humana.
  • A incapacidade de rastrear o progresso da conversa destrói a tolerância do utilizador aos erros do sistema.

A fala e a escuta ocorrem em canais bidirecionais onde sons e palavras são trocados para ajustar a compreensão mútua. O ser humano tolera pequenas falhas de pronúncia inicial, mas a tolerância cessa quando o bot perde o contexto do diálogo. Se a IA interrompe o utilizador enquanto este lê dados complexos, a atividade conjunta é interrompida.

A estrutura linguística em camadas para IA de voz

  • A arquitetura de IA de voz divide-se em quatro níveis: som, palavra, interação e modelo mental.
  • As camadas linguísticas são interdependentes e precisam de alinhamento simultâneo para o sucesso do agente.
  • A conclusão de tarefas na camada do modelo mental depende da precisão nas camadas inferiores de som e palavra.

O canal de escuta avalia o reconhecimento de fala, a compreensão do vocabulário, a deteção de turnos e a captação da intenção. O canal de fala cobre a pronúncia do TTS, a seleção de palavras compreensíveis, o tempo de resposta e a relevância da informação entregue. A falha em qualquer uma destas etapas resulta na rutura do fluxo conversacional.

A dimensão temporal e a gestão do modelo mental

  • Diferente do texto em chat, os sinais sonoros da voz desaparecem imediatamente após a emissão.
  • O modelo mental é o único elemento que persiste e evolui ao longo da chamada.
  • Orquestração dinâmica exige gerir latência, reter contexto e adaptar a resposta ao perfil do utilizador.

As ondas sonoras desvanecem no ar, tornando a retenção de contexto crucial para manter o utilizador satisfeito. O sistema precisa de ajustar configurações de ASR e TTS, selecionar vocabulário comum e gerir a latência na alternância de turnos. A adaptação precisa ocorrer em tempo real para lidar com diferentes perfis, como crianças ou utilizadores frustrados.

Impacto no negócio e avaliação com evaBench

  • Erros na estrutura linguística causam chamadas abandonadas, falhas silenciosas e custos com transbordo para humanos.
  • O evaBench permite diagnosticar e medir o desempenho ponta a ponta de agentes de IA de voz.
  • Os falantes e as línguas mudam com o tempo, exigindo sistemas capazes de se adaptar a longo prazo.

A melhoria da arquitetura linguística reduz diretamente taxas de abandono e falhas de transferência de chamadas. A avaliação contínua do sistema com ferramentas como o evaBench ajuda a identificar ruturas no fluxo de conversação. Como os utilizadores adaptam o próprio estilo de fala ao longo do tempo, os agentes de voz precisam de estruturas flexíveis para evoluir com essas mudanças.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video