"Meu nome é... meu nome é...": Um Mapa Linguístico para Agentes de Voz — Midam Kim, ServiceNow

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Olá a todos. O meu nome é Midam Kim. Sou engenheiro de ML na ServiceNow e vou
00:00:25falar sobre uma estrutura linguística para a IA de Voz. Um breve enquadramento sobre mim, para
00:00:37saberem de onde venho. Como disse, sou engenheiro de ML na ServiceNow, mas
00:00:42também sou investigador, investigador há vários anos, de comunicação de voz no mundo real. O meu
00:00:48lema é fazer linguística e o que vou fazer hoje é dar-vos
00:00:54essa perspetiva da linguística. Já experienciaram falhas na IA de Voz? Sim, como
00:01:05toda a gente. Vou apresentar um exemplo que eu próprio vivenciei. O
00:01:15bot perguntou-me: “Pode, por favor, soletrar o seu primeiro nome?” E eu comecei devagar a soletrar
00:01:22o meu nome: “Sim, é M-I-D-A-M.” E o bot diz: “A confirmar consigo, é M-I-D-A-N?” E eu digo: “Não, é M-I-D-A-M.”
00:01:40E fico um pouco irritado, mais irritado, porque o meu nome é M-I-D-A-M, não M-I-D-A-N. Depois pergunta-me: “Qual é o seu número de conta?” E eu fico confuso. O que é isso do número de conta? Então tento encontrar essa informação. Tento procurar essa informação.
00:02:09Qual deles? Deve ser, e começo devagar a soletrar o número de conta. “É A-X-4-5-1.” E levo o meu tempo porque não estou habituado a ler este número estranho. E o bot interrompe-me. E diz: “Não consegui encontrar o seu registo.” E, sem sequer
00:02:14tentar, pede-me para repetir. “Pode, por favor, repetir?” E eu fico estressado: “Não consegui encontrar o seu registo.” E ele diz: “Não consegui encontrar o seu registo.” E, sem sequer tentar, pede para repetir. “Pode, por favor, repetir?” E eu fico super estressado. E ele diz: “Não consegui encontrar o seu registo.” E depois,
00:02:21A, X, 4, 5, 1, e levo o meu tempo porque não estou habituado a ler este
00:02:30número estranho. O bot interrompe-me e diz: “Não consegui encontrar o seu
00:02:36registo”. E depois, sem sequer tentar, pede-me para repetir. “Pode
00:02:42repetir, por favor?” Fico super irritado e acabo por dizer: “Posso falar
00:02:46com uma pessoa? Já não quero lidar mais contigo.” Este é um padrão muito
00:02:51típico da IA de voz atualmente, infelizmente. Por isso,
00:02:57quero analisar como resolver este problema com a linguística. A IA de voz está
00:03:06em expansão, mas os utilizadores ainda preferem frequentemente agentes humanos em vez de agentes
00:03:11de voz. Como podemos mitigar este problema? Mas, em primeiro lugar, quais são os
00:03:19verdadeiros problemas? Acho que podemos pensar numa estrutura fundamental para
00:03:25compreender esta arquitetura ponta a ponta da IA de voz, que é a linguística. Como
00:03:35todos já sabemos, a comunicação humana é uma atividade conjunta, tal como
00:03:41o que estamos a fazer agora. Eu dou-vos os meus sons e palavras, vocês ouvem-nos
00:03:48e, se for uma conversa, vão dar-me os vossos sons e as vossas
00:03:53palavras. Isto vai alternando através da interação e, neste
00:04:02processo, estamos continuamente a processar e a atualizar os nossos modelos mentais. É uma
00:04:09atividade conjunta na comunicação humana. Gostaria de dizer que, na IA de voz,
00:04:18a comunicação humana também tem de ser uma atividade conjunta como esta, porque é
00:04:25a única coisa que conhecemos sobre a comunicação humana. Como seres humanos, temos
00:04:30evolvido há milhares de anos como comunicadores e é isto que sabemos,
00:04:35pelo que esperamos o mesmo dos bots. Vamos analisar a cena de falha da minha chamada
00:04:45com o agente de voz nesta estrutura. Veem que há um canal de escuta e de fala para cada
00:04:53parte. Eu começo a soletrar o meu primeiro nome e o bot não ouve
00:05:04a diferença entre M e N corretamente. É uma falha de STT ao nível da escuta. Depois, o TTS aplica apenas
00:05:14regras de leitura focadas no inglês ao meu nome. M-I-D-A-M seria lido como M-I-D-A-N na versão
00:05:22de inglês americano. Fico confuso, mas nesta altura sou tolerante porque
00:05:29acontece muito, até com seres humanos. Por isso, tudo bem. Mas quando trouxe
00:05:36a questão do número de conta, como não sei o que é, fico confuso outra vez. Mas sou adaptável, consigo procurar.
00:05:44Encontro o número e começo a lê-lo, mas o STT não reconheceu a unidade de palavra
00:05:52corretamente. Por isso, interrompe-me e acaba por falar por cima de mim. Fico muito irritado.
00:06:06E quando me pede para repetir a mesma informação, fica claro
00:06:14que este bot não está a acompanhar o modelo mental comigo. Muito indelicadamente, nem sequer tenta
00:06:22uma clarificação interativa, que é uma estratégia comum nos seres humanos. Já não quero lidar com isto,
00:06:28por isso digo: “Posso falar com uma pessoa?” Vamos rever a estrutura novamente. Estes são os
00:06:38componentes linguísticos esperados e bem mantidos numa conversa entre humanos.
00:06:47Há canais de escuta, um canal de escuta e um canal de fala, e há diferentes componentes
00:06:52como sons, palavras, interação e modelo mental. O primeiro componente é: o bot reconhece bem a fala
00:06:59do utilizador? Todos estes termos técnicos enquadram-se aqui. Depois, temos este
00:07:09segundo componente, que são as palavras no canal de escuta: o bot entende as palavras do utilizador?
00:07:17O terceiro é: o bot espera pelo momento certo para a sua vez? Isto relaciona-se com a interação no canal de escuta.
00:07:28A última parte é o modelo mental: o bot compreende a intenção do utilizador na parte da escuta?
00:07:38Também podemos passar para o canal de fala. Será sobre a pronúncia, para o som,
00:07:43e também: o bot escolhe as palavras que o utilizador consegue entender?
00:07:53Na parte da interação: o bot fala no momento certo? E, por último, o bot fala com
00:08:01a informação de que o utilizador realmente precisa?
00:08:05Há muitos termos de engenharia, linguística ou ciência cognitiva apresentados aqui.
00:08:13Podem ver agora que todos eles têm o seu devido lugar nesta estrutura linguística.
00:08:23Importante: estes componentes são interdependentes, não são separados ou independentes entre si.
00:08:30São interdependentes e estão alinhados. Quando querem obter bons resultados nos sons,
00:08:36têm de pensar ao nível das palavras. E para ter bons resultados nos sons e palavras,
00:08:43também têm de considerar a interação, como a alternância ou deteção de turnos de fala.
00:08:50Por fim, para alcançar uma boa conclusão da tarefa, que é o objetivo da camada do modelo mental, precisam de ter tudo isto.
00:09:02Sem qualquer um destes componentes, o vosso agente de voz vai falhar.
00:09:09E, finalmente, tudo isto tem de estar bem alinhado.
00:09:17Além disso, têm de ter em mente que isto acontece numa linha do tempo.
00:09:26O que quero dizer com isto é que é acompanhado silenciosamente. Ao contrário do chat, onde veem o histórico do que foi
00:09:34dito em texto, na experiência do agente de voz, vocês dizem algo, o bot diz algo, e há uma troca constante.
00:09:45Reparem em todas estas formas de onda, a vibração no ar... tudo isso desaparece.
00:09:53E apenas o modelo mental do utilizador permanece, e é isso que importa.
00:10:00Sons, palavras e interações desvanecem-se no momento em que são ditos,
00:10:04mas o modelo mental avança e desenvolve-se ao longo do tempo.
00:10:09Isto é o que têm de
00:10:12focar para a satisfação do utilizador.
00:10:16E o que podemos fazer
00:10:19para o bot corresponder aos padrões do utilizador?
00:10:25O que podemos fazer inclui, claro, escolher bons modelos ou configurações de ASR e fazer pós-processamento,
00:10:34escolher bons modelos de TTS, configurações e pré-processamento,
00:10:38e selecionar cuidadosamente o vocabulário que pode ser partilhado entre o bot e o utilizador,
00:10:46além de gerir bem a latência na deteção e na alternância de turnos.
00:10:52E, muito importante, seria excelente conseguirmos uma boa deteção e gestão de emoções
00:10:59e retenção de contexto — e por contexto quero dizer o contexto de tudo isto.
00:11:07E, acima de tudo, tem de ser dinâmico, pois as coisas estão sempre a mudar ao longo da chamada.
00:11:16Teríamos de fazer esta gestão dinamicamente ao longo da linha do tempo
00:11:21para diferentes tipos de pessoas.
00:11:24Crianças ou diferentes tipos de pessoas terão expetativas distintas que precisamos de satisfazer,
00:11:32não apenas quando estão satisfeitas, mas também quando não estão.
00:11:36Só assim se pode alcançar uma orquestração dinâmica e verdadeiramente escalável da IA de voz.
00:11:42É uma tarefa bastante difícil.
00:11:48Dizemos sempre que a voz é a forma de comunicação mais natural, mas na verdade não é fácil.
00:11:54Nos bastidores, tudo se deve a esta orquestração linguística.
00:11:59Quando o vosso bot não é bom nisso, é uma falha catastrófica.
00:12:07Prestar atenção a esta estrutura linguística traz muitas implicações de negócio, pois permite
00:12:17reduzir a frustração do utilizador, falhas nas tarefas, encaminhamento para agentes humanos, chamadas abandonadas ou falhas silenciosas.
00:12:28Na ServiceNow, criámos um bom benchmark ponta a ponta chamado evaBench, que podem usar para diagnosticar o estado do vosso agente de voz.
00:12:43Principais conclusões:
00:12:45A IA de voz é uma atividade conjunta
00:12:49entre o bot e o utilizador, não apenas um fluxo sequencial.
00:12:54E temos de responder às necessidades dos utilizadores em múltiplas camadas em tempo real.
00:12:59Não vos trouxe uma solução pronta hoje, porque isso não existe.
00:13:04A solução está em vocês e no vosso sistema.
00:13:10O que vos trouxe hoje foi a estrutura linguística que podem utilizar
00:13:16para diagnosticar o vosso sistema e construir sobre ela.
00:13:21Podem experimentar o eva, mas também aprender linguística e contratar linguistas.
00:13:28Outro ponto que quero recordar-vos é que
00:13:31as implicações de negócio são implicações linguísticas e vice-versa,
00:13:35neste cenário da IA de voz,
00:13:37porque a voz é fundamentalmente uma experiência linguística, humana e cognitiva.
00:13:45Gostaria de vos fazer uma pergunta a longo prazo.
00:13:50Os falantes adaptam-se. Tenho a certeza de que nesta apresentação hoje
00:13:59aprenderam algo sobre mim, sobre o meu estilo de falar, o meu sotaque,
00:14:05as palavras que utilizo. Da próxima vez que nos encontrarmos pessoalmente, será mais confortável
00:14:12falar comigo porque me prestaram atenção, certo? Os falantes estão sempre a adaptar-se, pelo que o utilizador
00:14:18vai adaptar-se ao vosso agente de voz ao longo da chamada. O vosso sistema está preparado para que eles
00:14:27consigam utilizar melhor o agente de voz da próxima vez?
00:14:31E as línguas mudam constantemente. O vosso agente de voz está preparado para a mudança da linguagem daqui a um ano ou seis meses?
00:14:44O vosso agente de voz estará melhor da próxima vez? Muito obrigado.
00:14:57Muito obrigado.
00:14:57Muito obrigado.
00:14:57Muito obrigado.
00:15:04Obrigado.

핵심 요약

Construir agentes de voz eficientes exige estruturar a arquitetura em camadas linguísticas interdependentes que alinhem som, vocabulário, alternância de turnos e o modelo mental do utilizador em tempo real.

하이라이트

  • A comunicação por IA de voz falha quando os sistemas tratam a conversa como um fluxo sequencial e não como uma atividade conjunta de processamento contínuo.

  • O reconhecimento de voz (STT) e a síntese de fala (TTS) falham frequentemente ao aplicar regras rígidas de pronúncia em inglês para nomes próprios não anglófonos.

  • Sons, palavras e interações desvanecem no momento em que são ditos, permanecendo apenas o modelo mental no utilizador ao longo do tempo.

  • Sistemas de voz eficientes exigem orquestração dinâmica entre reconhecimento de som, vocabulário partilhado, gestão de latência na troca de turnos e retenção de contexto.

  • O evaBench é uma ferramenta de avaliação criada para diagnosticar o estado de desempenho ponta a ponta de agentes de IA de voz.

타임라인

A experiência de falha nos agentes de IA de voz

  • A maioria dos utilizadores prefere o atendimento por agentes humanos devido a falhas recorrentes na IA de voz.
  • Sistemas atuais de STT e TTS cometem erros na diferenciação de fonemas e na leitura correta de nomes não padronizados.
  • A interrupção precoce da fala do utilizador por parte da IA gera frustração e abandono da chamada.

Erros de transcrição ocorrem quando o STT confunde fonemas semelhantes, como 'M' e 'N', no momento em que o utilizador soletra o próprio nome. Modelos de TTS ajustados para o inglês americano leem incorretamente palavras e nomes fora desse padrão. A ausência de estratégias de clarificação interativa faz com que o bot peça repetições sem ajustar a interpretação, levando o utilizador a solicitar atendimento humano.

Comunicação humana como atividade conjunta

  • A comunicação interpessoal funciona como uma atividade de colaboração e atualização contínua de modelos mentais.
  • Os utilizadores esperam que a IA siga a mesma dinâmica de troca contínua desenvolvida pela evolução humana.
  • A incapacidade de rastrear o progresso da conversa destrói a tolerância do utilizador aos erros do sistema.

A fala e a escuta ocorrem em canais bidirecionais onde sons e palavras são trocados para ajustar a compreensão mútua. O ser humano tolera pequenas falhas de pronúncia inicial, mas a tolerância cessa quando o bot perde o contexto do diálogo. Se a IA interrompe o utilizador enquanto este lê dados complexos, a atividade conjunta é interrompida.

A estrutura linguística em camadas para IA de voz

  • A arquitetura de IA de voz divide-se em quatro níveis: som, palavra, interação e modelo mental.
  • As camadas linguísticas são interdependentes e precisam de alinhamento simultâneo para o sucesso do agente.
  • A conclusão de tarefas na camada do modelo mental depende da precisão nas camadas inferiores de som e palavra.

O canal de escuta avalia o reconhecimento de fala, a compreensão do vocabulário, a deteção de turnos e a captação da intenção. O canal de fala cobre a pronúncia do TTS, a seleção de palavras compreensíveis, o tempo de resposta e a relevância da informação entregue. A falha em qualquer uma destas etapas resulta na rutura do fluxo conversacional.

A dimensão temporal e a gestão do modelo mental

  • Diferente do texto em chat, os sinais sonoros da voz desaparecem imediatamente após a emissão.
  • O modelo mental é o único elemento que persiste e evolui ao longo da chamada.
  • Orquestração dinâmica exige gerir latência, reter contexto e adaptar a resposta ao perfil do utilizador.

As ondas sonoras desvanecem no ar, tornando a retenção de contexto crucial para manter o utilizador satisfeito. O sistema precisa de ajustar configurações de ASR e TTS, selecionar vocabulário comum e gerir a latência na alternância de turnos. A adaptação precisa ocorrer em tempo real para lidar com diferentes perfis, como crianças ou utilizadores frustrados.

Impacto no negócio e avaliação com evaBench

  • Erros na estrutura linguística causam chamadas abandonadas, falhas silenciosas e custos com transbordo para humanos.
  • O evaBench permite diagnosticar e medir o desempenho ponta a ponta de agentes de IA de voz.
  • Os falantes e as línguas mudam com o tempo, exigindo sistemas capazes de se adaptar a longo prazo.

A melhoria da arquitetura linguística reduz diretamente taxas de abandono e falhas de transferência de chamadas. A avaliação contínua do sistema com ferramentas como o evaBench ajuda a identificar ruturas no fluxo de conversação. Como os utilizadores adaptam o próprio estilo de fala ao longo do tempo, os agentes de voz precisam de estruturas flexíveis para evoluir com essas mudanças.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기