"Mon nom est... mon nom est..." : une carte linguistique pour les agents vocaux — Midam Kim, ServiceNow

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00Bonjour à tous. Je m'appelle Midam Kim. Je suis ingénieure en ML chez ServiceNow et je vais
00:00:25vous parler d'un cadre linguistique pour l'IA vocale. Voici une brève présentation pour
00:00:37situer mon parcours. Comme je l'ai dit, je suis ingénieure en ML chez ServiceNow, mais je suis
00:00:42aussi chercheuse depuis toujours en communication orale sur le terrain. Ma
00:00:48devise est de faire de la linguistique, et ce que je vais faire aujourd'hui, c'est de vous apporter
00:00:54cet éclairage linguistique. Avez-vous déjà vécu des échecs d'IA vocale ? Oui, comme
00:01:05tout le monde. Je vais présenter un exemple que j'ai vécu moi-même. Alors, le
00:01:15bot m'a demandé : “Pouvez-vous épeler votre prénom ?” J'ai commencé à épeler lentement
00:01:22mon prénom. “Oui, c'est M-I-D-A-M.” Et le bot dit : “Je confirme avec vous, est-ce M-I-D-A-N ?” Et je réponds : “Non, c'est M-I-D-A-M.”
00:01:40Puis je commence à m'énerver un peu plus, parce que mon prénom est M-I-D-A-M, pas M-I-D-A-N. Ensuite, il me demande : “Quel est votre numéro de compte ?” Et là, je deviens confuse. C'est quoi ce numéro de compte ? J'essaie de chercher cette information. J'essaie donc d'en savoir plus.
00:02:09Lequel ? Ce doit être... et je commence à épeler lentement le numéro de compte. C'est A-X-4-5-1. Et je prends mon temps parce que je n'ai pas l'habitude de lire ce numéro bizarre. Et là, le bot me coupe la parole. Il dit : “Je n'ai pas trouvé votre dossier.” Et sans même
00:02:14réessayer, il me demande de répéter. “Pouvez-vous répéter ?” Et je commence à me stresser. “Je n'ai pas trouvé votre dossier.” Et il dit : “Je n'ai pas trouvé votre dossier.” Et sans même réessayer, il me demande de répéter. “Pouvez-vous répéter ?” Et je commence à me stresser. Et il répète : “Je n'ai pas trouvé votre dossier.” Et là,
00:02:21A, X, 4, 5, 1, puis je prends mon temps parce que je ne suis pas habituée à lire ce
00:02:30numéro bizarre, et là le bot me coupe et dit : “Je n'ai pas trouvé votre
00:02:36dossier”, et sans même réessayer, il me demande de le répéter : “Pouvez-vous
00:02:42répéter ?” Et là, je suis hyper agacée et je dis : “Puis-je parler
00:02:46à quelqu'un ? Je ne veux plus avoir affaire à vous.” C'est donc un schéma très
00:02:51classique d'IA vocale malheureusement à ce jour. Je veux juste
00:02:57explorer comment résoudre ce problème grâce à la linguistique. L'IA vocale est
00:03:06en plein essor, mais les utilisateurs préfèrent souvent les agents humains aux agents
00:03:11vocaux. Comment atténuer ce problème ? Et pour commencer, quels sont les
00:03:19vrais problèmes ? Je pense qu'on peut penser à un cadre fondamental pour
00:03:25comprendre cette architecture de bout en bout de l'IA vocale, qu'on appelle la linguistique. Comme
00:03:35nous le savons tous déjà, la communication humaine est une activité conjointe, comme
00:03:41ce que nous faisons actuellement. Je vous donne mes sons et mes mots, vous les
00:03:48entendez, et si c'est une conversation, vous me donnez vos sons et vos
00:03:53mots, et il y a un va-et-vient à travers l'interaction. Et dans
00:04:02ce processus, nous traitons et mettons à jour continuellement nos modèles mentaux. C'est une
00:04:09activité conjointe pour la communication humaine. Et j'aimerais dire que dans l'IA vocale,
00:04:18la communication humaine doit aussi être une activité conjointe comme celle-ci, car c'est la
00:04:25seule chose que nous connaissons. En tant qu'êtres humains, nous avons
00:04:30évolué pendant des milliers d'années en tant que communicateurs, et c'est ce que nous connaissons,
00:04:35donc nous attendons la même chose des bots. Reprenons la scène d'échec de mon appel
00:04:45avec l'agent vocal dans ce cadre. Donc, vous voyez qu'il y a « écouter » et « parler » pour chaque
00:04:53partie. Je commence à épeler mon prénom et le bot n'entend pas la
00:05:04différence entre M et N correctement. C'est un échec de la STT au niveau de l'écoute, puis le TTS applique des
00:05:14règles de lecture centrées sur l'anglais pour mon prénom M-I-D-A-M, qui se lirait M-I-D-A-M dans la version
00:05:22en anglais américain. Je suis confuse, mais cette fois-ci, je suis assez indulgente parce que
00:05:29cela arrive souvent, même avec des humains. Donc ça va, mais quand il a abordé
00:05:36l'histoire du numéro de compte, comme je ne sais pas ce que c'est, je suis à nouveau confuse, mais je suis adaptable, je peux chercher.
00:05:44Je trouve le numéro, je commence à le lire, mais la STT n'a pas reconnu l'unité mot
00:05:52correctement, il me coupe la parole et finit par parler par-dessus moi. Je suis vraiment irritée,
00:06:06et quand il me demande de répéter la même information, il est clair
00:06:14que ce bot ne suit pas le modèle mental avec moi, et très impoliment, il ne tente même pas
00:06:22de clarification interactive, ce qui est une stratégie courante chez les humains. Je ne veux plus gérer ça,
00:06:28alors je dis : “Puis-je parler à quelqu'un ?” Reprenons le cadre : voici les
00:06:38composantes linguistiques attendues et bien maintenues dans une conversation d'humain à humain.
00:06:47Il y a un canal d'écoute et un canal de parole, et différentes composantes
00:06:52comme les sons, les mots, l'interaction et le modèle mental. La première composante est : le bot reconnaît-il bien
00:06:59la parole de l'utilisateur ? Tous ces termes techniques entrent là-dedans. Ensuite, il y aura cette
00:07:09deuxième composante qui concerne les mots dans le canal d'écoute : le bot comprend-il les mots de l'utilisateur ?
00:07:17La troisième est : le bot attend-il le bon moment pour prendre la parole ? Cela concerne l'interaction dans le canal d'écoute.
00:07:28Et la dernière partie est le modèle mental : le bot comprend-il l'intention de l'utilisateur du côté de l'écoute ?
00:07:38Ensuite, on passe au canal de parole : il s'agira de la prononciation pour le son,
00:07:43et aussi : le bot comprend-il les mots... le bot choisit-il des mots que l'utilisateur peut comprendre ?
00:07:53Et dans la partie interaction : le bot parle-t-il au bon moment ? Enfin, le bot transmet-il
00:08:01l'information dont l'utilisateur a réellement besoin ?
00:08:05Il y a beaucoup de termes issus de l'ingénierie, de la linguistique ou des sciences cognitives qui sont présents ici.
00:08:13Vous voyez maintenant que chacun d'eux a sa propre place dans ce cadre linguistique.
00:08:23Et surtout, ces composantes sont interdépendantes, pas séparées ni indépendantes les unes des autres.
00:08:30Elles sont interdépendantes et alignées. Si vous voulez un bon résultat sur les sons,
00:08:36vous devez penser au niveau des mots, et pour obtenir de bons résultats sur les sons et les mots,
00:08:43vous devez aussi prendre en compte l'interaction, comme la prise ou la détection de tour de parole.
00:08:50Enfin, pour avoir une bonne résolution de tâche, qui est l'objectif de la couche du modèle mental, vous devez réunir tout cela.
00:09:02Sans l'une de ces composantes, votre agent vocal échouera.
00:09:09Enfin, tout cela doit être parfaitement aligné.
00:09:17De plus, vous devez garder à l'esprit que tout cela se déroule au fil du temps.
00:09:26Ce que je veux dire par là, c'est que c'est suivi silencieusement. Contrairement au chat où vous voyez l'historique de ce qui a été dit
00:09:34sous forme de texte, dans l'expérience avec un agent vocal, vous dites quelque chose, le bot répond, il y a un va-et-vient,
00:09:45puis toutes ces formes d'ondes, les vibrations dans l'air, disparaissent.
00:09:53Il ne reste plus que le modèle mental de l'utilisateur, et c'est ce qui compte.
00:10:00Les sons, les mots et les interactions s'évanouissent dès qu'ils sont prononcés,
00:10:04mais le modèle mental persiste et se développe au fil du temps.
00:10:09C'est donc ce que vous devez
00:10:12viser pour la satisfaction de l'utilisateur.
00:10:16Alors, que pouvons-nous faire
00:10:19pour que le bot réponde aux exigences de l'utilisateur ?
00:10:25Ce qu'on peut faire inclut bien sûr le choix de bons modèles ASR ou de bonnes configurations, et du post-traitement,
00:10:34choisir de bons modèles TTS, leurs configurations et le prétraitement,
00:10:38sélectionner soigneusement le vocabulaire partagé entre le bot et l'utilisateur,
00:10:46bien gérer la latence de détection de tour de parole et l'alternance des tours,
00:10:52et très important, ce serait formidable de bien détecter et gérer les émotions,
00:10:59ainsi que la rétention du contexte, et par contexte, j'entends le contexte sur tout cela.
00:11:07Et surtout, cela doit être dynamique car les choses changent continuellement tout au long de l'appel.
00:11:16Il faut donc faire cette gestion de manière dynamique au fil du temps,
00:11:21pour différents types de personnes.
00:11:24Les enfants ou d'autres profils auront des attentes différentes qu'il faudra satisfaire,
00:11:32pas seulement lorsqu'ils sont contents, mais aussi quand ils ne le sont pas.
00:11:36C'est seulement ainsi qu'on peut viser une orchestration dynamique et vraiment évolutive de l'IA vocale.
00:11:42C'est donc un travail très difficile.
00:11:48On dit toujours que la voix est le moyen de communication le plus naturel, mais ce n'est pas si simple.
00:11:54En coulisses, c'est grâce à cette orchestration linguistique.
00:11:59Si votre bot ne la maîtrise pas, c'est un échec catastrophique.
00:12:07Prêter attention à ce cadre linguistique a d'importantes retombées commerciales, car vous pouvez
00:12:17réduire la frustration des utilisateurs, les échecs de tâches, le transfert vers un agent humain, les appels abandonnés ou les échecs silencieux.
00:12:28Chez ServiceNow, nous avons créé un bon benchmark de bout en bout nommé EVA Bench. Vous pouvez l'essayer pour évaluer votre agent vocal.
00:12:43Ce qu'il faut retenir :
00:12:45L'IA vocale est une activité conjointe
00:12:49entre le bot et l'utilisateur, pas un simple pipeline,
00:12:54et nous devons répondre aux besoins des utilisateurs sur plusieurs niveaux en temps réel.
00:12:59Ce n'est pas comme si je vous apportais une solution miracle aujourd'hui, car cela n'existe pas.
00:13:04La solution réside en vous et dans votre système.
00:13:10Ce que je vous ai apporté aujourd'hui, c'est le cadre linguistique que vous pouvez tester
00:13:16pour évaluer votre système et sur lequel vous pouvez le concevoir.
00:13:21Vous pouvez tester EVA, mais aussi apprendre la linguistique et recruter des linguistes.
00:13:28Une autre chose que je souhaite vous rappeler,
00:13:31c'est que les enjeux commerciaux sont des enjeux linguistiques, et inversement,
00:13:35dans ce domaine de l'IA vocale,
00:13:37car la voix est fondamentalement une expérience linguistique, très humaine et cognitive.
00:13:45J'aimerais vous poser une question à plus long terme.
00:13:50Les locuteurs s'adaptent. Je suis sûre qu'au cours de notre échange d'aujourd'hui,
00:13:59vous avez appris des choses sur moi, mon style d'élocution, mon accent,
00:14:05le type de mots que j'utilise. La prochaine fois qu'on se verra en personne, vous serez plus à l'aise pour
00:14:12me parler, parce que vous m'avez prêté attention, n'est-ce pas ? Les locuteurs s'adaptent toujours. L'utilisateur
00:14:18s'adaptera à votre agent vocal tout au long de l'appel. Votre système est-il prêt pour qu'il
00:14:27l'utilise mieux la prochaine fois ?
00:14:31Et les langues évoluent constamment. Votre agent vocal est-il prêt pour l'évolution de la langue d'ici un an, voire six mois ?
00:14:44Votre agent vocal sera-t-il meilleur la prochaine fois ? Merci.
00:14:57Merci.
00:14:57Merci.
00:14:57Merci.
00:15:04Merci.

Key Takeaway

L'IA vocale exige une orchestration linguistique dynamique et simultanée sur les composantes de la parole, de la prise de tour et de la gestion du modèle mental pour éviter les échecs d'interaction.

Highlights

  • La communication humaine repose sur l'interaction continue et la mise à jour constante d'un modèle mental partagé.

  • L'échec des agents vocaux actuels découle de la rupture entre les canaux d'écoute et de parole aux niveaux phonétique, lexical et conversationnel.

  • Contrairement au texte écrit, les signaux sonores s'évanouissent immédiatement et seul le modèle mental de l'utilisateur persiste après chaque échange.

  • L'alignement dynamique des composantes linguistiques réduit le taux d'abandon, les échecs de tâches et le transfert vers des agents humains.

  • Le framework EVA Bench de ServiceNow offre un protocole de test de bout en bout pour mesurer la performance réelle des agents vocaux.

Timeline

Limites des architectures vocales actuelles

  • Les erreurs de reconnaissance phonétique sur des prénoms comme M-I-D-A-M dégradent immédiatement l'expérience utilisateur.
  • L'absence de détection précise des pauses entraîne des interruptions intempestives pendant la saisie d'identifiants.
  • Les agents vocaux échouent à initier des stratégies de clarification interactive face aux erreurs de transmission.

Une séquence de test standard révèle une accumulation de défaillances. Le module STT confond les consonnes nasales, puis le moteur TTS applique une prosodie inadéquate issue de l'anglais américain. Lorsque la vitesse d'élocution ralentit pour dicter un code alphanumérique, l'absence de gestion du tour de parole coupe l'utilisateur, provoquant une rupture d'interaction et le rejet de l'agent.

Structure du cadre linguistique bidirectionnel

  • La communication orale s'articule autour de deux canaux distincts : l'écoute et la parole.
  • Chaque canal intègre quatre niveaux indissociables : les sons, les mots, l'interaction et le modèle mental.
  • L'optimisation isolée d'un seul composant technique provoque la défaillance globale du système.

L'architecture conversationnelle s'appuie sur la synchronisation stricte entre la perception et la production. Côté écoute, le système doit traiter la reconnaissance acoustique, la compréhension lexicale, la détection des tours de parole et l'extraction d'intention. Côté parole, le système gère la synthèse phonétique, le choix du vocabulaire cible, le calage temporel des réponses et la transmission précise de l'information.

Évanescence du signal et persistance du modèle mental

  • Les signaux acoustiques disparaissent de la mémoire immédiate dès leur émission.
  • Le modèle mental constitue la seule trace cognitive conservée par l'utilisateur au cours de la conversation.
  • La résolution efficace des tâches dépend de l'alignement continu des états mentaux de l'humain et de la machine.

À l'opposé du texte écrit où l'historique demeure lisible, la voix s'appuie sur des ondes mécaniques éphémères. Dès qu'un mot est prononcé, le signal physique s'éteint. La satisfaction de l'utilisateur repose entièrement sur l'évolution du modèle mental résiduel constuit au fil de l'interaction.

Orchestration dynamique et métriques métriques d'impact commercial

  • Le réglage statique des modèles ASR et TTS s'avère insuffisant pour gérer la variabilité des profils utilisateurs.
  • L'implémentation du cadre linguistique diminue directement les transferts vers les centres de contact.
  • Le benchmark EVA Bench mesure la qualité globale des agents vocaux en conditions réelles.

La gestion opérationnelle des agents vocaux nécessite un ajustement dynamique en temps réel, incluant la latence du dialogue, le traitement du contexte et la prise en compte des états émotionnels. Une orchestration linguistique réussie se traduit par une baisse mesurable des appels abandonnés et des échecs silencieux. L'adaptation permanente aux variations de langue et aux caractéristiques des locuteurs conditionne la viabilité technique des systèmes.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video