"Mon nom est... mon nom est..." : une carte linguistique pour les agents vocaux — Midam Kim, ServiceNow
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00Bonjour à tous. Je m'appelle Midam Kim. Je suis ingénieure en ML chez ServiceNow et je vais
00:00:25vous parler d'un cadre linguistique pour l'IA vocale. Voici une brève présentation pour
00:00:37situer mon parcours. Comme je l'ai dit, je suis ingénieure en ML chez ServiceNow, mais je suis
00:00:42aussi chercheuse depuis toujours en communication orale sur le terrain. Ma
00:00:48devise est de faire de la linguistique, et ce que je vais faire aujourd'hui, c'est de vous apporter
00:00:54cet éclairage linguistique. Avez-vous déjà vécu des échecs d'IA vocale ? Oui, comme
00:01:05tout le monde. Je vais présenter un exemple que j'ai vécu moi-même. Alors, le
00:01:15bot m'a demandé : “Pouvez-vous épeler votre prénom ?” J'ai commencé à épeler lentement
00:01:22mon prénom. “Oui, c'est M-I-D-A-M.” Et le bot dit : “Je confirme avec vous, est-ce M-I-D-A-N ?” Et je réponds : “Non, c'est M-I-D-A-M.”
00:01:40Puis je commence à m'énerver un peu plus, parce que mon prénom est M-I-D-A-M, pas M-I-D-A-N. Ensuite, il me demande : “Quel est votre numéro de compte ?” Et là, je deviens confuse. C'est quoi ce numéro de compte ? J'essaie de chercher cette information. J'essaie donc d'en savoir plus.
00:02:09Lequel ? Ce doit être... et je commence à épeler lentement le numéro de compte. C'est A-X-4-5-1. Et je prends mon temps parce que je n'ai pas l'habitude de lire ce numéro bizarre. Et là, le bot me coupe la parole. Il dit : “Je n'ai pas trouvé votre dossier.” Et sans même
00:02:14réessayer, il me demande de répéter. “Pouvez-vous répéter ?” Et je commence à me stresser. “Je n'ai pas trouvé votre dossier.” Et il dit : “Je n'ai pas trouvé votre dossier.” Et sans même réessayer, il me demande de répéter. “Pouvez-vous répéter ?” Et je commence à me stresser. Et il répète : “Je n'ai pas trouvé votre dossier.” Et là,
00:02:21A, X, 4, 5, 1, puis je prends mon temps parce que je ne suis pas habituée à lire ce
00:02:30numéro bizarre, et là le bot me coupe et dit : “Je n'ai pas trouvé votre
00:02:36dossier”, et sans même réessayer, il me demande de le répéter : “Pouvez-vous
00:02:42répéter ?” Et là, je suis hyper agacée et je dis : “Puis-je parler
00:02:46à quelqu'un ? Je ne veux plus avoir affaire à vous.” C'est donc un schéma très
00:02:51classique d'IA vocale malheureusement à ce jour. Je veux juste
00:02:57explorer comment résoudre ce problème grâce à la linguistique. L'IA vocale est
00:03:06en plein essor, mais les utilisateurs préfèrent souvent les agents humains aux agents
00:03:11vocaux. Comment atténuer ce problème ? Et pour commencer, quels sont les
00:03:19vrais problèmes ? Je pense qu'on peut penser à un cadre fondamental pour
00:03:25comprendre cette architecture de bout en bout de l'IA vocale, qu'on appelle la linguistique. Comme
00:03:35nous le savons tous déjà, la communication humaine est une activité conjointe, comme
00:03:41ce que nous faisons actuellement. Je vous donne mes sons et mes mots, vous les
00:03:48entendez, et si c'est une conversation, vous me donnez vos sons et vos
00:03:53mots, et il y a un va-et-vient à travers l'interaction. Et dans
00:04:02ce processus, nous traitons et mettons à jour continuellement nos modèles mentaux. C'est une
00:04:09activité conjointe pour la communication humaine. Et j'aimerais dire que dans l'IA vocale,
00:04:18la communication humaine doit aussi être une activité conjointe comme celle-ci, car c'est la
00:04:25seule chose que nous connaissons. En tant qu'êtres humains, nous avons
00:04:30évolué pendant des milliers d'années en tant que communicateurs, et c'est ce que nous connaissons,
00:04:35donc nous attendons la même chose des bots. Reprenons la scène d'échec de mon appel
00:04:45avec l'agent vocal dans ce cadre. Donc, vous voyez qu'il y a « écouter » et « parler » pour chaque
00:04:53partie. Je commence à épeler mon prénom et le bot n'entend pas la
00:05:04différence entre M et N correctement. C'est un échec de la STT au niveau de l'écoute, puis le TTS applique des
00:05:14règles de lecture centrées sur l'anglais pour mon prénom M-I-D-A-M, qui se lirait M-I-D-A-M dans la version
00:05:22en anglais américain. Je suis confuse, mais cette fois-ci, je suis assez indulgente parce que
00:05:29cela arrive souvent, même avec des humains. Donc ça va, mais quand il a abordé
00:05:36l'histoire du numéro de compte, comme je ne sais pas ce que c'est, je suis à nouveau confuse, mais je suis adaptable, je peux chercher.
00:05:44Je trouve le numéro, je commence à le lire, mais la STT n'a pas reconnu l'unité mot
00:05:52correctement, il me coupe la parole et finit par parler par-dessus moi. Je suis vraiment irritée,
00:06:06et quand il me demande de répéter la même information, il est clair
00:06:14que ce bot ne suit pas le modèle mental avec moi, et très impoliment, il ne tente même pas
00:06:22de clarification interactive, ce qui est une stratégie courante chez les humains. Je ne veux plus gérer ça,
00:06:28alors je dis : “Puis-je parler à quelqu'un ?” Reprenons le cadre : voici les
00:06:38composantes linguistiques attendues et bien maintenues dans une conversation d'humain à humain.
00:06:47Il y a un canal d'écoute et un canal de parole, et différentes composantes
00:06:52comme les sons, les mots, l'interaction et le modèle mental. La première composante est : le bot reconnaît-il bien
00:06:59la parole de l'utilisateur ? Tous ces termes techniques entrent là-dedans. Ensuite, il y aura cette
00:07:09deuxième composante qui concerne les mots dans le canal d'écoute : le bot comprend-il les mots de l'utilisateur ?
00:07:17La troisième est : le bot attend-il le bon moment pour prendre la parole ? Cela concerne l'interaction dans le canal d'écoute.
00:07:28Et la dernière partie est le modèle mental : le bot comprend-il l'intention de l'utilisateur du côté de l'écoute ?
00:07:38Ensuite, on passe au canal de parole : il s'agira de la prononciation pour le son,
00:07:43et aussi : le bot comprend-il les mots... le bot choisit-il des mots que l'utilisateur peut comprendre ?
00:07:53Et dans la partie interaction : le bot parle-t-il au bon moment ? Enfin, le bot transmet-il
00:08:01l'information dont l'utilisateur a réellement besoin ?
00:08:05Il y a beaucoup de termes issus de l'ingénierie, de la linguistique ou des sciences cognitives qui sont présents ici.
00:08:13Vous voyez maintenant que chacun d'eux a sa propre place dans ce cadre linguistique.
00:08:23Et surtout, ces composantes sont interdépendantes, pas séparées ni indépendantes les unes des autres.
00:08:30Elles sont interdépendantes et alignées. Si vous voulez un bon résultat sur les sons,
00:08:36vous devez penser au niveau des mots, et pour obtenir de bons résultats sur les sons et les mots,
00:08:43vous devez aussi prendre en compte l'interaction, comme la prise ou la détection de tour de parole.
00:08:50Enfin, pour avoir une bonne résolution de tâche, qui est l'objectif de la couche du modèle mental, vous devez réunir tout cela.
00:09:02Sans l'une de ces composantes, votre agent vocal échouera.
00:09:09Enfin, tout cela doit être parfaitement aligné.
00:09:17De plus, vous devez garder à l'esprit que tout cela se déroule au fil du temps.
00:09:26Ce que je veux dire par là, c'est que c'est suivi silencieusement. Contrairement au chat où vous voyez l'historique de ce qui a été dit
00:09:34sous forme de texte, dans l'expérience avec un agent vocal, vous dites quelque chose, le bot répond, il y a un va-et-vient,
00:09:45puis toutes ces formes d'ondes, les vibrations dans l'air, disparaissent.
00:09:53Il ne reste plus que le modèle mental de l'utilisateur, et c'est ce qui compte.
00:10:00Les sons, les mots et les interactions s'évanouissent dès qu'ils sont prononcés,
00:10:04mais le modèle mental persiste et se développe au fil du temps.
00:10:09C'est donc ce que vous devez
00:10:12viser pour la satisfaction de l'utilisateur.
00:10:16Alors, que pouvons-nous faire
00:10:19pour que le bot réponde aux exigences de l'utilisateur ?
00:10:25Ce qu'on peut faire inclut bien sûr le choix de bons modèles ASR ou de bonnes configurations, et du post-traitement,
00:10:34choisir de bons modèles TTS, leurs configurations et le prétraitement,
00:10:38sélectionner soigneusement le vocabulaire partagé entre le bot et l'utilisateur,
00:10:46bien gérer la latence de détection de tour de parole et l'alternance des tours,
00:10:52et très important, ce serait formidable de bien détecter et gérer les émotions,
00:10:59ainsi que la rétention du contexte, et par contexte, j'entends le contexte sur tout cela.
00:11:07Et surtout, cela doit être dynamique car les choses changent continuellement tout au long de l'appel.
00:11:16Il faut donc faire cette gestion de manière dynamique au fil du temps,
00:11:21pour différents types de personnes.
00:11:24Les enfants ou d'autres profils auront des attentes différentes qu'il faudra satisfaire,
00:11:32pas seulement lorsqu'ils sont contents, mais aussi quand ils ne le sont pas.
00:11:36C'est seulement ainsi qu'on peut viser une orchestration dynamique et vraiment évolutive de l'IA vocale.
00:11:42C'est donc un travail très difficile.
00:11:48On dit toujours que la voix est le moyen de communication le plus naturel, mais ce n'est pas si simple.
00:11:54En coulisses, c'est grâce à cette orchestration linguistique.
00:11:59Si votre bot ne la maîtrise pas, c'est un échec catastrophique.
00:12:07Prêter attention à ce cadre linguistique a d'importantes retombées commerciales, car vous pouvez
00:12:17réduire la frustration des utilisateurs, les échecs de tâches, le transfert vers un agent humain, les appels abandonnés ou les échecs silencieux.
00:12:28Chez ServiceNow, nous avons créé un bon benchmark de bout en bout nommé EVA Bench. Vous pouvez l'essayer pour évaluer votre agent vocal.
00:12:43Ce qu'il faut retenir :
00:12:45L'IA vocale est une activité conjointe
00:12:49entre le bot et l'utilisateur, pas un simple pipeline,
00:12:54et nous devons répondre aux besoins des utilisateurs sur plusieurs niveaux en temps réel.
00:12:59Ce n'est pas comme si je vous apportais une solution miracle aujourd'hui, car cela n'existe pas.
00:13:04La solution réside en vous et dans votre système.
00:13:10Ce que je vous ai apporté aujourd'hui, c'est le cadre linguistique que vous pouvez tester
00:13:16pour évaluer votre système et sur lequel vous pouvez le concevoir.
00:13:21Vous pouvez tester EVA, mais aussi apprendre la linguistique et recruter des linguistes.
00:13:28Une autre chose que je souhaite vous rappeler,
00:13:31c'est que les enjeux commerciaux sont des enjeux linguistiques, et inversement,
00:13:35dans ce domaine de l'IA vocale,
00:13:37car la voix est fondamentalement une expérience linguistique, très humaine et cognitive.
00:13:45J'aimerais vous poser une question à plus long terme.
00:13:50Les locuteurs s'adaptent. Je suis sûre qu'au cours de notre échange d'aujourd'hui,
00:13:59vous avez appris des choses sur moi, mon style d'élocution, mon accent,
00:14:05le type de mots que j'utilise. La prochaine fois qu'on se verra en personne, vous serez plus à l'aise pour
00:14:12me parler, parce que vous m'avez prêté attention, n'est-ce pas ? Les locuteurs s'adaptent toujours. L'utilisateur
00:14:18s'adaptera à votre agent vocal tout au long de l'appel. Votre système est-il prêt pour qu'il
00:14:27l'utilise mieux la prochaine fois ?
00:14:31Et les langues évoluent constamment. Votre agent vocal est-il prêt pour l'évolution de la langue d'ici un an, voire six mois ?
00:14:44Votre agent vocal sera-t-il meilleur la prochaine fois ? Merci.
00:14:57Merci.
00:14:57Merci.
00:14:57Merci.
00:15:04Merci.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video