"Mein Name ist... mein Name ist...": Eine linguistische Landkarte für Sprachassistenten — Midam Kim, ServiceNow
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Hallo zusammen. Mein Name ist Midam Kim. Ich bin ML-Ingenieurin bei ServiceNow und werde
00:00:25über ein linguistisches Framework für VoiceAI sprechen. Kurze Info zu meinem Hintergrund, damit Sie
00:00:37wissen, worauf sich mein Ansatz stützt. Ich bin ML-Ingenieurin bei ServiceNow, aber ich bin
00:00:42auch Forscherin, leidenschaftliche Forscherin für Sprachkommunikation im Alltag. Mein
00:00:48Motto ist es, Linguistik anzuwenden, und genau diesen linguistischen Blickwinkel möchte ich Ihnen heute
00:00:54vermitteln. Haben Sie schon einmal Fehler bei VoiceAI erlebt? Ja, wohl
00:01:05jeder von uns. Ich möchte Ihnen ein Beispiel zeigen, das ich selbst erlebt habe. Der
00:01:15Bot fragte mich: “Könnten Sie bitte Ihren Vornamen buchstabieren?” Und ich fange langsam an, meinen Namen zu buchstabieren.
00:01:22Ja, M-I-D-A-M. Und der Bot sagt: “Ich bestätige, ist das M-I-D-A-N?” Und ich antworte: “Nein, M-I-D-A-M.”
00:01:40Ich werde langsam genervter, weil mein Name M-I-D-A-M ist, nicht M-I-D-A-N. Dann fragt er mich: “Wie lautet Ihre Kontonummer?” Ich bin verwirrt. Was für eine Kontonummer? Ich versuche, die Information zu finden.
00:02:09Welche war das? Das muss sie sein. Ich beginne langsam, die Kontonummer zu buchstabieren: A-X-4-5-1. Ich brauche etwas Zeit, weil ich diese lange Nummer nicht gewohnt bin.
00:02:14Der Bot fällt mir ins Wort und sagt: “Ich konnte Ihren Datensatz nicht finden.” Ohne es weiter zu versuchen, bittet er mich: “Könnten Sie das bitte wiederholen?” Ich bin gestresst.
00:02:21A, X, 4, 5, 1, und dann brauche ich Zeit, weil ich nicht daran gewöhnt bin, diese
00:02:30seltsame Nummer vorzulesen. Der Bot unterbricht mich und sagt: “Ich konnte Ihren
00:02:36Datensatz nicht finden.” Und ohne es noch einmal zu versuchen, verlangt er: “Könnten Sie
00:02:42das bitte wiederholen?” Ich bin extrem genervt und sage: “Kann ich mit einem Menschen sprechen?
00:02:46Ich möchte mich nicht mehr mit dir abgeben.” Das ist ein sehr
00:02:51typisches Muster bei Sprach-AI heutzutage. Ich möchte
00:02:57zeigen, wie wir dieses Problem mithilfe der Linguistik lösen können. Sprach-AI
00:03:06boomt, aber Nutzer bevorzugen immer noch häufig menschliche Agenten gegenüber Sprach-
00:03:11Bots. Wie können wir das beheben? Und was sind überhaupt
00:03:19die eigentlichen Probleme? Wir brauchen ein fundamentales Framework, um
00:03:25diese End-to-End-Architektur von VoiceAI zu verstehen: die Linguistik. Wie
00:03:35wir alle wissen, ist menschliche Kommunikation eine gemeinsame Aktivität,
00:03:41genau wie das, was wir hier tun. Ich gebe Ihnen Laute und Worte, Sie hören
00:03:48sie, und im Gespräch antworten Sie mir wiederum mit Ihren Lauten und Ihren
00:03:53Worten. Das geht durch Interaktion hin und her. In diesem
00:04:02Prozess verarbeiten und aktualisieren wir ständig unsere mentalen Modelle. Das ist die
00:04:09gemeinsame Aktivität menschlicher Kommunikation. Auch in der Sprach-AI
00:04:18muss die Kommunikation so eine gemeinsame Aktivität sein. Denn das ist
00:04:25das Einzige, was wir über menschliche Kommunikation wissen. Als Menschen haben
00:04:30wir uns über Jahrtausende als Kommunikatoren entwickelt, das ist uns vertraut.
00:04:35Wir erwarten also dasselbe von Bots. Gehen wir das Fehlerszenario meines Anrufs
00:04:45beim Sprach-Bot in diesem Framework durch. Es gibt ein Hören und Sprechen für beide
00:04:53Seiten. Ich fange an, meinen Vornamen zu buchstabieren, aber der Bot hört den
00:05:04Unterschied zwischen M und N nicht richtig. Das ist ein STT-Fehler auf der Hórebene. Die TTS verwendet
00:05:14dann nur rein englische Ausspracheregeln für meinen Namen: M-I-D-A-M wird auf Amerikanisch
00:05:22vorgelesen. Ich bin verwirrt, zeige mich aber noch nachsichtig, weil das ständig passiert,
00:05:29selbst bei Menschen. Das ist noch okay. Aber als er dann nach der
00:05:36Kontonummer fragte – da ich sie nicht auswendig wusste, war ich wieder verwirrt. Aber ich bin anpassungsfähig,
00:05:44ich suche danach. Ich habe die Nummer gefunden und fange an vorzulesen. Aber die STT hat die Worte
00:05:52nicht richtig erkannt. Er schneidet mir das Wort ab und fällt mir schließlich ins Wort. Das verärgert mich sehr.
00:06:06Und als er mich bittet, dieselbe Information zu wiederholen, wird klar:
00:06:14Dieser Bot teilt nicht dasselbe mentale Modell mit mir. Sehr unhöflich versucht er nicht einmal
00:06:22eine interaktive Klärung, was bei Menschen völlig normal wäre. Darauf habe ich keine
00:06:28Lust mehr. Ich frage: “Kann ich mit einem Menschen sprechen?” Schauen wir uns das Framework noch einmal an.
00:06:38Das sind die linguistischen Komponenten, die in einem Gespräch von Mensch zu Mensch erwartet und gepflegt werden.
00:06:47Es gibt einen Hörkanal und einen Sprechkanal, und es gibt verschiedene Komponenten
00:06:52wie Laute, Wörter, Interaktion und das mentale Modell. Der erste Punkt ist: Erkennt der Bot die Sprache
00:06:59des Nutzers gut? Alle technischen Fachbegriffe fallen darunter. Dann gibt es diese
00:07:09zweite Komponente: Wörter im Hörkanal. Versteht der Bot die Wörter des Nutzers?
00:07:17Die dritte Frage: Wartet der Bot auf den richtigen Moment für seinen Beitrag? Das betrifft die Interaktion im Hörkanal.
00:07:28Der letzte Teil ist das mentale Modell: Versteht der Bot beim Zuhören die Absicht des Nutzers?
00:07:38Wechseln wir zum Sprechkanal: Hier geht es um die Aussprache bei den Lauten,
00:07:43und auch darum, ob der Bot Wörter wählt, die der Nutzer verstehen kann.
00:07:53Im Bereich Interaktion: Spricht der Bot im richtigen Moment? Und schließlich: Liefert der Bot
00:08:01die Informationen, die der Nutzer wirklich braucht?
00:08:05Hier stehen viele Begriffe aus der Ingenieurwissenschaft, Linguistik oder Kognitionswissenschaft.
00:08:13Sie sehen jetzt, dass alle diesen festen Platz in unserem linguistischen Framework haben.
00:08:23Wichtig ist: Diese Komponenten hängen voneinander ab, sie sind nicht getrennt oder isoliert.
00:08:30Sie bedingen sich gegenseitig und sind aufeinander abgestimmt. Wenn Sie gute Ergebnisse bei den Lauten erzielen wollen,
00:08:36müssen Sie die Wortebene mitdenken. Und wenn Sie auf Laut- und Wortebene überzeugen wollen,
00:08:43müssen Sie auch die Interaktion berücksichtigen, wie den Wechsel der Sprecherrolle oder die Gesprächserkennung.
00:08:50Um letztlich das Ziel der mentalen Modelle zu erreichen – die erfolgreiche Aufgabenerfüllung –, braucht man all diese Bausteine.
00:09:02Fehlt auch nur eine einzige dieser Komponenten, wird Ihr Sprach-Bot scheitern.
00:09:09Und schließlich müssen alle diese Elemente perfekt aufeinander abgestimmt sein.
00:09:17Zusätzlich müssen Sie bedenken, dass sich all dies auf einer Zeitachse abspielt.
00:09:26Damit meine ich: Es wird im Hintergrund mitverfolgt, anders als beim Chat. Im Chat sieht man den Verlauf dessen, was gesagt
00:09:34wurde, als Text. Bei einem Sprach-Bot sagen Sie etwas, der Bot antwortet, und es geht hin und her.
00:09:45All diese Schwingungen, die Luftvibrationen, verfliegen sofort wieder.
00:09:53Was bleibt, ist einzig das mentale Modell des Nutzers – und das ist es, worauf es ankommt.
00:10:00Laute, Wörter, Interaktionen verfliegen im Moment des Sprechens,
00:10:04aber das mentale Modell bleibt bestehen und entwickelt sich weiter.
00:10:09Darauf müssen Sie sich ausrichten,
00:10:12um für Zufriedenheit beim Nutzer zu sorgen.
00:10:16Was können wir also tun,
00:10:19damit der Bot den Anforderungen der Nutzer gerecht wird?
00:10:25Zu den Maßnahmen gehört natürlich die Wahl guter ASR-Modelle oder Konfigurationen nebst Nachbearbeitung,
00:10:34die Wahl passender TTS-Modelle samt Konfiguration und Vorverarbeitung,
00:10:38sowie die sorgfältige Auswahl des Wortschatzes, den Bot und Nutzer teilen.
00:10:46Wichtig sind auch eine präzise Sprecherwechsel-Erkennung, geringe Latenz und flüssige Dialogführung.
00:10:52Sehr entscheidend wäre zudem eine verlässliche Erkennung und Berücksichtigung von Emotionen
00:10:59sowie das Speichern des Kontexts – und damit meine ich den Kontext all dieser Faktoren.
00:11:07Vor allem muss dies dynamisch geschehen, weil sich die Gegebenheiten während des Gesprächs laufend verändern.
00:11:16Wir müssen dieses Management also dynamisch entlang der Zeitachse gestalten,
00:11:21angepasst an unterschiedliche Zielgruppen.
00:11:24Kinder oder andere Personengruppen haben jeweils eigene Erwartungen, die wir erfüllen müssen –
00:11:32nicht nur, wenn sie zufrieden sind, sondern auch bei Unzufriedenheit.
00:11:36Nur so erreichen Sie eine dynamische und echt skalierbare Orchestrierung von VoiceAI.
00:11:42Das ist eine äußerst anspruchsvolle Aufgabe.
00:11:48Wir sagen immer, Sprache sei die natürlichste Form der Kommunikation, aber sie ist keineswegs einfach.
00:11:54Hinter den Kulissen klappt das nur dank dieser linguistischen Orchestrierung.
00:11:59Wenn Ihr Bot darin nicht gut ist, führt das zum Fiasko.
00:12:07Achtsamkeit für dieses linguistische Framework bringt erhebliche geschäftliche Vorteile. Denn so lassen sich
00:12:17Frustrationen, Fehlversuche, Weiterleitungen an Mitarbeiter, Anrufabbrüche oder unbemerkte Fehler reduzieren.
00:12:28Bei ServiceNow haben wir einen zuverlässigen End-to-End-Benchmark namens eva bench entwickelt, um den Status Ihres Sprach-Bots zu testen.
00:12:43Wichtigste Erkenntnisse:
00:12:45VoiceAI ist ein gemeinsames Zusammenspiel
00:12:49zwischen Bot und Nutzer, nicht nur ein Prozessablauf.
00:12:54Wir müssen die Bedürfnisse der Nutzer auf mehreren Ebenen in Echtzeit bedienen.
00:12:59Ich habe Ihnen heute keine fertige Musterlösung mitgebracht, denn so etwas gibt es nicht.
00:13:04Die Lösung liegt in Ihnen und Ihrem System.
00:13:10Was ich Ihnen heute an die Hand gebe, ist das linguistische Framework, mit dem Sie
00:13:16Ihr System analysieren und darauf aufbauen können.
00:13:21Sie können eva ausprobieren, aber auch Linguistik lernen und Linguisten einstellen.
00:13:28Eine weitere Sache, die ich Ihnen in Erinnerung rufen möchte:
00:13:31Business-Auswirkungen sind linguistische Auswirkungen und umgekehrt,
00:13:35wenn es um VoiceAI geht.
00:13:37Sprache ist im Grunde eine zutiefst linguistische, menschliche und kognitive Erfahrung.
00:13:45Ich möchte Ihnen eine langfristige Frage mit auf den Weg geben.
00:13:50Sprecher passen sich an. Ich bin mir sicher, dass Sie heute in meinem Vortrag
00:13:59habt ihr etwas über mich gelernt, über meinen Sprechstil, welche Akzente ich spreche,
00:14:05und die Wörter, die ich nutze. Wenn wir uns das nächste Mal persönlich sehen, fällt Ihnen das Gespräch
00:14:12leichter, weil Sie aufmerksam zugehört haben. Sprecher passen sich ständig an. Auch der Nutzer
00:14:18wird sich im Laufe des Gesprächs an Ihren Sprach-Bot anpassen. Ist Ihr System bereit dafür,
00:14:27dass der Nutzer Ihren Sprach-Bot beim nächsten Mal noch besser bedient?
00:14:31Sprachen verändern sich ständig. Ist Ihr Sprach-Bot auf den Sprachwandel in einem Jahr oder sechs Monaten vorbereitet?
00:14:44Ist Ihr Sprach-Bot beim nächsten Mal besser? Vielen Dank.
00:14:57Vielen Dank.
00:14:57Vielen Dank.
00:14:57Vielen Dank.
00:15:04Ihnen.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기