"Mein Name ist... mein Name ist...": Eine linguistische Landkarte für Sprachassistenten — Midam Kim, ServiceNow

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Hallo zusammen. Mein Name ist Midam Kim. Ich bin ML-Ingenieurin bei ServiceNow und werde
00:00:25über ein linguistisches Framework für VoiceAI sprechen. Kurze Info zu meinem Hintergrund, damit Sie
00:00:37wissen, worauf sich mein Ansatz stützt. Ich bin ML-Ingenieurin bei ServiceNow, aber ich bin
00:00:42auch Forscherin, leidenschaftliche Forscherin für Sprachkommunikation im Alltag. Mein
00:00:48Motto ist es, Linguistik anzuwenden, und genau diesen linguistischen Blickwinkel möchte ich Ihnen heute
00:00:54vermitteln. Haben Sie schon einmal Fehler bei VoiceAI erlebt? Ja, wohl
00:01:05jeder von uns. Ich möchte Ihnen ein Beispiel zeigen, das ich selbst erlebt habe. Der
00:01:15Bot fragte mich: “Könnten Sie bitte Ihren Vornamen buchstabieren?” Und ich fange langsam an, meinen Namen zu buchstabieren.
00:01:22Ja, M-I-D-A-M. Und der Bot sagt: “Ich bestätige, ist das M-I-D-A-N?” Und ich antworte: “Nein, M-I-D-A-M.”
00:01:40Ich werde langsam genervter, weil mein Name M-I-D-A-M ist, nicht M-I-D-A-N. Dann fragt er mich: “Wie lautet Ihre Kontonummer?” Ich bin verwirrt. Was für eine Kontonummer? Ich versuche, die Information zu finden.
00:02:09Welche war das? Das muss sie sein. Ich beginne langsam, die Kontonummer zu buchstabieren: A-X-4-5-1. Ich brauche etwas Zeit, weil ich diese lange Nummer nicht gewohnt bin.
00:02:14Der Bot fällt mir ins Wort und sagt: “Ich konnte Ihren Datensatz nicht finden.” Ohne es weiter zu versuchen, bittet er mich: “Könnten Sie das bitte wiederholen?” Ich bin gestresst.
00:02:21A, X, 4, 5, 1, und dann brauche ich Zeit, weil ich nicht daran gewöhnt bin, diese
00:02:30seltsame Nummer vorzulesen. Der Bot unterbricht mich und sagt: “Ich konnte Ihren
00:02:36Datensatz nicht finden.” Und ohne es noch einmal zu versuchen, verlangt er: “Könnten Sie
00:02:42das bitte wiederholen?” Ich bin extrem genervt und sage: “Kann ich mit einem Menschen sprechen?
00:02:46Ich möchte mich nicht mehr mit dir abgeben.” Das ist ein sehr
00:02:51typisches Muster bei Sprach-AI heutzutage. Ich möchte
00:02:57zeigen, wie wir dieses Problem mithilfe der Linguistik lösen können. Sprach-AI
00:03:06boomt, aber Nutzer bevorzugen immer noch häufig menschliche Agenten gegenüber Sprach-
00:03:11Bots. Wie können wir das beheben? Und was sind überhaupt
00:03:19die eigentlichen Probleme? Wir brauchen ein fundamentales Framework, um
00:03:25diese End-to-End-Architektur von VoiceAI zu verstehen: die Linguistik. Wie
00:03:35wir alle wissen, ist menschliche Kommunikation eine gemeinsame Aktivität,
00:03:41genau wie das, was wir hier tun. Ich gebe Ihnen Laute und Worte, Sie hören
00:03:48sie, und im Gespräch antworten Sie mir wiederum mit Ihren Lauten und Ihren
00:03:53Worten. Das geht durch Interaktion hin und her. In diesem
00:04:02Prozess verarbeiten und aktualisieren wir ständig unsere mentalen Modelle. Das ist die
00:04:09gemeinsame Aktivität menschlicher Kommunikation. Auch in der Sprach-AI
00:04:18muss die Kommunikation so eine gemeinsame Aktivität sein. Denn das ist
00:04:25das Einzige, was wir über menschliche Kommunikation wissen. Als Menschen haben
00:04:30wir uns über Jahrtausende als Kommunikatoren entwickelt, das ist uns vertraut.
00:04:35Wir erwarten also dasselbe von Bots. Gehen wir das Fehlerszenario meines Anrufs
00:04:45beim Sprach-Bot in diesem Framework durch. Es gibt ein Hören und Sprechen für beide
00:04:53Seiten. Ich fange an, meinen Vornamen zu buchstabieren, aber der Bot hört den
00:05:04Unterschied zwischen M und N nicht richtig. Das ist ein STT-Fehler auf der Hórebene. Die TTS verwendet
00:05:14dann nur rein englische Ausspracheregeln für meinen Namen: M-I-D-A-M wird auf Amerikanisch
00:05:22vorgelesen. Ich bin verwirrt, zeige mich aber noch nachsichtig, weil das ständig passiert,
00:05:29selbst bei Menschen. Das ist noch okay. Aber als er dann nach der
00:05:36Kontonummer fragte – da ich sie nicht auswendig wusste, war ich wieder verwirrt. Aber ich bin anpassungsfähig,
00:05:44ich suche danach. Ich habe die Nummer gefunden und fange an vorzulesen. Aber die STT hat die Worte
00:05:52nicht richtig erkannt. Er schneidet mir das Wort ab und fällt mir schließlich ins Wort. Das verärgert mich sehr.
00:06:06Und als er mich bittet, dieselbe Information zu wiederholen, wird klar:
00:06:14Dieser Bot teilt nicht dasselbe mentale Modell mit mir. Sehr unhöflich versucht er nicht einmal
00:06:22eine interaktive Klärung, was bei Menschen völlig normal wäre. Darauf habe ich keine
00:06:28Lust mehr. Ich frage: “Kann ich mit einem Menschen sprechen?” Schauen wir uns das Framework noch einmal an.
00:06:38Das sind die linguistischen Komponenten, die in einem Gespräch von Mensch zu Mensch erwartet und gepflegt werden.
00:06:47Es gibt einen Hörkanal und einen Sprechkanal, und es gibt verschiedene Komponenten
00:06:52wie Laute, Wörter, Interaktion und das mentale Modell. Der erste Punkt ist: Erkennt der Bot die Sprache
00:06:59des Nutzers gut? Alle technischen Fachbegriffe fallen darunter. Dann gibt es diese
00:07:09zweite Komponente: Wörter im Hörkanal. Versteht der Bot die Wörter des Nutzers?
00:07:17Die dritte Frage: Wartet der Bot auf den richtigen Moment für seinen Beitrag? Das betrifft die Interaktion im Hörkanal.
00:07:28Der letzte Teil ist das mentale Modell: Versteht der Bot beim Zuhören die Absicht des Nutzers?
00:07:38Wechseln wir zum Sprechkanal: Hier geht es um die Aussprache bei den Lauten,
00:07:43und auch darum, ob der Bot Wörter wählt, die der Nutzer verstehen kann.
00:07:53Im Bereich Interaktion: Spricht der Bot im richtigen Moment? Und schließlich: Liefert der Bot
00:08:01die Informationen, die der Nutzer wirklich braucht?
00:08:05Hier stehen viele Begriffe aus der Ingenieurwissenschaft, Linguistik oder Kognitionswissenschaft.
00:08:13Sie sehen jetzt, dass alle diesen festen Platz in unserem linguistischen Framework haben.
00:08:23Wichtig ist: Diese Komponenten hängen voneinander ab, sie sind nicht getrennt oder isoliert.
00:08:30Sie bedingen sich gegenseitig und sind aufeinander abgestimmt. Wenn Sie gute Ergebnisse bei den Lauten erzielen wollen,
00:08:36müssen Sie die Wortebene mitdenken. Und wenn Sie auf Laut- und Wortebene überzeugen wollen,
00:08:43müssen Sie auch die Interaktion berücksichtigen, wie den Wechsel der Sprecherrolle oder die Gesprächserkennung.
00:08:50Um letztlich das Ziel der mentalen Modelle zu erreichen – die erfolgreiche Aufgabenerfüllung –, braucht man all diese Bausteine.
00:09:02Fehlt auch nur eine einzige dieser Komponenten, wird Ihr Sprach-Bot scheitern.
00:09:09Und schließlich müssen alle diese Elemente perfekt aufeinander abgestimmt sein.
00:09:17Zusätzlich müssen Sie bedenken, dass sich all dies auf einer Zeitachse abspielt.
00:09:26Damit meine ich: Es wird im Hintergrund mitverfolgt, anders als beim Chat. Im Chat sieht man den Verlauf dessen, was gesagt
00:09:34wurde, als Text. Bei einem Sprach-Bot sagen Sie etwas, der Bot antwortet, und es geht hin und her.
00:09:45All diese Schwingungen, die Luftvibrationen, verfliegen sofort wieder.
00:09:53Was bleibt, ist einzig das mentale Modell des Nutzers – und das ist es, worauf es ankommt.
00:10:00Laute, Wörter, Interaktionen verfliegen im Moment des Sprechens,
00:10:04aber das mentale Modell bleibt bestehen und entwickelt sich weiter.
00:10:09Darauf müssen Sie sich ausrichten,
00:10:12um für Zufriedenheit beim Nutzer zu sorgen.
00:10:16Was können wir also tun,
00:10:19damit der Bot den Anforderungen der Nutzer gerecht wird?
00:10:25Zu den Maßnahmen gehört natürlich die Wahl guter ASR-Modelle oder Konfigurationen nebst Nachbearbeitung,
00:10:34die Wahl passender TTS-Modelle samt Konfiguration und Vorverarbeitung,
00:10:38sowie die sorgfältige Auswahl des Wortschatzes, den Bot und Nutzer teilen.
00:10:46Wichtig sind auch eine präzise Sprecherwechsel-Erkennung, geringe Latenz und flüssige Dialogführung.
00:10:52Sehr entscheidend wäre zudem eine verlässliche Erkennung und Berücksichtigung von Emotionen
00:10:59sowie das Speichern des Kontexts – und damit meine ich den Kontext all dieser Faktoren.
00:11:07Vor allem muss dies dynamisch geschehen, weil sich die Gegebenheiten während des Gesprächs laufend verändern.
00:11:16Wir müssen dieses Management also dynamisch entlang der Zeitachse gestalten,
00:11:21angepasst an unterschiedliche Zielgruppen.
00:11:24Kinder oder andere Personengruppen haben jeweils eigene Erwartungen, die wir erfüllen müssen –
00:11:32nicht nur, wenn sie zufrieden sind, sondern auch bei Unzufriedenheit.
00:11:36Nur so erreichen Sie eine dynamische und echt skalierbare Orchestrierung von VoiceAI.
00:11:42Das ist eine äußerst anspruchsvolle Aufgabe.
00:11:48Wir sagen immer, Sprache sei die natürlichste Form der Kommunikation, aber sie ist keineswegs einfach.
00:11:54Hinter den Kulissen klappt das nur dank dieser linguistischen Orchestrierung.
00:11:59Wenn Ihr Bot darin nicht gut ist, führt das zum Fiasko.
00:12:07Achtsamkeit für dieses linguistische Framework bringt erhebliche geschäftliche Vorteile. Denn so lassen sich
00:12:17Frustrationen, Fehlversuche, Weiterleitungen an Mitarbeiter, Anrufabbrüche oder unbemerkte Fehler reduzieren.
00:12:28Bei ServiceNow haben wir einen zuverlässigen End-to-End-Benchmark namens eva bench entwickelt, um den Status Ihres Sprach-Bots zu testen.
00:12:43Wichtigste Erkenntnisse:
00:12:45VoiceAI ist ein gemeinsames Zusammenspiel
00:12:49zwischen Bot und Nutzer, nicht nur ein Prozessablauf.
00:12:54Wir müssen die Bedürfnisse der Nutzer auf mehreren Ebenen in Echtzeit bedienen.
00:12:59Ich habe Ihnen heute keine fertige Musterlösung mitgebracht, denn so etwas gibt es nicht.
00:13:04Die Lösung liegt in Ihnen und Ihrem System.
00:13:10Was ich Ihnen heute an die Hand gebe, ist das linguistische Framework, mit dem Sie
00:13:16Ihr System analysieren und darauf aufbauen können.
00:13:21Sie können eva ausprobieren, aber auch Linguistik lernen und Linguisten einstellen.
00:13:28Eine weitere Sache, die ich Ihnen in Erinnerung rufen möchte:
00:13:31Business-Auswirkungen sind linguistische Auswirkungen und umgekehrt,
00:13:35wenn es um VoiceAI geht.
00:13:37Sprache ist im Grunde eine zutiefst linguistische, menschliche und kognitive Erfahrung.
00:13:45Ich möchte Ihnen eine langfristige Frage mit auf den Weg geben.
00:13:50Sprecher passen sich an. Ich bin mir sicher, dass Sie heute in meinem Vortrag
00:13:59habt ihr etwas über mich gelernt, über meinen Sprechstil, welche Akzente ich spreche,
00:14:05und die Wörter, die ich nutze. Wenn wir uns das nächste Mal persönlich sehen, fällt Ihnen das Gespräch
00:14:12leichter, weil Sie aufmerksam zugehört haben. Sprecher passen sich ständig an. Auch der Nutzer
00:14:18wird sich im Laufe des Gesprächs an Ihren Sprach-Bot anpassen. Ist Ihr System bereit dafür,
00:14:27dass der Nutzer Ihren Sprach-Bot beim nächsten Mal noch besser bedient?
00:14:31Sprachen verändern sich ständig. Ist Ihr Sprach-Bot auf den Sprachwandel in einem Jahr oder sechs Monaten vorbereitet?
00:14:44Ist Ihr Sprach-Bot beim nächsten Mal besser? Vielen Dank.
00:14:57Vielen Dank.
00:14:57Vielen Dank.
00:14:57Vielen Dank.
00:15:04Ihnen.

핵심 요약

Erfolgreiche VoiceAI erfordert die synchrone Orchestrierung aller linguistischen Ebenen von Lauten bis hin zu mentalen Modellen, um Unterbrechungen zu vermeiden und Kundensegmenten dynamisch gerecht zu werden.

하이라이트

  • Menschliche Kommunikation basiert auf der kontinuierlichen Aktualisierung gemeinsamer mentaler Modelle, was Sprach-Bots ebenfalls leisten müssen.

  • Sprachmedien sind im Gegensatz zu Text-Chats flüchtig; verflogene Laute und Wörter hinterlassen als einzig bleibenden Wert das mentale Modell des Nutzers.

  • Fehler auf Unterebenen wie ASR (STT) oder TTS zerstören die Interaktion und führen zum Abbruch des Gesprächs sowie zum Wunsch nach menschlichen Agenten.

  • Ein unzureichendes linguistisches Framework führt zu messbaren Geschäftseinbußen durch höhere Weiterleitungsraten und abgebrochene Anrufe.

  • Mit eva bench existiert ein spezifischer End-to-End-Benchmark zur Überprüfung der Leistungsfähigkeit von Sprach-Bots.

타임라인

Grenzen aktueller Sprach-Bots im Alltagsgebrauch

  • Typische Fehlerketten in der Spracherkennung führen zu Frustration und Anrufabbrüchen.
  • Nutzer bevorzugen menschliche Agenten, wenn Bots grundlegende Konversationsregeln verletzen.
  • Häufige Ursachen für Fehlschläge sind falsche Buchstabierung, unpassende Intonation und fehlerhaftes Timing.

Beim Buchstabieren eines Namens wie M-I-D-A-M verwechselt die Spracherkennung (STT) oft M und N, während die Sprachsynthese (TTS) unpassende Aussprageregeln anwendet. Bei der Eingabe langer Nummern führen starre Pausenzeiten zu ungewollten Unterbrechungen durch den Bot. Fehlt dem System die Fähigkeit zur interaktiven Klärung, bricht der Nutzer das Gespräch genervt ab.

Das linguistische Framework für menschliche Kommunikation

  • Menschliche Interaktion ist ein gemeinsames Erzeugen und Anpassen mentaler Modelle.
  • Kommunikation verläuft bidirektional über synchrone Hör- und Sprechkanäle.
  • Bots müssen die evolutionär erlernten Erwartungshaltungen menschlicher Gesprächspartner erfüllen.

Menschen tauschen kontinuierlich Laute und Wörter aus, um den Wissensstand im Gegenüber zu aktualisieren. Da dieses Verhalten über Jahrtausende erlernt wurde, setzen Nutzer dieselben Mechanismen unbewusst bei Sprach-Bots voraus. Versteht der Bot die Absicht nicht oder verpasst den richtigen Zeitpunkt für eine Rückfrage, bricht die gemeinsame Aktivität zusammen.

Die acht Komponenten der sprachlichen Orchestrierung

  • Hör- und Sprechkanäle umfassen jeweils vier Ebenen: Laute, Wörter, Interaktion und mentale Modelle.
  • Die einzelnen Bausteine bedingen sich gegenseitig und funktionieren nicht in Isolation.
  • Ein einzelner Fehler auf einer unteren Ebene verhindert die erfolgreiche Aufgabenerfüllung.

Auf der Hörebene reichen die Aufgaben von der reinen Signalerkennung über das Wortverständnis und das Timing der Gesprächsübernahme bis hin zur Absichtserkennung. Der Sprechkanal fordert präzise Aussprache, verständliche Wortwahl, exaktes Turn-Taking und relevante Informationsvergabe. Erst wenn alle Komponenten nahtlos ineinandergreifen, erreicht der Bot das finale Ziel der Aufgabenerfüllung.

Zeitliche Dynamik und mentale Modelle

  • Schallwellen verfliegen sofort, wohingegen das mentale Modell im Gedächtnis verbleibt.
  • Gespräche erfordern eine dynamische Anpassung entlang der Zeitachse.
  • VoiceAI erfordert das Speichern von Kontexten über veränderliche Faktoren hinweg.

Im Vergleich zum Text-Chat, der eine permanente Historie bietet, ist Sprache flüchtig. Nur der gegenseitige Wissensstand überdauert den Moment des Sprechens. Das System muss Faktoren wie ASR-/TTS-Konfigurationen, Wortverarbeitung, Latenz und Emotionserkennung kontinuierlich in Echtzeit anpassen – auch im Hinblick auf unterschiedliche Nutzergruppen wie Kinder.

Betriebswirtschaftliche Auswirkung und Evaluation

  • Linguistische Fehler verursachen direkte geschäftliche Kosten.
  • Der Benchmark eva bench misst die End-to-End-Leistung von Sprach-Bots.
  • Systeme müssen auf die sprachliche Adaption der Nutzer und Sprachwandel vorbereitet sein.

Mangelhafte sprachliche Performance führt zu mehr Fehlversuchen, Weiterleitungen an menschliche Agenten und verdeckten Fehlerkosten. Der Testrahmen eva bench hilft Unternehmen bei der Systemanalyse. Da sich menschliche Sprecher im Laufe der Zeit an den Bot anpassen und Sprache sich stetig wandelt, müssen VoiceAI-Systeme flexibel ausgelegt sein.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기