스크립트
00:00:00皆さん、こんにちは。ServiceNowでMLエンジニアをしているキム・ミダムです。
00:00:25本日は「VoiceAIのための言語学的フレームワーク」についてお話しします。まず簡単に自己紹介をさせてください。
00:00:37先ほど申し上げた通り、私はServiceNowのMLエンジニアですが、
00:00:42日常における音声コミュニケーションを長年研究している研究者でもあります。
00:00:48私のモットーは「言語学を活用すること」であり、本日は皆さんに
00:00:54言語学という視点をお渡ししたいと思っています。さて、VoiceAIの失敗を経験したことはありますか?
00:01:05皆さんありますよね。私自身が体験した例をご紹介します。
00:01:15ボットから「お名前のスペルを教えていただけますか?」と聞かれ、ゆっくり答え始めました。
00:01:22「はい、M-I-D-A-Mです」するとボットは「確認ですが、M-I-D-A-Nですか?」と言ったので、「いいえ、M-I-D-A-Mです」と返しました。
00:01:40私の名前はM-I-D-A-MであってM-I-D-A-Nではないので、少しイライラしてきます。すると次に「口座番号を教えてください」と尋ねられ、戸惑ってしまいました。口座番号とは何のことだろう?と思い、その情報を探そうとしました。
00:02:09どれだろうと思いつつ、ゆっくり口座番号の読み上げを始めました。「A-X-4-5-1です」と。読み慣れない不規則な番号だったので少し時間がかかっていると、ボットに言葉を遮られました。「該当する記録が見つかりませんでした」と言われ、
00:02:14聞き直そうともせず、「もう一度繰り返していただけますか?」と聞き返され、ストレスを感じました。「該当する記録が見つかりませんでした」と言われ、聞き直そうともせず、「もう一度繰り返していただけますか?」と言われてイライラが募りました。「該当する記録が見つかりませんでした」と言われ、
00:02:21「A、X、4、5、1」と、見慣れない番号を
00:02:30読むのに時間がかかっていると、ボットに話を遮られ、「記録が見つかりません」
00:02:36と言われました。そして確認もしないまま「もう一度繰り返してください」と
00:02:42求められ、非常に腹が立ちました。そして「人と話せますか?
00:02:46もうあなたとは話したくありません」と言ってしまうのです。これは残念ながら
00:02:51現在のVoiceAIによく見られる非常に典型的なパターンです。
00:02:57そこで、言語学を用いてこの問題をどう解決できるかを探りたいと思います。
00:03:06VoiceAIは急成長していますが、ユーザーは今でもボットより人間を
00:03:11選ぶ傾向があります。この問題をどう緩和すればよいでしょうか?そもそも
00:03:19本当の問題は何なのでしょうか?VoiceAIのエンドツーエンド構造を理解するための
00:03:25根本的なフレームワーク、すなわち言語学について考えることができると思います。
00:03:35皆さんもご存じの通り、人間のコミュニケーションとは共同作業です。
00:03:41まさに私たちが今行っているようなことです。私が音声と言葉を発し、皆さんがそれを聞き、
00:03:48会話であれば今度は皆さんが音声と言葉を返し、
00:03:53相互作用を通じてやり取りが往復します。
00:04:02そしてこのプロセスにおいて、私たちはメンタルモデルを常に処理・更新しています。
00:04:09これが人間のコミュニケーションにおける共同作業です。そしてVoiceAIとの
00:04:18コミュニケーションにおいても、同じような共同作業であるべきだと考えています。
00:04:25なぜなら、それこそが人間として私たちが知っている唯一の対話方法だからです。
00:04:30私たちは何千年もかけて話し手として進化してきており、それが身についているため、
00:04:35ボットに対しても同じことを期待してしまいます。それでは、先ほどの失敗シーンを
00:04:45このフレームワークに当てはめてみましょう。双方に「聞く」「話す」という役割があります。
00:04:53私が名前のスペルを言い始めると、ボットは
00:05:04MとNの違いを正しく聞き取れませんでした。これは受聴レベルでのSTTの失敗です。次にTTSが
00:05:14私の名前に対して英語中心の読み上げ規則しか適用せず、M-I-D-A-Mがアメリカ英語風に発音され、
00:05:22戸惑いました。しかしまあ、この時点では寛容でいられます。人間同士でも
00:05:29よくあることだからです。ですが、ボットが
00:05:36口座番号の件を出した時、何のことかわからず再び困惑しました。それでも適応して探し出し、
00:05:44番号を見つけて読み上げ始めたのですが、STTが単語単位を正しく認識できず、
00:05:52途中で遮られ、最終的には被せて話してくる始末でした。そのため非常にイライラし、
00:06:06同じ情報の繰り返しを求められた時、このボットが
00:06:14自分とメンタルモデルを共有できていないことが明確になりました。さらに非常に失礼なことに、人間なら普通に行う
00:06:22「対話的な確認」すら試みようとしません。そのため、もう相手をしたくなくなり、
00:06:28「人と話せますか?」と言ったのです。では、もう一度フレームワークを見てみましょう。
00:06:38これらは人間同士の会話で期待され、正しく維持されている言語的要素です。
00:06:47「受聴(聞く)チャネル」と「発話(話す)チャネル」があり、その中に
00:06:52音声、言葉、相互作用、メンタルモデルといった異なる要素が存在します。1つ目は、ボットがユーザーの
00:06:59発話を正しく認識できているかです。専門用語の多くはここに該当します。そして次に
00:07:09受聴チャネルにおける「言葉」という2つ目の要素があります。ボットがユーザーの言葉を理解しているか、です。
00:07:173つ目は、ボットが自分の順番が来るまで適切なタイミングで待てるかという、受聴チャネルの相互作用に関する部分です。
00:07:28そして最後がメンタルモデルです。受聴において、ボットがユーザーの意図を理解しているかということです。
00:07:38次に発話チャネルに移ると、まず音声面での発音の問題があります。
00:07:43また、ボットがユーザーの選ぶ言葉を理解し、ユーザーが理解できる言葉を選択できているか。
00:07:53相互作用においては、適切なタイミングで発話できているか。そして最後に、ユーザーが本当に
00:08:01必要としている情報を話しているか。
00:08:05ここには工学、言語学、認知科学における数多くの用語が網羅されています。
00:08:13これらすべてが、この言語的フレームワークの中で適切な位置を占めていることがお分かりいただけるでしょう。
00:08:23重要なのは、これらの要素が独立・分離しているのではなく、相互に依存しているということです。
00:08:30相互に依存し、連動しています。したがって、音声レベルで優れた処理を行いたいなら、
00:08:36言葉のレベルも考慮しなければなりません。また、音声と言葉を適切に扱いたいのであれば、
00:08:43相互作用、すなわち発話権の交替や検出も考慮する必要があります。
00:08:50そして最終的に、メンタルモデル層の目標である「タスクの正常完了」を達成したいのであれば、これらすべてを揃える必要があります。
00:09:02どれか1つでも欠けていれば、VoiceAIは失敗してしまいます。
00:09:09そして最後に、これらすべてがしっかりと整列し、調和していなければなりません。
00:09:17さらに、これが時間軸の上で進行していることを念頭に置く必要があります。
00:09:26どういうことかというと、テキストチャットとは異なり、静かに保持・追跡されるということです。チャットでは発言内容の履歴が
00:09:34テキストとして残ります。しかし音声体験では、自分が話し、ボットが話し、やり取りが続くなかで、
00:09:45波形や空気の振動としての音声はすべて消え去ってしまいます。
00:09:53そして唯一残るのがユーザーのメンタルモデルであり、それこそが重要なのです。
00:10:00音声、言葉、相互作用は発せられた瞬間に消えますが、
00:10:04メンタルモデルは時間の経過とともに蓄積され、成長していきます。
00:10:09したがって、ユーザーの満足度を得るためには
00:10:12ここをターゲットにする必要があります。
00:10:16では、ボットがユーザーの期待基準を
00:10:19満たすためには何ができるでしょうか?
00:10:25できることとしては、優れたASR(自動音声認識)モデルや設定の選択、そして後処理が含まれます。
00:10:34また、優れたTTS(音声合成)モデルや設定の選択、前処理も挙げられます。
00:10:38そして、ボットとユーザー間で共有できる語彙を慎重に精選すること。
00:10:46ターン検出のレイテンシーや発話権の制御を適切に行うこと。
00:10:52さらに非常に重要なのが、優れた感情検出とそれへの対処です。
00:10:59そして文脈の維持。ここで言う文脈とは、これらすべてに関する文脈のことです。
00:11:07重要なのは動的であることです。通話の全過程において、状況は常に変化しているからです。
00:11:16そのため、時間軸に沿って動的に管理を行う必要があります。
00:11:21さまざまな種類の人々に対してです。
00:11:24子どもなど、ユーザー層によって期待値は異なるため、それらを満たさなければなりません。
00:11:32満足している時だけでなく、不満を感じている時も同様です。
00:11:36そうして初めて、動的で真に拡張可能なVoiceAIのオーケストレーションを追求できるのです。
00:11:42非常に困難な仕事です。
00:11:48音声は最も自然な対話手段だとよく言われますが、実際には容易ではありません。
00:11:54水面下での言語的オーケストレーションがあってこそ成り立っています。
00:11:59ボットがこれを上手くこなせないと、壊滅的な失敗につながります。
00:12:07そのため、この言語的フレームワークに着目することはビジネス面でも大きな意味を持ちます。
00:12:17ユーザーのストレス、タスクの失敗、オペレーターへのエスカレーション、途中切断、サイレントエラーなどを削減できるからです。
00:12:28ServiceNowでは「eva bench」という優れたエンドツーエンドのベンチマークを作成しました。自社の音声ボットの状態診断にお試しいただけます。
00:12:43まとめです。
00:12:45VoiceAIは単なる処理パイプラインではなく、
00:12:49ボットとユーザーによる共同作業です。
00:12:54そして、多様な階層でリアルタイムにユーザーのニーズに応える必要があります。
00:12:59今日ここで万能な解決策を提示したわけではありません。そのようなものは存在しないからです。
00:13:04解決策は皆さん自身と、皆さんのシステムの中にあります。
00:13:10しかし本日お渡ししたのは、システムの診断や構築の基盤として活用できる
00:13:16言語学的フレームワークです。
00:13:21evaを試すのもよいですし、言語学を学び、言語学者を雇用するのも手でしょう。
00:13:28最後にお伝えしておきたいのは、
00:13:31ビジネス上の意味合いは言語学上の意味合いであり、その逆も然りだということです。
00:13:35このVoiceAIの領域においては。
00:13:37なぜなら音声とは本質的に言語的であり、非常に人間的かつ認知的な体験だからです。
00:13:45長期的な問いを1つ投げかけさせてください。
00:13:50話者は適応します。本日の私の発表を通じて、皆さんは
00:13:59私の話し方、アクセント、使う言葉について何かを学ばれたことでしょう。
00:14:05ですから次回直接お会いした際には、私に注意を払ってくださった分、
00:14:12より話しやすく感じるはずです。このように話者は常に適応しています。ユーザーも
00:14:18通話を通じて音声ボットに適応していきます。では、皆さんのシステムはユーザーが
00:14:27次回により良くボットを活用できる準備が整っているでしょうか?
00:14:31また、言語は常に変化します。皆さんの音声ボットは1年後、あるいは半年後の言語変化に対応できるでしょうか?
00:14:44次回利用する時、ボットはより進化しているでしょうか?ご清聴ありがとうございました。
00:14:57ご清聴ありがとうございました。
00:14:57ご清聴ありがとうございました。
00:14:57ご清聴ありがとうございました。
00:15:04ありがとうございました。
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기