"Nama saya... nama saya...": Peta Linguistik untuk Agen Suara — Midam Kim, ServiceNow
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00Oke, halo semuanya. Nama saya Midam Kim. Saya seorang ML engineer dari ServiceNow dan saya akan
00:00:25membahas tentang kerangka linguistik untuk VoiceAI. Latar belakang singkat tentang saya agar Anda
00:00:37tahu sudut pandang saya. Seperti yang saya katakan, saya ML engineer di ServiceNow, tetapi saya
00:00:42juga seorang peneliti komunikasi wicara di dunia nyata. Jadi,
00:00:48motto saya adalah menerapkan linguistik, dan yang akan saya lakukan hari ini adalah memberikan
00:00:54sudut pandang linguistik itu kepada Anda. Pernahkah Anda mengalami kegagalan VoiceAI? Ya, pasti
00:01:05semua orang pernah. Saya akan menceritakan contoh yang saya alami sendiri. Jadi,
00:01:15bot bertanya kepada saya, “Bisa tolong eja nama depan Anda?” Lalu saya pelan-pelan mengeja
00:01:22nama saya. Ya, M-I-D-A-M. Dan bot berkata, “Mengonfirmasi kembali, apakah M-I-D-A-N?” Lalu saya jawab, “Bukan, M-I-D-A-M.”
00:01:40Lalu saya mulai agak kesal, makin kesal, karena nama saya M-I-D-A-M, bukan M-I-D-A-N. Lalu bot bertanya, “Sekarang, berapa nomor akun Anda?” Dan saya mulai bingung. Nomor akun apa itu? Lalu saya berusaha mencari informasi tentang itu.
00:02:09Jadi, yang mana? Pasti yang ini, lalu perlahan saya mengeja nomor akun tersebut. Yaitu A-X-4-5-1. Dan saya butuh waktu karena belum terbiasa membaca nomor yang aneh ini. Lalu bot menyela saya. Bot berkata, “Saya tidak dapat menemukan catatan Anda.” Dan tanpa
00:02:14mencoba lagi, bot meminta saya mengulanginya. “Bisa tolong ulangi lagi?” Dan saya pun stres, “Saya tidak dapat menemukan catatan Anda.” Lalu bot berkata, “Saya tidak dapat menemukan catatan Anda.” Tanpa mencoba lagi, bot meminta saya mengulanginya. “Bisa tolong ulangi lagi?” Saya makin stres. Lalu bot berkata, “Saya tidak dapat menemukan catatan Anda.”
00:02:21A, X, 4, 5, 1, lalu saya butuh waktu karena tidak terbiasa membaca
00:02:30nomor aneh ini, lalu bot menyela dan berkata, “Saya tidak dapat menemukan
00:02:36catatan Anda,” dan tanpa mencoba lagi, bot meminta saya mengulanginya, “Bisa
00:02:42tolong ulangi lagi?” Lalu saya merasa sangat kesal dan berkata, “Bisa saya bicara
00:02:46dengan manusia? Saya tidak ingin berurusan denganmu lagi.” Jadi ini adalah pola yang sangat
00:02:51tipikal dari Voice AI saat ini. Jadi saya hanya
00:02:57ingin mengarahkan bagaimana kita dapat menyelesaikan masalah ini dengan linguistik. Voice AI
00:03:06sedang berkembang pesat, tetapi pengguna sering kali masih lebih menyukai agen manusia daripada agen suara.
00:03:11Bagaimana kita bisa mengurangi masalah ini? Namun yang paling utama, apa
00:03:19masalah yang sebenarnya? Menurut saya, kita bisa memikirkan kerangka mendasar untuk
00:03:25memahami arsitektur end-to-end Voice AI ini, yang disebut linguistik. Seperti
00:03:35yang kita semua ketahui, komunikasi manusia adalah aktivitas bersama,
00:03:41seperti yang sedang kita lakukan sekarang. Saya menyampaikan suara dan kata-kata saya, Anda mendengarnya,
00:03:48dan jika ini sebuah percakapan, Anda akan memberikan suara dan
00:03:53kata-kata Anda, lalu ini berlangsung bolak-balik melalui interaksi. Dalam
00:04:02proses ini, kita terus memproses dan memperbarui model mental kita. Itu adalah
00:04:09aktivitas bersama dalam komunikasi manusia. Menurut saya, dalam komunikasi manusia
00:04:18dengan Voice AI, prosesnya juga harus menjadi aktivitas bersama seperti ini, karena itulah
00:04:25satu-satunya hal yang kita ketahui tentang komunikasi manusia. Sebagai manusia, kita telah
00:04:30berevolusi ribuan tahun sebagai komunikator, dan inilah yang kita ketahui.
00:04:35Jadi kita mengharapkan hal yang sama dari bot. Mari kita bahas adegan kegagalan panggilan saya
00:04:45dengan agen suara dalam kerangka kerja ini. Anda lihat ada saluran mendengar dan berbicara untuk setiap
00:04:53pihak. Saya mulai mengeja nama depan saya, tetapi bot tidak mendengarkan
00:05:04perbedaan antara M dan N dengan benar. Jadi itu kegagalan STT di tingkat pendengaran. Lalu TTS hanya menerapkan aturan pembacaan berpusat pada bahasa Inggris pada nama saya. M-I-D-A-M akan dibaca sebagai M-I-D-A-M dalam versi
00:05:14bahasa Inggris Amerika. Saya pun bingung, tapi saat itu saya masih cukup memaklumi karena hal itu
00:05:22sering terjadi, bahkan pada manusia sekalipun. Jadi saya tidak masalah. Namun ketika bot mengungkit
00:05:29soal nomor akun, karena tidak tahu itu apa, saya bingung lagi. Namun saya adaptif, saya bisa
00:05:36mencarinya. Setelah menemukan nomornya, saya mulai membacanya, tetapi STT tidak mengenali unit kata
00:05:44dengan benar. Jadi bot menyela saya dan akhirnya memotong pembicaraan saya. Saya menjadi sangat kesal,
00:05:52lalu ketika bot meminta pengulangan informasi yang sama, jelas sekali bahwa
00:06:06bot ini tidak mengikuti model mental bersama saya. Sangat tidak sopan, bot bahkan tidak mencoba
00:06:14klarifikasi interaktif, yang merupakan strategi umum manusia. Saya tidak ingin berurusan dengan ini lagi,
00:06:22jadi saya katakan, “Bisa saya bicara dengan manusia?” Mari kita tinjau kerangkanya lagi.
00:06:28Ini adalah komponen linguistik yang diharapkan dan dijaga dengan baik dalam percakapan antarmanusia.
00:06:38Ada saluran mendengar dan saluran berbicara, serta ada berbagai komponen
00:06:47seperti bunyi, kata-kata, interaksi, dan model mental. Komponen pertama adalah, apakah bot mengenali ucapan
00:06:52pengguna dengan baik? Semua istilah teknis ini masuk dalam kategori ini. Lalu ada
00:06:59komponen kedua, yaitu kata-kata dalam saluran mendengar. Apakah bot memahami kata-kata pengguna?
00:07:09Lalu yang ketiga adalah, apakah bot menunggu hingga waktu yang tepat untuk mengambil gilirannya? Ini berkaitan dengan interaksi saluran mendengar.
00:07:17Lalu bagian terakhir adalah model mental: apakah bot memahami niat pengguna pada bagian mendengarkan?
00:07:28Kita juga bisa beralih ke saluran berbicara. Ini berkaitan dengan pelafalan untuk bunyi,
00:07:38dan juga apakah bot memahami kata-kata yang digunakan pengguna, atau apakah bot memilih kata-kata yang dapat dipahami pengguna.
00:07:43Pada bagian interaksi, apakah bot berbicara dengan ritme waktu yang tepat? Dan terakhir, apakah bot berbicara dengan
00:07:53informasi yang benar-benar dibutuhkan pengguna?
00:08:01Ada banyak istilah teknik, linguistik, atau ilmu kognitif di sini.
00:08:05Sekarang Anda dapat melihat bahwa semua itu memiliki tempatnya masing-masing dalam kerangka kerja linguistik ini.
00:08:13Yang terpenting, komponen-komponen ini saling bergantung, tidak terpisah atau independen satu sama lain.
00:08:23Semuanya saling bergantung dan terbaris sejajar. Jadi saat Anda ingin mengoptimalkan aspek bunyi,
00:08:30Anda harus memikirkan tingkat kata. Lalu ketika ingin mengoptimalkan bunyi dan kata-kata ini,
00:08:36Anda juga harus memperhitungkan interaksi, seperti pergantian giliran bicara atau deteksi gilir bicara.
00:08:43Hingga akhirnya, Anda ingin penyelesaian tugas yang baik, yang merupakan tujuan dari lapisan model mental ini, maka Anda harus memiliki semuanya.
00:08:50Tanpa salah satu komponen tersebut, agen suara Anda akan gagal.
00:09:02Dan yang terakhir, semuanya harus selaras dengan baik.
00:09:09Selain itu, Anda harus mengingat bahwa ini terjadi dalam rentang waktu.
00:09:17Maksud saya, proses ini dilacak secara tak kasat mata, tidak seperti di obrolan teks. Di obrolan teks, Anda bisa melihat riwayat apa yang telah disampaikan
00:09:26dalam bentuk teks, tetapi pada pengalaman agen suara, Anda mengatakan sesuatu dan bot merespons, terjadi interaksi bolak-balik.
00:09:34Lihatlah semua bentuk gelombang suara ini, getaran di udara itu, semuanya menghilang,
00:09:45dan hanya model mental pengguna yang tersisa, dan itulah yang terpenting.
00:09:53Jadi bunyi, kata-kata, dan interaksi menghilang begitu saja saat diucapkan,
00:10:00tetapi model mental terus berlanjut dan berkembang seiring berjalannya waktu.
00:10:04Jadi inilah yang harus
00:10:09Anda targetkan demi kepuasan pengguna.
00:10:12Lalu, apa yang bisa kita lakukan
00:10:16agar bot dapat memenuhi standar pengguna?
00:10:19Hal yang bisa kita lakukan mencakup, tentu saja, memilih model ASR atau konfigurasi yang baik serta melakukan pascapemrosesan,
00:10:25memilih model TTS, konfigurasi, dan prapemrosesan yang bagus,
00:10:34serta menyusun kosakata dengan cermat agar dapat dipahami bersama oleh bot dan pengguna,
00:10:38serta mengelola latensi deteksi giliran bicara dan penentuan giliran bicara dengan baik.
00:10:46Sangat penting juga jika kita bisa melakukan deteksi dan penanganan emosi dengan baik,
00:10:52serta retensi konteks. Maksud saya dengan konteks di sini adalah konteks mengenai semua hal ini.
00:10:59Dan yang terpenting, ini harus dinamis karena situasi selalu berubah sepanjang panggilan.
00:11:07Jadi kita harus melakukan pengelolaan ini secara dinamis seiring berjalannya waktu
00:11:16untuk berbagai tipe orang.
00:11:21Anak-anak atau tipe orang yang berbeda seperti ini akan memiliki ekspektasi berbeda yang harus kita penuhi,
00:11:24tidak hanya saat mereka senang, tetapi juga saat mereka sedang tidak senang.
00:11:32Hanya dengan begitu Anda dapat mewujudkan orkestrasi Voice AI yang dinamis dan benar-benar terukur.
00:11:36Jadi ini adalah tugas yang sangat sulit untuk dilakukan.
00:11:42Kita selalu mengatakan bahwa suara adalah cara komunikasi paling alami, tetapi kenyataannya tidak mudah.
00:11:48Di balik layar, keberhasilan ini adalah berkat orkestrasi linguistik.
00:11:54Ketika bot Anda tidak mahir dalam hal ini, itu akan menjadi kegagalan fatal.
00:11:59Memperhatikan kerangka kerja linguistik ini memiliki banyak implikasi bisnis, karena Anda dapat
00:12:07mengurangi rasa frustrasi pengguna, kegagalan tugas, pengalihan ke agen langsung, panggilan yang dibatalkan, atau kegagalan tak terdeteksi.
00:12:17Di ServiceNow, kami telah membuat tolok ukur end-to-end yang bagus bernama EVA Bench, jadi Anda dapat menggunakannya untuk mendiagnosis status agen suara Anda.
00:12:28Poin-poin penting:
00:12:43Voice AI adalah aktivitas bersama
00:12:45antara bot dan pengguna, bukan sekadar alur proses tunggal.
00:12:49Dan kita harus melayani kebutuhan pengguna dalam beberapa lapisan secara langsung (real-time).
00:12:54Bukan berarti saya memberikan solusi instan hari ini, karena hal seperti itu tidak ada.
00:12:59Solusi itu ada pada diri Anda dan sistem Anda.
00:13:04Namun yang saya berikan hari ini adalah kerangka kerja linguistik yang bisa Anda gunakan
00:13:10untuk mendiagnosis sistem dan membangun sistem Anda.
00:13:16Anda dapat mencoba EVA, tetapi Anda juga dapat mempelajari linguistik dan merekrut ahli linguistik.
00:13:21Hal lain yang ingin saya ingatkan adalah bahwa
00:13:28implikasi bisnis adalah implikasi linguistik, dan sebaliknya,
00:13:31dalam ranah Voice AI ini,
00:13:35karena suara pada dasarnya adalah pengalaman linguistik, sangat manusiawi, dan kognitif.
00:13:37Saya ingin mengajukan pertanyaan jangka panjang kepada Anda.
00:13:45Penutur itu beradaptasi. Saya cukup yakin bahwa dalam sesi ceramah saya dengan Anda hari ini,
00:13:50Anda telah mempelajari sesuatu tentang saya, gaya bicara saya, dan logat yang saya gunakan,
00:13:59serta jenis kata yang saya pakai. Jadi lain kali jika kita bertemu langsung, Anda akan merasa lebih nyaman
00:14:05berbicara dengan saya karena Anda telah memperhatikan saya, bukan? Penutur selalu beradaptasi, jadi pengguna
00:14:12akan beradaptasi dengan agen suara Anda di sepanjang panggilan. Jadi apakah sistem Anda siap agar mereka dapat
00:14:18menggunakan agen suara Anda dengan lebih baik di lain kesempatan?
00:14:27Bahasa juga selalu berubah. Apakah agen suara Anda siap menghadapi perubahan bahasa dalam satu tahun atau bahkan enam bulan ke depan?
00:14:31Apakah agen suara Anda akan menjadi lebih baik di lain kesempatan? Terima kasih.
00:14:44Terima kasih.
00:14:57Terima kasih.
00:14:57Terima kasih.
00:14:57Terima kasih.
00:15:04Terima kasih.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video