"اسمي هو... اسمي هو...": خريطة لغوية لوكلاء الصوت — ميدام كيم، سيرفيس نود
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00مرحباً بالجميع. اسمي ميدام كيم. أنا مهندسة تعلم آلة في ServiceNow، وسوف
00:00:25أتحدث عن إطار عمل لغوي للذكاء الاصطناعي الصوتي. نبذة سريعة عن خلفيتي لتعرفوا
00:00:37من أين أتيحت لي هذه الخبرة. كما قلت، أنا مهندسة تعلم آلة في ServiceNow، ولكنني
00:00:42أيضاً باحثة شغوفة مدى الحياة في التواصل الصوتي الواقعي في بيئته الطبيعية. وشعاري
00:00:48هو تطبيق علم اللغويات، وما سأقوم به اليوم هو تقديم
00:00:54منظور علم اللغويات لكم. هل شهدتم من قبل إخفاقات في الذكاء الاصطناعي الصوتي؟ نعم، مثل
00:01:05الجميع تقريباً. لذا، سأعرض مثالاً مررت به شخصياً. حيث
00:01:15سألني الروبوت: “هل يمكنك تهجئة اسمك الأول من فضلك؟” فبدأت أهجئ اسمي ببطء.
00:01:22نعم، إنه M-I-D-A-M. فقال الروبوت: “للتأكيد معك، هل هو M-I-D-A-N؟” فقلت: “لا، إنه M-I-D-A-M.”
00:01:40ثم شعرت ببعض الانزعاج، بل بازدياد الانزعاج، لأن اسمي M-I-D-A-M وليس M-I-D-A-N. ثم سألني: “الان، ما هو رقم حسابك؟” فبدأت أشعر بالارتباك. ما هو رقم الحساب هذا؟ ثم حاولت البحث عن تلك المعلومة. حاولت العثور على المعلومات الخاصة بذلك.
00:02:09أي واحد؟ لا بد أنه كذا، وبدأت أهجئ رقم الحساب ببطء. إنه A-X-4-5-1. ثم أخذت وقتاً لأنني لست معتادة على قراءة هذا الرقم الغريب. فقاطعني الروبوت وقال: “لم أتمكن من العثور على سجلّك.” ودون حتى
00:02:14أن يحاول، طلب مني تكرار ذلك مجدداً. “هل يمكنك تكرار ذلك من فضلك؟” فشعرت بالتوتر، “لم أتمكن من العثور على سجلّك.” ثم قال: “لم أتمكن من العثور على سجلّك.” ودون محاولة حتى، طلب مني تكرار ذلك مجدداً. “هل يمكنك تكرار ذلك من فضلك؟” فشعرت بالاحباط. ثم قال: “لم أتمكن من العثور على سجلّك.” وبعد ذلك،
00:02:21A, X, 4, 5, 1 ثم أخذت وقتاً لأنني لست معتادة على قراءة هذا
00:02:30الرقم الغريب، فقاطعني الروبوت وقال: لم أتمكن من العثور على
00:02:36سجلك، ودون أن يحاول حتى، طلب مني كرر ذلك مجدداً: هل يمكنك
00:02:42تكرار ذلك من فضلك؟ لشعرت بالانزعاج الشديد وقالت: هل يمكنني التحدث
00:02:46إلى شخص حقيقي؟ لا أريد التعامل معك بعد الآن. هذا نمط
00:02:51شائع جداً في الذكاء الاصطناعي الصوتي للأسف في هذه المرحلة. لذا أريد
00:02:57فقط استكشاف كيفية حل هذه المشكلة باستخدام علم اللغويات. فالذكاء الاصطناعي الصوتي
00:03:06يشهد طفرة كبيرة، لكن المستخدمين غالباً ما يفضلون الوكلاء البشريين على الوكلاء
00:03:11الصوتيين. كيف يمكننا الحد من هذه المشكلة؟ ولكن في المقام الأول، ما هي
00:03:19المشكلات الفعلية؟ أعتقد أنه يمكننا التفكير في إطار عمل أساسي
00:03:25لفهم هذه البنية الشاملة للذكاء الاصطناعي الصوتي، والمسمى علم اللغويات. وكما
00:03:35نعلم جميعاً بالفعل، التواصل البشري نشاط مشترك، مثل
00:03:41الشيء الذي نقوم به الآن. أقدم لكم أصواتي وكلماتي، فتسمعونها،
00:03:48وإذا كانت محادثة، ستعطونني أصواتكم وكلماتكم،
00:03:53وهذا يذهب ويجيء من خلال التفاعل. وخلال هذه
00:04:02العملية، نقوم باستمرار بمعالجة وتحديث نماذجنا الذهنية. إذن، هذا
00:04:09نشاط مشترك للتواصل البشري. وأود أن أقول إنه في التواصل مع الذكاء الاصطناعي
00:04:18الصوتي، يجب أن يكون أيضاً نشاطاً مشتركاً كهذا، لأن هذا هو
00:04:25الشيء الوحيد الذي نعرفه عن التواصل البشري. كبشر، لقد
00:04:30تطورنا عبر آلاف السنين كمتواصلين، وهذا ما نعرفه،
00:04:35لذا نتوقع الأمر نفسه من الروبوتات. دعوني أستعرض مشهد الإخفاق في مكالمتي
00:04:45مع الوكيل الصوتي ضمن هذا الإطار. كما ترون، هناك الاستماع والتحدث لكل
00:04:53طرف. لقد بدأت بتهجئة اسمي الأول، ولكن الروبوت لم يسمع
00:05:04الفرق بين M و N بشكل صحيح. إذن فهذا إخفاق في تحويل الكلام إلى نص على مستوى الاستماع، ثم تطبق تقنية تحويل النص إلى كلام
00:05:14قواعد قراءة إنجليزية بحتة على اسمي، فتُقرأ M-I-D-A-M كـ “ميدام” في النسخة
00:05:22الإنجليزية الأمريكية. لذا شعرت بالارتباك، لكنني في هذه المرة كنت متسامحة لأن هذا
00:05:29يحدث كثيراً حتى مع البشر، فلا بأس. ولكن عندما طرح
00:05:36موضوع رقم الحساب، وبما أنني لا أعرف ما هو، ارتبكت مجدداً، لكنني متكيفة ويمكنني البحث
00:05:44عنه. وجدت الرقم وبدأت بقرائته، لكن تقنية تحويل الكلام إلى نص لم تتعرف على وحدة الكلمة
00:05:52بشكل صحيح، فقاطعني، وفي النهاية تحدث فوق صوتي، مما أثار غضبي شديداً.
00:06:06وعندما طلب مني تكرار المعلومات نفسها، أصلح من الواضح
00:06:14أن هذا الروبوت لا يتابع النموذج الذهني معي، وبوقاحة شديدة، لم يحاول حتى
00:06:22استخدام التوضيح التفاعلي، وهو استراتيجية شائعة لدى البشر. لذا لم أعد أريد التعامل
00:06:28مع هذا بعد الآن، وقلت: هل يمكنني التحدث إلى شخص حقيقي؟ دعونا نراجع إطار العمل مجدداً، فهذه هي
00:06:38المكونات اللغوية المتوقعة والمحافظ عليها جيداً في المحادثة بين البشر.
00:06:47فهناك قنوات استماع، قناة الاستماع وقناة التحدث، وهناك مكونات مختلفة
00:06:52مثل الأصوات، والكلمات، والتفاعل، والنموذج الذهني. المكون الأول هو: هل يتعرف الروبوت على كلام
00:06:59المستخدم بشكل جيد؟ وكل هذه المصطلحات التقنية تندرج تحت هذا البند، ثم يأتي هذا
00:07:09المكون الثاني وهو الكلمات في قناة الاستماع: هل يفهم الروبوت كلمات المستخدم؟
00:07:17والثالث هو: هل ينتظر الروبوت التوقيت المناسب لدوره؟ وسيكون ذلك متعلقاً بالتفاعل عبر قناة الاستماع.
00:07:28والجزء الأخير هو النموذج الذهني: هل يفهم الروبوت قصد المستخدم في جزء الاستماع؟
00:07:38ويمكننا الانتقال أيضاً إلى قناة التحدث: ستتكون من النطق بالنسبة للصوت،
00:07:43وأيضاً، هل يفهم الروبوت الكلمات التي يستخدمها المستمعون؟ وهل يختار الروبوت الكلمات التي يمكن للمستخدم فهمها؟
00:07:53وفي جزء التفاعل، هل يتحدث الروبوت في التوقيت المناسب؟ وأخيراً، هل يتحدث الروبوت
00:08:01بالمعلومات التي يحتاجها المستخدم بالفعل؟
00:08:05لذا هناك الكثير من المصطلحات الهندسية أو اللغوية أو العلوم المعرفية الموجودة هنا،
00:08:13ويمكنكم الآن رؤية أن لكل منها مكانه الصحيح في هذا الإطار اللغوي.
00:08:23والأهم من ذلك، هذه المكونات مترابطة وليست منفصلة أو مستقلة عن بعضها البعض،
00:08:30فهي مترابطة ومتناسقة. فعندما تريد تحقيق جودة عالية في الأصوات،
00:08:36عليك التفكير في مستوى الكلمات، وعندما تريد تحسين هذه الأصوات والكلمات،
00:08:43عليك أيضاً مراعاة التفاعل، مثل تبادل الأدوار أو كشف الدور.
00:08:50وأخيراً، ترغب في تحقيق إنجاز جيد للمهمة، وهو هدف طبقة النموذج الذهني هذه، وحينها عليك امتلاك كل هذا.
00:09:02ودون كل ذلك، أو دون أي من هذه المكونات، سيفشل وكيلك الصوتي.
00:09:09وفي النهاية، يجب أن تتناسق بشكل جيد، يجب أن تتوافق جميعها تماماً.
00:09:17بالإضافة إلى ذلك، يجب أن تضع في اعتبارك أن هذا يحدث عبر خط زمني.
00:09:26وما أعنيه بذلك هو أنه يُتتبع ضمنياً، بخلاف الدردشة النصية، حيث ترى سجل ما قيل
00:09:34كنص، بينما في تجربة الوكيل الصوتي، تقول شيئاً ويقول الروبوت شيئاً، وتتبادلان الحديث،
00:09:45ثم انظروا، كل هذه الموجات الصوتية والاهتزازات في الهواء تتلاشى جميعها،
00:09:53ولا يبقى سوى النموذج الذهني للمستخدم، وهذا هو المهم.
00:10:00فالأصوات والكلمات والتفاعلات تتلاشى لحظة النطق بها،
00:10:04لكن النموذج الذهني يستمر وينمو على مدار الخط الزمني.
00:10:09إذن هذا ما يجب أن
00:10:12تستهدفه لتحقيق رضا المستخدم.
00:10:16وما الذي يمكننا فعله
00:10:19ليصل الروبوت إلى مستوى معايير المستخدم؟
00:10:25ما يمكننا فعله يتضمن بالطبع اختيار نماذج أو إعدادات جيدة للتعرف على الكلام، وإجراء بعض المعالجة اللاحقة،
00:10:34واختيار نماذج وإعدادات جيدة لتحويل النص إلى كلام، وإجراء المعالجة الأولية،
00:10:38وانتقاء المفردات بعناية بحيث تكون مشتركة بين الروبوت والمستخدم،
00:10:46والقيام بعمل جيد في كشف وقت استجابة التناوب وتبادل الأدوار.
00:10:52ومن المهم جداً أنه سيكون من الرائع لو استطعنا التعرف على المشاعر والتعامل معها بشكل جيد،
00:10:59وكذلك الاحتفاظ بالسياق، وما أعنيه بالسياق هو السياق المتعلق بكل هذه الأمور.
00:11:07والأهم من ذلك، يجب أن يكون ديناميكياً لأن الأشياء تتغير دائماً طوال مدة المكالمة،
00:11:16لذا سيتوجب علينا إجراء هذه الإدارة ديناميكياً على طول الخط الزمني
00:11:21لمختلف أنواع الأشخاص.
00:11:24فالأطفال أو الفئات المختلفة من الناس سيكون لديهم توقعات مختلفة يتوجب علينا تلبيتها،
00:11:32ليس فقط عندما يكونون سعداء، بل وأيضاً عندما لا يكونونككذلك.
00:11:36وحينها فقط يمكنك السعي إلى تنسيق ديناميكي وقابل للتوسع حقاً للذكاء الاصطناعي الصوتي.
00:11:42إنها مهمة صعبة للغاية.
00:11:48نحن نقول دائماً إن الصوت هو أسلوب التواصل الأكثر طبيعية، ولكن الأمر ليس سهلاً في الواقع،
00:11:54فكواليس الأمر تنجح بفضل هذا التنسيق اللغوي.
00:11:59وعندما لا يجيد روبوتك ذلك، فإن النتيجة تكون فشلاً ذريعاً.
00:12:07لذا، فإن الاهتمام بهذا الإطار اللغوي سيكون له العديد من الآثار التجارية، لأنك ستتمكن من
00:12:17تقليل كل حالات إحباط المستخدمين، وفشل المهام، والتصعيد إلى وكلاء بشرية، والمكالمات المتروكة، والإخفاقات الصامتة.
00:12:28في ServiceNow، أنشأنا قياساً مرجعياً شاملاً ممتازاً يُدعى Eva Bench، ويمكنكم تجريبه لتشخيص حالة الوكيل الصوتي لديكم.
00:12:43أبرز النقاط المستفادة:
00:12:45الذكاء الاصطناعي الصوتي هو نشاط مشترك
00:12:49بين الروبوت والمستخدم، وليس مجرد تسلسل خطي،
00:12:54ويجب أن نلبي احتياجات المستخدمين على مستويات متعددة في الوقت الفعلي.
00:12:59الأمر ليس أنني قدمت لكم حلاً سحرياً اليوم، لأنه لا يوجد شيء من هذا القبيل،
00:13:04بل إن الحل يكمن فيكم وفي نظامكم.
00:13:10لكن ما قدمته لكم اليوم هو الإطار اللغوي الذي يمكنكم تجريبه
00:13:16لتشخيص نظامكم وبناء نظامكم عليه.
00:13:21يمكنكم تجربة Eva، ولكن يمكنكم أيضاً تعلم اللغويات وتوظيف لغويين.
00:13:28وهناك أمر آخر أريد تذكيركم به، وهو أن
00:13:31الآثار التجارية هي آثار لغوية والعكس بالعكس
00:13:35في مجال الذكاء الاصطناعي الصوتي،
00:13:37لأن الصوت تجربة لغوية وبشرية ومعرفية في جوهرها.
00:13:45أود أن أطرح عليكم سؤالاً طويل المدى:
00:13:50المتحدثون يتكيفون، لذا أنا متأكدة من أنكم في هذا الحديث اليوم
00:13:59قد تعلمتم شيئاً عني، وعن أسلوبي في الحديث، ونوع الكلمات التي أستخدمها،
00:14:05لذا في المرة القادمة التي ألتقي بكم فيها شخصياً، ستجدون الأمر أكثر راحة في
00:14:12التحدث إلي لأنكم أعطيتموني اهتمامكم، أليس كذلك؟ المتحدثون يتكيفون دائماً، لذا فالمستخدم
00:14:18سيتكيف مع الوكيل الصوتي لديكم طوال المكالمة. فهل نظامكم مستعد ليتيح لهم
00:14:27استخدام الوكيل الصوتي بشكل أفضل في المرة القادمة؟
00:14:31واللغات تتغير دائماً، فهل الوكيل الصوتي لديكم جاهز للتغير اللغوي خلال عام أو حتى ستة أشهر؟
00:14:44هل أصبح الوكيل الصوتي أداءه أفضل في المرة القادمة؟ شكراً لكم.
00:14:57شكراً لكم.
00:14:57شكراً لكم.
00:14:57شكراً لكم.
00:15:04شكراً.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video