"اسمي هو... اسمي هو...": خريطة لغوية لوكلاء الصوت — ميدام كيم، سيرفيس نود

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00مرحباً بالجميع. اسمي ميدام كيم. أنا مهندسة تعلم آلة في ServiceNow، وسوف
00:00:25أتحدث عن إطار عمل لغوي للذكاء الاصطناعي الصوتي. نبذة سريعة عن خلفيتي لتعرفوا
00:00:37من أين أتيحت لي هذه الخبرة. كما قلت، أنا مهندسة تعلم آلة في ServiceNow، ولكنني
00:00:42أيضاً باحثة شغوفة مدى الحياة في التواصل الصوتي الواقعي في بيئته الطبيعية. وشعاري
00:00:48هو تطبيق علم اللغويات، وما سأقوم به اليوم هو تقديم
00:00:54منظور علم اللغويات لكم. هل شهدتم من قبل إخفاقات في الذكاء الاصطناعي الصوتي؟ نعم، مثل
00:01:05الجميع تقريباً. لذا، سأعرض مثالاً مررت به شخصياً. حيث
00:01:15سألني الروبوت: “هل يمكنك تهجئة اسمك الأول من فضلك؟” فبدأت أهجئ اسمي ببطء.
00:01:22نعم، إنه M-I-D-A-M. فقال الروبوت: “للتأكيد معك، هل هو M-I-D-A-N؟” فقلت: “لا، إنه M-I-D-A-M.”
00:01:40ثم شعرت ببعض الانزعاج، بل بازدياد الانزعاج، لأن اسمي M-I-D-A-M وليس M-I-D-A-N. ثم سألني: “الان، ما هو رقم حسابك؟” فبدأت أشعر بالارتباك. ما هو رقم الحساب هذا؟ ثم حاولت البحث عن تلك المعلومة. حاولت العثور على المعلومات الخاصة بذلك.
00:02:09أي واحد؟ لا بد أنه كذا، وبدأت أهجئ رقم الحساب ببطء. إنه A-X-4-5-1. ثم أخذت وقتاً لأنني لست معتادة على قراءة هذا الرقم الغريب. فقاطعني الروبوت وقال: “لم أتمكن من العثور على سجلّك.” ودون حتى
00:02:14أن يحاول، طلب مني تكرار ذلك مجدداً. “هل يمكنك تكرار ذلك من فضلك؟” فشعرت بالتوتر، “لم أتمكن من العثور على سجلّك.” ثم قال: “لم أتمكن من العثور على سجلّك.” ودون محاولة حتى، طلب مني تكرار ذلك مجدداً. “هل يمكنك تكرار ذلك من فضلك؟” فشعرت بالاحباط. ثم قال: “لم أتمكن من العثور على سجلّك.” وبعد ذلك،
00:02:21A, X, 4, 5, 1 ثم أخذت وقتاً لأنني لست معتادة على قراءة هذا
00:02:30الرقم الغريب، فقاطعني الروبوت وقال: لم أتمكن من العثور على
00:02:36سجلك، ودون أن يحاول حتى، طلب مني كرر ذلك مجدداً: هل يمكنك
00:02:42تكرار ذلك من فضلك؟ لشعرت بالانزعاج الشديد وقالت: هل يمكنني التحدث
00:02:46إلى شخص حقيقي؟ لا أريد التعامل معك بعد الآن. هذا نمط
00:02:51شائع جداً في الذكاء الاصطناعي الصوتي للأسف في هذه المرحلة. لذا أريد
00:02:57فقط استكشاف كيفية حل هذه المشكلة باستخدام علم اللغويات. فالذكاء الاصطناعي الصوتي
00:03:06يشهد طفرة كبيرة، لكن المستخدمين غالباً ما يفضلون الوكلاء البشريين على الوكلاء
00:03:11الصوتيين. كيف يمكننا الحد من هذه المشكلة؟ ولكن في المقام الأول، ما هي
00:03:19المشكلات الفعلية؟ أعتقد أنه يمكننا التفكير في إطار عمل أساسي
00:03:25لفهم هذه البنية الشاملة للذكاء الاصطناعي الصوتي، والمسمى علم اللغويات. وكما
00:03:35نعلم جميعاً بالفعل، التواصل البشري نشاط مشترك، مثل
00:03:41الشيء الذي نقوم به الآن. أقدم لكم أصواتي وكلماتي، فتسمعونها،
00:03:48وإذا كانت محادثة، ستعطونني أصواتكم وكلماتكم،
00:03:53وهذا يذهب ويجيء من خلال التفاعل. وخلال هذه
00:04:02العملية، نقوم باستمرار بمعالجة وتحديث نماذجنا الذهنية. إذن، هذا
00:04:09نشاط مشترك للتواصل البشري. وأود أن أقول إنه في التواصل مع الذكاء الاصطناعي
00:04:18الصوتي، يجب أن يكون أيضاً نشاطاً مشتركاً كهذا، لأن هذا هو
00:04:25الشيء الوحيد الذي نعرفه عن التواصل البشري. كبشر، لقد
00:04:30تطورنا عبر آلاف السنين كمتواصلين، وهذا ما نعرفه،
00:04:35لذا نتوقع الأمر نفسه من الروبوتات. دعوني أستعرض مشهد الإخفاق في مكالمتي
00:04:45مع الوكيل الصوتي ضمن هذا الإطار. كما ترون، هناك الاستماع والتحدث لكل
00:04:53طرف. لقد بدأت بتهجئة اسمي الأول، ولكن الروبوت لم يسمع
00:05:04الفرق بين M و N بشكل صحيح. إذن فهذا إخفاق في تحويل الكلام إلى نص على مستوى الاستماع، ثم تطبق تقنية تحويل النص إلى كلام
00:05:14قواعد قراءة إنجليزية بحتة على اسمي، فتُقرأ M-I-D-A-M كـ “ميدام” في النسخة
00:05:22الإنجليزية الأمريكية. لذا شعرت بالارتباك، لكنني في هذه المرة كنت متسامحة لأن هذا
00:05:29يحدث كثيراً حتى مع البشر، فلا بأس. ولكن عندما طرح
00:05:36موضوع رقم الحساب، وبما أنني لا أعرف ما هو، ارتبكت مجدداً، لكنني متكيفة ويمكنني البحث
00:05:44عنه. وجدت الرقم وبدأت بقرائته، لكن تقنية تحويل الكلام إلى نص لم تتعرف على وحدة الكلمة
00:05:52بشكل صحيح، فقاطعني، وفي النهاية تحدث فوق صوتي، مما أثار غضبي شديداً.
00:06:06وعندما طلب مني تكرار المعلومات نفسها، أصلح من الواضح
00:06:14أن هذا الروبوت لا يتابع النموذج الذهني معي، وبوقاحة شديدة، لم يحاول حتى
00:06:22استخدام التوضيح التفاعلي، وهو استراتيجية شائعة لدى البشر. لذا لم أعد أريد التعامل
00:06:28مع هذا بعد الآن، وقلت: هل يمكنني التحدث إلى شخص حقيقي؟ دعونا نراجع إطار العمل مجدداً، فهذه هي
00:06:38المكونات اللغوية المتوقعة والمحافظ عليها جيداً في المحادثة بين البشر.
00:06:47فهناك قنوات استماع، قناة الاستماع وقناة التحدث، وهناك مكونات مختلفة
00:06:52مثل الأصوات، والكلمات، والتفاعل، والنموذج الذهني. المكون الأول هو: هل يتعرف الروبوت على كلام
00:06:59المستخدم بشكل جيد؟ وكل هذه المصطلحات التقنية تندرج تحت هذا البند، ثم يأتي هذا
00:07:09المكون الثاني وهو الكلمات في قناة الاستماع: هل يفهم الروبوت كلمات المستخدم؟
00:07:17والثالث هو: هل ينتظر الروبوت التوقيت المناسب لدوره؟ وسيكون ذلك متعلقاً بالتفاعل عبر قناة الاستماع.
00:07:28والجزء الأخير هو النموذج الذهني: هل يفهم الروبوت قصد المستخدم في جزء الاستماع؟
00:07:38ويمكننا الانتقال أيضاً إلى قناة التحدث: ستتكون من النطق بالنسبة للصوت،
00:07:43وأيضاً، هل يفهم الروبوت الكلمات التي يستخدمها المستمعون؟ وهل يختار الروبوت الكلمات التي يمكن للمستخدم فهمها؟
00:07:53وفي جزء التفاعل، هل يتحدث الروبوت في التوقيت المناسب؟ وأخيراً، هل يتحدث الروبوت
00:08:01بالمعلومات التي يحتاجها المستخدم بالفعل؟
00:08:05لذا هناك الكثير من المصطلحات الهندسية أو اللغوية أو العلوم المعرفية الموجودة هنا،
00:08:13ويمكنكم الآن رؤية أن لكل منها مكانه الصحيح في هذا الإطار اللغوي.
00:08:23والأهم من ذلك، هذه المكونات مترابطة وليست منفصلة أو مستقلة عن بعضها البعض،
00:08:30فهي مترابطة ومتناسقة. فعندما تريد تحقيق جودة عالية في الأصوات،
00:08:36عليك التفكير في مستوى الكلمات، وعندما تريد تحسين هذه الأصوات والكلمات،
00:08:43عليك أيضاً مراعاة التفاعل، مثل تبادل الأدوار أو كشف الدور.
00:08:50وأخيراً، ترغب في تحقيق إنجاز جيد للمهمة، وهو هدف طبقة النموذج الذهني هذه، وحينها عليك امتلاك كل هذا.
00:09:02ودون كل ذلك، أو دون أي من هذه المكونات، سيفشل وكيلك الصوتي.
00:09:09وفي النهاية، يجب أن تتناسق بشكل جيد، يجب أن تتوافق جميعها تماماً.
00:09:17بالإضافة إلى ذلك، يجب أن تضع في اعتبارك أن هذا يحدث عبر خط زمني.
00:09:26وما أعنيه بذلك هو أنه يُتتبع ضمنياً، بخلاف الدردشة النصية، حيث ترى سجل ما قيل
00:09:34كنص، بينما في تجربة الوكيل الصوتي، تقول شيئاً ويقول الروبوت شيئاً، وتتبادلان الحديث،
00:09:45ثم انظروا، كل هذه الموجات الصوتية والاهتزازات في الهواء تتلاشى جميعها،
00:09:53ولا يبقى سوى النموذج الذهني للمستخدم، وهذا هو المهم.
00:10:00فالأصوات والكلمات والتفاعلات تتلاشى لحظة النطق بها،
00:10:04لكن النموذج الذهني يستمر وينمو على مدار الخط الزمني.
00:10:09إذن هذا ما يجب أن
00:10:12تستهدفه لتحقيق رضا المستخدم.
00:10:16وما الذي يمكننا فعله
00:10:19ليصل الروبوت إلى مستوى معايير المستخدم؟
00:10:25ما يمكننا فعله يتضمن بالطبع اختيار نماذج أو إعدادات جيدة للتعرف على الكلام، وإجراء بعض المعالجة اللاحقة،
00:10:34واختيار نماذج وإعدادات جيدة لتحويل النص إلى كلام، وإجراء المعالجة الأولية،
00:10:38وانتقاء المفردات بعناية بحيث تكون مشتركة بين الروبوت والمستخدم،
00:10:46والقيام بعمل جيد في كشف وقت استجابة التناوب وتبادل الأدوار.
00:10:52ومن المهم جداً أنه سيكون من الرائع لو استطعنا التعرف على المشاعر والتعامل معها بشكل جيد،
00:10:59وكذلك الاحتفاظ بالسياق، وما أعنيه بالسياق هو السياق المتعلق بكل هذه الأمور.
00:11:07والأهم من ذلك، يجب أن يكون ديناميكياً لأن الأشياء تتغير دائماً طوال مدة المكالمة،
00:11:16لذا سيتوجب علينا إجراء هذه الإدارة ديناميكياً على طول الخط الزمني
00:11:21لمختلف أنواع الأشخاص.
00:11:24فالأطفال أو الفئات المختلفة من الناس سيكون لديهم توقعات مختلفة يتوجب علينا تلبيتها،
00:11:32ليس فقط عندما يكونون سعداء، بل وأيضاً عندما لا يكونونككذلك.
00:11:36وحينها فقط يمكنك السعي إلى تنسيق ديناميكي وقابل للتوسع حقاً للذكاء الاصطناعي الصوتي.
00:11:42إنها مهمة صعبة للغاية.
00:11:48نحن نقول دائماً إن الصوت هو أسلوب التواصل الأكثر طبيعية، ولكن الأمر ليس سهلاً في الواقع،
00:11:54فكواليس الأمر تنجح بفضل هذا التنسيق اللغوي.
00:11:59وعندما لا يجيد روبوتك ذلك، فإن النتيجة تكون فشلاً ذريعاً.
00:12:07لذا، فإن الاهتمام بهذا الإطار اللغوي سيكون له العديد من الآثار التجارية، لأنك ستتمكن من
00:12:17تقليل كل حالات إحباط المستخدمين، وفشل المهام، والتصعيد إلى وكلاء بشرية، والمكالمات المتروكة، والإخفاقات الصامتة.
00:12:28في ServiceNow، أنشأنا قياساً مرجعياً شاملاً ممتازاً يُدعى Eva Bench، ويمكنكم تجريبه لتشخيص حالة الوكيل الصوتي لديكم.
00:12:43أبرز النقاط المستفادة:
00:12:45الذكاء الاصطناعي الصوتي هو نشاط مشترك
00:12:49بين الروبوت والمستخدم، وليس مجرد تسلسل خطي،
00:12:54ويجب أن نلبي احتياجات المستخدمين على مستويات متعددة في الوقت الفعلي.
00:12:59الأمر ليس أنني قدمت لكم حلاً سحرياً اليوم، لأنه لا يوجد شيء من هذا القبيل،
00:13:04بل إن الحل يكمن فيكم وفي نظامكم.
00:13:10لكن ما قدمته لكم اليوم هو الإطار اللغوي الذي يمكنكم تجريبه
00:13:16لتشخيص نظامكم وبناء نظامكم عليه.
00:13:21يمكنكم تجربة Eva، ولكن يمكنكم أيضاً تعلم اللغويات وتوظيف لغويين.
00:13:28وهناك أمر آخر أريد تذكيركم به، وهو أن
00:13:31الآثار التجارية هي آثار لغوية والعكس بالعكس
00:13:35في مجال الذكاء الاصطناعي الصوتي،
00:13:37لأن الصوت تجربة لغوية وبشرية ومعرفية في جوهرها.
00:13:45أود أن أطرح عليكم سؤالاً طويل المدى:
00:13:50المتحدثون يتكيفون، لذا أنا متأكدة من أنكم في هذا الحديث اليوم
00:13:59قد تعلمتم شيئاً عني، وعن أسلوبي في الحديث، ونوع الكلمات التي أستخدمها،
00:14:05لذا في المرة القادمة التي ألتقي بكم فيها شخصياً، ستجدون الأمر أكثر راحة في
00:14:12التحدث إلي لأنكم أعطيتموني اهتمامكم، أليس كذلك؟ المتحدثون يتكيفون دائماً، لذا فالمستخدم
00:14:18سيتكيف مع الوكيل الصوتي لديكم طوال المكالمة. فهل نظامكم مستعد ليتيح لهم
00:14:27استخدام الوكيل الصوتي بشكل أفضل في المرة القادمة؟
00:14:31واللغات تتغير دائماً، فهل الوكيل الصوتي لديكم جاهز للتغير اللغوي خلال عام أو حتى ستة أشهر؟
00:14:44هل أصبح الوكيل الصوتي أداءه أفضل في المرة القادمة؟ شكراً لكم.
00:14:57شكراً لكم.
00:14:57شكراً لكم.
00:14:57شكراً لكم.
00:15:04شكراً.

핵심 요약

يتطلب نجاح الذكاء الاصطناعي الصوتي تطبيق إطار عمل لغوي متكامل يربط بين معالجة الصوت، واختيار المفردات، وإدارة التفاعل الديناميكي لبناء نموذج ذهني مستمر لدى المستخدم.

하이라이트

  • التواصل البشري والصوتي مع الذكاء الاصطناعي هو نشاط تفاعلي مشترك يعتمد على المعالجة المستمرة والتحديث الفوري للنماذج الذهنية.

  • يتسبب الفشل في إدراك الفروق الصوتية بين الحروف المتقاربة مثل M و N في انقطاع سلسلة التواصل وإحباط المستخدم.

  • الموجات الصوتية والاهتزازات تلتغي لحظة النطق بها، بينما يبقى النموذج الذهني للمستخدم وينمو طوال مدة المكالمة.

  • تحسين جودة الوكلاء الصوتيين يتطلب تنسيقًا ديناميكيًا بين طبقات الأصوات، والكلمات، وإدارة التفاعل، والنموذج الذهني.

  • التطوير اللغوي السليم لنظم الذكاء الاصطناعي الصوتي يقلل من الفشل الفني والمكالمات المتروكة ونسب التحويل إلى وكلاء بشر.

타임라인

إخفاقات الأنظمة الصوتية الحالية في التعامل مع التفاعل البشري

  • الأنظمة الصوتية الحالية تفشل في التعرف الدقيق على تهجئة الأسماء والرموز المركبة.
  • قاطعت البرمجيات الصوتية المستخدمين أثناء البحث عن البيانات تزامنًا مع غياب آليات التوضيح التفاعلي.
  • يفضل المستخدمون التحويل إلى وكلاء بشر نتيجة تدني مستوى الاستجابة والتكدر الناجم عن التكرار.

تظهر تجارب المستخدمين إخفاقات متكررة عند تهجئة الأسماء الحاوية على أحرف متقاربة نطقًا أو عند قراءة أرقام الحسابات غير المعتادة. تتسبب المقاطعة المبكرة من قبل النظام أثناء التفكير أو البحث عن المعلومة في إنهاء المحادثة والطلب المباشر للتحدث مع عنصر بشري. يعود هذا السلوك إلى التعامل مع المكالمة كعملية إدخال آلي بدلاً من كونه تواصلًا مرنًا.

التواصل الصوتي كنشاط تفاعلي مشترك لبناء النموذج الذهني

  • التواصل البشري يتكون من تبادل الأصوات والكلمات لتحديث النماذج الذهنية لدى الطرفين.
  • تتلاشى الإشارات الصوتية في الهواء بينما يستقر النموذج الذهني المتكون في ذهن المستمع.
  • أخطاء تحويل الكلام إلى نص وتقنيات النطق الآلي تفكك سياق الفهم المشترك.

يتطور التواصل عبر تبادل الرسائل وتحديث التصورات الذهنية بمرور الوقت. تؤدي أخطاء التعرف على الكلمات وتطبيق قواعد النطق غير المناسبة لأسماء المستخدمين إلى إرباك نموذج الفهم. يتطلب بناء تجربة ناجحة تركيز الأنظمة على إدارة هذا النموذج الذهني المستمر بدلاً من الاقتصار على المعالجة اللحظية للموجات الصوتية.

عناصر الإطار العملي اللغوي للذكاء الاصطناعي الصوتي

  • يتوزع الإطار اللغوي على قناتي الاستماع والتحدث عبر أربعة مستويات: الأصوات، الكلمات، التفاعل، والنموذج الذهني.
  • مستويات الإطار اللغوي مترابطة وتتطلب التنسيق الكامل لضمان نجاح مهمة الوكيل الصوتي.
  • الهدف النهائي للأنظمة الصوتية هو تتبع وتحديث النموذج الذهني عبر الخط الزمني للمكالمة.

يشمل الإطار اللغوي قناة الاستماع للتعرف على الأصوات، واستيعاب المفردات، وتحديد توقيت التناوب، وفهم القصد. وفي قناة التحدث، يتطلب الإطار نطقًا صحيحًا، واختيارًا للمفردات المناسبة للمستخدم، وضبطًا لتوقيت الكلام تقديمًا للمعلومات المطلوبة. غياب أي مكون من هذه المكونات المترابطة يؤدي إلى فشل النظام الصوتي بكامله.

إدارة التفاعل الديناميكي والأثر التجاري للتنسيق اللغوي

  • تستلزم إدارة المكالمات ضبطًا ديناميكيًا يلائم اختلاف الفئات العمرية والحالات العاطفية للمستخدمين.
  • الاهتمام بالتأسيس اللغوي للذكاء الاصطناعي يقلل من المكالمات المتروكة وإخفاقات المهام الصامتة.
  • تتغير اللغات وتتكيف أنماط المتحدثين، مما يتطلب أنظمة صوتية قابلة للتطور والتكيف المستمر.

يتطلب التطبيق العملي اختيار نماذج دقيقة للتعرف على الكلام والمعالجة اللاحقة، مع انتقاء مفردات مشتركة وضبط كشف أدوار الحديث. ينعكس هذا الضبط اللغوي مباشرة على النتائج التجارية من خلال خفض معدلات تصعيد المكالمات للبشر وتقليل إحباط المستخدمين. تظل الأنظمة بحاجة إلى التكيف المستمر مع تغير سلوكيات المتحدثين والتطور اللغوي عبر الزمن.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기