5 أوضاع لفشل وكلاء الصوت ستواجهها في الأسبوع الأول — فينكي بي، بليف

Transcript

00:00:00دعونا نطرَح بعض الأسئلة السريعة ثم نبدأ مباشرة. كم شخصاً منا في هذه القاعة
00:00:19سبق له بناء وكلاء ذكاء اصطناعي صوتي؟ حسناً، هذا جمهور لا بأس به هنا. وكم عددكم
00:00:28الذي قام ببناء وكلاء ذكاء اصطناعي ونشرهم في بيئة الإنتاج الفعلي؟ ليس سيئاً. حسناً، رائع. إذن سنتحدث
00:00:38عما يحدث عادةً، أليس كذلك؟ مثلما يتحدث الجميع عن وكلاء الذكاء الاصطناعي الصوتي. وكما تعلمون،
00:00:47الحل السحري لكل شيء تقريباً في العالم اليوم هو وكلاء الذكاء الاصطناعي الصوتي. لذا فالجميع
00:00:51يقوم ببناء واحد ويحاول نشره. وهي تبدو رائعة عندما تبنيها نوعاً ما في
00:00:57بيئة التطوير الخاصة بك. ولكن اللحظة التي تنتقل فيها بها من مرحلة إثبات المفهوم إلى الإنتاج،
00:01:03تبدأ الأمور في الفشل. لذا سنستعرض هذه الجوانب الخمسة المختلفة وكيف، أو ما الذي
00:01:09رأيناه في شركة بليفو مع وكلاء الذكاء الاصطناعي الصوتي. ولكن قبل ذلك بقليل، مقدمة سريعة مني. أنا فيكي،
00:01:19المؤسس والرئيس التنفيذي للوكلاء. استخدمت عنوان مدير هندسة الوكلاء. وأنا أطلق على نفسي لقب رئيس مسؤول الوكلاء من
00:01:28منظور المسمى الوظيفي. حسناً، إذن ما هو، ما هو، كما تعلمون، لماذا، لماذا نحن مؤهلون أصلاً لهذه
00:01:35المناقشة وما الذي نراه ولا تتاح للكثير من الشركات فرصة رؤيته؟ لذا سأ...
00:01:42أتحدث قليلاً عن رحلتنا من حيث كيف وصلنا إلى هنا حتى الآن ثم نغوص مباشرة في الموضوع.
00:01:48كما تعلمون، نحن موجودون منذ نحو 14 عاماً. وكانت رحلتنا عبارة عن منصة واجهات برمجة تطبيقات للمطورين.
00:01:54والآن نحن شركة متخصصة في وكلاء الذكاء الاصطناعي. بدأنا بواجهات برمجة تطبيقات الصوت والرسائل النصية القصيرة في عام 2011.
00:02:01والآن، كما تعلمون، نحن نركز بشكل أساسي على تقديم خدمات وكلاء الذكاء الاصطناعي المتكاملة.
00:02:08الحل المتكامل على منصتنا. نحن نشهد أكثر من مليار مكالمة صوتية كل شهر في جميع أنحاء العالم.
00:02:16وهو ما شهدنا من خلاله الكثير من هذه الأنماط تظهر من حيث كيف،
00:02:20عندما نعمل مع عملائنا، ما يحدث لوكلاء الذكاء الاصطناعي الصوتي لديهم في بيئة الإنتاج.
00:02:25نحن فريق يتألف من 90 عضواً، ولدنا 50 مليون دولار من التمويل في البنك. وحقيقة طريفة،
00:02:33هذا ليس من مستثمرين رأس مال مغامر خارجيين. هذا كله ناتج عن كوننا شركة مربحة،
00:02:38حيث قمنا بتدفق تلك الأموال إلى البنك على مدار هذه السنوات.
00:02:42بعض العملاء الذين نخدمهم في جميع أنحاء العالم، لقد تركنا بعض الشعارات هناك،
00:02:49ولكن من منظور العروض بشكل أساسي، يمكنني تصنيف هذا إلى ثلاث فئات مختلفة.
00:02:54الفئة الأولى هي تقديم وكيل ذكاء اصطناعي قابل للبرمجة. نسميه، أعني، إنه خط أنابيب
00:03:00صوتي، وليس منتج تحويل كلام إلى كلام حقيقي بعد، ولكنه عرض قابل للبرمجة.
00:03:05لدينا أيضاً استوديو وكلاء الذكاء الاصطناعي وهو أداة بناء مرئية بدون برمجة. وكما قلت،
00:03:11بدأنا بواجهات برمجة تطبيقات الصوت. لذلك فقد بنينا هذا بوضوح على مدار الـ 14 عاماً الماضية،
00:03:16بما في ذلك ربط خطوط الاتصال (SIP trunking) ولبدء تدفق الصوت. لذا فنحن لا نعتمد على آخرين في مجال
00:03:22الاتصالات أو شبكات المزودين. فهذا هو عملنا الأساسي الذي بنيناه طوال هذه السنوات.
00:03:26وهو الأساس الذي تعلوه منصة وكلاء الذكاء الاصطناعي الخاصة بنا.
00:03:32حسناً. مع ذلك، دعونا ندخل في صلب الموضوع، أليس كذلك؟ والتي أنا متأكد من أنكم بما أنكم جميعاً بنيتم
00:03:39وكلاء ذكاء اصطناعي، فقد رأيتم جميعاً هذا أو بنيتموه بشكل أو بآخر. وسنقضي
00:03:44وقتاً أطول في هذا من حيث كيف يبدو خط العمليات بأكمله، أليس كذلك؟ ما نراه مع
00:03:51العملاء، وأنا متأكد من أنكم لا تستطيعون الارتباط بهذا، هو أن أي شخص يفكر في
00:03:56وكلاء الذكاء الاصطناعي، ما يفعله هو اختيار مجموعة من أدوات التنظيم هذه،
00:04:01ويقوم بعمل جيد جداً، مثل لايف كيت (LiveKit) أو بايب كات (Pipecat)، لبناء وكيل الذكاء الاصطناعي الخاص بهم فوقها. إنهم يعتقدون
00:04:06أن بإمكانهم فقط تنظيم هذه الطبقات الأربع المختلفة، تحويل الكلام إلى نص، نموذج اللغة الكبير (LLM)، وتحويل النص إلى كلام (TTS)
00:04:13مع اكتشاف دور المتحدث في المنتصف ونكون قد انطلقنا. وكأن وكيل الذكاء الاصطناعي الخاص بي يعمل في مرحلة إثبات المفهوم
00:04:19إذن فهو جاهز للعمل في الإنتاج. عادةً هذا ما يحدث. يقومون بقياس
00:04:24أوقات الاستجابة الخاصة بهم ويمكنك رؤية بعض أوقات الاستجابة الإرشادية في هذه الشريحة عند كل طبقة. ويقولون:
00:04:30نعم، تبدو هذه مناسبة لي لما أحتاجه. فلننتقل إذن إلى بيئة الإنتاج. وبعد ذلك يبدأ
00:04:36واقع الإنتاج في الظهور، وترى جميع أنواع أوجه القصور والفشل، والتي
00:04:41سنقضي (معظم الوقت في هذه المحادثة على الأقل) في الحديث عنها. لقد خصصت بعض الوقت
00:04:48في النهاية للأسئلة والأجوبة إذا كنتم ترغبون في طرح أسئلة، لكننا سننتقل مباشرة من
00:04:53هذا إلى أوجه الفشل المختلفة التي نراها. لنبدأ بالأولى والتي يتحدث عنها الجميع.
00:05:01هذا هو وضع الفشل الأكثر حديثاً، وهو التأخير الزمني (Latency). أعتقد أن لدينا
00:05:07القليل من محادثات وكلاء الذكاء الاصطناعي أو محادثات وكلاء الذكاء الاصطناعي الصوتي اليوم. أنا متأكد تماماً من أن الجميع
00:05:12سيتطرقون إلى وضع الفشل المحدّد هذا، ولهذا السبب أطرح هذا الأمر مباشرة
00:05:17فيما يتعلق ببعض الجوانب حول كيف تبدو هذه التجربة بأكملها للمستخدمين، أليس كذلك؟ عادةً،
00:05:26يقيس معظم الناس هذا بالوقت المستغرق حتى سماع أول صوت. أي الوقت الذي يتوقف فيه المستخدمون عن الكلام
00:05:34حتى يبدأ وكيلك في التحدث، أليس كذلك؟ وأعتقد أنكم ربما رأيتم هذا إذا كنتم قد بنيتم وكلاء ذكاء اصطناعي صوتي
00:05:39فيما يتعلق بما يشعر وكأنه أمر جيد أو طبيعي، وما يشعر وكأنه مزعج
00:05:46أو ملحوظ، وبعد ذلك ما يشعر وكأنه مزعج للغاية، وهي خطوات متدرجة مختلفة.
00:05:52نلاحظ أن معظم الناس يريدون أن يكونوا أقل من 550 ملي ثانية لأن ذلك ما تعلن عنه
00:06:00المنصات، أو الحلول، أو الطبقات المختلفة، ولكن أعتقد أن معظمهم ينتهي بهم الأمر بين 750
00:06:07إلى 1.2 ثانية. هذا هو المكان الذي ينتهي فيه مطاف غالبية الناس. أما الذين أداؤهم سيئ حقاً فينتتهي بهم المطاف
00:06:13بأكثر من 1.2 ثانية، وحينها تبدأ في ملاحظة أن المستخدمين يقومون بإنهاء المكالمة. الآن، سأشارك معكم
00:06:19ما رأيناه عملياً في الإنتاج مع العملاء الذين يستخدمون هذا عند طبقات مختلفة، ثم الحلول
00:06:26الخاصة ببعض هذه المشكلات. الطريقة التي نريد التفكير بها في هذه الطبقة هي نوع من التوازن بين ثلاثة أمور: التكلفة، والذكاء، والتأخير الزمني،
00:06:33أليس كذلك؟ ولماذا أطرح هذه الأمور الثلاثة؟ لأنها مترابطة بطريقة ما. أعتقد أن أحد الأمور
00:06:42التي كنت أتحدث عنها مع عدد قليل من الأشخاص في الخارج. أحد الأمور،
00:06:48في العام الماضي، رأينا الكثير من الابتكارات، والكثير من القفزات في الذكاء في جانب نماذج اللغة الكبيرة، أليس كذلك؟
00:06:51وقد جاء معظم الذكاء من حيث التفكير، أو التعلم التعزيزي، وما إلى ذلك.
00:06:58والسخرية في وكلاء الصوت هي أنه يكاد يكون دائماً، يجب أن يكون نموذج اللغة الكبير أو الوكيل المتحدث
00:07:05بخاصية التفكير معطلة لديه، أليس كذلك؟ لذا فإن كل التطورات التي حققناها في طبقة نماذج اللغة الكبيرة في العام الماضي،
00:07:11لا ينطبق أي منها هنا الآن، أليس كذلك؟ من الواضح أن لديك نماذج أفضل يمكنها القيام باتباع التعليمات
00:07:19أو استدعاء الأدوات بشكل أفضل، ولكن تقريبا كل الذكاء الذي تم بناؤه في طبقة التفكير يكون معطلاً افتراضياً إذا كنت تريد أن يكون الأمر سريعاً بما يكفي.
00:07:25إذن فهذه إحدى المفارقات التي نواجهها. فكيف تتوازن إذن بين الذكاء والتكلفة والتأخير الزمني؟
00:07:29دعونا ننظر إلى بعض هذه الخيارات الموجودة في السوق، أليس كذلك؟
00:07:34وأنا أختار نموذج اللغة الكبيرة تحديداً لأنه إذا نظرت إلى الرسم البياني السابق، فإن نموذج اللغة الكبيرة هو
00:07:39نوعاً ما أعلى فئة تأخير زمني تضيف إلى ذلك، أليس كذلك؟ وإذا نظرت إلى النماذج الرائدة،
00:07:44والتي أعتقد أن معظم الناس يبدؤون بها افتراضياً، مثل أوبن إيه آي (OpenAI)، كلود (Claude)،
00:07:48جيميني (Gemini)، فإن القيمة الوسيطة (P50) لوقت استجابة أول رمز (TTFT) تكون تقريباً حوالي 450 إلى 500 في الأيام العادية ويمكن أن تصبح متقلبة،
00:07:55أليس كذلك؟ يمكن أن ترتفع القيمة عند النسبة المئوية 90 أو 95 لتتجاوز بسهولة 1.2 أو 1.3 ثانية حتى،
00:08:02وهذا ليس جيداً لتجربة الوكيل الكلية. إذن فهذا هو نموذجك الرائد.
00:08:09الآن، هناك خيار آخر، وهو سيبريبوس (Cerebras) أو جروك (Grok)، المشهور والشائع بإخراج الكثير من الرمز أو الرموز بسرعة كبيرة، أليس كذلك؟
00:08:17هذه تعمل، ولكن لكي تحصل على تأخير زمني مخصص أو وقت استجابة أول رمز على هذه النماذج، فأنت تحتاج إلى سعة مخصصة وهذا باهظ الثمن حقاً.
00:08:25وهنا تحدثت عن التكلفة باعتبارها إحدى الأمور التي يجب موازنتها، أليس كذلك؟ إنه باهظ الثمن حقاً.
00:08:31ثم عندما تتحدث إلى أي شخص من فريق جروك أو فريق سيبريبوس، سيخبرونك أنك بحاجة إلى حجز سعة مخصصة قبل 12 شهراً مقدماً.
00:08:38فهي محجوزة بالكامل للأشهر الـ 12 القادمة. لذا فهذا خيار مكلف للغاية.
00:08:45وعليك حقاً أن تكون متأكداً من أن النموذج الذي تنشره على بعض طبقات البنية التحتية هذه سيظل موجوداً بعد 12 شهراً من الآن،
00:08:51وهو استثمار كبير ومجهول كبير. إذن ما هو الخيار الواقعي للوكلاء بجودة الإنتاج
00:08:56الذين يتمتعون بجودة عالية وينتهي بهم المطاف بموازنة هذه الأمور الثلاثة؟
00:09:01هذا هو ما نجح معنا، وهو النماذج مفتوحة المصدر.
00:09:05من الواضح أن هناك الكثير منها من حيث التنوع والخيارات التي يمكنك اختيارها.
00:09:11أنا أتحدث تحديداً عن النموذجين الذين نعمل معهما، كوين 3.5 (Qwen 3.5) وجيما 4 (Gemma 4).
00:09:17هذان نوعان من النماذج مفتوحة المصدر المتطورة الموجودة في السوق حالياً.
00:09:27وقد قمنا بالكثير من عمليات القياس المعياري حول هذا الموضوع في كيفية عملها.
00:09:34قد يكون مخيفاً أن تفكر، حسناً، لدي النماذج، والآن يجب علي استضافتها وتشغيلها على وحدات معالجة الرسومات الخاصة بي وما إلى ذلك.
00:09:41ولكن إذا كنت تستهدف باستمرار أقل من 300 ملي ثانية، فقد رأينا أن هذا خيار رائع
00:09:47لتحقيق التوازن بين التأخير الزمني، والتكلفة، والذكاء.
00:09:56الآن، بعض التعمق الإضافي هنا. إذا كنت تفعل اللغة الإنجليزية فقط، فإن كوين 3.5 أو جيما يعملان بشكل جيد.
00:10:02ولكن إذا كنت تتعامل مع لغات متعددة، وجماهير دولية، ولغات مختلفة، فإن جيما 4 هو نموذج أفضل بكثير لهذا الغرض.
00:10:10على وحدات معالجة الرسومات الخاصة بك وما إلى ذلك. ولكن إذا كنت تستهدف باستمرار أقل من 300 مللي ثانية، فهذا
00:10:17هو كم عدد الرموز التي يتطلبها توليد كلمة واحدة في تلك اللغة؟
00:10:23حسناً، إذن جيما أفضل بكثير، أفضل بـ 2.5 إلى 3 مرات على الأقل من كوين 3.5 من هذا المنظور.
00:10:29لذا فإن وقتك حتى الكلمات يكون أسرع بكثير على جيما 4، مع تساوي كل الظروف الأخرى، على أساس متعدد اللغات.
00:10:35الآن، ما هي الأحجام التي تختارها في طبقة نموذج اللغة الكبير؟ نموذج مزيج الخبراء (Mixture of Experts) عادة ما يعمل بشكل جيد.
00:10:44عادة ما تعمل نماذج مزيج الخبراء بحجم 3 أو 4 مليار بشكل جيد. المشكلة في مزيج الخبراء
00:10:48هي أنه إذا أراد أي شخص اتخاذ اتجاه الضبط الدقيق، فقد يمثل ذلك تحدياً، لأن ضبط نماذج مزيج الخبراء ليس بالأمر السهل.
00:10:56يمكن أن ينتهي بك المطاف إلى كسر النموذج في كثير من الأحيان. لذا فهذا أحد التحديات التي نراها مع مزيج الخبراء.
00:11:04الآن، ما هي الأحجام التي تختارها في طبقة نموذج اللغة الكبير؟ عادة ما يعمل نموذج الخبراء المختلطون بشكل جيد.
00:11:12عادة ما يعمل نموذج الخبراء المختلطون ذو الثلاثة أو الأربعة مليارات معلمات بشكل جيد. تكمن المشكلة في
00:11:17نموذج الخبراء المختلطون في أنه إذا أراد أي شخص اتخاذ اتجاه الضبط الدقيق، فقد يمثل ذلك
00:11:22تحدياً، نظراً لأن الضبط الدقيق لنماذج الخبراء المختلطون ليس سهلاً. فقد ينتهي بك الأمر إلى كسر النموذج
00:11:28في كثير من الأحيان. لذا، فهذه إحدى التحديات التي نراها مع الخبراء المختلطون، ولكن عادة خارج الصندوق،
00:11:35فهو يوصلك إلى نسبة 90% أقرب إلى ما تريد أن تكون عليه، حتى بدون أي ضبط دقيق أو
00:11:42أو عمل مخصص يتم على النموذج. إذن، هذه هي ميزة الخبراء المختلطون. الآن، إذا كنت تريد إجراء ضبط دقيق،
00:11:48وتريد التعمق أكثر وتقول، انظر، أنا أعمل لصالح مجال معين، كالرعاية الصحية،
00:11:53وما إلى ذلك، وأريد التأكد من قدرتي على إجراء ضبط دقيق لنموذجي، فأنت تريد البدء على الأقل
00:11:58بنموذج 8 مليارات، أو 12 ملياراً، على الأقل من حيث وضعنا اليوم، وربما بعد ستة أشهر من الآن،
00:12:04يهزم نموذج بـ 4 مليارات نموذج 8 مليارات بكل سهولة، ولكن بالنسبة لليوم، ما رأيناه هو
00:12:11أنك تحتاج بحد أدنى إلى نموذج بـ 8 مليارات أو 12 ملياراً، لأنك تبحث عن شيئين في هذه النماذج.
00:12:16الأول، من المؤكد رموز سريعة، ولكن أيضاً اتباع جيد للتعليمات، أليس كذلك؟ والشيء الثاني
00:12:23هو نسبة نجاح عالية جداً في استدعاء الأدوات، لأنه إذا كان بإمكانك القيام هذين الامرين بشكل جيد،
00:12:29فإنك ستصل إلى نسبة 70 أو 80% دون الحاجة حتى إلى إجراء ضبط دقيق لأي نموذج،
00:12:35حيث ستعمل النماذج خارج الصندوق، أليس كذلك؟ لذا، فقد كانت هذه وصفتنا. في الواقع، نحن
00:12:42نشغل نوعين، أحدهما نموذج دقيق الضبط لصناعات محددة، ثم بالنسبة لمعظم حالات الاستخدام العامة،
00:12:50يعمل نموذج الخبراء المختلطون خارج الصندوق مباشرة. وهناك عدد قليل آخر من النصائح والحيل التي سنناقشها
00:12:56في الشرائح القادمة حيث نرى نماذج الفشل، ولكن هذا هو موقفنا
00:13:00من منظور زمن الانتقال ونماذج اللغة الكبيرة. حسنًا، لقد نفد مني
00:13:07الوقت، لذا سأقوم بتسريع هذا الأمر. حسنًا، هناك نوعان آخران في هذا المجال.
00:13:12يبني الناس وكلاء بمزيج من النماذج. ما يفعلونه هو أنهم بالنسبة للجزء الخاص بالتحدث،
00:13:19لديهم نموذج محادثة، وهو نموذج أصغر بكثير، ثم
00:13:24ربما حتى نموذج بثلاثة مليارات، وبعد ذلك لاستدعاء الأدوات، لديهم نموذج أكبر بكثير،
00:13:27بحيث تكون لديهم نسبة نجاح محسنة في استدعاء الأدوات هناك.
00:13:35عذراً. النقطة الثانية هي افتراض أن عمليات النسخ الصوتي الخاصة بك ستكون هشّة. فهذا هو
00:13:42ما تريد أن تعيش وفقه عندما تبني وكلاء الذكاء الاصطناعي، حتى لو كان لديك
00:13:49أفضل محرك نسخ صوتي موجود هناك، وسأريك السبب، أليس كذلك؟ مثل محركات النسخ الحديثة
00:13:55الموجودة في السوق، توصلك نوعاً ما إلى معدل خطأ في الكلمات يتراوح بين أربعة إلى ستة بالمائة،
00:14:02أليس كذلك؟ وهذا على مجموعات تقييم معروفة. أما في المكالمات الحقيقية المليئة بالضوضاء مع
00:14:10نوع من اللهجات، مثل امتلاك الأشخاص لهجات مختلفة نوعاً ما، ومفردات خاصة بالمجال،
00:14:15وما إلى ذلك، فإن تلك عادة ما تنتهي في خانة العشرات من منظور معدل خطأ الكلمات،
00:14:21أليس كذلك؟ الآن، من الواضح أنه يمكنك إجراء ضبط دقيق، واختيار نموذج مفتوح المصدر والقيام بالضبط،
00:14:25ولكننا نرى عادة ما الذي يتعطل هنا غالباً، وهناك أنماط هنا فيما يتعلق بما يتعطل.
00:14:31لذا، الأسماء الخاصة، المصطلحات، أرقام الهواتف، مثل الأرقام العشوائية المفقودة في أرقام الهواتف،
00:14:38والاستبدالات الخاطئة. سأستعرض بعض الأمثلة حول كيفية معالجة هذه
00:14:43العناوين. عندما تحاول جمع عنوان طويل، قد ينتهي محرك النسخ
00:14:48بفقدان بعض أجزائه. لغات تبديل الرموز. سأعطي مثالاً على لغة أتحدث بها، لأن ذلك كان سهلاً بالنسبة لي لوضعه على الشريحة،
00:14:55حيث، كما تعلم، إذا أخذت اللغة الإنجليزية ولكن مكتوبة بنص مختلف،
00:15:01فهذا ما يُستخدم للغة الهندية، أليس كذلك؟ هذه لغة إنجليزية مكتوبة بهذا النص، أليس كذلك؟
00:15:06في حين أن النسخة الإنجليزية الفعلية من هذا هي، مرحباً، كيف حالك؟
00:15:11لذا، إذا كنت أتوجه إلى جمهور في بلد مختلف، حيث لدي لغات متبادلة،
00:15:16وأبدأ في تلقي اللغة الإنجليزية بنص مختلف نوعاً ما،
00:15:21يبدأ كل شيء في الانهيار من محرك النسخ إلى طبقة نموذج اللغة الكبير، ثم
00:15:26ما بعد ذلك، لأن نموذج اللغة الخاص بك يبدأ بعد ذلك في إنتاج مخرجات بهذا النوع من النصوص في كثير من الأحيان، ومن ثم
00:15:32يفسد تحويل النص إلى كلام الأمر. لذا، من المهم جداً توخي الحذر بشأن هذا، وإذا كنت تريد بناء
00:15:38وكيلك بشكل مستقل عن محرك النسخ، فعليك بناء طبقة تقوم بتطبيع كل هذا،
00:15:44أليس كذلك؟ سنتحدث عن الحلول بعد قليل. وهناك الحالة الأخرى، وهي اللغة الهندية،
00:15:48ولكن بالحروف اللاتينية أو الرومانية، أليس كذلك؟ والتي تُقرأ كاللغة الهندية، ولكنها تُقرأ كاللغة
00:15:54الإنجليزية، وهو ما يفسد كل شيء مرة أخرى في المراحل اللاحقة. هذه مجرد أمثلة. ينطبق هذا على
00:15:59اللغة العربية، الماندرين، اليابانية، وما إلى ذلك، تقريباً أي لغة.
00:16:04ما الذي يحقق نتيجة فعلية في طبقة النسخ الصوتي؟ بالنسبة للأسماء الخاصة،
00:16:11نوصي بألا تكتفوا باستخدام تعزيز الكلمات الرئيسية فقط. أعتقد أن الكثير من محركات النسخ
00:16:16توفر ميزة تعزيز الكلمات الرئيسية، حيث يمكنك إدخال كلمات محددة في محركاتها،
00:16:21ولكن ينبغي القيام بتعزيز ديناميكي للكلمات الرئيسية. ما يعني ذلك هو عدم إبقاء الكلمة الرئيسية طوال
00:16:26مدة المكالمة، بل إضافتها ديناميكياً عندما تعتقد أنك بحاجة إليها كإجابة، لكي تحصل على أعلى
00:16:32دقة؛ بمعنى أنه في مراحل مختلفة من المكالمة، سيحتوي محرك النسخ على كلمات رئيسية
00:16:38مختلفة معززة خلال مراحل مختلفة، أليس كذلك؟ وهذا ما رأينا أنه يعمل بشكل أفضل، لأنه إذا
00:16:43أنت فقط قمت بتلويث سياق محرك النسخ بالكثير من الكلمات الرئيسية، فسيبدأ في الهلوسة مجدداً،
00:16:49أليس كذلك؟ إذن هذا ما نراه يعمل بشكل أفضل عادة. نعم، قم بمعالجة النصوص المنسوخة
00:16:55لاحقاً باستخدام نموذج لغوي كبير، أليس كذلك؟ لأن نموذجك اللغوي يمتلك سياق المجال، بينما محرك النسخ لا يمتلكه.
00:17:02لذا فإن الكثير من الكلمات التي قد يخرجها، سأعطيكم بعض الأمثلة، قد لا تكون منطقية. هذا
00:17:07نسخ نصي، مثل رقم هاتف صادر من محرك نسخ، أليس كذلك؟ برأيكم ما الذي يعنيه حرف E هذا؟
00:17:13أليس كذلك؟ إذا أعطيته لنموذج لغوي، فهو يعلم أن ذلك رقم ثلاثة. وبالمثل، أما بالنسبة لذاك الرقم الواحد فهو الرقم واحد.
00:17:18لذا فإن محرك النسخ قد يخطئ في ذلك غالباً، ولكن عندما تقوم بمعالجته لاحقاً
00:17:24باستخدام طبقة نموذج لغوي، فسوف يصحح ذلك فوراً من منظور التصحيح. أعني، وأما الأخيرة،
00:17:30فكما قلت، النقل الحرفي هو أن مخرجات تحويل الكلام إلى نص الخاصة بك والتي تكون متعددة اللغات أيضاً
00:17:37يتم تطبيعها أيضاً، إما باستخدام نموذج لغوي تقوم أولاً بنقل حروفه، أو، كما تعلمون، باستخدام نوع من محركات
00:17:46النقل الحرفي العصبي. هناك الكثير منها متاحة كمصدر مفتوح، ويمكنك ببساطة اختيار أحدها،
00:17:49أليس كذلك؟ والذي سيقوم بكل هذا العمل نيابة عنك. أرسل نصوصاً منسوخة ومنظحة باستمرار،
00:17:55بشكل مستقل عن محرك النسخ، إلى نموذجك اللغوي.
00:18:00حسناً. النقطة الثالثة التي نراها عادة هي جمع البيانات. وهنا أعتقد أن ما بين 50 إلى 60
00:18:05بالمائة من وكلاء الذكاء الاصطناعي يرتكبون أخطاء فادحة. ونحن نحب أن ننظر إلى الأمر باعتباره مشكلة في تجربة المستخدم،
00:18:14ولكن للصوت فقط. لذا فكر في نماذج البيانات، وليس في نص وارد إلى نموذج لغوي يحاول
00:18:21معرفة ما قاله النص المنسوخ. لذا دعونا نستلهم بعض الأفكار من، افتراضاً أن معظمنا هنا مطورون،
00:18:27تعلمون، استلهموا الأفكار من فئات بيانات بايثون، وبيدانتيك،
00:18:32مثل مكتبة Zod في TypeScript أو حقول النماذج في واجهة المستخدم، أليس كذلك؟ إذا بدأت في التفكير في الأمر من منظور مشكلة كهذه،
00:18:39فقد رأينا دقة جمع البيانات ترتفع من حوالي 30% إلى نحو 95%
00:18:46عندما تبدأ في التفكير بهذه الطريقة. لذا، حدد الشكل المطلوب قبل أن تطلب البيانات، أليس كذلك؟
00:18:52بدلاً من إبقائه مفتوحاً، هل يمكنك تقييده؟ هل يمكن أن يكون رقم الهاتف
00:18:58حفظاً من نوع رقم هاتف؟ بمجرد أن تفعل ذلك، أليس كذلك؟ أنت تعلم عدد الأرقام التي يجب أن يتكون منها،
00:19:03ويمكنك إجراء عملية التحقق فوق ذلك، أليس كذلك؟ ومعرفة أنواع القيم المسموح بها.
00:19:10لذا في المثال السابق الذي رأيناه، إذا ظهر حرف E في منتصف رقم الهاتف وكنت تعلم أنه رقم هاتف،
00:19:15فستعرف فوراً إما أن تخمن بذكاء أنه الرقم 3 وتؤكد ذلك مع المستخدم،
00:19:20أو تعلم أن هذا خطأ فتتحقق من ذلك وتطلب من المستخدم الإعادة مرة أخرى، أليس كذلك؟
00:19:26لذا أعتقد أن هذا أحد الأنماط الشائعة التي رأيناها هنا من منظور أنماط جمع البيانات.
00:19:31أعتقد أن الاسم هو الجانب الأكثر إثارة للاهتمام. لقد اخترت للتو اسماً يصعب نطقه،
00:19:36ولن يتمكن أي إنسان من نقله بشكل صحيح، ولن يتمكن محرك النسخ الصوتي لدينا من فهمه بالشكل الصحيح
00:19:43مهما حاولت تكرار ذلك، أليس كذلك؟ لذا بمجرد أن تبدأ في التعامل مع هذا كحقول،
00:19:47ثم تضع قواعد وآليات تأكيد لتهجئة هذه الحروف حرفاً بحرف،
00:19:53فقط في هذه الحالة ستتمكن من تحقيق النتيجة الصحيحة. وإلا،
00:19:58فسيحدث الكثير من الخطأ فيما يتعلق بكيفية جمع هذه البيانات عبر مكالمة صوتية.
00:20:03وهذا مجرد مثال على ما أتحدث عنه فيما يتعلق بجانب جمع البيانات.
00:20:11جانب آخر تسوء الأمور فيه بشكل كبير هو القيم النسبية، وتعد التواريخ أحد هذه الأمثلة.
00:20:18إذا قال شخص ما الأسبوع القادم، الأربعاء الساعة 8، فقد تعني 8 صباحاً أو 8 مساءً،
00:20:25ومعرفة التاريخ المقصود بدقة تصبح مرة أخرى مشكلة مقيدة للغاية.
00:20:30إذا كنت تعلم أن هذا حقل تاريخ ووقتاً وأنت بصدد جمعه، فيمكنك أخذ التاريخ الحالي
00:20:35لتحديد هذه القيمة بناءً على ذلك، أليس كذلك؟ لذا فهذه هي الطريقة التي تضمن بها
00:20:39القيام بذلك من خلال الجمع بين نموذج اللغة واستدعاء الأدوات، حيث يقوم استدعاء الأدوات
00:20:44بالكثير من المهام الصعبة نيابة عنك من منظور الحقول.
00:20:50نعم، وبعد ذلك تقوم بإجراء هذا من منظور اختبار الوحدة. لذا فإن جميع عمليات التقييم لديك
00:20:58يجب أن تبدأ في التعامل مع هذه الحقول كاختبارات وحدة. وطالما أن اختبارات الوحدة الخاصة بك تتحقق وتنجح،
00:21:06تعمل بشكل موثوق وقابل للتكرار. لن تحتاج إلى,
00:21:10كما تعلم، تشغيل مئات حالات اختبار الوكيل الشاملة فقط لاكتشاف أن,
00:21:15على سبيل المثال، جمع حقل واحد معطل. بل تجري تقييماتك على مستوى الحقول والاختبارات الوحدة.
00:21:24وكما قلت، أعتقد أن هذه العقلية تجعل كل شيء أكثر تنظيمًا
00:21:30بدلاً من الأمل في وضع الكثير من التعليمات البرمجية وتغيير، كما تعلم،
00:21:36موجه الأوامر ببضع أحرف في كل مرة، على أمل أن تجعل هندسة الأوامر
00:21:41نموذج اللغة أكثر ضبطًا للتعليمات وتبدأ بشكل سحري في اتباع بعض هذه الأمور.
00:21:47في الواقع، وكما ذكرت، لقد رأينا أنفسنا نصل إلى دقة 95 إلى 97 بالمائة دون الحاجة إلى ضبط دقيق للنموذج.
00:21:53حسناً. والخداع أساساً هو مجرد تقسيم سياق
00:21:57ما يفعله الوكيل في تلك اللحظة مع تحديد الحالات الخاصة بما يمر به الوكيل.
00:22:04حسنًا. سأقوم بتخطي هذا الجزء سريعًا
00:22:10من منظور الوقت. أرى أن لدي ثلاث دقائق أخرى. أتمنى أن يكون ذلك مجرد خلل برمجي، لكننا سنكتفي بهذا القدر.
00:22:16حسنًا، إذن هذه هي المنطقة الرابعة التي نرى ظهور المشكلات فيها. معظم الناس يأخذون
00:22:24مخرجات نموذج اللغة ثم يرسلونها إلى نظام تحويل النص إلى كلام (TTS). من الواضح أن هناك العديد من أنظمة تحويل النص إلى كلام الجيدة في السوق
00:22:30التي تتولى الكثير من المهام الثقيلة، ولكن في كثير من الأحيان تحدث أخطاء. ما نوصي به
00:22:37وما لاحظناه هو أنك عادةً ما ترغب في وجود طبقة تسوية وتطبيع بين نموذج اللغة وما
00:22:43يتم إرساله إلى نظام تحويل النص إلى كلام. لا تفرض إرسال مخرجات نموذج اللغة مباشرة إلى نظام تحويل النص إلى كلام، أليس كذلك؟ وسوف نستعرض
00:22:50بعض الأمثلة. الأساسيات هي إزالة الرموز التعبيرية وتنسيق ماركداون قبل إجراء أي عملية تركيب صوتي
00:22:58في نظام تحويل النص إلى كلام. تقوم معظم خطوط أنابيب التنسيق بذلك، مثل LiveCAD أو PipeCAD
00:23:02والتي ستقوم بذلك نيابةً عنك إذا قمت بتعيين بعض الخيارات. لذا، فقط تأكد من ذلك إذا كنت لا تستخدمها أو
00:23:08إذا كنت تبني النظام من الصفر، فقد حددت هذا صراحةً لأنك لا تريد أن تظهر رموز تعبيرية
00:23:12في شيء يتم قراءته بصوت عالٍ، أو أن تظهر رموز ماركداون هناك.
00:23:17حسنًا. أعتقد أن هناك أمورًا أخرى أكثر شيوعًا، مثل القواميس المخصصة. توفر معظم محركات تحويل النص إلى كلام هذه الميزة لك،
00:23:23مثل كيفية نطق الكلمات المخصصة، سواء كانت أسماء أعلام، أو علامات تجارية،
00:23:30أو اختصارات، وما إلى ذلك. لذا، قم بضبط هذه الإعدادات عند الانتقال من نموذج اللغة إلى مخرجات تحويل النص إلى كلام،
00:23:36لأنك إن لم تفعل، فسوف تفسد الأمر. وسأعرض لك مثالاً على كيفية اختبارنا
00:23:40لذلك. الميزة الأخرى هي أن معظم المحركات توفر لك أيضًا التحكم في السرعة. لذا، إذا كنت تعلم أنك تنطق
00:23:47كيانًا معينًا، فقم بإبطاء السرعة، واجعل وكيلك يبطئ سرعته لتصبح 0.8x أو 0.7x، لكي يتمكن من
00:23:54توضيح ذلك الكيان المحدد بدقة، ولا يفسد طريقة نطق البريد الإلكتروني أو رقم الهاتف
00:24:00أو الاسم حرفًا بحرف. وقم بتسوية جميع الأمور الفوضوية، مثل عناوين البريد الإلكتروني، والعملات، والتواريخ. لا تترك هذا الأمر لنظام تحويل النص إلى كلام ليقوم به.
00:24:09معظم الأنظمة تفعل ذلك، لكن لا تترك الأمر بالكامل لنظام تحويل النص إلى كلام. بل قم بنناء طبقة التسوية والتطبيع الخاصة بك من جانبك
00:24:15حتى إذا احتجت غدًا إلى تبديل نظام تحويل النص إلى كلام، أو لأي سبب توقف النظام الأول عن العمل وأردت استخدام
00:24:21نظام آخر، فلن تضطر للاعتماد كليًا على محرك نظام تحويل النص إلى كلام، بل تبني هذا النظام
00:24:25داخليًا لتتمكن من إدارته. وبعد ذلك، أعتقد أنني لا أملك الدفعة الخاصة بي هنا،
00:24:32لكنني لا أملك اسم عائلتي هنا. لذلك فإن الاختبار الأول بالنسبة لي هو أنه إذا لم يستطع نطق اسم عائلتي
00:24:39أو اسم شركتي، فهذا يعني أنه يرتكب خطأً فادحًا بالفعل. اسم عائلتي هو بالاسوبرامانيان،
00:24:44وهو اسم طويل نوعًا ما.
00:24:50وإذا لم تتمكن من نطق ذلك باستخدام وكيل ذكاء اصطناعي صوتي، فهذه علامة فشل بالنسبة لي. وأنا أعلم،
00:24:56كما تعلم، أن الوكيل سيفسد الكثير من الكلمات التي تحتاج إلى نطق دقيق يومًا بعد يوم.
00:25:04النقطة الثانية هي اسم شركتنا Pliwo. فالكثير من المحركات تنطقه Pliwo أو ما شابه ذلك.
00:25:09ولكنني أعتقد أن القدرة على التحكم في هذا الأمر بشكل خاص داخل مسار العمل الخاص بك أمر بالغ الأهمية. وإذا كنت تبني منتجًا
00:25:16موجهاً للعملاء، فيجب عليك إتاحة هذا الخيار لعملائك.
00:25:21حسنًا، سأقوم بتخطي الشريحتين الأخيرتين سريعًا لأنني تجاوزت الوقت المخصص بكثير.
00:25:26اكتشاف نهاية الدور (End-of-turn detection)، أعتقد أن هذا موضوع منفصل، لكنني سأقوم سريعًا
00:25:32بعرض جميع النقاط لكي تتمكنوا من الاطلاع عليها سريعًا. وإذا أردتم إجراء محادثة
00:25:36بعد هذا العرض، فيمكننا الحديث عن ذلك. حسنًا، سأترك هذه الشريحة معروضة لمدة خمس ثوانٍ تقريبًا
00:25:41ثم يمكننا مناقشة الأمر لاحقًا خارج هذا الاجتماع، فقد تجاوزت الوقت المخصص لي بكثير.
00:25:49والموضوع الأخير هو المقاطعة (Barging-in) والتواصل الخلفي (Back-channeling).
00:25:53أعتقد أن هناك الكثير من الحديث حول نماذج الكلام إلى كلام التي تقوم ببعض هذه الأمور،
00:25:58ولكننا تمكنا من رؤية كيف يمكننا تنفيذ كل هذا في خطوط أنابيب الكلام إلى كلام العادية.
00:26:03أنت لا تحتاج حقًا إلى نموذج كلام إلى كلام معقد للقيام بكل هذه الأمور.
00:26:07مرة أخرى، سأكتفي بعرض هذا على الشاشة وأختتم به.
00:26:15حسنًا، لا أعتقد أن لدينا وقتاً لأسئلة. يمكننا الإجابة عليها لاحقاً إن وجد متسع من الوقت، ولكن
00:26:19نأمل أن يكون هذا مفيداً وأن يكون قد أعطاكم بعض الرؤى حول ما نراه في بيئات الإنتاج
00:26:24مع مليارات المكالمات على نطاق واسع. حسنًا، شكراً لكم.
00:26:29نراكم المرة القادمة.

Key Takeaway

يتطلب نشر وكلاء الذكاء الاصطناعي الصوتي في بيئة الإنتاج تجاوز تحديات التأخير الزمني وهشاشة النسخ الصوتي عبر استخدام نماذج مفتوحة المصدر وطبقات تحكم مخصصة للبيانات والتطبيع.

Highlights

  • تواجه وكلاء الذكاء الاصطناعي الصوتي خمسة أوضاع فشل رئيسية عند الانتقال من مرحلة التطوير إلى بيئة الإنتاج الفعلية.

  • تتراوح معدلات التأخير الزمني المقبولة لوكلاء الصوت بين 750 ملي ثانية و1.2 ثانية لتجنب إنهاء المستخدمين للمكالمات.

  • تعتمد النماذج مفتوحة المصدر مثل Qwen 3.5 وGemma 4 على وحدات معالجة الرسومات لتحقيق توازن فعال بين التكلفة والذكاء والتأخير الزمني.

  • ترتفع دقة جمع البيانات الخاصة بأسماء المستخدمين وأرقام الهواتف من 30 بالمائة إلى 95 بالمائة عند استخدام حقول مقيدة تشبه مكتبات البرمجة.

  • تتطلب أنظمة تحويل النص إلى كلام طبقة تسوية وتطبيع مسبقة لإزالة الرموز التعبيرية وتصحيح نطق الأسماء والعلامات التجارية بدقة.

Timeline

مقدمة عن وكلاء الذكاء الاصطناعي الصوتي وأسباب الفشل عند الإنتاج

  • تنتقل تطبيقات وكلاء الذكاء الاصطناعي الصوتي من مرحلة إثبات المفهوم إلى بيئة الإنتاج لتواجه تحديات وأوجه فشل متعددة.
  • تعتمد البنية الأساسية لوكلاء الصوت على أربع طبقات تشمل تحويل الكلام إلى نص ونموذج اللغة الكبير وتحويل النص إلى كلام.

يبني الكثير من المطورين وكلاء ذكاء اصطناعي صوتي باستخدام أدوات تنظيم مثل LiveKit أو Pipecat وتعتقد الشركات أن النظام جاهز للإنتاج بمجرد اجتياز مرحلة التطوير. يظهر واقع الإنتاج الحقيقي أوجه قصور واضحة تستوجب مراجعة طريقة عمل خطوط الأنابيب بالكامل.

تحديات التأخير الزمني وخيارات نماذج اللغة الكبيرة

  • تسجل النماذج الرائدة مثل OpenAI وClaude قيم وقت استجابة أول رمز تتراوح حول 450 إلى 500 ملي ثانية في الظروف العادية.
  • تحقق النماذج مفتوحة المصدر مثل Qwen 3.5 وGemma 4 توازناً مثالياً في التأخير الزمني والتكلفة والذكاء ضمن بيئات الإنتاج.

يؤدي تفعيل قدرات التفكير المعقدة في نماذج اللغة الكبيرة إلى إبطاء الاستجابة، مما يحتم تعطيلها لتلبية متطلبات السرعة في المكالمات الصوتية. تتطلب السعة المخصصة لنماذج مثل Cerebras أو Grok استثمارات باهظة وحجوزات مسبقة لفترات طويلة، مما يجعل النماذج مفتوحة المصدر الخيار الواقعي الأفضل.

معالجة هشاشة محركات النسخ الصوتي وتعدد اللغات

  • تتراوح معدلات خطأ الكلمات في المكالمات الحقيقية المليئة بالضوضاء واللهجات المختلفة بين العشرات بالمائة.
  • يؤدي استخدام التعزيز الديناميكي للكلمات الرئيسية مع معالجة النصوص لاحقاً عبر نموذج لغوي إلى رفع دقة النسخ الصوتي.

تواجه محركات النسخ الصوتي صعوبة في التعامل مع الأسماء الخاصة والأرقام والكلمات المتبادلة بين اللغات المختلفة بالحروف اللاتينية. يؤدي إدخال طبقة تطبيع مستقلة ومعالجة المخرجات بنموذج لغوي يمتلك سياق المجال إلى تصحيح الأخطاء تلقائياً مثل تحويل الحروف الخاطئة إلى أرقام صحيحة.

أنماط جمع البيانات الصوتي وتطبيق اختبارات الوحدة

  • ترتفع دقة جمع البيانات من 30 بالمائة إلى 95 بالمائة عند التعامل مع البيانات كحقول مقيدة شبيهة بمكتبات البرمجة.
  • تضمن اختبارات الوحدة على مستوى الحقول موثوقية استخراج البيانات والتعامل مع التواريخ والأسماء المعقدة دون أخطاء.

يفشل نسبة كبيرة من الوكلاء في جمع البيانات بسبب ترك الحقول مفتوحة دون قيود واضحة لشكل الإدخال المطلوبة مثل أرقام الهواتف والتاريخ. يتيح تقييد الحقول واستخدام أدوات التحقق اكتشاف الأخطاء وتصحيحها بذكاء مع المستخدم عبر مكالمة صوتية.

تسوية مخرجات تحويل النص إلى كلام وإدارة النطق

  • تتطلب مخرجات نموذج اللغة طبقة تسوية وتطبيع لإزالة الرموز التعبيرية وتنسيق ماركداون قبل إرسالها إلى نظام تحويل النص إلى كلام.
  • تتيح القواميس المخصصة والتحكم في سرعة النطق توضيح نطق الأسماء الصعبة والعلامات التجارية بدقة عالية.

تؤدي قراءة الرموز التعبيرية وماركداون بصوت عالٍ إلى أخطاء فادحة في تجربة المستخدم الصوتي. يتيح التحكم المخصص في نطق الأسماء المعقدة وأرقام الهواتف وبطء سرعة النطق للملفات الحساسة تقديم وكيل صوتي احترافي وعالي الجودة في بيئة الإنتاج.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video