스크립트
00:00:00دعونا نطرَح بعض الأسئلة السريعة ثم نبدأ مباشرة. كم شخصاً منا في هذه القاعة
00:00:19سبق له بناء وكلاء ذكاء اصطناعي صوتي؟ حسناً، هذا جمهور لا بأس به هنا. وكم عددكم
00:00:28الذي قام ببناء وكلاء ذكاء اصطناعي ونشرهم في بيئة الإنتاج الفعلي؟ ليس سيئاً. حسناً، رائع. إذن سنتحدث
00:00:38عما يحدث عادةً، أليس كذلك؟ مثلما يتحدث الجميع عن وكلاء الذكاء الاصطناعي الصوتي. وكما تعلمون،
00:00:47الحل السحري لكل شيء تقريباً في العالم اليوم هو وكلاء الذكاء الاصطناعي الصوتي. لذا فالجميع
00:00:51يقوم ببناء واحد ويحاول نشره. وهي تبدو رائعة عندما تبنيها نوعاً ما في
00:00:57بيئة التطوير الخاصة بك. ولكن اللحظة التي تنتقل فيها بها من مرحلة إثبات المفهوم إلى الإنتاج،
00:01:03تبدأ الأمور في الفشل. لذا سنستعرض هذه الجوانب الخمسة المختلفة وكيف، أو ما الذي
00:01:09رأيناه في شركة بليفو مع وكلاء الذكاء الاصطناعي الصوتي. ولكن قبل ذلك بقليل، مقدمة سريعة مني. أنا فيكي،
00:01:19المؤسس والرئيس التنفيذي للوكلاء. استخدمت عنوان مدير هندسة الوكلاء. وأنا أطلق على نفسي لقب رئيس مسؤول الوكلاء من
00:01:28منظور المسمى الوظيفي. حسناً، إذن ما هو، ما هو، كما تعلمون، لماذا، لماذا نحن مؤهلون أصلاً لهذه
00:01:35المناقشة وما الذي نراه ولا تتاح للكثير من الشركات فرصة رؤيته؟ لذا سأ...
00:01:42أتحدث قليلاً عن رحلتنا من حيث كيف وصلنا إلى هنا حتى الآن ثم نغوص مباشرة في الموضوع.
00:01:48كما تعلمون، نحن موجودون منذ نحو 14 عاماً. وكانت رحلتنا عبارة عن منصة واجهات برمجة تطبيقات للمطورين.
00:01:54والآن نحن شركة متخصصة في وكلاء الذكاء الاصطناعي. بدأنا بواجهات برمجة تطبيقات الصوت والرسائل النصية القصيرة في عام 2011.
00:02:01والآن، كما تعلمون، نحن نركز بشكل أساسي على تقديم خدمات وكلاء الذكاء الاصطناعي المتكاملة.
00:02:08الحل المتكامل على منصتنا. نحن نشهد أكثر من مليار مكالمة صوتية كل شهر في جميع أنحاء العالم.
00:02:16وهو ما شهدنا من خلاله الكثير من هذه الأنماط تظهر من حيث كيف،
00:02:20عندما نعمل مع عملائنا، ما يحدث لوكلاء الذكاء الاصطناعي الصوتي لديهم في بيئة الإنتاج.
00:02:25نحن فريق يتألف من 90 عضواً، ولدنا 50 مليون دولار من التمويل في البنك. وحقيقة طريفة،
00:02:33هذا ليس من مستثمرين رأس مال مغامر خارجيين. هذا كله ناتج عن كوننا شركة مربحة،
00:02:38حيث قمنا بتدفق تلك الأموال إلى البنك على مدار هذه السنوات.
00:02:42بعض العملاء الذين نخدمهم في جميع أنحاء العالم، لقد تركنا بعض الشعارات هناك،
00:02:49ولكن من منظور العروض بشكل أساسي، يمكنني تصنيف هذا إلى ثلاث فئات مختلفة.
00:02:54الفئة الأولى هي تقديم وكيل ذكاء اصطناعي قابل للبرمجة. نسميه، أعني، إنه خط أنابيب
00:03:00صوتي، وليس منتج تحويل كلام إلى كلام حقيقي بعد، ولكنه عرض قابل للبرمجة.
00:03:05لدينا أيضاً استوديو وكلاء الذكاء الاصطناعي وهو أداة بناء مرئية بدون برمجة. وكما قلت،
00:03:11بدأنا بواجهات برمجة تطبيقات الصوت. لذلك فقد بنينا هذا بوضوح على مدار الـ 14 عاماً الماضية،
00:03:16بما في ذلك ربط خطوط الاتصال (SIP trunking) ولبدء تدفق الصوت. لذا فنحن لا نعتمد على آخرين في مجال
00:03:22الاتصالات أو شبكات المزودين. فهذا هو عملنا الأساسي الذي بنيناه طوال هذه السنوات.
00:03:26وهو الأساس الذي تعلوه منصة وكلاء الذكاء الاصطناعي الخاصة بنا.
00:03:32حسناً. مع ذلك، دعونا ندخل في صلب الموضوع، أليس كذلك؟ والتي أنا متأكد من أنكم بما أنكم جميعاً بنيتم
00:03:39وكلاء ذكاء اصطناعي، فقد رأيتم جميعاً هذا أو بنيتموه بشكل أو بآخر. وسنقضي
00:03:44وقتاً أطول في هذا من حيث كيف يبدو خط العمليات بأكمله، أليس كذلك؟ ما نراه مع
00:03:51العملاء، وأنا متأكد من أنكم لا تستطيعون الارتباط بهذا، هو أن أي شخص يفكر في
00:03:56وكلاء الذكاء الاصطناعي، ما يفعله هو اختيار مجموعة من أدوات التنظيم هذه،
00:04:01ويقوم بعمل جيد جداً، مثل لايف كيت (LiveKit) أو بايب كات (Pipecat)، لبناء وكيل الذكاء الاصطناعي الخاص بهم فوقها. إنهم يعتقدون
00:04:06أن بإمكانهم فقط تنظيم هذه الطبقات الأربع المختلفة، تحويل الكلام إلى نص، نموذج اللغة الكبير (LLM)، وتحويل النص إلى كلام (TTS)
00:04:13مع اكتشاف دور المتحدث في المنتصف ونكون قد انطلقنا. وكأن وكيل الذكاء الاصطناعي الخاص بي يعمل في مرحلة إثبات المفهوم
00:04:19إذن فهو جاهز للعمل في الإنتاج. عادةً هذا ما يحدث. يقومون بقياس
00:04:24أوقات الاستجابة الخاصة بهم ويمكنك رؤية بعض أوقات الاستجابة الإرشادية في هذه الشريحة عند كل طبقة. ويقولون:
00:04:30نعم، تبدو هذه مناسبة لي لما أحتاجه. فلننتقل إذن إلى بيئة الإنتاج. وبعد ذلك يبدأ
00:04:36واقع الإنتاج في الظهور، وترى جميع أنواع أوجه القصور والفشل، والتي
00:04:41سنقضي (معظم الوقت في هذه المحادثة على الأقل) في الحديث عنها. لقد خصصت بعض الوقت
00:04:48في النهاية للأسئلة والأجوبة إذا كنتم ترغبون في طرح أسئلة، لكننا سننتقل مباشرة من
00:04:53هذا إلى أوجه الفشل المختلفة التي نراها. لنبدأ بالأولى والتي يتحدث عنها الجميع.
00:05:01هذا هو وضع الفشل الأكثر حديثاً، وهو التأخير الزمني (Latency). أعتقد أن لدينا
00:05:07القليل من محادثات وكلاء الذكاء الاصطناعي أو محادثات وكلاء الذكاء الاصطناعي الصوتي اليوم. أنا متأكد تماماً من أن الجميع
00:05:12سيتطرقون إلى وضع الفشل المحدّد هذا، ولهذا السبب أطرح هذا الأمر مباشرة
00:05:17فيما يتعلق ببعض الجوانب حول كيف تبدو هذه التجربة بأكملها للمستخدمين، أليس كذلك؟ عادةً،
00:05:26يقيس معظم الناس هذا بالوقت المستغرق حتى سماع أول صوت. أي الوقت الذي يتوقف فيه المستخدمون عن الكلام
00:05:34حتى يبدأ وكيلك في التحدث، أليس كذلك؟ وأعتقد أنكم ربما رأيتم هذا إذا كنتم قد بنيتم وكلاء ذكاء اصطناعي صوتي
00:05:39فيما يتعلق بما يشعر وكأنه أمر جيد أو طبيعي، وما يشعر وكأنه مزعج
00:05:46أو ملحوظ، وبعد ذلك ما يشعر وكأنه مزعج للغاية، وهي خطوات متدرجة مختلفة.
00:05:52نلاحظ أن معظم الناس يريدون أن يكونوا أقل من 550 ملي ثانية لأن ذلك ما تعلن عنه
00:06:00المنصات، أو الحلول، أو الطبقات المختلفة، ولكن أعتقد أن معظمهم ينتهي بهم الأمر بين 750
00:06:07إلى 1.2 ثانية. هذا هو المكان الذي ينتهي فيه مطاف غالبية الناس. أما الذين أداؤهم سيئ حقاً فينتتهي بهم المطاف
00:06:13بأكثر من 1.2 ثانية، وحينها تبدأ في ملاحظة أن المستخدمين يقومون بإنهاء المكالمة. الآن، سأشارك معكم
00:06:19ما رأيناه عملياً في الإنتاج مع العملاء الذين يستخدمون هذا عند طبقات مختلفة، ثم الحلول
00:06:26الخاصة ببعض هذه المشكلات. الطريقة التي نريد التفكير بها في هذه الطبقة هي نوع من التوازن بين ثلاثة أمور: التكلفة، والذكاء، والتأخير الزمني،
00:06:33أليس كذلك؟ ولماذا أطرح هذه الأمور الثلاثة؟ لأنها مترابطة بطريقة ما. أعتقد أن أحد الأمور
00:06:42التي كنت أتحدث عنها مع عدد قليل من الأشخاص في الخارج. أحد الأمور،
00:06:48في العام الماضي، رأينا الكثير من الابتكارات، والكثير من القفزات في الذكاء في جانب نماذج اللغة الكبيرة، أليس كذلك؟
00:06:51وقد جاء معظم الذكاء من حيث التفكير، أو التعلم التعزيزي، وما إلى ذلك.
00:06:58والسخرية في وكلاء الصوت هي أنه يكاد يكون دائماً، يجب أن يكون نموذج اللغة الكبير أو الوكيل المتحدث
00:07:05بخاصية التفكير معطلة لديه، أليس كذلك؟ لذا فإن كل التطورات التي حققناها في طبقة نماذج اللغة الكبيرة في العام الماضي،
00:07:11لا ينطبق أي منها هنا الآن، أليس كذلك؟ من الواضح أن لديك نماذج أفضل يمكنها القيام باتباع التعليمات
00:07:19أو استدعاء الأدوات بشكل أفضل، ولكن تقريبا كل الذكاء الذي تم بناؤه في طبقة التفكير يكون معطلاً افتراضياً إذا كنت تريد أن يكون الأمر سريعاً بما يكفي.
00:07:25إذن فهذه إحدى المفارقات التي نواجهها. فكيف تتوازن إذن بين الذكاء والتكلفة والتأخير الزمني؟
00:07:29دعونا ننظر إلى بعض هذه الخيارات الموجودة في السوق، أليس كذلك؟
00:07:34وأنا أختار نموذج اللغة الكبيرة تحديداً لأنه إذا نظرت إلى الرسم البياني السابق، فإن نموذج اللغة الكبيرة هو
00:07:39نوعاً ما أعلى فئة تأخير زمني تضيف إلى ذلك، أليس كذلك؟ وإذا نظرت إلى النماذج الرائدة،
00:07:44والتي أعتقد أن معظم الناس يبدؤون بها افتراضياً، مثل أوبن إيه آي (OpenAI)، كلود (Claude)،
00:07:48جيميني (Gemini)، فإن القيمة الوسيطة (P50) لوقت استجابة أول رمز (TTFT) تكون تقريباً حوالي 450 إلى 500 في الأيام العادية ويمكن أن تصبح متقلبة،
00:07:55أليس كذلك؟ يمكن أن ترتفع القيمة عند النسبة المئوية 90 أو 95 لتتجاوز بسهولة 1.2 أو 1.3 ثانية حتى،
00:08:02وهذا ليس جيداً لتجربة الوكيل الكلية. إذن فهذا هو نموذجك الرائد.
00:08:09الآن، هناك خيار آخر، وهو سيبريبوس (Cerebras) أو جروك (Grok)، المشهور والشائع بإخراج الكثير من الرمز أو الرموز بسرعة كبيرة، أليس كذلك؟
00:08:17هذه تعمل، ولكن لكي تحصل على تأخير زمني مخصص أو وقت استجابة أول رمز على هذه النماذج، فأنت تحتاج إلى سعة مخصصة وهذا باهظ الثمن حقاً.
00:08:25وهنا تحدثت عن التكلفة باعتبارها إحدى الأمور التي يجب موازنتها، أليس كذلك؟ إنه باهظ الثمن حقاً.
00:08:31ثم عندما تتحدث إلى أي شخص من فريق جروك أو فريق سيبريبوس، سيخبرونك أنك بحاجة إلى حجز سعة مخصصة قبل 12 شهراً مقدماً.
00:08:38فهي محجوزة بالكامل للأشهر الـ 12 القادمة. لذا فهذا خيار مكلف للغاية.
00:08:45وعليك حقاً أن تكون متأكداً من أن النموذج الذي تنشره على بعض طبقات البنية التحتية هذه سيظل موجوداً بعد 12 شهراً من الآن،
00:08:51وهو استثمار كبير ومجهول كبير. إذن ما هو الخيار الواقعي للوكلاء بجودة الإنتاج
00:08:56الذين يتمتعون بجودة عالية وينتهي بهم المطاف بموازنة هذه الأمور الثلاثة؟
00:09:01هذا هو ما نجح معنا، وهو النماذج مفتوحة المصدر.
00:09:05من الواضح أن هناك الكثير منها من حيث التنوع والخيارات التي يمكنك اختيارها.
00:09:11أنا أتحدث تحديداً عن النموذجين الذين نعمل معهما، كوين 3.5 (Qwen 3.5) وجيما 4 (Gemma 4).
00:09:17هذان نوعان من النماذج مفتوحة المصدر المتطورة الموجودة في السوق حالياً.
00:09:27وقد قمنا بالكثير من عمليات القياس المعياري حول هذا الموضوع في كيفية عملها.
00:09:34قد يكون مخيفاً أن تفكر، حسناً، لدي النماذج، والآن يجب علي استضافتها وتشغيلها على وحدات معالجة الرسومات الخاصة بي وما إلى ذلك.
00:09:41ولكن إذا كنت تستهدف باستمرار أقل من 300 ملي ثانية، فقد رأينا أن هذا خيار رائع
00:09:47لتحقيق التوازن بين التأخير الزمني، والتكلفة، والذكاء.
00:09:56الآن، بعض التعمق الإضافي هنا. إذا كنت تفعل اللغة الإنجليزية فقط، فإن كوين 3.5 أو جيما يعملان بشكل جيد.
00:10:02ولكن إذا كنت تتعامل مع لغات متعددة، وجماهير دولية، ولغات مختلفة، فإن جيما 4 هو نموذج أفضل بكثير لهذا الغرض.
00:10:10على وحدات معالجة الرسومات الخاصة بك وما إلى ذلك. ولكن إذا كنت تستهدف باستمرار أقل من 300 مللي ثانية، فهذا
00:10:17هو كم عدد الرموز التي يتطلبها توليد كلمة واحدة في تلك اللغة؟
00:10:23حسناً، إذن جيما أفضل بكثير، أفضل بـ 2.5 إلى 3 مرات على الأقل من كوين 3.5 من هذا المنظور.
00:10:29لذا فإن وقتك حتى الكلمات يكون أسرع بكثير على جيما 4، مع تساوي كل الظروف الأخرى، على أساس متعدد اللغات.
00:10:35الآن، ما هي الأحجام التي تختارها في طبقة نموذج اللغة الكبير؟ نموذج مزيج الخبراء (Mixture of Experts) عادة ما يعمل بشكل جيد.
00:10:44عادة ما تعمل نماذج مزيج الخبراء بحجم 3 أو 4 مليار بشكل جيد. المشكلة في مزيج الخبراء
00:10:48هي أنه إذا أراد أي شخص اتخاذ اتجاه الضبط الدقيق، فقد يمثل ذلك تحدياً، لأن ضبط نماذج مزيج الخبراء ليس بالأمر السهل.
00:10:56يمكن أن ينتهي بك المطاف إلى كسر النموذج في كثير من الأحيان. لذا فهذا أحد التحديات التي نراها مع مزيج الخبراء.
00:11:04الآن، ما هي الأحجام التي تختارها في طبقة نموذج اللغة الكبير؟ عادة ما يعمل نموذج الخبراء المختلطون بشكل جيد.
00:11:12عادة ما يعمل نموذج الخبراء المختلطون ذو الثلاثة أو الأربعة مليارات معلمات بشكل جيد. تكمن المشكلة في
00:11:17نموذج الخبراء المختلطون في أنه إذا أراد أي شخص اتخاذ اتجاه الضبط الدقيق، فقد يمثل ذلك
00:11:22تحدياً، نظراً لأن الضبط الدقيق لنماذج الخبراء المختلطون ليس سهلاً. فقد ينتهي بك الأمر إلى كسر النموذج
00:11:28في كثير من الأحيان. لذا، فهذه إحدى التحديات التي نراها مع الخبراء المختلطون، ولكن عادة خارج الصندوق،
00:11:35فهو يوصلك إلى نسبة 90% أقرب إلى ما تريد أن تكون عليه، حتى بدون أي ضبط دقيق أو
00:11:42أو عمل مخصص يتم على النموذج. إذن، هذه هي ميزة الخبراء المختلطون. الآن، إذا كنت تريد إجراء ضبط دقيق،
00:11:48وتريد التعمق أكثر وتقول، انظر، أنا أعمل لصالح مجال معين، كالرعاية الصحية،
00:11:53وما إلى ذلك، وأريد التأكد من قدرتي على إجراء ضبط دقيق لنموذجي، فأنت تريد البدء على الأقل
00:11:58بنموذج 8 مليارات، أو 12 ملياراً، على الأقل من حيث وضعنا اليوم، وربما بعد ستة أشهر من الآن،
00:12:04يهزم نموذج بـ 4 مليارات نموذج 8 مليارات بكل سهولة، ولكن بالنسبة لليوم، ما رأيناه هو
00:12:11أنك تحتاج بحد أدنى إلى نموذج بـ 8 مليارات أو 12 ملياراً، لأنك تبحث عن شيئين في هذه النماذج.
00:12:16الأول، من المؤكد رموز سريعة، ولكن أيضاً اتباع جيد للتعليمات، أليس كذلك؟ والشيء الثاني
00:12:23هو نسبة نجاح عالية جداً في استدعاء الأدوات، لأنه إذا كان بإمكانك القيام هذين الامرين بشكل جيد،
00:12:29فإنك ستصل إلى نسبة 70 أو 80% دون الحاجة حتى إلى إجراء ضبط دقيق لأي نموذج،
00:12:35حيث ستعمل النماذج خارج الصندوق، أليس كذلك؟ لذا، فقد كانت هذه وصفتنا. في الواقع، نحن
00:12:42نشغل نوعين، أحدهما نموذج دقيق الضبط لصناعات محددة، ثم بالنسبة لمعظم حالات الاستخدام العامة،
00:12:50يعمل نموذج الخبراء المختلطون خارج الصندوق مباشرة. وهناك عدد قليل آخر من النصائح والحيل التي سنناقشها
00:12:56في الشرائح القادمة حيث نرى نماذج الفشل، ولكن هذا هو موقفنا
00:13:00من منظور زمن الانتقال ونماذج اللغة الكبيرة. حسنًا، لقد نفد مني
00:13:07الوقت، لذا سأقوم بتسريع هذا الأمر. حسنًا، هناك نوعان آخران في هذا المجال.
00:13:12يبني الناس وكلاء بمزيج من النماذج. ما يفعلونه هو أنهم بالنسبة للجزء الخاص بالتحدث،
00:13:19لديهم نموذج محادثة، وهو نموذج أصغر بكثير، ثم
00:13:24ربما حتى نموذج بثلاثة مليارات، وبعد ذلك لاستدعاء الأدوات، لديهم نموذج أكبر بكثير،
00:13:27بحيث تكون لديهم نسبة نجاح محسنة في استدعاء الأدوات هناك.
00:13:35عذراً. النقطة الثانية هي افتراض أن عمليات النسخ الصوتي الخاصة بك ستكون هشّة. فهذا هو
00:13:42ما تريد أن تعيش وفقه عندما تبني وكلاء الذكاء الاصطناعي، حتى لو كان لديك
00:13:49أفضل محرك نسخ صوتي موجود هناك، وسأريك السبب، أليس كذلك؟ مثل محركات النسخ الحديثة
00:13:55الموجودة في السوق، توصلك نوعاً ما إلى معدل خطأ في الكلمات يتراوح بين أربعة إلى ستة بالمائة،
00:14:02أليس كذلك؟ وهذا على مجموعات تقييم معروفة. أما في المكالمات الحقيقية المليئة بالضوضاء مع
00:14:10نوع من اللهجات، مثل امتلاك الأشخاص لهجات مختلفة نوعاً ما، ومفردات خاصة بالمجال،
00:14:15وما إلى ذلك، فإن تلك عادة ما تنتهي في خانة العشرات من منظور معدل خطأ الكلمات،
00:14:21أليس كذلك؟ الآن، من الواضح أنه يمكنك إجراء ضبط دقيق، واختيار نموذج مفتوح المصدر والقيام بالضبط،
00:14:25ولكننا نرى عادة ما الذي يتعطل هنا غالباً، وهناك أنماط هنا فيما يتعلق بما يتعطل.
00:14:31لذا، الأسماء الخاصة، المصطلحات، أرقام الهواتف، مثل الأرقام العشوائية المفقودة في أرقام الهواتف،
00:14:38والاستبدالات الخاطئة. سأستعرض بعض الأمثلة حول كيفية معالجة هذه
00:14:43العناوين. عندما تحاول جمع عنوان طويل، قد ينتهي محرك النسخ
00:14:48بفقدان بعض أجزائه. لغات تبديل الرموز. سأعطي مثالاً على لغة أتحدث بها، لأن ذلك كان سهلاً بالنسبة لي لوضعه على الشريحة،
00:14:55حيث، كما تعلم، إذا أخذت اللغة الإنجليزية ولكن مكتوبة بنص مختلف،
00:15:01فهذا ما يُستخدم للغة الهندية، أليس كذلك؟ هذه لغة إنجليزية مكتوبة بهذا النص، أليس كذلك؟
00:15:06في حين أن النسخة الإنجليزية الفعلية من هذا هي، مرحباً، كيف حالك؟
00:15:11لذا، إذا كنت أتوجه إلى جمهور في بلد مختلف، حيث لدي لغات متبادلة،
00:15:16وأبدأ في تلقي اللغة الإنجليزية بنص مختلف نوعاً ما،
00:15:21يبدأ كل شيء في الانهيار من محرك النسخ إلى طبقة نموذج اللغة الكبير، ثم
00:15:26ما بعد ذلك، لأن نموذج اللغة الخاص بك يبدأ بعد ذلك في إنتاج مخرجات بهذا النوع من النصوص في كثير من الأحيان، ومن ثم
00:15:32يفسد تحويل النص إلى كلام الأمر. لذا، من المهم جداً توخي الحذر بشأن هذا، وإذا كنت تريد بناء
00:15:38وكيلك بشكل مستقل عن محرك النسخ، فعليك بناء طبقة تقوم بتطبيع كل هذا،
00:15:44أليس كذلك؟ سنتحدث عن الحلول بعد قليل. وهناك الحالة الأخرى، وهي اللغة الهندية،
00:15:48ولكن بالحروف اللاتينية أو الرومانية، أليس كذلك؟ والتي تُقرأ كاللغة الهندية، ولكنها تُقرأ كاللغة
00:15:54الإنجليزية، وهو ما يفسد كل شيء مرة أخرى في المراحل اللاحقة. هذه مجرد أمثلة. ينطبق هذا على
00:15:59اللغة العربية، الماندرين، اليابانية، وما إلى ذلك، تقريباً أي لغة.
00:16:04ما الذي يحقق نتيجة فعلية في طبقة النسخ الصوتي؟ بالنسبة للأسماء الخاصة،
00:16:11نوصي بألا تكتفوا باستخدام تعزيز الكلمات الرئيسية فقط. أعتقد أن الكثير من محركات النسخ
00:16:16توفر ميزة تعزيز الكلمات الرئيسية، حيث يمكنك إدخال كلمات محددة في محركاتها،
00:16:21ولكن ينبغي القيام بتعزيز ديناميكي للكلمات الرئيسية. ما يعني ذلك هو عدم إبقاء الكلمة الرئيسية طوال
00:16:26مدة المكالمة، بل إضافتها ديناميكياً عندما تعتقد أنك بحاجة إليها كإجابة، لكي تحصل على أعلى
00:16:32دقة؛ بمعنى أنه في مراحل مختلفة من المكالمة، سيحتوي محرك النسخ على كلمات رئيسية
00:16:38مختلفة معززة خلال مراحل مختلفة، أليس كذلك؟ وهذا ما رأينا أنه يعمل بشكل أفضل، لأنه إذا
00:16:43أنت فقط قمت بتلويث سياق محرك النسخ بالكثير من الكلمات الرئيسية، فسيبدأ في الهلوسة مجدداً،
00:16:49أليس كذلك؟ إذن هذا ما نراه يعمل بشكل أفضل عادة. نعم، قم بمعالجة النصوص المنسوخة
00:16:55لاحقاً باستخدام نموذج لغوي كبير، أليس كذلك؟ لأن نموذجك اللغوي يمتلك سياق المجال، بينما محرك النسخ لا يمتلكه.
00:17:02لذا فإن الكثير من الكلمات التي قد يخرجها، سأعطيكم بعض الأمثلة، قد لا تكون منطقية. هذا
00:17:07نسخ نصي، مثل رقم هاتف صادر من محرك نسخ، أليس كذلك؟ برأيكم ما الذي يعنيه حرف E هذا؟
00:17:13أليس كذلك؟ إذا أعطيته لنموذج لغوي، فهو يعلم أن ذلك رقم ثلاثة. وبالمثل، أما بالنسبة لذاك الرقم الواحد فهو الرقم واحد.
00:17:18لذا فإن محرك النسخ قد يخطئ في ذلك غالباً، ولكن عندما تقوم بمعالجته لاحقاً
00:17:24باستخدام طبقة نموذج لغوي، فسوف يصحح ذلك فوراً من منظور التصحيح. أعني، وأما الأخيرة،
00:17:30فكما قلت، النقل الحرفي هو أن مخرجات تحويل الكلام إلى نص الخاصة بك والتي تكون متعددة اللغات أيضاً
00:17:37يتم تطبيعها أيضاً، إما باستخدام نموذج لغوي تقوم أولاً بنقل حروفه، أو، كما تعلمون، باستخدام نوع من محركات
00:17:46النقل الحرفي العصبي. هناك الكثير منها متاحة كمصدر مفتوح، ويمكنك ببساطة اختيار أحدها،
00:17:49أليس كذلك؟ والذي سيقوم بكل هذا العمل نيابة عنك. أرسل نصوصاً منسوخة ومنظحة باستمرار،
00:17:55بشكل مستقل عن محرك النسخ، إلى نموذجك اللغوي.
00:18:00حسناً. النقطة الثالثة التي نراها عادة هي جمع البيانات. وهنا أعتقد أن ما بين 50 إلى 60
00:18:05بالمائة من وكلاء الذكاء الاصطناعي يرتكبون أخطاء فادحة. ونحن نحب أن ننظر إلى الأمر باعتباره مشكلة في تجربة المستخدم،
00:18:14ولكن للصوت فقط. لذا فكر في نماذج البيانات، وليس في نص وارد إلى نموذج لغوي يحاول
00:18:21معرفة ما قاله النص المنسوخ. لذا دعونا نستلهم بعض الأفكار من، افتراضاً أن معظمنا هنا مطورون،
00:18:27تعلمون، استلهموا الأفكار من فئات بيانات بايثون، وبيدانتيك،
00:18:32مثل مكتبة Zod في TypeScript أو حقول النماذج في واجهة المستخدم، أليس كذلك؟ إذا بدأت في التفكير في الأمر من منظور مشكلة كهذه،
00:18:39فقد رأينا دقة جمع البيانات ترتفع من حوالي 30% إلى نحو 95%
00:18:46عندما تبدأ في التفكير بهذه الطريقة. لذا، حدد الشكل المطلوب قبل أن تطلب البيانات، أليس كذلك؟
00:18:52بدلاً من إبقائه مفتوحاً، هل يمكنك تقييده؟ هل يمكن أن يكون رقم الهاتف
00:18:58حفظاً من نوع رقم هاتف؟ بمجرد أن تفعل ذلك، أليس كذلك؟ أنت تعلم عدد الأرقام التي يجب أن يتكون منها،
00:19:03ويمكنك إجراء عملية التحقق فوق ذلك، أليس كذلك؟ ومعرفة أنواع القيم المسموح بها.
00:19:10لذا في المثال السابق الذي رأيناه، إذا ظهر حرف E في منتصف رقم الهاتف وكنت تعلم أنه رقم هاتف،
00:19:15فستعرف فوراً إما أن تخمن بذكاء أنه الرقم 3 وتؤكد ذلك مع المستخدم،
00:19:20أو تعلم أن هذا خطأ فتتحقق من ذلك وتطلب من المستخدم الإعادة مرة أخرى، أليس كذلك؟
00:19:26لذا أعتقد أن هذا أحد الأنماط الشائعة التي رأيناها هنا من منظور أنماط جمع البيانات.
00:19:31أعتقد أن الاسم هو الجانب الأكثر إثارة للاهتمام. لقد اخترت للتو اسماً يصعب نطقه،
00:19:36ولن يتمكن أي إنسان من نقله بشكل صحيح، ولن يتمكن محرك النسخ الصوتي لدينا من فهمه بالشكل الصحيح
00:19:43مهما حاولت تكرار ذلك، أليس كذلك؟ لذا بمجرد أن تبدأ في التعامل مع هذا كحقول،
00:19:47ثم تضع قواعد وآليات تأكيد لتهجئة هذه الحروف حرفاً بحرف،
00:19:53فقط في هذه الحالة ستتمكن من تحقيق النتيجة الصحيحة. وإلا،
00:19:58فسيحدث الكثير من الخطأ فيما يتعلق بكيفية جمع هذه البيانات عبر مكالمة صوتية.
00:20:03وهذا مجرد مثال على ما أتحدث عنه فيما يتعلق بجانب جمع البيانات.
00:20:11جانب آخر تسوء الأمور فيه بشكل كبير هو القيم النسبية، وتعد التواريخ أحد هذه الأمثلة.
00:20:18إذا قال شخص ما الأسبوع القادم، الأربعاء الساعة 8، فقد تعني 8 صباحاً أو 8 مساءً،
00:20:25ومعرفة التاريخ المقصود بدقة تصبح مرة أخرى مشكلة مقيدة للغاية.
00:20:30إذا كنت تعلم أن هذا حقل تاريخ ووقتاً وأنت بصدد جمعه، فيمكنك أخذ التاريخ الحالي
00:20:35لتحديد هذه القيمة بناءً على ذلك، أليس كذلك؟ لذا فهذه هي الطريقة التي تضمن بها
00:20:39القيام بذلك من خلال الجمع بين نموذج اللغة واستدعاء الأدوات، حيث يقوم استدعاء الأدوات
00:20:44بالكثير من المهام الصعبة نيابة عنك من منظور الحقول.
00:20:50نعم، وبعد ذلك تقوم بإجراء هذا من منظور اختبار الوحدة. لذا فإن جميع عمليات التقييم لديك
00:20:58يجب أن تبدأ في التعامل مع هذه الحقول كاختبارات وحدة. وطالما أن اختبارات الوحدة الخاصة بك تتحقق وتنجح،
00:21:06تعمل بشكل موثوق وقابل للتكرار. لن تحتاج إلى,
00:21:10كما تعلم، تشغيل مئات حالات اختبار الوكيل الشاملة فقط لاكتشاف أن,
00:21:15على سبيل المثال، جمع حقل واحد معطل. بل تجري تقييماتك على مستوى الحقول والاختبارات الوحدة.
00:21:24وكما قلت، أعتقد أن هذه العقلية تجعل كل شيء أكثر تنظيمًا
00:21:30بدلاً من الأمل في وضع الكثير من التعليمات البرمجية وتغيير، كما تعلم،
00:21:36موجه الأوامر ببضع أحرف في كل مرة، على أمل أن تجعل هندسة الأوامر
00:21:41نموذج اللغة أكثر ضبطًا للتعليمات وتبدأ بشكل سحري في اتباع بعض هذه الأمور.
00:21:47في الواقع، وكما ذكرت، لقد رأينا أنفسنا نصل إلى دقة 95 إلى 97 بالمائة دون الحاجة إلى ضبط دقيق للنموذج.
00:21:53حسناً. والخداع أساساً هو مجرد تقسيم سياق
00:21:57ما يفعله الوكيل في تلك اللحظة مع تحديد الحالات الخاصة بما يمر به الوكيل.
00:22:04حسنًا. سأقوم بتخطي هذا الجزء سريعًا
00:22:10من منظور الوقت. أرى أن لدي ثلاث دقائق أخرى. أتمنى أن يكون ذلك مجرد خلل برمجي، لكننا سنكتفي بهذا القدر.
00:22:16حسنًا، إذن هذه هي المنطقة الرابعة التي نرى ظهور المشكلات فيها. معظم الناس يأخذون
00:22:24مخرجات نموذج اللغة ثم يرسلونها إلى نظام تحويل النص إلى كلام (TTS). من الواضح أن هناك العديد من أنظمة تحويل النص إلى كلام الجيدة في السوق
00:22:30التي تتولى الكثير من المهام الثقيلة، ولكن في كثير من الأحيان تحدث أخطاء. ما نوصي به
00:22:37وما لاحظناه هو أنك عادةً ما ترغب في وجود طبقة تسوية وتطبيع بين نموذج اللغة وما
00:22:43يتم إرساله إلى نظام تحويل النص إلى كلام. لا تفرض إرسال مخرجات نموذج اللغة مباشرة إلى نظام تحويل النص إلى كلام، أليس كذلك؟ وسوف نستعرض
00:22:50بعض الأمثلة. الأساسيات هي إزالة الرموز التعبيرية وتنسيق ماركداون قبل إجراء أي عملية تركيب صوتي
00:22:58في نظام تحويل النص إلى كلام. تقوم معظم خطوط أنابيب التنسيق بذلك، مثل LiveCAD أو PipeCAD
00:23:02والتي ستقوم بذلك نيابةً عنك إذا قمت بتعيين بعض الخيارات. لذا، فقط تأكد من ذلك إذا كنت لا تستخدمها أو
00:23:08إذا كنت تبني النظام من الصفر، فقد حددت هذا صراحةً لأنك لا تريد أن تظهر رموز تعبيرية
00:23:12في شيء يتم قراءته بصوت عالٍ، أو أن تظهر رموز ماركداون هناك.
00:23:17حسنًا. أعتقد أن هناك أمورًا أخرى أكثر شيوعًا، مثل القواميس المخصصة. توفر معظم محركات تحويل النص إلى كلام هذه الميزة لك،
00:23:23مثل كيفية نطق الكلمات المخصصة، سواء كانت أسماء أعلام، أو علامات تجارية،
00:23:30أو اختصارات، وما إلى ذلك. لذا، قم بضبط هذه الإعدادات عند الانتقال من نموذج اللغة إلى مخرجات تحويل النص إلى كلام،
00:23:36لأنك إن لم تفعل، فسوف تفسد الأمر. وسأعرض لك مثالاً على كيفية اختبارنا
00:23:40لذلك. الميزة الأخرى هي أن معظم المحركات توفر لك أيضًا التحكم في السرعة. لذا، إذا كنت تعلم أنك تنطق
00:23:47كيانًا معينًا، فقم بإبطاء السرعة، واجعل وكيلك يبطئ سرعته لتصبح 0.8x أو 0.7x، لكي يتمكن من
00:23:54توضيح ذلك الكيان المحدد بدقة، ولا يفسد طريقة نطق البريد الإلكتروني أو رقم الهاتف
00:24:00أو الاسم حرفًا بحرف. وقم بتسوية جميع الأمور الفوضوية، مثل عناوين البريد الإلكتروني، والعملات، والتواريخ. لا تترك هذا الأمر لنظام تحويل النص إلى كلام ليقوم به.
00:24:09معظم الأنظمة تفعل ذلك، لكن لا تترك الأمر بالكامل لنظام تحويل النص إلى كلام. بل قم بنناء طبقة التسوية والتطبيع الخاصة بك من جانبك
00:24:15حتى إذا احتجت غدًا إلى تبديل نظام تحويل النص إلى كلام، أو لأي سبب توقف النظام الأول عن العمل وأردت استخدام
00:24:21نظام آخر، فلن تضطر للاعتماد كليًا على محرك نظام تحويل النص إلى كلام، بل تبني هذا النظام
00:24:25داخليًا لتتمكن من إدارته. وبعد ذلك، أعتقد أنني لا أملك الدفعة الخاصة بي هنا،
00:24:32لكنني لا أملك اسم عائلتي هنا. لذلك فإن الاختبار الأول بالنسبة لي هو أنه إذا لم يستطع نطق اسم عائلتي
00:24:39أو اسم شركتي، فهذا يعني أنه يرتكب خطأً فادحًا بالفعل. اسم عائلتي هو بالاسوبرامانيان،
00:24:44وهو اسم طويل نوعًا ما.
00:24:50وإذا لم تتمكن من نطق ذلك باستخدام وكيل ذكاء اصطناعي صوتي، فهذه علامة فشل بالنسبة لي. وأنا أعلم،
00:24:56كما تعلم، أن الوكيل سيفسد الكثير من الكلمات التي تحتاج إلى نطق دقيق يومًا بعد يوم.
00:25:04النقطة الثانية هي اسم شركتنا Pliwo. فالكثير من المحركات تنطقه Pliwo أو ما شابه ذلك.
00:25:09ولكنني أعتقد أن القدرة على التحكم في هذا الأمر بشكل خاص داخل مسار العمل الخاص بك أمر بالغ الأهمية. وإذا كنت تبني منتجًا
00:25:16موجهاً للعملاء، فيجب عليك إتاحة هذا الخيار لعملائك.
00:25:21حسنًا، سأقوم بتخطي الشريحتين الأخيرتين سريعًا لأنني تجاوزت الوقت المخصص بكثير.
00:25:26اكتشاف نهاية الدور (End-of-turn detection)، أعتقد أن هذا موضوع منفصل، لكنني سأقوم سريعًا
00:25:32بعرض جميع النقاط لكي تتمكنوا من الاطلاع عليها سريعًا. وإذا أردتم إجراء محادثة
00:25:36بعد هذا العرض، فيمكننا الحديث عن ذلك. حسنًا، سأترك هذه الشريحة معروضة لمدة خمس ثوانٍ تقريبًا
00:25:41ثم يمكننا مناقشة الأمر لاحقًا خارج هذا الاجتماع، فقد تجاوزت الوقت المخصص لي بكثير.
00:25:49والموضوع الأخير هو المقاطعة (Barging-in) والتواصل الخلفي (Back-channeling).
00:25:53أعتقد أن هناك الكثير من الحديث حول نماذج الكلام إلى كلام التي تقوم ببعض هذه الأمور،
00:25:58ولكننا تمكنا من رؤية كيف يمكننا تنفيذ كل هذا في خطوط أنابيب الكلام إلى كلام العادية.
00:26:03أنت لا تحتاج حقًا إلى نموذج كلام إلى كلام معقد للقيام بكل هذه الأمور.
00:26:07مرة أخرى، سأكتفي بعرض هذا على الشاشة وأختتم به.
00:26:15حسنًا، لا أعتقد أن لدينا وقتاً لأسئلة. يمكننا الإجابة عليها لاحقاً إن وجد متسع من الوقت، ولكن
00:26:19نأمل أن يكون هذا مفيداً وأن يكون قد أعطاكم بعض الرؤى حول ما نراه في بيئات الإنتاج
00:26:24مع مليارات المكالمات على نطاق واسع. حسنًا، شكراً لكم.
00:26:29نراكم المرة القادمة.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기