عدم محاذاة الوسائط وإسناد الأصالة في الفيديوهات القصيرة — أديتيا غوتام، ميتا

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00أديتيا راهم: مرحبًا بالجميع، أنا أديتيا، وسنتحدث عن مشكلتين رئيسيتين
00:00:17تحدثان على منصات المحتوى القصير.
00:00:20سنتحدث عن كيفية التعامل مع هذه الأمور على نطاق واسع.
00:00:25للبدء، أول شيء هو فهم خصائص
00:00:28البيانات التي نحاول التعامل معها، وما هما المشكلتان الرئيسيتان اللتان نعمل
00:00:33على حلهما بالفعل، وما هي الأنظمة متعددة الوكلاء لحل تلك المشكلات على نطاق واسع.
00:00:39ما هي نماذج VLM المتخصصة صغيرة الحجم المختلفة التي يمكننا بناؤها لحل تلك المشكلات
00:00:46الخاصة بكل وكيل، وكيف نبني هؤلاء الوكلاء، وما هي الطرق المختلفة للقيام بـ
00:00:50تحسينها بالفعل، كجعلها قابلة للتوسع على نطاق ضخم جدًا، ثم سنلقي
00:00:56نظرة على التقييم بنهج شامل ومتكامل 360 درجة، وليس مجرد دقة واستدعاء.
00:01:00ما المتاح هناك؟
00:01:01كيف نفهم مسار المعالجة متعدد الوكلاء بأكمله، من مستوى LLM، والأدوات، وMCP، وما إلى ذلك،
00:01:08وكل ما هو موجود هناك.
00:01:09وبعد ذلك سنتطرق إلى تقنيات التحسين الخاصة جدًا بالرؤية الحاسوبية
00:01:14وبالبيانات، والتي ستتيح لنا وتمنحنا بعض الذكاء للقول إننا لا نحتاج
00:01:20حقًا لتطبيق مسار العمل الذكي هذا على جميع الفيديوهات، بل يمكننا تحديد المجموعة
00:01:25الصغيرة من الفيديوهات التي ينبغي أن تكون مرشحة لخضوع لهذه العمليات.
00:01:29وسنختتم بالنتائج الرئيسية.
00:01:32بيانات الحياة الواقعية فوضوية للغاية.
00:01:34إنها-- نحن نتحدث عن نطاق يتجاوز 100 مليون والكثير من المحتوى الشائع انتشارًا.
00:01:39هناك الكثير من المحتوى المضلل أو الضار.
00:01:42يحاول الأشخاص الخداع والتلاعب بالنظام.
00:01:43هناك الكثير من النصوص متعددة اللغات على الشاشات وفي مقاطع الفيديو الصور.
00:01:48والبيانات ديناميكية للغاية.
00:01:50وهي تتغير باستمرار من شهر لآخر.
00:01:52تظهر أدوات ذكاء اصطناعي مختلفة، وكل شيء يتطور.
00:01:54لذا فالأمر ديناميكي للغاية حقًا.
00:01:57هذا يعني وجود الكثير من مشكلات الانحراف وغيرها من الأمور التي تأتي مع بيانات الفيديو.
00:02:00ثم نعلم أنه لا توجد حقيقة قاطعة واضحة للمشكلة التي نحاول حلها.
00:02:05لذا فهذه مشكلات قائمة تحدث في مجموعات بيانات الفيديو في العالم الحقيقي.
00:02:10سنقوم بـ-- المشكلة الأولى التي سنتحدث عنها هي عدم محاذاة الوسائط،
00:02:14حيث النوع الأول هو بين الوسائط المختلفة، وهي مشكلة محلولة جدًا.
00:02:19يمكنك استخدام نموذج CLIP.
00:02:20يمكن أن يكون لديك نمط على الصور، مقاطع الفيديو، الصوتي، النص،
00:02:25وتحديد ما هي تشابه جيب التمام بدقة على تلك التضمينات واكتشاف الأمر.
00:02:29لذا فهذه مشكلة أسهل بكثير.
00:02:31ما سنتحدث عنه هو كيف نعالج مشكلات عدم المحاذاة داخل الوسيط نفسه.
00:02:37لذا اعتبر هذا مثل فيديو.
00:02:39لدينا فيديو طويل.
00:02:40وفجأة ترى شيئًا ما، إعلانًا، أو أجندة، أو أمورًا سياسية،
00:02:45أو شيئًا ما هناك لا ينبغي أن يكون في الفيديو كما توقعت عند النقر عليه.
00:02:49فكيف ننظر في الواقع إلى أجزاء الفيديو الصغيرة، ونفهم هذه المشكلة،
00:02:54ونكتشف أين يوجد شذوذ أو نوع من السلوك الاحتيالي أو المضلل هناك
00:02:59والذي لا ينبغي أن يكون موجودًا من الأساس.
00:03:01لذا فهذه هي المشكلة الأولى، والتي تتطلب الكثير من الفهم الدقيق، وفهم الرؤية،
00:03:05وفهم الفيديو لرؤية ما يحدث على مستوى المقطع والإطار بدقة.
00:03:10المشكلة الثانية هي فهم المحتوى غير الأصلي.
00:03:14في اقتصاد اليوم، ومع أدوات الذكاء الاصطناعي المتاحة، من السهل جدًا تكرار المحتوى وتنسيخه.
00:03:19عندما يرفع شخص ما فيديو أو شيئًا ما، نرى أنه يتم نسخه وتعديله،
00:03:25ومع وجود الأدوات أصبح تعديل هذه الفيديوهات أسهل بكثير.
00:03:29فكيف نكشف بالفعل هذا النوع من المحتوى غير الأصلي؟
00:03:33كيف نحدد مصدر الفيديو؟
00:03:35وقد تسبب هذا في الواقع في مشكلة في إسناد الحقوق، والائتمان، وخلل في النظام البيئي للمحتوى.
00:03:41وهناك قدر كبير من إجهاد المستخدم، حيث نرى الكثير من الفيديوهات المكررة التي لا ينبغي أن تكون موجودة بالأساس.
00:03:47بالانتقال إلى النظام متعدد الوكلاء، أول شيء هو لماذا نلجأ إلى نظام متعدد الوكلاء،
00:03:54وليس وكيلًا واحدًا أو نموذج LLM واحدًا، وذلك لأن المشكلة معقدة حقًا.
00:03:57إنها تتطلب عقدًا متخصصة للغاية ونوعًا من الفهم في كل جزء من الاسترجاع،
00:04:04وفهم المحتوى، ثم التفكير الاستنتاجي.
00:04:07وإذا كان بإمكانك حل مشكلة بوكيل واحد أو نموذج LLM واحد، فلن نحتاج إلى استخدام أنظمة متعددة الوكلاء.
00:04:14وهنا يأتي العقل المركزي، وكيف نفكر، وكيف يحدث تفكيك هذه المشكلة وتحليلها.
00:04:22الخطوة الأولى هي أن يكون لديك فيديو ومعرف فيديو وكل شيء يُمَرَّر إلى وكيل المراجعة (Reviewer Agent).
00:04:28هذا وكيل مركزي.
00:04:29إنه في الأساس المنسق للنظام.
00:04:31اعتبره بوابة API تقوم بتفكيك الإشارات واكتشاف ما يحدث في الصورة.
00:04:38ما يفعله هذا الوكيل هو الاستعانة بوكيل الإدراك (Perceiver Agent)، ووكيل الإدراك هو الذي يُعتبر
00:04:46خبير VLM متطورًا للغاية ويمتلك الكثير من أدوات الصور والفيديو تحت تصرفه.
00:04:52يأخذ وكيل الإدراك المعرّف من وكيل المراجعة ويجلب الفيديو من قاعدة البيانات.
00:05:01ثم يفككه إلى أجزاء أصغر باستخدام أدوات مختلفة وتضمينات دلالية وتغييرات زمنية مختلفة تحدث.
00:05:08وهو أمر يتجاوز نطاق حديثنا اليوم قليلاً، لكنها تقنيتنا التي تضمن عدم قيامنا بذلك بمعدل إطارات ثابت.
00:05:17بل نحدد أين حدث التغيير الزمني ونضغط تلك الإطارات المتشابهة في إطار واحد أو إطارين.
00:05:23ثم يحصل وكيل الإدراك على جميع البيانات من مستوى المقطع، ومستوى تضمين الفيديو، ويحصل على كل المعلومات حول المقطع والتضمين والعلامات والتعرف الضوئي على الحروف (OCR) وكل ما هو موجود،
00:05:34وما هو الوصف بلغة طبيعية، وما هي الطوابع الزمنية من أي إطار إلى أي إطار، وكيف تبدو هذه البيانات الوصفية.
00:05:41ثم يقدم تلك البيانات إلى وكيل المراجعة.
00:05:43سينظر وكيل المراجعة في كل هذه البيانات الزمنية، كائن JSON هذا المقدم من وكيل الإدراك بصيغته الخام، إلى جانب التضمينات والمعرفات الدلالية والعلامات وOCR وكل شيء.
00:05:52ويجري تحليلاً زمنيًا.
00:05:55ينظر ليرى، حسناً، من الإطار الأول إلى الإطار رقم 360، أو حتى ست ثوانٍ، كان الفيديو يتحدث عن الرياضة.
00:06:05وفجأة نرى أنه من الثانية 6 إلى الثانية 6.5، من الإطار رقم كذا إلى كذا، يتغير المحتوى إلى شيء سياسي.
00:06:14لذا لمجرد النظر في البيانات الوصفية، يستطيع وكيل المراجعة الفهم والاستيعاب واكتشاف الشذوذ بدقة في
00:06:22هذا المجال الزمني.
00:06:23وبمجرد قيامه بذلك، يحدد ما إذا كان هذا عدم محاذاة في الوسائط بالفعل، أم أن هناك مشكلة أكبر هناك.
00:06:30لذا سينظر وكيل المراجعة ويتحدث إلى وكيل الاسترجاع (Retriever Agent)، ويخبره: هذا هو الفيديو الذي أدرسه.
00:06:36هذه بعض البيانات الوصفية التي قمت بالفعل بإزالة التكرار منها ومعالجتها.
00:06:41الآن زوّدني ببعض المعلومات عن المقاطع المشابهة المتاحة في قاعدة البيانات.
00:06:47لذا سينظر وكيل الاسترجاع في جميع الإشارات المقدمة من وكيل الإدراك، وجميع البيانات الوصفية على مستوى المقطع والفيديو بأكمله، ويفهرسها في قواعد بيانات مختلفة بشكل تكيّفي.
00:06:57على سبيل المثال، قد تكون الموضوعات عبارة عن فهرس معكوس يحتوي على موضوعات والكثير من الفيديوهات.
00:07:02بالنسبة للتضمين، ستكون قواعد بيانات متجهية متوفرة هناك.
00:07:06ولأنواع الكيانات المختلفة المستخرجة، لدينا قواعد بيانات رسومية حيث يحدد وكيل المراجعة: حسناً، هذه قواعد بيانات متعددة، وهذه الكيانات، وهذه بيانات وصفية.
00:07:16دعني أفهرسها بحيث يمكنني في وقت الاستدلال المباشر تحديد المقاطع والكيانات والموضوعات المشابهة المتاحة لجلبها وتحسين معدل الاستدعاء لمقطع معين.
00:07:28بالانتقال إلى الوكلاء الفرديين، لقد تحدثنا عن وكيل الإدراك.
00:07:32لقد فحص الفيديو بأكمله، وقام بتفكيك زمني إلى مقاطع صغيرة بناءً على التضمين الدلالي وبعض الخوارزميات، وقام بضبط نموذج VLM لدفع كل المعلومات الملموسة
00:07:45والدقيقة للغاية حول كل مقطع والفيديو بأكمله.
00:07:51وبما أننا نتعامل على نطاق ضخم جدًا، فهذا يعني أنه لا يمكننا الاكتفاء بنماذج VLM القياسية المتاحة.
00:07:56يجب أن يكون هناك ضغط، وتوفير طريقة فعالة من حيث التكلفة لتشغيل هذه النماذج لتطبيقها على مليارات الإطارات.
00:08:05وهنا ندخل في التدريب المسبق، والضبط الدقيق، وتقطير المعرفة، والتكميم لنشر وحل المشكلات عبر
00:08:13نماذج VLM متخصصة للغاية بناءً على هذه المشكلة المحددة.
00:08:16وسنتحدث بإيجاز عن ذلك.
00:08:19وكيل الاسترجاع هو الذي تحدثنا عنه بشكل عام جدًا.
00:08:22وما يفعله في المعالجة غير المتصلة بالإنترنت هو أخذ كل الإشارات التي فككها وكيل الإدراك بنمط غير متصل،
00:08:29فاعتبر أنك بدلاً من وكيل، تأخذ تلك المكتبة وتجري تحليلاً غير متصل بالإنترنت على نطاق واسع.
00:08:34لنقل مثلاً عبر عنقود Ray أو شيء من هذا القبيل.
00:08:37وبمجرد الحصول على كل تلك البيانات الوصفية، يقوم بفرزها وفهرستها في قواعد بيانات مختلفة.
00:08:42ويقوم بالتجميع العنقودي غير المتصل بشكل دوري لمعرفة المحتوى المشابه، ومعرف التضمين، ومعرف العنقود لكل مقطع وللفيديو بأكمله.
00:08:50فتكون هذه هي البيانات التي يُعتمد عليها في الاستدلال المباشر للعثور على مقاطع فيديو مشابهة.
00:08:56وفي النمط المباشر، تُعطى استعلامًا أو معرف مقطع وكل تفاصيل البيانات الوصفية.
00:09:01فيحدد ما هو موجود في قاعدة البيانات الشاملة ويشبه هذا المقطع.
00:09:06وما هي العناصر المختلفة التي تتمتع بدرجة تشابه عالية.
00:09:09لذا ينظر في قواعد البيانات، ويجد مقاطع وصناع محتوى متشابهين ومعلومات بيانات وصفية مختلفة.
00:09:16وإعادة ترتيب تلك المرشحات واستخدام بعض الأدوات، مثل نتيجة نطاق النموذج التقليدي، كنتيجة التصنيف،
00:09:24لمعرفة المرشحات المختلفة التي قد تكون مزعجة أو غير عالية الجودة، وتلك الأمور هناك.
00:09:29وبمجرد الحصول على أفضل المرشحات، يُعيدها إلى المراجع.
00:09:33والمراجع هو المكان الذي يعالج فيه بالفعل إشارات المحتوى الرئيسية وتضمينات مقاطع الفيديو.
00:09:39هذا فيديو مشابه مقدم من المسترجع.
00:09:42دعني أفكر في الأمر وما إذا كنت بحاجة إلى إعادة الإنشاء والحصول على المزيد من البيانات من المسترجع.
00:09:48وهنا يمتلك المراجع جميع الإشارات الزمانية من مقطع فيديو واحد.
00:09:52ولديه كل المعلومات عن المقاطع المشابهة، وفهم المؤلِفين المشابهين وأشياء أخرى.
00:09:58كما يمتلك معلومات لحظية حول كيفية تفاعل المستخدمين بالفعل مع هذا الفيديو.
00:10:03ما هي الأنواع المختلفة من البلاغات أو التعليقات، وما هي نبرة المشاعر في تلك التعليقات هناك، أليس كذلك؟
00:10:13لذا، فإن الكثير من هذه الإشارات التي تفوتها الإشارات غير المتصلة بالإنترنت ونماذج اللغة والبصريات (VLMs) والوكلاء الآخرون،
00:10:18يتم دمجها أيضاً لمعرفة ما إذا كان هناك تغيير يحدث في مشاعر المستخدمين.
00:10:22ما هي الاستجابة التي أحصل عليها في الوقت الفعلي؟
00:10:25لذا هناك أدوات مختلفة متاحة لهذا لفهم الفيديو بالفعل، ليس فقط من ناحية المحتوى
00:10:30ومن المنظور الدلالي، بل بفهمه من منظور تفاعل المستخدم.
00:10:36تلك الإشارات مهمة جداً حقاً.
00:10:38لذا بمجرد الحصول على هذه المهمة وكل شيء، نقوم ببناء هذا الإطار الوكيلي.
00:10:44وكل أطر العمل الوكيلية هذه، يتم تشغيل وكيلائها الثلاثة جميعاً بواسطة نماذج لغة وبصريات
00:10:50متخصصة وصغيرة الحجم نوعاً ما.
00:10:54لذا سنتحدث عن التدريب المسبق أولاً.
00:10:58الآن، في معظم الحالات، ترى أنك تملك تدريباً مسبقاً.
00:11:01تقوم بضبط محول الرؤية الخاص بك قليلاً هنا وهناك وضبطه بشكل أساسي لغرضك المحدد.
00:11:08الفكرة هي أن نماذج اللغة والبصريات هذه، المتاحة في الخارج، النماذج التأسيسية، النماذج المتقدمة،
00:11:14مُدرَّبة على مجموعة بيانات نظيفة وجيدة للغاية، بيانات ويب جيدة الضبط والتنظيف وكل شيء.
00:11:20لكن البيانات الداخلية لغرض معين لا تمتلك نفس خصائص البيانات تلك.
00:11:26إنها غير منظمة.
00:11:27وتم إنشاؤها بواسطة المستخدمين.
00:11:28وهي مخصصة لسير العمل الخاص بك.
00:11:30هذا يعني أنك بحاجة إلى التدريب المسبق على رموز الصور واللغة لتضبيط محول الرؤية الخاص بك من الصفر
00:11:37ومعرفة ما إذا كان هناك فارق بين تضبيطه وتدريبه من الصفر.
00:11:42وهنا يكمن دور التدريب المسبق المفيد.
00:11:44إنه مكلف قليلاً، ولكن إذا كان بإمكانه إحداث فارق، فهذا يعمل بشكل جيد حقاً.
00:11:50الثاني هو الضبط الدقيق للتعليمات، حيث لدينا مشكلتان.
00:11:54لدينا سياسات معينة وإرشادات معينة.
00:11:57نعرف المحتوى والإشارات هناك، فيفهمها ويضبطها على مجموعة البيانات التخصصية تلك مع
00:12:04مخرجات معينة، وهي مخطط، مثل مخطط JSON، لفهم ماهية عدم محاذاة النمط أو
00:12:10تكرار الدرجات وسلسلة التفكير المنطقي الأخرى المقدمة من وكيل المراجعة.
00:12:16لذا لدينا هنا مقطع فيديو.
00:12:17لدينا مشفر رؤية، قمنا بتدريبه مسبقاً قليلاً.
00:12:21مثل الآن، نحن نقوم بمزيد من التدريب على ذلك.
00:12:23هناك جهاز إسقاط يقع بين محول الرؤية ونماذج اللغة،
00:12:27وهو في الواقع جسر بينهما بشكل أساسي.
00:12:30ثم لدينا المخرجات اعتماداً على بيانات الضبط الدقيق للتعليمات الموجودة لدينا في هذا الجانب.
00:12:35لذا فهذا هو الجزء الحاسم لرفع أداء النموذج الخاص بك في مجالك المحدد.
00:12:45لذا فإن السياق هو بشكل أساسي أن لديك دوراً وسياسة والأدوات المتاحة
00:12:50لربط ذلك ببعض البيانات الوصفية، والأشياء الأخرى المتاحة هناك.
00:12:54أعطه الأمور كاملة بطريقة موجزة جداً في السياق، ودعه يكتشف ما هي
00:13:01التسميات الهيكلية التي وجدتها. هذه التسميات هي تصنيفات داخلية، وهي التي
00:13:06أنشأناها لتحديد ماهية أمور الأنماط بالضبط، وما هي المشكلات المختلفة التي نراها،
00:13:12وما هي سلاسل التفكير المنطقي المختلفة التي ينبغي أن توجد في النموذج،
00:13:15وكيف تبدو المخرجات للمراجع البشري. لذا فإن هذه بمثابة مجموعة بيانات عالية الجودة
00:13:21نقوم بضبطها بدقة لوكلاء مختلفين، أليس كذلك؟ لذا بمجرد الانتهاء من
00:13:27التدريب المسبق لمجرد فهم جانب الرؤية أو جوانب الأنماط الأخرى لمقاطع الفيديو،
00:13:33ثم ننتقل إلى الضبط الدقيق لجعله يفهم ويوفر السياق والمخرجات
00:13:38بالطريقة التي نريد معالجة مجموعة البيانات بها. المرحلة التالية هي مرحلة DPO،
00:13:44وهي تقنية تُستخدم كثيراً في مرحلة ما بعد التدريب لضبط نماذجنا بدقة
00:13:51في نطاق أو مجال أو فهم سياسة معين أو ما شابه. ولكن يمكن استخدام هذا أيضاً
00:13:58كثيراً في الإنتاج لفهم العينات التي
00:14:02لا تؤدي بشكل جيد بواسطة أنظمتك متعددة الوكلاء ونماذج اللغة الكبيرة.
00:14:11لذا فإن ما يمكن فعله هو أن لديك مجموعة بيانات الإنتاج القادمة، ولديك الكثير من
00:14:17الاستنتاجات التي تحدث، فتأخذ عينة فرعية من هذه البيانات القادمة من الإنتاج، وتمررها
00:14:23عبر نموذج لغة كبير كقاضٍ مُدرَّب داخلياً على مجموعة البيانات المصنفة بشرياً، ثم يكون لديك
00:14:29قائمة انتظار المراجعة البشرية لمعرفة الأداء الناتج في النظام الفعلي. وبمجرد حصولك على هذا
00:14:36الشيء، إذا كان أداؤك مذهلاً وأعلى من حد التوقع الخاص بك،
00:14:40مثل 95 بالمئة لكل مشكلة، فهذا أمر رائع. ولكن إن لم يكن كذلك، فهذا يعني وجود طريقة،
00:14:47يجب أن تكون هناك طريقة للتعلم من هذه العينات التي لم يؤدِّ فيها النموذج بشكل جيد. وهنا يكون لديك
00:14:52عنصر بشري في السلسلة. فهو يفهم كل التتبعات الموجودة من جميع الوكلاء،
00:14:57واستدعاءات نماذج اللغة، وبروتوكول سياق النموذج (MCP)، ويكتشف أين حدثت المشكلة. هل هي في سلسلة
00:15:02التفكير المنطقي؟ أم أن هناك أدوات خاطئة تم استدعاؤها أو أن الاسترجاع لم يعمل؟ إذن فإن عمليات التحقق
00:15:08تلك وفهم كل خطوة ونقطة على مستوى ذكاء النموذج
00:15:14بالإضافة إلى المستوى الهيكلي هو ما تكتشفه وتقول: "حسناً، هذه هي التحسينات
00:15:20التي أحتاج إلى إجرائها على هذه العينات التي تم أخذها بشكل غير صحيح بواسطة نظامنا". وبمجرد حصولك على
00:15:28هذا الشيء، يكون لديك عينة إيجابية وعينة سلبية وما يحتاج إلى تحديث، وهنا تقوم
00:15:34بإعادة تدريب نموذجك لمعرفة كيف يمكننا تحسينه بشكل أفضل. وهذا تحسين مستمر
00:15:40حيث ننظر في هذه العينات، ونعيد التدريب، ونحسن النماذج، ونحصل على مجموعة بيانات جديدة
00:15:46من عينات الإنتاج ونحاول فهم ما إذا كان قد حدث انحراف في الأداء أو ما الذي يفعله
00:15:53النموذج بالضبط. لذا فإن وجود العنصر البشري في السلسلة هو دائماً عملية مستمرة حيث يكون لديك عينات يومية
00:15:58من الإنتاج وتحاول فهم كيفية أداء النموذج ونموذج اللغة الكبير كقاضٍ.
00:16:05بسبب التكلفة والقدرة على الحل بهذا الحجم، لا يمكننا استخدام نماذج اللغة والبصريات القياسية
00:16:14من الأحجام المتقدمة لأنها غير قابلة للتوسع وتتطلب الكثير من الاستنتاج والكثير من التعقيد،
00:16:20ونحن نحل مشكلة محددة للغاية. مثل، أنا لا يهمني حقاً ما إذا كان النموذج يستطيع حل مشكلة برمجية.
00:16:25أنا أهتم فقط بمشكلتي الخاصة بالمجال. هذا كل ما أهتم به. هذا لا يُعرض للعميل،
00:16:31هذا أمر داخلي. لذا سأقوم في الواقع بتقطير المعرفة خارج السياسة وداخل السياسة
00:16:37وإجراء القليل من التكميم اعتماداً على بعض تجارب التكميم لفهم
00:16:41ما إذا كانت الـ 4 بت تعمل، أم نمط bfloat، ما الذي يعمل حقاً بشكل جيد. ثم سيكون لدي جدول
00:16:47بأحجام مختلفة من التقطير والتكميم وفهم ورؤية أين يقع أدائي
00:16:54بشكل ممتاز وأين أكسب الكثير من الحوسبة وتوفير تكلفة الموارد في
00:17:00إنتاج الاستنتاج من خلال القيام بهذا التحسين. لذا فإن هذا حاسم حقاً لأنه كمشكلة،
00:17:07ما قمنا بحله جيد جداً. ولكن في الإنتاج، يجب أن يكون قابلاً للتوسع. ويجب أن يكون
00:17:13فعالاً من حيث التكلفة. لا يمكن أن يكون مجرد شيء موجود فقط في السوق
00:17:21لأننا نحل مشكلة محددة جداً هنا. بالعودة إلى التقييم، أساساً،
00:17:27الأول هو نجاح المهمة. بالطبع، هذه أشياء ثنائية. هل حدث توافق الأنماط أم لم يحدث.
00:17:31مثل وجود محاذاة أو عدم محاذاة. لذا فإن الدقة والاستدعاء ودرجة F1 هي مقاييس واضحة
00:17:37لفهم ماهية نجاح المهمة. ولكننا نريد النظر إلى النظام بطريقة شمولية للغاية،
00:17:42ليس فقط كهدف نهائي، بل ماذا يحدث عند كل نقطة، ومدى كفاءة عمل نظام الاسترجاع،
00:17:47وما هي مدة الاستجابة واستدعاء النظام، ومدى قدرتنا على التفكير المنطقي فيه. ما هي سلسلة
00:17:53التفكير القادمة من هذه النماذج عند كل مستوى وكيلي أو أينما كانت تفكيراتها
00:17:59قابلة للتطبيق، وهو أساساً وكيل المراجعة في حالتنا؟ وما هي جودة ذلك؟ هل هو
00:18:04مثل التفكير الزائد؟ هل يمكننا تقليل الميزانية في مكان ما للتأكد من أن النموذج يقوم بالفعل
00:18:09بعدل جيد بميزانية أقل؟ أو هل يمكننا زيادتها، ميزانية التخطيط أو التفكير المنطقي
00:18:16للأشياء للحصول على ميزانية أعلى والتأكد من أن المشكلة المعقدة التي نحلها
00:18:22ربما تحقق أداءً ودقة أعلى بكثير. لذا فإن وجود ميزانية تفكير تكيفية أمر
00:18:29مهم جداً أيضاً. ثم لدينا المتانة. ما هي الحالات الحدية التي نراها؟ ما هي معدلات الخطأ
00:18:34التي لدينا؟ ما هي العقد والنقاط المختلفة التي تحدث فيها؟ هل هو استدعاء أداة لا
00:18:39يعمل بشكل جيد؟ أم جزء الاسترجاع أم أن نموذج اللغة لا يؤدي عملاً جيداً أو أشيائاً من هذا القبيل. و
00:18:45ثم لدينا كفاءة النظام حيث لا ننظر فقط إلى أداء المخرجات و
00:18:51كل شيء، بل ننظر إلى كل جانب من جوانب تكلفة الرموز، أي نماذج لغة نستدعي؟ هل يمكننا
00:18:56تحسين نموذج اللغة أكثر لتوفير التكلفة؟ ما هي الكفاءة التي نراها و
00:19:01زمن الانتقال لكل وكيل وللنظام بأكمله مجتمعاً؟ ثم لدينا نموذج اللغة كقاضٍ حيث نرى
00:19:08أنه في أي نظام توقع، هناك دائماً انحراف في البيانات يحدث، خاصة عندما
00:19:14يكون لديك محتوى من إنشاء المستخدمين. فكيف يؤدي نموذج اللغة كقاضٍ، والمستخدم للتقييم وكل شيء،
00:19:20بالمقارنة مع قائمة الانتظار البشرية؟ هل هناك انحراف يحدث؟ هل نحتاج إلى إعادة تدريب نموذج اللغة
00:19:25كقاضٍ على مجموعة بيانات جديدة قادمة من فريق التصنيف؟ أم كيف نعمل في هذه الأجزاء؟ في
00:19:30التحسين، لدينا تحسين التقليل الزماني والمكاني، والذي ينظر في الإطارات
00:19:35المتشابهة ويضغطها في جانب واحد فقط. هذا يقلل من إجمالي معالجة
00:19:41الفيديوهات بدرجة كبيرة. الخيار الثاني هو أن يكون لديك تخزين مؤقت، ولديك محتوى
00:19:47رائج يتصدر حالياً، ولا تريد أن يمر نفس المحتوى الموجود هناك
00:19:52عبر مسار المعالجة بأكمله. وهناك تحصل على درجة تشابه عالية وتتخطى
00:19:57النظام متعدد الوكلاء وتتخذ قراراً بناءً على ذلك مباشرة. أما الخيار الثالث، وهو مهم جداً،
00:20:01فهو تقليم البيانات الوصفية. هذا هو المكان الذي نُقلّص فيه المساحة من الكثير من المرشحات بناءً على
00:20:07بعض البيانات الوصفية، على سبيل المثال، بعض الموضوعات وبعض صناع المحتوى الذين لديهم بالفعل سجل جيد جداً.
00:20:12هذا يعني أننا لسنا بحاجة حقاً لمعالجة كل هذه الصور وكل مقاطع الفيديو من صانع المحتوى
00:20:18الذي يتمتع بدرجة موثوقية عالية جداً، ويؤدي بشكل ممتاز في هذا المجال،
00:20:22حيث جودة الفيديو عالية جداً والتفاعل جيد. من هذه الأنواع من الأمور، فإن البيانات الوصفية هي شيء
00:20:27يمكن استخدامه لتصفية الفيديو الذي لا ينبغي حتى أن يذهب إلى الأنظمة. لذا فإن بعض هذه
00:20:33العلامات ستكون مفيدة. لذا فإن النقطة المستفادة الأخيرة التي يمكننا الخروج بها من هذه القاعة هي أن
00:20:42التفكيك هو المفتاح، أو قم بتفكيك المشكلة كلما كان ذلك ضرورياً. والتحسين التكيفي
00:20:50مهم جداً للعائد على الاستثمار والجدوى الاقتصادية. والتقييم الجيد أمر بالغ الأهمية. فكل شيء
00:20:56يعتمد على هذا. هذا هو الأساس لنظامك بأكمله ولنماذج اللغة والبصريات بأكملها. ومراقبة التوقعات
00:21:02والتحسين النوعي أمران ضروريان حقاً لضمان استدامة ذلك على المدى الطويل.
00:21:08وبهذا أختتم. شكراً جزيلاً لكم على الاستماع.

Key Takeaway

تتطلب معالجة مشكلات عدم محاذاة المحتوى وتكرار الفيديوهات على نطاق يتجاوز 100 مليون فيديو بناء نظام متعدد الوكلاء يعتمد على نماذج رؤية ولغة صغيرة ومتقطرة مع إطار تحسين تكيفي للبيانات والتكاليف.

Highlights

  • تعتمد معالجة بيانات مقاطع الفيديو القصيرة التي تتجاوز 100 مليون فيديو على نظام متعدد الوكلاء يوزع المهام بين الإدراك والاسترجاع والمراجعة.

  • يعتمد ضغط معالجة الفيديو على اكتشاف التغيرات الزمنية ودمج الإطارات المتشابهة بدلاً من معالجتها بمعدل إطارات ثابت.

  • يؤدي تقليل نطاق النموذج عبر التكميم واستخدام نماذج متخصصة صغيرة الحجم إلى تقليل تكاليف الاستدلال وحوسبة الإنتاج الضخم.

  • تساعد التصفية المسبقة للبيانات الوصفية والتخزين المؤقت للمحتوى الشائع على تجاوز معالجة النظام متعدد الوكلاء للفيديوهات ذات الموثوقية العالية.

  • يساهم تدريب نماذج الرؤية واللغة مسبقاً من الصفر على البيانات الداخلية غير المنظمة في رفع الدقة مقارنة بالنواة المعتمدة على بيانات الويب النظيفة.

Timeline

تحديات بيانات مقاطع الفيديو القصيرة في العالم الحقيقي

  • تتجاوز أحجام البيانات التشغيلية 100 مليون فيديو وتتميز بالتغير المستمر والانحراف الزمني.
  • تتضمن البيانات نصوصاً متعددة اللغات ومحتوى مضللاً ينشأ من أدوات الذكاء الاصطناعي المتطورة.

تفتقر بيئات الإنتاج الفعلي إلى الحقائق القاطعة الواضحة لحل مشكلات المحتوى. تتغير أنماط الخداع والتلاعب باستمرار، مما يجعل نماذج التقييم الثابتة غير مجدية على المدى الطويل.

أنواع عدم المحاذاة وإسناد الأصالة في الوسائط

  • يُحل عدم المحاذاة بين الوسائط المختلفة بسهولة عبر تقنيات التضمين مثل نموذج CLIP.
  • يتطلب عدم المحاذاة داخل الوسيط نفسه تحليل مقاطع الفيديو على مستوى الإطار لاكتشاف الشذوذ المضلل.
  • تسهل أدوات التعديل تكرار المحتوى، مما يؤدي إلى خلل في إسناد الحقوق وإجهاد المستخدمين.

تظهر مشكلة عدم المحاذاة الداخلية عند ظهور محتوى سياسي أو إعلاني غير متوقع داخل فيديو طويل. يتسبب انتشار المحتوى غير الأصلي في توزيع غير عادل للائتمان بين صناع المحتوى وتكرار التجارب السيئة للمستهلكين.

بنية النظام متعدد الوكلاء وتوزيع المهام

  • يدير وكيل المراجعة المركزية التنسيق وتفكيك الإشارات وتحديد الشذوذ الزمني.
  • يقوم وكيل الإدراك بتقسيم الفيديو زمنياً واستخراج بيانات التضمين والتعرف الضوئي على الحروف.
  • يفهرس وكيل الاسترجاع المقاطع والكيانات في قواعد بيانات متجهية ورسومية ومعكوسة.

يتولى وكيل الإدراك ضغط الإطارات المتشابهة زمنياً في إطار واحد بناءً على التغيرات الدلالية. يتلقى وكيل المراجعة هيكل البيانات الخام ويحلل التحولات المفاجئة في موضوع الفيديو، مثل الانتقال من الرياضة إلى السياسة.

آلية عمل الوكلاء في البيئات المتصلة وغير المتصلة

  • ينفذ وكيل الاسترجاع التجميع العنقودي غير المتصل بالإنترنت بصفة دورية عبر عناقيد المعالجة الموزعة.
  • يعتمد الاستدلال المباشر على مطابقة الدرجات وتصفية المرشحات ذات الجودة المنخفضة.
  • يدمج وكيل المراجعة إشارات تفاعل المستخدمين والتعليقات وتحليل المشاعر في الوقت الفعلي.

يوفر التجميع العنقودي غير المتصل معرفات التضمين المرجعية لاستخدامها عند طلب الاستدلال الفوري. يغطي تحليل مشاعر التعليقات والبلاغات الحية الفجوات التي لا تدركها نماذج الرؤية واللغة المستقلة.

التدريب المسبق والضبط الدقيق لنماذج الرؤية واللغة

  • يتطلب المحتوى المنشأ بواسطة المستخدم تدريب محولات الرؤية مسبقاً من الصفر لعدم ملاءمة بيانات الويب النظيفة.
  • يربط جهاز الإسقاط البنيوي بين محول الرؤية ونماذج اللغة الكبيرة.
  • يُنفَّذ الضبط الدقيق للتعليمات باستخراج مخرجات هيكلية محددة وفق المخططات الداخلية.

تختلف طبيعة البيانات غير المنظمة داخل المنصات عن المجموعات التدريبية المفتوحة. يضمن الضبط الدقيق للتعليمات توفير سلاسل تفكير منطقي تتوافق مع سياسات المراجعة البشرية ومخططات JSON المطلوبة.

التحسين المستمر عبر تقنية DPO والتكميم

  • تُحلل العينات ضعيفة الأداء عبر نموذج لغة كقاضٍ ومراجعين بشريين لتحديد أسباب الخلل.
  • تُعيد تقنية DPO تدريب النماذج بناءً على المقارنة بين العينات الإيجابية والسلبية.
  • يخفض التكميم وتقطير المعرفة تكلفة الحوسبة لتتناسب مع متطلبات تشغيل الإنتاج الضخم.

تساعد مراجعة أخطاء سلاسل التفكير واستدعاء الأدوات في معالجة الانحراف الأداء. يتيح استخدام نماذج مصغرة ومكممة بقدرة 4-bit خفض تكاليف الاستدلال الداخلي دون التأثير على جودة النتائج.

استراتيجيات التقييم الشامل وتحسين الأداء

  • يتطلب التقييم الشامل ضبط ميزانية التفكير التكيفي بناءً على تعقيد المشكلة.
  • يقلل الضغط الزماني والمكاني الحجم الإجمالي لمعالجة مقاطع الفيديو.
  • تمنع التصفية المسبقة عبر البيانات الوصفية والتخزين المؤقت دخول الفيديوهات الموثوقة إلى النظام الوكيلي.

تسمح ميزانيات التخطيط التكيفية بتقليل استهلاك الرموز في المهام البسيطة وزيادتها في الحالات المركبة. تُستخدم سجلات موثوقية صناع المحتوى لتجاوز عمليات المعالجة المعقدة، مما يحقق جدوى اقتصادية أعلى.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video