العقبة القادمة أمام الذكاء الاصطناعي المادي هي العثور على الفيديو المناسب — رافائيل ليفي، برايت داتا
AAI Engineer
컴퓨터/소프트웨어경제 뉴스AI/미래기술
스크립트
00:00:00مرحباً بالجميع، وأهلاً بكم. لمن أتوا لرؤيتي تحديداً، شكراً لكم. ولمن
00:00:21يتواجدون هنا فقط، شكراً لكم أيضاً. سأحاول إمتاعكم وأعلمكم شيئاً جديداً.
00:00:26مجدداً، اسمي رافاييل، وأعمل في Bright Data منذ أكثر من ثماني سنوات، ونحن هناك نجمع البيانات ونحاول الابتكار.
00:00:38لذا أريد اليوم التحدث عن اكتشاف الفيديو لتدريب النماذج العالمية القائمة على الوكلاء، وسنشرح ما يعنيه ذلك بعد قليل.
00:00:48إذاً، ما الذي يتطلبه اليوم بناء نظام يمكنه الرؤية والفهم والتصرف؟
00:00:56أليس كذلك؟ أعني، لقد فهمنا ماهية الذكاء الاصطناعي ونعمل على تحسينه باستمرار، هذا الجزء تم التعامل معه تقريباً،
00:01:04لكن الجزء الصعب الآن هو طبيعة البيانات التي تزوده بها، فالجميع يعلم أن الذكاء الاصطناعي بدون بيانات مجرد صندوق فارغ.
00:01:13أليس كذلك؟ دعوني أعد بكم قليلاً إلى الوراء، في عام 2022، علمت جوجل روبوتاً باستخدام الصور،
00:01:25من خلال إجراء أفعال في العالم الحقيقي. ثم بالانتقال إلى الأمام، حدثت قفزة نوعية. ففي عام 2023، أصبح لدينا ذكاء اصطناعي يتحكم بالفعل في روبوتات متعددة.
00:01:37وفي عام 2024، ظهر المصدر المفتوح. وهنا تغيرت قواعد اللعبة. فبمجرد توفر المصدر المفتوح، أتيح لجميع المختبرات الوصول للذكاء الاصطناعي وبدأت بالفعل في دمجه داخل الروبوتات.
00:01:51والآن تشغل هذه النماذج بالفعل روبوتات شبيهة بالبشر. أرى بعضها بالطبع، ومعظمها هنا يُدار عن بُعد.
00:02:00لكن في سان فرانسيسكو مثلاً، تجد سيارات Waymo تقود دون أي سائقين. كم هذا رائع؟
00:02:07أول مرة ركبت فيها السيارة ظننت أنني سأموت، لكن التجربة كانت لطيفة جداً في الواقع.
00:02:12أليس كذلك؟ الآن، كيف تعتقدون أنها تعلمت القيادة؟ عبر تعليم نفسها بنفسها، بالتعلم من كاميرات لوحة القيادة، أليس كذلك؟
00:02:22كل سيارة تحتوي على كاميرا. لذا إذا قدمت ذلك للذكاء الاصطناعي، فيمكنه استنتاج كيفية تشغيل الآلة.
00:02:31لذا كما قلت، لم يعد الذكاء الاصطناعي هو الجزء الصعب، بل البيانات هي العائق، وهذا ما أريد التحدث عنه.
00:02:39بالنسبة لنماذج الدردشة اللغوية الكبيرة، هناك ترليونات الكلمات والنصوص، لدينا كم هائل من البيانات النصية لتدريبها.
00:02:49وبالنسبة لتوليد الصور، لدينا مليارات الصور المصنفة، وتلك قاعدة بيانات ضخمة أيضاً.
00:02:56لكن بالنسبة علم الروبوتات، لا يوجد سوى نحو مليون فيديو فقط. إنها مجموعة بيانات صغيرة ومحدودة للغاية لروبوتات تقوم بأعمال ما.
00:03:09والفكرة هنا هي أن العديد من الشركات تقوم بتدفع أموالاً لأشخاص لتسجيل أفعال معينة.
00:03:20على سبيل المثال: “سجل لي كيف تفتح الباب”، أو “سجل لي كيف تجلس على الكرسي”.
00:03:28تكمن المشكلة حينئذٍ في أنه عندما يُطلب من شخص القيام بشيء ما، فإنه لا يفعله بشكل طبيعي.
00:03:34لذا أسميها بيانات مُوجَّهة، فعندما يُطلب منك تصوير طريقة فتحك للباب وتفعل ذلك لأجل شخص ما،
00:03:40لن تكون الحركة مماثلة لما لو كنت تدخل المنزل بشكل طبيعي، فالحركة مختلفة تماماً.
00:03:45هل هذه البيانات صالحة لتدريب الروبوتات؟ في تقديري، لا. إنها بيانات متحيزة ولا تعطي نفس النتائج.
00:03:53وبالتالي لن يكون الروبوت فعالاً كما لو كان يتحرك ببديهية تلقائية.
00:03:59لذا وضعت بعض الأمثلة على الشريحة.
00:04:06البيانات التي تُصنع يدوياً ليست كلك البيانات العفوية المأخوذة من الواقع.
00:04:12كما أن الناس يتصرفون بشكل مختلف تماماً عندما يكونون أمام الكاميرا.
00:04:16كما تعلمون، البعض يخجل من الكاميرا، وبمجرد تسليطها عليهم يتغير تصرفهم.
00:04:23لكن الأمر مختلف تماماً في الحياة الطبيعية.
00:04:27وهذا ما نحاول حله في Bright Data.
00:04:35مجدداً، لماذا تعتبر مصادر البيانات المعتادة غير كافية؟
00:04:37المحاكاة الافتراضية رخيصة، لكن الجميع يلعب ألعاب الفيديو.
00:04:44الفيزياء في ألعاب الفيديو قريبة من الواقع، لكنها ليست جيدة بما يكفي لتدريب روبوت عليها.
00:04:50التحكم اليدوي، بأن يتحكم شخص بالروبوت، أمر ممكن، لكن كم ساعة في اليوم يمكنك تسجيلها؟
00:04:57كم شخصاً تحتاج للحصول على بيانات على نطاق واسع ضخم؟
00:05:01يمكنك التسجيل ربما لثماني ساعات يومياً.
00:05:04كم ساعة ستجمع في السنة؟
00:05:07هذا الخيار لا يمكن التوسع فيه عملياً.
00:05:09وبالطبع هناك مجموعات بيانات جاهزة بالفعل، لكنها كما ذكرت صغيرة.
00:05:13لا يوجد سوى حوالي مليون فيديو حالياً.
00:05:15فما هو البديل إذاً؟
00:05:17البديل هو شبكة الويب.
00:05:20دعونا نفكر في يوتيوب فقط.
00:05:22كم عدد الفيديوهات الموجودة على يوتيوب؟
00:05:25لا أعلم، ربما 5 مليارات فيديو؟
00:05:28كم عدد التصرفات والحركات في تلك الفيديوهات التي يمكن للروبوت محاكاتها؟
00:05:34دعونا نفكر في الأمر.
00:05:35كم مقطع فيديو تعتقدون أنه موجود لشخص يفتح الباب من منظور الشخص الأول؟
00:05:42ملايين الساعات.
00:05:43ستندهشون من الرقم.
00:05:45تظهر فيديوهات الويب يومياً قواعد الجاذبية والحركات، أليس كذلك؟
00:05:53وتعرض السبب والنتيجة، كالحوادث مثلاً التي تعد أكبر مثال على السبب والنتيجة.
00:06:00وكيفية تعامل الناس مع الأجسام، وذلك في مليارات الساعات.
00:06:04إنها مواد تدريبية رائعة للروبوتات، ولكن ما هي المشكلة؟
00:06:08المشكلة هي وجود الكثير من البيانات غير المهمة أو المشوشة.
00:06:12خذوا هذا المثال مثلاً:
00:06:14أحد نماذج الذكاء الاصطناعي التي دربتها شركة ميتا زودوه بنحو مليون ساعة من فيديوهات العالم الحقيقي.
00:06:21ثم لم يتطلب الأمر سوى 62 ساعة من بيانات الروبوتات الفعلية للتحكم في روبوت حقيقي.
00:06:29إذا فكرتم في الأمر، فقد جُمِعت البيانات من مصادر عامة.
00:06:33تم تدريب الروبوت على أشياء عشوائية، وفي خلال 62 ساعة روبوتية كان يتحرك بالفعل.
00:06:41لذا لا حاجة للمحاكاة، فقد تم تقديم روبوتات ذاتية التحكم بسرعة.
00:06:52لكن الفيديوهات لا تظهر كيفية حركة الروبوتات، أليس كذلك؟
00:06:54قد تسألون: ما مدى فائدة فيديو لشخص يسكب الماء في كوب بالنسبة لروبوت؟
00:07:01هناك أساليب بالفعل تمكن الذكاء الاصطناعي من التمييز والتعلم من الأفعال الموجودة في الفيديو.
00:07:09إذا أخذت إطارين متتاليين، يقيس الذكاء الاصطناعي فارق الحركة بينهما.
00:07:15إذا كان لديك صورة (أ) وصورة (2)، وهناك حركة صغيرة تتغير بين الصورتين،
00:07:21فيمكن للذكاء الاصطناعي قياس ذلك التغير بالفعل.
00:07:24وإذا واصلت فعل ذلك عبر الفيديو بأكمله، يمكن للذكاء الاصطناعي تحديد الزوايا والمسافات،
00:07:30وكل ما يحتاجه لتدريب الروبوت.
00:07:34لذا لسنا بحاجة حتمية لبيانات أجهزة الاستشعار، ولكن بالطبع فإن فيديو تقوم بتنزيله
00:07:41من يوتيوب أو فيديو تستخرج منه البيانات لا يوصلك للنتيجة بنسبة 100% تلقائياً.
00:07:48أنت بحاجة لمعالجة إضافية فوق ذلك، لكن الأدوات متوفرة.
00:07:53إنها متاحة، وكل ما عليك فعله هو معالجتها.
00:07:58إليكم بضعة أمثلة أخرى:
00:07:59شركة إنفيديا مثلاً، عندما قامت بتدريب روبوت Cosmos، استغنت عن حوالي 96% من الفيديوهات.
00:08:07ما الذي يعنيه ذلك؟
00:08:09يقومون بتنزيل مليون ساعة فيديو،
00:08:12ثم يتضح أن 4% فقط منها هي المفيدة بالفعل.
00:08:15ويتم التخلص من كل ما متبقي.
00:08:16هذا هدر لقدرات المعالجة الحاسوبية.
00:08:18وهدر لسعة نطاق الشبكة.
00:08:19وهدر للمساحة التخزينية.
00:08:21إنه مجرد إهدار للكثير من الأموال.
00:08:23ونموذج Stable Video Diffusion يستغني عن 74% من الفيديوهات التي ينزلها.
00:08:30لذا نسعى في Bright Data لحل هذه المشكلة والمضي بها خطوة نحو الأمام.
00:08:37ما نقترحه هو: ابحث أولاً، ثم اجمع البيانات ثانياً.
00:08:41ما نفعله هو أننا نفهرس الفيديوهات ونسمح لك بالبحث عن أفعال وحركات محددة.
00:08:50وبما أننا يتحدث عن شخص يفتح الباب، فلنواصل استخدام هذا المثال.
00:08:55ما يمكنك فعله على منصتنا هو إدخال معلومات مفصلة.
00:09:01استعلام مثل: شخص يغسل الأطباق، شخص يطوي قميصاً، وهكذا.
00:09:06وسنزودك بمقاطع من الفيديوهات التي تتضمن هذه الأفعال.
00:09:13ما الذي يعنيه ذلك؟
00:09:16هذا يعني هداراً أقل في عملية جمع البيانات.
00:09:22وهداراً أقل في التخزين ونطاق الترددي.
00:09:25إليكم المزيد عن طريقة عمل النظام.
00:09:27بالطبع، حدد أولاً ما تبحث عنه.
00:09:32ونحن نبحث عبر مليارات ومليارات الفيديوهات المفهرسة مسبقاً.
00:09:36ليس بالكلمات المفتاحية، بل عبر الأفعال بالحركات.
00:09:39ثم نزودك بمقاطع جاهزة للاستخدام.
00:09:43وبالطبع تكون مهيأة بالفعل لعمليات التدريب لديك.
00:09:47فكل ما عليك فعله هو معالجتها قليلاً لقياس الحركة وحساسات المسافة وما شابه.
00:09:52وتصبح جاهزة لتُدمَج في الروبوت.
00:09:57لدي مثال لقطع فيديو قصير يوضح كيفية عمل ذلك بالفعل على منصتنا.
00:10:02دعوني أضغط على زر التشغيل هنا إن استطعت العثور عليه.
00:10:07نرى هنا شخصاً يغسل الأطباق بيده في الحوض، ويزيل الدهون عن الطبق،
00:10:12باستخدام الإسفنجة والصابون، بما في ذلك الشطف ووضع الأطباق في رف التجفيف، مع لقطات مقربة لتفاعل اليدين.
00:10:19ما يحدث الآن هو أنه يبحث عبر مليارات الفيديوهات.
00:10:24هذا الفيديو قديم نوعاً ما،
00:10:26كان لدينا نحو 100 مليون فيديو مفهرس هنا فقط، أما الآن فقد وصلنا إلى 1.1 مليار فيديو.
00:10:31وسيزودك حرفياً—المقطع مسرّع قليلاً حتى لا أضيع وقتكم—
00:10:35بمقاطع فيديو لأشخاص يغسلون الأطباق.
00:10:41ويمكنكم أن تروا هنا كل الفيديوهات التي وجدناها.
00:10:47قد لا تتعلق بعض هذه الفيديوهات بغسيل الأطباق مباشرة،
00:10:50بل قد تتناول تنظيف المطبخ،
00:10:52أو شيئاً آخر مختلفاً.
00:10:54وهذا مثال آخر:
00:10:55إنسان يطوي أنواعاً مختلفة من الملابس مثلاً.
00:10:59أليس كذلك؟
00:10:59إضافة القليل من الوصف إذن.
00:11:01كلما قدمت وصفاً أكثر التفاصيل، حصلت على نتائج أكبر وأدق.
00:11:06مجدداً، العرض مسرّع قليلاً.
00:11:08دعونا نرى.
00:11:14أريدكم أن تفهموا أنه يمكن تطبيق هذا على أي شيء.
00:11:16كأن تضع امرأة مساحيق التجميل.
00:11:17لنفترض أن لديك علامة تجارية وتريد إيجاد فيديوهات تظهر فيها منتجاتك.
00:11:21كل ذلك يمكن توفيره أيضاً.
00:11:23كما ترون، هناك أشخاص يطوون الملابس.
00:11:26وبالتالي يمكنك الآن تدريب روبوت على كيفية طي الملابس.
00:11:34بالطبع، كل شيء متاح عبر واجهة برمجة التطبيقات (API).
00:11:36ولا نتوقع من الأشخاص القيام بأي شيء يدوياً.
00:11:39أليس كذلك؟
00:11:39لذا يمكنك تشغيل الطلب عبر الـ API.
00:11:41تحصل على مقطع مسترجع من الفيديو، والرابط.
00:11:46ونمنحك رابط الفيديو الأصلي إذا أردت مشاهدته.
00:11:49لكن الشيء الرئيسي هنا هو أنه يمكننا إعطاؤك مقاطع من الفيديو لتدريب الروبوتات الخاصة بك.
00:11:57الآن، لست متأكدًا مما إذا كان أي منكم يدرب أي روبوتات.
00:12:01لذا، سأعطيكم مثالاً آخر على مدى فائدة ذلك.
00:12:04لنفرض أن لديك علامة تجارية.
00:12:06وتريد أن تعرف أين يتم استعراض علامتك التجارية في مقاطع الفيديو.
00:12:13عناوين الفيديوهات لا تهم لأنها في الواقع لا تتعلق بمنتجك.
00:12:19إنها مجرد شخص يقدم بودكاست، أو يسجل شيئًا ما.
00:12:22لكن، ترى امرأة تضع المكياج.
00:12:25وترى على الطاولة أن هذه هي علامتك التجارية للمكياج.
00:12:30فجأة، يمكنك العثور على جميع الفيديوهات التي تُستخدم فيها علامتك التجارية.
00:12:34مهما كانت.
00:12:35أليس كذلك؟
00:12:35عن طريق البحث باسم الفيديو، لن تجدها.
00:12:38لكن عبر فهرسة الفيديو، يمكنك في الواقع العثور على أشياء محددة تهمك.
00:12:45تفاحة تسقط من الشجرة.
00:12:47وما إلى ذلك.
00:12:48إذن، ما الذي يعود إليك؟
00:12:50نقدم لك هذا الطابع الزمني.
00:12:52ونقدم لك درجة المطابقة.
00:12:53مدى قربها من استعلام البحث الخاص بك.
00:12:55وبالطبع، عدد الإطارات.
00:12:57كم عدد الإطارات التي تتناول ما تبحث عنه.
00:13:03إذن، ما الذي يغيره هذا؟
00:13:06هذا يغير الكثير.
00:13:07حسناً، هدر أقل.
00:13:09لا تحتاج إلى تنزيل ملايين الساعات من الفيديوهات.
00:13:12يمكنك في الواقع الحصول بالضبط على الأفعال المحددة
00:13:16التي تهمك.
00:13:20مرة أخرى، هذا حاسم جداً لتدريب الروبوتات.
00:13:24لأن التشويش يخلق مشاكل وهلاوس.
00:13:28أليس كذلك؟
00:13:29هذا يزيل التشويش.
00:13:34فيمَ يفيد هذا؟
00:13:35ليس فقط للروبوتات، بل بوضوح للقيادة الذاتية.
00:13:38على سبيل المثال، Waymo.
00:13:39أليس كذلك؟
00:13:40تم تدريبها على فيديوهات كاميرات المراقبة بالسيارات.
00:13:43وهناك الملايين، مئات الملايين من الساعات على يوتيوب.
00:13:46من كاميرات السيارات.
00:13:47كم منكم يحب مشاهدة الحوادث؟
00:13:49حوادث كاميرات السيارات.
00:13:52أنا متأكد أن الجميع شاهد بعضاً منها.
00:13:53القيادة الجنونية في روسيا.
00:13:55أليس كذلك؟
00:13:56إذن، هذا ما نتحدث عنه.
00:13:58أليس كذلك؟
00:13:58الفيديوهات موجودة هناك.
00:14:01حسناً؟
00:14:01شخص يتجاوز الإشارة الحمراء.
00:14:02شخص يتوقف عند الإشارة الحمراء.
00:14:04ينعطف يساراً.
00:14:05ينعطف يميناً.
00:14:06وما إلى ذلك.
00:14:06كل ذلك يمكن أن يكون بيانات مفيدة جداً للتدريب.
00:14:11وأي نماذج عالمية أخرى.
00:14:13الفيزياء.
00:14:14أليس كذلك؟
00:14:14تحتاج الروبوتات إلى فهم الفيزياء.
00:14:16ما هي الجاذبية؟
00:14:18كيف تجلس؟
00:14:18كيف تمشي؟
00:14:19كيف تتحرك؟
00:14:21مرة أخرى، بالطبع يمكنك تسجيلها مسبقاً.
00:14:25في كثير من الأحيان حالياً، أتحدث مع بعض الأشخاص.
00:14:27ولديهم ملايين الأشخاص الذين يسجلون فيديوهات لهم.
00:14:30“يا رفاق، هل يمكنكم تسجيل كيفية فتح الأبواب لي؟”
00:14:33هذا أمر جنوني.
00:14:34لماذا تحتاج إلى مليون شخص يفعلون ذلك بينما كل شيء متاح عبر الإنترنت؟
00:14:39الإنترنت هو أحد أكبر قواعد البيانات الموجودة.
00:14:43لكن الناس لا... أعني، ليس من السهل استخدامه، أليس كذلك؟
00:14:46أعني، حالياً البحث الوحيد المتاح لنا هو عن طريق الكلمة المفتاحية لاسم الفيديو.
00:14:53وبالطبع، مصدر واحد، شبكة الفيديوهات العامة بأكملها في مكان واحد.
00:14:59أعني، لدينا يوتيوب، ولدينا فيميو، ولدينا العديد من مزودي الفيديوهات المختلفين هناك.
00:15:06مليارات ومليارات الساعات من بيانات التدريب تنتظرك فقط لـ تأخذها،
00:15:13وتجمعها، وتعالجها.
00:15:14لذا أساساً، هذا منتج جديد نقوم به في Bright Data، حسناً؟
00:15:18فهرسة الفيديوهات حتى تتمكنوا من العثور على أفعال محددة.
00:15:23أي شيء تفكرون فيه، كما تعلمون، يمكن أن يكون مفيداً للعلامات التجارية.
00:15:28أيضاً، الأمر لا يقتصر على بيانات التدريب فقط.
00:15:31أي شيء يخطر ببالك قد يكون مفيداً.
00:15:35ربما تكون لاعباً وتريد معرفة كيف تتجاوز هذا المستوى؟
00:15:40لكن لا يوجد فيديو بهذا الاسم بالتحديد.
00:15:42لذا يمكنك البحث عن أشخاص يتجاوزون هذا المستوى في لعبة الفيديو، صح؟
00:15:47أي شيء، العالم بين يديك.
00:15:52لذا سأختتم حديثي.
00:15:54لا أعلم إذا كانت لديكم أي أسئلة، لكن إذا أردتم التواصل معي والتحدث أكثر،
00:15:58لا تترددوا في إضافتي على LinkedIn.
00:16:01ونعم، أود أن أشكركم جميعاً على حسن استماعكم.
00:16:06وأنا موجود في جناح Bright Data إذا أردتم التحدث أكثر عن ذلك.
00:16:10وشكراً لحضوركم.
00:16:17أراكم في المرة القادمة.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기