العقبة القادمة أمام الذكاء الاصطناعي المادي هي العثور على الفيديو المناسب — رافائيل ليفي، برايت داتا

AAI Engineer
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00مرحباً بالجميع، وأهلاً بكم. لمن أتوا لرؤيتي تحديداً، شكراً لكم. ولمن
00:00:21يتواجدون هنا فقط، شكراً لكم أيضاً. سأحاول إمتاعكم وأعلمكم شيئاً جديداً.
00:00:26مجدداً، اسمي رافاييل، وأعمل في Bright Data منذ أكثر من ثماني سنوات، ونحن هناك نجمع البيانات ونحاول الابتكار.
00:00:38لذا أريد اليوم التحدث عن اكتشاف الفيديو لتدريب النماذج العالمية القائمة على الوكلاء، وسنشرح ما يعنيه ذلك بعد قليل.
00:00:48إذاً، ما الذي يتطلبه اليوم بناء نظام يمكنه الرؤية والفهم والتصرف؟
00:00:56أليس كذلك؟ أعني، لقد فهمنا ماهية الذكاء الاصطناعي ونعمل على تحسينه باستمرار، هذا الجزء تم التعامل معه تقريباً،
00:01:04لكن الجزء الصعب الآن هو طبيعة البيانات التي تزوده بها، فالجميع يعلم أن الذكاء الاصطناعي بدون بيانات مجرد صندوق فارغ.
00:01:13أليس كذلك؟ دعوني أعد بكم قليلاً إلى الوراء، في عام 2022، علمت جوجل روبوتاً باستخدام الصور،
00:01:25من خلال إجراء أفعال في العالم الحقيقي. ثم بالانتقال إلى الأمام، حدثت قفزة نوعية. ففي عام 2023، أصبح لدينا ذكاء اصطناعي يتحكم بالفعل في روبوتات متعددة.
00:01:37وفي عام 2024، ظهر المصدر المفتوح. وهنا تغيرت قواعد اللعبة. فبمجرد توفر المصدر المفتوح، أتيح لجميع المختبرات الوصول للذكاء الاصطناعي وبدأت بالفعل في دمجه داخل الروبوتات.
00:01:51والآن تشغل هذه النماذج بالفعل روبوتات شبيهة بالبشر. أرى بعضها بالطبع، ومعظمها هنا يُدار عن بُعد.
00:02:00لكن في سان فرانسيسكو مثلاً، تجد سيارات Waymo تقود دون أي سائقين. كم هذا رائع؟
00:02:07أول مرة ركبت فيها السيارة ظننت أنني سأموت، لكن التجربة كانت لطيفة جداً في الواقع.
00:02:12أليس كذلك؟ الآن، كيف تعتقدون أنها تعلمت القيادة؟ عبر تعليم نفسها بنفسها، بالتعلم من كاميرات لوحة القيادة، أليس كذلك؟
00:02:22كل سيارة تحتوي على كاميرا. لذا إذا قدمت ذلك للذكاء الاصطناعي، فيمكنه استنتاج كيفية تشغيل الآلة.
00:02:31لذا كما قلت، لم يعد الذكاء الاصطناعي هو الجزء الصعب، بل البيانات هي العائق، وهذا ما أريد التحدث عنه.
00:02:39بالنسبة لنماذج الدردشة اللغوية الكبيرة، هناك ترليونات الكلمات والنصوص، لدينا كم هائل من البيانات النصية لتدريبها.
00:02:49وبالنسبة لتوليد الصور، لدينا مليارات الصور المصنفة، وتلك قاعدة بيانات ضخمة أيضاً.
00:02:56لكن بالنسبة علم الروبوتات، لا يوجد سوى نحو مليون فيديو فقط. إنها مجموعة بيانات صغيرة ومحدودة للغاية لروبوتات تقوم بأعمال ما.
00:03:09والفكرة هنا هي أن العديد من الشركات تقوم بتدفع أموالاً لأشخاص لتسجيل أفعال معينة.
00:03:20على سبيل المثال: “سجل لي كيف تفتح الباب”، أو “سجل لي كيف تجلس على الكرسي”.
00:03:28تكمن المشكلة حينئذٍ في أنه عندما يُطلب من شخص القيام بشيء ما، فإنه لا يفعله بشكل طبيعي.
00:03:34لذا أسميها بيانات مُوجَّهة، فعندما يُطلب منك تصوير طريقة فتحك للباب وتفعل ذلك لأجل شخص ما،
00:03:40لن تكون الحركة مماثلة لما لو كنت تدخل المنزل بشكل طبيعي، فالحركة مختلفة تماماً.
00:03:45هل هذه البيانات صالحة لتدريب الروبوتات؟ في تقديري، لا. إنها بيانات متحيزة ولا تعطي نفس النتائج.
00:03:53وبالتالي لن يكون الروبوت فعالاً كما لو كان يتحرك ببديهية تلقائية.
00:03:59لذا وضعت بعض الأمثلة على الشريحة.
00:04:06البيانات التي تُصنع يدوياً ليست كلك البيانات العفوية المأخوذة من الواقع.
00:04:12كما أن الناس يتصرفون بشكل مختلف تماماً عندما يكونون أمام الكاميرا.
00:04:16كما تعلمون، البعض يخجل من الكاميرا، وبمجرد تسليطها عليهم يتغير تصرفهم.
00:04:23لكن الأمر مختلف تماماً في الحياة الطبيعية.
00:04:27وهذا ما نحاول حله في Bright Data.
00:04:35مجدداً، لماذا تعتبر مصادر البيانات المعتادة غير كافية؟
00:04:37المحاكاة الافتراضية رخيصة، لكن الجميع يلعب ألعاب الفيديو.
00:04:44الفيزياء في ألعاب الفيديو قريبة من الواقع، لكنها ليست جيدة بما يكفي لتدريب روبوت عليها.
00:04:50التحكم اليدوي، بأن يتحكم شخص بالروبوت، أمر ممكن، لكن كم ساعة في اليوم يمكنك تسجيلها؟
00:04:57كم شخصاً تحتاج للحصول على بيانات على نطاق واسع ضخم؟
00:05:01يمكنك التسجيل ربما لثماني ساعات يومياً.
00:05:04كم ساعة ستجمع في السنة؟
00:05:07هذا الخيار لا يمكن التوسع فيه عملياً.
00:05:09وبالطبع هناك مجموعات بيانات جاهزة بالفعل، لكنها كما ذكرت صغيرة.
00:05:13لا يوجد سوى حوالي مليون فيديو حالياً.
00:05:15فما هو البديل إذاً؟
00:05:17البديل هو شبكة الويب.
00:05:20دعونا نفكر في يوتيوب فقط.
00:05:22كم عدد الفيديوهات الموجودة على يوتيوب؟
00:05:25لا أعلم، ربما 5 مليارات فيديو؟
00:05:28كم عدد التصرفات والحركات في تلك الفيديوهات التي يمكن للروبوت محاكاتها؟
00:05:34دعونا نفكر في الأمر.
00:05:35كم مقطع فيديو تعتقدون أنه موجود لشخص يفتح الباب من منظور الشخص الأول؟
00:05:42ملايين الساعات.
00:05:43ستندهشون من الرقم.
00:05:45تظهر فيديوهات الويب يومياً قواعد الجاذبية والحركات، أليس كذلك؟
00:05:53وتعرض السبب والنتيجة، كالحوادث مثلاً التي تعد أكبر مثال على السبب والنتيجة.
00:06:00وكيفية تعامل الناس مع الأجسام، وذلك في مليارات الساعات.
00:06:04إنها مواد تدريبية رائعة للروبوتات، ولكن ما هي المشكلة؟
00:06:08المشكلة هي وجود الكثير من البيانات غير المهمة أو المشوشة.
00:06:12خذوا هذا المثال مثلاً:
00:06:14أحد نماذج الذكاء الاصطناعي التي دربتها شركة ميتا زودوه بنحو مليون ساعة من فيديوهات العالم الحقيقي.
00:06:21ثم لم يتطلب الأمر سوى 62 ساعة من بيانات الروبوتات الفعلية للتحكم في روبوت حقيقي.
00:06:29إذا فكرتم في الأمر، فقد جُمِعت البيانات من مصادر عامة.
00:06:33تم تدريب الروبوت على أشياء عشوائية، وفي خلال 62 ساعة روبوتية كان يتحرك بالفعل.
00:06:41لذا لا حاجة للمحاكاة، فقد تم تقديم روبوتات ذاتية التحكم بسرعة.
00:06:52لكن الفيديوهات لا تظهر كيفية حركة الروبوتات، أليس كذلك؟
00:06:54قد تسألون: ما مدى فائدة فيديو لشخص يسكب الماء في كوب بالنسبة لروبوت؟
00:07:01هناك أساليب بالفعل تمكن الذكاء الاصطناعي من التمييز والتعلم من الأفعال الموجودة في الفيديو.
00:07:09إذا أخذت إطارين متتاليين، يقيس الذكاء الاصطناعي فارق الحركة بينهما.
00:07:15إذا كان لديك صورة (أ) وصورة (2)، وهناك حركة صغيرة تتغير بين الصورتين،
00:07:21فيمكن للذكاء الاصطناعي قياس ذلك التغير بالفعل.
00:07:24وإذا واصلت فعل ذلك عبر الفيديو بأكمله، يمكن للذكاء الاصطناعي تحديد الزوايا والمسافات،
00:07:30وكل ما يحتاجه لتدريب الروبوت.
00:07:34لذا لسنا بحاجة حتمية لبيانات أجهزة الاستشعار، ولكن بالطبع فإن فيديو تقوم بتنزيله
00:07:41من يوتيوب أو فيديو تستخرج منه البيانات لا يوصلك للنتيجة بنسبة 100% تلقائياً.
00:07:48أنت بحاجة لمعالجة إضافية فوق ذلك، لكن الأدوات متوفرة.
00:07:53إنها متاحة، وكل ما عليك فعله هو معالجتها.
00:07:58إليكم بضعة أمثلة أخرى:
00:07:59شركة إنفيديا مثلاً، عندما قامت بتدريب روبوت Cosmos، استغنت عن حوالي 96% من الفيديوهات.
00:08:07ما الذي يعنيه ذلك؟
00:08:09يقومون بتنزيل مليون ساعة فيديو،
00:08:12ثم يتضح أن 4% فقط منها هي المفيدة بالفعل.
00:08:15ويتم التخلص من كل ما متبقي.
00:08:16هذا هدر لقدرات المعالجة الحاسوبية.
00:08:18وهدر لسعة نطاق الشبكة.
00:08:19وهدر للمساحة التخزينية.
00:08:21إنه مجرد إهدار للكثير من الأموال.
00:08:23ونموذج Stable Video Diffusion يستغني عن 74% من الفيديوهات التي ينزلها.
00:08:30لذا نسعى في Bright Data لحل هذه المشكلة والمضي بها خطوة نحو الأمام.
00:08:37ما نقترحه هو: ابحث أولاً، ثم اجمع البيانات ثانياً.
00:08:41ما نفعله هو أننا نفهرس الفيديوهات ونسمح لك بالبحث عن أفعال وحركات محددة.
00:08:50وبما أننا يتحدث عن شخص يفتح الباب، فلنواصل استخدام هذا المثال.
00:08:55ما يمكنك فعله على منصتنا هو إدخال معلومات مفصلة.
00:09:01استعلام مثل: شخص يغسل الأطباق، شخص يطوي قميصاً، وهكذا.
00:09:06وسنزودك بمقاطع من الفيديوهات التي تتضمن هذه الأفعال.
00:09:13ما الذي يعنيه ذلك؟
00:09:16هذا يعني هداراً أقل في عملية جمع البيانات.
00:09:22وهداراً أقل في التخزين ونطاق الترددي.
00:09:25إليكم المزيد عن طريقة عمل النظام.
00:09:27بالطبع، حدد أولاً ما تبحث عنه.
00:09:32ونحن نبحث عبر مليارات ومليارات الفيديوهات المفهرسة مسبقاً.
00:09:36ليس بالكلمات المفتاحية، بل عبر الأفعال بالحركات.
00:09:39ثم نزودك بمقاطع جاهزة للاستخدام.
00:09:43وبالطبع تكون مهيأة بالفعل لعمليات التدريب لديك.
00:09:47فكل ما عليك فعله هو معالجتها قليلاً لقياس الحركة وحساسات المسافة وما شابه.
00:09:52وتصبح جاهزة لتُدمَج في الروبوت.
00:09:57لدي مثال لقطع فيديو قصير يوضح كيفية عمل ذلك بالفعل على منصتنا.
00:10:02دعوني أضغط على زر التشغيل هنا إن استطعت العثور عليه.
00:10:07نرى هنا شخصاً يغسل الأطباق بيده في الحوض، ويزيل الدهون عن الطبق،
00:10:12باستخدام الإسفنجة والصابون، بما في ذلك الشطف ووضع الأطباق في رف التجفيف، مع لقطات مقربة لتفاعل اليدين.
00:10:19ما يحدث الآن هو أنه يبحث عبر مليارات الفيديوهات.
00:10:24هذا الفيديو قديم نوعاً ما،
00:10:26كان لدينا نحو 100 مليون فيديو مفهرس هنا فقط، أما الآن فقد وصلنا إلى 1.1 مليار فيديو.
00:10:31وسيزودك حرفياً—المقطع مسرّع قليلاً حتى لا أضيع وقتكم—
00:10:35بمقاطع فيديو لأشخاص يغسلون الأطباق.
00:10:41ويمكنكم أن تروا هنا كل الفيديوهات التي وجدناها.
00:10:47قد لا تتعلق بعض هذه الفيديوهات بغسيل الأطباق مباشرة،
00:10:50بل قد تتناول تنظيف المطبخ،
00:10:52أو شيئاً آخر مختلفاً.
00:10:54وهذا مثال آخر:
00:10:55إنسان يطوي أنواعاً مختلفة من الملابس مثلاً.
00:10:59أليس كذلك؟
00:10:59إضافة القليل من الوصف إذن.
00:11:01كلما قدمت وصفاً أكثر التفاصيل، حصلت على نتائج أكبر وأدق.
00:11:06مجدداً، العرض مسرّع قليلاً.
00:11:08دعونا نرى.
00:11:14أريدكم أن تفهموا أنه يمكن تطبيق هذا على أي شيء.
00:11:16كأن تضع امرأة مساحيق التجميل.
00:11:17لنفترض أن لديك علامة تجارية وتريد إيجاد فيديوهات تظهر فيها منتجاتك.
00:11:21كل ذلك يمكن توفيره أيضاً.
00:11:23كما ترون، هناك أشخاص يطوون الملابس.
00:11:26وبالتالي يمكنك الآن تدريب روبوت على كيفية طي الملابس.
00:11:34بالطبع، كل شيء متاح عبر واجهة برمجة التطبيقات (API).
00:11:36ولا نتوقع من الأشخاص القيام بأي شيء يدوياً.
00:11:39أليس كذلك؟
00:11:39لذا يمكنك تشغيل الطلب عبر الـ API.
00:11:41تحصل على مقطع مسترجع من الفيديو، والرابط.
00:11:46ونمنحك رابط الفيديو الأصلي إذا أردت مشاهدته.
00:11:49لكن الشيء الرئيسي هنا هو أنه يمكننا إعطاؤك مقاطع من الفيديو لتدريب الروبوتات الخاصة بك.
00:11:57الآن، لست متأكدًا مما إذا كان أي منكم يدرب أي روبوتات.
00:12:01لذا، سأعطيكم مثالاً آخر على مدى فائدة ذلك.
00:12:04لنفرض أن لديك علامة تجارية.
00:12:06وتريد أن تعرف أين يتم استعراض علامتك التجارية في مقاطع الفيديو.
00:12:13عناوين الفيديوهات لا تهم لأنها في الواقع لا تتعلق بمنتجك.
00:12:19إنها مجرد شخص يقدم بودكاست، أو يسجل شيئًا ما.
00:12:22لكن، ترى امرأة تضع المكياج.
00:12:25وترى على الطاولة أن هذه هي علامتك التجارية للمكياج.
00:12:30فجأة، يمكنك العثور على جميع الفيديوهات التي تُستخدم فيها علامتك التجارية.
00:12:34مهما كانت.
00:12:35أليس كذلك؟
00:12:35عن طريق البحث باسم الفيديو، لن تجدها.
00:12:38لكن عبر فهرسة الفيديو، يمكنك في الواقع العثور على أشياء محددة تهمك.
00:12:45تفاحة تسقط من الشجرة.
00:12:47وما إلى ذلك.
00:12:48إذن، ما الذي يعود إليك؟
00:12:50نقدم لك هذا الطابع الزمني.
00:12:52ونقدم لك درجة المطابقة.
00:12:53مدى قربها من استعلام البحث الخاص بك.
00:12:55وبالطبع، عدد الإطارات.
00:12:57كم عدد الإطارات التي تتناول ما تبحث عنه.
00:13:03إذن، ما الذي يغيره هذا؟
00:13:06هذا يغير الكثير.
00:13:07حسناً، هدر أقل.
00:13:09لا تحتاج إلى تنزيل ملايين الساعات من الفيديوهات.
00:13:12يمكنك في الواقع الحصول بالضبط على الأفعال المحددة
00:13:16التي تهمك.
00:13:20مرة أخرى، هذا حاسم جداً لتدريب الروبوتات.
00:13:24لأن التشويش يخلق مشاكل وهلاوس.
00:13:28أليس كذلك؟
00:13:29هذا يزيل التشويش.
00:13:34فيمَ يفيد هذا؟
00:13:35ليس فقط للروبوتات، بل بوضوح للقيادة الذاتية.
00:13:38على سبيل المثال، Waymo.
00:13:39أليس كذلك؟
00:13:40تم تدريبها على فيديوهات كاميرات المراقبة بالسيارات.
00:13:43وهناك الملايين، مئات الملايين من الساعات على يوتيوب.
00:13:46من كاميرات السيارات.
00:13:47كم منكم يحب مشاهدة الحوادث؟
00:13:49حوادث كاميرات السيارات.
00:13:52أنا متأكد أن الجميع شاهد بعضاً منها.
00:13:53القيادة الجنونية في روسيا.
00:13:55أليس كذلك؟
00:13:56إذن، هذا ما نتحدث عنه.
00:13:58أليس كذلك؟
00:13:58الفيديوهات موجودة هناك.
00:14:01حسناً؟
00:14:01شخص يتجاوز الإشارة الحمراء.
00:14:02شخص يتوقف عند الإشارة الحمراء.
00:14:04ينعطف يساراً.
00:14:05ينعطف يميناً.
00:14:06وما إلى ذلك.
00:14:06كل ذلك يمكن أن يكون بيانات مفيدة جداً للتدريب.
00:14:11وأي نماذج عالمية أخرى.
00:14:13الفيزياء.
00:14:14أليس كذلك؟
00:14:14تحتاج الروبوتات إلى فهم الفيزياء.
00:14:16ما هي الجاذبية؟
00:14:18كيف تجلس؟
00:14:18كيف تمشي؟
00:14:19كيف تتحرك؟
00:14:21مرة أخرى، بالطبع يمكنك تسجيلها مسبقاً.
00:14:25في كثير من الأحيان حالياً، أتحدث مع بعض الأشخاص.
00:14:27ولديهم ملايين الأشخاص الذين يسجلون فيديوهات لهم.
00:14:30“يا رفاق، هل يمكنكم تسجيل كيفية فتح الأبواب لي؟”
00:14:33هذا أمر جنوني.
00:14:34لماذا تحتاج إلى مليون شخص يفعلون ذلك بينما كل شيء متاح عبر الإنترنت؟
00:14:39الإنترنت هو أحد أكبر قواعد البيانات الموجودة.
00:14:43لكن الناس لا... أعني، ليس من السهل استخدامه، أليس كذلك؟
00:14:46أعني، حالياً البحث الوحيد المتاح لنا هو عن طريق الكلمة المفتاحية لاسم الفيديو.
00:14:53وبالطبع، مصدر واحد، شبكة الفيديوهات العامة بأكملها في مكان واحد.
00:14:59أعني، لدينا يوتيوب، ولدينا فيميو، ولدينا العديد من مزودي الفيديوهات المختلفين هناك.
00:15:06مليارات ومليارات الساعات من بيانات التدريب تنتظرك فقط لـ تأخذها،
00:15:13وتجمعها، وتعالجها.
00:15:14لذا أساساً، هذا منتج جديد نقوم به في Bright Data، حسناً؟
00:15:18فهرسة الفيديوهات حتى تتمكنوا من العثور على أفعال محددة.
00:15:23أي شيء تفكرون فيه، كما تعلمون، يمكن أن يكون مفيداً للعلامات التجارية.
00:15:28أيضاً، الأمر لا يقتصر على بيانات التدريب فقط.
00:15:31أي شيء يخطر ببالك قد يكون مفيداً.
00:15:35ربما تكون لاعباً وتريد معرفة كيف تتجاوز هذا المستوى؟
00:15:40لكن لا يوجد فيديو بهذا الاسم بالتحديد.
00:15:42لذا يمكنك البحث عن أشخاص يتجاوزون هذا المستوى في لعبة الفيديو، صح؟
00:15:47أي شيء، العالم بين يديك.
00:15:52لذا سأختتم حديثي.
00:15:54لا أعلم إذا كانت لديكم أي أسئلة، لكن إذا أردتم التواصل معي والتحدث أكثر،
00:15:58لا تترددوا في إضافتي على LinkedIn.
00:16:01ونعم، أود أن أشكركم جميعاً على حسن استماعكم.
00:16:06وأنا موجود في جناح Bright Data إذا أردتم التحدث أكثر عن ذلك.
00:16:10وشكراً لحضوركم.
00:16:17أراكم في المرة القادمة.

핵심 요약

يتطلب تطوير الذكاء الاصطناعي المادي والانتقال من البيانات المصنوعة يدويًا إلى الفهرسة المباشرة لفيديوهات الويب العامة للبحث عن حركات وأفعال محددة تقليل الهدر في طاقة المعالجة والنطاق الترددي.

하이라이트

  • تعتمد نماذج الذكاء الاصطناعي للروبوتات على مجموعة بيانات محدودة للغاية لا تتجاوز مليون فيديو مقارنة بتريليونات الكلمات للنماذج اللغوية.

  • تؤدي البيانات المصنوعة يدويًا عبر استئجار أشخاص لتسجيل حركات معينة إلى سلوكيات متحيزة وغير طبيعية للروبوتات.

  • تستغني شركة Nvidia عن 96% من الفيديوهات المحملة لعدم فائدتها لتدريب روبوت Cosmos، بينما يتخلص نموذج Stable Video Diffusion من 74% منها.

  • درّبت شركة Meta نموذج ذكاء اصطناعي عبر مليون ساعة من فيديوهات العالم الحقيقي العامة، ولم يتطلب التحرّك الفعلي للروبوت سوى 62 ساعة من البيانات الروبوتية المباشرة.

  • يتيح نهج البحث أولاً ثم الجمع المتبع في Bright Data الوصول إلى أكثر من 1.1 مليار فيديو مفهرس للبحث عن حركات وأفعال محددة بدلاً من تنزيل المقاطع بأكملها.

타임라인

تطور الذكاء الاصطناعي وعقبة بيانات الروبوتات

  • شهدت أنظمة التحكم بالروبوتات قفزات متسارعة من التعليم عبر الصور في 2022 إلى دمج النماذج مفتوحة المصدر في الروبوتات الشبيهة بالبشر والسيارات ذاتية القيادة بحلول 2024.
  • تمثل البيانات العائق الأساسي لتطوير الروبوتات نظرًا لتوفر مليون فيديو فقط للتدريب مقارنة بتريليونات الكلمات في النماذج اللغوية.
  • تتسبب بيانات التسجيل اليدوي المدفوع في إكساب الروبوتات سلوكيات غير طبيعية نتيجة تغير الحركة العفوية للبشر أمام الكاميرا.

تطور الذكاء الاصطناعي المادي بسرعة من التحكم الفردي إلى إدارة شبكات روبوتات كاملة وسيارات ذاتية القيادة تستند إلى كاميرات القيادة. تكمن المشكلة الحالية في محددات البيانات المتاحة؛ فالجمع اليدوي عبر إجبار الأشخاص على تصوير أفعال يومية كالجلوس أو فتح الباب ينتج بيانات موجّهة ومتحيزة تجعل حركة الروبوت تفتقر إلى البديهية التلقائية.

محدودية البدائل الحالية ومزايا فيديوهات الويب العامة

  • تفشل ألعاب الفيديو والمحاكاة الافتراضية والتحكم اليدوي في توفير بيانات قابلة للتوسع على نطاق واسع لتطوير الروبوتات.
  • توفر منصات الفيديو العامة مثل يوتيوب مليارات الساعات من الفيديوهات التي تعالج قوانين الفيزياء والجاذبية وتفاعلات الأجسام من منظور الشخص الأول.
  • استعان نموذج Meta بمليون ساعة من الفيديوهات العامة لتنفيذ التحكم المباشر في الروبوتات خلال 62 ساعة تدريب روبوتية فقط.

تفتقر المحاكاة الافتراضية للفيزياء الدقيقة المطلوبة للواقع، بينما يقتصر التحكم اليدوي بالروبوتات على سقف زمني لا يتجاوز بضع ساعات يوميًا. توفر شبكة الويب العامة بديلًا ضخمًا يحتوي على ملايين الساعات من المشاهد المنظورية للأنشطة اليومية والتفاعلات الفيزيائية، وتثبت تجارب النماذج المتقدمة إمكانية الاعتماد على هذا الكم من مشاهد العالم الحقيقي لتقليل الاعتماد على التسجيل المباشر.

معالجة هدر البيانات وفهرسة الأفعال عبر Bright Data

  • يتسبب التنزيل العشوائي للفيديوهات في إهدار سعة التخزين والنطاق الترددي بسبب الاستغناء عن نسبة تصل إلى 96% من البيانات غير المفيدة.
  • تعتمد آلية الفهرسة الحديثة على تحليل فارق الحركة بين الإطارات المتتالية لتقييم الزوايا والمسافات واستخراج الأفعال بدقة.
  • تتيح منصة Bright Data الفهرسة المباشرة لأكثر من 1.1 مليار فيديو للوصول إلى مقاطع زامنية محددة وفقًا للوصف وبحث الحركات عبر API.

تستغني نماذج الذكاء الاصطناعي الكبرى عن معظم الفيديوهات المحملة لعدم صلتها بالحركة المطلوبة، مما ينشئ هدرًا حاسوبيًا وماليًا كبيرًا. تعتمد التقنية الجديدة على قياس التغير بين إطارات الفيديو لتحديد المسافات والزوايا، ثم فهرسة الأفعال كغسل الأطباق أو طي الملابس ضمن قاعدة بيانات تتجاوز 1.1 مليار فيديو، مما يمنح المطورين مقاطع قصيرة محددة بالطوابع الزمنية ودرجات المطابقة دون الحاجة لتنزيل مقاطع كاملة.

تطبيقات فهرسة الفيديو في الروبوتات والعلامات التجارية

  • تمنع الفهرسة الدقيقة للحركات حدوث الهلاوس والمشاكل الناتجة عن التشويش في بيانات التدريب.
  • تمتد استخدامات فهرسة الفيديوهات إلى تطوير القيادة الذاتية عبر فيديوهات كاميرات السيارات وتتبع ظهور المنتجات للعلامات التجارية.
  • تستبدل الفهرسة الذكية الاعتماد التقليدي على العناوين والكلمات المفتاحية بالتحليل المباشر لمحتوى الفيديو الفيزيائي.

تساعد الفهرسة المباشرة للأفعال على تنقية بيانات التدريب من التشويش الذي يسبب أخطاء وهلاوس في النماذج الذكية. تتعدى الاستفادة حدود الروبوتات المنزلية لتشمل أنظمة القيادة الذاتية عبر تحليل تسجيلات الحوادث والمخالفات المرورية من الكاميرات، بالإضافة إلى تمكين الشركات من تتبع منتجاتها الظاهرة على الطاولات وفي الخلفيات داخل الفيديوهات دون الحاجة للبحث في عناوين المقاطع.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기