الروبوتات عالقة منذ 70 عاماً — ديباك باثاك، Skild AI

스크립트

00:00:00أعتقد أن جميعكم هنا يعرفون كم التطور الذي حققه الذكاء الاصطناعي
00:00:15خلال السنوات الخمس الماضية.
00:00:17يبدو أنه يفوق التقدم الذي تحقق في المئة عام الماضية.
00:00:22وما يحدث، خاصة في مجال الذكاء الاصطناعي،
00:00:24هو أنه بدأ باللغة، ثم الكلام، فالصوت، ثم الفيديو.
00:00:28والجميع متحمسون لأن الخطوة التالية هي الروبوتات.
00:00:32وهذا الحماس يصل إلى ذروته هذا العام لسبب ما،
00:00:37وهو أمر لا أزال لا أفهمه.
00:00:40ويمكنكم أيضاً رؤية قادة مثل جينسن
00:00:43يتحدثون عن الذكاء الاصطناعي المادي باعتباره أفق الروبوتات القادم.
00:00:46لذا يبدو الأمر كما لو أنك إذا فتحت تويتر أو لينكد إن،
00:00:49يخيل إليك أن الروبوتات قد أصبحت بيننا بالفعل.
00:00:51وأننا سنحصل على روبوتات منزلية في بيوتنا بحلول ديسمبر،
00:00:56كما يقول العديد من الأشخاص.
00:00:58لكنني هنا لأسلط الضوء على أن الروبوتات كانت على وشك الوصول
00:01:03طوال السنوات السبعين الماضية.
00:01:06والآن، بالنسبة لمن دخلوا مجال الروبوتات في السنوات الأربع أو الخمس
00:01:10الماضية، اذهبوا وخذوا أي دورة تدريبية في الروبوتات.
00:01:14وإذا استطعتم التمييز بين مقاطع الفيديو في الروبوتات
00:01:17قبل 30 عاماً واليوم، فأنتم تستحقون دعوة على العشاء.
00:01:23ولإعطائكم مثالاً، لننظر إلى هذا الروبوت.
00:01:26هذا الروبوت هنا عبارة عن صورة.
00:01:27والهدف من هذا الروبوت هو النظر إلى صورة المكعبات هذه
00:01:31وترتيب هذه المكعبات أمامه
00:01:34بحيث تبدو بنفس النمط الموجود في الصورة.
00:01:37حسناً؟
00:01:38هذه مهمة بسيطة للغاية.
00:01:40لكن إذا فكرتم في الأمر، فهو مجسم ثلاثي الأبعاد.
00:01:42عليك النظر وفهم الأبعاد الثلاثية من كل جانب.
00:01:44ويمكن للروبوت القيام بذلك بدقة عالية.
00:01:47هل من تخمينات لمدى قدم هذه النتيجة؟
00:01:51أي أحد؟
00:01:51إنه مجرد تخمين.
00:01:52يمكنكم إعطاء أي تخمين.
00:01:53عفواً؟
00:01:5440 عاماً.
00:01:55حسناً.
00:01:55هل هذا أعلى تخمين؟
00:01:59هذا يعود إلى ستينيات القرن الماضي.
00:02:01هذا قبل وجود أجهزة الكمبيوتر بفترة طويلة.
00:02:03حسناً؟
00:02:04هذا يسمى العرض التوضيحي للنسخ من MIT.
00:02:06كانت هذه بداية--
00:02:09هذا يسبق الذكاء الاصطناعي، كما تعرفونه اليوم.
00:02:12انظروا إلى هذا.
00:02:17معروضة واحدة في المؤتمر النووي في فيلادلفيا
00:02:19تمتلك الوصفة المثالية للشعبية.
00:02:21ما يحدث هنا، هو أن الشخص خلف الكواليس
00:02:24يتحكم في هذه الروبوتات، بنظام التابع والمتبوع.
00:02:27وإذا نظرت إلى أي مختبر كبير، أو شركة كبيرة،
00:02:31أو أي مختبر أكاديمي كبير، وكيف يحصلون على البيانات،
00:02:33ستجد أنهم يستخدمون نظام التشغيل عن بُعد، والذي
00:02:35يتبع نفس المبادئ تماماً؟
00:02:38أي تخمينات للسنة التي يعود إليها هذا؟
00:02:40المشغل الماهر للجهاز الإلكتروني--
00:02:42الآن، سيقوم الجميع بالتصحيح بشدة بشأن السنة.
00:02:45لكن هذا يعود إلى عام 1957، أي قبل 68 عاماً.
00:02:49حسناً؟
00:02:51اسأل أي شخص في عائلتك أكبر من--
00:02:53في الواقع، قد لا يكونون موجودين معنا.
00:02:55لأن هذا--
00:02:57عليك أن تسأل شخصاً يبلغ من العمر 80 عاماً،
00:02:59كيف كانت حالة التكنولوجيا في ذلك الوقت؟
00:03:02مثل ذاكرة الوصول العشوائي، للحصول على بضع كيلوبايت منها، كانت بحجم غرفة،
00:03:06منظومة بهذا الحجم الكبيرة.
00:03:07وهذا يعود إلى ذلك الوقت الذي استطاع فيه الناس جعلها تعمل.
00:03:11وليس هذا فحسب، كلما عدت بالزمن عقداً بعد عقد،
00:03:14تبدو الفيديوهات رائعة بنفس القدر.
00:03:15مثل هذا الروبوت الشبيه بالبشر، وهو يقوم بفرز الكرات،
00:03:18ويلعب كرة الطاولة (الفوسبول) مع إنسان.
00:03:21وهذا أيضاً، كلوحات الفيديوهات هذه، تسبق التعلم العميق.
00:03:25هذا يعود إلى ثماني سنوات مضت.
00:03:26هذا الروبوت هو نتيجة بحث من جامعة بيركلي،
00:03:29يمكنه تنظيف الطاولة بأكملها، وترتيب العناصر في صندوق.
00:03:33تم تحقيق هذا بواسطة طالب دراسات عليا واحد باستخدام جهاز يعتمد على وحدة معالجة رسومات واحدة.
00:03:36لا أكثر من ذلك.
00:03:37حسناً؟
00:03:38الان، هذه الصورة— وإذا قمت بتلوين كل هذه الفيديوهات
00:03:41من الماضي وتطبيق مرشح الذكاء الاصطناعي التوليدي للصوت الحديث،
00:03:45فلن تتمكن من معرفة ما إذا كان هذا الفيديو من عام 1965
00:03:49أم أنه من اليوم.
00:03:50وهذه ليست حتى أقدم النتائج.
00:03:52فأقدمها يعود إلى أربعينيات القرن الماضي.
00:03:54حسناً؟
00:03:55إذاً ما هذا؟ إذا نظرت إلى السبعين عاماً الماضية،
00:04:00فستجد أن كل تقنية أخرى، كل تقنية أخرى
00:04:02قَطَعت شوطاً كبيراً جداً—
00:04:04فهم اللغة، الرؤية الحاسوبية، الهواتف المحمولة، الرقائق الإلكترونية.
00:04:08فلماذا بقيت الروبوتات عالقة في هذا العصر البدائي لكل هذه المدة؟
00:04:11والسبب هو وجود عقل عام.
00:04:14فقد تم التعامل مع الروبوتات دائماً كمشكلة
00:04:17عتاد صلب من الأساس.
00:04:18وهذا هو السبب في أن كل شيء محيط بالروبوتات
00:04:21قد تطور، لكن الروبوتات لا تزال عالقة في النقطة نفسها
00:04:24منذ السبعين عاماً الماضية.
00:04:25هناك مفارقة شهيرة جداً تسمى مفارقة موراڤيك.
00:04:27لا أعرف ما إذا كنتم تعرفون موراڤيك.
00:04:29لقد كان أيضاً أستاذاً في كارنيغي ميلون، وأنا كذلك أستاذ هناك.
00:04:32لذا يجب عليّ الاقتباس منه بكل تأكيد.
00:04:34كان أحد الشخصيات المؤسسة في مجال الذكاء الاصطناعي.
00:04:36وبعد 30 عاماً من العمل في مجال الروبوتات،
00:04:39توصل إلى استنتاج بسيط للغاية.
00:04:41الصعب سهل.
00:04:42والسهل صعب.
00:04:43حسناً؟
00:04:44كل ما كان يعتقد الإنسان أنه صعب
00:04:45هو أسهل ما يكون بالنسبة للكمبيوتر، والعكس صحيح.
00:04:49ويمكنكم رؤية حدوث ذلك أمام أعينكم مباشرة.
00:04:51قد تقولون إن حل الرياضيات أمر صعب.
00:04:53والحصول على الميدالية الذهبية في أولمبياد الرياضيات صعب جداً حقاً.
00:04:56أما صعود الدرج؟
00:04:57فكان سهلاً للغاية.
00:04:59الان انظروا حولكم في عالم التقنية.
00:05:01أين نحن من حيث ما تم حله
00:05:02وما لم يتم حله بعد.
00:05:04إذاً هذه هي الروبوتات بالنسبة لكم، حسناً؟
00:05:05إنها ليست مجرد تطبيق آخر للذكاء الاصطناعي.
00:05:09بل هي الهدف الذي تأسس من أجله الذكاء الاصطناعي في البداية
00:05:12ولم يحرز فيه سوى تقدم ضئيل جداً.
00:05:14هذا ليس مجرد تطبيق آخر
00:05:15تستطيع الشبكات العميقة الدخول إليه واقتحام المجال.
00:05:18بل يجب التفكير في هذا من المبادئ الأولية الأساسية
00:05:22من الصفر.
00:05:23هذا مثال شهير جداً حيث
00:05:25يمكنك جعل كمبيوتر يهزم غاري كاسباروف في الشطرنج
00:05:29في التسعينيات، ولكن ليس لديك حتى الان كمبيوتر، أي روبوت،
00:05:34يمكنه التقاط قطع الشطرنج وترتيبها
00:05:36على رقعة الشطرنج.
00:05:37الان، كيف نمضي قدماً في حل هذه المشكلة، حسناً؟
00:05:43من ناحية أكثر إيجابية، لدينا الوصفة السحرية
00:05:47لنجاح الذكاء الاصطناعي، أليس كذلك؟
00:05:49تحصل على مجموعة بيانات ضخمة.
00:05:51وتدرب نماذج ضخمة.
00:05:52ويحدث السحر، حسناً؟
00:05:54الان، نحن نعلم أن هذا النموذج يعمل بشكل جيد جداً
00:05:57في العديد من الموضوعات، حسناً؟
00:05:59الان، هل يمكننا تطبيق الوصفة نفسها على الروبوتات؟
00:06:02في الواقع، إنها غير قابلة للتطبيق بشكل مباشر لأنه لا تتوفر لدينا بيانات.
00:06:06لا توجد شبكة إنترنت لبيانات الروبوتات.
00:06:09وكما قلت سابقاً، يمكنك الذهاب وجمع البيانات يدوياً
00:06:12على الروبوت عبر ما يسمى التشغيل عن بُعد.
00:06:14وكما تلاحظون، التشغيل عن بُعد ليس أمراً ظهر منذ خمس سنوات.
00:06:18بل هو أمر موجود منذ 68 أو 70 عاماً.
00:06:21لذا فإن الجزء المثير للدهشة هو، إذا عدتم للوراء
00:06:24ونظرتم إلى التطور الكامل لنماذج GPT-3 وGPT-4،
00:06:28وعدتم إلى GPT-3 قبل ثلاث سنوات.
00:06:31يبدو وكأنه دهر مضى.
00:06:33لم يبدأ GPT-3 بالعمل ولفت انتباه الناس
00:06:36إلا عندما أصبح بمقدورك تدريب تلك النماذج على تريليونات الرموز.
00:06:40فقد كان GPT-3 يعتمد بالفعل على أكثر من 30 تريليون رمز.
00:06:42واليوم نتحدث عن مئات التريليونات من الرموز.
00:06:44وإذا قمت بجمع البيانات يدوياً عن طريق التشغيل عن بُعد،
00:06:47فسيستغرق الأمر منك حوالي دقيقة واحدة للحصول على مثال واحد.
00:06:49يمكنكم إجراء الحسابات بأنفسكم.
00:06:50لو كان لديك كل سكان الولايات المتحدة،
00:06:53فسيستغرق الأمر أكثر من قرن للوصول إلى النطاق نفسه
00:06:55الذي وصل إليه GPT-3، وهو ما يشبه--
00:06:59ولا أحد يستخدم GPT-3 اليوم.
00:07:00حسناً؟
00:07:01لذا فهذا بطيء جداً ومكلف.
00:07:02لذا في مجال الروبوتات، أزعم أنه لا يوجد أحد
00:07:05قد قام بتوسيع نطاق الروبوتات حقاً حتى الآن.
00:07:07ونحن بعيدون جداً عن الحديث عن توسيع الروبوتات
00:07:10بالطريقة التي شهدت بها المجالات الأخرى التوسع.
00:07:14حسناً؟
00:07:14هذا هو المجال الذي نركز عليه.
00:07:17شركة Skild عمرها حوالي ثلاث سنوات.
00:07:19لكنني أعمل على هذه المشكلة لأكثر من عقد من الزمان.
00:07:22هذا كل ما فعلته في مسيرتي المهنية.
00:07:24لا شيء آخر.
00:07:26لذا في Skild، فرضيتنا هي
00:07:27بناء ما نسميه ذكاءً شامل الأجسام.
00:07:32أي روبوت، أي مهمة، عقل واحد.
00:07:35حسناً؟
00:07:36أي روبوت-- يمكن أن يكون شبيهاً بالبشر.
00:07:37يمكن أن يكون روبوتاً رباعي الأرجل.
00:07:38يمكن أن يكون ذراعاً روبوتية على حزام ناقل أو يداً ماهرة.
00:07:41هذا لا يهم حقاً.
00:07:42وحتى هذه الفرضية أكثر
00:07:45عمومية بكثير مما يقال عن البشر،
00:07:48لأننا نتحكم في أجسادنا فقط.
00:07:50ولماذا علينا أن نصل إلى هذه العمومية؟
00:07:51الحجة هي أنه في مجال الروبوتات،
00:07:54لا توجد بيانات على أي حال.
00:07:56لذا لا يمكنني الاختيار والانتقاء من أي جهاز أستخدم البيانات.
00:07:59وينبغي أن نكون قادرين على استخدام البيانات من أي نوع من الأجهزة،
00:08:02وأي نوع من المهام، وأي نوع من السيناريوهات.
00:08:04وهذه هي الطريقة الوحيدة لتحقيق
00:08:06نطاق التوسع الذي حققته نماذج اللغات قبل ثلاث سنوات.
00:08:10والهدف هنا هو هذه الفكرة بأكملها: أي روبوت،
00:08:13أي مهمة، عقل واحد.
00:08:15ومن خلال هذا الحديث، آمل
00:08:16أن أقنعكم بسبيل المضي قدماً نحو الروبوتات.
00:08:20حسناً؟
00:08:20هذه هي المقدمة العامة.
00:08:23ولكن قبل أن أدخل في المزيد من التفاصيل،
00:08:24دعوني أعرض عليكم مجرد نتيجة تشويقية.
00:08:28في هذه النتيجة، كل روبوت
00:08:31هو من شركة مختلفة، وأجهزة مختلفة.
00:08:34وكلها محكومة بعقل Skild،
00:08:37سواء كانت روبوتات شبيهة بالبشر تصعد وتهبط الدرج،
00:08:39أو أي نوع من السيناريوهات.
00:08:42وهذه ليست نتائج جديدة.
00:08:43إنها نتائج تعود لقبل عامين تقريباً هنا.
00:08:47مقاومة للاضطرابات.
00:08:51يمكنك وضعها دون تدريب سابق في سيناريوهات جديدة.
00:09:03الفكرة هنا أن كل روبوت في هذا الفيديو يتخذ
00:09:08أي إجراء في أي مكان في العالم.
00:09:11العقل الذي يعمل خلف الكواليس يتحسن،
00:09:13لأنه عقل شامل الأجسام.
00:09:15أجل، هذا صعب للغاية، أليس كذلك؟
00:09:16لأن البيض سليم.
00:09:17كان ذلك لمحة عما نعمل عليه.
00:09:33أريد جعل هذا الحديث علمياً وأكثر إفادة
00:09:38من مجرد إعلان لشركة.
00:09:39لذا سأتحدث عن كيفية توسيع البيانات في الروبوتات.
00:09:42دعونا نلقي نظرة للوراء على كيفية تعامل الناس مع هذا.
00:09:45سألقي نظرة للوراء على مسيرتي المهنية.
00:09:48وفرضيتي للبيانات كانت تتغير على مر السنين.
00:09:51عندما بدأت العمل وتوسيع نطاق الأمور،
00:09:55كانت الفكرة هي إمكانية جمع البيانات للروبوتات يدوياً،
00:09:59ولكن ذلك بطيء جداً.
00:10:00ويجب السماح للروبوتات بجمع البيانات بنفسها.
00:10:03لذا كانت لدينا فكرة الاستكشاف القائم على الفضول،
00:10:06وهي السماح للروبوتات بالاستكشاف بطريقة فضولية في البيئة.
00:10:10ولها جوانب جيدة كثيرة، مثل عدم الحاجة إلى إنسان.
00:10:13يمكن للروبوتات الاستمرار في اللعب وجمع المزيد من البيانات.
00:10:15أطلقنا عليها اسم “بيانات اللعب” في ذلك الوقت.
00:10:17وهي غنية جداً، لأنها تحتوي على القوة والمستشعرات وزوايا المفاصل.
00:10:21ولكن الصعوبة تكمن في أنها موجودة في العالم المادي فقط.
00:10:24لذا من الصعب جداً توسيع نطاقها.
00:10:27كانت جوجل تعمل على ذلك في ذلك الوقت، مع مئات الروبوتات.
00:10:31حتى بالنسبة لجوجل، كان التوسع مكلفًا جدًا وبطيئًا للغاية.
00:10:34الفكرة الأخرى هي، مجددًا، التشغيل عن بُعد.
00:10:36كما قلت، إنها فكرة قديمة.
00:10:38ولكن مرة أخرى، نفس المشكلات.
00:10:39من المستحيل التوسع، لأنك الآن لا تحتاج لروبوت فحسب،
00:10:42بل تحتاج إلى بشر أيضًا.
00:10:43لذا فهو أكثر كلفة.
00:10:45والتنوع محدود للغاية.
00:10:46لأنك حتى لو وضعت روبوتًا في إعداد واحد مع إنسان،
00:10:50يمكنك الحصول على 1,000 مثال.
00:10:51لكنها ستكون جميعها في نفس الإعداد.
00:10:53ما تريده مثاليًا هو نقل الروبوت إلى منزل جديد
00:10:57كل يوم، وإلى سيناريو جديد.
00:10:58وهذا أمر في غاية الصعوبة للتوسع.
00:11:01ثم حققنا إنجازًا كبيرًا في التعلم
00:11:03من المحاكاة.
00:11:04كانت هذه إحدى أولى النتائج التي أمكن فيها
00:11:08إظهار التعلم التعزيزي العميق، المُدرب في المحاكاة،
00:11:12ونقله إلى روبوت حقيقي.
00:11:13كانت هذه ورقة بحثية حائزة على جوائز في ذلك الوقت.
00:11:16والآن تُستخدم في كل روبوت بشري وفي كل شركة هناك.
00:11:20كان هذا من مختبر في بيركلي وجامعة كارنيجي ميلون.
00:11:23ولكن مجددًا، هناك إيجابيات وسلبيات.
00:11:25من السهل جدًا التوسع.
00:11:27لكن من الصعب تحقيق التنوع، لأن عليك تصميم
00:11:29كل مشهد في المحاكاة يدويًا.
00:11:31لذا إن كنت تستمع إلى هذا،
00:11:34فليس هناك إجابة واحدة أصل إليها.
00:11:35لا يوجد حل واحد.
00:11:39هذا عمل آخر قمنا به سابقًا.
00:11:41هذا كله كان قبل مرحلة التوسع.
00:11:43التعلم من فيديوهات البشر.
00:11:44تشاهد الإنسان وهو يفعل الأشياء، ثم يقلده الروبوت.
00:11:47مرة أخرى، تنوع كبير.
00:11:48يمكنك استخدام فيديوهات من يوتيوب وما إلى ذلك.
00:11:50قابلة للتوسع بدرجة كبيرة.
00:11:51لكنها شكل رديء جدًا من البيانات،
00:11:54لأنها بعيدة جدًا عن الروبوت.
00:11:57إذن ما هو الحل هنا؟
00:11:59الإجابة هي أنه لا يوجد طريق مثالي.
00:12:01عليك التفكير في البيانات في سياق
00:12:05ميزات مختلفة.
00:12:06وفي رأيي، هناك ثلاث ميزات فقط
00:12:09تعد مهمة في علم الروبوتات--
00:12:12القابلية للتوسع، والتنوع، ومدى قربك
00:12:15من زوايا مفاصل الروبوت.
00:12:18القابلية للتوسع تعني، هل يمكنني توسيعها بسرعة عبر السيناريوهات؟
00:12:22التنوع يعني، هل يمكنني الحصول على بيانات متنوعة؟
00:12:25لأن مجرد امتلاك 100 ترليون رمز
00:12:27هو أمر عديم الفائدة تمامًا إذا كانت كلها
00:12:29في نفس البيئة ونفس السيناريوهات.
00:12:32والقرب من الروبوت يعني، ما مدى بعدك
00:12:35عن الحقيقة الواقعية لزوايا مفاصل الروبوت؟
00:12:38لذا إذا نظرت إلى المحاكاة، فهي قابلة للتوسع جدًا، منخفضة التنوع،
00:12:42لكنها قريبة بشكل متوسط من الروبوت.
00:12:44مقاطع الفيديو البشرية قابلة للتوسع ومتنوعة جدًا،
00:12:46لكنها بعيدة جدًا عن بيانات الروبوت.
00:12:47عليك أن تتعلم كيفية ربط الإنسان بالروبوت.
00:12:49الخياران الآخران، التحكم عن بعد وواجهات المعالجة،
00:12:52هما في مكان ما في المنتصف.
00:12:54ويمكنك أن ترى هنا، في الوقت الحالي، حول العالم،
00:12:57إذا نظرت إلى الشركات المختلفة،
00:12:58ستجد أنها تركز جميعها على أحد هذه النهج.
00:13:01معظمها يركز على التحكم عن بعد أو إعدادات يومي.
00:13:05وقليل جدًا منها يركز على كل شيء آخر.
00:13:07لكن لا يوجد إجابة سحرية.
00:13:09كل منها له جانب سلبي.
00:13:11لكن النقطة المضيئة هنا هي أنها جميعًا تكمل
00:13:15بعضها البعض.
00:13:16إنها ليست-- سلبياتها لا تتطابق تمامًا مع بعضها
00:13:19البعض.
00:13:20وهنا تكمن الوصفة التي التقينا عليها على مر السنين
00:13:24وهي إدراك-- تقسيم التدريب إلى جزأين،
00:13:27التدريب المسبق والتدريب اللاحق.
00:13:29لكن هذه مفاجأة، أليس كذلك؟
00:13:30ولكن كيف نقوم بالتدريب المسبق؟
00:13:31تريد إجراء التدريب المسبق باستخدام بيانات
00:13:32قابلة للتوسع ومتنوعة للغاية، لكن ربما ذات جودة منخفضة.
00:13:35مثل المحاكاة، مقاطع فيديو البشر، وما إلى ذلك.
00:13:37هكذا تقوم بالتدريب المسبق.
00:13:39ثم بالنسبة للتدريب اللاحق، تستخدم بيانات من التشغيل عن بُعد.
00:13:42الان، ما هي بيانات التشغيل عن بُعد؟
00:13:43إنها عالية الجودة جداً، لكنها قليلة الكمية، حسناً؟
00:13:47جودة عالية، وكمية قليلة.
00:13:48هذا يذكرنا تماماً بالوصفة المستخدمة في النماذج اللغوية.
00:13:51تقوم بالتدريب المسبق للبيانات على الإنترنت.
00:13:53ثم تقوم بالتدريب اللاحق للبرمجة، ولشركتك الخاصة، وما إلى ذلك.
00:13:59لكن في علم الروبوتات، هناك فئة أخرى،
00:14:00وهي بيانات النشر والتشغيل الفعلي.
00:14:02وبيانات النشر قابلة للتوسع للغاية
00:14:05بمجرد التوسع في النشر.
00:14:07لذا بمرور الوقت، ستستحوذ هذه البيانات على كل شيء آخر.
00:14:11وما نحاول بناءه هو ما
00:14:14نسميه “دولاب الموازنة للبيانات”، والذي
00:14:16يأخذ هذه البيانات من مرحلة التدريب اللاحق
00:14:18ويعيدها إلى التدريب المسبق.
00:14:20والآن يمكنك أن تفهم لماذا تعد فكرة العقل متعدد الأجساد
00:14:23بالغة الأهمية، لأنه
00:14:25من المستبعد جداً أن يكون لديك روبوت واحد فقط، وإصدار واحد فقط
00:14:28مُعتمَد للأبد في كل مهمة حول العالم.
00:14:32هذا لا يحدث أبداً في أي مجال من مجالات الأجهزة، باستثناء الرقائق،
00:14:36لأن تصنيعها صعب للغاية.
00:14:38ومع ذلك ما زلت ترى، حتى في الرقائق،
00:14:40أن رقائق الاستدلال تأتي من كل حدب وصوب
00:14:42للعديد من الشركات هذه الأيام.
00:14:43لذا في مجالات الأجهزة، لا تكون الحالة هكذا أبداً.
00:14:45أن يكون لديك إصدار واحد فقط من الروبوت، شكل واحد،
00:14:48ولهذا السبب فإن الذكاء متعدد الأجساد
00:14:50هو المُمكّن لما نسميه “دولاب الموازنة لبيانات النشر”.
00:14:56دعونا نلقي نظرة سريعة على بعض النتائج الآن.
00:14:58الآن، هذا العقل عام للغاية،
00:15:00لذا يمكننا أداء مجموعة متنوعة من المهام بسرعة كبيرة.
00:15:03ربما شاهدتم العديد من المهام مثل طي الملابس،
00:15:06وما إلى ذلك.
00:15:07إنها مهمة شائعة جداً في وادي السيليكون لسبب ما.
00:15:10والحجة هنا هي، متى فكرت
00:15:14يوماً أثناء طي قميص، أنه إذا أخطأت يدي
00:15:18بمقدار سنتيمتر واحد، فإن طي القميص سينتهي بكارثة؟
00:15:22أنت لا تفكر بهذه الطريقة.
00:15:23الناس لا يفكرون حتى أثناء الطي.
00:15:25إنهم يمسكون من أي مكان فحسب.
00:15:26أنت تفعل ذلك فحسب.
00:15:27لذا فإن نسبة التسامح مع الخطأ عالية جداً جداً.
00:15:31إذاً لماذا تعد هذه المهمة صعبة؟
00:15:35أي شخص-- لماذا ينخدع الناس
00:15:38ويعتقدون أن هذه المهمة صعبة؟
00:15:39دعوني أطرح الأمر بهذه الطريقة.
00:15:42القماش، أليس كذلك؟
00:15:43لماذا القماش صعب؟
00:15:46المحاكاة، ولكن لا أحد يستخدم المحاكاة على أي حال.
00:15:48هذا كله من التشغيل عن بُعد.
00:15:49لماذا هذا صعب؟
00:15:51أتدرون لماذا هو صعب؟
00:15:52لأنه صعب بالنسبة للنسخة التقليدية من علم الروبوتات.
00:15:56تقليدياً في علم الروبوتات، كان الناس يصممون الفيزياء بأكملها،
00:15:59وينشئون النماذج يدوياً، ثم يقومون بذلك.
00:16:01الأمر صعب جداً بالنسبة لتلك الطريقة.
00:16:02لكن بالنسبة للروبوتات القائمة على التعلم العميق،
00:16:04تعد هذه أسهل مهمة ممكنة،
00:16:06لأنها تتمتع بنسبة تسامح عالية مع الخطأ.
00:16:08لذا فإن الأمر تماماً--
00:16:09الان، هناك الكثير من الشركات تركز على هذه المهمة.
00:16:12الآن، ما هو الصعب، في رأيي،
00:16:13شيء مثل هذه المهمة، فلنقل.
00:16:17إذا سألتكم، قبل رؤية هذا الفيديو،
00:16:19هل هذه المهمة قابلة للتنفيذ بدون وجود أيدٍ؟
00:16:22على الأرجح، سينشر نصف الناس سلبياً،
00:16:24لأنها تتطلب إدخال--
00:16:25مثلاً، كم منكم فقد سماعات AirPods؟
00:16:29وفي شركتنا، هناك قناة محادثة
00:16:30تسمى “سماعة Airpod اليمنى”، لأن الناس يستمرون
00:16:32في فقدان سماعة Airpod اليمنى الخاصة بهم.
00:16:34الآن، في هذه الحالة، لا يملك الروبوت يداً.
00:16:36هو يمتلك قابضاً.
00:16:37لذا، هذه المهمة صعبة جداً بالنسبة للقابض.
00:16:41فهي تتطلب مستواً أعلى من الذكاء،
00:16:43لأن على الذراع أن تتحرك وتضبط اتجاهها
00:16:46لاقتطاف سماعة AirPod بالشكل الصحيح،
00:16:49بحيث يمكن إدخالها، لأن القوابض يمكنها فقط
00:16:52الإغلاق بهذا الشكل.
00:16:54فهي متوازية في إغلاقها.
00:16:55لذا لا يمكنك تدوير السماعة في اللحظة الأخيرة.
00:16:59الآن، ما ترونه هنا ليست سماعات AirPod حقيقية.
00:17:02بل هي مقلدة من Temu، بسعر 5 أو 10 دولار للواحدة.
00:17:05لذا لا تحتوي على مغناطيس بداخلها.
00:17:07وبالتالي يتعين على الروبوت بذل جهد حقيقي لإدخالها بشكل صحيح،
00:17:11لعدم وجود مغناطيس يجذبها بسهولة.
00:17:13لذا جميعها مقلدة.
00:17:15هذا أصعب حتى مما يبدو في الفيديو.
00:17:17يمكنك أيضاً—بمجرد بناء العقل العام في الخلفية—
00:17:23أن تتعلم من مجموعة متنوعة من فيديوهات البشر فقط
00:17:26دون الحاجة إلى بيانات ضبط دقيق
00:17:28أثناء وقت التشغيل عن بُعد.
00:17:29في هذا السيناريو، ما قمنا به هو
00:17:31التدريب على فيديوهات بشرية كهذه، كالفيديوهات الذاتية.
00:17:34ونحن نحاول الآن نقل ذلك إلى فيديوهات من منظور الشخص الثالث.
00:17:38وإذا نجح منظور الشخص الثالث، يمكنك التعلم من يوتيوب،
00:17:40أو أي نوع من البيانات مفتوحة المصدر.
00:17:43في هذه الحالة، نشاهد الفيديو،
00:17:45ثم نضيف أقل من ساعة من بيانات الروبوت.
00:17:47إنه تحول سريع جداً.
00:17:50وبعد ذلك يمكن نقله إلى الروبوتات الشبيهة بالبشر.
00:17:53الآن، هذه الروبوتات تمتلك أيدياً.
00:17:54مسألة وجود أيدٍ من عدمها هي محل جدل كبير.
00:17:57غالباً ما يتخذ الناس الأيدي كعذر لعدم انتشار الروبوتات
00:18:00حتى الآن، لكن هذا ليس السبب.
00:18:02الأمر يتعلق دائماً بالذكاء الموجود في الخلفية.
00:18:07نحن لا نستخدم الأيدي حالياً، لأنه لا يوجد
00:18:09أي منها متاح يمكن نشره في المصانع.
00:18:12جميعها تتعطل خلال 100 ساعة.
00:18:14اختر أي نوع منها.
00:18:17إذا كان لديك يد أفضل، سيسعدني
00:18:19شراء 10 وحدات فوراً لاختبارها.
00:18:22لذا يتعلق الأمر بسيناريوهات متينة.
00:18:25الآن، الفكرة هي أنه يمكنك أداء مهام عديدة بمشاهدة البشر.
00:18:28والسبب في قدرتنا على العمل ببيانات قليلة جداً،
00:18:31وهي أقل من ساعة من بيانات الروبوت،
00:18:33هو أن الروبوت يتخيل الأشياء في ذهنه
00:18:36ويحاول مضاعفة التعلم لسيناريوهات عديدة.
00:18:39ما ترونه هنا هو فيديو زائف تماماً.
00:18:42يمكنكم تسميته حلم الروبوت.
00:18:43فهو داخل نموذج الروبوت الخاص،
00:18:45حيث يمكنه تخيل السيناريوهات.
00:18:48لذا هذه ليست بيانات حقيقية.
00:18:49هذا كله محاكاة من نموذج الروبوت نفسه.
00:18:52يمكنك نقل ذلك إلى مهام أكثر تعقيداً
00:18:56وحتى إلى أجهزة أقل تكلفة.
00:18:57هذه مهمة إعداد البيض، مثل إعداد الأومليت.
00:19:02هنا، تكلفة هذا الإعداد بالكامل حوالي 4000 دولار.
00:19:06لذا هي أذرع رخيصة للغاية مقارنة بما ترونه في السوق.
00:19:11وإذا لاحظتم هنا، هذا الإعداد رخيص جداً
00:19:15درجة أنه لا يحتوي على أي مستشعرات.
00:19:16المستشعر الوحيد هنا هو مجرد كاميرا، لا مستشعرات قوة ولا شيء آخر.
00:19:20يمكن للروبوت أداء مهام تتطلب تحكماً بالقوة عبر الرؤية فقط.
00:19:25الآن، لا أقول إن هذا هو المستقبل.
00:19:26بمعنى أنه لا ينبغي عليكم فعل ذلك.
00:19:27أنا متأكد من أن المستشعرات ستتحسن.
00:19:29ولكن انطلاقاً من المستشعرات الحالية، فإننا
00:19:33متأخرون كثيراً عما يمكننا الوصول إليه من منظور
00:19:36الذكاء وحده.
00:19:38لذا يمكن لهذا أن يستمر بالعمل.
00:19:39هذا مشرفي من جامعة بيركلي.
00:19:41لم يكن يعتقد أن الروبوتات يمكنها فعل ذلك.
00:19:43ظل واقفاً لنحو ساعة كاملة.
00:19:45واستمر الروبوت في إعداد الأومليت.
00:19:48والجزء المثير للاهتمام هنا هو أن هذا
00:19:49نظام متكامل كلياً من البداية للنهاية.
00:19:51لا توجد آلة حالات، لا شيء من ذلك.
00:19:53لذا، السبب في إعداد الروبوت للبيض
00:19:55هو وجود طبق فارغ أمامه.
00:19:56لا أعرف لماذا يتقطع العرض.
00:19:58لا يوجد أي مونتاج أو اقتطاع في الفيديو.
00:20:00أؤكد لكم ذلك.
00:20:01إنها مشكلة في كبل HDMI.
00:20:02لذا بمجرد أن تزيل الطبق--
00:20:06عذراً، لا أعلم لماذا يحدث هذا.
00:20:08نعم، إذن لا توجد آلة حالات محدودة.
00:20:10متى يبدأ الروبوت، ومتى ينتهي،
00:20:11كل ذلك يتم تلقائياً.
00:20:12وهو متين جداً حتى أمام التشويش.
00:20:14يمكنك تغيير أماكن الأشياء حوله.
00:20:16يمكنك إضافة-- هذه كلها أشياء لم يرها من قبل.
00:20:20المقلاة وموقد الغاز هما الوحيدان المتشابهان.
00:20:22كل شيء آخر مختلف.
00:20:23ويمكن للروبوت الاستمرار في العمل.
00:20:25لذا يمكنك الحصول على متانة أساسية.
00:20:27وقد تم تدريب كل هذا ببيانات أقل من 10 ساعات.
00:20:30إنها كمية بيانات قليلة جداً لتعلم هذه المتانة.
00:20:33وهي ناتجة عن النموذج الأساسي في الخلفية.
00:20:37سأتجاوز هذا اختصاراً للوقت.
00:20:39بخلاف مسارات الروبوتات التقليدية،
00:20:42حيث يوجد لديك تخطيط ورسم خرائط وما إلى ذلك،
00:20:44فهذا عقل يعمل من البداية إلى النهاية.
00:20:46مصطلح “من البداية إلى النهاية” مستخدم بكثرة في مجالات الذكاء الاصطناعي.
00:20:50ولكن عندما أقول ذلك، فأنا أعنيه حرفياً.
00:20:53فهو يقرأ البيانات مباشرة من الكاميرات.
00:20:55ويزود المحركات بالفيض الكهربائي مباشرة.
00:20:59لذا لا نستخدم أي شيء بينهما، سوى وحدة تحكم PID
00:21:02في النهاية تماماً، للانتقال من 100 إلى 500 هرتز.
00:21:04لكن PID ليست مساهمة من عالم الروبوتات.
00:21:06بل هي أقدم من ذلك.
00:21:07يعود تاريخها إلى الحرب العالمية الثانية أو نحو ذلك.
00:21:10والآن، الجزء المثير للاهتمام هو أن الرؤية بالنسبة لنا
00:21:13مجرد مدخل آخر.
00:21:15لذا لا يوجد شيء مذهل للغاية بخصوصها.
00:21:17إذا كنتم قد رأيتم-- ربما رأيتم الكثير من النتائج
00:21:20لروبوتات ترقص، أو تمارس الكاراتيه، أو الكونغ فو، أو الشقلبة الخلفية.
00:21:23فكروا ملياً، كم نتيجة رأيتموها
00:21:27لروبوتات تصعد السلالم وتهبط منها؟
00:21:30قليلة جداً.
00:21:31حتى كبرى الشركات في مجال الروبوتات الشبيهة بالبشر،
00:21:34لم تعرض أكثر من درجة سلم واحدة
00:21:37فقط لإثبات إمكانية ذلك.
00:21:39ويتحدث الناس عن قدوم الروبوتات البشرية، والمنافسة بين الصين وأمريكا.
00:21:42كل هذا محض هراء نوعاً ما.
00:21:44إذا كانت الروبوتات البشرية لا تستطيع صعود السلالم،
00:21:47فما الفائدة من تزويدها بأرجل؟
00:21:50هذا هو السبب الوحيد لامتلاك الأرجل.
00:21:51هذا تجسيد فعلي لمفارقة مورافيك.
00:21:55الجانب الأيسر في الواقع أسهل بكثير بالنسبة للروبوت.
00:21:58الشقلبة الخلفية والرقص أسهل بكثير على الروبوت.
00:22:01وقد تسألون، لماذا توجد هذه المفارقة؟
00:22:04فكروا بعمق أكبر لمستوى واحد.
00:22:05عندما يقوم الروبوت بشقلبة خلفية،
00:22:09فإنه يحتاج فقط لمعرفة جسده هو، ولا شيء آخر.
00:22:13أليس كذلك؟
00:22:13وعندما يكون كل شيء معلوماً وملاحظاً بالكامل،
00:22:17فهذا ما برعت فيه أجهزة الكمبيوتر.
00:22:20لأنها تستطيع محاكاة كل إعداد ممكن.
00:22:25لكن الجانب الأيمن، حتى مجرد صعود السلالم،
00:22:27يتطلب رؤية السلالم في المقام الأول.
00:22:30ومعرفة الارتفاع والعرض.
00:22:32أنت لا تقيس الارتفاع والعرض بدقة،
00:22:34ولكنك تتكيف مع كل المؤثرات والتغييرات.
00:22:35وهذا يتطلب حاسة الرؤية.
00:22:36فالجانب الأيمن يتطلب الفهم وإدراك البيئة.
00:22:38ولهذا السبب هو صعب، ولا ترون أي شيء من هذا.
00:22:40أما بالنسبة لنا، فهو مجرد نتيجة أخرى.
00:22:42الأمر لا يشكل فارقاً حقاً.
00:22:43لذا يمكننا-- لقد نشرنا هذه النتيجة منذ عام ونصف.
00:22:46وقمنا بتصويرها منذ عامين ونصف.
00:22:48لكن هذا الروبوت يمكنه التحرك في أي سيناريو.
00:22:52فهو لا يتعثر بالأشياء.
00:22:53بل يتخطاها عمداً.
00:22:55ولا يوجد رسم خرائط أو تخطيط مسبق.
00:22:56فهو لا ينشئ أي خريطة ثلاثية الأبعاد للمحيط.
00:22:59كل شيء يعمل انطلاقاً من الكاميرا المثبتة على الجذع.
00:23:02ويمكنكم وضع هذا في أي نوع من الإعدادات، وأي نوع من السلالم.
00:23:05سأقوم بالتسريع هنا.
00:23:07هذه كما تعلمون، سلالم مهارب الحريق.
00:23:11إنها غريبة بعض الشيء.
00:23:12سلالم مهارب الحريق تُستخدم عندما يكون هناك حريق أو حالة طوارئ.
00:23:15وهي الأكثر صعوبة في كل مبنى.
00:23:17لذا نحن نختبر في كل هذه الإعدادات.
00:23:20ولكن يمكنك وضع هذا بأي طريقة.
00:23:21يمكنك مضايقته على السلالم.
00:23:22هذا لا يهم حقًا.
00:23:23هذه القدرة تتفوق على القدرة البشرية.
00:23:25لأن الروبوت لا يمكنه رؤية أنه يُسحب.
00:23:27لذا فهذا عنصر مفاجأة للروبوت
00:23:29أنك تسحبه أثناء صعوده.
00:23:31ومجددًا، إنه النموذج نفسه في كل مكان
00:23:33في كل هذه السيناريوهات.
00:23:35لذا الأمر سهل للغاية.
00:23:36ورغم سهولته، فإن الباركور يبدو ممتعًا.
00:23:40والناس يجدون غالبًا أن هذا، كما تعلمون،
00:23:45الروبوتات تستطيع القيام بكل هذا.
00:23:47لكن هذا أسهل بكثير مما عرضته سابقًا.
00:23:51وحتى لو شاهدتم هذه الفيديوهات الآن،
00:23:53سيجد العديد منكم هذا أكثر إبهارًا،
00:23:55حتى مع قولي لكم إن هذا سهل.
00:23:57يتطلب تدريب هذا نصف ساعة فقط،
00:23:59بينما استغرق السابق وقتًا أطول بكثير وكان أكثر
00:24:01صعوبة في التدريب.
00:24:03لذا يمكنك أخذ هذا النموذج الأساسي، ونقله
00:24:06إلى مجموعة متنوعة من المهام بسرعة كبيرة.
00:24:08فهنا مثلاً، هذه نتيجة قديمة جداً
00:24:09منذ نحو عام ونصف.
00:24:11لإدخال كبلات الشبكة (LAN) وما إلى ذلك،
00:24:13لدينا أنظمة متطورة جداً الآن.
00:24:14لكننا نقوم بنشر هذه النماذج بالفعل
00:24:17عبر مجموعة متنوعة من التطبيقات.
00:24:18على سبيل المثال، لبناء عجلة البيانات الإيجابية،
00:24:21فإن الجزء الأصعب هو النشر الميداني نفسه.
00:24:24هناك العديد من المشكلات الأخرى إلى جانب الذكاء
00:24:26والأجهزة التي تظهر عند نشر الروبوتات.
00:24:30هذا ليس مثل نشر ChatGPT عبر تطبيق.
00:24:34لأنه يتعين عليك التعامل مع العديد من...
00:24:36وأعتقد أن Skydio قدمت عرضًا قبل هذا،
00:24:38ويمكنهم التحدث إليكم طوال اليوم
00:24:40عن صعوبة النشر الميداني.
00:24:42لذا يجب أن نبدأ النشر الآن،
00:24:44حتى نتمكن من امتلاك عجلة البيانات هذه في المستقبل المنظور.
00:24:47وسأعطيكم بضعة أمثلة على عمليات النشر التي نقوم بها.
00:24:49أحد الأمثلة مع NVIDIA...
00:24:51إن NVIDIA تفتتح أول مصنع لها في هيوستن.
00:24:54وأنوِية معالجة الرسوميات الخاصة بهم، التي تستخدمونها الآن،
00:24:56تُصنع كلها خارج الولايات المتحدة وفي تايوان بشكل أساسي.
00:24:59وكل ذلك يتم يدوياً هناك.
00:25:01والبشر أكفاء حقاً وممتازون للغاية
00:25:04في تصنيع هذه الأشياء.
00:25:05لكن تحمل التكلفة والقدرة على التوسع ومعدل الإنتاج
00:25:08هنا في الولايات المتحدة، يصعب الحفاظ عليها
00:25:10بدون هذه القوة العاملة.
00:25:11لذا نحن هنا نقوم بأتمتة تجميع معالجات الرسوميات هذه لهم.
00:25:15هذا... لقد قدمنا عرضاً توضيحياً حياً في مؤتمر NVIDIA GTC.
00:25:19تم نشر هذا في المصنع بالفعل الأسبوع الماضي،
00:25:21لذا فهو يعمل حالياً.
00:25:22لكن الجزء المثير للأهمية الذي أريد تسليط الضوء عليه...
00:25:25هذه مهمة مصنع تقليدية للغاية.
00:25:29ولكن إذا نظرت إلى الإعداد بأكمله،
00:25:32فهو عشوائي للغاية ومبهرج للغاية.
00:25:36وإذا ذهبت إلى أي مصنع بإعدادات تقليدية،
00:25:38ستجدها نظيفة للغاية.
00:25:39لذا هنا، يمكن للروبوت، باستخدام العقل نفسه،
00:25:42ليس فقط القيام بمهام دقيقة للغاية،
00:25:44بل يمكنه أيضًا أن يكون قويًا ومقاومًا لأي نوع من التشويش، وهو ما
00:25:46يعني أن هذه الروبوتات لا تحتاج الآن إلى أن تكون داخل قفص.
00:25:50ويمكن نشرها كما هي على خطوط المصانع هذه
00:25:54دون أي تغيير في أي خط إنتاج.
00:25:56جنبًا إلى جنب مع البشر، وحيثما يوجد بشر، تتواجد الفوضى.
00:26:00حسناً؟
00:26:00يمكنك استخدام العقل نفسه في تطبيقات التوصيل.
00:26:02فهنا يقوم الروبوت بالتوصيل من الشاحنة إلى الباب.
00:26:06عليه أن يحدد موقع الباب الأمامي.
00:26:08لذا فهذه مسألة تتعلق بالمنطق البديهي،
00:26:09وليست مشكلة تنقل.
00:26:10وقد قمنا بالفعل بتوصيل الطرود
00:26:12من خلال العمل خلف الكواليس مع العديد من الشركاء
00:26:15لتوصيل الطرود إلى الأبواب الأمامية للمنازل
00:26:17في هذه المناطق.
00:26:19النظام نفسه يعمل في المستودعات وكل هذه الأماكن.
00:26:23والآن، وختاماً لهذا الحديث وهذا الموضوع،
00:26:26ذكرت أن هذا العقل متعدد الأجسام.
00:26:29وآمل أن يكون واضحاً تماماً سبب أهميته البالغة
00:26:31لوجود عقل متعدد الأجسام لبناء عجلة قيادة البيانات.
00:26:34لكن هناك فائدة إضافية.
00:26:35تتمثل في أن روبوتاتك قد تتعطل بمرور الوقت
00:26:38وفي سيناريوهات السلامة.
00:26:41والسلامة هي نتاج ثانوية لهذا العقل متعدد الأجسام.
00:26:44لأنه إذا كان لديك--
00:26:45يمكننا وضع-- سأتجاوز هذا بسرعة كبيرة.
00:26:47يمكنكم رؤيته عبر الإنترنت.
00:26:48هذا كله متاح عبر الإنترنت.
00:26:49لكن يمكننا وضع العقل نفسه في كل نظام من هذه الأنظمة،
00:26:52وفي كل روبوت من هذه الروبوتات.
00:26:55وفي هذه الحالة، لم نقم حتى بالتدريب على هذه الروبوتات.
00:26:58هذا نقل فوري مباشر تماماً
00:27:00إلى كل هذه الروبوتات الشبيهة بالبشر وكل هذه الأشياء.
00:27:02وحتى لو انكسر الروبوت، وهنا انكسرت الساق،
00:27:05يمكنه التعافي في غضون أجزاء من الثانية.
00:27:07لأنه عندما تنكسر ساق الروبوت، فإن روبوتك ثلاثي الأرجل
00:27:10يصبح روبوتًا جديدًا.
00:27:12لذا لا يهم حقًا ما هو شكل الروبوت.
00:27:14أي شيء يتغير، هنا قمنا بتعطيل أرجل الروبوت.
00:27:17يتعلم المشي على رجلين في ثلاث محاولات فقط.
00:27:21لذا ما ترونه على الشاشة هو كل التدريب
00:27:24الذي يحدث للروبوت في هذه الأنظمة.
00:27:27فيتحول ويتكيف في غضون أجزاء من الثانية إلى 30 ثانية تقريبًا.
00:27:32وكمثال واحد هنا، إنه يسير على عجلات.
00:27:34تقوم بتعطيل العجلة.
00:27:36فيبدأ بالمشي.
00:27:37وهذا منتج ثانوي آخر للدماغ الشامل لأجساد مختلفة.
00:27:40تأخذ السلامة معنى مختلفًا تمامًا مع هذا النوع من النماذج
00:27:45عندما يستطيع الروبوت الطيران--
00:27:46عفوًا، عندما تستطيع الروبوتات المشي أو التشغيل
00:27:49بنصف جسدها فقط.
00:27:50لقد أزلت بعض المشاهد المروعة من هذا،
00:27:52لكننا أيضًا قطعنا الروبوت إلى نصفين.
00:27:54وما زال بإمكانه العمل بكلا النصفين بشكل منفصل.
00:27:57ولكن لرؤية ذلك، يمكنك الذهاب إلى يوتيوب.
00:27:59وهذا كل ما لدي.
00:28:00شكرًا لكم.

설명

Show a robotics demo from 1957 next to one from today, and most people can't tell which is which. Deepak Pathak, co-founder and CEO of Skild AI and a professor at Carnegie Mellon, argues robotics stalled because it was treated as a hardware problem rather than a problem of building a general brain. Collecting robot data by teleoperation at one example a minute, he calculates, would take the entire US population more than a century to reach GPT-3 scale. Skild's answer is an "omni-bodied" brain: one model for any robot and any task. It's pre-trained on scalable data like simulation and human video, post-trained on teleoperation, and improved by a deployment flywheel. Pathak shows it inserting AirPods with a simple gripper, learning from human video with under an hour of robot data, and cooking omelets on $4,000 arms with only a camera. He explains why climbing stairs is harder than a backflip. He also shows GPU assembly for NVIDIA's Houston factory, and a robot learning to walk on two legs in three tries after its other legs are disabled. Speaker info: X/Twitter: @pathak2206 (https://x.com/pathak2206) LinkedIn: https://www.linkedin.com/in/pathak22 Website: https://www.cs.cmu.edu/~dpathak Related links: Skild AI: https://www.skild.ai Timestamps: 0:00 AI's progress and the robotics hype 1:02 Robotics has been "almost here" for 70 years 1:27 A 1960s block-copying robot 2:17 Teleoperation in 1957 3:57 Why robotics is stuck: the missing general brain 4:27 Moravec's paradox 5:42 There's no internet of robot data 7:22 Skild's thesis: one brain, any robot, any task 8:22 Teaser: many robots, one brain 9:31 How to scale robot data: a career retrospective 12:01 The three properties of robot data that matter 13:21 Pre-training, post-training and the deployment flywheel 14:56 Why laundry folding is actually easy 16:17 The AirPods task 17:21 Learning from human videos 18:36 The robot's "dream": imagined training data 18:56 Cooking omelets on $4,000 arms 20:41 Truly end-to-end: camera in, motor power out 21:21 Why stairs are harder than backflips 24:50 Deployment: GPU assembly for NVIDIA 26:00 Package delivery to the front door 26:25 Safety: adapting when the robot breaks

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기