रोबोटिक्स 70 सालों से रुका हुआ है — दीपक पाठक, Skild AI

Transcript

00:00:00मुझे लगता है कि आप सभी जानते हैं कि AI ने
00:00:15पिछले पांच सालों में कितनी प्रगति की है।
00:00:17लगता है कि यह पिछले 100 सालों की प्रगति से भी ज़्यादा है।
00:00:22और जो हो रहा है, खासकर AI के क्षेत्र में,
00:00:24वह यह है कि AI पहले भाषा के लिए आया, फिर स्पीच, ऑडियो, वीडियो।
00:00:28और अब हर किसी का उत्साह अगला कदम, यानी रोबोटिक्स को लेकर है।
00:00:32और यह उत्साह किसी कारण से इस साल चरम पर पहुँच रहा है,
00:00:37जो अब भी मेरी समझ से परे है।
00:00:40और आप जेन्सेन जैसे लीडर्स को भी देख सकते हैं
00:00:43जो रोबोटिक्स की अगली सीमा के रूप में फिज़िकल AI की बात कर रहे हैं।
00:00:46तो ऐसा लगता है कि अगर आप ट्विटर या लिंक्डइन खोलें,
00:00:49तो लगेगा कि रोबोटिक्स पहले से ही आ चुका है।
00:00:51और दिसंबर तक हमारे घरों में होम रोबोट्स आ जाएँगे,
00:00:56जैसा कि कई लोगों द्वारा कहा जा रहा है।
00:00:58लेकिन मैं यहाँ यह उजागर करने आया हूँ कि रोबोटिक्स लगभग आने ही वाला है
00:01:03पिछले 70 सालों से।
00:01:06अब, आपमें से जो लोग पिछले चार या पाँच
00:01:10सालों में रोबोटिक्स में आए हैं, वे जाएँ और रोबोटिक्स का कोई भी कोर्स लें।
00:01:14और अगर आप 30 साल पहले के रोबोटिक्स के वीडियो
00:01:17और आज के वीडियो में अंतर बता सकें, तो मेरी तरफ़ से आपको डिनर!
00:01:23तो आपको एक उदाहरण देने के लिए, आइए इस रोबोट को देखते हैं।
00:01:26तो यहाँ यह रोबोट एक छवि है।
00:01:27और इस रोबोट का लक्ष्य ब्लॉक्स की इस छवि को देखना है
00:01:31और इन ब्लॉक्स को अपने सामने इस तरह व्यवस्थित करना है
00:01:34कि यह छवि में दिखाए गए पैटर्न जैसा ही दिखे।
00:01:37ठीक है?
00:01:38यह एक बहुत ही सरल काम है।
00:01:40लेकिन अगर आप इसके बारे में सोचें, तो यह एक 3D ब्लॉक है।
00:01:42आपको हर तरफ से 3D को देखना और समझना होता है।
00:01:44और रोबोट इसे काफी सटीकता से कर सकता है।
00:01:47कोई अंदाज़ा है कि यह परिणाम कितना पुराना है?
00:01:51कोई भी?
00:01:51यह सिर्फ़ एक अंदाज़ा है।
00:01:52आप कोई भी अंदाज़ा लगा सकते हैं।
00:01:53हाँ?
00:01:5440 साल।
00:01:55ठीक है।
00:01:55क्या वह सबसे ज़्यादा है?
00:01:59यह 1960 के दशक का है।
00:02:01यह कंप्यूटर के आने से बहुत पहले का समय है।
00:02:03ठीक है?
00:02:04तो इसे "MIT कॉपी डेमो" कहा जाता है।
00:02:06यह शुरुआत थी--
00:02:09यह AI से भी पुराना है, जैसा कि आप आज जानते हैं।
00:02:12इसे देखिए।
00:02:17फिलाडेल्फिया में न्यूक्लियर कांग्रेस की एक प्रदर्शनी
00:02:19लोकप्रियता का सही फ़ॉर्मूला दिखाती है।
00:02:21यहाँ क्या हो रहा है, पर्दे के पीछे का व्यक्ति
00:02:24इन रोबोट्स को नियंत्रित कर रहा है, जो एक लीडर-फॉलोअर सिस्टम है।
00:02:27और अगर आप किसी भी बड़ी लैब, किसी भी बड़ी कंपनी,
00:02:31किसी भी बड़ी एकेडमिक लैब को देखें कि वे डेटा कैसे प्राप्त करते हैं,
00:02:33वे टेली-ऑपरेशन सिस्टम का उपयोग करते हैं, जो
00:02:35ठीक इन्हीं सिद्धांतों पर काम करता है।
00:02:38इसके वर्ष के लिए कोई अंदाज़ा?
00:02:40इस इलेक्ट्रॉनिक डिवाइस का कुशल ऑपरेटर--
00:02:42अब, हर कोई वर्ष का अंदाज़ा लगाने के लिए सुधार करेगा।
00:02:45लेकिन यह 1957 का है, 68 साल पहले।
00:02:49ठीक है?
00:02:51अपने परिवार के किसी भी ऐसे व्यक्ति से पूछें जो उम्र में--
00:02:53वास्तव में, शायद वे अब न भी हों।
00:02:55क्योंकि यह--
00:02:57आपको 80 साल के किसी व्यक्ति से पूछना होगा,
00:02:59कि उस समय तकनीक की स्थिति क्या थी?
00:03:02जैसे RAM, कुछ kb की RAM के लिए, आपके पास एक कमरे जितना बड़ा सेटअप होता था।
00:03:06इतना बड़ा सेटअप।
00:03:07और यह उस समय की बात है जब लोगों ने इसे काम के लायक बना दिया था।
00:03:11सिर्फ़ यही नहीं, आप हर दशक पीछे जाकर देखें,
00:03:14वीडियो उतने ही शानदार दिखते हैं।
00:03:15जैसे यहाँ एक ह्यूमनॉइड रोबोट है, जो करतब दिखा रहा है,
00:03:18एक इंसान के साथ फ़ूसबॉल खेल रहा है।
00:03:21और यह भी उस समय का है, यह सब डीप लर्निंग से पहले की बात है।
00:03:25यह आठ साल पहले का है।
00:03:26तो यह रोबोट बर्कले का एक परिणाम है,
00:03:29जो पूरी मेज साफ कर सकता है, एक डिब्बे में सामान व्यवस्थित कर सकता है।
00:03:33यह एक सिंगल GPU मशीन के साथ एक छात्र द्वारा किया गया था।
00:03:36इससे ज़्यादा कुछ नहीं।
00:03:37ठीक है?
00:03:38अब, यह तस्वीर-- और अगर मैं इन सभी वीडियोज़ का रंगीन रूप बना दूँ
00:03:41अतीत से और आधुनिक आवाज़ के लिए Gen AI फ़िल्टर लागू करूँ,
00:03:45तो आप यह नहीं बता सकते कि यह वीडियो 1967 का है
00:03:49या आज का।
00:03:50और ये सबसे पुराने परिणाम भी नहीं हैं।
00:03:52सबसे पुराने परिणाम 1940 के दशक के हैं।
00:03:54ठीक है?
00:03:55तो बात यह है कि अगर आप पिछले 70 सालों को देखें,
00:04:00तो बाकी हर तकनीक, बाकी हर तकनीक
00:04:02बहुत आगे बढ़ चुकी है--
00:04:04भाषा की समझ, कंप्यूटर विज़न, मोबाइल फ़ोन, चिप्स।
00:04:08फिर रोबोटिक्स इतने लंबे समय से इस आदिम दौर में क्यों अटका हुआ है?
00:04:11और इसका कारण है एक सामान्य दिमाग की कमी।
00:04:14रोबोटिक्स को हमेशा शुरुआत से ही एक हार्डवेयर
00:04:17समस्या के रूप में देखा गया है।
00:04:18और यही वजह है कि रोबोटिक्स के आस-पास की हर चीज़
00:04:21आगे बढ़ी है, लेकिन रोबोटिक्स अब भी पिछले 70 सालों से
00:04:24उसी मुकाम पर अटका हुआ है।
00:04:25तो मोरावेक्स पैराडॉक्स नाम का एक बहुत प्रसिद्ध विरोधाभास है।
00:04:27मुझे नहीं पता कि आप मोरावेक के बारे में जानते हैं या नहीं।
00:04:29वह भी CMU के प्रोफ़ेसर थे, और मैं भी CMU का प्रोफ़ेसर हूँ।
00:04:32इसलिए मुझे उनका ज़िक्र ज़रूर करना चाहिए।
00:04:34वह AI के संस्थापक हस्तियों में से एक थे।
00:04:36रोबोटिक्स में 30 साल काम करने के बाद,
00:04:39वह एक बहुत ही सरल निष्कर्ष पर पहुँचे।
00:04:41कठिन आसान है।
00:04:42आसान कठिन है।
00:04:43ठीक है?
00:04:44जो कुछ भी इंसान कठिन मानता था,
00:04:45वह कंप्यूटरों के लिए बेहद आसान है और इसके विपरीत भी।
00:04:49और आप इसे अपनी आँखों के सामने होते हुए देख सकते हैं।
00:04:51आप कहेंगे गणित करना कठिन है।
00:04:53मैथ्स ओलम्पियाड में गोल्ड मेडल जीतना वाकई बहुत कठिन है।
00:04:56सीढ़ी चढ़ना?
00:04:57यह तो बहुत आसान था।
00:04:59अब तकनीक के मामले में अपने आस-पास देखें।
00:05:01हम कहाँ हैं, इस संदर्भ में कि क्या हल हो चुका है
00:05:02और क्या हल नहीं हो पा रहा है।
00:05:04तो यह आपके लिए रोबोटिक्स है, ठीक है?
00:05:05यह बहुत-- यह AI का केवल एक और अनुप्रयोग नहीं है।
00:05:09यह वही है जिसके लिए AI की शुरुआत में स्थापना की गई थी
00:05:12और इसमें बहुत ही कम प्रगति हुई है।
00:05:14यह ऐसा कोई साधारण अनुप्रयोग नहीं है
00:05:15जहाँ डीप नेटवर्क आएं और इस क्षेत्र को बदल दें।
00:05:18इसके बारे में मूलभूत रूप से बुनियादी सिद्धांतों के साथ
00:05:22शुरुआत से सोचना होगा।
00:05:23यह इस बात का एक बहुत प्रसिद्ध उदाहरण है जहाँ
00:05:25कंप्यूटर 90 के दशक में गैरी कास्पारोव को शतरंज में हरा सकता है,
00:05:29लेकिन आज भी आपके पास ऐसा कंप्यूटर या रोबोट नहीं है,
00:05:34जो शतरंज की गोटियाँ उठा सके और उन्हें
00:05:36शतरंज के बोर्ड पर व्यवस्थित कर सके।
00:05:37अब, तो हम इसे हल करने के लिए क्या रुख अपनाएँ, ठीक है?
00:05:43तो एक सकारात्मक बात यह है कि हमारे पास AI की सफलता का एक जादुई मंतर है, है ना?
00:05:47आप बड़ा डेटासेट लेते हैं।
00:05:49आप बड़े मॉडलों को प्रशिक्षित करते हैं।
00:05:51और जादू हो जाता है, ठीक है?
00:05:52अब, हम जानते हैं कि यह ढाँचा कई विषयों में
00:05:54बहुत अच्छी तरह काम कर रहा है, ठीक है?
00:05:57अब, क्या हम रोबोटिक्स में भी यही तरीक़ा अपना सकते हैं?
00:05:59खैर, यह सीधे तौर पर लागू नहीं होता क्योंकि हमारे पास डेटा नहीं है।
00:06:02रोबोटिक्स डेटा का ऐसा कोई इंटरनेट मौजूद नहीं है।
00:06:06और जैसा कि मैंने पहले कहा, आप टेलीऑपरेशन नाम की प्रक्रिया से
00:06:09रोबोट पर खुद जाकर डेटा एकत्र कर सकते हैं।
00:06:12और जैसा कि आप ध्यान देंगे, टेलीऑपरेशन कोई पाँच साल पुरानी बात नहीं है।
00:06:14यह 68 या 70 साल पुरानी बात है।
00:06:18तो दिलचस्प बात यह है कि अगर आप पीछे जाएँ
00:06:21और GPT-3, GPT-4 मॉडलों के पूरे विकास को देखें,
00:06:24तो तीन साल पहले GPT-3 पर वापस जाकर देखें।
00:06:28लगता है जैसे एक ज़माना बीत गया।
00:06:31GPT-3 ने काम करना और लोगों का ध्यान खींचना तभी शुरू किया
00:06:33जब आप उन मॉडलों को ट्रिलियन टोकन पर प्रशिक्षित कर सके।
00:06:36तो GPT-3 पहले से ही 30 ट्रिलियन से अधिक टोकन का था।
00:06:40और आज, सैकड़ों ट्रिलियन टोकन हैं।
00:06:42और अगर आप टेलीऑपरेशन द्वारा खुद डेटा एकत्र करते हैं,
00:06:44तो एक उदाहरण पाने में आपको लगभग एक मिनट लगता है।
00:06:47आप हिसाब लगा सकते हैं।
00:06:49अगर आपके पास अमेरिका की पूरी आबादी भी हो,
00:06:50अगर अमेरिका की पूरी आबादी भी इसमें लग जाए, तो
00:06:53GPT-3 के पैमाने तक पहुँचने में
00:06:55एक सदी से भी ज़्यादा का समय लग जाएगा, जो कि एक--
00:06:59और आज के समय में GPT-3 का इस्तेमाल कोई नहीं करता।
00:07:00ठीक है?
00:07:01तो यह तरीका बहुत धीमा और महँगा है।
00:07:02इसलिए रोबोटिक्स में, मैं कहूँगा कि अभी तक किसी ने भी
00:07:05रोबोटिक्स को सही मायने में स्केल नहीं किया है।
00:07:07और हम रोबोटिक्स को उस पैमाने पर ले जाने से बहुत दूर हैं
00:07:10जिस पैमाने को बाकी क्षेत्रों में देखा गया है।
00:07:14ठीक है?
00:07:14तो यही वो चीज़ है जिस पर हम ध्यान केंद्रित कर रहे हैं।
00:07:17स्केल्ड (Physical Intelligence) लगभग तीन साल पुरानी है।
00:07:19लेकिन मैं एक दशक से भी ज़्यादा समय से इस समस्या पर काम कर रहा हूँ।
00:07:22मैंने अपने करियर में बस यही किया है।
00:07:24और कुछ नहीं।
00:07:26तो बड़े पैमाने पर, हमारी धारणा यह है कि
00:07:27एक सर्व-शारीरिक बुद्धिमत्ता (omnibodied intelligence) बनाई जाए।
00:07:32कोई भी रोबोट, कोई भी काम, एक दिमाग।
00:07:35ठीक है?
00:07:36कोई भी रोबोट-- वह ह्यूमनाॉयड हो सकता है।
00:07:37वह चार पैरों वाला रोबोट हो सकता है।
00:07:38वह कन्वेयर बेल्ट पर रोबोटिक आर्म या कुशल हाथ हो सकता है।
00:07:41इससे वास्तव में कोई फ़र्क नहीं पड़ता।
00:07:42और यह धारणा इंसानों की क्षमता से भी कहीं ज़्यादा
00:07:45व्यापक है, ऐसा तर्क दिया जा सकता है,
00:07:48क्योंकि हम केवल अपने शरीर को नियंत्रित करते हैं।
00:07:50और हमें इतना व्यापक होने की ज़रूरत क्यों है?
00:07:51खैर, तर्क यह है कि रोबोटिक्स में,
00:07:54वैसे भी कोई डेटा उपलब्ध नहीं है।
00:07:56इसलिए मैं चुन नहीं सकता कि किस हार्डवेयर का डेटा इस्तेमाल करूँ।
00:07:59और हमें किसी भी तरह के हार्डवेयर से डेटा का इस्तेमाल करने में सक्षम होना चाहिए,
00:08:02किसी भी तरह का काम, किसी भी तरह का परिदृश्य।
00:08:04और वास्तव में उस पैमाने को हासिल करने का
00:08:06यही एकमात्र तरीका है जो भाषा मॉडल ने तीन साल पहले हासिल किया था।
00:08:10और यहाँ लक्ष्य 'कोई भी रोबोट,
00:08:13कोई भी काम, एक दिमाग' का विचार है।
00:08:15और इस बातचीत के ज़रिए, मुझे उम्मीद है कि
00:08:16मैं आपको समझा पाऊँगा कि रोबोटिक्स की दिशा में यही सही रास्ता क्यों है।
00:08:20ठीक है?
00:08:20तो यह एक शुरुआती परिचय था।
00:08:23लेकिन विस्तृत जानकारी में जाने से पहले,
00:08:24मैं आपको एक छोटा सा टीज़र परिणाम दिखाना चाहता हूँ।
00:08:28तो इस परिणाम में, हर एक रोबोट
00:08:31अलग कंपनी और अलग हार्डवेयर का है।
00:08:34और वे सभी एक ही एआई दिमाग द्वारा नियंत्रित हैं,
00:08:37चाहे वह सीढ़ियों पर चढ़ते-उतरते ह्यूमनाॉयड हों,
00:08:39या किसी भी तरह की परिस्थितियाँ हों।
00:08:42और ये कोई नए नतीजे नहीं हैं।
00:08:43यहाँ दिख रहे परिणाम कुछ साल पुराने हैं।
00:08:47बाधाओं के बावजूद मजबूती से काम करते हैं।
00:08:51आप उन्हें बिना पूर्व प्रशिक्षण के सीधे नए माहौल में रख सकते हैं।
00:09:03विचार यह है कि इस वीडियो का हर एक रोबोट
00:09:08दुनिया में कहीं भी कोई भी एक्शन ले सकता है।
00:09:11इसके पीछे काम करने वाला दिमाग बेहतर होता जाता है,
00:09:13क्योंकि यह एक सर्व-शारीरिक दिमाग है।
00:09:15हाँ, यह सचमुच बहुत मुश्किल है, है ना?
00:09:16क्योंकि अंडे ठीक-ठाक हैं।
00:09:17तो यह हमारी तकनीक की एक छोटी सी झलक थी।
00:09:33तो मैं इस टॉक को कंपनी के विज्ञापन से ज़्यादा वैज्ञानिक
00:09:38और ज्ञानवर्धक बनाना चाहता हूँ।
00:09:39इसलिए मैं बात करूँगा कि हम रोबोटिक्स में डेटा को स्केल कैसे करते हैं।
00:09:42चलिए एक नज़र डालते हैं कि लोग इसे कैसे हल करते रहे हैं।
00:09:45मैं अपने करियर पर भी एक नज़र डालूँगा।
00:09:48और डेटा को लेकर मेरी धारणा सालों में बदलती रही है।
00:09:51जब मैंने काम करना और चीज़ों को स्केल करना शुरू किया था,
00:09:55तब सोच यह थी कि रोबोट के लिए डेटा मैन्युअल रूप से जुटाया जा सकता है,
00:09:59लेकिन यह बहुत धीमा तरीका है।
00:10:00और रोबोट को खुद डेटा जुटाने की अनुमति होनी चाहिए।
00:10:03इसलिए हमारे पास उत्सुकता से प्रेरित अन्वेषण की अवधारणा थी,
00:10:06जिसमें रोबोट को अपने माहौल में उत्सुक होकर चीज़ें तलाशने दी जाती हैं।
00:10:10और इसके कई फ़ायदे हैं, जैसे इंसान की ज़रूरत नहीं होती।
00:10:13रोबोट खुद जाकर खेलते रह सकते हैं और ज़्यादा डेटा जुटा सकते हैं।
00:10:15उस समय हम इसे 'प्ले डेटा' कहते थे।
00:10:17यह बहुत समृद्ध होता है, क्योंकि इसमें बल, सेंसर और जॉइंट एंगल्स शामिल होते हैं।
00:10:21लेकिन दिक्कत यह है कि यह केवल भौतिक दुनिया तक सीमित है।
00:10:24इसलिए इसे बड़े पैमाने पर ले जाना बहुत मुश्किल है।
00:10:27गूगल उस समय इस पर काम कर रहा था, उनके पास सैकड़ों रोबोट थे।
00:10:31गूगल के लिए भी इसे स्केल करना बहुत महँगा और धीमा था।
00:10:34दूसरा विचार फिर से टेलि-ऑपरेशन का है।
00:10:36जैसा कि मैंने कहा, यह पुराना विचार है।
00:10:38लेकिन फिर से वही समस्याएँ आती हैं।
00:10:39स्केल करना असंभव है, क्योंकि अब केवल रोबोट ही नहीं,
00:10:42इंसानों की भी ज़रूरत होती है।
00:10:43तो यह और भी ज़्यादा महँगा है।
00:10:45और विविधता बहुत सीमित होती है।
00:10:46क्योंकि अगर आप किसी इंसान के साथ रोबोट को एक सेटअप में रखते भी हैं,
00:10:50तो आप 1,000 उदाहरण तो हासिल कर सकते हैं।
00:10:51लेकिन वे सब एक ही सेटअप में होंगे।
00:10:53तो आप जो वास्तव में चाहते हैं, वह यह है कि रोबोट को रोज़ एक नए घर,
00:10:57हर दिन, एक नए माहौल में।
00:10:58और उसे बड़े पैमाने पर ले जाना बेहद कठिन है।
00:11:01फिर हमें सिमुलेशन से सीखने के क्षेत्र में
00:11:03एक बड़ी सफलता मिली।
00:11:04यह उन शुरुआती नतीजों में से एक था जहाँ यह दिखाया जा सका कि
00:11:08सिमुलेशन में प्रशिक्षित डीप रीइन्फोर्समेंट लर्निंग को
00:11:12असली रोबोट में ट्रांसफ़र किया गया।
00:11:13यह उस समय का एक पुरस्कार विजेता शोध पत्र था।
00:11:16और अब इसका इस्तेमाल हर ह्यूमनाॉयड और हर कंपनी में हो रहा है।
00:11:20यह बर्कले और CMU की एक लैब से आया था।
00:11:23लेकिन फिर से, इसके अपने फ़ायदे और नुकसान हैं।
00:11:25इसे स्केल करना बहुत आसान है।
00:11:27लेकिन विविधता लाना मुश्किल है, क्योंकि आपको
00:11:29सिमुलेशन में हर सीन को खुद डिज़ाइन करना पड़ता है।
00:11:31तो अगर आप इसे सुन रहे हैं, तो
00:11:34ऐसा कोई एक सीधा जवाब नहीं है जिस पर मैं आ रहा हूँ।
00:11:35कोई एक समाधान मौजूद नहीं है।
00:11:39यह एक और काम है जो हमने पहले किया था।
00:11:41यह सब स्केलिंग से पहले की बात है।
00:11:43इंसानी वीडियो से सीखना।
00:11:44आप इंसान को काम करते देखते हैं, और फिर रोबोट उसकी नकल करता है।
00:11:47यहाँ भी बहुत विविधता है।
00:11:48आप YouTube वगैरह के वीडियो का इस्तेमाल कर सकते हैं।
00:11:50इसे बहुत आसानी से स्केल किया जा सकता है।
00:11:51लेकिन यह डेटा का एक बहुत ही कमजोर रूप है,
00:11:54क्योंकि यह रोबोट की वास्तविक कार्यप्रणाली से बहुत अलग है।
00:11:57तो यहाँ समाधान क्या है?
00:11:59जवाब यह है कि कोई एक उत्तम रास्ता नहीं है।
00:12:01आपको अलग-अलग विशेषताओं के संदर्भ में
00:12:05डेटा के बारे में सोचना होगा।
00:12:06और मेरी राय में, केवल तीन ही विशेषताएँ हैं
00:12:09जो रोबोटिक्स में मायने रखती हैं--
00:12:12स्केलेबिलिटी, विविधता, और आप रोबोट के
00:12:15जॉइंट एंगल्स के कितने करीब हैं।
00:12:18स्केलेबिलिटी का मतलब है, क्या मैं इसे अलग-अलग परिस्थितियों में तेजी से बढ़ा सकता हूँ?
00:12:22विविधता का मतलब है, क्या मुझे विविध डेटा मिल सकता है?
00:12:25क्योंकि सिर्फ़ 100 ट्रिलियन टोकन होना
00:12:27बिल्कुल बेकार है अगर वे सभी
00:12:29एक ही माहौल और एक ही परिस्थिति के हों।
00:12:32और रोबोट से निकटता का मतलब है, आप रोबोट के
00:12:35खुद के जॉइंट एंगल्स के सटीक डेटा से कितने दूर हैं?
00:12:38तो अगर आप सिमुलेशन को देखें, तो यह बेहद स्केलेबल है, कम विविध है,
00:12:42लेकिन रोबोट डेटा के काफी करीब है।
00:12:44इंसानी वीडियो बहुत स्केलेबल और विविध होते हैं,
00:12:46लेकिन रोबोट डेटा से बहुत दूर होते हैं।
00:12:47आपको इंसान की हरकतों को रोबोट पर मैप करना सीखना पड़ता है।
00:12:49ये बाकी दो, टेलि-ऑप और मैनिपुलेशन इंटरफेस,
00:12:52ये दोनों के बीच में आते हैं।
00:12:54और आप यहाँ देख सकते हैं, अभी दुनिया भर में,
00:12:57अगर आप अलग-अलग कंपनियों को देखें,
00:12:58तो वे सभी इनमें से किसी एक दृष्टिकोण पर ध्यान केंद्रित कर रही हैं।
00:13:01उनमें से ज़्यादातर टेलि-ऑप या Yumi सेटअप पर काम कर रहे हैं।
00:13:05बाकी चीज़ों पर बहुत कम लोग ध्यान दे रहे हैं।
00:13:07लेकिन कोई भी एक सही उत्तर नहीं है।
00:13:09उनमें से हर एक की अपनी कुछ कमियाँ हैं।
00:13:11लेकिन अच्छी बात यह है कि वे सब एक-दूसरे की कमियों को
00:13:15पूरा करती हैं।
00:13:16वे आपस में-- उनके नुकसान एक-दूसरे से पूरी तरह मेल नहीं खाते हैं।
00:13:19यह
00:13:20यही वह तरीका है जिस पर हम सालों के अनुभव के बाद पहुँचे हैं,
00:13:24और वह यह समझना है-- ट्रेनिंग को दो भागों में बाँटना,
00:13:27प्री-ट्रेनिंग और पोस्ट-ट्रेनिंग।
00:13:29लेकिन यह तो हैरान करने वाली बात है, है ना?
00:13:30लेकिन हम प्री-ट्रेन कैसे करते हैं?
00:13:31आप ऐसे डेटा का उपयोग करके प्री-ट्रेन करना चाहते हैं, जो
00:13:32बहुत बड़े पैमाने पर उपलब्ध और विविध हो, लेकिन शायद कम गुणवत्ता का हो।
00:13:35जैसे सिमुलेशन, इंसानों के वीडियो, वगैरह।
00:13:37तो इस तरह आप प्री-ट्रेन करते हैं।
00:13:39और फिर पोस्ट-ट्रेनिंग के लिए, आप टेली-ऑपरेशन से मिले डेटा का उपयोग करते हैं।
00:13:42अब, टेली-ऑपरेशन डेटा क्या है?
00:13:43यह बहुत उच्च गुणवत्ता का होता है, लेकिन मात्रा में कम होता है, ठीक है?
00:13:47उच्च गुणवत्ता, मात्रा में कम।
00:13:48यह हमें बिल्कुल लैंग्वेज मॉडल के तरीके की याद दिलाता है।
00:13:51आप इंटरनेट के डेटा पर प्री-ट्रेन करते हैं।
00:13:53फिर अपनी कंपनी या कोडिंग वगैरह के लिए पोस्ट-ट्रेन करते हैं।
00:13:59लेकिन रोबोटिक्स में एक और श्रेणी है,
00:14:00जो है डिप्लॉयमेंट डेटा।
00:14:02और डिप्लॉयमेंट डेटा बड़े पैमाने पर स्केलेबल होता है
00:14:05एक बार जब डिप्लॉयमेंट बढ़ जाता है।
00:14:07तो समय के साथ, यह डेटा बाकी सभी चीज़ों पर हावी हो जाएगा।
00:14:11और हम जो बनाने की कोशिश कर रहे हैं वह है
00:14:14जिसे हम डेटा फ्लाईव्हील कहते हैं, जो
00:14:16पोस्ट-ट्रेनिंग के समय से यह डेटा लेता है
00:14:18और वापस प्री-ट्रेनिंग में डाल देता है।
00:14:20और अब आप देख सकते हैं कि ओम्नी-बॉडी वाले ब्रेन का यह विचार
00:14:23बेहद महत्वपूर्ण क्यों है, क्योंकि इसकी
00:14:25संभावना बहुत कम है कि आपके पास केवल एक ही रोबोट हो, केवल एक ही
00:14:28वर्जन जो दुनिया भर के हर काम के लिए हमेशा के लिए डिप्लॉय किया गया हो।
00:14:32चिप्स को छोड़कर, हार्डवेयर के किसी भी क्षेत्र में ऐसा कभी नहीं होता,
00:14:36क्योंकि उन्हें बनाना बहुत मुश्किल होता है।
00:14:38और आप अभी भी देख सकते हैं, चिप्स में भी,
00:14:40आजकल कई कंपनियों के लिए
00:14:42इन्फरेंस चिप्स लगातार आ रहे हैं।
00:14:43तो हार्डवेयर में, ऐसा कभी नहीं होता।
00:14:45आपके पास रोबोट का केवल एक ही वर्जन, एक ही आकार हो,
00:14:48इसीलिए ओम्नी-बॉडी इंटेलिजेंस ही
00:14:50डिप्लॉयमेंट डेटा फ्लाईव्हील को संभव बनाती है।
00:14:56तो चलिए अब बहुत जल्दी कुछ नतीजों को देखते हैं।
00:14:58अब, यह ब्रेन बेहद सामान्य उद्देश्यों वाला है,
00:15:00इसलिए हम बहुत जल्दी कई तरह के काम कर सकते हैं।
00:15:03आपने कपड़े तय करने जैसे कई काम देखे होंगे,
00:15:06वगैरह।
00:15:07किसी वजह से यह सिलिकॉन वैली में बहुत लोकप्रिय काम है।
00:15:10और यहाँ तर्क यह है कि क्या आपने कभी
00:15:14टी-शर्ट तय करते समय सोचा है कि अगर मेरा हाथ
00:15:18एक सेंटीमीटर भी चूक गया, तो मेरी टी-शर्ट का मोड़ बिगड़ जाएगा?
00:15:22आप ऐसा नहीं सोचते।
00:15:23लोग तय करते समय सोचते भी नहीं हैं।
00:15:25वे बस कहीं भी पकड़ लेते हैं।
00:15:26आप बस कैसे भी कर देते हैं।
00:15:27तो गलती की गुंजाइश बहुत, बहुत ज़्यादा होती है।
00:15:31फिर यह काम कठिन क्यों है?
00:15:35कोई बता सकता है-- लोग यह मानने के छलावे में क्यों आ जाते हैं
00:15:38कि यह काम बहुत कठिन है?
00:15:39मैं इसे इस तरह रखता हूँ।
00:15:42कपड़ा, सही न?
00:15:43कपड़ा कठिन क्यों है?
00:15:46सिमुलेशन, लेकिन वैसे भी कोई सिमुलेशन का उपयोग नहीं कर रहा है।
00:15:48यह सब टेलीऑपरेशन से है।
00:15:49यह कठिन क्यों है?
00:15:51क्या आप जानते हैं कि यह कठिन क्यों है?
00:15:52क्योंकि यह रोबोटिक्स के पारंपरिक तरीकों के लिए कठिन है।
00:15:56पारंपरिक रूप से रोबोटिक्स में, लोग पूरे भौतिक नियमों का मॉडल बनाते थे,
00:15:59खुद से मॉडल तैयार करते थे, और फिर यह करते थे।
00:16:01उस तरीके के लिए यह बहुत कठिन है।
00:16:02लेकिन डीप लर्निंग पर आधारित रोबोटिक्स के लिए,
00:16:04यह संभव सबसे आसान काम है,
00:16:06क्योंकि इसमें गलती की गुंजाइश बहुत अधिक होती है।
00:16:08तो यह पूरी तरह से--
00:16:09अब, इतनी सारी कंपनियां इसी काम पर ध्यान दे रही हैं।
00:16:12अब, जो काम सच में कठिन है, वह है,
00:16:13मान लीजिए, इस काम की तरह।
00:16:17यदि मैं यह वीडियो देखने से पहले आपसे पूछूँ,
00:16:19क्या यह काम बिना हाथों के किया जा सकता है?
00:16:22तो बहुत संभव है कि आधे लोग कहेंगे नहीं,
00:16:24क्योंकि इसमें ज़रूरत होती है लगाने की--
00:16:25जैसे, आपमें से कितने लोगों के एयरपॉड्स खोए हैं?
00:16:29और हमारी कंपनी में एक चैनल है
00:16:30“राइट एयरपॉड” नाम से, क्योंकि लोग लगातार
00:16:32अपना दायां एयरपॉड खोते रहते हैं।
00:16:34अब, इस मामले में, रोबोट के पास हाथ नहीं हैं।
00:16:36उसके पास ग्रिपर हैं।
00:16:37तो यहाँ, यह काम ग्रिपर के लिए बहुत कठिन है।
00:16:41इसलिए इसमें उच्च स्तर की बुद्धिमत्ता की आवश्यकता होती है,
00:16:43क्योंकि आर्म को जाकर खुद की दिशा सही करनी पड़ती है
00:16:46ताकि एयरपॉड को सही तरीके से उठाया जा सके,
00:16:49ताकि उसे अंदर डाला जा सके, क्योंकि ग्रिपर्स केवल
00:16:52इस तरह बंद हो सकते हैं।
00:16:54वे समानांतर ग्रिपर हैं।
00:16:55तो आप बिल्कुल आखिरी पल में एयरपॉड को घुमा नहीं सकते।
00:16:59अब, जो आप यहाँ देख रहे हैं, ये असली एयरपॉड्स नहीं हैं।
00:17:02ये Temu के नकली वाले हैं, लगभग $5 या $10 के।
00:17:05तो इनके अंदर चुंबक नहीं है।
00:17:07इसलिए रोबोट को इसे ठीक से अंदर रखने के लिए बहुत मेहनत करनी पड़ती है,
00:17:11क्योंकि इसे आसानी से खींचने के लिए कोई चुंबक नहीं है।
00:17:13तो ये सब नकली हैं।
00:17:15यह वीडियो में दिखने से भी ज्यादा कठिन है।
00:17:17आप यह भी कर सकते हैं-- एक बार जब आप बैकएंड में सामान्य ब्रेन बना लेते हैं,
00:17:23तो आप टेलीऑपरेशन के समय बिना किसी विशेष फाइन-ट्यूनिंग डेटा के
00:17:26केवल इंसानों के विभिन्न वीडियो से भी
00:17:28सीख सकते हैं।
00:17:29तो इस स्थिति में, हमने क्या किया, हमने
00:17:31इंसानों के ऐसे वीडियो पर ट्रेनिंग दी, जैसे ईगोसेंट्रिक (स्वयं के नज़रिए वाले) वीडियो।
00:17:34हम अब इसे थर्ड-पर्सन (थर्ड-पार्टी) वीडियो में ट्रांसफर करने की कोशिश कर रहे हैं।
00:17:38और अगर थर्ड-पर्सन काम करता है, तो आप YouTube से भी सीख सकते हैं,
00:17:40किसी भी प्रकार के ओपन सोर्स डेटा से।
00:17:43तो इस मामले में, हम वीडियो देखते हैं,
00:17:45और फिर हम एक घंटे से भी कम समय का रोबोट डेटा जोड़ते हैं।
00:17:47तो बहुत ही तेज़ ट्रांसफॉर्मेशन।
00:17:50और फिर यह ह्यूमनॉइड रोबोट में ट्रांसफ़र हो सकता है।
00:17:53अब, इनके पास हाथ हैं।
00:17:54हाथ होने चाहिए या नहीं, यह एक बड़ी बहस का विषय है।
00:17:57लोग अक्सर हाथों का बहाना बनाते हैं कि रोबोटिक्स अभी तक
00:18:00सफल क्यों नहीं हुआ, लेकिन बात यह नहीं है।
00:18:02मुख्य बात हमेशा बैकएंड में काम कर रही बुद्धिमत्ता ही होती है।
00:18:07हम अभी हाथों का उपयोग डिप्लॉयमेंट में नहीं कर रहे हैं, क्योंकि ऐसा कोई हाथ
00:18:09उपलब्ध ही नहीं है जिसे फैक्ट्रियों में डिप्लॉय किया जा सके।
00:18:12वे सभी 100 घंटों के भीतर टूट जाते हैं।
00:18:14चाहे कोई भी चुन लें।
00:18:17अगर आपके पास कोई बेहतर हाथ है, तो मैं टेस्टिंग के लिए
00:18:19जल्द से जल्द 10 यूनिट खरीदना चाहूँगा।
00:18:22तो यह मजबूत और टिकाऊ परिदृश्यों की बात है।
00:18:25अब, विचार यह है कि आप इंसानों को देखकर कई काम कर सकते हैं।
00:18:28और हम जो बहुत कम डेटा के साथ काम कर पाते हैं, जो कि
00:18:31रोबोट के एक घंटे से भी कम समय का डेटा है,
00:18:33उसका कारण यह है कि रोबोट अपने दिमाग में चीज़ों की कल्पना करता है
00:18:36और कई स्थितियों के लिए अपनी सीख को बढ़ाने की कोशिश करता है।
00:18:39यहाँ जो आप देख रहे हैं वह पूरी तरह से एक काल्पनिक वीडियो है।
00:18:42आप इसे रोबोट का सपना कह सकते हैं।
00:18:43तो यह रोबोट के अपने मॉडल के अंदर है,
00:18:45जहाँ वह स्थितियों की कल्पना कर सकता है।
00:18:48तो यह कोई असली डेटा नहीं है।
00:18:49यह सब रोबोट के अपने मॉडल द्वारा बनाया गया काल्पनिक डेटा है।
00:18:52आप इसे और अधिक जटिल कामों में ट्रांसफर कर सकते हैं
00:18:56और इससे भी कम लागत वाले हार्डवेयर पर भी लागू कर सकते हैं।
00:18:57तो यह अंडा बनाने, यानी ऑमलेट बनाने का काम है।
00:19:02अब यहाँ, इस पूरे सेटअप की कीमत लगभग $4,000 है।
00:19:06तो जो आप बाहर देखते हैं उसकी तुलना में यह बेहद सस्ते आर्म्स हैं।
00:19:11और अगर आप ध्यान दें, तो यह सेटअप इतना सस्ता है
00:19:15कि इसमें कोई सेंसर भी नहीं हैं।
00:19:16तो यहाँ एकमात्र सेंसर सिर्फ एक कैमरा है, कोई फ़ोर्स सेंसर नहीं, कुछ भी नहीं।
00:19:20और रोबोट केवल देखकर (विज़न से) बल लगाने वाले काम कर सकता है।
00:19:25अब, मैं यह नहीं कह रहा कि भविष्य ऐसा ही है।
00:19:26जैसे कि आपको ऐसा नहीं करना चाहिए।
00:19:27मुझे यकीन है कि सेंसर में सुधार होगा।
00:19:29लेकिन मौजूदा सेंसर्स के साथ हम केवल
00:19:33बुद्धिमत्ता के दृष्टिकोण से जहाँ पहुँच सकते हैं,
00:19:36उससे हम अभी बहुत पीछे हैं।
00:19:38तो यह सिलसिला चलता रह सकता है।
00:19:39ये बर्कले से मेरे एडवाइजर हैं।
00:19:41उन्हें विश्वास नहीं था कि रोबोट ऐसा कर सकते हैं।
00:19:43वह लगभग एक घंटे तक वहीं खड़े रहे।
00:19:45और रोबोट लगातार ऑमलेट बनाता रहा।
00:19:48और दिलचस्प बात यह है कि यह
00:19:49पूरी तरह से एंड-टू-एंड सिस्टम है।
00:19:51इसमें कोई स्टेट मशीन नहीं है, कुछ भी नहीं।
00:19:53तो रोबोट के अंडा बनाने का कारण यह है,
00:19:55क्योंकि सामने एक खाली प्लेट रखी है।
00:19:56मुझे नहीं पता कि यह ब्लिंक क्यों कर रहा है।
00:19:58वीडियो में कोई कट नहीं है।
00:20:00मैं आपको इस बात का यकीन दिलाता हूँ।
00:20:01यह HDMI की समस्या है।
00:20:02तो जैसे ही आप प्लेट हटाते हैं--
00:20:06माफ़ कीजिएगा, मुझे नहीं पता ऐसा क्यों हुआ।
00:20:08हाँ, तो इसमें कोई स्टेट मशीन नहीं है।
00:20:10रोबोट कब शुरू होता है, कब बंद होता है,
00:20:11यह सब स्वचालित है।
00:20:12और यह रुकावटों के प्रति भी बहुत मजबूत है।
00:20:14आप आसपास की चीज़ें बदल सकते हैं।
00:20:16आप जोड़ सकते हैं-- यह सब पहले न देखी गई चीज़ें हैं।
00:20:20सिर्फ़ पैन और गैस स्टोव वही पुराना है।
00:20:22बाकी सब कुछ अलग है।
00:20:23और रोबोट लगातार काम कर सकता है।
00:20:25तो आपको बेसिक मजबूती मिल जाती है।
00:20:27इसे 10 घंटे से भी कम डेटा के साथ ट्रेन किया गया है।
00:20:30तो इतनी मजबूती सीखने के लिए यह बहुत कम डेटा है।
00:20:33और यह बैकग्राउंड में काम कर रहे बेस मॉडल से आ रहा है।
00:20:37समय की कमी के कारण मैं इसे छोड़ रहा हूँ।
00:20:39पारंपरिक रोबोटिक्स पाइपलाइनों के विपरीत,
00:20:42जहाँ प्लानिंग, मैपिंग वगैरह होती है,
00:20:44यह एक एंड-टू-एंड दिमाग है।
00:20:46अब, 'एंड-टू-एंड' AI के कई क्षेत्रों में बहुत ज़्यादा इस्तेमाल होने वाला शब्द है।
00:20:50लेकिन जब मैं एंड-टू-एंड कहता हूँ, तो मेरा मतलब वाकई एंड-टू-एंड ही होता है।
00:20:53यह सीधे कैमरों से इनपुट लेता है।
00:20:55यह सीधे मोटरों को पॉवर देता है।
00:20:59तो हम बीच में कुछ भी इस्तेमाल नहीं करते, सिवाय एक PID के,
00:21:02बिलकुल अंत में, 100 से 500 हर्ट्ज़ तक जाने के लिए।
00:21:04लेकिन PID रोबोटिक्स का योगदान नहीं है।
00:21:06यह उससे पहले का है।
00:21:07यह द्वितीय विश्व युद्ध या उसके आसपास का है।
00:21:10अब, दिलचस्प बात यह है कि हमारे लिए विज़न
00:21:13बस एक और इनपुट की तरह है।
00:21:15तो इसमें कुछ भी उतना अजीब नहीं है।
00:21:17तो अगर आपने देखा हो-- आपने बहुत सारे नतीजे देखे होंगे
00:21:20रोबोट्स को डांस करते, कराटे, कुंग फू, बैकफ्लिप करते हुए।
00:21:23पीछे जाकर सोचिए, आपने ऐसे कितने नतीजे
00:21:27देखे हैं जहाँ रोबोट सीढ़ियाँ चढ़-उतर रहे हों?
00:21:30बहुत ही कम।
00:21:31ह्यूमनॉइड क्षेत्र की शीर्ष कंपनियों ने भी,
00:21:34बस औपचारिकता पूरी करने के लिए एक सैंपल सीढ़ी से ज़्यादा
00:21:37कुछ नहीं दिखाया है।
00:21:39और लोग बातें करते हैं कि ह्यूमनॉइड्स आ रहे हैं, चीन बनाम अमेरिका।
00:21:42यह सब एक तरह से बकवास है।
00:21:44अगर ह्यूमनॉइड्स सीढ़ियाँ नहीं चढ़ सकते,
00:21:47तो पैर होने का क्या फायदा?
00:21:50पैर होने की एकमात्र वजह यही है।
00:21:51अब, यह असल में मोरावेक का विरोधाभास (Moravec's paradox) काम कर रहा है।
00:21:55बाईं तरफ वाला काम रोबोट के लिए बहुत आसान है।
00:21:58बैकफ्लिप करना, डांस करना, रोबोट के लिए कहीं आसान है।
00:22:01और आप सोच सकते हैं कि यह विरोधाभास क्यों मौजूद है?
00:22:04एक स्तर और गहराई से सोचिए।
00:22:05जब कोई रोबोट बैकफ्लिप कर रहा होता है, तो उसे
00:22:09सिर्फ़ अपने शरीर के बारे में जानना होता है, और किसी चीज़ के बारे में नहीं।
00:22:13सही कहा न?
00:22:13तो यह-- और जब सब कुछ ज्ञात या पूरी तरह से देखा गया हो,
00:22:17कंप्यूटर उसी काम में अच्छे होते हैं।
00:22:20क्योंकि वे हर संभव स्थिति का सिमुलेशन कर सकते हैं।
00:22:25लेकिन दाहिनी तरफ वाला काम, सीढ़ियों पर बस चढ़ना भी,
00:22:27इसके लिए सबसे पहले सीढ़ियों को देखना ज़रूरी है।
00:22:30या उसकी ऊँचाई और चौड़ाई क्या है।
00:22:32आप ऊँचाई और चौड़ाई को सटीक रूप से नहीं नापते,
00:22:34लेकिन आप सभी रुकावटों के हिसाब से तालमेल बिठाते हैं।
00:22:35और उसके लिए विज़न की ज़रूरत होती है।
00:22:36तो दाहिने वाले काम के लिए समझ की ज़रूरत होती है।
00:22:38और इसीलिए यह मुश्किल है, और आपको ऐसा कुछ देखने को नहीं मिलता।
00:22:40लेकिन हमारे लिए, यह बस एक और नतीजा है।
00:22:42इससे कोई फ़र्क नहीं पड़ता।
00:22:43तो हम-- हमने यह नतीजा डेढ़ साल पहले जारी किया था।
00:22:46हमने इसे ढाई साल पहले शूट किया था।
00:22:48लेकिन यह रोबोट किसी भी स्थिति में जा सकता है।
00:22:52यह चीज़ों से टकराकर गिरता नहीं है।
00:22:53यह जानबूझकर चीज़ों के ऊपर से पैर रखता है।
00:22:55और इसमें कोई मैपिंग या प्लानिंग नहीं है।
00:22:56यह आसपास का कोई 3D मैप नहीं बनाता।
00:22:59यह सब धड़ (torso) पर लगे कैमरे से काम कर रहा है।
00:23:02और आप इसे किसी भी तरह के सेटअप, किसी भी तरह की सीढ़ियों पर रख सकते हैं।
00:23:05मैं यहाँ थोड़ा तेज़ी से आगे बढ़ रहा हूँ।
00:23:07ये, आप जानते हैं, आपातकालीन फायर-एस्केप सीढ़ियाँ हैं।
00:23:11यह थोड़ा अजीब है।
00:23:12फायर-एस्केप सीढ़ियों का इस्तेमाल आपात स्थिति में आग लगने पर किया जाता है।
00:23:15और वे हर इमारत में सबसे कठिन होती हैं।
00:23:17तो हम उन सभी सेटअप्स में टेस्टिंग कर रहे हैं।
00:23:20लेकिन आप इसे किसी भी तरह से रख सकते हैं।
00:23:21आप इसे सीढ़ियों पर डिस्टर्ब कर सकते हैं।
00:23:22इससे वाकई कोई फ़र्क नहीं पड़ता।
00:23:23यह इंसान से भी बढ़कर क्षमता है।
00:23:25क्योंकि रोबोट यह नहीं देख सकता कि उसे खींचा जा रहा है।
00:23:27तो रोबोट के लिए यह एक सरप्राइज़ फैक्टर है
00:23:29कि चढ़ते समय आप उसे खींच रहे हैं।
00:23:31और फिर से, इन सभी परिस्थितियों में
00:23:33हर जगह एक ही मॉडल है।
00:23:35तो यह बहुत आसान है।
00:23:36हालाँकि आसान है, पारकोर (parkour) देखने में मज़ेदार ज़रूर लगता है।
00:23:40और लोगों को अक्सर लगता है कि, यह तो,
00:23:45रोबोट यह सब कर सकते हैं।
00:23:47लेकिन यह उससे बहुत आसान है जो मैंने पहले दिखाया था।
00:23:51और अगर आप अभी इन वीडियो को देखें,
00:23:53तो आपमें से कई लोगों को यह ज़्यादा प्रभावशाली लगेगा,
00:23:55भले ही मैं आपको बता रहा हूँ कि यह आसान है।
00:23:57इसे ट्रेन करने में आधा घंटा लगता है,
00:23:59जबकि पिछले वाले में बहुत ज़्यादा समय लगता है और ट्रेन करना
00:24:01काफ़ी कठिन है।
00:24:03तो आप इस बेस मॉडल को ले सकते हैं, और इसे बहुत तेज़ी से
00:24:06कई तरह के कामों में ट्रांसफर कर सकते हैं।
00:24:08तो यहाँ, यह बहुत पुराना नतीजा है
00:24:09लगभग डेढ़ साल पहले का।
00:24:11LAN केबल लगाने वगैरह के लिए,
00:24:13अब हमारे पास बहुत एडवांस्ड सिस्टम हैं।
00:24:14लेकिन हम इन मॉडलों को पहले से ही तैनात कर रहे हैं
00:24:17कई तरह के एप्लिकेशन्स में।
00:24:18उदाहरण के लिए, क्योंकि एक डेटा फ्लाईव्हील बनाने में,
00:24:21सबसे कठिन हिस्सा खुद डिप्लॉयमेंट ही है।
00:24:24इंटेलिजेंस और हार्डवेयर के अलावा भी कई मुद्दे हैं
00:24:26जो रोबोटिक्स को डिप्लॉय करते समय सामने आते हैं।
00:24:30यह किसी ऐप पर ChatGPT डिप्लॉय करने जैसा नहीं है।
00:24:34क्योंकि आपको कई चीज़ों के साथ तालमेल बिठाना पड़ता है--
00:24:36और मुझे लगता है कि Skydio ने इससे पहले एक टॉक दी थी,
00:24:38और वे डिप्लॉयमेंट की कठिनाइयों के बारे में
00:24:40आपसे दिन भर बात कर सकते हैं।
00:24:42तो हमें अभी डिप्लॉयमेंट शुरू करना होगा,
00:24:44ताकि निकट भविष्य में हमारे पास यह डेटा फ्लाईव्हील हो सके।
00:24:47और मैं आपको हमारे द्वारा किए जा रहे डिप्लॉयमेंट के कुछ उदाहरण देता हूँ।
00:24:49तो NVIDIA के साथ एक उदाहरण--
00:24:51जैसे NVIDIA ह्यूस्टन में अपनी पहली फैक्ट्री खोल रहा है।
00:24:54और उनके GPUs, जिनका इस्तेमाल आप अभी करते हैं,
00:24:56वे सभी अमेरिका से बाहर और मुख्य रूप से ताइवान में बनते हैं।
00:24:59और वहाँ यह सब मैन्युअली किया जाता है।
00:25:01और इंसान इन चीज़ों को बनाने में वास्तव में कुशल
00:25:04और बहुत-बहुत अच्छे हैं।
00:25:05लेकिन यहाँ अमेरिका में लागत, स्केलेबिलिटी और थ्रूपुट को बनाए रखना,
00:25:08इस कार्यबल के बिना
00:25:10संभालना बहुत मुश्किल है।
00:25:11तो यहाँ, हम उनके लिए इस GPU असेंबली को स्वचालित कर रहे हैं।
00:25:15यह-- हमने NVIDIA GTC में एक लाइव डेमो दिया था।
00:25:19इसे पिछले हफ्ते ही फैक्ट्री में डिप्लॉय कर दिया गया है,
00:25:21तो यह पहले से ही लाइव है।
00:25:22लेकिन जिस दिलचस्प बात को मैं हाईलाइट करना चाहता हूँ--
00:25:25यह एक बहुत ही पारंपरिक फैक्ट्री का काम है।
00:25:29लेकिन अगर आप पूरे सेटअप को देखें,
00:25:32तो यह बेहद अनिश्चित और शोर-शराबे वाला है।
00:25:36और अगर आप किसी भी पारंपरिक फैक्ट्री सेटअप में जाएँ,
00:25:38तो वे बेहद साफ़-सुथरे होते हैं।
00:25:39तो यहाँ, रोबोट का वही दिमाग,
00:25:42न केवल बेहद सटीक काम कर सकता है,
00:25:44बल्कि किसी भी तरह की रुकावट के प्रति बहुत मजबूत हो सकता है, जिसका
00:25:46मतलब है कि अब इन रोबोटों को किसी पिंजरे में रखने की ज़रूरत नहीं है।
00:25:50और उन्हें इन फैक्ट्री लाइनों पर जैसे हैं वैसे ही डिप्लॉय किया जा सकता है
00:25:54बिना किसी फैक्ट्री लाइन में बदलाव किए।
00:25:56इंसानों के साथ, और जहाँ भी इंसान होते हैं, वहाँ अव्यवस्था होती ही है।
00:26:00ठीक है?
00:26:00आप उसी दिमाग का इस्तेमाल डिलीवरी एप्लिकेशन्स के लिए कर सकते हैं।
00:26:02तो यहाँ, रोबोट ट्रक से दरवाजे तक डिलीवरी करता है।
00:26:06इसे यह खोजना होता है कि मुख्य दरवाजा कहाँ है।
00:26:08तो यह सामान्य समझ (कॉमन सेंस) की समस्या है।
00:26:09यह गतिशीलता (मोबिलिटी) की समस्या नहीं है।
00:26:10और हम पहले से ही पैकेज डिलीवर कर रहे हैं,
00:26:12कई साझेदारों के साथ पर्दे के पीछे काम करते हुए,
00:26:15इन इलाकों में घरों के मुख्य दरवाजे तक
00:26:17पैकेज पहुँचाने का काम कर रहे हैं।
00:26:19यही सेटअप गोदामों और इन सभी जगहों पर भी काम करता है।
00:26:23अब, बात समाप्त करने के लिए,
00:26:26मैंने ज़िक्र किया था कि यह एक ओम्नीबॉडिएट मस्तिष्क है।
00:26:29और मुझे उम्मीद है कि यह बात बिल्कुल स्पष्ट है
00:26:31कि डेटा फ्लाईव्हील बनाने के लिए ओम्नीबॉडिएट मस्तिष्क क्यों बेहद ज़रूरी है।
00:26:34लेकिन इसका एक और फ़ायदा है।
00:26:35और फ़ायदा यह है कि समय के साथ आपके रोबोट टूट-फूट सकते हैं
00:26:38और सुरक्षा परिदृश्यों में भी।
00:26:41और सुरक्षा इस ओम्नीबॉडिएट मस्तिष्क का ही एक उप-उत्पाद (बायप्रॉडक्ट) है।
00:26:44क्योंकि अगर आपके पास एक--
00:26:45हम रख सकते हैं-- मैं बस तेज़ी से आगे बढ़ा रहा हूँ।
00:26:47आप इसे ऑनलाइन देख सकते हैं।
00:26:48यह सब ऑनलाइन उपलब्ध है।
00:26:49लेकिन हम इस एक ही मस्तिष्क को इन सभी प्रणालियों,
00:26:52इनमें से हर एक रोबोट में डाल सकते हैं।
00:26:55और इस मामले में, हमने इन रोबोटों पर प्रशिक्षण भी नहीं दिया था।
00:26:58यह पूरी तरह से ज़ीरो-शॉट ट्रांसफ़र है
00:27:00इन सभी ह्यूमनॉइड्स और इन तमाम चीज़ों के लिए।
00:27:02और अगर रोबोट टूट भी जाता है, जैसे यहाँ पैर टूट जाता है,
00:27:05तो यह कुछ ही मिलीसेकंड में खुद को संभाल लेता है।
00:27:07क्योंकि जब आपका पैर टूटता है, तो आपका तीन पैरों वाला रोबोट
00:27:10एक नया रोबोट बन जाता है।
00:27:12इसलिए इससे कोई फ़र्क नहीं पड़ता कि रोबोट का आकार क्या है।
00:27:14कुछ भी बदलने पर, यहाँ हम रोबोट के पैरों को निष्क्रिय कर देते हैं।
00:27:17यह महज़ तीन प्रयासों में दो पैरों पर चलना सीख जाता है।
00:27:21तो स्क्रीन पर जो आप देख रहे हैं, वह रोबोट की पूरी ट्रेनिंग है
00:27:24जो इन प्रणालियों में हो रही है।
00:27:27तो यह कुछ मिलीसेकंड से लेकर 30 सेकंड के भीतर ढल जाता है।
00:27:32और जैसे यहाँ एक उदाहरण है, यह पहियों पर चल रहा है।
00:27:34आप पहिए को जाम कर देते हैं।
00:27:36यह पैदल चलने लगता है।
00:27:37यह ओम्नीबॉडिएट मस्तिष्क का एक और फ़ायदा है।
00:27:40इस तरह के मॉडल के साथ सुरक्षा के मायने बिल्कुल बदल जाते हैं,
00:27:45जब रोबोट उड़ सकता है--
00:27:46या माफ कीजिए, जब रोबोट चल सकते हैं या काम कर सकते हैं
00:27:49सिर्फ़ आधे शरीर के साथ।
00:27:50मैंने इसमें से कुछ वीभत्स दृश्य हटा दिए हैं,
00:27:52लेकिन हमने रोबोट को दो हिस्सों में भी काटा।
00:27:54यह फिर भी दोनों हिस्सों के साथ अलग-अलग काम कर सकता है।
00:27:57लेकिन उसके लिए आप YouTube पर जा सकते हैं।
00:27:59और मेरी तरफ़ से बस इतना ही।
00:28:00धन्यवाद।

Description

Show a robotics demo from 1957 next to one from today, and most people can't tell which is which. Deepak Pathak, co-founder and CEO of Skild AI and a professor at Carnegie Mellon, argues robotics stalled because it was treated as a hardware problem rather than a problem of building a general brain. Collecting robot data by teleoperation at one example a minute, he calculates, would take the entire US population more than a century to reach GPT-3 scale. Skild's answer is an "omni-bodied" brain: one model for any robot and any task. It's pre-trained on scalable data like simulation and human video, post-trained on teleoperation, and improved by a deployment flywheel. Pathak shows it inserting AirPods with a simple gripper, learning from human video with under an hour of robot data, and cooking omelets on $4,000 arms with only a camera. He explains why climbing stairs is harder than a backflip. He also shows GPU assembly for NVIDIA's Houston factory, and a robot learning to walk on two legs in three tries after its other legs are disabled. Speaker info: X/Twitter: @pathak2206 (https://x.com/pathak2206) LinkedIn: https://www.linkedin.com/in/pathak22 Website: https://www.cs.cmu.edu/~dpathak Related links: Skild AI: https://www.skild.ai Timestamps: 0:00 AI's progress and the robotics hype 1:02 Robotics has been "almost here" for 70 years 1:27 A 1960s block-copying robot 2:17 Teleoperation in 1957 3:57 Why robotics is stuck: the missing general brain 4:27 Moravec's paradox 5:42 There's no internet of robot data 7:22 Skild's thesis: one brain, any robot, any task 8:22 Teaser: many robots, one brain 9:31 How to scale robot data: a career retrospective 12:01 The three properties of robot data that matter 13:21 Pre-training, post-training and the deployment flywheel 14:56 Why laundry folding is actually easy 16:17 The AirPods task 17:21 Learning from human videos 18:36 The robot's "dream": imagined training data 18:56 Cooking omelets on $4,000 arms 20:41 Truly end-to-end: camera in, motor power out 21:21 Why stairs are harder than backflips 24:50 Deployment: GPU assembly for NVIDIA 26:00 Package delivery to the front door 26:25 Safety: adapting when the robot breaks

Community Posts

No posts yet. Be the first to write about this video!

Write about this video