VLM/VLA से embodied AI एजेंट्स तक — आर्मेन अघाजानयान, Perceptron AI

AAI Engineer
Computing/Software

Transcript

00:00:00हाँ, मुझे लगता है कि अब शुरू करते हैं। मैं आर्मिन हूँ। मैं Perceptron का सह-संस्थापक और CEO हूँ।
00:00:20हम क्या करते हैं, इस पर थोड़ी बात करेंगे, लेकिन मुख्य रूप से मैं आज जिस बारे में बात करना चाहता हूँ,
00:00:25वह हमारा रिसर्च दृष्टिकोण है कि हम VLMs, VLAs,
00:00:32वर्ल्ड मॉडल्स, या आप इसे जो भी कहें, उनके बीच के अंतर से आगे बढ़कर कुछ ऐसा बनाएँ जिसे हम एम्बॉडीड फ़ाउंडेशन मॉडल्स कहते हैं।
00:00:42तो Perceptron में हम जो करते हैं, हमारा मुख्य लक्ष्य यह है कि हम
00:00:48ऐसे फ़िजिकल AI फ़ाउंडेशन बना सकें जो हमें वास्तविक समय में भौतिक दुनिया को समझने,
00:00:53महसूस करने और उससे इंटरैक्ट करने की क्षमता दें। इसलिए हमारा मुख्य मिशन वास्तव में
00:00:58भौतिक और डिजिटल दुनिया को जोड़ना है। मूल रूप से इसका मतलब है कि हमारा लक्ष्य है जहाँ भी कोई डिवाइस,
00:01:07उपकरण, रोबोट, कैमरा या सेंसर हो, हम वहाँ उसे इंटेलिजेंस प्रदान करें।
00:01:14और विशेष रूप से जब हम महसूस करने, तर्क करने,
00:01:19और कार्रवाई करने के इस मॉडल की बात करते हैं, तो हम इसे पारंपरिक मल्टीमॉडल मॉडलिंग के एकीकरण के रूप में देखते हैं।
00:01:25मैं FAIR से आया हूँ। मैं वहाँ छह साल तक था और वहाँ मेरा लक्ष्य यह पता लगाना था कि
00:01:31मल्टीमॉडल मॉडल्स के तरीकों को कैसे स्केल किया जाए। और हमने जिन शुरुआती चीज़ों पर काम करना शुरू किया था,
00:01:37और इस क्षेत्र में काफ़ी पब्लिश भी किया, वह अर्ली फ़्यूज़न के बारे में था। यानी यह अवधारणा कि आप इन सभी
00:01:41मोडैलिटीज़ को जितनी जल्दी हो सके एक साथ लाएँ। और असली जटिलता यह पता लगाने में है कि
00:01:47इन सभी अलग-अलग मोडैलिटीज़ को इनपुट और आउटपुट दोनों पर सही तरीके से कैसे दर्शाया जाए
00:01:52="ताकि उन्हें समग्र रूप से पेश किया जा सके। इसलिए VLMs एक तरह से मानक बन गए हैं,"
00:01:58जब मैं मल्टीमॉडल मॉडल्स की बात करता हूँ, तो आप शायद VLMs के बारे में ही सोचते होंगे। यह
00:02:03इमेज, वीडियो और टेक्स्ट को इनपुट के रूप में लेने और मूल रूप से कुछ टेक्स्ट आउटपुट करने की क्षमता है। और इसके कई रूप हैं।
00:02:09ER मॉडल्स जैसे मॉडल हैं, एम्बॉडीड रीज़निंग मॉडल्स, जो शायद कुछ
00:02:15ग्राउंडिंग पॉइंट्स दे सकते हैं, जो स्थानिक समझ या तर्क को थोड़ा बेहतर तरीके से कर सकते हैं।
00:02:20फिर हमारे पास VLAs जैसी चीज़ें हैं जो केवल टेक्स्ट के बजाय
00:02:25एक्शन्स को भी आउटपुट डोमेन में शामिल करती हैं। और ये पारंपरिक रूप से स्टैंडर्ड VLM बैकबोन्स पर ही बनाए जाते रहे हैं,
00:02:30हालाँकि इस दिशा में कुछ प्रयास हुए हैं कि
00:02:35VLMs से हटकर वर्ल्ड मॉडल्स या वर्ल्ड एक्शन मॉडल्स जैसी चीज़ों की ओर बढ़ा जाए, भले ही अभी तक कुछ बहुत ज्यादा
00:02:39सफल न रहा हो। और फिर हम मल्टीमॉडल मॉडल्स के अधिक दिलचस्प और जटिल रूपों में आते हैं,
00:02:46जैसे कि वर्ल्ड मॉडल्स, जहाँ आप अनिवार्य रूप से कुछ इनपुट्स से वीडियो आउटपुट करते हैं, और इनपुट्स
00:02:51या तो इमेज या वीडियो हो सकते हैं, या फिर इमेज, वीडियो और एक्शन्स। और आख़िरी बात जो मैं कहूँगा
00:02:57वह एक हालिया चीज़ है, जिसे हम सिमेंटिक वर्ल्ड मॉडल्स कहते हैं, जहाँ आप वास्तव में कुछ भी आउटपुट नहीं करते,
00:03:02लेकिन आप एक ऐसा रिप्रजेंटेशन सीखते हैं जो आपको लगता है कि भविष्य में उपयोगी होगा। हम जिसे
00:03:08एम्बॉडीड फ़ाउंडेशन मॉडल के रूप में देखते हैं, वह वास्तव में एक ऐसा ढांचा है जो आपको स्टैंडर्ड
00:03:13पर्सेप्शन, एम्बॉडीड रीज़निंग, और फिर कंट्रोल के मुख्य लक्ष्य को एक ही मॉडल के भीतर करने की अनुमति देता है।
00:03:20यानी इनपुट पर विभिन्न प्रकार की मोडैलिटीज़ में तर्क करने में सक्षम होना और आउटपुट पर
00:03:25मेरे द्वारा बताई गई अधिकांश चीज़ों को एक ही एकीकृत मॉडल के भीतर करना।
00:03:31तो बहुत जल्दी, मैं दो चुनौतियों के बारे में बात करने जा रहा हूँ, और ये मूलभूत
00:03:35रिसर्च चुनौतियाँ हैं जिनका हम सामना करते हैं, और मैं बात करूँगा कि हमारी कंपनी ने इस पर क्या रुख अपनाया है,
00:03:40और यहाँ अन्य लोग क्या कर रहे हैं।
00:03:43तो सबसे पहली बात यह है कि सोचिए यदि आप केवल वीडियो जैसी किसी चीज़ को मॉडल करने की कोशिश कर रहे हैं,
00:03:48जैसे एक घंटे का वीडियो। रिप्रजेंटेशन के आधार पर, आपके पास लगभग
00:03:52दस लाख विजुअल टोकन्स आ सकते हैं। सच तो यह है कि वास्तव में ऐसा कोई ग्राउंड ट्रुथ नहीं है
00:03:57जिसे आप प्रभावी ढंग से उपयोग कर सकें, सही? तो आप ऐसी चीज़ें कर सकते हैं, और लोगों ने बेशक ऐसा किया भी है,
00:04:02जैसे ट्रांसक्रिप्ट्स निकालना, वीडियो से ट्रांसक्रिप्ट्स की भविष्यवाणी करना, या शायद सिंथेटिक रूप से
00:04:08कुछ फ्रेम्स को लेबल करना, कुछ सवाल पूछना। और यह पता चलता है कि यह एक तरह से बहुत बड़ी बर्बादी है,
00:04:13है न? तो अगर आप सोचें कि आपके मॉडल में क्या जा रहा है, तो आपके पास दस लाख टोकन जा रहे हैं,
00:04:16और आप अनिवार्य रूप से अंदर जाने वाले सभी टोकनों में से लगभग 0.2 प्रतिशत पर ही
00:04:22लॉस की गणना कर रहे हैं। और इसलिए यह मौलिक रूप से बहुत समस्याग्रस्‍त है। और सच तो यह है कि इसे ठीक करने के लिए
00:04:27आप जो भी तरीका अपनाएँ, आप वास्तव में एक गलत ट्रेनिंग सिग्नल डाल रहे होते हैं।
00:04:31या तो सिग्नल बहुत विरल है, बहुत सिंथेटिक है, या बहुत ही अंधाधुंध है। इसलिए केवल
00:04:37सिंथेटिक एनरिचमेंट से परे के दृष्टिकोण रहे हैं, "चलिए हर एक पिक्सेल की भविष्यवाणी करते हैं।" माना कि
00:04:42यह एक बहुत ही सघन सिग्नल है, लेकिन यह वास्तव में अटेंशन को बहुत खराब तरीके से बाँटता है। इसमें,
00:04:47आप तुलना कर रहे हैं, आप बैकग्राउंड के पिक्सेल को भी उतना ही महत्व दे रहे हैं जितना कि
00:04:51किसी ग्रिप या टिप, संपर्क बिंदुओं, विशिष्ट विफलताओं या भौतिकी को दे रहे हैं।
00:04:56और इसलिए Perceptron में हम जो करते हैं, और यह हमारी मुख्य IP का हिस्सा है,
00:05:01हम यह सोचते हैं कि एक स्वाभाविक पर्सेप्टिव ऑब्जेक्टिव कैसा दिखता है? विशेष रूप से, मैं उन अवधारणाओं
00:05:06की भविष्यवाणी कैसे कर सकता हूँ जो हमें लगता है कि भविष्य में बहुत ही स्वचालित तरीके से काम आएँगी? उदाहरण के तौर पर,
00:05:11आप कुछ ऐसा हार्ड कोड कर सकते हैं कि अगर आपके पास एक रोबोटिक आर्म है, तो ग्रिपर की नोक
00:05:16एक बहुत ही उपयोगी पर्सेप्ट साबित होती है जिसकी आप भविष्य के लिए भविष्यवाणी कर सकते हैं। और लोगों ने ऐसा करना
00:05:20शुरू कर दिया है। जैसे AI2 के MOMO Act वाले लोगों ने यह किया है। अन्य VLAs हैं जिन्होंने
00:05:26यह किया है। लेकिन यह अभी भी एक हार्ड-कोडेड पर्सेप्ट है। तो सवाल यह है कि क्या आप एक ऐसा स्वचालित तरीका
00:05:30खोज सकते हैं कि मॉडल सिमेंटिक रूप से इस अनोखे ऑब्जेक्टिव को सीख सके? और सच यह है कि हमने
00:05:37एक तरीका खोज लिया है। हम यहाँ यह साझा नहीं करने जा रहे हैं कि हम इसे कैसे करते हैं, लेकिन यह सिर्फ़ एक इशारा है कि
00:05:41हम स्पासिटी (विरलता) की समस्या को कैसे हल करते हैं। दूसरी मुख्य समस्या जिस पर हम बहुत समय बिताते हैं
00:05:49वह है कॉन्टेक्स्ट ब्लोट। तो अगर आपके पास हमेशा चालू रहने वाले कैमरे हैं, अगर आपके पास ऐसे रोबोट हैं जो रुकते नहीं हैं,
00:05:54वे ठहरते नहीं हैं, तो अनिवार्य रूप से आपको टोकनों की एक बहुत ही लंबी श्रृंखला पर विचार करना होता है। और इसलिए
00:06:01टेक्स्ट अपेक्षाकृत सघन होता है और वीडियो अपेक्षाकृत विरल। तो सवाल यह है कि क्या ऐसी आर्किटेक्चरल
00:06:08सफलताएँ मौजूद हैं ताकि आप इस समस्या से सीधे निपट सकें, न कि केवल
00:06:13किसी कृत्रिम स्तर पर इस असंतुलन को ठीक करने की कोशिश करें?
00:06:20और इसलिए ऐसी कई चीज़ें हैं जो आप कर सकते हैं। एक पहला बुनियादी सिद्धांत यह है कि आपको
00:06:25अलग-अलग मोडैलिटीज़ को पूरी तरह से अलग मानकर ट्रेन करना शुरू करना होगा। आप टेक्स्ट टोकन्स को
00:06:31इमेज टोकन्स या ऑडियो/वीडियो टोकन्स के समान नहीं मान सकते। तो एक चीज़ जो आप कर सकते हैं
00:06:36वह है स्पेशियल कम्प्रेशन या टोकन कम्प्रेशन पर ध्यान केंद्रित करना। और लोग बहुत ही बुनियादी
00:06:41चीज़ें करते हैं, और हमने भी शुरुआत में वही बुनियादी चीज़ें की थीं, और वे काम करती हैं। आप एक वीडियो या
00:06:44इमेज में पैच-वाइज़ रिप्रजेंटेशन के औसत निकालने के बारे में सोच सकते हैं। और आपको 10 गुना तक के
00:06:51दिलचस्प कम्प्रेशन रेट्स मिलने लगते हैं। लेकिन फिर भी, यह एक तरह का अस्थायी उपाय है, और इसको असल में हल करने के लिए
00:06:57अच्छी तरह से इस्तेमाल किए जाने वाले आर्किटेक्चरल तरीके नहीं हैं। इसलिए हमने पिछले
00:07:04कुछ महीनों में वह जारी किया है जो हमें लगता है कि विरलता (स्पासिटी) की अलग-अलग मात्रा से निपटने का हमारा दृष्टिकोण है,
00:07:10जो बस मॉडल को यह तय करने देता है कि उसे किन टोकनों को देखना चाहिए और किन टोकनों को
00:07:14नहीं देखना चाहिए। और इसलिए हमने अपना "डेटा स्पार्स मिक्सचर ऑफ़ एक्सपर्ट्स" पेपर जारी किया, जो मूल रूप से
00:07:19आपको ऐसा करने की अनुमति देता है। यह मॉडल को — असल में मॉडल में एक राउटर होता है — यह उसे
00:07:24यह भविष्यवाणी करने देता है कि मुझे किस टोकन को इनपुट करना चाहिए, किस टोकन को छोड़ देना चाहिए, और यह हमें
00:07:30विभिन्न लेयर्स के माध्यम से मुफ़्त में ऐसा करने देता है। और यह पता चलता है कि यदि आप बस मॉडल को सीखने दें,
00:07:36यदि आप वास्तव में कोई कड़े आर्किटेक्चरल नियम लागू नहीं कर रहे हैं, तो मॉडल वास्तव में सीखता है।
00:07:43इसलिए यदि आप उस डेटा स्पार्स कंप्यूट को विज़ुअलाइज़ करते हैं जो हमारे मॉडल इस्तेमाल करते हैं, तो आप वास्तव में देखते हैं कि
00:07:49मॉडल स्वाभाविक रूप से बहुत उच्च-घनत्व वाली जानकारी या कार्य से संबंधित जानकारी पर ध्यान केंद्रित करना सीख जाते हैं।
00:07:56तो ऊपर दाईं ओर, आप देख सकते हैं कि मॉडल ग्राफ़ पर ध्यान केंद्रित करने का फैसला करता है,
00:08:00जिस पर एक इंसान के रूप में आप भी ज़ूम इन करेंगे, क्योंकि संभवतः इस चित्र में
00:08:05वही दिलचस्प चीज़ है। और यह भी पता चलता है कि कार्य-आधारित अलॉटमेंट भी
00:08:13होने लगता है। तो अगर आप नीचे बाईं ओर देखें, अगर आप बस एक बहुत ही सामान्य सा सवाल पूछते हैं,
00:08:18तो आपको पूरी छवि में फैला हुआ अटेंशन ग्राफ़ दिखाई देगा। क्योंकि मॉडल को यह नहीं पता
00:08:22कि कंप्यूट को आवंटित करने का सही तरीका क्या है। वहीं दूसरी ओर, यदि आप इससे कुछ ऐसा करने को कहते हैं
00:08:27जैसे, "सभी फलों को अलग करो", तो आप देख सकते हैं कि यह उन टोकनों को अधिक टोकन आवंटित करेगा जिन्हें
00:08:31यह फल के टोकन मानता है। और इसलिए यह एक बहुत ही बढ़िया और चतुर ट्रिक है जिसका उपयोग हम करते हैं और हमने इसे पब्लिश भी किया है
00:08:36और अन्य लोग भी आर्किटेक्चर में प्रासंगिक जानकारी को एम्बेड करने के लिए इसका उपयोग करने लगे हैं, जो
00:08:43आपकी मोडैलिटीज़ के स्पासिटी असंतुलन से निपटने के लिए उपयोगी हैं, लेकिन इतनी कठोर भी नहीं हैं कि मॉडल्स
00:08:49वास्तव में स्वाभाविक रूप से सीख ही न पाएँ। और इस तरह हम इस सबको एक साथ लाते हैं, और आप लोगों ने शायद
00:08:57इसकी रिलीज़ देखी होगी, हमने मूल रूप से अपना मॉडल रिलीज़ किया जिसे हमने पहला एम्बॉडीड
00:09:03फ़ाउंडेशन मॉडल माना था, कुछ हफ़्ते पहले। और यह मॉडल मूल रूप से Gemini
00:09:093.1 Pro के बराबर की क्षमता रखता है। यह वास्तव में Gemini Embodied Reasoning से बेहतर है, और लगभग 15 गुना सस्ता है।
00:09:15और यह मूल रूप से एक पेटाबाइट डेटासेट पर प्रशिक्षित है जिसे हमने हर संभव ज़रिया
00:09:20इस्तेमाल करके एकत्र किया है। इसमें इंटरनेट क्रॉल से लेकर हमारी अपनी कस्टम मिड-ट्रेनिंग रेसिपी या सिंथेटिक डेटा पाइपलाइन शामिल हैं।
00:09:28हमारे पास टेक्स्ट, इमेज, वीडियो, ट्रैजेक्टरीज़ में यह एक पेटाबाइट डेटा है, और ये ट्रैजेक्टरीज़
00:09:34बहुत सामान्य हो सकती हैं। यह डेस्कटॉप उपयोग की ट्रैजेक्टरी हो सकती है। यह वीडियो गेम खेलने की ट्रैजेक्टरी हो सकती है।
00:09:41और यह पता चलता है कि एक बार जब आप ये चीज़ें करने लगते हैं, तो बहुत ही दिलचस्प गुण सामने आने लगते हैं।
00:09:46और सबसे बड़ा गुण जो हमने देखा, जो बाद में सोचने पर काफी स्पष्ट लगता है,
00:09:50वह यह है कि आप पारंपरिक सीवी कार्यों को एक एजेंटिक कार्य के रूप में सोचना शुरू कर सकते हैं। और इसलिए
00:09:57इस मामले में, हमने मूल रूप से डिटैक्शन को एक एजेंटिक कार्य के रूप में फिर से तैयार किया है। तो हमारा मॉडल, आप जानते हैं,
00:10:02कोड लिख सकता है। यह विशिष्ट हिस्सों में ज़ूम इन करने के लिए कह सकता है। यह कॉन्ट्रास्ट बदल सकता है। और आप
00:10:09वास्तव में यहाँ देख सकते हैं, यह एक बहुत ही कठिन समस्या है। मुझे लगता है कि इन समस्याओं का एक पूरा रेडिट सबरेडिट है
00:10:14जहाँ छवियों में बहुत कठिन वस्तुओं को ढूंढने की कोशिश की जाती है। और हमारे मॉडल मूल रूप से इसे बहुत
00:10:19अच्छी तरह से करते हैं। लेकिन वे ऐसा एजेंटिक समझ के साथ करते हैं। तो यह कोई पारंपरिक, आप जानते हैं, इस एक
00:10:24बॉक्स को डिटेक्ट करने वाला काम नहीं है। यह मॉडल वास्तव में यह तय कर रहा है कि उसे चीजों को विभाजित करना है। उसे
00:10:28कॉन्ट्रास्ट बदलना है। यह यहाँ एक बॉक्स का सुझाव देता है। मुझे लगता है यहाँ यह, हाँ, कॉन्ट्रास्ट बढ़ाता है और पक्षी को ढूंढ लेता है।
00:10:36तो फिर से, यह करना बहुत कठिन है, अगर इंसान के लिए भी देखें, और इंसान समझने वाले कार्यों में बहुत अच्छे होते हैं,
00:10:42तो यह करने के लिए काफी कठिन चीज़ है। और यह सब केवल
00:10:46नेटिवली एम्बॉडीड मॉडल होने से आता है जो वास्तव में समझते हैं कि विभिन्न तौर-तरीकों को कैसे देखना है।
00:10:51और आगे बढ़ते हुए, यह रोबोटिक्स के आसपास सामान्य फिजिकल एआई रुख से कैसे संबंधित है?
00:10:57तो मैंने जीडीएम के लोगों से यह स्लाइड ली है। और इसलिए एक चीज़ जो हम रोबोटिक्स
00:11:04एजेंटिक सिस्टम से देखने लगे हैं, वह है एम्बॉडीड रीज़निंग मॉडल या
00:11:11ऑर्केस्ट्रेटर और टैक्टाइल पॉलिसी मॉडल के बीच का यह अलगाव। तो आप समस्याओं के बारे में ऐसे सोच सकते हैं,
00:11:17अगर मेरे पास -- अगर मैं कॉफी बना रहा हूँ और इसमें मुझे तीन मिनट लगते हैं, तो एक चीज़ जो मैं कर सकता हूँ
00:11:21वह है अपने पूरे, आप जानते हैं, वीएलए को यह समझने के लिए मजबूर करने की कोशिश करना कि इस व्यक्तिगत कार्य को कैसे किया जाए। या फिर
00:11:26मैं एक ऑर्केस्ट्रेटर मॉडल का उपयोग कर सकता हूँ जो इन कार्यों को उप-कार्यों में विभाजित करता है। और ऊपर एक
00:11:31टैक्टाइल कंट्रोल पॉलिसी चल रही होती है। और केवल फुल वीएलए
00:11:36से लेकर इस प्रकार के एजेंटिक सिस्टम तक एक पूरा स्पेक्ट्रम है। लेकिन मुख्य बात जो मैं उजागर करने की कोशिश कर रहा हूँ वह यह है कि
00:11:41एम्बॉडीड रीज़निंग वास्तव में एक बहुत ही दिलचस्प और जटिल समस्या है जिसे अभी हल किया जाना बाकी है।
00:11:46इसके बावजूद, हमारे मॉडल एम्बॉडीड रीज़निंग पर फ्रंटियर बने हुए हैं।
00:11:50और क्योंकि वे फ्रंटियर हैं, हम वास्तव में शानदार चीजें देखने लगे हैं जो हमने पहले नहीं देखी हैं।
00:11:55यहाँ बहुत जटिल ईगोसेंट्रिक -- या ईगोसेंट्रिक नहीं,
00:11:59लेकिन यह रोबोटिक डेटा एनोटेशन का एक ठोस उदाहरण है। और आप यहाँ देख सकते हैं कि मॉडल इधर-उधर नेविगेट कर रहा है,
00:12:04वीडियो के विभिन्न हिस्सों को देख रहा है, आप जानते हैं, इसे क्लिप कर रहा है, यह पता लगा रहा है कि
00:12:09कैप्शन सही हैं या नहीं, खुद सत्यापित कर रहा है। और हम यह सब इसलिए कर सकते हैं क्योंकि एआर मॉडल तेज़ हैं।
00:12:15वे बाहर मौजूद किसी भी अन्य चीज़ की तुलना में काफ़ी सस्ते हैं। तो अगर आप जेमिनी के साथ ऐसा करने की कोशिश करते हैं,
00:12:20तो इस वीडियो में शायद आपको कुछ डॉलर लग जाएँगे, या हमारे लिए यह शायद कुछ सेंट्स में होगा।
00:12:24और यह सब इन फ्रंटियर एम्बॉडीड रीज़निंग क्षमताओं को हासिल करने से उत्पन्न होता है
00:12:29जो हमने पहले कभी अन्य मॉडलों में नहीं देखी थीं।
00:12:37ठीक है, शायद हमारी अब तक की सबसे बड़ी शोध सफलता को साझा करने जा रहा हूँ, और मुझे लगता है कि हम
00:12:41आगामी हफ्तों में शायद ट्विटर पर इसमें से और अधिक साझा करेंगे। लेकिन एक बात जो हमने पाई है वह यह है कि हमने
00:12:48एम्बॉडीड फाउंडेशन मॉडल के लिए नए स्केलिंग नियमों की खोज की है। तो ये वे मॉडल हैं, फिर से, जिनमें आप
00:12:53संयुक्त रूप से कंट्रोल-आधारित ट्रेनिंग कर सकते हैं, प्रक्षेप पथ ट्रेनिंग कर सकते हैं, परसेप्टिव ट्रेनिंग कर सकते हैं,
00:12:59एम्बॉडीड रीज़निंग ट्रेनिंग कर सकते हैं। यदि आप बस यह पता लगा लेते हैं कि इस सबको एक साथ मिलाने का सही तरीका क्या है
00:13:03और उपयोग करने के लिए सही उद्देश्य क्या हैं, तो आप वास्तव में बहुत दिलचस्प परिणाम देखना शुरू करते हैं जो
00:13:08शायद आप पहले नहीं देख पाए थे।
00:13:11तो जिस ठोस बदलाव के बारे में मैं बात करूँगा, वह है एक्सचेंज करने की क्षमता, सामान्य वीडियो
00:13:19प्री-ट्रेनिंग डेटा को टेलि-ऑप डेटा से बदलने की यह क्षमता। तो जैसा कि हम जानते हैं, टेलि-ऑप डेटा बहुत महंगा है। यह
00:13:25प्रति घंटे डेटा $100 के क्रम में है। $100 में, मैं काफी अधिक वीडियो प्री-ट्रेनिंग डेटा एकत्र कर सकता हूँ।
00:13:32और इसलिए यह ग्राफ जो दिखा रहा है वह यह है कि यदि आप केवल विशुद्ध वीएलए, विशुद्ध नीतियों को प्रशिक्षित कर रहे हैं, तो यह
00:13:39बैंड आपके पास है। तो आपके पास अभी भी स्केलिंग की कमी है। इसलिए आपको अधिक से अधिक
00:13:43टेलि-ऑप डेटा से लाभ मिलता है। इसके बावजूद, लाभ उतने महत्वपूर्ण नहीं हैं जितने कि यदि आप वास्तव में
00:13:48इन एकीकृत एम्बॉडीड फाउंडेशन मॉडल को प्रशिक्षित कर रहे हैं। और यह ग्राफ का निचला आधा हिस्सा है।
00:13:55और वास्तव में शानदार फायदा जो हमें मिलता है वह यह है कि आप अनिवार्य रूप से 10 गुना कम टेलि-ऑप डेटा से काम चला सकते हैं यदि
00:14:03आपके पास 10 गुना अधिक वीडियो प्री-ट्रेनिंग डेटा है। और अब तक, यह हमारी कंपनी के पास मौजूद कंप्यूट की मात्रा के लिए
00:14:09सही साबित हुआ है। और हम इस सीमा को आगे बढ़ाना जारी रखेंगे कि आप इन एम्बॉडीड
00:14:16फाउंडेशन मॉडल को कितना आगे तक ले जा सकते हैं। तो यहाँ एक नीति के कुछ वीडियो हैं जो उम्मीद है कि कुछ हफ़्तों में
00:14:28छोटे मॉडल में से एक को ओपन सोर्स कर देंगे। लेकिन यह सब एक ही मॉडल के भीतर नेटिव रूप से चल रहा है
00:14:33जो कार्य को समझने के लिए एम्बॉडीड रीज़निंग करने में सक्षम है। वास्तव में, यह
00:14:38कंट्रोल टोकन आउटपुट कर रहा है। आप देख सकते हैं कि यह थोड़ा अस्थिर है, लेकिन कोई बात नहीं। उम्मीद है,
00:14:43आप इसे बड़े पैमाने पर समझ जाएँगे। और आप वास्तव में बहुत जटिल कार्य देख सकते हैं जो पहले, मुझे लगता है,
00:14:48शुद्ध वीएलए के लिए करना बहुत कठिन होता। इसलिए मुझे लगता है कि यदि आप दाईं ओर का वीडियो देखते हैं, तो इसमें
00:14:54मॉडल को वास्तव में पुस्तक का शीर्षक पढ़ने, यह ज्ञान रखने की आवश्यकता होती है कि यह किस प्रकार की पुस्तक
00:14:58है, और फिर इसे डिब्बों में से एक के भीतर उचित रूप से आवंटित करना होता है। तो यह वास्तव में धारणा और नियंत्रण के बीच
00:15:04एक बहु-चरण कार्य है जिसे करना वास्तव में, बहुत कठिन है यदि आपके पास एक प्रकार का शुद्ध एंड-टू-एंड
00:15:09कंट्रोल मॉडल है जो विभिन्न परसेप्टिव कार्यों के बारे में जागरूक नहीं है जिन्हें इस कार्य को करने के लिए पूरा करने की आवश्यकता है।
00:15:23हाँ। यह काफी शानदार है। यह बिना किसी पूर्व प्रशिक्षण के भी काफी अच्छी तरह से काम करता है। तो हम कुछ हफ़्तों में,
00:15:28जुलाई में किसी समय इसे लोगों के हाथों में सौंपने के लिए उत्साहित हैं।
00:15:33हाँ। सामान्य प्रश्नों के लिए कुछ मिनट छोड़ रहा हूँ, लेकिन यदि आप लोग रुचि रखते हैं, तो आइए जुड़ते हैं।
00:15:41तो हमारी कंपनी के साथ हम जो एक अच्छी चीज़ करते हैं वह यह है कि हम वास्तव में भागीदारों के एक सीमित समूह के लिए, अपने मार्क 1 वेट्स तक पहुँच प्रदान करते हैं।
00:15:47हम अपने बड़े एम्बॉडीड फाउंडेशन मॉडल वेट्स तक पहुँच प्रदान करते हैं। इसलिए मुझे ईमेल करें, ट्विटर पर डीएम करें, जो भी आसान हो।
00:15:58और फिर, हाँ, मैं शुरू करूँगा। प्रश्नों के लिए कुछ मिनट बचे हैं।
00:16:02धन्यवाद।
00:16:03धन्यवाद।
00:16:05धन्यवाद।
00:16:05धन्यवाद।
00:16:09धन्यवाद।
00:16:11धन्यवाद।
00:16:13धन्यवाद।
00:16:24हाँ, मुझे लगता है कि यह -- हाँ, तो सवाल यह है कि हम इस हद तक समय और समझ को कैसे हासिल करने में सक्षम हैं?
00:16:31यह एक अच्छा सवाल है। मेरा मतलब है, सच कहूँ तो, यह अभी पूरी तरह से तय नहीं हुआ है। इसलिए इसे वास्तव में ऐसी जगह पर लाने के लिए अभी भी बहुत काम करना बाकी है जहाँ आप विश्वसनीय रूप से तैनात कर सकें।
00:16:37मुख्य बात यह है कि आप संदर्भ प्रबंधन के बारे में कैसे सोचते हैं? तो आपके पास एक अपेक्षाकृत सीमित संदर्भ है। इसलिए मुझे लगता है कि यहाँ के मॉडलों में 1 मिलियन संदर्भ हैं, लेकिन उच्च एफपीएस वीडियो के साथ तालमेल बिठाना अपेक्षाकृत आसान है।
00:17:06और इसलिए आपको सोचना शुरू करना होगा कि क्या ऐसी दिलचस्प चीज़ें हैं जो आप कर सकते हैं? मैं एक विचार सामने रखता हूँ। हम ऐसा करते थे, लेकिन हम इससे आगे निकल चुके हैं, जैसे, मैं की-फ्रेम बनाम डेल्टा-फ्रेम के बारे में कैसे सोचूँ?
00:17:19मैं इन दोनों को साधकर अपने संदर्भ को कैसे प्रबंधित कर सकता हूँ? और फिर आप सोचने लगते हैं, अपने प्री-ट्रेनिंग उद्देश्य के दौरान, मैं उन चीज़ों को स्वाभाविक रूप से कैसे शामिल करना शुरू कर सकता हूँ जो मुझे लगता है कि रोबोटिक्स कार्यों के लिए उपयोगी होंगी?
00:17:32उदाहरण के लिए, एक बहुत ही बुनियादी चीज़ जिससे जेमिनी मॉडल भी जूझते थे, मुझे लगता है कि नए वाले काफी अच्छे हैं, लेकिन दिशा-निर्देशों को बताने में सक्षम होना।
00:17:40जैसे, बाएँ और दाएँ बताना बहुत कठिन है यदि आप इंटरनेट-स्तरीय खोज करते हैं, क्योंकि इंटरनेट पर कोई भी अनिवार्य रूप से चीज़ों को लेबल नहीं कर रहा है, आप जानते हैं, यह वस्तु इस वस्तु के बाईं ओर है, यह इस वस्तु के नीचे है।
00:17:51इसलिए, शुरुआत में ही डेटा वितरण के बारे में सोचना आपको अपेक्षाकृत तेज़ी से यह क्षमता प्रदान करता है। और यह भी, जैसे ईआर, इस प्रकार की एम्बॉडीड रीज़निंग हमारे साथ एक बहुत ही ठोस ध्यान केंद्रित करने का विषय थी, यही वजह है कि मुझे लगता है कि हम अपेक्षाकृत कम कंप्यूट के साथ जेमिनी ईआर को पीछे छोड़ने में सक्षम थे।
00:18:07हाँ, तो सबसे बढ़िया मजबूती जो हमने देखी है वह यह है कि विशेष रूप से वीएलए मॉडल के लिए, जैसे, यदि आप चीनी मॉडलों में से एक को लेते हैं,
00:18:35और आप उन्हें किसी विशिष्ट नीति के लिए ठीक करने का प्रयास करते हैं, यदि आप केवल पृष्ठभूमि बदलते हैं -- मुझे नहीं पता, यहाँ तक कि, जैसे मेज पर, यदि आप मेज की पृष्ठभूमि बदलते हैं, तो नीति वास्तव में विफल हो जाएगी।
00:18:47जो वास्तव में दिलचस्प है, यदि आप इस प्रकार की संयुक्त परसेप्टिव और कंट्रोल मॉडलिंग करते हैं, तो आप इस प्रकार की त्रुटियों के प्रति या यदि प्रकाश इस पर थोड़ा अलग तरीके से पड़ रहा है, तो बहुत अधिक मजबूत होते हैं।
00:18:56और मुझे लगता है कि हम इसे मुख्य रूप से एक ऐसे तरीके से पृष्ठभूमि की मजबूती के रूप में देखते हैं जो मुझे लगता है कि पारंपरिक मॉडलों में जरूरी नहीं कि हो।
00:19:03इसके बावजूद, मैं अति-दावा नहीं करने जा रहा हूँ, जैसे -- मेरा मतलब है, जैसे, यह अभी भी अपेक्षाकृत कठिन है।
00:19:07मुझे लगता है कि अगर मैं जाकर एक टॉर्च को भुजाओं में से एक पर चमकाने जा रहा हूँ, तो यह शायद काम नहीं करने वाला है।
00:19:12लेकिन इन चीज़ों को संयुक्त रूप से मॉडल करने में सक्षम होने से काफ़ी मदद मिलती है।
00:19:16हम बहुत सारे ऑनलाइन ऑग्मेंटेशन भी करते हैं, इसलिए हम वास्तव में, आप जानते हैं, नकली, मुझे नहीं पता, आर्म कैमरों में से एक का बंद होना, है ना?
00:19:27हम नकली, आप जानते हैं, किसी निश्चित दिशा से आने वाली सूरज की रोशनी बनाते हैं, है ना?
00:19:31इसलिए हम मजबूती में सुधार के लिए प्रशिक्षण के दौरान ये काम करते हैं।
00:19:35लेकिन बड़े लाभ इस प्रारंभिक संलयन प्रतिमान को लेने और फिर रोबोटिक्स क्षेत्र में जाने से आते हैं।
00:19:43बढ़िया।
00:19:44.
00:19:50ओह, ज्ञान के आधार?
00:19:52यह उपयोगी है, जैसे -- मेरा मतलब है, यदि आप छवियों, वीडियो को कैप्शन देना चाहते हैं, तो यह अपेक्षाकृत अच्छा है।
00:19:57हम इस तरह के बहुत जटिल, ईगोसेंट्रिक एनोटेशन के लिए रोबोटिक्स भागीदारों के साथ काम करते हैं।
00:20:02तो यह जरूरी नहीं कि एक ऑन्टोलॉजी पर निर्माण कर रहा हो, लेकिन एक प्रकार का बहुत गहरा, संरचित निष्कर्षण करने में सक्षम होना,
00:20:07मुझे लगता है कि हमारे मॉडल बहुत अच्छे हैं।
00:20:10हाँ।
00:20:11वैसे, मैंने यहाँ जो कुछ भी दिखाया है वह एक प्रकार का सार्वजनिक एपीआई है, ताकि आप जाकर इसके साथ प्रयोग कर सकें।
00:20:15बेंचमार्क सार्वजनिक हैं।
00:20:17मुझे लगता है कि मेरा समय समाप्त हो गया है।
00:20:19वे मुझे रोक रहे हैं, इसलिए मैं बाहर लोगों के साथ बात कर सकता हूँ।
00:20:22लेकिन धन्यवाद, दोस्तों।
00:20:27धन्यवाद।

Key Takeaway

Perceptron AI ने 1 पेटाबाइट मल्टीमॉडल डेटा और स्पार्स आर्किटेक्चर का उपयोग करके एक एकीकृत एम्बॉडीड फ़ाउंडेशन मॉडल विकसित किया है जो Gemini 3.1 Pro के प्रदर्शन से मुकाबला करता है और टेली-ऑप डेटा की आवश्यकता को 10 गुना घटाता है।

Highlights

  • Perceptron AI का एम्बॉडीड फ़ाउंडेशन मॉडल Gemini 3.1 Pro की क्षमता से मेल खाता है और Gemini Embodied Reasoning से बेहतर प्रदर्शन करते हुए 15 गुना सस्ता है।

  • वीडियो और कंट्रोल डेटा में डेटा विरलता (sparsity) को हल करने के लिए 'Data Sparse Mixture of Experts' आर्किटेक्चर का उपयोग किया जाता है, जो मॉडल को केवल महत्वपूर्ण विजुअल टोकन चुनने की अनुमति देता है।

  • 10 गुना अधिक सस्ते वीडियो प्री-ट्रेनिंग डेटा का उपयोग करने से $100 प्रति घंटे वाले महंगे टेली-ऑप (tele-op) डेटा की आवश्यकता 10 गुना तक कम हो जाती है।

  • मॉडल टेक्स्ट, इमेज, वीडियो और ट्रैजेक्टरी सहित 1 पेटाबाइट डेटासेट पर प्रशिक्षित है, जो ऑब्जेक्ट डिटैक्शन जैसे सीवी कार्यों को एजेंटिक वर्कफ़्लो के रूप में निष्पादित करता है।

  • संयुक्त पर्सेप्टिव और कंट्रोल मॉडलिंग से पृष्ठभूमि में बदलाव या रोशनी के भिन्न होने पर भी रोबोटिक नीतियाँ विफल नहीं होतीं।

Timeline

एम्बॉडीड फ़ाउंडेशन मॉडल्स का परिचय और मिशन

  • भौतिक और डिजिटल दुनिया को जोड़ने के लिए किसी भी उपकरण या रोबोट में इंटेलिजेंस प्रदान करना आवश्यक है।
  • अर्ली फ़्यूज़न और मल्टीमॉडल मॉडल्स पर्सेप्शन, एम्बॉडीड रीज़निंग और कंट्रोल को एक ही मॉडल में एकीकृत करते हैं।

पारंपरिक VLMs केवल टेक्स्ट आउटपुट तक सीमित रहते हैं, जबकि VLAs एक्शन्स को आउटपुट में शामिल करते हैं। एम्बॉडीड फ़ाउंडेशन मॉडल इन सभी विधाओं को अलग-अलग मॉडलों के बजाय एक ही एकीकृत नेटवर्क के भीतर संचालित करने की क्षमता देता है।

डेटा विरलता और कॉन्टेक्स्ट ब्लोट की चुनौतियाँ

  • एक घंटे के वीडियो में 10 लाख विजुअल टोकन होते हैं, जिनमें से केवल 0.2% पर ही ट्रेनिंग लॉस की गणना हो पाती है।
  • पिक्सेल-स्तरीय भविष्यवाणी बैकग्राउंड पिक्सेल और महत्वपूर्ण संपर्क बिंदुओं को समान महत्व देकर कंप्यूट को बर्बाद करती है।

हमेशा चालू रहने वाले कैमरों और लगातार काम करने वाले रोबोट्स में टोकन्स की लंबी श्रृंखला बन जाती है। सिंथेटिक डेटा या विरल ट्रेनिंग सिग्नल मॉडल को गलत सिग्नल देते हैं, जिससे एक स्वचालित पर्सेप्टिव ऑब्जेक्टिव खोजना अनिवार्य हो जाता है।

Data Sparse Mixture of Experts आर्किटेक्चर

  • स्पेशियल और टोकन कम्प्रेशन शुरुआत में 10 गुना तक कम्प्रेशन अनुपात प्रदान करते हैं।
  • Data Sparse Mixture of Experts में एक राउटर मॉडल को खुद यह तय करने देता है कि किन टोकन को प्रोसेस करना है और किसे छोड़ना है।

कड़े आर्किटेक्चरल नियम लागू किए बिना मॉडल स्वाभाविक रूप से कार्य-संबंधित और उच्च-घनत्व वाली जानकारी पर ध्यान केंद्रित करना सीखता है। विशिष्ट कार्यों जैसे 'फलों को अलग करना' या 'ग्राफ़ देखना' के दौरान मॉडल सटीक टोकन आवंटन करता है।

Mark 1 मॉडल की क्षमताएँ और एजेंटिक सीवी

  • 1 पेटाबाइट डेटा पर प्रशिक्षित मॉडल Gemini 3.1 Pro के बराबर है और Gemini Embodied Reasoning से 15 गुना सस्ता है।
  • पारंपरिक कंप्यूटर विज़न (CV) कार्यों को एजेंटिक वर्कफ़्लो के रूप में फिर से तैयार किया गया है।

मॉडल कोड लिखकर, ज़ूम इन करके और कॉन्ट्रास्ट बदलकर जटिल छवियों में वस्तुओं का पता लगाता है। यह ऑर्केस्ट्रेटर और टैक्टाइल पॉलिसी के विभाजन के माध्यम से रोबोटिक एनोटेशन जैसे बहु-स्तरीय कार्यों को कुशलतापूर्वक प्रबंधित करता है।

नये स्केलिंग नियम और रोबोटिक कंट्रोल

  • वीडियो प्री-ट्रेनिंग डेटा को 10 गुना बढ़ाकर महंगा टेली-ऑप डेटा 10 गुना कम इस्तेमाल किया जा सकता है।
  • संयुक्त पर्सेप्टिव और कंट्रोल मॉडलिंग से नीतियाँ पृष्ठभूमि में बदलाव के प्रति मजबूत और प्रतिरोधी बनती हैं।

एकीकृत मॉडल में कंट्रोल टोकन आउटपुट करके कठिन कार्य जैसे किताब का शीर्षक पढ़कर उसे सही डिब्बे में रखना संभव होता है। प्रशिक्षण के दौरान ऑनलाइन ऑग्मेंटेशन और नकली लाइटिंग कंडीशन जोड़कर मॉडल की मजबूती में और सुधार किया जाता है।

Community Posts

No posts yet. Be the first to write about this video!

Write about this video