शॉर्ट-फॉर्म वीडियो में मोडालिटी मिसअलाइनमेंट और ओरिजनैलिटी एट्रिब्यूशन — आदित्य गौतम, मेटा
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00आदित्य रहम: नमस्ते सभी को, मैं आदित्य हूँ, और हम दो मुख्य समस्याओं के बारे में बात करेंगे
00:00:17जो शॉर्ट-फॉर्म प्लेटफॉर्म्स पर होती हैं।
00:00:20हम बात करने वाले हैं कि बड़े पैमाने पर इन चीज़ों से कैसे निपटा जाए।
00:00:25तो शुरुआत करने के लिए, सबसे पहले हम उस डेटा की विशेषताओं को समझेंगे
00:00:28जिससे हम निपटने की कोशिश कर रहे हैं, वे दो मुख्य समस्याएं क्या हैं जिन पर हम वास्तव में
00:00:33काम कर रहे हैं, और उन समस्याओं को बड़े पैमाने पर हल करने के लिए मल्टी-एजेंट सिस्टम क्या हैं।
00:00:39वे कौन से अलग-अलग विशिष्ट छोटे स्तर के VLM हैं जो हम उन व्यक्तिगत
00:00:46एजेंटिक समस्याओं को हल करने के लिए बना सकते हैं, और हम उन एजेंटों को कैसे बनाते हैं, वास्तव में इन्हें अनुकूलित करने के
00:00:50अलग-अलग तरीके क्या हैं, ताकि इसे बहुत बड़े पैमाने पर स्केलेबल बनाया जा सके, और फिर हम
00:00:56मूल्यांकन को बहुत ही समग्र 360 दृष्टिकोण से देखेंगे, न कि केवल प्रिसिजन-रिकॉल की तरह।
00:01:00वहाँ क्या मौजूद है?
00:01:01हम पूरे मल्टी-एजेंट पाइपलाइन को कैसे समझते हैं, LLM स्तर, टूल्स, MCP और बाकी सभी चीज़ों
00:01:08दोनों दृष्टियों से।
00:01:09और फिर हम उन ऑप्टिमाइजेशन तकनीकों में जाएँगे जो बहुत ही विज़न-विशिष्ट और
00:01:14डेटा-विशिष्ट हैं, जो हमें अनुमति देंगी और इतनी समझ देंगी जो बता सके कि हमें वास्तव में
00:01:20सभी वीडियो के लिए यह इंटेलिजेंट वर्कफ़्लो करने की आवश्यकता नहीं है, हम यह पता लगा सकते हैं कि वीडियो का वह कौन सा
00:01:25छोटा सेट है जो इन चीज़ों को करने के लिए उपयुक्त उम्मीदवार होना चाहिए।
00:01:29और हम मुख्य निष्कर्षों के साथ समापन करेंगे।
00:01:32तो वास्तविक दुनिया का डेटा बहुत अस्त-व्यस्त होता है।
00:01:34यह-- हम 10 करोड़ से अधिक और बहुत सारे वायरल कंटेंट के पैमाने की बात कर रहे हैं।
00:01:39बहुत सारा विरोधी (एडवर्सरियल) कंटेंट है।
00:01:42लोग सिस्टम को चकमा देने की कोशिश कर रहे हैं।
00:01:43स्क्रीन पर और उनके वीडियो तथा छवियों में बहुत सारा बहुभाषी टेक्स्ट होता है।
00:01:48और डेटा बहुत गतिशील (डायनेमिक) है।
00:01:50यह महीने-दर-महीने बदलता रहता है।
00:01:52अलग-अलग AI टूल्स आ रहे हैं, और भी बहुत कुछ हो रहा है।
00:01:54इसलिए यह वास्तव में बहुत गतिशील है।
00:01:57इसका मतलब है कि वीडियो डेटा के साथ बहुत सारे ड्रिफ्ट मुद्दे और अन्य चीजें आती हैं।
00:02:00और फिर हम जानते हैं कि जिस समस्या को हम हल करने की कोशिश कर रहे हैं, उसका कोई स्पष्ट आधार सत्य (ग्राउंड ट्रुथ) नहीं है।
00:02:05तो ये मौजूदा समस्याएं हैं जो वास्तविक दुनिया के वीडियो डेटा सेट में होती हैं।
00:02:10हम-- जिस पहली समस्या के बारे में बात करेंगे, वह मोडैलिटी मिसअलाइनमेंट है,
00:02:14जहाँ पहला इंटरमोडैलिटी है, जो एक काफ़ी हद तक हल हो चुकी समस्या है।
00:02:19आपके पास एक क्लिप मॉडल हो सकता है।
00:02:20आपके पास छवियों, वीडियो, ऑडियो, टेक्स्ट पर एक मोडैलिटी हो सकती है,
00:02:25और उन एम्बेडिंग पर सटीक कोसाइन सिमिलरिटी क्या है, यह समझकर समस्या सुलझा सकते हैं।
00:02:29तो यह एक बहुत ही सरल समस्या है।
00:02:31हम जिस बारे में बात करेंगे, वह यह है कि हम इंट्रामोडैलिटी समस्याओं को कैसे हल कर रहे हैं।
00:02:37तो इसे एक वीडियो की तरह समझें।
00:02:39हमारे पास एक बड़ा वीडियो है।
00:02:40और फिर अचानक आपको कुछ दिखता है, कोई विज्ञापन, एजेंडा, कुछ राजनीतिक चीज़ें,
00:02:45या ऐसा कुछ जो वीडियो में नहीं होना चाहिए था जब आपने उस पर क्लिक किया था।
00:02:49तो हम वास्तव में वीडियो के छोटे टुकड़ों को कैसे देखें, इस समस्या को समझें,
00:02:54और यह पता लगाएँ कि कहाँ कोई विसंगति (अनोमली) या किसी प्रकार का विरोधी व्यवहार मौजूद है
00:02:59जो शुरुआत से ही वहाँ नहीं होना चाहिए था।
00:03:01तो यह पहली समस्या है, जिसके लिए बहुत सूक्ष्म समझ, विज़न समझ,
00:03:05और वीडियो समझ की आवश्यकता होती है ताकि यह देखा जा सके कि बिल्कुल क्लिप और फ्रेम स्तर पर क्या हो रहा है।
00:03:10दूसरी समस्या गैर-मूल (अनओरिजिनल) सामग्री को समझना है।
00:03:14आज की अर्थव्यवस्था में, उपलब्ध AI टूल्स के साथ, सामग्री को डुप्लिकेट करना वास्तव में बहुत आसान है।
00:03:19जब कोई वीडियो या कुछ अपलोड करता है, तो हम देखते हैं कि, ठीक है, इसे कॉपी किया जा रहा है, इसे बदला जा रहा है,
00:03:25और टूल्स के साथ इन वीडियो को बदलना बहुत आसान होता जा रहा है।
00:03:29तो हम वास्तव में इस प्रकार की गैर-मूल सामग्री का पता कैसे लगाएं?
00:03:33हम वीडियो के स्रोत का पता कैसे लगाएं?
00:03:35और इसने वास्तव में एट्रिब्यूशन, क्रेडिट, पारिस्थितिकी तंत्र के असंतुलन में एक समस्या पैदा कर दी है।
00:03:41यूज़र की बहुत ज़्यादा थकान, हमें कई ऐसे दोहराव वाले वीडियो दिख रहे हैं जो पहली बात तो होने ही नहीं चाहिए।
00:03:47तो मल्टी-एजेंट सिस्टम की बात करें, तो पहली बात यह है कि हम मल्टी-एजेंट का इस्तेमाल क्यों कर रहे हैं,
00:03:54किसी सिंगल एजेंट या सिंगल LLM का क्यों नहीं, क्योंकि समस्या वाकई जटिल है।
00:03:57इसके लिए बेहद विशेषीकृत नोड्स और रिट्रीवल, कंटेंट अंडरस्टैंडिंग
00:04:04और फिर रीज़निंग के हर हिस्से पर एक तरह की समझ की आवश्यकता होती है।
00:04:07और अगर आप किसी समस्या को एक एजेंट, एक LLM से हल कर सकते हैं, तो हमें असल में मल्टी-एजेंट सिस्टम का उपयोग करने की आवश्यकता नहीं है।
00:04:14तो यहाँ सेंट्रलाइज़्ड ब्रेन काम आता है, कि हम वास्तव में कैसे सोच रहे हैं, इस समस्या का विघटन कैसे होता है।
00:04:22पहला यह है कि मूल रूप से आपके पास एक वीडियो है और रिव्यूअर एजेंट को दिया गया एक वीडियो ID वगैरह है।
00:04:28यह एक सेंट्रलाइज़्ड एजेंट है।
00:04:29यह मूल रूप से ऑर्केस्ट्रेटर है।
00:04:31इसे सिग्नल डीकंपोज़िशन करने और इमेज के आसपास क्या हो रहा है यह पता लगाने वाला एक API गेटवे समझें।
00:04:38तो यह घटक क्या करता है, बेसिकली यह परसीवर एजेंट का सहारा लेता है, और परसीवर एजेंट वह है जिसे मूल रूप से
00:04:46बहुत सारे इमेज और वीडियो टूल से लैस एक बेहद परिष्कृत VLM विशेषज्ञ माना जाता है।
00:04:52परसीवर एजेंट रिव्यूअर एजेंट से ID लेगा और डेटाबेस से वीडियो प्राप्त करेगा।
00:05:01यह विभिन्न टूल्स, विभिन्न सेमांटिक एम्बेडिंग्स, और होने वाले विभिन्न प्रकार के टेम्पोरल परिवर्तनों का उपयोग करके इसे छोटे भागों में विभाजित करता है।
00:05:08जो इस टॉक के हमारे दायरे से थोड़ा बाहर है, लेकिन यह हमारी तकनीक है जो यह सुनिश्चित करती है कि हम इसे फिक्स्ड फ्रेम रेट पर न करें।
00:05:17बल्कि हम यह पता लगा रहे हैं कि टेम्पोरल परिवर्तन कहाँ हुआ और उन समान फ़्रेमों को एक या दो फ़्रेमों में कंप्रेस कर रहे हैं।
00:05:23और फिर परसीवर एजेंट को क्लिप स्तर, वीडियो एम्बेडिंग स्तर से सारा डेटा मिलता है, क्लिप, एम्बेडिंग, टैग, OCR, जो कुछ भी मौजूद है उसके बारे में सारी जानकारी मिलती है,
00:05:34नेचुरल लैंग्वेज विवरण क्या है, और किस फ्रेम से किस फ्रेम तक के टाइमस्टैम्प हैं, यह मेटाडेटा कैसा दिखता है।
00:05:41यह वह डेटा रिव्यूअर को देता है।
00:05:43रिव्यूअर, एम्बेडिंग्स, सेमांटिक IDs, टैग्स, OCR और सब कुछ के साथ, परसीवर एजेंट द्वारा रॉ फॉर्म में प्रदान की गई इस सभी टेम्पोरल, JSON ऑब्जेक्ट की जांच करेगा।
00:05:52और यह एक टेम्पोरल विश्लेषण करता है।
00:05:55यह देखता है कि, ठीक है, आप जानते हैं, पहले फ्रेम से लेकर फ्रेम नंबर 360 तक, या लगभग छह सेकंड तक, यह खेल के बारे में बात करने वाला एक वीडियो था।
00:06:05और अचानक हम देख रहे हैं कि छह सेकंड से 6.5 सेकंड तक या इस फ्रेम नंबर से इस तक, हम देख रहे हैं कि यह किसी राजनीतिक चीज़ में बदल रहा है।
00:06:14तो केवल मेटाडेटा को देखकर, रिव्यूअर एजेंट यह समझने, आत्मसात करने और यह पता लगाने में सक्षम होता है कि इस
00:06:22टेम्पोरल स्पेस में बिल्कुल क्या विसंगति आ रही है।
00:06:23और ऐसा करने के बाद, यह पता लगाता है कि क्या यह वास्तव में मॉडेलिटी मिसअलाइनमेंट है, या वहां कोई बड़ी समस्या मौजूद है।
00:06:30इसलिए रिव्यूअर एजेंट रिट्रीवर एजेंट से देखेगा और बात करेगा, और बताएगा कि, हे, यह वह वीडियो है जिसे मैं देख रहा हूं।
00:06:36ये कुछ ऐसे मेटाडेटा हैं जिन्हें मैंने पहले ही एक तरह से डिडुप और पोस्ट-प्रोसेस कर लिया है।
00:06:41अब मुझे कॉर्पस में उपलब्ध इन समान क्लिप्स की कुछ समझ प्रदान करें।
00:06:47तो रिट्रीवर एजेंट परसीवर एजेंट द्वारा प्रदान किए गए सभी सिग्नलों, क्लिप स्तर और पूरे वीडियो स्तर के सभी मेटाडेटा को देखेगा, और इसे अनुकूल रूप से विभिन्न डेटाबेस में इंडेक्स करेगा।
00:06:57उदाहरण के लिए, टॉपिक्स को शायद एक इनवर्टेड इंडेक्स की तरह होना चाहिए जहाँ हमारे पास टॉपिक्स और बहुत सारे वीडियो हैं।
00:07:02एम्बेडिंग के लिए, यह एक वेक्टर डेटाबेस होगा जो वहां उपलब्ध है।
00:07:06और एक्सट्रैक्ट की गई विभिन्न प्रकार की एंटिटीज के लिए, हमारे पास ग्राफ डेटाबेस हैं जहां रिव्यूअर एजेंट यह पता लगाएगा कि, ठीक है, ये कई डेटाबेस हैं, ये एंटिटीज हैं, और ये मेटाडेटा हैं।
00:07:16मुझे इसे इंडेक्स करने दें ताकि ऑनलाइन इंस्टेंस टाइम में, मैं किसी विशेष क्लिप के लिए यह पता लगा सकूं कि रिकॉल को फ़ेच करने और बेहतर बनाने के लिए कौन सी समान क्लिप्स, समान एंटिटीज और टॉपिक्स उपलब्ध हैं।
00:07:28तो व्यक्तिगत एजेंट पर आते हुए, हमने परसीवर के बारे में बात की।
00:07:32इसने पूरे वीडियो को देखा, सेमांटिक एम्बेडिंग और कुछ एल्गोरिदम के आधार पर छोटी क्लिप में एक टेम्पोरल डीकंपोज़िशन किया, और इसने सभी वास्तविक कंक्रीट
00:07:45और प्रत्येक क्लिप और पूरे वीडियो के बारे में बेहद विस्तृत जानकारी निकालने के लिए VLM को फाइन-ट्यून किया।
00:07:51क्योंकि हम बहुत बड़े पैमाने पर काम कर रहे हैं, इसका मतलब है कि हम केवल मौजूदा मानक VLM के साथ नहीं चल सकते।
00:07:56अरबों फ़्रेमों पर काम करने के लिए, इन मॉडलों को वास्तव में हल करने का एक कम्प्रेशन, एक किफायती तरीका होना चाहिए।
00:08:05यहीं पर हम प्री-ट्रेनिंग, फाइन-ट्यूनिंग, नॉलेज डिस्टिलेशन, क्वांटाइजेशन में आ रहे हैं ताकि बहुत ही
00:08:13विशेषीकृत VLM को इस विशिष्ट समस्या के आधार पर तैनात और हल किया जा सके।
00:08:16और हम इसके बारे में थोड़ा संक्षेप में बात करेंगे।
00:08:19रिट्रीवर एजेंट वह है जिसके बारे में हमने बहुत उच्च स्तर पर बात की थी।
00:08:22और फिर यह ऑफ़लाइन प्रोसेसिंग में जो करता है वह यह है कि परसीवर एजेंट द्वारा ऑफ़लाइन तरीके से विघटित किए गए सभी सिग्नल,
00:08:29उसे एक एजेंट के बजाय, समझें कि आप उस लाइब्रेरी को ले रहे हैं और बड़े पैमाने पर एक ऑफ़लाइन विश्लेषण कर रहे हैं।
00:08:34मान लीजिए, एक रे क्लस्टर या ऐसा ही कुछ।
00:08:37और फिर एक बार जब आपके पास वे सभी मेटाडेटा आ जाते हैं, तो यह मूल रूप से इसे विभिन्न डेटाबेस में इंडेक्स कर रहा होता है।
00:08:42एक समय-समय पर ऑफ़लाइन क्लस्टरिंग करना और यह पता लगाना कि समान कंटेंट कौन से हैं, प्रत्येक क्लिप और पूरे वीडियो के लिए एम्बेडिंग ID क्या होनी चाहिए, क्लस्टर ID क्या होनी चाहिए।
00:08:50तो यह वह डेटा है जिसका उपयोग मूल रूप से समान वीडियो खोजने के लिए ऑनलाइन इंफरेंस द्वारा किया जाता है।
00:08:56और ऑनलाइन तरीके से, इसे एक क्वेरी या क्लिप ID और सभी मेटाडेटा विवरण दिए जाते हैं।
00:09:01यह पता लगाता है कि कॉर्पस में ऐसा क्या है जो इस क्लिप के समान है।
00:09:06वे कौन सी अलग-अलग चीज़ें हैं जिनमें उच्च समानता है।
00:09:09तो यह क्या करता है, यह डेटाबेस में देखता है, समान क्लिप्स और समान ऑथर्स और विभिन्न मेटाडेटा जानकारी ढूंढता है।
00:09:16उन उम्मीदवारों को फिर से रैंक करें और कुछ टूल का उपयोग करें, जैसे कि पारंपरिक मॉडल स्पैम स्कोर, क्लासिफायर स्कोर,
00:09:24यह देखने के लिए कि कौन से अलग-अलग उम्मीदवार स्पैम हो सकते हैं, कौन से उच्च गुणवत्ता वाले नहीं हो सकते, और ऐसी ही अन्य चीजें।
00:09:29और एक बार जब इसके पास वे शीर्ष उम्मीदवार आ जाते हैं, तो यह उन्हें समीक्षाकर्ता (रिव्यूअर) को वापस दे देता है।
00:09:33और समीक्षाकर्ता ही वह जगह है जहाँ यह वास्तव में प्रक्रिया करता है, कि ये मेरे मुख्य कंटेंट सिग्नल और क्लिप एम्बेडिंग हैं।
00:09:39ये रिट्रीवर द्वारा दिए गए समान वीडियो हैं।
00:09:42मुझे इस पर विचार करने दें और क्या मुझे फिर से री-क्रिएट करने और रिट्रीवर से अधिक डेटा प्राप्त करने की आवश्यकता है।
00:09:48तो यहीं पर समीक्षाकर्ता के पास एक ही क्लिप के सभी टेम्पोरल सिग्नल होते हैं।
00:09:52इसके पास समान क्लिप्स की समझ, समान क्रिएटर्स और अन्य चीजों की सभी जानकारी होती है।
00:09:58इसके पास इस बारे में भी वास्तविक समय (रियल-टाइम) की जानकारी होती है कि उपयोगकर्ता वास्तव में इस वीडियो के साथ कैसे इंटरैक्ट कर रहे हैं।
00:10:03विभिन्न प्रकार की रिपोर्ट या टिप्पणियाँ (कमेंट्स) क्या हैं, और उन टिप्पणियों की भावना (सेंटिमेंट) क्या है, सही?
00:10:13तो इनमें से बहुत सारे सिग्नल जो वास्तव में ऑफ़लाइन सिग्नल, VLM और अन्य प्रकार के एजेंटों से छूट जाते हैं,
00:10:18उन्हें यह देखने के लिए भी शामिल किया जाता है कि क्या भावना में कोई बदलाव हो रहा है।
00:10:22मुझे रियल टाइम में क्या प्रतिक्रिया मिल रही है?
00:10:25तो वीडियो को केवल कंटेंट और सिमेंटिक के दृष्टिकोण से ही नहीं,
00:10:30बल्कि उपयोगकर्ता के इंटरैक्शन के दृष्टिकोण से समझने के लिए इसके कई अलग-अलग टूल उपलब्ध हैं।
00:10:36वे सिग्नल वास्तव में बहुत महत्वपूर्ण हैं।
00:10:38इसलिए जब हमारे पास यह काम और सब कुछ हो जाता है, तो हम यह एजेंटिक ढांचा (फ्रेमवर्क) बनाते हैं।
00:10:44और इनमें से प्रत्येक एजेंटिक फ्रेमवर्क, ये तीनों एजेंट वास्तव में विशेष
00:10:50VLM और एक तरह से छोटे पैमाने के VLM द्वारा संचालित होते हैं।
00:10:54तो हम सबसे पहले प्री-ट्रेनिंग के बारे में बात करेंगे।
00:10:58अब, अधिकांश मामलों में, आप देखते हैं कि ठीक है, आपके पास प्री-ट्रेनिंग है।
00:11:01आप अपने विज़न ट्रांसफॉर्मर को यहाँ-वहाँ थोड़ा फ़ाइन-ट्यून करते हैं और मूल रूप से इसे अपने विशिष्ट उद्देश्य के लिए ट्यून करते हैं।
00:11:08बात यह है कि ये VLM, जो हमारे पास बाहर उपलब्ध हैं, फ़ाउंडेशनल मॉडल, फ्रंट-एंड मॉडल,
00:11:14वे बहुत ही साफ़, बहुत अच्छे डेटासेट पर प्रशिक्षित होते हैं, जो बहुत अच्छी तरह से ट्यून और क्लीन किया गया वेब डेटा होता है।
00:11:20लेकिन किसी विशिष्ट उद्देश्य के लिए इन-हाउस डेटा में समान डेटा विशेषताएँ नहीं होती हैं।
00:11:26यह अव्यवस्थित (मैसी) होता है।
00:11:27यह उपयोगकर्ताओं द्वारा जनरेट किया जाता है।
00:11:28यह आपके विशिष्ट कार्यप्रवाह (वर्कफ़्लो) के लिए है।
00:11:30इसका मतलब है कि आपको अपने विज़न ट्रांसफॉर्मर को शुरुआत से फ़ाइन-ट्यून करने के लिए उन इमेज टोकन और भाषा पर प्री-ट्रेन करना होगा
00:11:37और यह देखना होगा कि इसे फ़ाइन-ट्यून करने और शुरुआत से ट्यून करने में क्या अंतर (डेल्टा) है।
00:11:42यहीं पर प्री-ट्रेनिंग मददगार होती है।
00:11:44यह थोड़ा महंगा है, लेकिन अगर यह अंतर ला सकता है, तो यह वास्तव में बहुत अच्छी तरह से काम करता है।
00:11:50दूसरा है इंस्ट्रक्शन फ़ाइन-ट्यूनिंग, जहाँ हमारे पास दो समस्याएँ हैं।
00:11:54हमारे पास कुछ नीतियाँ (पॉलिसी) और कुछ दिशानिर्देश हैं।
00:11:57हम कंटेंट और सिग्नल को जानते हैं, और यह उसे समझता है और उस विशेष डेटासेट पर एक विशेष आउटपुट के साथ ट्यून करता है,
00:12:04जो कि JSON स्कीमा की तरह एक स्कीमा है, यह समझने के लिए कि मॉडैलिटी मिसअलाइनमेंट या
00:12:10स्कोर का दोहराव और रिव्यूअर एजेंट द्वारा प्रदान किया गया विचार-श्रृंखला (चेन ऑफ थॉट) तर्क क्या है।
00:12:16तो यहाँ हमारे पास एक वीडियो क्लिप है।
00:12:17हमारे पास एक विज़न एन्कोडर है, जिसे हमने पहले ही थोड़ा प्री-ट्रेन कर लिया है।
00:12:21जैसे अब हम उस पर थोड़ा और ट्रेनिंग कर रहे हैं।
00:12:23एक प्रोजेक्टर है, जो विज़न ट्रांसफॉर्मर और लैंग्वेज मॉडल के बीच स्थित है,
00:12:27और यह वास्तव में उनके बीच एक पुल का काम करता है।
00:12:30और फिर हमारे पास इस बात पर निर्भर करते हुए आउटपुट होता है कि इस तरफ हमारे पास कौन सा इंस्ट्रक्शन फ़ाइन-ट्यूनिंग डेटा है।
00:12:35तो यह आपके डोमेन-विशिष्ट कार्य के लिए मॉडल के प्रदर्शन को बढ़ाने का एक महत्वपूर्ण हिस्सा है।
00:12:45तो संदर्भ मूल रूप से यह है कि आपके पास एक भूमिका है, एक नीति है, उसे कुछ मेटाडेटा में
00:12:50आधारित (ग्राउंड) करने के लिए कौन से टूल उपलब्ध हैं, और अन्य क्या चीजें उपलब्ध हैं।
00:12:54पूरी चीज़ों को संदर्भ में बहुत संक्षिप्त रूप में दें, और इसे यह समझने दें कि आपने कौन सा
00:13:01संरचित लेबल (स्ट्रक्चर्ड लेबल) पाया है। ये लेबल वास्तव में इन-हाउस लेबल हैं। ये वे हैं जहाँ
00:13:06हमने बनाया है कि वास्तव में मॉडैलिटी चीजें क्या हैं, हम कौन सी अलग-अलग समस्याएँ देख रहे हैं,
00:13:12मॉडल में कौन से अलग-अलग विचार-श्रृंखला तर्क होने चाहिए,
00:13:15और मानव समीक्षक के लिए आउटपुट कैसा दिखता है। तो यह एक बहुत ही उच्च गुणवत्ता वाला
00:13:21डेटासेट है जिस पर हम अलग-अलग एजेंटों के लिए इसे फ़ाइन-ट्यून कर रहे हैं, ठीक है? तो एक बार जब हम
00:13:27वीडियो के विज़न पहलू या अन्य मॉडैलिटी पहलुओं को समझने के लिए प्री-ट्रेनिंग पूरी कर लेते हैं,
00:13:33फिर हम इसे समझाने और उस तरीके से संदर्भ और आउटपुट प्रदान करने के लिए फ़ाइन-ट्यूनिंग में जाते हैं,
00:13:38जिस तरह से हम वास्तव में डेटासेट को प्रोसेस करना चाहते हैं। तो अगला चरण DPO चरण है,
00:13:44जो मूल रूप से यह तकनीक पोस्ट-ट्रेनिंग में हमारे मॉडल को एक विशिष्ट
00:13:51क्षेत्र, डोमेन या नीति की समझ आदि में फ़ाइन-ट्यून करने के लिए बहुत उपयोग की जाती है। लेकिन इसका
00:13:58उत्पादन (प्रडक्शन) में यह समझने के लिए भी बहुत उपयोग किया जा सकता है कि वे कौन से नमूने (सैंपल) हैं जो
00:14:02वास्तव में आपके मल्टी-एजेंट सिस्टम और आपके LLM द्वारा इतने अच्छे नहीं बन पा रहे हैं। तो क्या
00:14:11किया जा सकता है कि आपके पास यह प्रोडक्शन डेटासेट आ रहा है, आपके पास बहुत सारे
00:14:17अनुमान (इन्फरेंस) हो रहे हैं, आप प्रोडक्शन से इस डेटा का एक उप-नमूना (सब-सैंपल) लेते हैं, आप इसे
00:14:23जज के रूप में एक LLM के माध्यम से पास करते हैं जो मानव-लेबल वाले डेटासेट पर इन-हाउस प्रशिक्षित है, और फिर आपके पास
00:14:29वास्तविक सिस्टम पर प्रदर्शन कैसा आ रहा है, यह देखने के लिए मानव समीक्षा कतार (ह्यूमन रिव्यू क्यू) होती है। एक बार जब आपके पास यह
00:14:36चीज़ आ जाती है, अगर आपका प्रदर्शन बहुत बढ़िया आ रहा है और यह आपकी भविष्यवाणी सीमा (प्रेडिक्शन थ्रेशोल्ड) से ऊपर है,
00:14:40प्रत्येक समस्या के लिए 95 प्रतिशत, तो यह बहुत बढ़िया है। लेकिन अगर ऐसा नहीं है, तो इसका मतलब है कि एक तरीका है,
00:14:47उन नमूनों से सीखने का एक तरीका होना चाहिए जहाँ मॉडल ने अच्छा प्रदर्शन नहीं किया। वहीं पर आपके पास
00:14:52कतार में एक इंसान (ह्यूमन-इन-द-लूप) होता है। वह सभी एजेंटों, LLM कॉल, MCP से वहाँ मौजूद सभी निशानों (ट्रेसेस) को समझता है,
00:14:57और वह पता लगाता है कि समस्या कहाँ हुई। क्या यह विचार-श्रृंखला
00:15:02तर्क की तरह है? या क्या कुछ गलत टूल कॉल किए गए हैं, रिट्रीवल ने काम नहीं किया? तो वे पूरे
00:15:08सत्यापन और मूल रूप से मॉडल बुद्धिमत्ता स्तर दोनों पर प्रत्येक हुक और नोड को समझना,
00:15:14साथ ही कठिनाई स्तर पर समझना ही वह चीज़ है जिसका आप पता लगाते हैं और कहते हैं कि, ठीक है, ये वे सुधार हैं
00:15:20जो मुझे इन नमूनों पर करने की आवश्यकता है, जो हमारे सिस्टम द्वारा गलत तरीके से लिए गए थे। तो एक बार जब आपके पास
00:15:28यह चीज़ आ जाती है, आपके पास सकारात्मक नमूना, नकारात्मक नमूना होता है, किसे अपडेट करने की आवश्यकता है और यहीं पर आप
00:15:34यह देखने के लिए अपने मॉडल को फिर से प्रशिक्षित (री-ट्रेन) करते हैं कि हम इसे बेहतर कैसे बना सकते हैं। और यह एक निरंतर सुधार है
00:15:40जहाँ हम इन नमूनों को देख रहे हैं, फिर से ट्यून कर रहे हैं, मॉडलों में सुधार कर रहे हैं और प्रोडक्शन नमूनों से
00:15:46एक नया डेटासेट प्राप्त कर रहे हैं और यह समझने की कोशिश कर रहे हैं कि क्या बदलाव (ड्रिफ्ट) हुआ है या वास्तव में
00:15:53मॉडल क्या कर रहा है। तो यह ह्यूमन-इन-द-लूप हमेशा एक निरंतर चलने वाली प्रक्रिया की तरह है जहाँ आपके पास दैनिक
00:15:58प्रोडक्शन से नमूने लिए जाते हैं और यह समझने की कोशिश की जाती है कि मॉडल और जज के रूप में LLM कैसा प्रदर्शन कर रहे हैं।
00:16:05इसलिए लागत और इस पैमाने पर हल करने की क्षमता के कारण, हम फ़्रंटियर आकार के मानक VLM मॉडल
00:16:14के साथ नहीं जा सकते क्योंकि यह स्केलेबल नहीं है, इसके लिए बहुत सारे अनुमान, बहुत सारी जटिलता की आवश्यकता होती है,
00:16:20और हम एक बहुत ही विशिष्ट समस्या का समाधान कर रहे हैं। जैसे, मुझे वास्तव में कोई फ़र्क नहीं पड़ता कि मॉडल कोडिंग समस्या हल कर सकता है या नहीं।
00:16:25मुझे केवल अपनी डोमेन-विशिष्ट समस्या की परवाह है। मुझे बस इतनी ही परवाह है। यह ग्राहक के सामने उजागर नहीं होता है,
00:16:31यह एक आंतरिक चीज़ है। इसलिए मैं वास्तव में एक ऑफ-पॉलिसी और ऑन-पॉलिसी नॉलेज डिस्टिलेशन करूँगा
00:16:37और यह समझने के लिए कुछ प्रयोगात्मक क्वांटाइजेशन के आधार पर थोड़ा क्वांटाइजेशन करूँगा
00:16:41कि क्या 4-बिट काम करता है, ब्रेन फ़्लो, वास्तव में क्या बहुत अच्छी तरह से काम करता है। फिर मेरे पास डिस्टिलेशन और क्वांटाइजेशन के
00:16:47विभिन्न आकारों की एक तालिका होगी और यह समझूँगा और देखूँगा कि मेरा प्रदर्शन वास्तव में कहाँ पर
00:16:54मानक के अनुसार है और यह ऑप्टिमाइजेशन करके मुझे अनुमान (इन्फरेंस) के उत्पादन में गणना और लागत संसाधनों की
00:17:00बहुत बचत कहाँ हो रही है। तो यह वास्तव में महत्वपूर्ण है क्योंकि एक समस्या के रूप में,
00:17:07हमने जो हल किया है, वह सब अच्छा है। लेकिन प्रोडक्शन में, इसे स्केलेबल होना चाहिए। इसे
00:17:13किफायती होना चाहिए। यह सिर्फ ऐसा नहीं हो सकता जो बाज़ार में उपलब्ध हो -- जो बस बाज़ार में आ गया हो
00:17:21क्योंकि हम यहाँ एक बहुत ही विशिष्ट समस्या को हल कर रहे हैं। मूल्यांकन (मूल्यांकन) पर वापस आते हुए, मूल रूप से,
00:17:27पहला कार्य की सफलता है। बेशक, ये बाइनरी चीज़ें हैं। मॉडैलिटी हुई या नहीं हुई।
00:17:31जैसे अलाइनमेंट है या डिस-अलाइनमेंट है। तो प्रिसिजन, रिकॉल और F1 यह समझने के लिए स्पष्ट मैट्रिक्स हैं
00:17:37कि कार्य की सफलता क्या है। लेकिन हम सिस्टम को बहुत ही समग्र (होलिस्टिक) तरीके से देखना चाहते हैं,
00:17:42न केवल अंतिम लक्ष्य की तरह, बल्कि प्रत्येक नोड पर क्या हो रहा है, रिट्रीवल सिस्टम कितनी अच्छी तरह
00:17:47काम कर रहा है, सिस्टम की लेटेंसी और रिकॉल क्या है, और हम इसके तर्क को कितनी अच्छी तरह समझ पा रहे हैं। प्रत्येक
00:17:53एजेंटिक स्तर पर या जहाँ भी इसके तर्क लागू होते हैं, इन मॉडलों से आने वाला विचार-श्रृंखला तर्क क्या है,
00:17:59जो मूल रूप से हमारे मामले में एक रिव्यूअर एजेंट है? और उसकी गुणवत्ता क्या है? क्या यह
00:18:04ज्यादा सोचने (ओवरथिंकिंग) जैसा है? क्या हम यह सुनिश्चित करने के लिए कहीं बजट कम कर सकते हैं कि मॉडल वास्तव में
00:18:09कम बजट में अच्छा काम कर रहा है? या क्या हम चीजों की योजना या तर्क के बजट को बढ़ा सकते हैं
00:18:16ताकि इसका बजट अधिक हो और यह सुनिश्चित हो सके कि हम जिस जटिल समस्या को हल कर रहे हैं,
00:18:22उसका प्रदर्शन और सटीकता कहीं अधिक हो सकती है। इसलिए एक एडेप्टिव रीज़निंग बजट का होना भी
00:18:29काफी महत्वपूर्ण है। और फिर हमारे पास रोबस्टनेस है। हम कौन से अपवाद (एज केस) देख रहे हैं? हमारी एरर रेट
00:18:34क्या है? वे कौन से अलग-अलग नोड्स और हुक हैं जहाँ ये हो रहे हैं? क्या यह टूल कॉल की तरह है जो वास्तव में बहुत
00:18:39अच्छी तरह से काम नहीं कर रहा है? क्या यह रिट्रीवल वाला हिस्सा है या LLM अच्छा काम नहीं कर रहा है या उस तरह की चीजें। और
00:18:45फिर हमारे पास सिस्टम दक्षता है जहाँ हम केवल आउटपुट और बाकी सब चीजों के प्रदर्शन को नहीं देख रहे हैं,
00:18:51बल्कि हम टोकन लागत के प्रत्येक पहलू को देख रहे हैं, हम कौन से LLM कॉल कर रहे हैं? क्या हम
00:18:56वास्तव में लागत बचाने के लिए LLM को थोड़ा और ऑप्टिमाइज़ कर सकते हैं? हम क्या दक्षता देख रहे हैं और
00:19:01प्रत्येक एजेंट और पूरे सिस्टम की कुल लेटेंसी क्या है? फिर हमारे पास एक जज के रूप में LLM है जहाँ हम देखते हैं
00:19:08कि किसी भी प्रेडिक्शन सिस्टम में, हमेशा एक डेटा ड्रिफ्ट होता है, खासकर तब जब आपके पास
00:19:14उपयोगकर्ता द्वारा जनरेट किया गया कंटेंट होता है। तो एक जज के रूप में हमारा LLM, जो मूल्यांकन और बाकी सब चीजों के लिए उपयोग किया जाता है,
00:19:20मानव कतार (ह्यूमन क्यू) के संबंध में कैसा प्रदर्शन कर रहा है? क्या कोई बदलाव (ड्रिफ्ट) हो रहा है? क्या हमें लेबलिंग टीम से आ रहे
00:19:25नए डेटा सेट पर एक जज के रूप में अपने LLM को फिर से प्रशिक्षित करने की आवश्यकता है? या हम वास्तव में उन भागों पर कैसा प्रदर्शन करते हैं? ऑप्टिमाइजेशन
00:19:30में, हमारे पास स्पैचियो-टेम्पोरल रिडक्शन ऑप्टिमाइजेशन है, जो वास्तव में फ़्रेम को देखता है,
00:19:35जो समान हैं और बस उन्हें एक पहलू में कंप्रेस कर देता है। यह वीडियो की कुल प्रोसेसिंग को
00:19:41बहुत बड़े पैमाने पर कम कर देता है। दूसरा वाला मूल रूप से आपके पास एक कैशिंग है, आपके पास वायरल
00:19:47कंटेंट है, जो मूल रूप से सामने आ रहा है, और आप वहाँ एक ही कंटेंट नहीं रखना चाहते हैं,
00:19:52जो पूरी पाइपलाइन से गुजर रहा है। और वहीं पर आपके पास एक उच्च समानता (सिमिलरिटी) स्कोर होता है और आप बस
00:19:57मल्टी-एजेंट सिस्टम को छोड़ देते हैं और उस पर सीधे कॉल करते हैं। तीसरा, जो वास्तव में महत्वपूर्ण है,
00:20:01वह है मेटाडेटा प्रूनिंग। यह वह जगह है जहाँ हम वास्तव में कुछ मेटाडेटा के आधार पर बहुत सारे उम्मीदवारों से स्थान को छोटा करते हैं,
00:20:07उदाहरण के लिए, कुछ विषय और कुछ क्रिएटर जिनका रिकॉर्ड पहले से ही बहुत अच्छा है।
00:20:12इसका मतलब है कि हमें वास्तव में क्रिएटर की इन सभी छवियों, इन सभी वीडियो को प्रोसेस करने की आवश्यकता नहीं है,
00:20:18जिसका प्रामाणिकता (ऑथेंटिसिटी) स्कोर बहुत अच्छा और उच्च है, जो इस पर वास्तव में अच्छा प्रदर्शन कर रहे हैं,
00:20:22जहाँ वीडियो की गुणवत्ता वास्तव में उच्च है, जुड़ाव (एंगेजमेंट) अच्छा है। उस तरह की चीजें, मेटाडेटा कुछ ऐसा है
00:20:27जिसका उपयोग वीडियो को फ़िल्टर करने के लिए किया जा सकता है, जिसे सिस्टम में जाना ही नहीं चाहिए। इसलिए इनमें से कुछ
00:20:33फ्लैग मददगार होंगे। तो आखिरी मुख्य बात जो हम मूल रूप से इस सत्र से सीख सकते हैं वह यह है कि,
00:20:42समस्या को तोड़ना (डीकंपोज़ करना) महत्वपूर्ण है, या आवश्यकता पड़ने पर समस्या को छोटे भागों में तोड़ें। एडेप्टिव ऑप्टिमाइजेशन
00:20:50ROI और लागत व्यवहार्यता के लिए वास्तव में महत्वपूर्ण है। अच्छा मूल्यांकन सर्वोपरि है। हर चीज़
00:20:56इसी पर निर्भर करती है। यह आपके पूरे सिस्टम और पूरे VLM की नींव है। और प्रेडिक्शन मॉनिटरिंग
00:21:02और गुणात्मक सुधार यह सुनिश्चित करने के लिए वास्तव में आवश्यक हैं कि यह लंबी अवधि में टिकाऊ रहे।
00:21:08इसके साथ ही, मैं इसे समाप्त करूँगा। सुनने के लिए आपका बहुत-बहुत धन्यवाद।
Community Posts
No posts yet. Be the first to write about this video!
Write about this video