स्कील इशू: विज़न लैंग्वेज मॉडल को डिप्लॉय करना बंद करें, Skills के साथ उनका इस्तेमाल करें — मर्वे नोयान, हगिंग फेस
AAI Engineer
Computing/SoftwareSmall Business/Startups
Transcript
00:00:00नमस्कार और “स्किल इश्यू” (कौशल की कमी) पर इस टॉक में आपका स्वागत है। दरअसल, अब यह कोई स्किल इश्यू नहीं रह गया है। इस टॉक के अंत तक
00:00:22अगर आप विजन मॉडल का उपयोग नहीं कर रहे हैं, तो भी आप उनसे काफी कुछ बनाने में सक्षम हो जाएंगे।
00:00:27संक्षेप में मेरे बारे में, मैं मर्व हूँ। मैं LLaVA के शुरुआती दिनों से ही कंप्यूटर विजन पर काम कर रही हूँ और हाल ही में मैं एजेंट्स और ऑन-डिवाइस चीजों पर अधिक काम करती हूँ। मुझे विजन लैंग्वेज मॉडल इतने पसंद हैं कि मैंने इस पर एक किताब भी लिखी है। लेकिन अब मैं नहीं चाहती कि डेवलपर्स सीधे विजन लैंग्वेज मॉडल का उपयोग करें, बल्कि चाहती हूँ कि हर एक डेवलपर एंड-टू-एंड विजन एप्लीकेशन
00:00:54बनाना शुरू करे। यह टॉक्स आपको ऐसा करने के लिए एक अच्छी बुनियादी समझ देगा। डेवलपर्स के साथ जो एक आम बात मैंने देखी है, वह यह है कि वे हर चीज़ के लिए विजन लैंग्वेज मॉडल का उपयोग करने की कोशिश करते हैं, लेकिन आपको कभी भी रियल-टाइम परफॉर्मेंस नहीं मिलेगी। और जब मैं रियल-टाइम की बात करती हूँ, तो मेरा मतलब है जैसे आपके पास एक टोस्टर है
00:01:18और उस पर आपको 30-40 fps मिल रहे हों, चाहे आप इमेज क्लासिफिकेशन, इंस्टेंस सेगमेंटेशन या कुछ भी बना रहे हों।
00:01:28और वे उतने मजबूत नहीं होते। उदाहरण के लिए, अगर आप RFDTR जैसा मॉडल ट्रेन करते हैं, जिसके बारे में जोसेफ ने पहली टॉक में बात की थी,
00:01:39तो यह हमेशा आपके विजन लैंग्वेज मॉडल से बेहतर प्रदर्शन करेगा, और मैं आज इसे साबित करने जा रही हूँ।
00:01:47और दाईं ओर आप मुझे RFDTR का उपयोग करके काम करते हुए देख सकते हैं।
00:01:52दूसरी बात यह है कि लोग लाइसेंस नहीं पढ़ते। जब भी मैं ऑब्जेक्ट डिटेक्शन के बारे में कुछ पोस्ट करती हूँ, तो लोग हमेशा YOLO के बारे में पूछते हैं। YOLO एक अच्छा मॉडल है, लेकिन इसमें शायद GPL 3.0 लाइसेंस है,
00:02:07और मैं शर्त लगा सकती हूँ कि कुछ डेवलपर्स बिना यह जाने इसे डिप्लॉय कर देते हैं
00:02:12कि उन्हें इसके लिए भुगतान करना होगा। तो हाँ, मैं चाहती हूँ कि आप आज Apache 2.0 मॉडल पर माइग्रेट करें।
00:02:23और इसके लिए मैंने “वाइब विजन” नाम से कुछ बनाया है, जो माज़ियार की एक पोस्ट से प्रेरित है।
00:02:30मूल रूप से वे क्या करते हैं कि वे Gemma 4 को कॉल करने के लिए एक टूल के रूप में SAM 3.1 मॉडल देते हैं, और मुझे यह बहुत
00:02:39प्रभावशाली लगता है। आज मैंने एक टूलकिट बनाई है जहाँ आप इससे भी ज़्यादा चीज़ों के साथ ऐसा कर सकते हैं।
00:02:49तो एक तरह से मैं अपने अनुभव का निचोड़ साझा कर रही हूँ। सबसे पहले, इस टूलकिट में टूल के रूप में मेरे पसंदीदा मॉडल शामिल हैं,
00:02:57ताकि आप इन्हें अपने एजेंट को दे सकें, क्योंकि आपका कोडिंग एजेंट एक तरह से अनुभवहीन कंप्यूटर विजन
00:03:03इंजीनियर की तरह ही होता है। जब भी मैं कोई मॉडल चुनती हूँ, तो हमेशा इन बातों पर ध्यान देती हूँ:
00:03:09सबसे पहली प्राथमिकता मेरे लिए लाइसेंस की होती है। यह Apache 2.0, MIT या फिर
00:03:16कोई गैर-व्यावसायिक लाइसेंस होना चाहिए। दूसरा, इसके आकार और आर्किटेक्चरल विकल्पों के आधार पर परफ़ॉर्मेंस भी
00:03:24बराबर स्तर की होनी चाहिए। इसलिए जब भी कंप्यूटर विजन कॉन्फ्रेंस से कोई नया मॉडल आता है, तो मैं बेंचमार्क चेक करती हूँ।
00:03:31और तीसरी बात, वाइब्स। इस टूलकिट का एक दूसरा हिस्सा भी है, जो थोड़ा “वाइब ट्रेनिंग” जैसा है,
00:03:41और यह सबसे रोमांचक हिस्सा है। तो मैं पहले इस पर बात करूँगी। एक विजन एप्लीकेशन बनाने के लिए मैंने खुद को
00:03:47डेवलपर्स की जगह रखकर सोचा। अगर मेरे पास लेबल वाली इमेजेस हैं, तो आसान है, मैं बस एक मॉडल ट्रेन कर सकती हूँ
00:03:55या अपने कंप्यूटर विजन एजेंट को ऐसा करने के लिए कुछ ट्यूटोरियल दे सकती हूँ, क्योंकि यह सब उपलब्ध है
00:04:02जैसे हमने इसके लिए ट्रांसफॉर्मर बनाए हैं। लेकिन अगर मेरे पास केवल इमेजेस हैं, तो मुझे एनोटेट करना होगा, फिर
00:04:11उन एनोटेशन का मूल्यांकन करना होगा और फिर मॉडल को ट्रेन करना होगा। लेकिन बड़े पैमाने पर आप यह कैसे कर सकते हैं? आप दरअसल एक विजन
00:04:17लैंग्वेज मॉडल को लेबलर की तरह और दूसरे विजन लैंग्वेज मॉडल को जज की तरह इस्तेमाल करके मनचाहा मॉडल ट्रेन कर सकते हैं।
00:04:24लेकिन यह पाइपलाइन कैसी दिखती है? बेसिकली मैंने इसे बनाया है और इसमें लेबलिंग के लिए VLM, जज के रूप में VLM
00:04:35और फिर ट्रेनिंग शामिल है। कोडिंग एजेंट्स के लिए यह थोड़ा लंबे समय वाला कार्य है और इसमें काफी
00:04:42इन्फ्रास्ट्रक्चर सपोर्ट है। आप इसे स्थानीय रूप से या रिमोटली कर सकते हैं। यह Hugging Face
00:04:48इन्फ्रास्ट्रक्चर पर चलता है। हमारे पास ऐसे जॉब्स हैं जो आपको एक बार में बैच प्रोसेसिंग या ट्रेनिंग करने की सुविधा देते हैं।
00:04:54हमारे पास इंफ़रेंस प्रोवाइडर्स नामक एक सर्वरलेस राउटिंग सिस्टम भी है जहाँ आप कई
00:05:00प्रोवाइडेर्स का उपयोग कर सकते हैं। डेटासेट रिपॉजिटरी और मॉडल रिपॉजिटरी के अलावा
00:05:07हमारे पास इंटरमीडिएट डेटा स्टोर करने के लिए बकेट्स भी हैं। लेकिन इस काम को क्या संभव बनाता है? सबसे पहले, मेरा पसंदीदा मॉडल RFDTR,
00:05:17RFDTR सेगमेंटेशन। मैं फिलहाल सेगमेंटेशन पर ही काम कर रही हूँ। लंबे समय वाले कार्यों के लिए हमारे पास बेहतर एजेंट्स हैं,
00:05:24जहाँ आपको लेबलिंग प्रक्रिया, ट्रेनिंग प्रक्रिया आदि पर नज़र रखनी होती है।
00:05:32और छोटे लेकिन अधिक सक्षम विजन मॉडल आपको बहुत कम लागत में डेटा लेबल करने की सुविधा देते हैं। साथ ही
00:05:40ट्रांसफॉर्मर्स के v5 रीफैक्टरिंग आदि के साथ, यह इस समय विजन मॉडल्स के लिए बेहतर प्रदर्शन करता है।
00:05:47और यह पाइपलाइन असल में कुछ ऐसी दिखती है: सबसे पहले मैं डेटासेट को लेबल करती हूँ, जैसे मैं कोई इमेज
00:05:54डेटासेट लेती हूँ और उसे Qwen 3.5 9B से लेबल करती हूँ। फिर मैं इस
00:06:02लेबल किए गए डेटासेट को दो जज मॉडल्स के पास भेजती हूँ। पहला है Gemma 4 E4B, जो एक 8B जज है, और दूसरा है
00:06:10LFM 2.5 VL, जो लगभग 2B का एक छोटा मॉडल है। शोध के अनुसार छोटे जज मॉडल्स के समूह (ensemble) का उपयोग करना
00:06:18ज्यादा बेहतर रहता है। इसके बाद मैं उनके फैसलों को मिलाती हूँ। मैंने इससे जुड़े रिसर्च को भी
00:06:26देखा है, जहाँ ज़्यादातर लोग VLM या LLM से कोई स्कोर असाइन करने को कहते हैं, लेकिन वे स्कोर
00:06:34बिल्कुल काम नहीं करते, खासकर तब जब आपके जज मॉडल्स अलग-अलग आकार के हों। फिर मैं इसे
00:06:40RFDTR Medium या Large को ट्रेन करने के लिए भेजती हूँ। मैंने Roboflow के लोगों से बात की थी और उन्होंने इसका उपयोग करने के लिए प्रोत्साहित किया।
00:06:47और यह वास्तव में काम करता है, मैं आपको जल्द ही दिखाऊँगी। लेकिन यह काम कैसे करता है? आप
00:06:55रिपॉजिटरी लेते हैं और बस पूछते हैं कि क्या आप इसे ट्रेन कर सकते हैं? क्या आप Hub पर मौजूद इस डेटासेट पर
00:07:04ट्रेनिंग कर सकते हैं? और फिर यह शुरू हो जाएगा। अगर डेटासेट में पहले से लेबल हैं, तो आप सीधे
00:07:11ट्रेनिंग शुरू कर सकते हैं। लेकिन अगर लेबल नहीं हैं, तो आप एनोटेट करना शुरू कर सकते हैं। इसमें ट्रिक यह है कि
00:07:19मैं जज को इमेजेस पर ओवरले किए गए बाउंडिंग बॉक्स भेजती हूँ। तकनीकी रूप से Qwen
00:07:27बाउंडिंग बॉक्स को टोकन के रूप में आउटपुट करता है, मैं उन्हें वैसे नहीं भेजती। मैं बस बाउंडिंग बॉक्स को इमेज पर ओवरले करती हूँ
00:07:33और उस इमेज को कुछ लेबल और उनके विवरण के साथ भेजती हूँ। मैं कहती हूँ कि अगर इस लेबल विवरण का बाउंडिंग बॉक्स
00:07:40इस पर मौजूद है, तो बस मुझे बताएं कि आप इसे मंज़ूरी देते हैं या नहीं। फिर मैं जज के फैसलों को
00:07:49न्यूनतम सहमति (minimum agreement) के आधार पर मिलाती हूँ, न कि पूर्ण सहमति (consensus) पर। मैं आगे बताऊँगी कि मैंने ऐसा क्यों किया।
00:07:56ये लेबल विवरण भी कोडिंग एजेंट्स द्वारा जनरेट किए जाते हैं और एक इंसान के रूप में आप बस उन्हें मंज़ूरी देते हैं।
00:08:03इस पाइपलाइन में इस्तेमाल किए गए सभी मॉडल्स में Apache 2.0 लाइसेंस है, सिवाय
00:08:10LFM मॉडल के, जिसमें एक खास तरह का लाइसेंस है जहाँ अगर आपकी कमाई एक निश्चित राशि से अधिक होती है,
00:08:19तभी आपको भुगतान करना होता है। लेकिन आप इसे आराम से इस्तेमाल कर सकते हैं। इस पाइपलाइन की निगरानी करने वाले
00:08:26कोडिंग एजेंट्स के लिए, मैंने शुरू में Opus 4.8 के साथ निर्माण किया और फिर GLM 5.2 के साथ वर्कफ़्लो चलाया,
00:08:35जो सच कहूँ तो लंबे कार्यों पर अच्छा काम कर रहा है। इन्फ्रास्ट्रक्चर की बात करें तो मैं Hugging Face में काम करती हूँ,
00:08:42मेरे पास बहुत सारे कंप्यूट क्रेडिट्स हैं और मुझमें सब्र बिल्कुल नहीं है, इसलिए मैं प्रयोगों के लिए अच्छी-खासी मात्रा में
00:08:50हार्डवेयर का उपयोग करती हूँ। लेकिन मैंने इसका परीक्षण किया और मॉडल ट्रेन करने के लिए इस पूरी पाइपलाइन को चलाने में केवल तीन-चार डॉलर लगते हैं,
00:08:58जो मेरे हिसाब से कमाल है। शुरुआत में Qwen 3.5 के लिए मैंने सर्वरलेस का इस्तेमाल किया क्योंकि यह सुविधाजनक और काफी सस्ता था। तो मैंने DeepInfra का इस्तेमाल किया,
00:09:05जो बेहद सस्ता है। Together का उपयोग करने के बजाय अगर आप जॉब्स के ज़रिए बैच प्रोसेसिंग करते हैं तो बेहतर होगा।
00:09:12और जजिंग के लिए मैंने Hugging Face Jobs का उपयोग किया जो कम खर्चीला है। ट्रेनिंग के लिए फिर से मैंने L4 का उपयोग किया,
00:09:19लेकिन मॉडल काफी छोटा है। RFDTR बहुत छोटा है और आप किसी अन्य विकल्प का उपयोग कर सकते हैं।
00:09:27अगर आप चाहें तो इसे लोकल सिस्टम पर भी कर सकते हैं। बस मुझे जल्दी नतीजे चाहिए थे और बड़ा बैच साइज़ चाहिए था। तो हाँ, मैंने दो समस्याओं पर इसका परीक्षण किया:
00:09:33पहला, रोड साइन डिटेक्शन और दूसरा, डॉक्यूमेंट पार्सिंग। रोड साइन डिटेक्शन के लिए
00:09:42मेरे पास पहले से ही एनोटेशन थे, तो मैंने अपने पाइपलाइन के प्रदर्शन की तुलना ओरिजिनल (ground truth) एनोटेशन से की।
00:09:48लेकिन डॉक्यूमेंट पार्सिंग के लिए मैं ऐसा नहीं कर सकी, क्योंकि मैंने DocVQA डेटासेट का उपयोग किया था।
00:09:54असल समस्या यह थी कि मैं इमेजेस, टेबल्स, सिग्नेचर जैसी चीज़ों को निकालना चाहती थी,
00:10:02जो एक नया काम था। मैं देखना चाहती थी कि क्या RFDTR इसे वास्तव में सीख सकता है। पहला परिणाम: यह काम करता है!
00:10:08हमारे पास 50 से अधिक का एक अच्छा मीन एवरेज प्रिसिजन (mAP) है। मैं इसकी तुलना ऐसे करती हूँ: मेरे पास एक टेस्ट सेट है,
00:10:19और मैं उस टेस्ट सेट को Qwen से गुज़ारती हूँ, फिर मैं छद्म-एनोटेशन (pseudo-annotations)
00:10:29और उस टेस्ट सेट के सटीक (ground truth) एनोटेशन से उसकी तुलना करती हूँ। थोड़ा अंतर है, लेकिन इसकी उम्मीद थी
00:10:35क्योंकि यह Qwen से सीखा गया है। इसके अलावा, सच कहूँ तो इस तरह के इस्तेमाल के लिए
00:10:42ROC-AUC स्कोर भी काफी अच्छा है। और डॉक्यूमेंट पार्सिंग के मामले में, यह वास्तव में नए डेटा पर लागू (generalize) होता है, जो मेरे लिए अद्भुत है।
00:10:50यहाँ ट्रेन किए गए मॉडल का आउटपुट आप देख सकते हैं, इसने सिग्नेचर की पहचान कर ली, जबकि
00:10:58उसी टेस्ट सेट के Qwen एनोटेशन से वह छूट गया था। इसलिए मैं कहना चाहूँगी कि यह बहुत अच्छी तरह से काम करता है।
00:11:06और इसका श्रेय RFDTR की बैकबोन क्षमता को जाता है।
00:11:12यहाँ आप यह भी देख सकते हैं कि यह इमेजेस को तकनीकी रूप से कैसे कैप्चर करता है, और यह बिल्कुल सटीक है। इसे बनाते समय
00:11:21मैंने ध्यान दिया कि मुझे विजन एजेंट्स के साथ काम करने का सही तरीका नहीं पता था। तो इससे जुड़ी कुछ बातें सामने आईं:
00:11:30सबसे पहले, जजिंग में बहुत बड़ा असंतुलन है। समस्या के आधार पर LFM बहुत सी चीज़ों को खारिज कर देता है।
00:11:37इसीलिए मैं पूर्ण सहमति (consensus) नहीं ले सकी, क्योंकि अगर मैं उन सभी उदाहरणों को हटा देती
00:11:44जिन पर LFM और Gemma दोनों हटाने के लिए सहमत थे, तो मेरे पास बहुत कम उदाहरण बचते,
00:11:50जिससे मॉडल की सीखने और लागू होने की क्षमता कमजोर हो जाती। इसलिए मैंने यह तय किया कि अगर कोई एक भी 'हाँ' कहता है,
00:11:58तो मैं उस उदाहरण को शामिल करूँगी। और फिर भी इसने अच्छा काम किया। लेकिन अगर आपके पास एक बड़ा डेटासेट है और आप रिकॉल (recall) की परवाह करते हैं,
00:12:04तो मेरा सुझाव है कि आप सर्वसम्मति लें या निरीक्षण करें। डॉक्यूमेंट पार्सिंग के लिए यह अंतर
00:12:09उतना बड़ा नहीं है। दूसरी बात, प्रॉम्प्ट जनरेशन थोड़ा मुश्किल है। यही एकमात्र ऐसा हिस्सा है जहाँ एक इंसान के रूप में
00:12:17आपको यह मंज़ूर करना होता है कि मॉडल ने जज के लिए सही प्रॉम्प्ट बनाए हैं।
00:12:28और फिर आप कहेंगे, “ठीक है, मैं इसे मंज़ूरी देता हूँ,” क्योंकि आपको अभी भी अपने डेटासेट पर
00:12:35थोड़ी नज़र डालनी पड़ती है, इससे बचा नहीं जा सकता। और तीसरी बात, जो बहुत दिलचस्प है,
00:12:42आपका कोडिंग एजेंट चाहे कितना भी अच्छा क्यों न हो—जैसे आप Opus 4.8 लें, जो एक बहुत अच्छा
00:12:52कोडिंग एजेंट है—कंप्यूटर विजन इंजीनियर के रूप में उसे सही समझ नहीं होती और उसमें व्यावहारिक समझ (common sense) की कमी होती है।
00:12:59उदाहरण के लिए, यह ट्रैफिक साइन्स को हॉरिजॉन्टल फ्लिप कर रहा था या ट्रैफिक लाइट्स में जिटर जोड़ रहा था,
00:13:06जिससे डेटासेट खराब हो जाता। इसलिए मैंने इसे बाद में ठीक किया, ताकि
00:13:14आप यह तय कर सकें कि ऑग्मेंटेशन करना है या नहीं, और आपका कोडिंग एजेंट इसमें आपकी मदद करेगा।
00:13:21और अंत में, इस टूलकिट का दूसरा हिस्सा मेरे पसंदीदा मॉडल्स को टूल्स के रूप में इस्तेमाल करना है।
00:13:30और आख़िर में, इस टूलकिट का दूसरा हिस्सा है मेरे पसंदीदा मॉडल्स टूल के रूप में।
00:13:35तो यह रिपॉजिटरी डेप्थ एस्टीमेशन से लेकर ज़ीरो-शॉट सेगमेंटेशन तक मेरे पसंदीदा मॉडल्स को कवर करती है।
00:13:42और यह आंशिक रूप से हगिंग फेस बेंचमार्क द्वारा संचालित है जिन्हें हमने कुछ महीने पहले ही शुरू किया था,
00:13:48मूल रूप से हमारे पास एक बेंचमार्क लीडरबोर्ड है और वहाँ पर
00:13:55आपके पास ओपन मॉडल्स के साथ-साथ उनके इवैल्यूएशन परिणाम भी हैं, और आप अलग-अलग साइज़ के मॉडल्स की तुलना कर सकते हैं।
00:14:02तो मैं इसे अपडेट रखता हूँ, लेकिन यह आंशिक रूप से मेरे द्वारा भी संचालित है जिसे
00:14:13कंप्यूटर विज़न कॉन्फ्रेंस पेपर्स पढ़ना पसंद है, इसलिए मैं इस मॉडल की तारीफ़ करना चाहूँगा क्योंकि
00:14:20बहुत से लोग इसके बारे में नहीं जानते। मूल रूप से, SAM ओपन-एंडेड रेफ़रेंस सेगमेंटेशन नहीं कर सकता,
00:14:26जैसे अगर आप कहें "इस लाल कार को सेगमेंट करो" तो वह कर देगा, लेकिन अगर आप कहें "नारंगी कार के बगल वाली लाल कार
00:14:33जो नीली कार के बगल में है", तो वह ऐसा नहीं कर पाएगा। और Falcon perception, जो कि
00:14:39TII का एक मॉडल है, वास्तव में यह कर सकता है, और यह Apache 2.0 लाइसेंस के साथ केवल 600 मिलियन पैरामीटर्स का है।
00:14:47तो यह मॉडल मेरे लिए ज़ीरो-शॉट सेगमेंटेशन करता है।
00:14:51और यह एक अधूरी सूची है; पोज़िंग के लिए हमारे पास Sapiens फ़ैमिली है,
00:14:58ह्यूमन-सेंट्रिक टास्क के लिए जहाँ आपको ह्यूमन की-पॉइंट डिटेक्शन, ह्यूमन
00:15:04डेप्थ एस्टीमेशन वगैरह करने की ज़रूरत होती है। और ज़ीरो-शॉट डिटेक्शन के लिए मेरे पास Moondream 3 और MM-Grounding-DINO है,
00:15:13जो Apache 2.0 लाइसेंस वाला मॉडल है। यह भी बहुत अच्छा है और Moondream की तुलना में बहुत छोटा है। मैं आपको
00:15:20अलग-अलग साइज़ में कई मॉडल्स देता हूँ जिन्हें आप अपने हार्डवेयर के हिसाब से चुन सकते हैं। अगर आप
00:15:25फ़ास्ट काम करना चाहते हैं, तो बस टाइनी विकल्प चुन लें। OCR के लिए मैंने उन्हें अलग-अलग साइज़ में almOCR बेंचमार्क से लिया है।
00:15:34और डेप्थ एस्टीमेशन के लिए मुझे पता चला कि बड़े मॉडल का लाइसेंस नॉन-कमर्शियल नहीं है,
00:15:40जबकि बाकी सभी का है, तो आप वास्तव में उसका उपयोग कर सकते हैं। उसका लाइसेंस Apache 2.0 जैसा ही है
00:15:45और यह Supervision व ट्रैकर सपोर्ट के साथ भी आता है। ये दोनों
00:15:51Roboflow की लाइब्रेरीज़ हैं जो आपको इंस्टेंस, बाउंडिंग बॉक्स वगैरह की ट्रैकिंग करने की अनुमति देती हैं।
00:16:00और भविष्य की योजनाएँ: सबसे पहले, मैं सुन सकता हूँ कि आप कह रहे हैं कि यह इंडस्ट्री के उपयोग के मामलों में काम नहीं करेगा,
00:16:06क्योंकि इंडस्ट्री यूज़ केसेस में अलग-अलग हिस्से होते हैं, जैसे नॉन-डिस्क्राइबेबल
00:16:13पार्ट्स, जहाँ नेचुरल लैंग्वेज एक अच्छा रास्ता नहीं है। तो मुझे लगता है कि उस मामले में इमेज-गाइडेड डिटेक्शन
00:16:21मदद कर सकता है। अगर आप इमेज-गाइडेड डिटेक्शन के बारे में नहीं जानते हैं, तो मूल रूप से आपके पास किसी इमेज का एक उदाहरण होता है,
00:16:27उदाहरण के लिए यहाँ Huggy, और फिर आप मॉडल से पूछते हैं कि इस इमेज में इस ऑब्जेक्ट को डिटेक्ट करो
00:16:36सभी इमेजेस में। मुझे लगता है कि यह इंडस्ट्री के उपयोग के मामलों में कुछ हद तक मदद कर सकता है जहाँ
00:16:41आप इसे नेचुरल लैंग्वेज द्वारा बयां नहीं कर सकते। इसके अलावा मैं इंटरसेक्शन ओवर
00:16:52यूनियन मर्जर जैसा कुछ आज़माना चाहता हूँ। मूल रूप से आपके पास लेबल्ड बॉक्स होते हैं और फिर जज के बॉक्स, जैसे आप जज से
00:17:00वास्तव में एक बॉक्स जनरेट करने को कहते हैं और फिर जज से रिजेक्ट या एक्सेप्ट कराने के बजाय आप इंटरसेक्शन ओवर यूनियन लेते हैं।
00:17:06और मैं अभी सेगमेंटेशन सपोर्ट पर काम कर रहा हूँ। सुनने के लिए धन्यवाद! यदि
00:17:14आप और अधिक जानना चाहते हैं, तो मूल रूप से मेरे पास एक छोटी विज़न रिपॉजिटरी है। इसमें मॉडल्स को फाइन-ट्यून करने,
00:17:20क्वांटाइज़ करने, मल्टी-मॉडल मॉडल्स, विज़न से जुड़ी हर चीज़ के बारे में सब कुछ है, साथ ही
00:17:27ट्रांसफ़ॉर्मर्स टास्क गाइड भी हैं, जिन्हें हम अपडेट रखते हैं। इसमें कई ट्यूटोरियल्स हैं। हमारे पास हगिंग फेस स्किल्स भी हैं
00:17:36जिसमें कंप्यूटर विज़न विशिष्ट स्किल्स के साथ-साथ इन्फ़्रा स्किल्स भी हैं, जिनसे आप आसानी से
00:17:43एक-प्रॉम्प्ट ट्रेनिंग दोबारा कर सकते हैं। और यह मेरा ट्विटर प्रोफ़ाइल है और यह रेपो वास्तव में GitHub पर है,
00:17:51mervenoyan vision-intern। मुझे लगता है कि मेरे पास एक सवाल के लिए समय है, बहुत-बहुत धन्यवाद।
00:18:04हाँ, वे पूछ रहे हैं कि क्या मेरी VLM को खुद ही ट्रेन करने की योजना है, जैसे सेल्फ-इम्प्रूवमेंट जैसा कुछ।
00:18:16वह बहुत रोमांचक होगा, लेकिन पहले मैं इस समस्या को हल करना चाहता हूँ कि डेवलपर्स वास्तव में
00:18:22टास्क-स्पेसिफ़िक मॉडल्स को ट्रेन करें और फिर एज पर डिप्लॉय करें। उसके बाद शायद वह आ सकता है। शायद एक और सवाल, हाँ?
00:18:34जी नहीं, वास्तव में ऐसा नहीं है। मुझे नहीं लगता। मैंने बस इसका इस्तेमाल किया क्योंकि मैं चाहता था... क्योंकि कोडिंग एजेंट के पास
00:18:44कॉन्टेक्स्ट होता है, इसलिए मैं चाहता था कि वह प्रॉम्प्ट जनरेट करे। शायद एक और सवाल? ठीक है, आपका बहुत-बहुत धन्यवाद!
00:19:04तो...
Community Posts
No posts yet. Be the first to write about this video!
Write about this video