स्कील इशू: विज़न लैंग्वेज मॉडल को डिप्लॉय करना बंद करें, Skills के साथ उनका इस्तेमाल करें — मर्वे नोयान, हगिंग फेस

AAI Engineer
Computing/SoftwareSmall Business/Startups

Transcript

00:00:00नमस्कार और “स्किल इश्यू” (कौशल की कमी) पर इस टॉक में आपका स्वागत है। दरअसल, अब यह कोई स्किल इश्यू नहीं रह गया है। इस टॉक के अंत तक
00:00:22अगर आप विजन मॉडल का उपयोग नहीं कर रहे हैं, तो भी आप उनसे काफी कुछ बनाने में सक्षम हो जाएंगे।
00:00:27संक्षेप में मेरे बारे में, मैं मर्व हूँ। मैं LLaVA के शुरुआती दिनों से ही कंप्यूटर विजन पर काम कर रही हूँ और हाल ही में मैं एजेंट्स और ऑन-डिवाइस चीजों पर अधिक काम करती हूँ। मुझे विजन लैंग्वेज मॉडल इतने पसंद हैं कि मैंने इस पर एक किताब भी लिखी है। लेकिन अब मैं नहीं चाहती कि डेवलपर्स सीधे विजन लैंग्वेज मॉडल का उपयोग करें, बल्कि चाहती हूँ कि हर एक डेवलपर एंड-टू-एंड विजन एप्लीकेशन
00:00:54बनाना शुरू करे। यह टॉक्स आपको ऐसा करने के लिए एक अच्छी बुनियादी समझ देगा। डेवलपर्स के साथ जो एक आम बात मैंने देखी है, वह यह है कि वे हर चीज़ के लिए विजन लैंग्वेज मॉडल का उपयोग करने की कोशिश करते हैं, लेकिन आपको कभी भी रियल-टाइम परफॉर्मेंस नहीं मिलेगी। और जब मैं रियल-टाइम की बात करती हूँ, तो मेरा मतलब है जैसे आपके पास एक टोस्टर है
00:01:18और उस पर आपको 30-40 fps मिल रहे हों, चाहे आप इमेज क्लासिफिकेशन, इंस्टेंस सेगमेंटेशन या कुछ भी बना रहे हों।
00:01:28और वे उतने मजबूत नहीं होते। उदाहरण के लिए, अगर आप RFDTR जैसा मॉडल ट्रेन करते हैं, जिसके बारे में जोसेफ ने पहली टॉक में बात की थी,
00:01:39तो यह हमेशा आपके विजन लैंग्वेज मॉडल से बेहतर प्रदर्शन करेगा, और मैं आज इसे साबित करने जा रही हूँ।
00:01:47और दाईं ओर आप मुझे RFDTR का उपयोग करके काम करते हुए देख सकते हैं।
00:01:52दूसरी बात यह है कि लोग लाइसेंस नहीं पढ़ते। जब भी मैं ऑब्जेक्ट डिटेक्शन के बारे में कुछ पोस्ट करती हूँ, तो लोग हमेशा YOLO के बारे में पूछते हैं। YOLO एक अच्छा मॉडल है, लेकिन इसमें शायद GPL 3.0 लाइसेंस है,
00:02:07और मैं शर्त लगा सकती हूँ कि कुछ डेवलपर्स बिना यह जाने इसे डिप्लॉय कर देते हैं
00:02:12कि उन्हें इसके लिए भुगतान करना होगा। तो हाँ, मैं चाहती हूँ कि आप आज Apache 2.0 मॉडल पर माइग्रेट करें।
00:02:23और इसके लिए मैंने “वाइब विजन” नाम से कुछ बनाया है, जो माज़ियार की एक पोस्ट से प्रेरित है।
00:02:30मूल रूप से वे क्या करते हैं कि वे Gemma 4 को कॉल करने के लिए एक टूल के रूप में SAM 3.1 मॉडल देते हैं, और मुझे यह बहुत
00:02:39प्रभावशाली लगता है। आज मैंने एक टूलकिट बनाई है जहाँ आप इससे भी ज़्यादा चीज़ों के साथ ऐसा कर सकते हैं।
00:02:49तो एक तरह से मैं अपने अनुभव का निचोड़ साझा कर रही हूँ। सबसे पहले, इस टूलकिट में टूल के रूप में मेरे पसंदीदा मॉडल शामिल हैं,
00:02:57ताकि आप इन्हें अपने एजेंट को दे सकें, क्योंकि आपका कोडिंग एजेंट एक तरह से अनुभवहीन कंप्यूटर विजन
00:03:03इंजीनियर की तरह ही होता है। जब भी मैं कोई मॉडल चुनती हूँ, तो हमेशा इन बातों पर ध्यान देती हूँ:
00:03:09सबसे पहली प्राथमिकता मेरे लिए लाइसेंस की होती है। यह Apache 2.0, MIT या फिर
00:03:16कोई गैर-व्यावसायिक लाइसेंस होना चाहिए। दूसरा, इसके आकार और आर्किटेक्चरल विकल्पों के आधार पर परफ़ॉर्मेंस भी
00:03:24बराबर स्तर की होनी चाहिए। इसलिए जब भी कंप्यूटर विजन कॉन्फ्रेंस से कोई नया मॉडल आता है, तो मैं बेंचमार्क चेक करती हूँ।
00:03:31और तीसरी बात, वाइब्स। इस टूलकिट का एक दूसरा हिस्सा भी है, जो थोड़ा “वाइब ट्रेनिंग” जैसा है,
00:03:41और यह सबसे रोमांचक हिस्सा है। तो मैं पहले इस पर बात करूँगी। एक विजन एप्लीकेशन बनाने के लिए मैंने खुद को
00:03:47डेवलपर्स की जगह रखकर सोचा। अगर मेरे पास लेबल वाली इमेजेस हैं, तो आसान है, मैं बस एक मॉडल ट्रेन कर सकती हूँ
00:03:55या अपने कंप्यूटर विजन एजेंट को ऐसा करने के लिए कुछ ट्यूटोरियल दे सकती हूँ, क्योंकि यह सब उपलब्ध है
00:04:02जैसे हमने इसके लिए ट्रांसफॉर्मर बनाए हैं। लेकिन अगर मेरे पास केवल इमेजेस हैं, तो मुझे एनोटेट करना होगा, फिर
00:04:11उन एनोटेशन का मूल्यांकन करना होगा और फिर मॉडल को ट्रेन करना होगा। लेकिन बड़े पैमाने पर आप यह कैसे कर सकते हैं? आप दरअसल एक विजन
00:04:17लैंग्वेज मॉडल को लेबलर की तरह और दूसरे विजन लैंग्वेज मॉडल को जज की तरह इस्तेमाल करके मनचाहा मॉडल ट्रेन कर सकते हैं।
00:04:24लेकिन यह पाइपलाइन कैसी दिखती है? बेसिकली मैंने इसे बनाया है और इसमें लेबलिंग के लिए VLM, जज के रूप में VLM
00:04:35और फिर ट्रेनिंग शामिल है। कोडिंग एजेंट्स के लिए यह थोड़ा लंबे समय वाला कार्य है और इसमें काफी
00:04:42इन्फ्रास्ट्रक्चर सपोर्ट है। आप इसे स्थानीय रूप से या रिमोटली कर सकते हैं। यह Hugging Face
00:04:48इन्फ्रास्ट्रक्चर पर चलता है। हमारे पास ऐसे जॉब्स हैं जो आपको एक बार में बैच प्रोसेसिंग या ट्रेनिंग करने की सुविधा देते हैं।
00:04:54हमारे पास इंफ़रेंस प्रोवाइडर्स नामक एक सर्वरलेस राउटिंग सिस्टम भी है जहाँ आप कई
00:05:00प्रोवाइडेर्स का उपयोग कर सकते हैं। डेटासेट रिपॉजिटरी और मॉडल रिपॉजिटरी के अलावा
00:05:07हमारे पास इंटरमीडिएट डेटा स्टोर करने के लिए बकेट्स भी हैं। लेकिन इस काम को क्या संभव बनाता है? सबसे पहले, मेरा पसंदीदा मॉडल RFDTR,
00:05:17RFDTR सेगमेंटेशन। मैं फिलहाल सेगमेंटेशन पर ही काम कर रही हूँ। लंबे समय वाले कार्यों के लिए हमारे पास बेहतर एजेंट्स हैं,
00:05:24जहाँ आपको लेबलिंग प्रक्रिया, ट्रेनिंग प्रक्रिया आदि पर नज़र रखनी होती है।
00:05:32और छोटे लेकिन अधिक सक्षम विजन मॉडल आपको बहुत कम लागत में डेटा लेबल करने की सुविधा देते हैं। साथ ही
00:05:40ट्रांसफॉर्मर्स के v5 रीफैक्टरिंग आदि के साथ, यह इस समय विजन मॉडल्स के लिए बेहतर प्रदर्शन करता है।
00:05:47और यह पाइपलाइन असल में कुछ ऐसी दिखती है: सबसे पहले मैं डेटासेट को लेबल करती हूँ, जैसे मैं कोई इमेज
00:05:54डेटासेट लेती हूँ और उसे Qwen 3.5 9B से लेबल करती हूँ। फिर मैं इस
00:06:02लेबल किए गए डेटासेट को दो जज मॉडल्स के पास भेजती हूँ। पहला है Gemma 4 E4B, जो एक 8B जज है, और दूसरा है
00:06:10LFM 2.5 VL, जो लगभग 2B का एक छोटा मॉडल है। शोध के अनुसार छोटे जज मॉडल्स के समूह (ensemble) का उपयोग करना
00:06:18ज्यादा बेहतर रहता है। इसके बाद मैं उनके फैसलों को मिलाती हूँ। मैंने इससे जुड़े रिसर्च को भी
00:06:26देखा है, जहाँ ज़्यादातर लोग VLM या LLM से कोई स्कोर असाइन करने को कहते हैं, लेकिन वे स्कोर
00:06:34बिल्कुल काम नहीं करते, खासकर तब जब आपके जज मॉडल्स अलग-अलग आकार के हों। फिर मैं इसे
00:06:40RFDTR Medium या Large को ट्रेन करने के लिए भेजती हूँ। मैंने Roboflow के लोगों से बात की थी और उन्होंने इसका उपयोग करने के लिए प्रोत्साहित किया।
00:06:47और यह वास्तव में काम करता है, मैं आपको जल्द ही दिखाऊँगी। लेकिन यह काम कैसे करता है? आप
00:06:55रिपॉजिटरी लेते हैं और बस पूछते हैं कि क्या आप इसे ट्रेन कर सकते हैं? क्या आप Hub पर मौजूद इस डेटासेट पर
00:07:04ट्रेनिंग कर सकते हैं? और फिर यह शुरू हो जाएगा। अगर डेटासेट में पहले से लेबल हैं, तो आप सीधे
00:07:11ट्रेनिंग शुरू कर सकते हैं। लेकिन अगर लेबल नहीं हैं, तो आप एनोटेट करना शुरू कर सकते हैं। इसमें ट्रिक यह है कि
00:07:19मैं जज को इमेजेस पर ओवरले किए गए बाउंडिंग बॉक्स भेजती हूँ। तकनीकी रूप से Qwen
00:07:27बाउंडिंग बॉक्स को टोकन के रूप में आउटपुट करता है, मैं उन्हें वैसे नहीं भेजती। मैं बस बाउंडिंग बॉक्स को इमेज पर ओवरले करती हूँ
00:07:33और उस इमेज को कुछ लेबल और उनके विवरण के साथ भेजती हूँ। मैं कहती हूँ कि अगर इस लेबल विवरण का बाउंडिंग बॉक्स
00:07:40इस पर मौजूद है, तो बस मुझे बताएं कि आप इसे मंज़ूरी देते हैं या नहीं। फिर मैं जज के फैसलों को
00:07:49न्यूनतम सहमति (minimum agreement) के आधार पर मिलाती हूँ, न कि पूर्ण सहमति (consensus) पर। मैं आगे बताऊँगी कि मैंने ऐसा क्यों किया।
00:07:56ये लेबल विवरण भी कोडिंग एजेंट्स द्वारा जनरेट किए जाते हैं और एक इंसान के रूप में आप बस उन्हें मंज़ूरी देते हैं।
00:08:03इस पाइपलाइन में इस्तेमाल किए गए सभी मॉडल्स में Apache 2.0 लाइसेंस है, सिवाय
00:08:10LFM मॉडल के, जिसमें एक खास तरह का लाइसेंस है जहाँ अगर आपकी कमाई एक निश्चित राशि से अधिक होती है,
00:08:19तभी आपको भुगतान करना होता है। लेकिन आप इसे आराम से इस्तेमाल कर सकते हैं। इस पाइपलाइन की निगरानी करने वाले
00:08:26कोडिंग एजेंट्स के लिए, मैंने शुरू में Opus 4.8 के साथ निर्माण किया और फिर GLM 5.2 के साथ वर्कफ़्लो चलाया,
00:08:35जो सच कहूँ तो लंबे कार्यों पर अच्छा काम कर रहा है। इन्फ्रास्ट्रक्चर की बात करें तो मैं Hugging Face में काम करती हूँ,
00:08:42मेरे पास बहुत सारे कंप्यूट क्रेडिट्स हैं और मुझमें सब्र बिल्कुल नहीं है, इसलिए मैं प्रयोगों के लिए अच्छी-खासी मात्रा में
00:08:50हार्डवेयर का उपयोग करती हूँ। लेकिन मैंने इसका परीक्षण किया और मॉडल ट्रेन करने के लिए इस पूरी पाइपलाइन को चलाने में केवल तीन-चार डॉलर लगते हैं,
00:08:58जो मेरे हिसाब से कमाल है। शुरुआत में Qwen 3.5 के लिए मैंने सर्वरलेस का इस्तेमाल किया क्योंकि यह सुविधाजनक और काफी सस्ता था। तो मैंने DeepInfra का इस्तेमाल किया,
00:09:05जो बेहद सस्ता है। Together का उपयोग करने के बजाय अगर आप जॉब्स के ज़रिए बैच प्रोसेसिंग करते हैं तो बेहतर होगा।
00:09:12और जजिंग के लिए मैंने Hugging Face Jobs का उपयोग किया जो कम खर्चीला है। ट्रेनिंग के लिए फिर से मैंने L4 का उपयोग किया,
00:09:19लेकिन मॉडल काफी छोटा है। RFDTR बहुत छोटा है और आप किसी अन्य विकल्प का उपयोग कर सकते हैं।
00:09:27अगर आप चाहें तो इसे लोकल सिस्टम पर भी कर सकते हैं। बस मुझे जल्दी नतीजे चाहिए थे और बड़ा बैच साइज़ चाहिए था। तो हाँ, मैंने दो समस्याओं पर इसका परीक्षण किया:
00:09:33पहला, रोड साइन डिटेक्शन और दूसरा, डॉक्यूमेंट पार्सिंग। रोड साइन डिटेक्शन के लिए
00:09:42मेरे पास पहले से ही एनोटेशन थे, तो मैंने अपने पाइपलाइन के प्रदर्शन की तुलना ओरिजिनल (ground truth) एनोटेशन से की।
00:09:48लेकिन डॉक्यूमेंट पार्सिंग के लिए मैं ऐसा नहीं कर सकी, क्योंकि मैंने DocVQA डेटासेट का उपयोग किया था।
00:09:54असल समस्या यह थी कि मैं इमेजेस, टेबल्स, सिग्नेचर जैसी चीज़ों को निकालना चाहती थी,
00:10:02जो एक नया काम था। मैं देखना चाहती थी कि क्या RFDTR इसे वास्तव में सीख सकता है। पहला परिणाम: यह काम करता है!
00:10:08हमारे पास 50 से अधिक का एक अच्छा मीन एवरेज प्रिसिजन (mAP) है। मैं इसकी तुलना ऐसे करती हूँ: मेरे पास एक टेस्ट सेट है,
00:10:19और मैं उस टेस्ट सेट को Qwen से गुज़ारती हूँ, फिर मैं छद्म-एनोटेशन (pseudo-annotations)
00:10:29और उस टेस्ट सेट के सटीक (ground truth) एनोटेशन से उसकी तुलना करती हूँ। थोड़ा अंतर है, लेकिन इसकी उम्मीद थी
00:10:35क्योंकि यह Qwen से सीखा गया है। इसके अलावा, सच कहूँ तो इस तरह के इस्तेमाल के लिए
00:10:42ROC-AUC स्कोर भी काफी अच्छा है। और डॉक्यूमेंट पार्सिंग के मामले में, यह वास्तव में नए डेटा पर लागू (generalize) होता है, जो मेरे लिए अद्भुत है।
00:10:50यहाँ ट्रेन किए गए मॉडल का आउटपुट आप देख सकते हैं, इसने सिग्नेचर की पहचान कर ली, जबकि
00:10:58उसी टेस्ट सेट के Qwen एनोटेशन से वह छूट गया था। इसलिए मैं कहना चाहूँगी कि यह बहुत अच्छी तरह से काम करता है।
00:11:06और इसका श्रेय RFDTR की बैकबोन क्षमता को जाता है।
00:11:12यहाँ आप यह भी देख सकते हैं कि यह इमेजेस को तकनीकी रूप से कैसे कैप्चर करता है, और यह बिल्कुल सटीक है। इसे बनाते समय
00:11:21मैंने ध्यान दिया कि मुझे विजन एजेंट्स के साथ काम करने का सही तरीका नहीं पता था। तो इससे जुड़ी कुछ बातें सामने आईं:
00:11:30सबसे पहले, जजिंग में बहुत बड़ा असंतुलन है। समस्या के आधार पर LFM बहुत सी चीज़ों को खारिज कर देता है।
00:11:37इसीलिए मैं पूर्ण सहमति (consensus) नहीं ले सकी, क्योंकि अगर मैं उन सभी उदाहरणों को हटा देती
00:11:44जिन पर LFM और Gemma दोनों हटाने के लिए सहमत थे, तो मेरे पास बहुत कम उदाहरण बचते,
00:11:50जिससे मॉडल की सीखने और लागू होने की क्षमता कमजोर हो जाती। इसलिए मैंने यह तय किया कि अगर कोई एक भी 'हाँ' कहता है,
00:11:58तो मैं उस उदाहरण को शामिल करूँगी। और फिर भी इसने अच्छा काम किया। लेकिन अगर आपके पास एक बड़ा डेटासेट है और आप रिकॉल (recall) की परवाह करते हैं,
00:12:04तो मेरा सुझाव है कि आप सर्वसम्मति लें या निरीक्षण करें। डॉक्यूमेंट पार्सिंग के लिए यह अंतर
00:12:09उतना बड़ा नहीं है। दूसरी बात, प्रॉम्प्ट जनरेशन थोड़ा मुश्किल है। यही एकमात्र ऐसा हिस्सा है जहाँ एक इंसान के रूप में
00:12:17आपको यह मंज़ूर करना होता है कि मॉडल ने जज के लिए सही प्रॉम्प्ट बनाए हैं।
00:12:28और फिर आप कहेंगे, “ठीक है, मैं इसे मंज़ूरी देता हूँ,” क्योंकि आपको अभी भी अपने डेटासेट पर
00:12:35थोड़ी नज़र डालनी पड़ती है, इससे बचा नहीं जा सकता। और तीसरी बात, जो बहुत दिलचस्प है,
00:12:42आपका कोडिंग एजेंट चाहे कितना भी अच्छा क्यों न हो—जैसे आप Opus 4.8 लें, जो एक बहुत अच्छा
00:12:52कोडिंग एजेंट है—कंप्यूटर विजन इंजीनियर के रूप में उसे सही समझ नहीं होती और उसमें व्यावहारिक समझ (common sense) की कमी होती है।
00:12:59उदाहरण के लिए, यह ट्रैफिक साइन्स को हॉरिजॉन्टल फ्लिप कर रहा था या ट्रैफिक लाइट्स में जिटर जोड़ रहा था,
00:13:06जिससे डेटासेट खराब हो जाता। इसलिए मैंने इसे बाद में ठीक किया, ताकि
00:13:14आप यह तय कर सकें कि ऑग्मेंटेशन करना है या नहीं, और आपका कोडिंग एजेंट इसमें आपकी मदद करेगा।
00:13:21और अंत में, इस टूलकिट का दूसरा हिस्सा मेरे पसंदीदा मॉडल्स को टूल्स के रूप में इस्तेमाल करना है।
00:13:30और आख़िर में, इस टूलकिट का दूसरा हिस्सा है मेरे पसंदीदा मॉडल्स टूल के रूप में।
00:13:35तो यह रिपॉजिटरी डेप्थ एस्टीमेशन से लेकर ज़ीरो-शॉट सेगमेंटेशन तक मेरे पसंदीदा मॉडल्स को कवर करती है।
00:13:42और यह आंशिक रूप से हगिंग फेस बेंचमार्क द्वारा संचालित है जिन्हें हमने कुछ महीने पहले ही शुरू किया था,
00:13:48मूल रूप से हमारे पास एक बेंचमार्क लीडरबोर्ड है और वहाँ पर
00:13:55आपके पास ओपन मॉडल्स के साथ-साथ उनके इवैल्यूएशन परिणाम भी हैं, और आप अलग-अलग साइज़ के मॉडल्स की तुलना कर सकते हैं।
00:14:02तो मैं इसे अपडेट रखता हूँ, लेकिन यह आंशिक रूप से मेरे द्वारा भी संचालित है जिसे
00:14:13कंप्यूटर विज़न कॉन्फ्रेंस पेपर्स पढ़ना पसंद है, इसलिए मैं इस मॉडल की तारीफ़ करना चाहूँगा क्योंकि
00:14:20बहुत से लोग इसके बारे में नहीं जानते। मूल रूप से, SAM ओपन-एंडेड रेफ़रेंस सेगमेंटेशन नहीं कर सकता,
00:14:26जैसे अगर आप कहें "इस लाल कार को सेगमेंट करो" तो वह कर देगा, लेकिन अगर आप कहें "नारंगी कार के बगल वाली लाल कार
00:14:33जो नीली कार के बगल में है", तो वह ऐसा नहीं कर पाएगा। और Falcon perception, जो कि
00:14:39TII का एक मॉडल है, वास्तव में यह कर सकता है, और यह Apache 2.0 लाइसेंस के साथ केवल 600 मिलियन पैरामीटर्स का है।
00:14:47तो यह मॉडल मेरे लिए ज़ीरो-शॉट सेगमेंटेशन करता है।
00:14:51और यह एक अधूरी सूची है; पोज़िंग के लिए हमारे पास Sapiens फ़ैमिली है,
00:14:58ह्यूमन-सेंट्रिक टास्क के लिए जहाँ आपको ह्यूमन की-पॉइंट डिटेक्शन, ह्यूमन
00:15:04डेप्थ एस्टीमेशन वगैरह करने की ज़रूरत होती है। और ज़ीरो-शॉट डिटेक्शन के लिए मेरे पास Moondream 3 और MM-Grounding-DINO है,
00:15:13जो Apache 2.0 लाइसेंस वाला मॉडल है। यह भी बहुत अच्छा है और Moondream की तुलना में बहुत छोटा है। मैं आपको
00:15:20अलग-अलग साइज़ में कई मॉडल्स देता हूँ जिन्हें आप अपने हार्डवेयर के हिसाब से चुन सकते हैं। अगर आप
00:15:25फ़ास्ट काम करना चाहते हैं, तो बस टाइनी विकल्प चुन लें। OCR के लिए मैंने उन्हें अलग-अलग साइज़ में almOCR बेंचमार्क से लिया है।
00:15:34और डेप्थ एस्टीमेशन के लिए मुझे पता चला कि बड़े मॉडल का लाइसेंस नॉन-कमर्शियल नहीं है,
00:15:40जबकि बाकी सभी का है, तो आप वास्तव में उसका उपयोग कर सकते हैं। उसका लाइसेंस Apache 2.0 जैसा ही है
00:15:45और यह Supervision व ट्रैकर सपोर्ट के साथ भी आता है। ये दोनों
00:15:51Roboflow की लाइब्रेरीज़ हैं जो आपको इंस्टेंस, बाउंडिंग बॉक्स वगैरह की ट्रैकिंग करने की अनुमति देती हैं।
00:16:00और भविष्य की योजनाएँ: सबसे पहले, मैं सुन सकता हूँ कि आप कह रहे हैं कि यह इंडस्ट्री के उपयोग के मामलों में काम नहीं करेगा,
00:16:06क्योंकि इंडस्ट्री यूज़ केसेस में अलग-अलग हिस्से होते हैं, जैसे नॉन-डिस्क्राइबेबल
00:16:13पार्ट्स, जहाँ नेचुरल लैंग्वेज एक अच्छा रास्ता नहीं है। तो मुझे लगता है कि उस मामले में इमेज-गाइडेड डिटेक्शन
00:16:21मदद कर सकता है। अगर आप इमेज-गाइडेड डिटेक्शन के बारे में नहीं जानते हैं, तो मूल रूप से आपके पास किसी इमेज का एक उदाहरण होता है,
00:16:27उदाहरण के लिए यहाँ Huggy, और फिर आप मॉडल से पूछते हैं कि इस इमेज में इस ऑब्जेक्ट को डिटेक्ट करो
00:16:36सभी इमेजेस में। मुझे लगता है कि यह इंडस्ट्री के उपयोग के मामलों में कुछ हद तक मदद कर सकता है जहाँ
00:16:41आप इसे नेचुरल लैंग्वेज द्वारा बयां नहीं कर सकते। इसके अलावा मैं इंटरसेक्शन ओवर
00:16:52यूनियन मर्जर जैसा कुछ आज़माना चाहता हूँ। मूल रूप से आपके पास लेबल्ड बॉक्स होते हैं और फिर जज के बॉक्स, जैसे आप जज से
00:17:00वास्तव में एक बॉक्स जनरेट करने को कहते हैं और फिर जज से रिजेक्ट या एक्सेप्ट कराने के बजाय आप इंटरसेक्शन ओवर यूनियन लेते हैं।
00:17:06और मैं अभी सेगमेंटेशन सपोर्ट पर काम कर रहा हूँ। सुनने के लिए धन्यवाद! यदि
00:17:14आप और अधिक जानना चाहते हैं, तो मूल रूप से मेरे पास एक छोटी विज़न रिपॉजिटरी है। इसमें मॉडल्स को फाइन-ट्यून करने,
00:17:20क्वांटाइज़ करने, मल्टी-मॉडल मॉडल्स, विज़न से जुड़ी हर चीज़ के बारे में सब कुछ है, साथ ही
00:17:27ट्रांसफ़ॉर्मर्स टास्क गाइड भी हैं, जिन्हें हम अपडेट रखते हैं। इसमें कई ट्यूटोरियल्स हैं। हमारे पास हगिंग फेस स्किल्स भी हैं
00:17:36जिसमें कंप्यूटर विज़न विशिष्ट स्किल्स के साथ-साथ इन्फ़्रा स्किल्स भी हैं, जिनसे आप आसानी से
00:17:43एक-प्रॉम्प्ट ट्रेनिंग दोबारा कर सकते हैं। और यह मेरा ट्विटर प्रोफ़ाइल है और यह रेपो वास्तव में GitHub पर है,
00:17:51mervenoyan vision-intern। मुझे लगता है कि मेरे पास एक सवाल के लिए समय है, बहुत-बहुत धन्यवाद।
00:18:04हाँ, वे पूछ रहे हैं कि क्या मेरी VLM को खुद ही ट्रेन करने की योजना है, जैसे सेल्फ-इम्प्रूवमेंट जैसा कुछ।
00:18:16वह बहुत रोमांचक होगा, लेकिन पहले मैं इस समस्या को हल करना चाहता हूँ कि डेवलपर्स वास्तव में
00:18:22टास्क-स्पेसिफ़िक मॉडल्स को ट्रेन करें और फिर एज पर डिप्लॉय करें। उसके बाद शायद वह आ सकता है। शायद एक और सवाल, हाँ?
00:18:34जी नहीं, वास्तव में ऐसा नहीं है। मुझे नहीं लगता। मैंने बस इसका इस्तेमाल किया क्योंकि मैं चाहता था... क्योंकि कोडिंग एजेंट के पास
00:18:44कॉन्टेक्स्ट होता है, इसलिए मैं चाहता था कि वह प्रॉम्प्ट जनरेट करे। शायद एक और सवाल? ठीक है, आपका बहुत-बहुत धन्यवाद!
00:19:04तो...

Description

Merve Noyan wrote a book on vision language models and now wants developers to stop calling them directly. Put one in front of a camera and you will never get real time; a small detector trained for the task runs at forty frames per second on a toaster and beats the VLM anyway. Her other complaint is licensing: people deploy a popular detector without noticing its copyleft license. So she built a toolkit that hands her favorite Apache 2.0 models to a coding agent, which she calls a clueless computer vision engineer, plus what she calls vibe training. Give it a dataset with no labels and it labels images with a nine billion parameter open VLM, passes the overlaid bounding boxes to two smaller VLM judges, merges their verdicts on minimum agreement rather than consensus, and trains RF-DETR. The whole run costs three or four dollars on Hugging Face jobs and inference providers. On road signs the trained detector lands a good mean average precision against ground truth, and on document parsing it generalizes, catching a signature the labeling model itself missed. The findings matter more: one judge rejects far more than the other, so consensus would have left too few examples; the judge prompts still need a human to approve them; and even the best coding agent flips traffic signs horizontally and jitters the color of traffic lights until told not to. She closes with the models as tools half of the toolkit, from a 600 million parameter model that segments the red car next to the orange car to pose, depth, and OCR picks, and plans for image guided detection where words cannot describe the part. Speaker info: - https://x.com/mervenoyann - https://www.linkedin.com/in/merve-noyan-28b1a113a - https://hf.co/merve Timestamps: 0:00 - Why developers should stop reaching for a VLM at runtime 1:51 - Read the license: move to Apache 2.0 models 2:46 - A toolkit for coding agents, the clueless computer vision engineer 3:41 - Vibe training: VLM as labeler, VLMs as judges, then train 5:40 - The pipeline: overlaid boxes, minimum agreement, RF-DETR 8:29 - What it costs: a few dollars end to end 9:40 - Results on road signs and document parsing 11:18 - Findings: judge imbalance, prompt approval, augmentation blunders 13:20 - Favorite models as tools, from segmentation to depth 15:52 - Future plans: image guided detection and IoU merging 17:57 - Q&A

Community Posts

No posts yet. Be the first to write about this video!

Write about this video