इन्फरेंस इंजीनियरिंग में नया क्या है — फिलिप काइली, बेजटेन

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00मैं यहाँ यह बताने आया हूँ कि इन्फरेंस इंजीनियरिंग में नया क्या है, तो हाय, मैं फ़िलिप हूँ और मैं यहाँ इसलिए हूँ
00:00:19क्योंकि मैंने एक किताब लिखी है। AI इंजीनियर वर्ल्ड्स फेयर में यह मेरा तीसरा साल है। यह पूरी दुनिया में
00:00:24मेरा पसंदीदा सम्मेलन है। हर साल यह मेरे कैलेंडर का सबसे खास हिस्सा होता है। मुझे
00:00:29स्पीकर और इंजीनियर के रूप में अपनी शुरुआत 2024 में यहीं से मिली। मैं 2025 में वापस आया और बहुत सारी चीजें कीं।
00:00:36मैं फिर से यहाँ हूँ। मुझे यहाँ आना पसंद है और मुझे हमेशा आमंत्रित करने के लिए मैं आयोजकों का बहुत आभारी हूँ। मैंने
00:00:44'इन्फरेंस इंजीनियरिंग' नाम की यह किताब लिखी थी। हमने इसे तीन या चार महीने पहले प्रकाशित किया था और मुझे
00:00:49इसकी प्रतिक्रिया देखकर बेहद खुशी हुई है। हमने 23 फरवरी को इसे प्रकाशित किया था, और इस समय तक
00:00:57हम 11,000 से अधिक पेपर कॉपियां बेच चुके हैं, हम जल्द ही 30,000 डिजिटल कॉपियां पूरी करने वाले हैं और दुनिया भर के 2.4 करोड़
00:01:04लोग या 2.4 करोड़ ट्विटर अकाउंट्स तक पहुँच चुके हैं। तो देखते हैं कि वास्तव में कितने लोगों ने
00:01:09इन्फरेंस इंजीनियरिंग से जुड़ा कुछ न कुछ देखा है। और इस शानदार प्रतिक्रिया के साथ ही,
00:01:17एक सवाल ऐसा रहा है जो लोग मुझसे पूछते आ रहे हैं: आपने भला ऐसा क्यों किया? यानी आप
00:01:23एक ऐसी चीज पर किताब क्यों लिखेंगे जो इतनी तेजी से बदल रही है? खैर, मेरा मानना है कि
00:01:29इस समय तक इन्फरेंस इंजीनियरिंग के कई सिद्धांत काफी मजबूत हो चुके हैं, और ऐसी बहुत सी चीजें हैं जो
00:01:34हम मॉडल की हर नई पीढ़ी के साथ सीख सकते हैं और दोहरा सकते हैं। लेकिन आज मैं यहाँ यह बताने आया हूँ कि
00:01:42इन्फरेंस इंजीनियरिंग में नया क्या है। किताब आने के बाद की सभी नई जानकारियों का यह पहला सार्वजनिक परिशिष्ट है।
00:01:48हम इन्फरेंस इंजीनियरिंग के सिद्धांतों की थोड़ी समीक्षा करेंगे, और फिर उस सब पर बात करेंगे
00:01:54जो 23 फरवरी 2026 के बाद से इन्फरेंस की दुनिया में हुआ है। हम बात करेंगे
00:02:00कि टर्बो क्वांट के साथ क्या हुआ, केवी कॉम्पैक्शन के बारे में थोड़ी बात करेंगे, हम डी-फ्लैश पर काफी समय
00:02:05बिताएंगे और स्पेक्युलेटिव डिकोडिंग की कुछ नई और रोमांचक चीजों पर चर्चा करेंगे। और फिर मैं
00:02:12थोड़ा अनुमान लगाऊंगा, थोड़ा पूर्वानुमान लगाऊंगा कि इन्फरेंस में आगे क्या होने वाला है
00:02:17और अगली बार जब आप लोग मुझे यहाँ देखेंगे, तो मैं किस बारे में बात करने के लिए उत्साहित रहूँगा।
00:02:23बढ़िया! तो चलिए शुरू करते हैं। इन्फरेंस के बारे में लोगों के साथ ढेर सारी बातचीत से
00:02:30मैंने कुछ साझा सिद्धांतों की पहचान की है। और उनमें से एक बड़ा सिद्धांत यह है—
00:02:38मैं उस दिन सारा के साथ इस पॉडकास्ट पर था, हम इन्फरेंस के बारे में बात कर रहे थे,
00:02:44और दो तरह की इन्फरेंस इंजीनियरिंग सामने आई है: एक है लोकल इन्फरेंस,
00:02:48जहाँ मुख्य रणनीति बस यह होती है कि जो भी हार्डवेयर आपके पास है, उस पर इसे चला दिया जाए।
00:02:56मॉडल को क्वांटाइजेशन, डिस्टिलेशन, प्रूनिंग जैसे तरीकों से कंप्रेस करके, या आपके घर में जो भी
00:03:02GPU मौजूद हैं, उन पर बाँटकर चलाया जाता है। पहले आप इसे काम करने लायक बनाते हैं, और फिर इसकी कमियों को दूर करते हैं।
00:03:09मॉडल के इस कम्प्रेशन से जो भी गंभीर समस्याएं पैदा हुई हैं, उन्हें आप हटाते हैं और
00:03:15बैच साइज 1 पर चलाते हुए इसे वापस पुरानी बुद्धिमत्ता के स्तर पर लाने की कोशिश करते हैं। और फिर मेरी
00:03:20दुनिया आती है—बैच साइज और डेटा सेंटर की दुनिया, जहाँ नियम है कि इसे तुरंत काम पर लगाओ,
00:03:27vLLM का बिल्ड तैयार करो, इसे चालू करो और फिर इसकी स्पीड बढ़ाओ। इसके लिए केवी-अवेयर राउटिंग, स्पेक्युलेशन,
00:03:33और डिसएग्रीगेशन जैसी चीजें की जाती हैं। मुझे लगता है कि इन दोनों दुनियाओं से हमें एक-दूसरे से काफी कुछ सीखने को मिलता है।
00:03:40इस टॉक में मेरा ध्यान डेटा सेंटर-उन्मुख इन्फरेंस इंजीनियरिंग की प्रगति पर रहेगा,
00:03:46क्योंकि मैं इसी के बारे में जानता हूँ, लेकिन लोकल इन्फरेंस की दुनिया में भी कई बेहतरीन चीजें हो रही हैं।
00:03:52अपनी किताब 'इन्फरेंस इंजीनियरिंग' में, मैंने आम तौर पर माना है कि वेट्स (weights) एक तैयार प्रोडक्ट हैं, और
00:03:58मुझे लगता है कि ट्रेनिंग से इन्फरेंस में हैंडऑफ को ध्यान में रखना जरूरी है, और यह इस क्षेत्र की
00:04:03सीमा तय करने का एक अच्छा तरीका है। हालाँकि, मुझे हाल ही में यह अधिक से अधिक देखने को मिला है कि
00:04:10इन्फरेंस के लिए कई ऑप्टिमाइजेशन एक समर्पित ट्रेनिंग प्रोसेस से आते हैं। इसलिए ट्रेनिंग
00:04:17और इन्फरेंस के बीच की लकीरें धुंधली होती जा रही हैं, और यह ध्यान रखने योग्य एक दिलचस्प बात है।
00:04:22हम एक ऐसा चक्र देख रहे हैं जहाँ आपको तेजी से इन्फरेंस मिलता है, जिससे अधिक डेटा मिलता है, जिसका उपयोग आप
00:04:28एक बेहतर मॉडल को ट्रेन करने के लिए करते हैं, जिससे आपको और तेज इन्फरेंस मिलता है, जिससे अधिक डेटा मिलता है... और आप बस
00:04:33तब तक ऐसा करते रहते हैं जब तक आप बहुत अमीर न बन जाएं। तो इन्फरेंस के लिए ट्रेनिंग के साथ,
00:04:39हमारे पास उन चीजों पर बात करने के लिए कई नई तकनीकें हैं जिन्हें मैं 'द बिग थ्री' कहना पसंद करता हूँ।
00:04:45हम क्वांटाइजेशन की नई खबरों, कैशिंग की नई खबरों (विशेष रूप से KV कैश मैकेनिज्म) और
00:04:52स्पेक्युलेशन की नई खबरों पर बात करेंगे। क्योंकि ये वही क्षेत्र हैं... वैसे तो इन्फरेंस की दुनिया में और भी बहुत कुछ है,
00:04:57जिसमें से कुछ चीजों पर मैं अंत में बात करूँगा, लेकिन जब रोजमर्रा के व्यावहारिक काम की बात आती है
00:05:02कि 'किसी मॉडल को तेज कैसे बनाया जाए', तो आमतौर पर लोग इन्हीं तीन तकनीकों का सहारा लेते हैं।
00:05:09तो सबसे पहली बात, मैंने एक किताब प्रकाशित की, फरवरी का महीना था, मुझे बहुत अच्छा लग रहा था, मुझे लगा कि वाह,
00:05:16इन्फरेंस के बारे में जो कुछ भी जानने की जरूरत है, वह सब एक ही जगह पर है! और फिर,
00:05:23क्वांटाइजेशन की दुनिया में: संक्षेप में कहें तो, क्वांटाइजेशन वह प्रक्रिया है जहाँ हम कम सटीक नंबर फॉर्मेट का उपयोग करते हैं
00:05:32ताकि बैंडविथ और कंप्यूट की बचत हो सके, TTFT और TPS को बेहतर बनाया जा सके।
00:05:39यह आमतौर पर हार्डवेयर-विशिष्ट होता है, लागत बचाता है, लेकिन मॉडल की गुणवत्ता में थोड़ी गिरावट ला सकता है।
00:05:45वैसे, यदि आप क्वांटाइजेशन पर मेरा पूरा विचार सुनना चाहते हैं, तो मैंने पिछले महीने AI इंजीनियर मियामी में एक टॉक दी थी
00:05:51कि कैसे क्वांटाइजेशन उतना बुरा नहीं है जितना लगता है, और ऐसी कई चीजें हैं जो आप
00:05:57क्वालिटी बनाए रखने के लिए कर सकते हैं। तो मुझे क्वांटाइजेशन के अपने विवरण पर काफी अच्छा लग रहा था,
00:06:04और तभी 2 करोड़ लोगों ने टर्बो क्वांट देखा, और इसने मेमोरी स्टॉक में एक मिनट के लिए
00:06:12बड़ा फेरबदल ला दिया क्योंकि सबको लगा कि मेमोरी अब बहुत अधिक कुशल होने वाली है
00:06:16और हमें अब फ्लैश मेमोरी की आवश्यकता नहीं है, जो कि गलत था। खैर, यह एक नया
00:06:23क्वांटाइजेशन दृष्टिकोण था, जो इस साल मार्च में लोकप्रिय हुआ था, जो क्वांटाइजेशन के लिए
00:06:29पोलर कोऑर्डिनेट्स का उपयोग करता है और आपको KV कैश को 4 बिट्स तक क्वांटाइज करने की अनुमति देता है। यह बहुत ट्रेंडिंग था और
00:06:36मुझे लगा कि अरे यार, यह पूरा विषय तो मुझसे छूट ही गया, अब यह सब कैसा दिखेगा?
00:06:43और इसलिए हमारी टीम ने इस पर काफी शोध किया, अगर आप ट्विटर पर वाटरलू
00:06:50इंटरन को जानते हैं, जो हमारी मॉडल परफॉरमेंस टीम के अली हैं, मुझे पक्का नहीं पता कि वह अभी भी इंटरन हैं या नहीं,
00:06:57लेकिन हाँ, वह वाटरलू से हैं। तो उन्होंने टर्बो क्वांट के पीछे के गणित पर एक बेहतरीन लेख लिखा।
00:07:04और मूल रूप से, टर्बो क्वांट से आपको जो लाभ मिलता है वह यह है कि आप 8 बिट्स के बजाय 4 बिट्स से
00:07:09KV कैश को दर्शाते हैं। आप आधी जगह और आधी बैंडविड्थ बचाते हैं और प्रभावी रूप से
00:07:14दोगुनी बैंडविड्थ पाते हैं जब आप सिस्टम मेमोरी में KV कैश को स्थानांतरित करते हैं। लेकिन इसकी एक बड़ी कमी भी है।
00:07:21टर्बो क्वांट के लिए, डिकोड के दौरान इसे संभालने के लिए आपको फॉरवर्ड पास में अतिरिक्त गणना करने की
00:07:25आवश्यकता होती है और यह TPS को आधे से भी कम कर देता है, जो प्रोडक्शन के कई उपयोगों के लिए स्वीकार्य नहीं है।
00:07:32इसलिए हमने टर्बो क्वांट को गहराई से समझा, लेकिन वास्तविक कार्यभार के लिए
00:07:38हम इसका उपयोग नहीं कर रहे हैं। हम अभी भी पारंपरिक NVFP4 क्वांटाइजेशन पर ही निर्भर हैं।
00:07:44फिर भी, यह लोकल इन्फरेंस इस्तेमाल करने वालों के लिए एक बेहतरीन तकनीक है। यदि आप कोई मॉडल चला रहे हैं,
00:07:51विशेष रूप से अपने स्थानीय कंप्यूटर या बेसमेंट में रखे GPU पर एक लंबा कांटेक्स्ट भाषा मॉडल,
00:07:58तो आपके पास बहुत सीमित मेमोरी होती है, जो सबसे बड़ी बाधा है। इसलिए KV कैश से मेमोरी खाली करने वाली
00:08:04और लंबे अनुक्रमों को रखने की अनुमति देने वाली कोई भी तकनीक बहुत मूल्यवान होगी,
00:08:09और अतिरिक्त फॉरवर्ड पास की गणना उतनी बड़ी कमी नहीं लगेगी।
00:08:16फिर भी, टर्बो क्वांट एक शानदार शोध पत्र है, एक बेहतरीन तकनीक है जो डेटा सेंटर इन्फरेंस
00:08:22की दुनिया में उतनी लागू नहीं हो पाई जितनी शुरू में लगी थी। इसके बजाय,
00:08:28हमारा ध्यान KV कैश के बजाय वेट्स को क्वांटाइज करने पर केंद्रित NVFP4 पर है,
00:08:36हम क्वांटाइज्ड वेट्स की कमियों को दूर करने की पूरी कोशिश कर रहे हैं ताकि यह सुनिश्चित हो सके कि हम KV कैश
00:08:41के प्रोबबिलिटी डिस्ट्रीब्यूशन को न बिगाड़ें। इसके बजाय KV-अवेयर राउटिंग, KV ऑफलोडिंग और KV शेयरिंग पर ध्यान केंद्रित कर रहे हैं,
00:08:49सिस्टम में KV कैश को स्थानांतरित करने के लिए NCCL और NVIDIA Dynamo जैसे उपकरणों का उपयोग कर रहे हैं
00:08:55और इसे कंप्रेस करने के लिए टर्बो क्वांट का उपयोग करने के बजाय साधारण CPU मेमोरी आदि में ऑफलोड कर रहे हैं।
00:09:04और हम विभिन्न मॉडैलिटीज़ में क्वांटाइजेशन पर भी ध्यान केंद्रित कर रहे हैं, ताकि
00:09:11हम न केवल भाषा मॉडलों बल्कि इमेज और वीडियो मॉडलों पर भी NVFP4 के लाभों को कैसे लागू कर सकें।
00:09:17अली ने ट्विटर पर इसके बारे में बहुत सारी शानदार चीजें लिखी हैं, जिन्हें आपको ज़रूर देखना चाहिए।
00:09:23बहरहाल, KV कैश अभी भी बहुत महत्वपूर्ण है और आइए इसके बारे में बात करते हैं, आइए KV कॉम्पैक्शन के बारे में बात करते हैं।
00:09:29एक त्वरित पुनरावलोकन: KV कैश में यदि आप समान प्रिफिक्स के साथ वही प्रॉम्प्ट डालते हैं, तो आप उन टोकन का पुनः उपयोग
00:09:35कर सकते हैं जिन्हें आपने पिछली बार प्री-फिल पर कैलकुलेट किया था। यह आपके पूरे सिस्टम को तेज और अधिक कुशल बनाता है।
00:09:42व्यापक रूप से कहें तो, KV कैश लॉसलेस मेमोरी है। जब हम अपने इन्फरेंस सिस्टम के बारे में
00:09:48सोचते हैं, तो लॉसलेस मेमोरी के केवल कुछ ही स्रोत होते हैं। आपके पास प्रॉम्प्ट की सामग्री, कांटेक्स्ट और KV कैश होता है
00:09:55और यह आपके द्वारा पास किए गए डेटा की मात्रा के साथ रैखिक रूप से बढ़ेगा। और अब यदि आप
00:09:5910 लाख टोकन अनुक्रम की लंबाई के बारे में सोच रहे हैं, तो यह वास्तव में काफी बड़ा हो जाता है। इसलिए बहुत से लोग सोच रहे हैं
00:10:05कि मेमोरी को कैसे कंप्रेस किया जाए, कांटेक्स्ट को कैसे कंप्रेस किया जाए। एजेंट हार्नेस कांटेक्स्ट को कंप्रेस करेंगे, लेग
00:10:11सर्च और ये सभी तकनीकें जिनके बारे में हम वर्षों से बात कर रहे हैं, एक बड़े कांटेक्स्ट को
00:10:17ऐसी चीज़ में कंप्रेस करने जैसा है जिसे आप मॉडल को दे सकें या फाइलों में लिख सकें। ये सभी चीज़ें
00:10:22उपलब्ध डेटा की मात्रा की तुलना में उप-रैखिक रूप से बढ़ती हैं। लेकिन क्या होगा यदि कोई बीच का रास्ता हो? क्या होगा यदि ऐसा कोई तरीका हो
00:10:28जिससे आप लगभग बिना किसी जानकारी के नुकसान के, याद रखे जाने वाले डेटा में काफी हद तक कंप्रेशन हासिल कर सकें?
00:10:34तो, हमारे पास यह सोचने के कई अलग-अलग तरीके हैं कि कैश में क्या रखा जाए।
00:10:41हाल के कॉम्पैक्शन तरीकों ने दिखाया है कि हम कैश को बहुत छोटे कैश से बदल सकते हैं।
00:10:47छोटा कर सकते हैं। हमारे पास अटेंशन मैचिंग और कार्ट्रिज जैसे पेपर हैं जिन्होंने
00:10:53उच्च कम्प्रेशन रेशियो के साथ बहुत आशाजनक परिणाम दिए हैं। लेकिन ये दोनों इन्फरेंस के समय चलते हैं। फिर से, तकनीकों में से एक
00:11:00जिसके बारे में मैं बात करना चाहता हूँ या जिन विषयों पर मैं बात करना चाहता हूँ, वह है इन्फरेंस के लिए ट्रेनिंग। तो इस मामले में
00:11:05मैं 'स्टिल' नाम की चीज़ पेश करना चाहता हूँ, जिसे बेस 10 रिसर्च टीम ने बनाया है, जहाँ कैश के ऊपर सिंथेसिस होता है
00:11:12जहाँ हम सीधे जानकारी या उसके किसी डिटरमिनिस्टिक सबसेट को रखने के बजाय जानकारी का एक सीखा हुआ रिप्रेजेंटेशन रखते हैं,
00:11:17जो ट्रेनिंग के ज़रिए अमॉर्टाइज्ड होता है। तो हमारी पोस्ट-ट्रेनिंग टीम के चार्ली और मुदित ने
00:11:25हाल ही में कोसा कंपाइल में एक शानदार चौक टॉक दी थी। यह यूट्यूब पर उपलब्ध है, मैं
00:11:31आपसे आग्रह करूँगा कि अगर आप केवी कॉम्पैक्शन के बारे में जानने में रुचि रखते हैं तो इसे ज़रूर देखें। दुर्भाग्य से मेरे पास
00:11:37यहाँ सब कुछ समझाने का समय या प्रतिभा नहीं है, लेकिन इसका मूल तंत्र यह है
00:11:46कि स्टिल एक परसीवर बॉटलनेक है, जो सीखे हुए क्वेरी वैक्टर्स के एक फिक्स्ड सेट को लेता है, उसे पूरे केवी कैश के साथ
00:11:53क्रॉस-अटेंड करता है और एक ही फॉरवर्ड पास में कॉम्पैक्ट कीज़ और वैल्यूज़ का एक सेट तैयार करता है।
00:11:59यह एक तेज़, डिफरेन्शिएबल कंप्रेस्ड मेमोरी बनाता है जिस पर एलएलएम ध्यान दे सकता है मानो यह वास्तविक कॉन्टेक्स्ट हो।
00:12:05तो अगर आप केवी कॉम्पैक्शन में रुचि रखते हैं, तो चार्ली और मुदित के काम को ज़रूर देखें।
00:12:09इसके बारे में सीखना वाकई बहुत शानदार रहा है। तो यह उन तकनीकों में से दो हैं जिनके बारे में हमने बात की है,
00:12:16हमने क्वांटाइजेशन और कैशिंग की बात की है। आखिरी तकनीक स्पेक्यूलेशन है, और इसमें काफी बदलाव आया है।
00:12:21रिव्यू के तौर पर, स्पेक्यूलेटिव डिकोडिंग में हम ड्राफ्ट टोकन्स का उपयोग करने जा रहे हैं, हम फॉरवर्ड पास के दौरान उन्हें वेरीफाई करेंगे
00:12:29और इसका उपयोग प्रति फॉरवर्ड पास एक से अधिक टोकन जनरेट करने के लिए करेंगे।
00:12:34यह प्रति सेकंड टोकन में बहुत मदद करता है और यह पूरी तरह से लॉसलेस ऑप्टिमाइजेशन है, जो बढ़िया है क्योंकि
00:12:40हमें क्वालिटी की बिल्कुल चिंता करने की ज़रूरत नहीं है। अब स्पेक्यूलेशन के इतिहास की बात करें तो हमने
00:12:46स्पेक्यूलेटिव डिकोडिंग से शुरुआत की, ये सभी किताब में हैं। आपके पास स्पेक-डेक है जहाँ आप ड्राफ्ट टोकन जनरेट करने के लिए
00:12:52उसी फैमिली के एक छोटे मॉडल का उपयोग करते हैं। पता चला कि छोटे मॉडल अच्छे ड्राफ्ट टोकन जनरेटर नहीं होते हैं,
00:12:58वे बस अच्छे छोटे मॉडल होते हैं। इसलिए एक इंडस्ट्री के रूप में हमने मेदुसा जैसे कई नए तरीकों का आविष्कार किया, जहाँ
00:13:04शायद आप मॉडल में सिर्फ डिकोडर हेड्स जोड़ते हैं, और अंततः ईगल 3 आया, जो यह था कि क्या हो
00:13:09अगर उसी फैमिली से एक छोटा मॉडल लेने के बजाय, हम वास्तव में ड्राफ्ट टोकन जनरेट करने के लिए टारगेट मॉडल के हिडन स्टेट्स पर
00:13:15एक बिलियन पैरामीटर मॉडल को ट्रेन करें? और उसने वास्तव में बहुत अच्छी तरह काम किया। और इसलिए
00:13:21शायद पिछले साल या इस साल फरवरी तक, ईगल 3 स्पेक्यूलेशन में सबसे बेहतरीन तरीका था।
00:13:27अब हमारे पास डीफ्लैश आ गया है। डीफ्लैश और भी बेहतर है। तो यह स्पेक्यूलेशन के लिए डिफ्यूजन है; डीफ्लैश
00:13:36एक सिंगल टोकन के बजाय ड्राफ्ट टोकन्स की एक सीक्वेंस बनाता है। तो यह मॉडल एक डिफ्यूजन लैंग्वेज मॉडल है, जिसका
00:13:43मतलब है कि यह ठीक उसी तरह टोकन्स की एक पूरी सीक्वेंस बनाता है जैसे वीडियो या इमेज जनरेशन फ्रेम्स या
00:13:49पिक्सेल की सीक्वेंस बनाता है और ऑटो-रिग्रेसिव टोकन जनरेशन करने के बजाय उस पर इटरेट करता है।
00:13:55डीफ्लैश मॉडल चलाने में दो या चार गुना धीमे हो सकते हैं, लेकिन वे उस विंडो में एक बार में
00:14:01आठ या 16 टोकन प्रेडिक्ट करेंगे, जबकि ईगल एक बार में केवल एक ही करता है। इसलिए एक सिंगल डीफ्लैश
00:14:08फॉरवर्ड पास पूरे ईगल ड्राफ्ट फेज़ से तेज़ होता है और अधिक टोकन प्रेडिक्ट करता है। ये टोकन
00:14:14एक-दूसरे के साथ क्रॉस-अटेंड कर सकते हैं और आमतौर पर उच्च एक्सेप्टेंस रेट प्रदान करते हैं, क्योंकि स्पेक्यूलेशन में एक्सेप्टेंस
00:14:21रेट ही सब कुछ है। तो व्यावहारिक उपयोग में हम डीफ्लैश से 3 गुना से अधिक का सुधार देख रहे हैं। इसे
00:14:30एक सिंगल B200 Qwen38B के साथ मापा गया है और हम देख सकते हैं कि ईगल की तुलना में टोकन एक्सेप्टेंस रेट
00:14:40और प्रति सेकंड टोकन दोनों में काफी बड़ा सुधार हुआ है। इन डीफ्लैश मॉडल्स को बाईडायरेक्शनल ड्राफ्टिंग के लिए
00:14:47एक अटेंशन मास्क के साथ ट्रेन किया जाता है, इसलिए टारगेट मॉडल कॉन्टेक्स्ट प्रदान करेगा।
00:14:54हमारे पास क्लीन टोकन का एक सबसेट होगा जो सैंपल किए जाते हैं, और अटेंशन मास्क
00:14:59कॉज़ल कंसिस्टेंसी लागू करेगा, लेकिन फिर भी यह बायडायरेक्शनल अटेंशन की अनुमति देगा,
00:15:06जबकि एक पारंपरिक ऑटोरिग्रेसिव मॉडल में आप केवल एक ही दिशा में टोकन देखते हैं। इसलिए हम
00:15:13इस डिफ्यूज़न-बेस्ड आर्किटेक्चर का लाभ उठाने में सक्षम हैं। और फिर मुझे लगा कि मेरा काम
00:15:19पूरा हो गया है, पर कुछ दिन पहले ही DSpark सामने आया। अब dflash तो प्रोडक्शन में चालू है,
00:15:25लेकिन DSpark एक नई रिसर्च है। तो इसके बारे में मैं बस यही कह सकता हूँ कि यह मौजूद है, काफी कूल है, और हम
00:15:31इस पर ध्यान दे रहे हैं। dflash की तुलना में अंतर यह है कि इसमें भी डिफ्यूज़न मॉडल है, पर यह इसे
00:15:38एक सीक्वेंसियल मॉडल के साथ जोड़ता है। विचार यह है कि हम एक्सेप्टेंस रेट में सुधार करेंगे
00:15:45केवल इटेरेटिव स्पेक्युलेटर, केवल डिफ्यूज़न स्पेक्युलेटर
00:15:51या केवल ऑटोरिग्रेसिव स्पेक्युलेटर के बजाय इन दोनों मॉडलों को एक साथ काम में लाकर। तो DSpark काफी रोमांचक है,
00:15:57लेकिन अभी शेयर करने के लिए हमारे पास इसके कोई प्रोडक्शन परिणाम नहीं हैं। उम्मीद है अगली बार होंगे।
00:16:03लेकिन हमारे पास कंटीन्यूअस स्पेक्युलेटर रीट्रेनिंग पर प्रोडक्शन परिणाम ज़रूर हैं। तो यहाँ हम
00:16:09वापस dflash पर आते हैं। विचार यह है कि स्पेक्युलेटिव डिकोडिंग
00:16:15आपके सिस्टम में प्रॉम्प्ट्स और रिस्पॉन्स्स के वास्तविक कंटेंट पर काफी निर्भर करती है। और इसलिए यदि आप
00:16:21अपने लाइव सिस्टम में उन प्रॉम्प्ट्स और रिस्पॉन्स्स पर लगातार रीट्रेनिंग कर रहे हैं, तो आप टोकन एक्सेप्टेंस रेट्स में
00:16:2920% से लेकर 2 गुना तक का सुधार देख सकते हैं। यह वास्तव में करना काफी कठिन है, इसमें बहुत अधिक
00:16:36स्टोरेज लगता है और आपको यह सुनिश्चित करना होगा कि आपके पास इस तरह से डेटा का उपयोग करने की अनुमति है
00:16:40जिससे आप इसे प्रोसेस कर रहे हैं। इसमें भारी मात्रा में कंप्यूट लगता है और आपको इस सारी जानकारी को ट्रांसफर करना पड़ता है,
00:16:46और यदि आप अंतर्निहित मॉडल बदलते हैं, तो आपको स्पेक्युलेटर मॉडल भी बदलना होगा। लेकिन जब मैं भविष्य की ओर देखता हूँ,
00:16:51भविष्य की ओर देखते हुए, मुझे लगता है कि बहुत बड़े पैमाने के सिस्टम के लिए निरंतर स्पेक्यूलेशन
00:16:58एक बेहतरीन ऑप्टिमाइजेशन होगा। तो इन्फेरेंस में आगे क्या होने वाला है? जो मैं कहने जा रहा हूँ, वह मेरी व्यक्तिगत राय, अनुमान
00:17:06और सार्वजनिक जानकारी पर आधारित है। अगर मुझे वास्तव में किसी नई रिलीज़ के बारे में पता होता, तो मैं उसके बारे में बात नहीं कर पाता।
00:17:11तो यह सिर्फ वो है जो मुझे लगता है कि होने वाला है। मैं hardware के तीन चक्रों से गुजर चुका हूँ—
00:17:17Ampere रिलीज़, Hopper रिलीज़ और Blackwell रिलीज़। और हमेशा इसमें समय लगता है,
00:17:23इन चिप्स के शिप होने से लेकर डेटा सेंटर्स में इंस्टॉल होने तक, और पूरे सॉफ्टवेयर स्टैक द्वारा
00:17:30इनकी क्षमताओं का सही मायने में फायदा उठाने में समय लगता है। लेकिन कुछ बातें जिन्हें लेकर मैं उत्साहित हूँ,
00:17:36वह यह है कि Rubin के साथ NVFP4 का परफॉर्मेंस शानदार होने वाला है।
00:17:44इसलिए जितना अधिक हम लोकल इन्फेरेंस से तकनीकों को अपनाकर NVFP4 डेटा फॉर्मेट में
00:17:49मॉडल चलाने का आत्मविश्वास हासिल करेंगे, उतना ही हम आने वाले Rubin सिस्टम्स के
00:17:54शानदार परफॉर्मेंस का लाभ उठा पाएंगे। मुझे लगता है कि डिसएग्रीगेशन और पूरे सिस्टम स्तर पर
00:18:00कम्युनिकेशन का महत्व लगातार बढ़ता जाएगा। हमें PD डिसएग्रीगेशन से बहुत अच्छे शुरुआती फायदे दिख रहे हैं,
00:18:05और KV कैश डेटा जैसी जानकारी को पूरे सिस्टम में ट्रांसफर करने की क्षमता
00:18:12काफी महत्वपूर्ण होती जाएगी। और जैसा कि मैंने कहा, इन्फेरेंस के लिए ट्रेनिंग का विषय
00:18:17आने वाले समय में इंडस्ट्री पर बड़ा प्रभाव डालता रहेगा। टॉकी के लिए आप सभी का बहुत-बहुत धन्यवाद,
00:18:25टॉक में आने के लिए धन्यवाद। मैं Twitter और LinkedIn पर हूँ, और मैं मुफ़्त किताबें भी बांट रहा हूँ।
00:18:32आप QR कोड स्कैन करके PDF डाउनलोड कर सकते हैं या Base10 बूथ पर आकर “Inference Engineering” की
00:18:37अपनी मुफ़्त कॉपी ले सकते हैं। हमारे पास वहां काफी किताबें हैं, शायद सभी के लिए पर्याप्त होंगी। अगर नहीं, तो कूरियर
00:18:43ऑफिस से और किताबें ले आएगा। तो हाँ, मैं नीचे Base10 बूथ पर मौजूद रहूँगा। आप सभी का बहुत-बहुत धन्यवाद
00:18:48और आपका दिन शुभ हो!

Key Takeaway

इन्फरेंस स्पीड बढ़ाने के लिए मॉडल वेट्स के NVFP4 क्वांटाइजेशन, स्टिल (STILL) द्वारा KV कैश कॉम्पैक्शन, और डीफ्लैश (dflash) जैसे डिफ्यूजन-आधारित स्पेक्युलेटिव डिकोडिंग का संयोजन डेटा सेंटर इन्फरेंस की दक्षता को 3 गुना तक बढ़ा देता है।

Highlights

  • 23 फरवरी 2026 को प्रकाशित 'इन्फरेंस इंजीनियरिंग' किताब की 11,000 से अधिक प्रिंट कॉपियां बिक चुकी हैं और यह 2.4 करोड़ ट्विटर अकाउंट्स तक पहुँची है।

  • टर्बो क्वांट डिकोड के दौरान अतिरिक्त फॉरवर्ड पास गणना के कारण प्रति सेकंड टोकन (TPS) की गति को आधा कर देता है, जिससे यह डेटा सेंटर इन्फरेंस के लिए अनुपयुक्त हो जाता है।

  • स्टिल (STILL) परसीवर बॉटलनेक का उपयोग करके पूरे KV कैश पर क्रॉस-अटेंड करता है और एक ही फॉरवर्ड पास में कॉम्पैक्ट कीज़ और वैल्यूज़ का सेट तैयार करता है।

  • डीफ्लैश (dflash) डिफ्यूजन-आधारित आर्किटेक्चर का उपयोग करके एक ही फॉरवर्ड पास में 8 से 16 ड्राफ्ट टोकन प्रेडिक्ट करता है और ईगल (EAGLE) की तुलना में 3 गुना से अधिक सुधार देता है।

  • लाइव सिस्टम के प्रॉम्प्ट्स और रिस्पॉन्स्स पर स्पेक्युलेटर मॉडल की निरंतर रीट्रेनिंग से टोकन एक्सेप्टेंस रेट में 20% से 2 गुना तक का सुधार होता है।

Timeline

इन्फरेंस इंजीनियरिंग का विकास और दो मुख्य दृष्टिकोण

  • 23 फरवरी 2026 को प्रकाशित इन्फरेंस इंजीनियरिंग पुस्तक की 11,000 प्रिंट और लगभग 30,000 डिजिटल प्रतियां बिक चुकी हैं।
  • इन्फरेंस इंजीनियरिंग दो भागों में बंटी है: लोकल इन्फरेंस और डेटा सेंटर इन्फरेंस।
  • ट्रेनिंग और इन्फरेंस के बीच की सीमाएं अब धुंधली हो रही हैं क्योंकि इन्फरेंस ऑप्टिमाइजेशन के लिए समर्पित ट्रेनिंग का उपयोग बढ़ रहा है।

लोकल इन्फरेंस का मुख्य उद्देश्य सीमित हार्डवेयर पर क्वांटाइजेशन, डिस्टिलेशन और प्रूनिंग के माध्यम से मॉडल को कंप्रेस करके बैच साइज 1 पर चलाना है। डेटा सेंटर इन्फरेंस में vLLM बिल्ड का उपयोग करके KV-अवेयर राउटिंग, स्पेक्यूलेशन और डिसएग्रीगेशन के जरिए स्पीड बढ़ाई जाती है। तेजी से इन्फरेंस मिलने से अधिक डेटा एकत्र होता है, जिसका उपयोग बेहतर मॉडल ट्रेन करने के लिए किया जाता है।

क्वांटाइजेशन तकनीकें और टर्बो क्वांट का प्रभाव

  • मार्च 2026 में लोकप्रिय हुआ टर्बो क्वांट पोलर कोऑर्डिनेट्स का उपयोग करके KV कैश को 4 बिट्स तक क्वांटाइज करता है।
  • टर्बो क्वांट डिकोड चरण के दौरान फॉरवर्ड पास में अतिरिक्त गणना की मांग करता है, जिससे TPS आधा रह जाता है।
  • डेटा सेंटर इन्फरेंस में KV कैश के बजाय वेट्स को क्वांटाइज करने के लिए NVFP4 मानक बना हुआ है।

क्वांटाइजेशन कम सटीक नंबर फॉर्मेट का उपयोग करके बैंडविथ और कंप्यूट की बचत करता है। टर्बो क्वांट सिस्टम मेमोरी में KV कैश ट्रांसफर करते समय आधी जगह बचाता है और दोगुनी बैंडविड्थ देता है, लेकिन TPS में गिरावट के कारण यह डेटा सेंटर के बजाय सीमित मेमोरी वाले लोकल इन्फरेंस के लिए अधिक उपयोगी है। डेटा सेंटर इन्फरेंस के लिए KV-अवेयर राउटिंग, NCCL और NVIDIA Dynamo का उपयोग करके KV कैश को साधारण CPU मेमोरी में ऑफलोड किया जाता है।

KV कैश कॉम्पैक्शन और स्टिल (STILL) आर्किटेक्चर

  • 10 लाख टोकन अनुक्रम लंबाई पर KV कैश का आकार रैखिक रूप से बढ़ता है।
  • अटेंशन मैचिंग और कार्ट्रिज तकनीकें इन्फरेंस के समय KV कैश को छोटा करती हैं।
  • बेस 10 द्वारा विकसित स्टिल (STILL) सीखे हुए रिप्रेजेंटेशन का उपयोग करके कॉम्पैक्ट मेमोरी तैयार करता है।

KV कैश लॉसलेस मेमोरी है जो इनपुट डेटा की मात्रा के साथ रैखिक रूप से बढ़ता है। स्टिल (STILL) एक परसीवर बॉटलनेक का उपयोग करता है जो सीखे हुए क्वेरी वेक्टर्स के फिक्स्ड सेट को पूरे KV कैश के साथ क्रॉस-अटेंड करता है। यह एक ही फॉरवर्ड पास में कॉम्पैक्ट कीज़ और वैल्यूज़ का सेट तैयार करता है, जिससे डिफ़रेंशिएबल कंप्रेस्ड मेमोरी बनती है जिस पर LLM ध्यान केंद्रित कर सकता है।

स्पेक्युलेटिव डिकोडिंग: ईगल 3 से डीफ्लैश और डीस्पार्क तक

  • ईगल 3 (EAGLE 3) में टारगेट मॉडल के हिडन स्टेट्स पर 1 बिलियन पैरामीटर मॉडल को ट्रेन करके ड्राफ्ट टोकन जनरेट किए जाते थे।
  • डीफ्लैश (dflash) डिफ्यूजन मॉडल का उपयोग करके एक ही विंडो में 8 से 16 टोकन प्रेडिक्ट करता है।
  • सिंगल B200 Qwen38B पर डीफ्लैश ईगल की तुलना में 3 गुना से अधिक का परफॉरमेंस सुधार दर्ज करता है।

डीफ्लैश ऑटोरिग्रेसिव टोकन जनरेशन के बजाय डिफ्यूजन लैंग्वेज मॉडल का उपयोग करता है, जो टोकन्स की पूरी सीक्वेंस बनाता है। एक सिंगल डीफ्लैश फॉरवर्ड पास पूरे ईगल ड्राफ्ट फेज़ से तेज़ होता है। ये टोकन एक-दूसरे के साथ क्रॉस-अटेंड करते हैं, जिससे एक्सेप्टेंस रेट बढ़ जाता है। डीस्पार्क (DSpark) इस डिफ्यूजन मॉडल को एक सीक्वेंसियल मॉडल के साथ जोड़कर एक्सेप्टेंस रेट को और बेहतर बनाता है।

इन्फरेंस का भविष्य और हार्डवेयर प्रगति

  • लाइव सिस्टम डेटा पर स्पेक्युलेटर मॉडल की निरंतर रीट्रेनिंग से एक्सेप्टेंस रेट 2 गुना तक बढ़ सकता है।
  • NVIDIA Rubin चिप्स के आने से NVFP4 डेटा फॉर्मेट की परफॉरमेंस में बड़ा सुधार होगा।
  • PD डिसएग्रीगेशन और सिस्टम-स्तरीय कम्युनिकेशन से KV कैश ट्रांसफर अधिक कुशल बनेगा।

Ampere, Hopper और Blackwell के बाद Rubin आर्किटेक्चर NVFP4 में मॉडल चलाने की दक्षता को बढ़ाएगा। निरंतर स्पेक्युलेटर रीट्रेनिंग के लिए अधिक स्टोरेज और कंप्यूट की आवश्यकता होती है, लेकिन यह बड़े पैमाने के सिस्टम के लिए सबसे प्रभावी ऑप्टिमाइजेशन है। पीडी डिसएग्रीगेशन के माध्यम से पूरे सिस्टम में KV कैश ट्रांसफर की क्षमता इन्फरेंस स्पीड को बनाए रखने में महत्वपूर्ण भूमिका निभाएगी।

Community Posts

No posts yet. Be the first to write about this video!

Write about this video