इन्फरेंस इंजीनियरिंग में नया क्या है — फिलिप काइली, बेजटेन

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00मैं यहाँ यह बताने आया हूँ कि इन्फरेंस इंजीनियरिंग में नया क्या है, तो हाय, मैं फ़िलिप हूँ और मैं यहाँ इसलिए हूँ
00:00:19क्योंकि मैंने एक किताब लिखी है। AI इंजीनियर वर्ल्ड्स फेयर में यह मेरा तीसरा साल है। यह पूरी दुनिया में
00:00:24मेरा पसंदीदा सम्मेलन है। हर साल यह मेरे कैलेंडर का सबसे खास हिस्सा होता है। मुझे
00:00:29स्पीकर और इंजीनियर के रूप में अपनी शुरुआत 2024 में यहीं से मिली। मैं 2025 में वापस आया और बहुत सारी चीजें कीं।
00:00:36मैं फिर से यहाँ हूँ। मुझे यहाँ आना पसंद है और मुझे हमेशा आमंत्रित करने के लिए मैं आयोजकों का बहुत आभारी हूँ। मैंने
00:00:44'इन्फरेंस इंजीनियरिंग' नाम की यह किताब लिखी थी। हमने इसे तीन या चार महीने पहले प्रकाशित किया था और मुझे
00:00:49इसकी प्रतिक्रिया देखकर बेहद खुशी हुई है। हमने 23 फरवरी को इसे प्रकाशित किया था, और इस समय तक
00:00:57हम 11,000 से अधिक पेपर कॉपियां बेच चुके हैं, हम जल्द ही 30,000 डिजिटल कॉपियां पूरी करने वाले हैं और दुनिया भर के 2.4 करोड़
00:01:04लोग या 2.4 करोड़ ट्विटर अकाउंट्स तक पहुँच चुके हैं। तो देखते हैं कि वास्तव में कितने लोगों ने
00:01:09इन्फरेंस इंजीनियरिंग से जुड़ा कुछ न कुछ देखा है। और इस शानदार प्रतिक्रिया के साथ ही,
00:01:17एक सवाल ऐसा रहा है जो लोग मुझसे पूछते आ रहे हैं: आपने भला ऐसा क्यों किया? यानी आप
00:01:23एक ऐसी चीज पर किताब क्यों लिखेंगे जो इतनी तेजी से बदल रही है? खैर, मेरा मानना है कि
00:01:29इस समय तक इन्फरेंस इंजीनियरिंग के कई सिद्धांत काफी मजबूत हो चुके हैं, और ऐसी बहुत सी चीजें हैं जो
00:01:34हम मॉडल की हर नई पीढ़ी के साथ सीख सकते हैं और दोहरा सकते हैं। लेकिन आज मैं यहाँ यह बताने आया हूँ कि
00:01:42इन्फरेंस इंजीनियरिंग में नया क्या है। किताब आने के बाद की सभी नई जानकारियों का यह पहला सार्वजनिक परिशिष्ट है।
00:01:48हम इन्फरेंस इंजीनियरिंग के सिद्धांतों की थोड़ी समीक्षा करेंगे, और फिर उस सब पर बात करेंगे
00:01:54जो 23 फरवरी 2026 के बाद से इन्फरेंस की दुनिया में हुआ है। हम बात करेंगे
00:02:00कि टर्बो क्वांट के साथ क्या हुआ, केवी कॉम्पैक्शन के बारे में थोड़ी बात करेंगे, हम डी-फ्लैश पर काफी समय
00:02:05बिताएंगे और स्पेक्युलेटिव डिकोडिंग की कुछ नई और रोमांचक चीजों पर चर्चा करेंगे। और फिर मैं
00:02:12थोड़ा अनुमान लगाऊंगा, थोड़ा पूर्वानुमान लगाऊंगा कि इन्फरेंस में आगे क्या होने वाला है
00:02:17और अगली बार जब आप लोग मुझे यहाँ देखेंगे, तो मैं किस बारे में बात करने के लिए उत्साहित रहूँगा।
00:02:23बढ़िया! तो चलिए शुरू करते हैं। इन्फरेंस के बारे में लोगों के साथ ढेर सारी बातचीत से
00:02:30मैंने कुछ साझा सिद्धांतों की पहचान की है। और उनमें से एक बड़ा सिद्धांत यह है—
00:02:38मैं उस दिन सारा के साथ इस पॉडकास्ट पर था, हम इन्फरेंस के बारे में बात कर रहे थे,
00:02:44और दो तरह की इन्फरेंस इंजीनियरिंग सामने आई है: एक है लोकल इन्फरेंस,
00:02:48जहाँ मुख्य रणनीति बस यह होती है कि जो भी हार्डवेयर आपके पास है, उस पर इसे चला दिया जाए।
00:02:56मॉडल को क्वांटाइजेशन, डिस्टिलेशन, प्रूनिंग जैसे तरीकों से कंप्रेस करके, या आपके घर में जो भी
00:03:02GPU मौजूद हैं, उन पर बाँटकर चलाया जाता है। पहले आप इसे काम करने लायक बनाते हैं, और फिर इसकी कमियों को दूर करते हैं।
00:03:09मॉडल के इस कम्प्रेशन से जो भी गंभीर समस्याएं पैदा हुई हैं, उन्हें आप हटाते हैं और
00:03:15बैच साइज 1 पर चलाते हुए इसे वापस पुरानी बुद्धिमत्ता के स्तर पर लाने की कोशिश करते हैं। और फिर मेरी
00:03:20दुनिया आती है—बैच साइज और डेटा सेंटर की दुनिया, जहाँ नियम है कि इसे तुरंत काम पर लगाओ,
00:03:27vLLM का बिल्ड तैयार करो, इसे चालू करो और फिर इसकी स्पीड बढ़ाओ। इसके लिए केवी-अवेयर राउटिंग, स्पेक्युलेशन,
00:03:33और डिसएग्रीगेशन जैसी चीजें की जाती हैं। मुझे लगता है कि इन दोनों दुनियाओं से हमें एक-दूसरे से काफी कुछ सीखने को मिलता है।
00:03:40इस टॉक में मेरा ध्यान डेटा सेंटर-उन्मुख इन्फरेंस इंजीनियरिंग की प्रगति पर रहेगा,
00:03:46क्योंकि मैं इसी के बारे में जानता हूँ, लेकिन लोकल इन्फरेंस की दुनिया में भी कई बेहतरीन चीजें हो रही हैं।
00:03:52अपनी किताब 'इन्फरेंस इंजीनियरिंग' में, मैंने आम तौर पर माना है कि वेट्स (weights) एक तैयार प्रोडक्ट हैं, और
00:03:58मुझे लगता है कि ट्रेनिंग से इन्फरेंस में हैंडऑफ को ध्यान में रखना जरूरी है, और यह इस क्षेत्र की
00:04:03सीमा तय करने का एक अच्छा तरीका है। हालाँकि, मुझे हाल ही में यह अधिक से अधिक देखने को मिला है कि
00:04:10इन्फरेंस के लिए कई ऑप्टिमाइजेशन एक समर्पित ट्रेनिंग प्रोसेस से आते हैं। इसलिए ट्रेनिंग
00:04:17और इन्फरेंस के बीच की लकीरें धुंधली होती जा रही हैं, और यह ध्यान रखने योग्य एक दिलचस्प बात है।
00:04:22हम एक ऐसा चक्र देख रहे हैं जहाँ आपको तेजी से इन्फरेंस मिलता है, जिससे अधिक डेटा मिलता है, जिसका उपयोग आप
00:04:28एक बेहतर मॉडल को ट्रेन करने के लिए करते हैं, जिससे आपको और तेज इन्फरेंस मिलता है, जिससे अधिक डेटा मिलता है... और आप बस
00:04:33तब तक ऐसा करते रहते हैं जब तक आप बहुत अमीर न बन जाएं। तो इन्फरेंस के लिए ट्रेनिंग के साथ,
00:04:39हमारे पास उन चीजों पर बात करने के लिए कई नई तकनीकें हैं जिन्हें मैं 'द बिग थ्री' कहना पसंद करता हूँ।
00:04:45हम क्वांटाइजेशन की नई खबरों, कैशिंग की नई खबरों (विशेष रूप से KV कैश मैकेनिज्म) और
00:04:52स्पेक्युलेशन की नई खबरों पर बात करेंगे। क्योंकि ये वही क्षेत्र हैं... वैसे तो इन्फरेंस की दुनिया में और भी बहुत कुछ है,
00:04:57जिसमें से कुछ चीजों पर मैं अंत में बात करूँगा, लेकिन जब रोजमर्रा के व्यावहारिक काम की बात आती है
00:05:02कि 'किसी मॉडल को तेज कैसे बनाया जाए', तो आमतौर पर लोग इन्हीं तीन तकनीकों का सहारा लेते हैं।
00:05:09तो सबसे पहली बात, मैंने एक किताब प्रकाशित की, फरवरी का महीना था, मुझे बहुत अच्छा लग रहा था, मुझे लगा कि वाह,
00:05:16इन्फरेंस के बारे में जो कुछ भी जानने की जरूरत है, वह सब एक ही जगह पर है! और फिर,
00:05:23क्वांटाइजेशन की दुनिया में: संक्षेप में कहें तो, क्वांटाइजेशन वह प्रक्रिया है जहाँ हम कम सटीक नंबर फॉर्मेट का उपयोग करते हैं
00:05:32ताकि बैंडविथ और कंप्यूट की बचत हो सके, TTFT और TPS को बेहतर बनाया जा सके।
00:05:39यह आमतौर पर हार्डवेयर-विशिष्ट होता है, लागत बचाता है, लेकिन मॉडल की गुणवत्ता में थोड़ी गिरावट ला सकता है।
00:05:45वैसे, यदि आप क्वांटाइजेशन पर मेरा पूरा विचार सुनना चाहते हैं, तो मैंने पिछले महीने AI इंजीनियर मियामी में एक टॉक दी थी
00:05:51कि कैसे क्वांटाइजेशन उतना बुरा नहीं है जितना लगता है, और ऐसी कई चीजें हैं जो आप
00:05:57क्वालिटी बनाए रखने के लिए कर सकते हैं। तो मुझे क्वांटाइजेशन के अपने विवरण पर काफी अच्छा लग रहा था,
00:06:04और तभी 2 करोड़ लोगों ने टर्बो क्वांट देखा, और इसने मेमोरी स्टॉक में एक मिनट के लिए
00:06:12बड़ा फेरबदल ला दिया क्योंकि सबको लगा कि मेमोरी अब बहुत अधिक कुशल होने वाली है
00:06:16और हमें अब फ्लैश मेमोरी की आवश्यकता नहीं है, जो कि गलत था। खैर, यह एक नया
00:06:23क्वांटाइजेशन दृष्टिकोण था, जो इस साल मार्च में लोकप्रिय हुआ था, जो क्वांटाइजेशन के लिए
00:06:29पोलर कोऑर्डिनेट्स का उपयोग करता है और आपको KV कैश को 4 बिट्स तक क्वांटाइज करने की अनुमति देता है। यह बहुत ट्रेंडिंग था और
00:06:36मुझे लगा कि अरे यार, यह पूरा विषय तो मुझसे छूट ही गया, अब यह सब कैसा दिखेगा?
00:06:43और इसलिए हमारी टीम ने इस पर काफी शोध किया, अगर आप ट्विटर पर वाटरलू
00:06:50इंटरन को जानते हैं, जो हमारी मॉडल परफॉरमेंस टीम के अली हैं, मुझे पक्का नहीं पता कि वह अभी भी इंटरन हैं या नहीं,
00:06:57लेकिन हाँ, वह वाटरलू से हैं। तो उन्होंने टर्बो क्वांट के पीछे के गणित पर एक बेहतरीन लेख लिखा।
00:07:04और मूल रूप से, टर्बो क्वांट से आपको जो लाभ मिलता है वह यह है कि आप 8 बिट्स के बजाय 4 बिट्स से
00:07:09KV कैश को दर्शाते हैं। आप आधी जगह और आधी बैंडविड्थ बचाते हैं और प्रभावी रूप से
00:07:14दोगुनी बैंडविड्थ पाते हैं जब आप सिस्टम मेमोरी में KV कैश को स्थानांतरित करते हैं। लेकिन इसकी एक बड़ी कमी भी है।
00:07:21टर्बो क्वांट के लिए, डिकोड के दौरान इसे संभालने के लिए आपको फॉरवर्ड पास में अतिरिक्त गणना करने की
00:07:25आवश्यकता होती है और यह TPS को आधे से भी कम कर देता है, जो प्रोडक्शन के कई उपयोगों के लिए स्वीकार्य नहीं है।
00:07:32इसलिए हमने टर्बो क्वांट को गहराई से समझा, लेकिन वास्तविक कार्यभार के लिए
00:07:38हम इसका उपयोग नहीं कर रहे हैं। हम अभी भी पारंपरिक NVFP4 क्वांटाइजेशन पर ही निर्भर हैं।
00:07:44फिर भी, यह लोकल इन्फरेंस इस्तेमाल करने वालों के लिए एक बेहतरीन तकनीक है। यदि आप कोई मॉडल चला रहे हैं,
00:07:51विशेष रूप से अपने स्थानीय कंप्यूटर या बेसमेंट में रखे GPU पर एक लंबा कांटेक्स्ट भाषा मॉडल,
00:07:58तो आपके पास बहुत सीमित मेमोरी होती है, जो सबसे बड़ी बाधा है। इसलिए KV कैश से मेमोरी खाली करने वाली
00:08:04और लंबे अनुक्रमों को रखने की अनुमति देने वाली कोई भी तकनीक बहुत मूल्यवान होगी,
00:08:09और अतिरिक्त फॉरवर्ड पास की गणना उतनी बड़ी कमी नहीं लगेगी।
00:08:16फिर भी, टर्बो क्वांट एक शानदार शोध पत्र है, एक बेहतरीन तकनीक है जो डेटा सेंटर इन्फरेंस
00:08:22की दुनिया में उतनी लागू नहीं हो पाई जितनी शुरू में लगी थी। इसके बजाय,
00:08:28हमारा ध्यान KV कैश के बजाय वेट्स को क्वांटाइज करने पर केंद्रित NVFP4 पर है,
00:08:36हम क्वांटाइज्ड वेट्स की कमियों को दूर करने की पूरी कोशिश कर रहे हैं ताकि यह सुनिश्चित हो सके कि हम KV कैश
00:08:41के प्रोबबिलिटी डिस्ट्रीब्यूशन को न बिगाड़ें। इसके बजाय KV-अवेयर राउटिंग, KV ऑफलोडिंग और KV शेयरिंग पर ध्यान केंद्रित कर रहे हैं,
00:08:49सिस्टम में KV कैश को स्थानांतरित करने के लिए NCCL और NVIDIA Dynamo जैसे उपकरणों का उपयोग कर रहे हैं
00:08:55और इसे कंप्रेस करने के लिए टर्बो क्वांट का उपयोग करने के बजाय साधारण CPU मेमोरी आदि में ऑफलोड कर रहे हैं।
00:09:04और हम विभिन्न मॉडैलिटीज़ में क्वांटाइजेशन पर भी ध्यान केंद्रित कर रहे हैं, ताकि
00:09:11हम न केवल भाषा मॉडलों बल्कि इमेज और वीडियो मॉडलों पर भी NVFP4 के लाभों को कैसे लागू कर सकें।
00:09:17अली ने ट्विटर पर इसके बारे में बहुत सारी शानदार चीजें लिखी हैं, जिन्हें आपको ज़रूर देखना चाहिए।
00:09:23बहरहाल, KV कैश अभी भी बहुत महत्वपूर्ण है और आइए इसके बारे में बात करते हैं, आइए KV कॉम्पैक्शन के बारे में बात करते हैं।
00:09:29एक त्वरित पुनरावलोकन: KV कैश में यदि आप समान प्रिफिक्स के साथ वही प्रॉम्प्ट डालते हैं, तो आप उन टोकन का पुनः उपयोग
00:09:35कर सकते हैं जिन्हें आपने पिछली बार प्री-फिल पर कैलकुलेट किया था। यह आपके पूरे सिस्टम को तेज और अधिक कुशल बनाता है।
00:09:42व्यापक रूप से कहें तो, KV कैश लॉसलेस मेमोरी है। जब हम अपने इन्फरेंस सिस्टम के बारे में
00:09:48सोचते हैं, तो लॉसलेस मेमोरी के केवल कुछ ही स्रोत होते हैं। आपके पास प्रॉम्प्ट की सामग्री, कांटेक्स्ट और KV कैश होता है
00:09:55और यह आपके द्वारा पास किए गए डेटा की मात्रा के साथ रैखिक रूप से बढ़ेगा। और अब यदि आप
00:09:5910 लाख टोकन अनुक्रम की लंबाई के बारे में सोच रहे हैं, तो यह वास्तव में काफी बड़ा हो जाता है। इसलिए बहुत से लोग सोच रहे हैं
00:10:05कि मेमोरी को कैसे कंप्रेस किया जाए, कांटेक्स्ट को कैसे कंप्रेस किया जाए। एजेंट हार्नेस कांटेक्स्ट को कंप्रेस करेंगे, लेग
00:10:11सर्च और ये सभी तकनीकें जिनके बारे में हम वर्षों से बात कर रहे हैं, एक बड़े कांटेक्स्ट को
00:10:17ऐसी चीज़ में कंप्रेस करने जैसा है जिसे आप मॉडल को दे सकें या फाइलों में लिख सकें। ये सभी चीज़ें
00:10:22उपलब्ध डेटा की मात्रा की तुलना में उप-रैखिक रूप से बढ़ती हैं। लेकिन क्या होगा यदि कोई बीच का रास्ता हो? क्या होगा यदि ऐसा कोई तरीका हो
00:10:28जिससे आप लगभग बिना किसी जानकारी के नुकसान के, याद रखे जाने वाले डेटा में काफी हद तक कंप्रेशन हासिल कर सकें?
00:10:34तो, हमारे पास यह सोचने के कई अलग-अलग तरीके हैं कि कैश में क्या रखा जाए।
00:10:41हाल के कॉम्पैक्शन तरीकों ने दिखाया है कि हम कैश को बहुत छोटे कैश से बदल सकते हैं।
00:10:47छोटा कर सकते हैं। हमारे पास अटेंशन मैचिंग और कार्ट्रिज जैसे पेपर हैं जिन्होंने
00:10:53उच्च कम्प्रेशन रेशियो के साथ बहुत आशाजनक परिणाम दिए हैं। लेकिन ये दोनों इन्फरेंस के समय चलते हैं। फिर से, तकनीकों में से एक
00:11:00जिसके बारे में मैं बात करना चाहता हूँ या जिन विषयों पर मैं बात करना चाहता हूँ, वह है इन्फरेंस के लिए ट्रेनिंग। तो इस मामले में
00:11:05मैं 'स्टिल' नाम की चीज़ पेश करना चाहता हूँ, जिसे बेस 10 रिसर्च टीम ने बनाया है, जहाँ कैश के ऊपर सिंथेसिस होता है
00:11:12जहाँ हम सीधे जानकारी या उसके किसी डिटरमिनिस्टिक सबसेट को रखने के बजाय जानकारी का एक सीखा हुआ रिप्रेजेंटेशन रखते हैं,
00:11:17जो ट्रेनिंग के ज़रिए अमॉर्टाइज्ड होता है। तो हमारी पोस्ट-ट्रेनिंग टीम के चार्ली और मुदित ने
00:11:25हाल ही में कोसा कंपाइल में एक शानदार चौक टॉक दी थी। यह यूट्यूब पर उपलब्ध है, मैं
00:11:31आपसे आग्रह करूँगा कि अगर आप केवी कॉम्पैक्शन के बारे में जानने में रुचि रखते हैं तो इसे ज़रूर देखें। दुर्भाग्य से मेरे पास
00:11:37यहाँ सब कुछ समझाने का समय या प्रतिभा नहीं है, लेकिन इसका मूल तंत्र यह है
00:11:46कि स्टिल एक परसीवर बॉटलनेक है, जो सीखे हुए क्वेरी वैक्टर्स के एक फिक्स्ड सेट को लेता है, उसे पूरे केवी कैश के साथ
00:11:53क्रॉस-अटेंड करता है और एक ही फॉरवर्ड पास में कॉम्पैक्ट कीज़ और वैल्यूज़ का एक सेट तैयार करता है।
00:11:59यह एक तेज़, डिफरेन्शिएबल कंप्रेस्ड मेमोरी बनाता है जिस पर एलएलएम ध्यान दे सकता है मानो यह वास्तविक कॉन्टेक्स्ट हो।
00:12:05तो अगर आप केवी कॉम्पैक्शन में रुचि रखते हैं, तो चार्ली और मुदित के काम को ज़रूर देखें।
00:12:09इसके बारे में सीखना वाकई बहुत शानदार रहा है। तो यह उन तकनीकों में से दो हैं जिनके बारे में हमने बात की है,
00:12:16हमने क्वांटाइजेशन और कैशिंग की बात की है। आखिरी तकनीक स्पेक्यूलेशन है, और इसमें काफी बदलाव आया है।
00:12:21रिव्यू के तौर पर, स्पेक्यूलेटिव डिकोडिंग में हम ड्राफ्ट टोकन्स का उपयोग करने जा रहे हैं, हम फॉरवर्ड पास के दौरान उन्हें वेरीफाई करेंगे
00:12:29और इसका उपयोग प्रति फॉरवर्ड पास एक से अधिक टोकन जनरेट करने के लिए करेंगे।
00:12:34यह प्रति सेकंड टोकन में बहुत मदद करता है और यह पूरी तरह से लॉसलेस ऑप्टिमाइजेशन है, जो बढ़िया है क्योंकि
00:12:40हमें क्वालिटी की बिल्कुल चिंता करने की ज़रूरत नहीं है। अब स्पेक्यूलेशन के इतिहास की बात करें तो हमने
00:12:46स्पेक्यूलेटिव डिकोडिंग से शुरुआत की, ये सभी किताब में हैं। आपके पास स्पेक-डेक है जहाँ आप ड्राफ्ट टोकन जनरेट करने के लिए
00:12:52उसी फैमिली के एक छोटे मॉडल का उपयोग करते हैं। पता चला कि छोटे मॉडल अच्छे ड्राफ्ट टोकन जनरेटर नहीं होते हैं,
00:12:58वे बस अच्छे छोटे मॉडल होते हैं। इसलिए एक इंडस्ट्री के रूप में हमने मेदुसा जैसे कई नए तरीकों का आविष्कार किया, जहाँ
00:13:04शायद आप मॉडल में सिर्फ डिकोडर हेड्स जोड़ते हैं, और अंततः ईगल 3 आया, जो यह था कि क्या हो
00:13:09अगर उसी फैमिली से एक छोटा मॉडल लेने के बजाय, हम वास्तव में ड्राफ्ट टोकन जनरेट करने के लिए टारगेट मॉडल के हिडन स्टेट्स पर
00:13:15एक बिलियन पैरामीटर मॉडल को ट्रेन करें? और उसने वास्तव में बहुत अच्छी तरह काम किया। और इसलिए
00:13:21शायद पिछले साल या इस साल फरवरी तक, ईगल 3 स्पेक्यूलेशन में सबसे बेहतरीन तरीका था।
00:13:27अब हमारे पास डीफ्लैश आ गया है। डीफ्लैश और भी बेहतर है। तो यह स्पेक्यूलेशन के लिए डिफ्यूजन है; डीफ्लैश
00:13:36एक सिंगल टोकन के बजाय ड्राफ्ट टोकन्स की एक सीक्वेंस बनाता है। तो यह मॉडल एक डिफ्यूजन लैंग्वेज मॉडल है, जिसका
00:13:43मतलब है कि यह ठीक उसी तरह टोकन्स की एक पूरी सीक्वेंस बनाता है जैसे वीडियो या इमेज जनरेशन फ्रेम्स या
00:13:49पिक्सेल की सीक्वेंस बनाता है और ऑटो-रिग्रेसिव टोकन जनरेशन करने के बजाय उस पर इटरेट करता है।
00:13:55डीफ्लैश मॉडल चलाने में दो या चार गुना धीमे हो सकते हैं, लेकिन वे उस विंडो में एक बार में
00:14:01आठ या 16 टोकन प्रेडिक्ट करेंगे, जबकि ईगल एक बार में केवल एक ही करता है। इसलिए एक सिंगल डीफ्लैश
00:14:08फॉरवर्ड पास पूरे ईगल ड्राफ्ट फेज़ से तेज़ होता है और अधिक टोकन प्रेडिक्ट करता है। ये टोकन
00:14:14एक-दूसरे के साथ क्रॉस-अटेंड कर सकते हैं और आमतौर पर उच्च एक्सेप्टेंस रेट प्रदान करते हैं, क्योंकि स्पेक्यूलेशन में एक्सेप्टेंस
00:14:21रेट ही सब कुछ है। तो व्यावहारिक उपयोग में हम डीफ्लैश से 3 गुना से अधिक का सुधार देख रहे हैं। इसे
00:14:30एक सिंगल B200 Qwen38B के साथ मापा गया है और हम देख सकते हैं कि ईगल की तुलना में टोकन एक्सेप्टेंस रेट
00:14:40और प्रति सेकंड टोकन दोनों में काफी बड़ा सुधार हुआ है। इन डीफ्लैश मॉडल्स को बाईडायरेक्शनल ड्राफ्टिंग के लिए
00:14:47एक अटेंशन मास्क के साथ ट्रेन किया जाता है, इसलिए टारगेट मॉडल कॉन्टेक्स्ट प्रदान करेगा।
00:14:54हमारे पास क्लीन टोकन का एक सबसेट होगा जो सैंपल किए जाते हैं, और अटेंशन मास्क
00:14:59कॉज़ल कंसिस्टेंसी लागू करेगा, लेकिन फिर भी यह बायडायरेक्शनल अटेंशन की अनुमति देगा,
00:15:06जबकि एक पारंपरिक ऑटोरिग्रेसिव मॉडल में आप केवल एक ही दिशा में टोकन देखते हैं। इसलिए हम
00:15:13इस डिफ्यूज़न-बेस्ड आर्किटेक्चर का लाभ उठाने में सक्षम हैं। और फिर मुझे लगा कि मेरा काम
00:15:19पूरा हो गया है, पर कुछ दिन पहले ही DSpark सामने आया। अब dflash तो प्रोडक्शन में चालू है,
00:15:25लेकिन DSpark एक नई रिसर्च है। तो इसके बारे में मैं बस यही कह सकता हूँ कि यह मौजूद है, काफी कूल है, और हम
00:15:31इस पर ध्यान दे रहे हैं। dflash की तुलना में अंतर यह है कि इसमें भी डिफ्यूज़न मॉडल है, पर यह इसे
00:15:38एक सीक्वेंसियल मॉडल के साथ जोड़ता है। विचार यह है कि हम एक्सेप्टेंस रेट में सुधार करेंगे
00:15:45केवल इटेरेटिव स्पेक्युलेटर, केवल डिफ्यूज़न स्पेक्युलेटर
00:15:51या केवल ऑटोरिग्रेसिव स्पेक्युलेटर के बजाय इन दोनों मॉडलों को एक साथ काम में लाकर। तो DSpark काफी रोमांचक है,
00:15:57लेकिन अभी शेयर करने के लिए हमारे पास इसके कोई प्रोडक्शन परिणाम नहीं हैं। उम्मीद है अगली बार होंगे।
00:16:03लेकिन हमारे पास कंटीन्यूअस स्पेक्युलेटर रीट्रेनिंग पर प्रोडक्शन परिणाम ज़रूर हैं। तो यहाँ हम
00:16:09वापस dflash पर आते हैं। विचार यह है कि स्पेक्युलेटिव डिकोडिंग
00:16:15आपके सिस्टम में प्रॉम्प्ट्स और रिस्पॉन्स्स के वास्तविक कंटेंट पर काफी निर्भर करती है। और इसलिए यदि आप
00:16:21अपने लाइव सिस्टम में उन प्रॉम्प्ट्स और रिस्पॉन्स्स पर लगातार रीट्रेनिंग कर रहे हैं, तो आप टोकन एक्सेप्टेंस रेट्स में
00:16:2920% से लेकर 2 गुना तक का सुधार देख सकते हैं। यह वास्तव में करना काफी कठिन है, इसमें बहुत अधिक
00:16:36स्टोरेज लगता है और आपको यह सुनिश्चित करना होगा कि आपके पास इस तरह से डेटा का उपयोग करने की अनुमति है
00:16:40जिससे आप इसे प्रोसेस कर रहे हैं। इसमें भारी मात्रा में कंप्यूट लगता है और आपको इस सारी जानकारी को ट्रांसफर करना पड़ता है,
00:16:46और यदि आप अंतर्निहित मॉडल बदलते हैं, तो आपको स्पेक्युलेटर मॉडल भी बदलना होगा। लेकिन जब मैं भविष्य की ओर देखता हूँ,
00:16:51भविष्य की ओर देखते हुए, मुझे लगता है कि बहुत बड़े पैमाने के सिस्टम के लिए निरंतर स्पेक्यूलेशन
00:16:58एक बेहतरीन ऑप्टिमाइजेशन होगा। तो इन्फेरेंस में आगे क्या होने वाला है? जो मैं कहने जा रहा हूँ, वह मेरी व्यक्तिगत राय, अनुमान
00:17:06और सार्वजनिक जानकारी पर आधारित है। अगर मुझे वास्तव में किसी नई रिलीज़ के बारे में पता होता, तो मैं उसके बारे में बात नहीं कर पाता।
00:17:11तो यह सिर्फ वो है जो मुझे लगता है कि होने वाला है। मैं hardware के तीन चक्रों से गुजर चुका हूँ—
00:17:17Ampere रिलीज़, Hopper रिलीज़ और Blackwell रिलीज़। और हमेशा इसमें समय लगता है,
00:17:23इन चिप्स के शिप होने से लेकर डेटा सेंटर्स में इंस्टॉल होने तक, और पूरे सॉफ्टवेयर स्टैक द्वारा
00:17:30इनकी क्षमताओं का सही मायने में फायदा उठाने में समय लगता है। लेकिन कुछ बातें जिन्हें लेकर मैं उत्साहित हूँ,
00:17:36वह यह है कि Rubin के साथ NVFP4 का परफॉर्मेंस शानदार होने वाला है।
00:17:44इसलिए जितना अधिक हम लोकल इन्फेरेंस से तकनीकों को अपनाकर NVFP4 डेटा फॉर्मेट में
00:17:49मॉडल चलाने का आत्मविश्वास हासिल करेंगे, उतना ही हम आने वाले Rubin सिस्टम्स के
00:17:54शानदार परफॉर्मेंस का लाभ उठा पाएंगे। मुझे लगता है कि डिसएग्रीगेशन और पूरे सिस्टम स्तर पर
00:18:00कम्युनिकेशन का महत्व लगातार बढ़ता जाएगा। हमें PD डिसएग्रीगेशन से बहुत अच्छे शुरुआती फायदे दिख रहे हैं,
00:18:05और KV कैश डेटा जैसी जानकारी को पूरे सिस्टम में ट्रांसफर करने की क्षमता
00:18:12काफी महत्वपूर्ण होती जाएगी। और जैसा कि मैंने कहा, इन्फेरेंस के लिए ट्रेनिंग का विषय
00:18:17आने वाले समय में इंडस्ट्री पर बड़ा प्रभाव डालता रहेगा। टॉकी के लिए आप सभी का बहुत-बहुत धन्यवाद,
00:18:25टॉक में आने के लिए धन्यवाद। मैं Twitter और LinkedIn पर हूँ, और मैं मुफ़्त किताबें भी बांट रहा हूँ।
00:18:32आप QR कोड स्कैन करके PDF डाउनलोड कर सकते हैं या Base10 बूथ पर आकर “Inference Engineering” की
00:18:37अपनी मुफ़्त कॉपी ले सकते हैं। हमारे पास वहां काफी किताबें हैं, शायद सभी के लिए पर्याप्त होंगी। अगर नहीं, तो कूरियर
00:18:43ऑफिस से और किताबें ले आएगा। तो हाँ, मैं नीचे Base10 बूथ पर मौजूद रहूँगा। आप सभी का बहुत-बहुत धन्यवाद
00:18:48और आपका दिन शुभ हो!

핵심 요약

इन्फरेंस स्पीड बढ़ाने के लिए मॉडल वेट्स के NVFP4 क्वांटाइजेशन, स्टिल (STILL) द्वारा KV कैश कॉम्पैक्शन, और डीफ्लैश (dflash) जैसे डिफ्यूजन-आधारित स्पेक्युलेटिव डिकोडिंग का संयोजन डेटा सेंटर इन्फरेंस की दक्षता को 3 गुना तक बढ़ा देता है।

하이라이트

  • 23 फरवरी 2026 को प्रकाशित 'इन्फरेंस इंजीनियरिंग' किताब की 11,000 से अधिक प्रिंट कॉपियां बिक चुकी हैं और यह 2.4 करोड़ ट्विटर अकाउंट्स तक पहुँची है।

  • टर्बो क्वांट डिकोड के दौरान अतिरिक्त फॉरवर्ड पास गणना के कारण प्रति सेकंड टोकन (TPS) की गति को आधा कर देता है, जिससे यह डेटा सेंटर इन्फरेंस के लिए अनुपयुक्त हो जाता है।

  • स्टिल (STILL) परसीवर बॉटलनेक का उपयोग करके पूरे KV कैश पर क्रॉस-अटेंड करता है और एक ही फॉरवर्ड पास में कॉम्पैक्ट कीज़ और वैल्यूज़ का सेट तैयार करता है।

  • डीफ्लैश (dflash) डिफ्यूजन-आधारित आर्किटेक्चर का उपयोग करके एक ही फॉरवर्ड पास में 8 से 16 ड्राफ्ट टोकन प्रेडिक्ट करता है और ईगल (EAGLE) की तुलना में 3 गुना से अधिक सुधार देता है।

  • लाइव सिस्टम के प्रॉम्प्ट्स और रिस्पॉन्स्स पर स्पेक्युलेटर मॉडल की निरंतर रीट्रेनिंग से टोकन एक्सेप्टेंस रेट में 20% से 2 गुना तक का सुधार होता है।

타임라인

इन्फरेंस इंजीनियरिंग का विकास और दो मुख्य दृष्टिकोण

  • 23 फरवरी 2026 को प्रकाशित इन्फरेंस इंजीनियरिंग पुस्तक की 11,000 प्रिंट और लगभग 30,000 डिजिटल प्रतियां बिक चुकी हैं।
  • इन्फरेंस इंजीनियरिंग दो भागों में बंटी है: लोकल इन्फरेंस और डेटा सेंटर इन्फरेंस।
  • ट्रेनिंग और इन्फरेंस के बीच की सीमाएं अब धुंधली हो रही हैं क्योंकि इन्फरेंस ऑप्टिमाइजेशन के लिए समर्पित ट्रेनिंग का उपयोग बढ़ रहा है।

लोकल इन्फरेंस का मुख्य उद्देश्य सीमित हार्डवेयर पर क्वांटाइजेशन, डिस्टिलेशन और प्रूनिंग के माध्यम से मॉडल को कंप्रेस करके बैच साइज 1 पर चलाना है। डेटा सेंटर इन्फरेंस में vLLM बिल्ड का उपयोग करके KV-अवेयर राउटिंग, स्पेक्यूलेशन और डिसएग्रीगेशन के जरिए स्पीड बढ़ाई जाती है। तेजी से इन्फरेंस मिलने से अधिक डेटा एकत्र होता है, जिसका उपयोग बेहतर मॉडल ट्रेन करने के लिए किया जाता है।

क्वांटाइजेशन तकनीकें और टर्बो क्वांट का प्रभाव

  • मार्च 2026 में लोकप्रिय हुआ टर्बो क्वांट पोलर कोऑर्डिनेट्स का उपयोग करके KV कैश को 4 बिट्स तक क्वांटाइज करता है।
  • टर्बो क्वांट डिकोड चरण के दौरान फॉरवर्ड पास में अतिरिक्त गणना की मांग करता है, जिससे TPS आधा रह जाता है।
  • डेटा सेंटर इन्फरेंस में KV कैश के बजाय वेट्स को क्वांटाइज करने के लिए NVFP4 मानक बना हुआ है।

क्वांटाइजेशन कम सटीक नंबर फॉर्मेट का उपयोग करके बैंडविथ और कंप्यूट की बचत करता है। टर्बो क्वांट सिस्टम मेमोरी में KV कैश ट्रांसफर करते समय आधी जगह बचाता है और दोगुनी बैंडविड्थ देता है, लेकिन TPS में गिरावट के कारण यह डेटा सेंटर के बजाय सीमित मेमोरी वाले लोकल इन्फरेंस के लिए अधिक उपयोगी है। डेटा सेंटर इन्फरेंस के लिए KV-अवेयर राउटिंग, NCCL और NVIDIA Dynamo का उपयोग करके KV कैश को साधारण CPU मेमोरी में ऑफलोड किया जाता है।

KV कैश कॉम्पैक्शन और स्टिल (STILL) आर्किटेक्चर

  • 10 लाख टोकन अनुक्रम लंबाई पर KV कैश का आकार रैखिक रूप से बढ़ता है।
  • अटेंशन मैचिंग और कार्ट्रिज तकनीकें इन्फरेंस के समय KV कैश को छोटा करती हैं।
  • बेस 10 द्वारा विकसित स्टिल (STILL) सीखे हुए रिप्रेजेंटेशन का उपयोग करके कॉम्पैक्ट मेमोरी तैयार करता है।

KV कैश लॉसलेस मेमोरी है जो इनपुट डेटा की मात्रा के साथ रैखिक रूप से बढ़ता है। स्टिल (STILL) एक परसीवर बॉटलनेक का उपयोग करता है जो सीखे हुए क्वेरी वेक्टर्स के फिक्स्ड सेट को पूरे KV कैश के साथ क्रॉस-अटेंड करता है। यह एक ही फॉरवर्ड पास में कॉम्पैक्ट कीज़ और वैल्यूज़ का सेट तैयार करता है, जिससे डिफ़रेंशिएबल कंप्रेस्ड मेमोरी बनती है जिस पर LLM ध्यान केंद्रित कर सकता है।

स्पेक्युलेटिव डिकोडिंग: ईगल 3 से डीफ्लैश और डीस्पार्क तक

  • ईगल 3 (EAGLE 3) में टारगेट मॉडल के हिडन स्टेट्स पर 1 बिलियन पैरामीटर मॉडल को ट्रेन करके ड्राफ्ट टोकन जनरेट किए जाते थे।
  • डीफ्लैश (dflash) डिफ्यूजन मॉडल का उपयोग करके एक ही विंडो में 8 से 16 टोकन प्रेडिक्ट करता है।
  • सिंगल B200 Qwen38B पर डीफ्लैश ईगल की तुलना में 3 गुना से अधिक का परफॉरमेंस सुधार दर्ज करता है।

डीफ्लैश ऑटोरिग्रेसिव टोकन जनरेशन के बजाय डिफ्यूजन लैंग्वेज मॉडल का उपयोग करता है, जो टोकन्स की पूरी सीक्वेंस बनाता है। एक सिंगल डीफ्लैश फॉरवर्ड पास पूरे ईगल ड्राफ्ट फेज़ से तेज़ होता है। ये टोकन एक-दूसरे के साथ क्रॉस-अटेंड करते हैं, जिससे एक्सेप्टेंस रेट बढ़ जाता है। डीस्पार्क (DSpark) इस डिफ्यूजन मॉडल को एक सीक्वेंसियल मॉडल के साथ जोड़कर एक्सेप्टेंस रेट को और बेहतर बनाता है।

इन्फरेंस का भविष्य और हार्डवेयर प्रगति

  • लाइव सिस्टम डेटा पर स्पेक्युलेटर मॉडल की निरंतर रीट्रेनिंग से एक्सेप्टेंस रेट 2 गुना तक बढ़ सकता है।
  • NVIDIA Rubin चिप्स के आने से NVFP4 डेटा फॉर्मेट की परफॉरमेंस में बड़ा सुधार होगा।
  • PD डिसएग्रीगेशन और सिस्टम-स्तरीय कम्युनिकेशन से KV कैश ट्रांसफर अधिक कुशल बनेगा।

Ampere, Hopper और Blackwell के बाद Rubin आर्किटेक्चर NVFP4 में मॉडल चलाने की दक्षता को बढ़ाएगा। निरंतर स्पेक्युलेटर रीट्रेनिंग के लिए अधिक स्टोरेज और कंप्यूट की आवश्यकता होती है, लेकिन यह बड़े पैमाने के सिस्टम के लिए सबसे प्रभावी ऑप्टिमाइजेशन है। पीडी डिसएग्रीगेशन के माध्यम से पूरे सिस्टम में KV कैश ट्रांसफर की क्षमता इन्फरेंस स्पीड को बनाए रखने में महत्वपूर्ण भूमिका निभाएगी।

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기