वर्टिकल मोबिलिटी: MVP से ट्रिलियन-पैरामीटर वर्कलोड तक इंफरेंस — सितांशु गुप्ता, कोरवीव

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00शुभ दोपहर, सभी को। मैं कॉरवी से सितान शू हूँ। मैं वर्टिकल मोबिलिटी के बारे में बात करने जा रहा हूँ।
00:00:19यह काफी शानदार विषय है, जो शीर्षक हमने चुना है, लेकिन मूल रूप से हम बात करने वाले हैं
00:00:26कॉरवी के उस इन्फेरेंस प्लेटफॉर्म के बारे में जिसे हम छोटे से लेकर बड़े मॉडल
00:00:30और विभिन्न प्रकार के वर्कलोड को सर्व करने के लिए बना रहे हैं। मेरे बारे में एक संक्षिप्त परिचय, मैंने कॉरवी में
00:00:38लगभग चार महीने पहले ज्वाइन किया था, और वहाँ सभी इन्फेरेंस का नेतृत्व कर रहा हूँ। और इससे पहले,
00:00:44मैं एडब्ल्यूएस अन्नपूर्णा लैब्स में ट्रेनिंग से जुड़ी हर चीज़ का प्रबंधन कर रहा था, और उससे पहले, सांबानोवा में इन्फेरेंस
00:00:49और ट्रेनिंग का काम संभालता था। तो इस विशेष क्षेत्र में मेरे पास काफी अनुभव है। जिस तरह से
00:00:56मैं आपको आगे ले जाऊंगा, वह यह समझाना है कि हमारे पास कौन से उपभोग मॉडल (कंजम्पशन मॉडल) हैं,
00:01:00और उनसे हमने यह कैसे तय किया है कि प्लेटफॉर्म कैसा दिखना चाहिए ताकि
00:01:04हमें बार-बार प्लेटफॉर्म को बदलने की जरूरत न पड़े और हम इन्फेरेंस सर्व करने के लिए अपने प्लेटफॉर्म में
00:01:09लगातार सुधार करते रहें, और यह भी कि वहाँ प्रदर्शन (परफॉरमेंस) इतनी महत्वपूर्ण भूमिका क्यों निभाता है।
00:01:14मुझे लगता है कि इसका कुछ हिस्सा यहाँ चर्चा किए गए पिछले विषय से मिलता-जुलता हो सकता है।
00:01:20उपभोग मॉडल (कंजम्पशन मॉडल)। तो हमारे पास मुख्य रूप से दो सबसे बड़े उपभोग मॉडल हैं। एक सर्वरलेस है,
00:01:29जो वह है जहाँ ग्राहक आ सकते हैं, उपभोक्ता आ सकते हैं, जिन्हें हार्डवेयर का प्रबंधन करने की खुद चिंता करने की
00:01:35ज़रूरत नहीं है, और न ही क्लस्टर प्रबंधन या ऑर्केस्ट्रेशन की कोई चिंता करने की आवश्यकता है।
00:01:40एक एपीआई है, एक यूआई है, आप आते हैं, प्रति टोकन भुगतान करते हैं, और आपको अपना मॉडल मिल जाता है।
00:01:47यहाँ सबसे बड़ी बात यह है कि हम कैटलॉग में किस प्रकार के मॉडल सर्व करते हैं, यानी मॉडलों की वह विविधता
00:01:54जिस तक ग्राहक पहुँच सकेंगे। मैं डेडीकेटेड के बारे में बात करूंगा और फिर वापस सर्वरलेस पर आऊंगा,
00:02:01क्योंकि सर्वरलेस पक्ष पर एक बात बहुत अनूठी है। डेडीकेटेड इन्फेरेंस सेवा जो हम प्रदान करते हैं
00:02:05वह ऐसे ग्राहकों के लिए अधिक है जो यह बिल्कुल जानना चाहते हैं कि वे किस हार्डवेयर का उपयोग कर रहे हैं और उस पर चल रहे हैं,
00:02:11लेकिन मॉडल की तैनाती (डिप्लॉयमेंट) भी उन्हीं पर निर्भर करती है। इसलिए वे हमारी सेवा का उपयोग करते हैं, हमारे ऑर्केस्ट्रेशन लेयर्स का उपयोग करते हैं,
00:02:18लेकिन मॉडल का डिप्लॉयमेंट उन पर निर्भर करता है। मॉडल का प्रदर्शन भी उन्हीं पर निर्भर करता है, बशर्ते हम प्लेटफॉर्म में
00:02:25वे क्षमताएं और नॉब्स प्रदान करें जिनसे उन फीचर्स को सर्व किया जा सके। सर्वरलेस पर वापस आते हुए,
00:02:30यहाँ एक दिलचस्प बात यह है कि आमतौर पर सर्वरलेस मॉडल 'नॉइजी नेबर' (शोर मचाने वाले पड़ोसी) की समस्याओं से जुड़े होते हैं,
00:02:38जहाँ मान लीजिए कि हर कोई बिल्कुल उसी एक मॉडल पर दबाव डाल रहा है, तो आपको काफी समय आउट
00:02:43का सामना करना पड़ सकता है, जो इस बात पर निर्भर करता है कि मेरे पास उसके पीछे कितनी क्षमता है। इसलिए एक और फीचर
00:02:48जो हमारे पास सर्वरलेस पक्ष पर है, उसे हम प्रोविजंड थ्रूपुट कहते हैं। तो एक ग्राहक के रूप में, यदि आप अपने ट्रैफिक प्रोफाइल को जानते हैं,
00:02:55और यदि आप हमें इसके बारे में बता सकते हैं, तो हम इसे पर्दे के पीछे
00:03:00विशेष रूप से आपके लिए अलग से निकाल सकते हैं। आपको अभी भी इस बात की चिंता करने की ज़रूरत नहीं है कि यह वास्तव में किस हार्डवेयर पर चल रहा है,
00:03:04जब तक आपका थ्रूपुट और आपके एसएलए (SLA) बनाए रखे जाते हैं।
00:03:07तो सर्वरलेस साइड पर यह एक और विकल्प है, और इसके लिए अभी भी टोकन के हिसाब से शुल्क लिया जाता है,
00:03:12लेकिन आप जानते हैं कि आपको वहाँ नॉइजी नेबर की समस्या का सामना नहीं करना पड़ेगा।
00:03:19आइए मैं कुछ अलग-अलग प्रकार के वर्कलोड और वर्कलोड शेप्स पर एक नजर डालता हूँ जो हमारे पास हैं,
00:03:27जिन्हें हम देख रहे हैं, और इनके बीच का अनुपात लगातार बदल रहा है, हालांकि एजेंटिक वर्कलोड
00:03:32काफी ऊपर है। एजेंटिक और चैट, एक तरह से बहुत समान हैं, इनपुट अनुक्रम की लंबाई (इनपुट सीक्वेंस लेंथ) पर बहुत अधिक,
00:03:39और आमतौर पर आउटपुट अनुक्रम की लंबाई पर बहुत कम होते हैं। लेकिन एजेंटिक और चैट के बीच
00:03:43सबसे बड़ा अंतर यह है कि एजेंटिक में मल्टी-टर्न बहुत कम लेटेंसी वाले होते हैं जबकि चैट में, क्योंकि जब
00:03:50आपको उपयोगकर्ता की प्रतिक्रिया मिलती है, तो आपको उत्तर पढ़ना होता है और फिर उसका जवाब देना होता है। तो वहाँ
00:03:56अंतर होते हैं। और वह बड़ा अंतर अंततः किसी ऐसी चीज़ में बदल जाता है
00:04:01जो केवीकैश (KVCache) प्रबंधन से संबंधित है। लेकिन ये दोनों वास्तविक समय (real-time) के हैं और एक अन्य वास्तविक समय का वर्कलोड
00:04:09आपकी आवाज़ (वॉयस) और वीडियो हैं, जो लगातार स्ट्रीमिंग वाले और लेटेंसी के प्रति अत्यधिक संवेदनशील होते हैं। एजेंटिक और चैट
00:04:16की तरफ, आवश्यकताएं काफी हद तक थ्रूपुट के दृष्टिकोण से होती हैं, लेटेंसी से इतनी नहीं, लेकिन वास्तविक समय के
00:04:23वॉयस और वीडियो पूरी तरह से लेटेंसी के प्रति संवेदनशील होते हैं। बैच पर आते हैं, बैच वह है जहाँ एसएलए (SLAs) बहुत ही
00:04:32ढीले होते हैं। वे सेकंड और मिनटों तक चलते हैं, कभी-कभी कुछ ग्राहकों के लिए वास्तव में घंटों में भी।
00:04:37वे कहते हैं, मैं बस दे दूंगा, मुझे 10 से 12 घंटे की वर्कलोड क्षमता दें और मैं जो कुछ भी कर सकूँ गा फेंक दूंगा,
00:04:44जब चाहें तब प्रोसेस कर लें। ये बैच वर्कलोड, जिस तरह से यहाँ तस्वीर में आते हैं
00:04:52तय करने में, माफ़ कीजिए, हमारे स्टैक में किए जाने वाले कुछ डिज़ाइन विकल्पों की आवश्यकता होने के कारण। कल्पना कीजिए
00:04:59इन चार अलग-अलग प्रकार के वर्कलोड आकारों की। समय के आयाम में, आपको विशेषताओं का खेल खेलना होगा
00:05:04कि आप अंतर्निहित बुनियादी ढांचे (अंडरलाइंग इंफ्रास्ट्रक्चर) का अधिकतम उपयोग करने के लिए इसे कैसे फिट कर सकते हैं।
00:05:12मैं एक उच्च-स्तरीय विवरण दूंगा कि हमारा स्टैक अभी कैसा आकार लेता है। और मैं आपको यहाँ
00:05:19अनुरोध प्रवाह (request flow) के बारे में थोड़ा बताऊंगा। तो सर्वरलेस और डेडीकेटेड दोनों के लिए, यदि आप स्क्रीन के दाहिने हाथ की तरफ देखें,
00:05:24तो आप देखेंगे कि प्लेटफॉर्म की तरफ, आपके पास प्राधिकरण (authorizations), आपके रेट लिमिटिंग और आपके
00:05:31उपयोग को ट्रैक किए जाने आदि के लिए कंट्रोल प्लेन होगा। ताकि तदनुसार आपका बिल बनाया जा सके।
00:05:37और अवलोकनीयता (observability) ताकि हम यह सुनिश्चित कर सकें कि हम हस्ताक्षर किए गए एसएलए (SLAs) का उल्लंघन नहीं कर रहे हैं, है ना?
00:05:45प्लेटफॉर्म के अंतर्गत, मैंने बहुत उच्च स्तर पर दिखाया है कि हमारे पास ये अलग-अलग
00:05:52इन्फेरेंस इंजन हैं, VLLM, SGLang, और TensorRT-LLM, लेकिन यहाँ काफी विस्तार है जिसे मैं छूने जा रहा हूँ।
00:06:00और उसके अंतर्गत, जो मैं यहाँ हरे रंग में दिखाने की कोशिश कर रहा हूँ, वह हार्डवेयर के विभिन्न हिस्से हैं।
00:06:09तो ऐसा नहीं है कि, इसलिए प्लेटफॉर्म को साझा करने में सक्षम होना चाहिए, वर्कलोड को
00:06:15इन जीपीयू (GPUs) की विभिन्न पीढ़ियों में वितरित करने में सक्षम होना चाहिए, विशेष रूप से एनवीडिया जीपीयू
00:06:21जिन्हें हम उपयोग करते हैं, है ना? तो आइए यहाँ कुछ उदाहरण लेते हैं। मान लीजिए कि अनुरोध
00:06:31क्लाइंट साइड से ऐप्स या नोटबुक्स के माध्यम से, उनमें से किसी से भी, या एजेंटों के माध्यम से उत्पन्न होता है, है ना? यह गेटवे पर हिट करता है।
00:06:36एक बार जब यह गेटवे पर हिट करता है, तो, जैसा कि मैंने कंट्रोल प्लेन पर उल्लेख किया था, प्रमाणीकरण (authentication) से गुजरता है,
00:06:42इत्यादि, इत्यादि, इत्यादि, लेकिन फिर या तो सर्वरलेस या डेडीकेटेड आता है। तो सर्वरलेस के मामले में,
00:06:48यह प्रति टोकन भुगतान होगा, इसलिए टोकन उपयोग की यहाँ निगरानी की जाएगी, सटीक टोकन की नहीं,
00:06:53बल्कि केवल टोकन उपयोग की, क्योंकि हम ZDR (ज़ीरो डेटा रिटेनशन) नीतियों को बनाए रखते हैं।
00:06:59यह, मल्टी-टेनेंसी या प्रोविज़निंग के आधार पर, यदि यह प्रोविज़ंड है, तो हम जानते हैं
00:07:05कि राउटर के लिए, इसे अंदर जाना होगा और प्रोविज़ंड थ्रूपुट ग्राहकों के लिए स्पष्ट डिप्लॉयमेंट को लक्षित करना होगा।
00:07:12मल्टी-टेनेंट ग्राहकों के लिए, अलग डिप्लॉयमेंट हैं।
00:07:17यहाँ राउटर, विशेष रूप से, राउटर बहुत महत्वपूर्ण है, क्योंकि राउटर इस बात के लिए ज़िम्मेदार है कि
00:07:26kvcache-अवेयर रूटिंग विकल्प चुने जाएं। यह क्यों महत्वपूर्ण है? क्योंकि, जैसा कि मैंने वर्कलोड प्रोफाइल पर चर्चा करते समय उल्लेख किया था,
00:07:31एजेंटिक उपयोग के मामले आमतौर पर इनपुट अनुक्रम की लंबाई पर बहुत भारी होते हैं, और इनपुट अनुक्रम लंबाई का अधिकांश हिस्सा,
00:07:39लगभग 80 से 90 प्रतिशत, इस बात पर निर्भर करता है कि कौन सी कंपनी है,
00:07:44ग्राहकों पर निर्भर करता है, इसका 80 से 90 प्रतिशत विभिन्न अनुरोधों के लिए समान होता है।
00:07:51तो प्री-फिल (pre-fill) की फिर से गणना करने या उसके लिए प्री-फिल को दोबारा करने का कोई मतलब नहीं है।
00:07:57प्री-फिल बहुत अधिक कंप्यूट-बाउंड है, बहुत महंगा है, यही कारण है कि आप जितना अधिक कैश को हिट कर सकते हैं,
00:08:04उतना अधिक आप बचा सकते हैं, यही कारण है कि यदि आप कहीं भी टोकन मूल्य निर्धारण को देखते हैं, तो इनपुट टोकन के लिए एक विशिष्ट मूल्य होता है
00:08:11और कैश इनपुट टोकन के लिए बहुत सस्ता मूल्य होता है। इसलिए यहाँ कैशिंग वास्तव में महत्वपूर्ण हो जाती है।
00:08:18हार्डवेयर को विभाजित करने का तरीका पूरी तरह से प्लेटफॉर्म में विकल्प पर निर्भर करता है
00:08:26और हम दोनों को करने की क्षमता प्रदान करते हैं। या तो प्री-फिल डिकोड डिऐग्रीगेशन करें यदि उपयोग का मामला इसकी इच्छा रखता है
00:08:31या ऐसा न करें क्योंकि प्री-फिल डिकोड डिऐग्रीगेशन हर प्रकार के उपयोग के मामले के लिए सस्ता नहीं है।
00:08:41आइए यहाँ एक और अनुरोध प्रवाह लेते हैं। आइए देखें कि यदि यह एक डेडीकेटेड ग्राहक था, तो क्या होगा।
00:08:48एक डेडीकेटेड ग्राहक फिर से उन गेटवे से गुजरेगा जिन्हें उचित आइसोलेशन के साथ उनके लिए स्थापित किया गया है।
00:08:55बिलिंग टोकन पर आधारित नहीं है, बिलिंग प्रति जीपीयू प्रति घंटे के उपयोग पर आधारित है।
00:09:03यह एक निजी गेटवे है ताकि कोई नॉइजी नेबर समस्या न हो, कोई और अंदर न आ सके।
00:09:09यहाँ वही राउटर तर्क है ताकि यदि ऐसे अनुरोध हैं जो बहुत समान हैं, तो यह कैश को सबसे अधिक हिट करे।
00:09:18और उस डिप्लॉयमेंट के आधार पर जो ग्राहक अपने डेडीकेटेड जीपीयू पर वहां करता है,
00:09:24वे तय कर सकते हैं कि वे प्री-फिल डिकोड डिऐग्रीगेशन करना चाहते हैं या नहीं। वे तय कर सकते हैं कि कौन सा
00:09:29इंजन उपयोग करना है, VLLM या SG-Lang या TensorRT-LLM। और क्षमता के उस बड़े हिस्से को देखते हुए जो ग्राहक ने
00:09:35आरक्षित किया है, वे तय कर सकते हैं कि क्या वे पूरे क्लस्टर के माध्यम से स्केल करने की क्षमता के साथ सिर्फ एक डिप्लॉयमेंट रखना चाहते हैं
00:09:42या वे कई अलग-अलग मॉडल, कई अलग-अलग डिप्लॉयमेंट रखना चाहते हैं।
00:09:47एक बात जिसका मैं यहाँ राउटर के बारे में उल्लेख करना चाहता हूँ, वह यह तथ्य है कि
00:09:54विभिन्न ज़ोन और क्षेत्रों में हेटेरोज़ीनस क्षमता
00:09:59समर्थित है। यह थोड़ा, इसके पार लोड को संतुलित करना काफी कठिन समस्या है।
00:10:04तो प्राथमिकता क्रम जो हम आम तौर पर लेते हैं वह पहले KV कैश लोकेलिटी है और उसके बाद सबसे कम लोड वाला फ़ॉलबैक है।
00:10:16बस इतना ही। एक और अनुरोध प्रवाह जिसे मैं यहाँ देखना चाहता हूँ जो
00:10:21आरेख (डायग्राम) से देखना थोड़ा कठिन हो सकता है, वह है बैच वर्कलोड लेना।
00:10:25बैच वर्कलोड के लिए हम वास्तव में क्या करेंगे, वह यह है कि ग्राहक के पास जो अंतर्निहित क्षमता है,
00:10:31मान लीजिए कि वही डेडीकेटेड इन्फेरेंस ग्राहक, अमेरिकी दिन के समय अपने वास्तविक समय के वर्कलोड
00:10:37चला रहे हैं और शाम से रात तक वे बैच वर्कलोड चलाना चाहते हैं, समय के बाद उसी क्षमता को
00:10:43बैच वर्कलोड चलाने के लिए शेड्यूल किया जा सकता है। इसलिए हम यह बताने के लिए API में क्षमता प्रदान करते हैं कि कब स्केल अप करना है
00:10:51और कब स्केल डाउन करना है और शेड्यूल के अनुसार, यदि हम कर सकते हैं, यदि वे हमें बताते हैं कि हमें स्केल डाउन करना पड़ सकता है,
00:10:56तो हम स्केल डाउन करेंगे और रात भर में बैच प्रोसेसिंग के लिए इसे खोल देंगे।
00:11:05मुझे लगता है कि मैंने KV कैश पक्ष पर अनुकूलन (optimizations) के बारे में काफी बात की है लेकिन मैं थोड़ा सा दोहराना चाहता हूँ
00:11:10क्योंकि यह सबसे दिलचस्प हिस्सों में से एक है। यदि हम कैश को अधिक बार हिट कर सकते हैं तो आप,
00:11:19तो आप प्री-फिल की लागत से बच जाएंगे जो यहाँ सबसे महंगा हिस्सा है।
00:11:26अपने एजेंटिक वर्कलोड में कई अलग-अलग टर्न्स में KV कैश का पुनरु उपयोग करना, टर्न्स के बीच भी वहाँ
00:11:31इनपुट अनुक्रम लंबाई में बहुत सारा समान प्री-फिल आता है।
00:11:38चैट वर्कलोड के बारे में सोचें जहाँ KV कैश को ऑफलोड करना भी बेहद महत्वपूर्ण हो जाता है
00:11:43क्योंकि चैट वर्कलोड के साथ हमारे पास अलग-अलग, कई टर्न्स के बीच काफी विलंबता होती है
00:11:49जिसे हम उपयोगकर्ता के रूप में डालते हैं। लेकिन अगर हम अपनी विशेष बातचीत में जो कुछ भी था उसे पूरी तरह से हटा देते हैं,
00:11:57तो अगली बार जब हम उसी चैट में कोई सवाल पूछेंगे तो इसमें थोड़ा अधिक समय लगेगा।
00:12:02इसलिए पूरी तरह से हटाने और प्री-फिल को फिर से करने के बजाय, जो तकनीकें
00:12:08इस्तेमाल की जा रही हैं, शायद हम अपनी खुद की इस्तेमाल कर रहे हैं लेकिन बाहरी रूप से हम LM कैश और मूनकेक्स के बारे में जानते हैं।
00:12:17हम क्या करते हैं कि हम KV कैश को उच्च बैंडविड्थ स्टोरेज में ऑफलोड कर देंगे
00:12:21ताकि हम इनमें से कई प्री-फिल्स को स्टोर कर सकें ताकि जब भी संबंधित अनुरोध आए
00:12:28उस विशेष बातचीत के लिए, इसे सीधे HPM में लोड किया जा सके।
00:12:37प्रदर्शन लीवर पर, मैं, मैं केवल कुछ प्रदर्शन लीवर का उल्लेख करना चाहता हूँ जिन पर हमने
00:12:41चर्चा की है PD DSAG जो कि एक है लेकिन क्वांटाइजेशन और स्पेक्युलेटिव डिकोडिंग अन्य हैं और कैसे
00:12:48समानांतरता की डिग्री और रणनीतियों को सावधानीपूर्वक चुनना है जो वास्तव में बहुत महत्वपूर्ण है।
00:12:54दो सबसे बड़े लीवर जिनके साथ हम काम कर रहे हैं वे हैं NVFE4 और स्पेक डेक पर क्वांटाइजेशन।
00:13:01हम यह क्षमता प्रदान करते हैं कि यदि ग्राहक के पास उनका डेटासेट है और वे चाहते हैं कि हम उनके डेटासेट के लिए
00:13:07बेहतर स्वीकृति लंबाई के लिए अनुमान लगाने वालों को प्रशिक्षित करें, जिससे अंततः आउटपुट थ्रूपुट
00:13:12काफी अधिक हो जाएगा। हमारे पास वह भी है। तो, लेकिन वह एसिंक होता है। हम, हम डेटा एसिंक प्राप्त करते हैं,
00:13:20हम अनुमान लगाने वालों को एसिंक प्रशिक्षित करते हैं और फिर हम अनुमान लगाने वालों को ग्राहक की तैनाती में तैनात करते हैं
00:13:26यदि वे यही चाहते थे। आप यहाँ तीन स्क्रीनशॉट देखते हैं। मैंने उन्हें पिछले
00:13:32एक महीने के काम से पोस्ट किया है जो मेरी टीम के कुछ लोगों ने किया है। आप देख सकते हैं कि हम
00:13:39Kimi 2.6, 2.7 पर लीडरबोर्ड के शीर्ष पर जल्दी से आ गए और वे, वे कृत्रिम विश्लेषण से हैं
00:13:46और इसके पहले वाले सत्र में वापस जाते हुए, क्या हम उस पर भरोसा कर सकते हैं? इसीलिए GLM के लिए, मेरे पास
00:13:52ओपन राउटर्स के परिणाम हैं। इसलिए कृत्रिम विश्लेषण, जब वे बेंचमार्क चलाते हैं, तो वे बहुत विशिष्ट वर्कलोड चला रहे हैं।
00:13:58ओपन राउटर वास्तविक उपयोगकर्ता ट्रैफ़िक है और आप ओपन राउटर पक्ष पर देख सकते हैं, वेट्स एंड बायसेस। तो
00:14:05ब्रांडिंग अलग है, लेकिन वेट्स एंड बायसेस मूल रूप से कर्वी हैं। हमने वेट्स एंड बायसेस खरीदा
00:14:09लगभग एक साल पहले। आप यहाँ गति देख सकते हैं कि हमारी तैनाती से जो हमारे पास है वह काफी करीब है
00:14:16जो फ़ायरवर्क्स फ़ायरवर्क्स फ़ास्ट के रूप में प्रदान कर रहा है, है ना? लेकिन अंतनिहित तकनीकें जिनका हम उपयोग कर रहे हैं
00:14:21वही हैं जिन पर मैं प्रदर्शन अनुकूलन के लिए यहाँ सबसे अधिक जोर देना चाहता हूँ। वह महत्वपूर्ण हो जाता है क्योंकि
00:14:27अंततः आप ग्राहक को क्या सेवा देना चाहते हैं, हम ग्राहक को मूल्य प्रदर्शन लाभ सेवा देना चाहते हैं।
00:14:36त्वरित पुनरावृत्ति, एकल मंच वह है जिस पर मैं जोर देने की कोशिश कर रहा हूँ जो मैं दिखाने की कोशिश कर रहा हूँ।
00:14:44ग्राहकों के लिए दो अलग-अलग उपभोग मॉडल, सर्वरलेस और समर्पित और सर्वरलेस के भीतर,
00:14:49मैंने दो अलग-अलग उपभोग मॉडल का भी वर्णन किया, जैसे-जैसे आप आगे बढ़ते हैं भुगतान करें और प्रावधानित थ्रूपुट यदि आप उसकी परवाह करते हैं
00:14:53और अंततः स्टैक में प्रदर्शन अनुकूलन के माध्यम से लाभ को संयोजित करना।
00:15:01बस इतना ही। धन्यवाद, दोस्तों।

핵심 요약

कॉरवी का इन्फेरेंस प्लेटफॉर्म सर्वरलेस और डेडीकेटेड उपभोग मॉडल, केवी कैश अनुकूलन और उन्नत प्रदर्शन लीवर के माध्यम से छोटे मॉडल से लेकर ट्रिलियन-पैरामीटर वर्कलोड तक को संभालता है।

하이라이트

  • कॉरवी इन्फेरेंस प्लेटफॉर्म सर्वरलेस और डेडीकेटेड दोनों उपभोग मॉडल प्रदान करता है ताकि विभिन्न वर्कलोड जरूरतों को पूरा किया जा सके।

  • प्रोविज्ड थ्रूपुट विकल्प सर्वरलेस उपयोगकर्ताओं को 'नॉइजी नेबर' समस्याओं से बचाता है और एसएलए को बनाए रखता है।

  • एजेंटिक और चैट वर्कलोड इनपुट अनुक्रम की लंबाई पर भारी होते हैं, जबकि वास्तविक समय की आवाज और वीडियो लेटेंसी के प्रति अत्यधिक संवेदनशील होते हैं।

  • केवी कैश प्रबंधन और कैश-अवेयर रूटिंग प्री-फिल की उच्च लागत को बचाते हैं और सिस्टम के प्रदर्शन को बढ़ाते हैं।

  • मात्रा निर्धारण (क्वांटाइजेशन) और स्पेक्युलेटिव डिकोडिंग जैसे प्रदर्शन लीवर आउटपुट थ्रूपुट को काफी बढ़ाते हैं।

타임라인

उपभोग मॉडल और वर्कलोड प्रकार

  • प्लेटफॉर्म सर्वरलेस और डेडीकेटेड दो मुख्य उपभोग मॉडल प्रदान करता है।
  • सर्वरलेस मॉडल में हार्डवेयर प्रबंधन की चिंता किए बिना प्रति टोकन भुगतान किया जाता है।
  • एजेंटिक, चैट, वॉयस, वीडियो और बैच वर्कलोड की अपनी अलग-अलग लेटेंसी और थ्रूपुट आवश्यकताएं होती हैं।

उपभोग मॉडल ग्राहकों को हार्डवेयर प्रबंधन से मुक्ति दिलाते हैं। सर्वरलेस पक्ष पर प्रोविज्ड थ्रूपुट उपयोगकर्ताओं को समर्पित क्षमता प्रदान करता है। अलग-अलग वर्कलोड शेप्स के लिए प्लेटफॉर्म में विशेष डिजाइन विकल्पों की आवश्यकता होती है।

अनुरोध प्रवाह और केवी कैश अनुकूलन

  • राउटर केवी-कैश-अवेयर रूटिंग विकल्प चुनकर कैश को सबसे अधिक हिट करने का प्रयास करता है।
  • एजेंटिक और चैट वर्कलोड में केवी कैश का पुनरु उपयोग प्री-फिल की भारी लागत से बचाता है।
  • केवी कैश को उच्च बैंडविड्थ स्टोरेज में ऑफलोड किया जाता है ताकि संबंधित अनुरोध आने पर इसे सीधे लोड किया जा सके।

प्री-फिल गणना कंप्यूट-बाउंड और महंगी होती है। कैशिंग का उपयोग करके इनपुट टोकन लागत को काफी कम किया जाता है। विभिन्न अनुरोधों के बीच समान प्री-फिल को सहेजने के लिए आधुनिक तकनीकों का उपयोग किया जाता है।

प्रदर्शन लीवर और परिणाम

  • क्वांटाइजेशन और स्पेक्युलेटिव डिकोडिंग प्रदर्शन में सुधार करने वाले दो सबसे बड़े लीवर हैं।
  • ओपन राउटर और कृत्रिम विश्लेषण के परिणाम प्लेटफॉर्म की उच्च गति और शीर्ष प्रदर्शन को दर्शाते हैं।
  • प्लेटफॉर्म ग्राहकों को मूल्य-प्रदर्शन लाभ और त्वरित पुनरावृत्ति प्रदान करता है।

विभिन्न प्रदर्शन लीवर और अनुकूलन रणनीतियाँ मिलकर उच्च थ्रूपुट सुनिश्चित करती हैं। टीम के निरंतर कार्य से यह प्लेटफॉर्म लीडरबोर्ड के शीर्ष पर पहुंच गया है, जो उद्योग मानकों के बराबर प्रदर्शन प्रदान करता है।

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기