एजेंटों के लिए फ्रंटियर एआई इन्फेरेंस क्लाउड — ब्युंग-गोन (गोन) चुन, फ्रेंडलीएआई
AAI Engineer
Computing/SoftwareSmall Business/StartupsInternet Technology
Transcript
00:00:00चलिए शुरू करते हैं। नमस्ते सभी को। आने के लिए धन्यवाद। यह दिन का आखिरी पहर है, इसलिए मैं वाकई बहुत आभारी हूँ।
00:00:25मैं गॉन हूँ, Friendly AI का संस्थापक और सीईओ। आज मैं एजेंटिक इन्फेरेंस के बारे में बात करना चाहता हूँ। तो पहले मैं बताऊँगा कि क्या बदला है, यह क्यों महत्वपूर्ण है, और हम एजेंटों के लिए इन्फेरेंस क्लाउड को कैसे फिर से बना रहे हैं।
00:00:40आगे बढ़ने से पहले, मैं संक्षेप में Friendly AI का परिचय दे दूँ। Friendly AI एजेंटों के लिए फ्रंटियर AI इन्फेरेंस क्लाउड है।
00:00:50बड़े पैमाने पर, तेज, सस्ता और अधिक भरोसेमंद। हम सियोल नेशनल यूनिवर्सिटी की एक रिसर्च टीम से बने हैं, और वे रिसर्च रूट्स आज भी हमारी पहचान हैं।
00:01:02हम वह टीम हैं जिसने कंटीन्यूअस बैचिंग का आविष्कार किया, जो अब पूरे उद्योग में मानक बन चुकी इन्फेरेंस ऑप्टिमाइज़ेशन तकनीक है, और हमारे ORCA काम ने एक व्यापक रूप से उपयोग किए जाने वाले ओपन सोर्स फ्रेमवर्क vLLM को प्रेरित किया।
00:01:15आज हम वैश्विक स्तर पर काम करते हैं, जिसका मुख्यालय सैन फ्रांसिस्को में है और फ्रंटियर इन्फेरेंस को बढ़ाने के लिए सियोल में एक टीम है।
00:01:24जैसा कि आप जानते हैं, 2026 वह वर्ष है जब एजेंट बड़े पैमाने पर प्रोडक्शन में उतर रहे हैं, और यह दो प्रवृत्तियों के एक साथ आने से प्रेरित है।
00:01:33पहला, एजेंट तेजी से बढ़ रहे हैं। AI एजेंट सॉफ़्टवेयर, ऑपरेशंस और नॉलेज वर्क में विस्फोटक अपनाया जाना बढ़ा रहे हैं।
00:01:45दूसरा, ओपन-वेट मॉडल फ्रंटियर तक पहुँच चुके हैं और एजेंटों को किफायती बनाते हैं। वे अब क्षमता में बंद फ्रंटियर मॉडलों को टक्कर देते हैं, जिसका मतलब है कि आप बहुत कम टोकन लागत पर ओपन मॉडल पर फ्रंटियर-क्वालिटी एजेंट चला सकते हैं।
00:02:00मैं यह स्पष्ट कर दूँ कि ओपन-वेट मॉडल अब इस तरह के वास्तविक एजेंट वर्कफ़्लो के लिए पर्याप्त रूप से मजबूत हैं।
00:02:13यहाँ हमने दो मॉडलों को कोडिंग एजेंट के साथ टॉवर डिफेंस गेम बनाने का बिल्कुल समान काम दिया।
00:02:19बाईं ओर GLM 5.2 है, जो Friendly AI पर चलने वाला एक ओपन-वेट मॉडल है। दाईं ओर Anthropic का Opus 4.8 है।
00:02:29महत्वपूर्ण बात यह नहीं है कि आउटपुट बिल्कुल एक जैसे हैं। बात यह है कि दोनों इस काम को ऐसे स्तर पर पूरा करते हैं जो स्पष्ट रूप से उपयोगी है।
00:02:38कई एजेंट वर्कफ़्लो के लिए, ओपन-वेट मॉडल गुणवत्ता की सीमा को पार कर चुके हैं, लेकिन अर्थशास्त्र बहुत अलग है।
00:02:49वही काम के लिए, Opus 4.8 की लागत लगभग 1.50 डॉलर है। Friendly AI पर GLM 5.2 की लागत 0.27 डॉलर है, जो 5.6 गुना सस्ता है।
00:03:03तो यह वही वादा है जिसका मैंने पहले उल्लेख किया था। ओपन-वेट मॉडल आपको लागत के एक अंश पर फ्रंटियर-क्वालिटी एजेंट देते हैं।
00:03:12लेकिन मॉडल की लागत कहानी का सिर्फ एक हिस्सा है। एजेंटों को वास्तव में तेज़ और भरोसेमंद बनाने के लिए, इन्फेरेंस स्टैक को खुद बदलना होगा।
00:03:22तो आइए देखें कि एजेंटिक वर्कफ़्लो के भीतर वास्तव में क्या होता है।
00:03:28तो सबसे पहले, वर्कफ़्लो में बदलावों को देखते हैं। अतीत में, मुख्य उपयोग चैट था।
00:03:34बुनियादी इकाई एक अनुरोध थी। एक व्यक्ति सवाल पूछता है, मॉडल जवाब देता है, और व्यक्ति उसे पढ़ता है।
00:03:41विलंबता का मतलब था कि मुझे एक प्रतिक्रिया कितनी जल्दी मिली? एजेंट अलग हैं। बुनियादी इकाई एक कार्य है।
00:03:49एक कार्य में कई मॉडल कॉल, कई टूल कॉल शामिल हो सकते हैं, और यह थोड़ी देर के लिए स्वायत्त रूप से चल सकता है।
00:03:58इसलिए उपयोगकर्ता को वास्तव में किसी एक व्यक्तिगत अनुरोध की विलंबता की परवाह नहीं होती है।
00:04:04उपयोगकर्ता को इसकी परवाह है कि पूरा कार्य कब पूरा होता है।
00:04:08इसका मतलब है कि हमें केवल व्यक्तिगत अनुरोधों के लिए नहीं, बल्कि कार्यों के लिए अनुकूलित करना होगा।
00:04:16आइए एजेंटिक वर्कफ़्लो को अधिक बारीकी से देखें। एक एजेंट वास्तव में कार्यों से बना एक सत्र चलाता है।
00:04:23प्रत्येक कार्य आमतौर पर एक लूप में चलता है। पहले, यह योजना बनाता है, जिसका आमतौर पर मतलब LLM कॉल होता है।
00:04:29फिर यह किसी टूल को कॉल करके काम करता है। फिर यह परिणाम का निरीक्षण करता है और उसे वापस संदर्भ में जोड़ता है।
00:04:38और यह तब तक दोहराता है जब तक काम पूरा नहीं हो जाता।
00:04:41इसलिए हम लगातार LLM इन्फेरेंस और एक या अधिक गैर-LLM टूल निष्पादन के बीच बदलाव कर रहे हैं।
00:04:50इसलिए LLM कॉलों के बीच एक अंतराल होता है। एक एजेंट सब-एजेंट भी बना सकता है और उन्हें समानांतर में चला सकता है।
00:05:01एजेंट इनपुट भी चैट से बहुत अलग दिखते हैं। यहाँ दिया गया ग्राफ़ GLM 5.2 के साथ हमारे आंतरिक कोडिंग एजेंट रन की संकेत और पूर्णता लंबाई वितरण को दिखाता है, जिसका हम दिन-प्रतिदिन उपयोग करते हैं।
00:05:15वे बहुत लंबे हैं। जैसे-जैसे कार्य आगे बढ़ता है वे बढ़ते जाते हैं क्योंकि प्रत्येक अवलोकन वापस संदर्भ में जोड़ा जाता है।
00:05:25यहाँ एक महत्वपूर्ण पैटर्न है। लगातार एजेंट चरणों में आमतौर पर एक बड़ा उपसर्ग साझा होता है।
00:05:32यदि हम हर बार उसी उपसर्ग की फिर से गणना करते हैं, तो हम पहले से किए गए काम पर बहुत अधिक कंप्यूट जला रहे हैं।
00:05:40तो यह एजेंटिक इन्फेरेंस में सबसे बड़े अवसरों में से एक है।
00:05:46तो एजेंट कितने टोकन-भूखे हैं?
00:05:49अब गहरी रिसर्च जैसे लंबी क्षितिज वाले कार्य के उदाहरण को देखते हैं।
00:05:53हमने Friendly AI पर GLM 5.2 के साथ कोड कोड का उपयोग करके vLLM में स्पेकुलेटिव डिकोडिंग फ्रेमवर्क की व्याख्या की।
00:06:02कई चरण हैं और प्रत्येक चरण उप-एजेंटों से बना है जो कई इन्फेरेंस और टूल कॉल चलाते हैं।
00:06:12तो यह दसियों या सैकड़ों इन्फेरेंस चरण चला सकता है, कभी-कभी मिनटों या घंटों तक।
00:06:19और साझा संदर्भ पूरे समय बढ़ता रहता है।
00:06:23उपयोगकर्ता के लिए, जो मायने रखता है वह एकल टोकन या एक कोर की विलंबता नहीं है।
00:06:28जो मायने रखता है वह यह है कि मेरा काम कब पूरा होता है।
00:06:35तो एजेंटिक इन्फेरेंस सिर्फ अधिक अनुरोधों वाली चैट नहीं है।
00:06:39यह एक अलग समस्या है। समय के साथ संदर्भ बढ़ता जाता है।
00:06:43मॉडल कॉलों के बीच टूल का काम अंतःस्थापित होता है।
00:06:46मॉडल कॉलों की संख्या इनपुट पर निर्भर करती है।
00:06:49इसलिए आप वास्तव में एक निश्चित अनुरोध दर योजना के आसपास योजना नहीं बना सकते हैं।
00:06:55और वास्तविक मीट्रिक एंड-टू-एंड कार्य विलंबता है, न कि एकल अनुरोध विलंबता।
00:07:02तो हम ऐसा कैसे करते हैं? आइए मैं आपको इसके पीछे की मुख्य इंजीनियरिंग दिखाता हूँ।
00:07:23यहाँ इसके बारे में सोचने के तरीके के लिए इंजीनियरिंग मानचित्र है।
00:07:27हमने एजेंट-समान बंद के आसपास परत-दर-परत स्टैक का निर्माण किया।
00:07:33चार बड़े स्तंभ हैं जिन्हें मैं आज कवर करने जा रहा हूँ।
00:07:37उपसर्ग कैशिंग, कुंजी मूल्य, संक्षेप में केवी, कैश प्रबंधन, कैश-सचेत रूटिंग, एजेंट-सचेत अनुकूलन।
00:07:48और, निश्चित रूप से, इसके नीचे, हमें लंबे संपर्कों के लिए विरल ध्यान जैसे मॉडल परत अनुकूलन की आवश्यकता है,
00:07:56त्रुटियों को कम करने की तकनीकें, तेज़ कोनों, लचीली सेवा, और बहुत कुछ।
00:08:02इस काम में, मैं चार स्तंभों पर ध्यान केंद्रित करने जा रहा हूँ।
00:08:05उपसर्ग कैशिंग से शुरू करते हैं।
00:08:09चूंकि एजेंट चरण एक बड़े उपसर्ग को साझा करते हैं, इसलिए हम उपसर्ग के लिए एक बार कुंजी मान की गणना करते हैं और इसे कैश करते हैं।
00:08:17फिर बाद के चरणों में, हम कैश कुंजी मान का पुन: उपयोग करते हैं और केवल नए प्रत्यय को संसाधित करते हैं।
00:08:23कैश से पढ़ना प्रीफिल की गणना करने की तुलना में बहुत सस्ता है,
00:08:27इसलिए यह पहले टोकन के समय में सुधार करता है और हर चरण में कंप्यूट को कम करता है।
00:08:33और एजेंटों में कार्य जितनी देर तक चलता है, यह उतना ही अधिक मूल्यवान हो जाता है।
00:08:41लेकिन कैशिंग तभी काम करती है जब केवी कैश वास्तव में फिट बैठता है और कुशलता से इधर-उधर जा सकता है।
00:08:48इसलिए हमें मजबूत केवी कैश प्रबंधन की आवश्यकता है।
00:08:52हम प्रत्येक GPU मेमोरी पर अधिक सक्रिय संपर्कों को पैक करने के लिए Google मेमोरी प्रबंधन का उपयोग करते हैं।
00:08:59मेमोरी पदचिह्न को कम करने के लिए हम केवी मात्रा का उपयोग करते हैं।
00:09:04हम GPU मेमोरी, होस्ट मेमोरी और डिस्क में पदानुक्रमित कैशिंग का उपयोग करते हैं, ताकि हम GPU सीमाओं से परे जा सकें।
00:09:13और हम विवादित कैशिंग का भी उपयोग करते हैं ताकि एक उपसर्ग को केवल एक उदाहरण के अंदर ही नहीं, बल्कि प्रतिकृतियों में परोसा जा सके।
00:09:26वैश्विक क्लस्टर पैमाने पर, रूटिंग वास्तव में महत्वपूर्ण हो जाती है।
00:09:29एक सीधा लोड बैलेंसर GPU क्लस्टर में अनुरोधों को समान रूप से फैला सकता है, लेकिन यह कैश स्थानीयता को नष्ट कर सकता है।
00:09:38वैश्विक स्तर पर कैश-जागरूक राउटर कुछ होशियार काम करता है।
00:09:42यह एक ऐसे पॉड को अनुरोध भेजता है जिसमें पहले से ही सही उपसर्ग कैश किया गया है, कोर प्रीफिल को एक कैश शिप में बदल देता है।
00:09:51साथ ही, इसे अभी भी लोड को संतुलित करना है, ताकि एक पॉड हॉटस्पॉट न बन जाए।
00:09:58इस उदाहरण में, कार्य A के दो अनुरोध कैश स्थानीयता के लिए एक ही पॉड एक पर जाते हैं।
00:10:08अगला टुकड़ा एजेंट-जागरूक अनुकूलन है।
00:10:11और यह एजेंट इन्फेरेंस की अगली सीमा है।
00:10:16आज, अधिकांश सिस्टम प्रत्येक LLM कोर को ऐसे शेड्यूल करते हैं जैसे कि यह स्वतंत्र हो।
00:10:21वे वास्तव में यह नहीं समझते हैं कि यह कोर लंबे एजेंट प्रोग्राम का हिस्सा है।
00:10:27लेकिन अगर अनुकूलक एजेंट-स्तर के संदर्भ को जानता है, तो यह बेहतर निर्णय ले सकता है।
00:10:33उदाहरण के लिए, सही काम को पहले से रोकना, संभावित अगले चरण के लिए संदर्भ को अनुमानित रूप से भरना, या एजेंट-स्तर के संदर्भ के आधार पर बेहतर कैश निष्कासन निर्णय लेना।
00:10:48तो लक्ष्य एंड-टू-एंड टेस्ट विलंबता को कम करना है, न कि केवल एक कॉल को तेज़ दिखाना।
00:10:58जब हम इन सभी को एक साथ रखते हैं, तो यह इसका परिणाम है।
00:11:01हम एक साधारण मोबाइल गेम बनाने के लिए किलिकोड के साथ उसी मॉडल, GLM 5.2 का उपयोग कर रहे हैं।
00:11:07हमने Friendly AI और किसी अन्य प्रसिद्ध इन्फेरेंस प्रदाता के मॉडल API के साथ वही काम चलाया।
00:11:14जैसा कि आप देख सकते हैं, हमारे एजेंट-केंद्रित क्लाउड डिज़ाइन के लिए धन्यवाद, Friendly AI उसी काम को एंड-टू-एंड तेज़ी से पूरा करता है।
00:11:24तो यह अभ्यास में क्या अनलॉक करता है?
00:11:29एक मजबूत प्रोडक्शन एजेंट स्टैक।
00:11:32कोई ऐसा एजेंट लें जो आपको पहले से ही पसंद हो।
00:11:35अब, Friendly AI पर परोसे जाने वाले GLM 5.2, Minimax और Kimi जैसे ओपन-वेट फ्रंटियर मॉडल प्लग-इन करें।
00:11:43मॉडल आपको फ्रंटियर गुणवत्ता क्षमता और बेहतर अर्थशास्त्र देता है।
00:11:49Friendly AI आपको प्रोडक्शन में आवश्यक गति, विश्वसनीयता और एंड-टू-एंड परीक्षण प्रदर्शन देता है।
00:11:56वह संयोजन, गुणवत्ता, गति, विश्वसनीयता और लागत वह है जो एजेंटों को उत्पादन में वास्तव में उपयोगी और किफायती बनाती है।
00:12:06Friendly AI वर्तमान में AI-मूल स्टार्टअप से लेकर वैश्विक उद्यमों तक उत्पादन में टीमों को शक्ति प्रदान कर रहा है।
00:12:15मैं यहाँ कुछ पर प्रकाश डालना चाहूँगा।
00:12:20Kilo लाखों उपयोगकर्ताओं की सेवा करने वाला एक बेहद लोकप्रिय एजेंटिक AI कोडिंग टूल है।
00:12:27LG एक वैश्विक उद्यम है जिसका व्यवसाय इलेक्ट्रॉनिक्स से लेकर स्वास्थ्य सेवा और ऊर्जा तक है।
00:12:35बहुत अलग कंपनियाँ, लेकिन उन सभी को एक ही चीज़ की आवश्यकता है।
00:12:39तेज़, विश्वसनीय, लागत प्रभावी एजेंटिक इन्फेरेंस।
00:12:45हमारे ग्राहक Kilo का यह प्रशंसापत्र यह सब कहता है।
00:12:50पिछले एक साल में, Kilo code ने खुले और बंद दोनों मॉडलों की मेजबानी करने वाले कई इन्फेरेंस प्रदाताओं का परीक्षण किया है।
00:12:56अन्य तीसरे पक्ष के प्रदाताओं और Model Lab G.AI के प्रत्यक्ष उपयोग की तुलना में GLM 5 उपयोग के एक विभाजन परीक्षण में,
00:13:05Friendly AI काफी कम त्रुटि दर के साथ लगातार सात गुना तेज था।
00:13:12आज, Friendly AI Kilo स्टैक का एक मुख्य घटक है।
00:13:17और आप इसे अपनी पसंद के अनुसार उपभोग कर सकते हैं।
00:13:23मॉडल API शुरू करने का सबसे तेज़ तरीका है।
00:13:26हमारे सर्वर रहित API के माध्यम से मुख्य फ्रंटियर ओपनवेट मॉडल।
00:13:29समर्पित समापन बिंदु आपको उत्पादन वर्कलोड के लिए गारंटीकृत SLA के साथ अपना स्वयं का पृथक तैनाती देते हैं।
00:13:36और BYOG, अपना खुद का GPU लाएँ, आपको अपने स्वयं के बुनियादी ढाँचे पर मैत्रीपूर्ण अनुमान चलाने देता है।
00:13:44वही स्टैक, तैनात करने के तीन तरीके।
00:13:49निष्कर्ष निकालने के लिए, याद रखने योग्य तीन चीजें हैं।
00:13:53पहला, फ्रंटियर ओपनवेट मॉडल प्रोडक्शन एजेंटों को आर्थिक रूप से स्केलेबल बनाते हैं।
00:13:59दूसरा, एजेंट सिर्फ अधिक कोर वाली चैट नहीं हैं।
00:14:03एजेंटिक इन्फेरेंस के लिए मेरे द्वारा बताई गई चुनौतियों के साथ एंड-टू-एंड टास्क विलंबता को अनुकूलित करने की आवश्यकता होती है।
00:14:10तीसरा, Friendly AI को मृत दुनिया के लिए एक इन्फेरेंस क्लाउड के रूप में बनाया गया है।
00:14:16तेज़, विश्वसनीय, लागत प्रभावी एजेंटिक इन्फेरेंस।
00:14:23मेरे सत्र में भाग लेने के लिए धन्यवाद।
00:14:25यदि आपके बिल्डिंग एजेंट आज Friendly AI पर फ्रंटियर ओपनवेट मोटर्स को आज़माते हैं,
00:14:30आप मिनटों में Friendly AI पर शुरुआत कर सकते हैं।
00:14:34और धन्यवाद।
00:14:35मैं सत्र के बाद आसपास रहूँगा।
00:14:37धन्यवाद।
00:14:38धन्यवाद।
Community Posts
No posts yet. Be the first to write about this video!
Write about this video