스크립트
00:00:00आइए कुछ त्वरित प्रश्न करते हैं और फिर सीधे आगे बढ़ते हैं। हम में से कितने लोगों ने यहाँ
00:00:19वॉइस एआई एजेंट्स बनाए हैं? ठीक है, यहाँ काफी अच्छे दर्शक हैं। और आप में से कितने
00:00:28लोगों ने ऐसे एआई एजेंट्स बनाए हैं जिन्हें प्रोडक्शन में तैनात किया गया है? बुरा नहीं है। ठीक है, बढ़िया। तो हम बात करेंगे
00:00:38कि आमतौर पर क्या होता है, है ना? जैसे हर कोई वॉइस एआई एजेंट्स के बारे में बात कर रहा है। वह, आप जानते हैं,
00:00:47आज की दुनिया में लगभग हर चीज़ का एकमात्र समाधान वॉइस एआई एजेंट्स है। तो हर कोई
00:00:51इसे बना रहा है और तैनात करने की कोशिश कर रहा है। जब आप इसे अपने
00:00:57डव परिवेश में बना रहे होते हैं, तो यह बहुत अच्छा लगता है। और फिर जिस पल आप इसे कॉन्सेप्ट के प्रमाण से प्रोडक्शन में ले जाते हैं,
00:01:03चीज़ें विफल होने लगती हैं। तो हम इन पाँच अलग-अलग पहलुओं पर चर्चा करेंगे कि कैसे, या हमने
00:01:09PLEVO में वॉइस एआई एजेंट्स के साथ क्या देखा है। लेकिन उससे ठीक पहले, मेरी तरफ से एक संक्षिप्त परिचय। मैं वेंकी हूँ,
00:01:19संस्थापक और सीएओ। उसने एजेंट इंजीनियरिंग मैनेजर का पद इस्तेमाल किया। मैं खुद को पद के दृष्टिकोण से
00:01:28चीफ एजेंट ऑफिसर कह रहा हूँ। ठीक है, तो क्या है, क्या है, आप जानते हैं, क्यों, हम इस चर्चा के लिए योग्य क्यों हैं,
00:01:35और जैसे, क्या, हम ऐसा क्या देख रहे हैं जो बहुत सी कंपनियों को देखने को नहीं मिलता है? तो मैं,
00:01:42मैं अपनी यात्रा के बारे में थोड़ी बात करूंगा कि हम अब तक कैसे आगे बढ़े हैं और फिर सीधे आगे
00:01:48बढ़ेंगे। आप जानते हैं, हम लगभग 14 वर्षों से अस्तित्व में हैं। हमारी यात्रा एक डेवलपर एपीआई प्लेटफॉर्म की रही है।
00:01:54और फिर अब एक, आप जानते हैं, एआई एजेंट व्यवसाय। हमने 2011 में वॉइस और एसएमएस एपीआई के साथ शुरुआत की थी।
00:02:01और फिर, आप जानते हैं, अब हम मुख्य रूप से अपने फुल-स्टैक एआई एजेंट ऑफ़रिंग पर ध्यान केंद्रित कर रहे हैं।
00:02:08हमारे प्लेटफ़ॉर्म पर फुल-स्टैक। हम दुनिया भर में हर महीने एक अरब से अधिक वॉइस कॉल देखते हैं।
00:02:16э, और यही वह जगह है जहाँ हमने इनमें से कई, आप जानते हैं, पैटर्न उभरते हुए देखे हैं कि कैसे,
00:02:20जब हम अपने ग्राहकों के साथ काम करते हैं, तो प्रोडक्शन में उनके वॉइस एआई एजेंट्स के साथ क्या होता है।
00:02:25э, हम 90 सदस्यों की एक टीम हैं, э, और हमारे पास बैंक में 50 मिलियन की फंडिंग है। मज़ेदार तथ्य,
00:02:33यह बाहरी वीसी निवेशकों से नहीं है। यह सब एक लाभदायक कंपनी होने के कारण है,
00:02:38इन वर्षों में उस नकदी को बैंक में जमा करने से। э,
00:02:42कुछ ग्राहक जिन्हें हम दुनिया भर में सेवा प्रदान करते हैं। э, आप जानते हैं, हमने वहाँ कुछ लोगो छोड़ दिए हैं,
00:02:49э, लेकिन मुख्य रूप से ऑफ़रिंग के दृष्टिकोण से, э, मैं इसे तीन अलग-अलग श्रेणियों में बाँटूंगा।
00:02:54एक प्रोग्रामेबल, э एआई एजेंट ऑफ़रिंग है। हम इसे कहते हैं, э मेरा मतलब है, यह एक स्पीच
00:03:00पाइपलाइन है, अभी तक कोई सच्चा स्पीच-टू-स्पीच उत्पाद नहीं है, लेकिन यह एक प्रोग्रामेबल ऑफ़रिंग है।
00:03:05हमारे पास एक एआई एजेंट स्टूडियो भी है। यह एक नो-कोड विज़ुअल, э बिल्डर है। और फिर, जैसा कि मैंने कहा,
00:03:11हमने वॉइस एपीआई के साथ शुरुआत की थी। इसलिए हमने पिछले 14 वर्षों में इसे स्पष्ट रूप से तैयार किया है,
00:03:16एसआईपी ट्रंकिंग और ऑडियो स्ट्रीमिंग परत। इसलिए हम टेलीफोनी या कैरियर परत के लिए अन्य लोगों पर निर्भर नहीं हैं।
00:03:22यह वह मुख्य व्यवसाय है जिसे हमने इन सभी वर्षों में बनाया है। और इसी के ऊपर हमारा एआई,
00:03:26э एजेंट प्लेटफॉर्म आधारित है।
00:03:32ठीक है। इसके साथ, э आइए इसमें उतरें, है ना? जो मुझे यकीन है कि चूँकि आप सभी ने
00:03:39एआई एजेंट्स बनाए हैं, आप सभी ने इसे देखा होगा या, आप जानते हैं, इसे किसी न किसी रूप में बनाया होगा। और हम इस पर
00:03:44अधिक समय बिताएंगे कि, э पूरी पाइपलाइन कैसी दिखती है, है ना? э हम ग्राहकों के साथ क्या देखते हैं,
00:03:51और, और मुझे यकीन है कि आप लोग इससे खुद को जोड़ नहीं पा रहे होंगे, वह यह है कि, एआई एजेंट्स के बारे में सोचने वाला कोई भी व्यक्ति,
00:03:56वे क्या करते हैं कि वे इनमें से कई ऑर्केस्ट्रेशन फ्रेमवर्क चुनते हैं, और, э वे बहुत अच्छा काम करते हैं,
00:04:01लाइव किट या पाइप कैट, आप जानते हैं, उसके ऊपर अपना एआई एजेंट बनाते हैं। э उन्हें लगता है कि
00:04:06वे इन चार अलग-अलग परतों को व्यवस्थित कर सकते हैं, स्पीच टू टेक्स्ट, एलएलएम, э और, और टीटीएस
00:04:13बीच में टर्न डिटेक्शन के साथ और हम आगे बढ़ जाते हैं। जैसे मेरा एआई एजेंट एक पीओजी में काम करता है
00:04:19और यह प्रोडक्शन में काम करने के लिए अच्छा है। э आमतौर पर ऐसा ही होता है। वे अपनी
00:04:24विलंबता को मापते हैं और आप इस स्लाइड पर प्रत्येक परत पर कुछ सांकेतिक विलंबता देख सकते हैं। और वे कहते हैं,
00:04:30हाँ, यह, э मुझे जिसकी आवश्यकता है उसके लिए यह अच्छा लगता है। तो आइए, आइए प्रोडक्शन तैनात करें। और फिर
00:04:36प्रोडक्शन, э एक तरह से शुरू होने लगता है, और, और आप सभी प्रकार के विफलता मोड देखते हैं, जिस पर
00:04:41हम इस बातचीत में, कम से कम, अपना अधिकांश समय बिताने जा रहे हैं। э मैंने अंत में कुछ समय
00:04:48प्रश्नोत्तर के लिए रखा है यदि आप लोग, э प्रश्न पूछना चाहते हैं, लेकिन हम सीधे इससे आगे बढ़ेंगे,
00:04:53э हमारे द्वारा देखे जाने वाले विभिन्न विफलता मोड। आइए, э पहले वाले से शुरू करें जिसके बारे में
00:05:01हर कोई बात करता है। जैसे यह सबसे अधिक चर्चा किया जाने वाला विफलता मोड है, जो कि विलंबता है। э मुझे लगता है कि
00:05:07आज हमारे पास कुछ एआई एजेंट वार्ताएँ या वॉइस एआई एजेंट वार्ताएँ हैं। उम, मुझे पूरा यकीन है कि हर कोई,
00:05:12हर कोई इस विशिष्ट विफलता मोड को छूने जा रहा है, यही कारण है कि मैं इसे तुरंत ला रहा हूँ, э
00:05:17э के संदर्भ में, э आप जानते हैं, कुछ पसंद है कि यह पूरा अनुभव, э उपयोगकर्ताओं के लिए कैसा है, है ना? э आमतौर पर
00:05:26अधिकांश लोग इसे पहले ऑडियो के समय से मापते हैं। यानी वह समय जब आपके उपयोगकर्ता बोलना बंद कर देते हैं
00:05:34आपके एजेंट के बोलना शुरू करने तक का समय, है ना? और मुझे लगता है कि आपने, आपने शायद इसे देखा होगा यदि आप लोगों ने
00:05:39वाईजेड एजेंट्स बनाए हैं, पर, आप जानते हैं, क्या, э अच्छा या प्राकृतिक महसूस होता है, क्या, э
00:05:46एक तरह से परेशान करने वाला महसूस होता है या ध्यान देने योग्य महसूस होता है, और फिर परेशान करने वाला क्या महसूस होता है, जो, आप जानते हैं, अलग-अलग स्तर के
00:05:52चरण हैं। э हम देखते हैं, э अधिकांश लोग 550 से कम रहना चाहते हैं क्योंकि प्लेटफॉर्म द्वारा यही विज्ञापित किया जाता है,
00:06:00या, आप जानते हैं, समाधान या, या, या, या परतें, लेकिन मुझे लगता है कि अधिकांश 750
00:06:07से 1.2 के बीच समाप्त होते हैं। э अधिकांश लोग इसी पर समाप्त होते हैं। э वास्तव में खराब प्रदर्शन करने वाले लोग समाप्त होते हैं,
00:06:13आप जानते हैं, 1.2 से अधिक, और फिर आप उपयोगकर्ताओं को, э फोन काटते हुए देखना शुरू करते हैं। э अब मैं, मैं साझा करूंगा
00:06:19आपके साथ कि हमने व्यावहारिक रूप से क्या देखा है, э प्रोडक्शन में, э ग्राहकों के साथ इसका उपयोग करते हुए, э अलग-अलग परतों पर, और फिर, आप जानते हैं,
00:06:26इनमें से कुछ के समाधान। जिस तरह से हम इसके बारे में सोचना चाहते हैं
00:06:33वह इन तीनों के बीच एक तरह का संतुलन है, जो लागत, बुद्धिमत्ता और विलंबता है,
00:06:42है ना? और, और, और मैं इन तीनों को क्यों ला रहा हूँ? क्योंकि वे एक तरह से परस्पर संबंधित हैं। मुझे लगता है
00:06:48कि मैं अभी-अभी जिन चीज़ों के बारे में बात कर रहा था, э आप जानते हैं, बाहर कुछ लोगों के साथ। उनमें से एक चीज़,
00:06:51पिछले एक साल में, हमने बहुत सारे नवाचार देखे हैं, एलएलएम पक्ष में बुद्धिमत्ता की बहुत अधिक वृद्धि देखी है,
00:06:58है ना? और अधिकांश, э आप जानते हैं, बुद्धिमत्ता सोच के मामले में आई है, या, आप जानते हैं,
00:07:05सुदृढीकरण सीखने (reinforcement learning) और, और इसी तरह आगे भी। वॉइस एजेंट्स के साथ विडंबना यह है कि लगभग हमेशा
00:07:11आपका, э एलएलएम या वह एजेंट जो बात कर रहा है, उसकी सोच को बंद करना होगा, है ना? तो सभी
00:07:19प्रगति जो हमने पिछले एक साल में एलएलएम परत में की है, उनमें से कोई भी यहाँ अब लागू नहीं होती है,
00:07:25है ना? आप, जाहिर है आपके पास, आप जानते हैं, बेहतर मॉडल हैं जो, आप जानते हैं, बेहतर निर्देश का पालन
00:07:29या टूल कॉलिंग कर सकते हैं, लेकिन आपकी लगभग सारी बुद्धिमत्ता जो सोच की परत पर अंतर्निहित है,
00:07:34यदि आप इसे पर्याप्त तेज़ बनाना चाहते हैं तो डिफ़ॉल्ट रूप से बंद है। तो, तो यह उन विडंबनाओं में से एक है
00:07:39जिसका हम सामना करते हैं। तो फिर आप बुद्धिमान लागत और विलंबता को कैसे संतुलित करते हैं?
00:07:44आइए, आइए इनमें से कुछ, э आप जानते हैं, विकल्पों को देखें, э जो बाजार में उपलब्ध हैं,
00:07:48है ना? तो, और मैं विशेष रूप से एलएलएम चुन रहा हूँ क्योंकि यदि आपने पिछला चार्ट देखा है, तो एलएलएम है,
00:07:55э आप जानते हैं, आपकी उच्चतम विलंबता बाल्टी है जो इसमें जुड़ जाती है, है ना? और, э यदि आप देखते हैं,
00:08:02आप जानते हैं, फ्रंटियर मॉडल, जो मुझे लगता है कि अधिकांश लोग डिफ़ॉल्ट रूप से शुरू करते हैं, आपके, आपके ओपनएआई, आपके क्लाउड,
00:08:09आपके जेमिनी, э आप जानते हैं, P50, TTFT एक अच्छे दिन पर लगभग 450 से 500 के आसपास है और यह
00:08:17स्पiky हो सकता है, है ना? यह हो सकता है, यह, э आप जानते हैं, P90, P95 आसानी से 1.2, 1.3 सेकंड से ऊपर जा सकता है,
00:08:25э, और, और यह समग्र एजेंट अनुभव के लिए अच्छा नहीं है। तो, तो यह आपका फ्रंटियर
00:08:31मॉडल है। अब, एक और विकल्प है, जो आपका, आपका सेरेब्रिस या ग्रोक, э है जो प्रसिद्ध है और
00:08:38बहुत सारे टोकन उगलने के लिए लोकप्रिय है, या, या बहुत तेजी से टोकन देता है, है ना? э ये काम करते हैं, लेकिन आपके लिए
00:08:45इन पर समर्पित विलंबता या पहले टोकन का समय प्राप्त करने के लिए, आपको समर्पित क्षमता की आवश्यकता होती है और वह वास्तव में महंगा है।
00:08:51यहीं पर मैंने लागत के बारे में बात की थी, э संतुलित करने की चीज़ों में से एक के रूप में, है ना? यह वास्तव में
00:08:56महंगा है। और फिर जैसे आप ग्रोक टीम या सेरेब्रिस टीम के किसी भी व्यक्ति से बात करते हैं, वे आपको बताएंगे,
00:09:01आपको समर्पित क्षमता के लिए 12 महीने पहले बुकिंग करनी होगी। वे अगले 12 महीनों के लिए बुक हैं।
00:09:05तो, तो यह, यह एक काफी महंगा विकल्प है। और फिर आपको वास्तव में यह सुनिश्चित करने की आवश्यकता है कि मॉडल
00:09:11जिसे आप इनमें से कुछ इन्फ्रा परतों पर तैनात कर रहे हैं, э आज से 12 महीने बाद भी यहाँ रहेगा। और, और यह एक,
00:09:17यह एक बड़ा निवेश और एक बड़ा अज्ञात है। तो, तो उत्पादन-ग्रेड के लिए एक यथार्थवादी विकल्प क्या है, э
00:09:27एजेंट जो, जो अच्छी गुणवत्ता के हैं और इनमें से तीन को संतुलित करते हैं? э हमारे लिए यही काम आया है,
00:09:34э जो ओपन सोर्स मॉडल हैं। э जाहिर है कि विविधता के मामले में उनमें से बहुत सारे हैं और, और, और विविधताएं जिन्हें आप चुन सकते हैं,
00:09:41मैं विशेष रूप से उन दो के बारे में बात कर रहा हूँ जिनके साथ हम काम करते हैं,
00:09:47э Quinn 3.5 और Gemma 4। ये, э आप जानते हैं, बाजार में अभी एक तरह के अत्याधुनिक ओपन सोर्स मॉडल हैं, है ना, э
00:09:56और हमने इस बात के बारे में बहुत सारे बेंचमार्किंग किए हैं, э कि वे कैसे काम करते हैं।
00:10:02यह सोचना डरावना हो सकता है कि, ठीक है, मेरे पास मॉडल हैं, अब मुझे उन्हें होस्ट करना होगा, है ना, उन्हें अपने
00:10:10GPU पर चलाना होगा और इसी तरह आगे भी। लेकिन यदि आप लगातार 300 मिलीसेकंड से कम का लक्ष्य रख रहे हैं, э यह,
00:10:17हमने इसे विलंबता, लागत और बुद्धिमत्ता के बीच संतुलन बनाने के लिए एक, э बढ़िया विकल्प के रूप में देखा है।
00:10:23अब, э यहाँ कुछ और गहराई से चर्चा करते हैं। यदि आप केवल अंग्रेजी कर रहे हैं, э Quinn 3.5 या Gemma दोनों ठीक काम करते हैं।
00:10:29लेकिन यदि आप बहुभाषी कर रहे हैं, э है ना, अंतर्राष्ट्रीय दर्शकों, विभिन्न भाषाओं के लिए, э Gemma 4 इसके लिए
00:10:35एक बहुत बेहतर मॉडल है। э हमने देखा है, э टोकन, э फर्टिलिटी मूल्यांकन। मूल रूप से इसका अर्थ यह है,
00:10:44यदि, यदि मैं इसे सरल बनाऊँ, तो यह है कि उस भाषा में एक शब्द उत्पन्न करने में कितने
00:10:48टोकन लगते हैं? ठीक है, तो जेम्मा बहुत, बहुत बेहतर है, उस दृष्टिकोण से Quinn 3.5 से कम से कम 2.5 से 3x बेहतर है।
00:10:56तो शब्दों का आपका समय Gemma 4 पर बहुत तेज़ है, э बाकी सब बराबर है, है ना, э बहुभाषी आधार पर।
00:11:04बहुभाषी आधार पर। अब, आप एलएलएम स्तर पर कौन सा आकार चुनते हैं? मिक्चर ऑफ एक्सपर्ट आमतौर पर
00:11:12ठीक काम करता है। तीन या चार अरब पैरामीटर वाला मिक्चर ऑफ एक्सपर्ट आमतौर पर ठीक काम करता है।
00:11:17मिक्चर ऑफ एक्सपर्ट के साथ समस्या यह है कि अगर कोई फाइन-ट्यूनिंग की दिशा में आगे बढ़ना चाहता है,
00:11:22तो यह एक चुनौती हो सकती है, क्योंकि मिक्चर ऑफ एक्सपर्ट मॉडल को फाइन-ट्यून करना आसान नहीं होता है।
00:11:28आप कई बार मॉडल को बिगाड़ सकते हैं। तो, मिक्चर ऑफ एक्सपर्ट के साथ यह एक चुनौती है, लेकिन आमतौर पर,
00:11:35यह आपको अपनी जरूरत के 90% करीब ले आता है, बिना किसी फाइन-ट्यूनिंग या मॉडल पर किए गए कस्टम
00:11:42काम के। तो मिक्चर ऑफ एक्सपर्ट का यह फायदा है। अब अगर आप फाइन-ट्यून करना चाहते हैं,
00:11:48और आप गहराई में जाना चाहते हैं और कहते हैं कि देखिए, मैं किसी खास डोमेन जैसे कि हेल्थकेयर,
00:11:53या किसी अन्य क्षेत्र के लिए काम कर रहा हूँ, और मैं यह सुनिश्चित करना चाहता हूँ कि मैं अपने मॉडल को फाइन-ट्यून कर सकूँ,
00:11:58तो आज की स्थिति के अनुसार आपको कम से कम 8 अरब या 12 अरब मॉडल से शुरुआत करनी चाहिए। शायद आज से छह महीने बाद,
00:12:044 अरब मॉडल, 8 अरब मॉडल को आसानी से मात दे दे, लेकिन आज के लिए, हमने जो देखा है,
00:12:11वह यह है कि आपको न्यूनतम 8 अरब या 12 अरब मॉडल की आवश्यकता है, क्योंकि आप इन मॉडलों में दो
00:12:16चीजें तलाश रहे हैं। एक तो स्पष्ट रूप से तेज़ टोकन, लेकिन साथ ही अच्छे से निर्देश मानना, ठीक है? और
00:12:23दूसरी चीज़ है टूल कॉलिंग में बहुत उच्च सफलता अनुपात, क्योंकि यदि आप इन दोनों चीज़ों को अच्छे से कर सकते हैं,
00:12:29तो आप 70-80% तक पहुँच जाते हैं और आपको किसी भी मॉडल को फाइन-ट्यून करने की आवश्यकता ही नहीं होती,
00:12:35यानी मॉडल सीधे इस्तेमाल करने पर भी काम करेंगे, है ना? तो, तो यह हमारा तरीका रहा है। हमने वास्तव में,
00:12:42हम दो तरह के मॉडल चलाते हैं, एक विशिष्ट उद्योगों के लिए फाइन-ट्यून किया गया मॉडल, और फिर,
00:12:50अधिकांश सामान्य उपयोग के मामलों के लिए, एक MOE मॉडल सीधे काम करता है। कुछ और भी
00:12:56सुझाव और युक्तियाँ हैं जिनके बारे में हम आने वाली स्लाइडों में बात करेंगे जहाँ हम देखते हैं कि मॉडल कहाँ विफल होते हैं, लेकिन,
00:13:00विलंबता और एलएलएम के दृष्टिकोण से हम यहीं खड़े हैं। um, ठीक है, मेरे पास
00:13:07समय कम है, इसलिए मैं इसे जल्दी से आगे बढ़ाऊँगा। अब इसमें कुछ और प्रकार भी हैं। लोग
00:13:12विभिन्न मॉडलों के मिश्रण के साथ एजेंट बनाते हैं। वे क्या करते हैं कि, बातचीत वाले हिस्से के लिए,
00:13:19उनके पास एक संवादात्मक मॉडल होता है, जो कि बहुत छोटा मॉडल होता है, और फिर,
00:13:24शायद तीन अरब का मॉडल भी हो, और फिर टूल कॉलिंग के लिए, उनके पास एक बहुत बड़ा मॉडल होता है,
00:13:27ताकि वहाँ टूल कॉलिंग की सफलता का अनुपात बेहतर हो सके। um,
00:13:35क्षमा करें। दूसरा यह है कि, यह मानकर चलें कि आपके ट्रांसक्रिप्शन अविश्वसनीय होंगे। यानी, यह
00:13:42एक ऐसी बात है जिसे आपको AI एजेंट बनाते समय अपनाना चाहिए, भले ही आपके पास
00:13:49बाजार का सबसे बेहतरीन ट्रांसक्रिप्शन इंजन हो, और मैं, मैं आपको दिखाऊँगा कि क्यों? जैसे कि, अत्याधुनिक
00:13:55ट्रांसक्रिप्शन इंजन बाजार में उपलब्ध हैं, जो आपको लगभग चार से छह प्रतिशत
00:14:02वर्ड एरर रेट तक पहुँचा देते हैं, है ना? और यह ज्ञात मूल्यांकन सेट पर है। वास्तविक दुनिया की शोरगुल वाली कॉलों पर,
00:14:10विभिन्न लहजे (accents), जैसे लोगों के अलग-अलग प्रकार के लहजे होते हैं, डोमेन शब्दावली,
00:14:15और इसी तरह की अन्य चीज़ों के साथ, वे वर्ड एरर रेट के दृष्टिकोण से दो अंकों में पहुँच जाते हैं,
00:14:21है ना? अब आप, स्पष्ट रूप से आप फाइन-ट्यून कर सकते हैं, कोई ओपन-सोर्स मॉडल चुनकर फाइन-ट्यून कर सकते हैं,
00:14:25लेकिन हम आम तौर पर देखते हैं कि यहाँ अक्सर क्या खराब होता है, और इसमें कुछ पैटर्न होते हैं कि क्या खराब होता है।
00:14:31तो, उचित संज्ञाएँ (proper nouns), शब्दजाल (jargons), फोन नंबर, जैसे फोन नंबरों में गायब होने वाले यादृच्छिक अंक,
00:14:38गलत प्रतिस्थापन (substitutions)। मैं, मैं कुछ उदाहरणों के साथ चलूँगा कि आप इन पतों को कैसे हल करते हैं।
00:14:43जब आप एक लंबा पता एकत्र करने का प्रयास कर रहे होते हैं, तो ट्रांसक्रिप्शन इंजन
00:14:48उसके कुछ हिस्सों को छोड़ सकता है। कोड-स्विच की गई भाषाएँ। मैं, मैं एक ऐसी भाषा का उदाहरण लेता हूँ जिसे मैं बोलता हूँ,
00:14:55क्योंकि यह मेरे लिए स्लाइड पर डालना आसान था, जहाँ, यदि आप अंग्रेजी लेते हैं,
00:15:01लेकिन एक अलग लिपि में लिखी गई है, तो वही हिंदी के लिए उपयोग किया जाता है,
00:15:06है ना? जैसे, यह उस लिपि में लिखी गई अंग्रेजी है, जबकि इसका वास्तविक अंग्रेजी संस्करण
00:15:11है: hello, how are you? तो, अगर मैं किसी अलग देश में दर्शकों को संबोधित कर रहा हूँ,
00:15:16जहाँ मैंने कोड-स्विच की हुई भाषाएँ इस्तेमाल की हैं, और मुझे अपनी अंग्रेजी एक अलग लिपि में मिलने लगती है,
00:15:21तो ट्रांसक्रिप्शन इंजन से लेकर LLM स्तर तक और उसके आगे सब कुछ खराब होने लगता है,
00:15:26क्योंकि आपका LLM फिर कई बार उस तरह की लिपि में आउटपुट देने लगता है, और फिर आपका TTS गड़बड़ा जाता है।
00:15:32ठीक है, तो, इसके बारे में सावधान रहना बहुत महत्वपूर्ण है, और यदि आप अपने एजेंट को ट्रांसक्रिप्शन इंजन से स्वतंत्र बनाना चाहते हैं,
00:15:38तो आपको एक ऐसी परत (layer) बनाने की जरूरत है जो इन सभी को सामान्यीकृत (normalize) कर सके, है ना?
00:15:44हम एक मिनट में समाधानों के बारे में बात करेंगे। और दूसरा मामला है, जो कि, हिंदी है,
00:15:48लैटिन या रोमन लिपि में, है ना? जो कि इस तरह है कि यह हिंदी है, लेकिन अंग्रेजी जैसी दिखती है,
00:15:54जो फिर से आगे की हर चीज़ को गड़बड़ा देती है। ये सिर्फ उदाहरण हैं। यह लागू होता है,
00:15:59अरबी, मंदारिन, जापानी, या लगभग किसी भी भाषा पर। तो,
00:16:04ट्रांसक्रिप्शन स्तर पर वास्तव में क्या बदलाव लाता है? उचित संज्ञाओं (proper nouns) के लिए,
00:16:11हम अनुशंसा करते हैं कि आप केवल कीवर्ड बूस्टिंग का उपयोग न करें। मुझे लगता है कि कई ट्रांसक्रिप्शन इंजन
00:16:16आपको कीवर्ड बूस्टिंग प्रदान करते हैं, जहाँ आप उनके इंजन में विशिष्ट शब्द डाल सकते हैं,
00:16:21लेकिन गतिशील कीवर्ड बूस्टिंग (dynamic keyword boosting) करें। इसका मतलब यह है कि कॉल की पूरी स्थिति के दौरान कीवर्ड को न रखें।
00:16:26जब आपको लगे कि उत्तर के रूप में इसकी आवश्यकता है, तो इसे गतिशील रूप से जोड़ें, ताकि आपको उच्चतम सटीकता मिले,
00:16:32यानी कॉल के विभिन्न चरणों में, ट्रांसक्रिप्शन इंजन में अलग-अलग चरणों के दौरान अलग-अलग कीवर्ड बूस्ट किए गए होंगे, है ना?
00:16:38और हमने देखा है कि यही सबसे अच्छा काम करता है, क्योंकि यदि आप ट्रांसक्रिप्शन इंजन के संदर्भ को
00:16:43ढेर सारे कीवर्ड से दूषित कर देते हैं, तो यह फिर से मतिभ्रम (hallucinate) करने लगेगा, है ना?
00:16:49तो, आम तौर पर यही सबसे अच्छा काम करता है। हाँ, अपने ट्रांसक्रिप्ट को एक LLM के साथ पोस्ट-प्रोसेस करें,
00:16:55क्योंकि आपके LLM के पास डोमेन संदर्भ होता है, आपके ट्रांसक्रिप्शन इंजन के पास नहीं। इसलिए, बहुत से शब्द जो यह कहेगा,
00:17:02मैं आपको कुछ उदाहरण दूँगा, शायद समझ न आएँ। यह ट्रांसक्रिप्शन है,
00:17:07जैसे किसी ट्रांसक्रिप्शन इंजन से एक फोन नंबर, है ना? आपको क्या लगता है कि वह E क्या है?
00:17:13है ना? यदि आप इसे किसी LLM को देते हैं, तो वह जानता है कि वह 3 है। इसी तरह, जैसे कि वह वन क्या है, वह अंक
00:17:181 है। तो, आपका ट्रांसक्रिप्शन इंजन कई बार इसे गड़बड़ा सकता है, लेकिन जब आप इसे LLM परत के साथ
00:17:24पोस्ट-प्रोसेस करते हैं, तो यह डेटा संग्रह के दृष्टिकोण से तुरंत उसे ठीक कर देगा। मेरा मतलब है, और आखिरी वाला,
00:17:30जैसा कि मैंने कहा, लिप्यंतरण (transliteration) है कि आपका STT आउटपुट जो कि बहुभाषी भी है,
00:17:37या तो किसी LLM का उपयोग करके सामान्यीकृत किया जाता है जिसे आप पहले लिप्यंतरित करते हैं या किसी प्रकार के तंत्रिका (neural) लिप्यंतरण इंजन का उपयोग करते हैं।
00:17:46इनमें से कई ओपन-सोर्स हैं। आप उनमें से किसी एक को चुन सकते हैं,
00:17:49है ना? जो आपके लिए वह सारा काम कर देगा। ट्रांसक्रिप्शन इंजन से स्वतंत्र होकर
00:17:55 लगातार साफ किए गए ट्रांसक्रिप्ट अपने LLM को भेजें।
00:18:00ठीक है। तीसरा मामला जो हम आमतौर पर देखते हैं वह है डेटा एकत्र करना। यहीं पर मुझे लगता है कि 50 से 60
00:18:05प्रतिशत AI एजेंट बुरी तरह से असफल हो जाते हैं। और हम इसके बारे में एक UX समस्या के रूप में सोचते हैं,
00:18:14लेकिन केवल आवाज के लिए। इसलिए डेटा मॉडल के बारे में सोचें, न कि किसी ट्रांसक्रिप्ट के बारे में जो LLM में आ रहा है और यह पता लगाने की कोशिश कर रहा है कि ट्रांसक्रिप्ट ने क्या कहा।
00:18:21तो आइए प्रेरणा लें, मैं यह मान रहा हूँ कि हम में से अधिकांश यहाँ डेवलपर हैं।
00:18:27Python के डेटा क्लास, Pydantic, TypeScript से Zod
00:18:32या UI में फॉर्म फील्ड्स से प्रेरणा लें, है ना? यदि आप उस समस्या विवरण से सोचना शुरू करते हैं,
00:18:39तो हमने डेटा संग्रह के दृष्टिकोण से सटीकता को 30% से बढ़ाकर 95% तक पहुँचते हुए देखा है
00:18:46जब आप इस तरह से सोचना शुरू करते हैं। तो पूछने से पहले अपना आकार तय करें, है ना?
00:18:52इसे खुला रखने के बजाय, क्या आप इसे सीमित रख सकते हैं? क्या फोन नंबर एक
00:18:58फोन नंबर प्रकार का फील्ड हो सकता है? जिस क्षण आप ऐसा करते हैं, आप जानते हैं कि इसमें कितने अंक होने चाहिए।
00:19:03आप उसके ऊपर सत्यापन (validation) कर सकते हैं, और फिर यह देख सकते हैं कि कौन से अनुमत मान (allowed values) वहाँ हो सकते हैं।
00:19:10तो पिछले उदाहरण में हमने देखा, यदि फोन नंबर के बीच में कोई E आ जाता है और आप जानते हैं कि यह एक फोन नंबर है,
00:19:15तो आप तुरंत समझ जाते हैं या तो आप उसका बुद्धिमानी से अनुमान लगाकर 3 कर लेते हैं और उपयोगकर्ता के साथ उसकी पुष्टि करते हैं,
00:19:20या आप जानते हैं कि यह एक त्रुटि है और फिर आप उसका सत्यापन करते हैं और उपयोगकर्ता से दोबारा दोहराने के लिए कहते हैं,
00:19:26है ना? तो, यह हमारे द्वारा देखे गए सामान्य पैटर्न में से एक है।
00:19:31नाम, मुझे लगता है, एक दिलचस्प मामला है। मैंने एक ऐसा नाम चुना है
00:19:36जिसे उच्चारण करना कठिन है। ऐसा कोई तरीका नहीं है कि कोई इंसान इसे सही से समझ पाए और न ही
00:19:43हमारा ट्रांसक्रिप्शन इंजन इसे सही से समझ पाएगा, चाहे आप इसे कितनी भी बार करें, है ना?
00:19:47तो जैसे ही आप इसके बारे में फील्ड के रूप में सोचना शुरू करते हैं और फिर नियम बनाते हैं और फिर इसकी वर्तनी
00:19:53अक्षर-दर-अक्षर (letter by letter) पुष्टि करने के तंत्र बनाते हैं, तभी आप इसे सही से समझ पाते हैं।
00:19:58अन्यथा, वॉयस कॉल पर इसे एकत्र करने के तरीके में यह बुरी तरह से गड़बड़ा जाएगा।
00:20:03और यह डेटा संग्रह के उस हिस्से के बारे में बात करने का एक उदाहरण है।
00:20:11दूसरी जगह जहाँ यह नाटकीय रूप से खराब हो जाता है, वह है सापेक्ष मान (relative values), जिसमें तारीख इसका एक उदाहरण है।
00:20:18यदि कोई कहता है कि अगले सप्ताह बुधवार 8, तो इसका मतलब सुबह के 8 बजे, शाम के 8 बजे हो सकता है,
00:20:25और फिर यह पता लगाना कि वह तारीख वास्तव में क्या है, फिर से एक बहुत सीमित समस्या बन जाती है।
00:20:30यदि आप जानते हैं कि यह एक दिनांक-समय फील्ड है और मैं एक दिनांक-समय फील्ड एकत्र कर रहा हूँ, तो आप वर्तमान तारीख लेते हैं
00:20:35और फिर यह पता लगाते हैं कि उसके आधार पर यह मान क्या होगा, है ना? तो, आप यह सुनिश्चित करना चाहते हैं
00:20:39कि आप इसे LLM और टूल कॉलिंग के संयोजन के साथ करें, और टूल कॉलिंग
00:20:44फील्ड के दृष्टिकोण से आपके लिए इनमें से बहुत सा भारी काम कर रही है।
00:20:50हाँ। और फिर आप इसे यूनिट टेस्ट के दृष्टिकोण से चलाते हैं। इसलिए आपके सभी मूल्यांकनों को
00:20:58इन फील्ड्स को यूनिट टेस्ट के रूप में मानना शुरू करना चाहिए। और जब तक आपके यूनिट टेस्ट
00:21:06जान aपका एजेंट काफी हद तक विश्वसनीय और बार-बार
00:21:10दहराने योग्य होगा। आपको, आपको सिर्फ यह पता लगाने के लिए
00:21:15सैकड़ों एंड-टू-एंड एजेंट टेस्ट केस नहीं चलाने पड़ते कि...
00:21:24और फिर, हाँ, जैसा कि मैंने कहा, मुझे लगता है कि यह मानसिकता...
00:21:30सब कुछ अधिक संरचित बनाती है, बजाय इसके कि मैं ढेर सारे प्रॉम्प्ट रखूँ
00:21:36और हर बार प्रॉम्प्ट में कुछ वर्ण बदलते रहें,
00:21:41और किसी तरह मेरी प्रॉम्प्ट इंजीनियरिंग एलएलएम को अधिक निर्देश-अनुकूल बना देगी...
00:21:47वास्तव में, जैसा कि मैंने कहा, हमने मॉडल को फाइन-ट्यून किए बिना...
00:21:53ठीक है। और फिर, और इसका तरीका मुख्य रूप से यह है कि एजेंट उस समय क्या कर रहा है,
00:21:57एजेंट उस समय क्या कर रहा है, उसके संदर्भ को विशिष्ट अवस्थाओं के साथ तोड़ा जाए।
00:22:04ठीक है। मैं समय के दृष्टिकोण से...
00:22:10इसे जल्दी से छोड़ रहा हूँ। मैं देख रहा हूँ कि मेरे पास तीन मिनट और हैं। उम्मीद है कि यह कोई बग है, लेकिन...
00:22:16हम इसे यहीं छोड़ते हैं। ठीक है। तो, यह चौथा क्षेत्र है जहाँ हम समस्याएँ आते हुए देखते हैं। अधिकांश लोग...
00:22:24एलएलएम आउटपुट लेते हैं और फिर हम इसे टीटीएस पर भेजते हैं। जाहिर है, मुझे लगता है कि बाजार में...
00:22:30कई अच्छे टीटीएस हैं जो काफी कठिन काम संभाल लेते हैं, लेकिन कई बार यह गड़बड़ कर देता है।
00:22:37हम जिसकी अनुशंसा करते हैं और जो हमने देखा है, वह यह है कि आमतौर पर आप अपने एलएलएम और...
00:22:43टीटीएस में फीड किए जाने वाले डेटा के बीच एक नॉर्मलाइजेशन लेयर रखना चाहते हैं। आप अपने एलएलएम आउटपुट को सीधे टीटीएस पर नहीं भेजते हैं, है ना?
00:22:50और हम कुछ उदाहरणों पर चर्चा करेंगे। मूल बातें, जैसे टीटीएस में किसी भी संश्लेषण से पहले...
00:22:58इमोजी, मार्कडाउन को हटाना। अधिकांश ऑर्केस्ट्रा पाइपलाइन ऐसा करती हैं...
00:23:02जैसे LiveCAD या PipeCAD यदि आप कुछ फ्लैग सेट करते हैं तो आपके लिए ऐसा कर देंगे। इसलिए, मैं...
00:23:08बस यह सुनिश्चित कर लें कि यदि आप उनका उपयोग नहीं कर रहे हैं या शुरुआत से निर्माण कर रहे हैं,
00:23:12तो आपने इसे स्पष्ट रूप से सेट किया है क्योंकि आप नहीं चाहते कि कोई इमोजी...
00:23:17ठीक है। मुझे लगता है, कुछ अधिक सामान्य, कस्टम डिक्शनरीज़। अधिकांश टीटीएस इंजन...
00:23:23आपको यह प्रदान करते हैं, जैसे कस्टम शब्दों का उच्चारण कैसे करें, चाहे वह...
00:23:30उचित संज्ञाएँ, ब्रांड, संक्षिप्त नाम आदि हों। इसलिए, जब आप अपने एलएलएम से...
00:23:36टीटीएस आउटपुट पर जाते हैं, तो इन्हें सेट कर लें, क्योंकि यदि आप ऐसा नहीं करते हैं, तो आप गड़बड़ कर देंगे।
00:23:40और मैं आपको इसका एक उदाहरण दिखाऊँगा कि हम इसका परीक्षण कैसे करते हैं। दूसरा यह है कि...
00:23:47अधिकांश इंजन आपको गति भी देते हैं। इसलिए, यदि आप जानते हैं कि आप किसी इकाई का उच्चारण कर रहे हैं, तो धीमा हो जाएँ...
00:23:54अपने एजेंट को धीमा करें। तो 0.8x या 0.7x पर, ताकि वह उस विशिष्ट इकाई पर...
00:24:00जोर दे सके और ईमेल या फोन नंबर या नाम के एक-एक अक्षर के उच्चारण में गड़बड़ न करे। और हाँ, सभी गंदी चीज़ों को सामान्य करें...
00:24:09जैसे ईमेल, मुद्रा, तिथियाँ। इसे करने के लिए टीटीएस पर भरोसा न करें। अधिकांश ऐसा करते हैं, लेकिन...
00:24:15इसे करने के लिए टीटीएस पर न छोड़ें। जैसे अपने अंत में अपनी नॉर्मलाइजेशन लेयर बनाएँ...
00:24:21ताकि कल को आपको लगे कि आपको टीटीएस बदलने की जरूरत है, या किसी भी कारण से...
00:24:25पहला डाउन है और आप दूसरा टीटीएस उपयोग करना चाहते हैं, तो आप टीटीएस के इंजन पर मूल रूप से...
00:24:32निर्भर न रहें, बल्कि इसे प्रबंधित करने के लिए इसे इन-हाउस बना रहे हों। और फिर, हाँ...
00:24:39मुझे लगता है कि यहाँ मेरा बैच नहीं है, लेकिन मेरे पास उस पर मेरा उपनाम नहीं है। इसलिए, मेरा पहला परीक्षण...
00:24:44यह है कि यदि यह मेरे उपनाम या मेरी कंपनी के नाम का उच्चारण नहीं कर सकता है, तो यह पहले ही असफल हो रहा है। इसलिए, मेरा उपनाम है...
00:24:50बालसुब्रामनियन, और यदि आप वॉयस एआई एजेंट का उपयोग करके इसका उच्चारण नहीं कर सकते हैं, तो यह मेरे लिए एक जाँच है।
00:24:56मैं जानता हूँ, जैसे, एजेंट कई ऐसे शब्दों में गड़बड़ कर देगा जिन्हें दिन-प्रतिदिन...
00:25:04शब्दशः बोलना पड़ता है। दूसरा हमारी कंपनी का नाम Pliwo है। इसलिए, कई इंजन...
00:25:09इसका उच्चारण Pliwo या Pliwo आदि करते हैं। लेकिन मुझे लगता है कि विशेष रूप से...
00:25:16अपनी पाइपलाइन में इसे नियंत्रित करने में सक्षम होना बेहद महत्वपूर्ण है। और फिर यदि आप निर्माण कर रहे हैं...
00:25:21एक ग्राहक-सामने वाला उत्पाद, तो, अपने ग्राहकों को यह विकल्प दें। ठीक है...
00:25:26मैं आखिरी दो स्लाइडों को सरसरी तौर पर देखने जा रहा हूँ। मैं समय से काफी आगे निकल रहा हूँ।
00:25:32एंड-ऑफ़-टर्न डिटेक्शन, मुझे लगता है कि यह एक अलग विषय है, लेकिन मैं...
00:25:36जल्दी से सभी बिंदुओं को सामने ला रहा हूँ ताकि आप लोग इसे देख सकें। और यदि आपको...
00:25:41इसके बाद चैट की आवश्यकता है, तो हम इस पर चर्चा कर सकते हैं। ठीक है, मैं इसे लगभग पाँच सेकंड के लिए...
00:25:49छोड़ रहा हूँ और फिर हम इसके बारे में ऑफ़लाइन बात कर सकते हैं। मैं समय से काफी आगे हूँ।
00:25:53और आखिरी वाला है, बार्ज-इन और बैक-चैनलिंग। मुझे लगता है कि स्पीच-टू-स्पीच मॉडल के बारे में...
00:25:58बहुत सी बातें हो रही हैं जो इनमें से कुछ को करते हैं, लेकिन हम यह देखने में सक्षम रहे हैं कि हम...
00:26:03स्पीच-टू-स्पीच पाइपलाइन में यह सब कैसे कर सकते हैं। इसके लिए वास्तव में आपको...
00:26:07स्पीच-टू-स्पीच मॉडल की आवश्यकता नहीं है। एक बार फिर, मैं इसे स्लाइड पर रखता हूँ...
00:26:15ठीक है। मुझे नहीं लगता कि हमारे पास प्रश्नों के लिए समय है। यदि आपके पास कोई समय है तो हम...
00:26:19उन्हें ऑफ़लाइन ले सकते हैं, लेकिन उम्मीद है कि यह मददगार रहा होगा और आपको इस बारे में कुछ अंतर्दृष्टि दी होगी कि हम...
00:26:24उत्पादन में, बड़े पैमाने पर अरबों कॉल के साथ क्या देख रहे हैं। ठीक है। धन्यवाद।
00:26:29हम आपसे अगली बार मिलते हैं।
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기