5 वॉयस एजेंट विफलता मोड जिनका आप पहले सप्ताह में सामना करेंगे — वेंकी बी, प्लिवो

스크립트

00:00:00आइए कुछ त्वरित प्रश्न करते हैं और फिर सीधे आगे बढ़ते हैं। हम में से कितने लोगों ने यहाँ
00:00:19वॉइस एआई एजेंट्स बनाए हैं? ठीक है, यहाँ काफी अच्छे दर्शक हैं। और आप में से कितने
00:00:28लोगों ने ऐसे एआई एजेंट्स बनाए हैं जिन्हें प्रोडक्शन में तैनात किया गया है? बुरा नहीं है। ठीक है, बढ़िया। तो हम बात करेंगे
00:00:38कि आमतौर पर क्या होता है, है ना? जैसे हर कोई वॉइस एआई एजेंट्स के बारे में बात कर रहा है। वह, आप जानते हैं,
00:00:47आज की दुनिया में लगभग हर चीज़ का एकमात्र समाधान वॉइस एआई एजेंट्स है। तो हर कोई
00:00:51इसे बना रहा है और तैनात करने की कोशिश कर रहा है। जब आप इसे अपने
00:00:57डव परिवेश में बना रहे होते हैं, तो यह बहुत अच्छा लगता है। और फिर जिस पल आप इसे कॉन्सेप्ट के प्रमाण से प्रोडक्शन में ले जाते हैं,
00:01:03चीज़ें विफल होने लगती हैं। तो हम इन पाँच अलग-अलग पहलुओं पर चर्चा करेंगे कि कैसे, या हमने
00:01:09PLEVO में वॉइस एआई एजेंट्स के साथ क्या देखा है। लेकिन उससे ठीक पहले, मेरी तरफ से एक संक्षिप्त परिचय। मैं वेंकी हूँ,
00:01:19संस्थापक और सीएओ। उसने एजेंट इंजीनियरिंग मैनेजर का पद इस्तेमाल किया। मैं खुद को पद के दृष्टिकोण से
00:01:28चीफ एजेंट ऑफिसर कह रहा हूँ। ठीक है, तो क्या है, क्या है, आप जानते हैं, क्यों, हम इस चर्चा के लिए योग्य क्यों हैं,
00:01:35और जैसे, क्या, हम ऐसा क्या देख रहे हैं जो बहुत सी कंपनियों को देखने को नहीं मिलता है? तो मैं,
00:01:42मैं अपनी यात्रा के बारे में थोड़ी बात करूंगा कि हम अब तक कैसे आगे बढ़े हैं और फिर सीधे आगे
00:01:48बढ़ेंगे। आप जानते हैं, हम लगभग 14 वर्षों से अस्तित्व में हैं। हमारी यात्रा एक डेवलपर एपीआई प्लेटफॉर्म की रही है।
00:01:54और फिर अब एक, आप जानते हैं, एआई एजेंट व्यवसाय। हमने 2011 में वॉइस और एसएमएस एपीआई के साथ शुरुआत की थी।
00:02:01और फिर, आप जानते हैं, अब हम मुख्य रूप से अपने फुल-स्टैक एआई एजेंट ऑफ़रिंग पर ध्यान केंद्रित कर रहे हैं।
00:02:08हमारे प्लेटफ़ॉर्म पर फुल-स्टैक। हम दुनिया भर में हर महीने एक अरब से अधिक वॉइस कॉल देखते हैं।
00:02:16э, और यही वह जगह है जहाँ हमने इनमें से कई, आप जानते हैं, पैटर्न उभरते हुए देखे हैं कि कैसे,
00:02:20जब हम अपने ग्राहकों के साथ काम करते हैं, तो प्रोडक्शन में उनके वॉइस एआई एजेंट्स के साथ क्या होता है।
00:02:25э, हम 90 सदस्यों की एक टीम हैं, э, और हमारे पास बैंक में 50 मिलियन की फंडिंग है। मज़ेदार तथ्य,
00:02:33यह बाहरी वीसी निवेशकों से नहीं है। यह सब एक लाभदायक कंपनी होने के कारण है,
00:02:38इन वर्षों में उस नकदी को बैंक में जमा करने से। э,
00:02:42कुछ ग्राहक जिन्हें हम दुनिया भर में सेवा प्रदान करते हैं। э, आप जानते हैं, हमने वहाँ कुछ लोगो छोड़ दिए हैं,
00:02:49э, लेकिन मुख्य रूप से ऑफ़रिंग के दृष्टिकोण से, э, मैं इसे तीन अलग-अलग श्रेणियों में बाँटूंगा।
00:02:54एक प्रोग्रामेबल, э एआई एजेंट ऑफ़रिंग है। हम इसे कहते हैं, э मेरा मतलब है, यह एक स्पीच
00:03:00पाइपलाइन है, अभी तक कोई सच्चा स्पीच-टू-स्पीच उत्पाद नहीं है, लेकिन यह एक प्रोग्रामेबल ऑफ़रिंग है।
00:03:05हमारे पास एक एआई एजेंट स्टूडियो भी है। यह एक नो-कोड विज़ुअल, э बिल्डर है। और फिर, जैसा कि मैंने कहा,
00:03:11हमने वॉइस एपीआई के साथ शुरुआत की थी। इसलिए हमने पिछले 14 वर्षों में इसे स्पष्ट रूप से तैयार किया है,
00:03:16एसआईपी ट्रंकिंग और ऑडियो स्ट्रीमिंग परत। इसलिए हम टेलीफोनी या कैरियर परत के लिए अन्य लोगों पर निर्भर नहीं हैं।
00:03:22यह वह मुख्य व्यवसाय है जिसे हमने इन सभी वर्षों में बनाया है। और इसी के ऊपर हमारा एआई,
00:03:26э एजेंट प्लेटफॉर्म आधारित है।
00:03:32ठीक है। इसके साथ, э आइए इसमें उतरें, है ना? जो मुझे यकीन है कि चूँकि आप सभी ने
00:03:39एआई एजेंट्स बनाए हैं, आप सभी ने इसे देखा होगा या, आप जानते हैं, इसे किसी न किसी रूप में बनाया होगा। और हम इस पर
00:03:44अधिक समय बिताएंगे कि, э पूरी पाइपलाइन कैसी दिखती है, है ना? э हम ग्राहकों के साथ क्या देखते हैं,
00:03:51और, और मुझे यकीन है कि आप लोग इससे खुद को जोड़ नहीं पा रहे होंगे, वह यह है कि, एआई एजेंट्स के बारे में सोचने वाला कोई भी व्यक्ति,
00:03:56वे क्या करते हैं कि वे इनमें से कई ऑर्केस्ट्रेशन फ्रेमवर्क चुनते हैं, और, э वे बहुत अच्छा काम करते हैं,
00:04:01लाइव किट या पाइप कैट, आप जानते हैं, उसके ऊपर अपना एआई एजेंट बनाते हैं। э उन्हें लगता है कि
00:04:06वे इन चार अलग-अलग परतों को व्यवस्थित कर सकते हैं, स्पीच टू टेक्स्ट, एलएलएम, э और, और टीटीएस
00:04:13बीच में टर्न डिटेक्शन के साथ और हम आगे बढ़ जाते हैं। जैसे मेरा एआई एजेंट एक पीओजी में काम करता है
00:04:19और यह प्रोडक्शन में काम करने के लिए अच्छा है। э आमतौर पर ऐसा ही होता है। वे अपनी
00:04:24विलंबता को मापते हैं और आप इस स्लाइड पर प्रत्येक परत पर कुछ सांकेतिक विलंबता देख सकते हैं। और वे कहते हैं,
00:04:30हाँ, यह, э मुझे जिसकी आवश्यकता है उसके लिए यह अच्छा लगता है। तो आइए, आइए प्रोडक्शन तैनात करें। और फिर
00:04:36प्रोडक्शन, э एक तरह से शुरू होने लगता है, और, और आप सभी प्रकार के विफलता मोड देखते हैं, जिस पर
00:04:41हम इस बातचीत में, कम से कम, अपना अधिकांश समय बिताने जा रहे हैं। э मैंने अंत में कुछ समय
00:04:48प्रश्नोत्तर के लिए रखा है यदि आप लोग, э प्रश्न पूछना चाहते हैं, लेकिन हम सीधे इससे आगे बढ़ेंगे,
00:04:53э हमारे द्वारा देखे जाने वाले विभिन्न विफलता मोड। आइए, э पहले वाले से शुरू करें जिसके बारे में
00:05:01हर कोई बात करता है। जैसे यह सबसे अधिक चर्चा किया जाने वाला विफलता मोड है, जो कि विलंबता है। э मुझे लगता है कि
00:05:07आज हमारे पास कुछ एआई एजेंट वार्ताएँ या वॉइस एआई एजेंट वार्ताएँ हैं। उम, मुझे पूरा यकीन है कि हर कोई,
00:05:12हर कोई इस विशिष्ट विफलता मोड को छूने जा रहा है, यही कारण है कि मैं इसे तुरंत ला रहा हूँ, э
00:05:17э के संदर्भ में, э आप जानते हैं, कुछ पसंद है कि यह पूरा अनुभव, э उपयोगकर्ताओं के लिए कैसा है, है ना? э आमतौर पर
00:05:26अधिकांश लोग इसे पहले ऑडियो के समय से मापते हैं। यानी वह समय जब आपके उपयोगकर्ता बोलना बंद कर देते हैं
00:05:34आपके एजेंट के बोलना शुरू करने तक का समय, है ना? और मुझे लगता है कि आपने, आपने शायद इसे देखा होगा यदि आप लोगों ने
00:05:39वाईजेड एजेंट्स बनाए हैं, पर, आप जानते हैं, क्या, э अच्छा या प्राकृतिक महसूस होता है, क्या, э
00:05:46एक तरह से परेशान करने वाला महसूस होता है या ध्यान देने योग्य महसूस होता है, और फिर परेशान करने वाला क्या महसूस होता है, जो, आप जानते हैं, अलग-अलग स्तर के
00:05:52चरण हैं। э हम देखते हैं, э अधिकांश लोग 550 से कम रहना चाहते हैं क्योंकि प्लेटफॉर्म द्वारा यही विज्ञापित किया जाता है,
00:06:00या, आप जानते हैं, समाधान या, या, या, या परतें, लेकिन मुझे लगता है कि अधिकांश 750
00:06:07से 1.2 के बीच समाप्त होते हैं। э अधिकांश लोग इसी पर समाप्त होते हैं। э वास्तव में खराब प्रदर्शन करने वाले लोग समाप्त होते हैं,
00:06:13आप जानते हैं, 1.2 से अधिक, और फिर आप उपयोगकर्ताओं को, э फोन काटते हुए देखना शुरू करते हैं। э अब मैं, मैं साझा करूंगा
00:06:19आपके साथ कि हमने व्यावहारिक रूप से क्या देखा है, э प्रोडक्शन में, э ग्राहकों के साथ इसका उपयोग करते हुए, э अलग-अलग परतों पर, और फिर, आप जानते हैं,
00:06:26इनमें से कुछ के समाधान। जिस तरह से हम इसके बारे में सोचना चाहते हैं
00:06:33वह इन तीनों के बीच एक तरह का संतुलन है, जो लागत, बुद्धिमत्ता और विलंबता है,
00:06:42है ना? और, और, और मैं इन तीनों को क्यों ला रहा हूँ? क्योंकि वे एक तरह से परस्पर संबंधित हैं। मुझे लगता है
00:06:48कि मैं अभी-अभी जिन चीज़ों के बारे में बात कर रहा था, э आप जानते हैं, बाहर कुछ लोगों के साथ। उनमें से एक चीज़,
00:06:51पिछले एक साल में, हमने बहुत सारे नवाचार देखे हैं, एलएलएम पक्ष में बुद्धिमत्ता की बहुत अधिक वृद्धि देखी है,
00:06:58है ना? और अधिकांश, э आप जानते हैं, बुद्धिमत्ता सोच के मामले में आई है, या, आप जानते हैं,
00:07:05सुदृढीकरण सीखने (reinforcement learning) और, और इसी तरह आगे भी। वॉइस एजेंट्स के साथ विडंबना यह है कि लगभग हमेशा
00:07:11आपका, э एलएलएम या वह एजेंट जो बात कर रहा है, उसकी सोच को बंद करना होगा, है ना? तो सभी
00:07:19प्रगति जो हमने पिछले एक साल में एलएलएम परत में की है, उनमें से कोई भी यहाँ अब लागू नहीं होती है,
00:07:25है ना? आप, जाहिर है आपके पास, आप जानते हैं, बेहतर मॉडल हैं जो, आप जानते हैं, बेहतर निर्देश का पालन
00:07:29या टूल कॉलिंग कर सकते हैं, लेकिन आपकी लगभग सारी बुद्धिमत्ता जो सोच की परत पर अंतर्निहित है,
00:07:34यदि आप इसे पर्याप्त तेज़ बनाना चाहते हैं तो डिफ़ॉल्ट रूप से बंद है। तो, तो यह उन विडंबनाओं में से एक है
00:07:39जिसका हम सामना करते हैं। तो फिर आप बुद्धिमान लागत और विलंबता को कैसे संतुलित करते हैं?
00:07:44आइए, आइए इनमें से कुछ, э आप जानते हैं, विकल्पों को देखें, э जो बाजार में उपलब्ध हैं,
00:07:48है ना? तो, और मैं विशेष रूप से एलएलएम चुन रहा हूँ क्योंकि यदि आपने पिछला चार्ट देखा है, तो एलएलएम है,
00:07:55э आप जानते हैं, आपकी उच्चतम विलंबता बाल्टी है जो इसमें जुड़ जाती है, है ना? और, э यदि आप देखते हैं,
00:08:02आप जानते हैं, फ्रंटियर मॉडल, जो मुझे लगता है कि अधिकांश लोग डिफ़ॉल्ट रूप से शुरू करते हैं, आपके, आपके ओपनएआई, आपके क्लाउड,
00:08:09आपके जेमिनी, э आप जानते हैं, P50, TTFT एक अच्छे दिन पर लगभग 450 से 500 के आसपास है और यह
00:08:17स्पiky हो सकता है, है ना? यह हो सकता है, यह, э आप जानते हैं, P90, P95 आसानी से 1.2, 1.3 सेकंड से ऊपर जा सकता है,
00:08:25э, और, और यह समग्र एजेंट अनुभव के लिए अच्छा नहीं है। तो, तो यह आपका फ्रंटियर
00:08:31मॉडल है। अब, एक और विकल्प है, जो आपका, आपका सेरेब्रिस या ग्रोक, э है जो प्रसिद्ध है और
00:08:38बहुत सारे टोकन उगलने के लिए लोकप्रिय है, या, या बहुत तेजी से टोकन देता है, है ना? э ये काम करते हैं, लेकिन आपके लिए
00:08:45इन पर समर्पित विलंबता या पहले टोकन का समय प्राप्त करने के लिए, आपको समर्पित क्षमता की आवश्यकता होती है और वह वास्तव में महंगा है।
00:08:51यहीं पर मैंने लागत के बारे में बात की थी, э संतुलित करने की चीज़ों में से एक के रूप में, है ना? यह वास्तव में
00:08:56महंगा है। और फिर जैसे आप ग्रोक टीम या सेरेब्रिस टीम के किसी भी व्यक्ति से बात करते हैं, वे आपको बताएंगे,
00:09:01आपको समर्पित क्षमता के लिए 12 महीने पहले बुकिंग करनी होगी। वे अगले 12 महीनों के लिए बुक हैं।
00:09:05तो, तो यह, यह एक काफी महंगा विकल्प है। और फिर आपको वास्तव में यह सुनिश्चित करने की आवश्यकता है कि मॉडल
00:09:11जिसे आप इनमें से कुछ इन्फ्रा परतों पर तैनात कर रहे हैं, э आज से 12 महीने बाद भी यहाँ रहेगा। और, और यह एक,
00:09:17यह एक बड़ा निवेश और एक बड़ा अज्ञात है। तो, तो उत्पादन-ग्रेड के लिए एक यथार्थवादी विकल्प क्या है, э
00:09:27एजेंट जो, जो अच्छी गुणवत्ता के हैं और इनमें से तीन को संतुलित करते हैं? э हमारे लिए यही काम आया है,
00:09:34э जो ओपन सोर्स मॉडल हैं। э जाहिर है कि विविधता के मामले में उनमें से बहुत सारे हैं और, और, और विविधताएं जिन्हें आप चुन सकते हैं,
00:09:41मैं विशेष रूप से उन दो के बारे में बात कर रहा हूँ जिनके साथ हम काम करते हैं,
00:09:47э Quinn 3.5 और Gemma 4। ये, э आप जानते हैं, बाजार में अभी एक तरह के अत्याधुनिक ओपन सोर्स मॉडल हैं, है ना, э
00:09:56और हमने इस बात के बारे में बहुत सारे बेंचमार्किंग किए हैं, э कि वे कैसे काम करते हैं।
00:10:02यह सोचना डरावना हो सकता है कि, ठीक है, मेरे पास मॉडल हैं, अब मुझे उन्हें होस्ट करना होगा, है ना, उन्हें अपने
00:10:10GPU पर चलाना होगा और इसी तरह आगे भी। लेकिन यदि आप लगातार 300 मिलीसेकंड से कम का लक्ष्य रख रहे हैं, э यह,
00:10:17हमने इसे विलंबता, लागत और बुद्धिमत्ता के बीच संतुलन बनाने के लिए एक, э बढ़िया विकल्प के रूप में देखा है।
00:10:23अब, э यहाँ कुछ और गहराई से चर्चा करते हैं। यदि आप केवल अंग्रेजी कर रहे हैं, э Quinn 3.5 या Gemma दोनों ठीक काम करते हैं।
00:10:29लेकिन यदि आप बहुभाषी कर रहे हैं, э है ना, अंतर्राष्ट्रीय दर्शकों, विभिन्न भाषाओं के लिए, э Gemma 4 इसके लिए
00:10:35एक बहुत बेहतर मॉडल है। э हमने देखा है, э टोकन, э फर्टिलिटी मूल्यांकन। मूल रूप से इसका अर्थ यह है,
00:10:44यदि, यदि मैं इसे सरल बनाऊँ, तो यह है कि उस भाषा में एक शब्द उत्पन्न करने में कितने
00:10:48टोकन लगते हैं? ठीक है, तो जेम्मा बहुत, बहुत बेहतर है, उस दृष्टिकोण से Quinn 3.5 से कम से कम 2.5 से 3x बेहतर है।
00:10:56तो शब्दों का आपका समय Gemma 4 पर बहुत तेज़ है, э बाकी सब बराबर है, है ना, э बहुभाषी आधार पर।
00:11:04बहुभाषी आधार पर। अब, आप एलएलएम स्तर पर कौन सा आकार चुनते हैं? मिक्चर ऑफ एक्सपर्ट आमतौर पर
00:11:12ठीक काम करता है। तीन या चार अरब पैरामीटर वाला मिक्चर ऑफ एक्सपर्ट आमतौर पर ठीक काम करता है।
00:11:17मिक्चर ऑफ एक्सपर्ट के साथ समस्या यह है कि अगर कोई फाइन-ट्यूनिंग की दिशा में आगे बढ़ना चाहता है,
00:11:22तो यह एक चुनौती हो सकती है, क्योंकि मिक्चर ऑफ एक्सपर्ट मॉडल को फाइन-ट्यून करना आसान नहीं होता है।
00:11:28आप कई बार मॉडल को बिगाड़ सकते हैं। तो, मिक्चर ऑफ एक्सपर्ट के साथ यह एक चुनौती है, लेकिन आमतौर पर,
00:11:35यह आपको अपनी जरूरत के 90% करीब ले आता है, बिना किसी फाइन-ट्यूनिंग या मॉडल पर किए गए कस्टम
00:11:42काम के। तो मिक्चर ऑफ एक्सपर्ट का यह फायदा है। अब अगर आप फाइन-ट्यून करना चाहते हैं,
00:11:48और आप गहराई में जाना चाहते हैं और कहते हैं कि देखिए, मैं किसी खास डोमेन जैसे कि हेल्थकेयर,
00:11:53या किसी अन्य क्षेत्र के लिए काम कर रहा हूँ, और मैं यह सुनिश्चित करना चाहता हूँ कि मैं अपने मॉडल को फाइन-ट्यून कर सकूँ,
00:11:58तो आज की स्थिति के अनुसार आपको कम से कम 8 अरब या 12 अरब मॉडल से शुरुआत करनी चाहिए। शायद आज से छह महीने बाद,
00:12:044 अरब मॉडल, 8 अरब मॉडल को आसानी से मात दे दे, लेकिन आज के लिए, हमने जो देखा है,
00:12:11वह यह है कि आपको न्यूनतम 8 अरब या 12 अरब मॉडल की आवश्यकता है, क्योंकि आप इन मॉडलों में दो
00:12:16चीजें तलाश रहे हैं। एक तो स्पष्ट रूप से तेज़ टोकन, लेकिन साथ ही अच्छे से निर्देश मानना, ठीक है? और
00:12:23दूसरी चीज़ है टूल कॉलिंग में बहुत उच्च सफलता अनुपात, क्योंकि यदि आप इन दोनों चीज़ों को अच्छे से कर सकते हैं,
00:12:29तो आप 70-80% तक पहुँच जाते हैं और आपको किसी भी मॉडल को फाइन-ट्यून करने की आवश्यकता ही नहीं होती,
00:12:35यानी मॉडल सीधे इस्तेमाल करने पर भी काम करेंगे, है ना? तो, तो यह हमारा तरीका रहा है। हमने वास्तव में,
00:12:42हम दो तरह के मॉडल चलाते हैं, एक विशिष्ट उद्योगों के लिए फाइन-ट्यून किया गया मॉडल, और फिर,
00:12:50अधिकांश सामान्य उपयोग के मामलों के लिए, एक MOE मॉडल सीधे काम करता है। कुछ और भी
00:12:56सुझाव और युक्तियाँ हैं जिनके बारे में हम आने वाली स्लाइडों में बात करेंगे जहाँ हम देखते हैं कि मॉडल कहाँ विफल होते हैं, लेकिन,
00:13:00विलंबता और एलएलएम के दृष्टिकोण से हम यहीं खड़े हैं। um, ठीक है, मेरे पास
00:13:07समय कम है, इसलिए मैं इसे जल्दी से आगे बढ़ाऊँगा। अब इसमें कुछ और प्रकार भी हैं। लोग
00:13:12विभिन्न मॉडलों के मिश्रण के साथ एजेंट बनाते हैं। वे क्या करते हैं कि, बातचीत वाले हिस्से के लिए,
00:13:19उनके पास एक संवादात्मक मॉडल होता है, जो कि बहुत छोटा मॉडल होता है, और फिर,
00:13:24शायद तीन अरब का मॉडल भी हो, और फिर टूल कॉलिंग के लिए, उनके पास एक बहुत बड़ा मॉडल होता है,
00:13:27ताकि वहाँ टूल कॉलिंग की सफलता का अनुपात बेहतर हो सके। um,
00:13:35क्षमा करें। दूसरा यह है कि, यह मानकर चलें कि आपके ट्रांसक्रिप्शन अविश्वसनीय होंगे। यानी, यह
00:13:42एक ऐसी बात है जिसे आपको AI एजेंट बनाते समय अपनाना चाहिए, भले ही आपके पास
00:13:49बाजार का सबसे बेहतरीन ट्रांसक्रिप्शन इंजन हो, और मैं, मैं आपको दिखाऊँगा कि क्यों? जैसे कि, अत्याधुनिक
00:13:55ट्रांसक्रिप्शन इंजन बाजार में उपलब्ध हैं, जो आपको लगभग चार से छह प्रतिशत
00:14:02वर्ड एरर रेट तक पहुँचा देते हैं, है ना? और यह ज्ञात मूल्यांकन सेट पर है। वास्तविक दुनिया की शोरगुल वाली कॉलों पर,
00:14:10विभिन्न लहजे (accents), जैसे लोगों के अलग-अलग प्रकार के लहजे होते हैं, डोमेन शब्दावली,
00:14:15और इसी तरह की अन्य चीज़ों के साथ, वे वर्ड एरर रेट के दृष्टिकोण से दो अंकों में पहुँच जाते हैं,
00:14:21है ना? अब आप, स्पष्ट रूप से आप फाइन-ट्यून कर सकते हैं, कोई ओपन-सोर्स मॉडल चुनकर फाइन-ट्यून कर सकते हैं,
00:14:25लेकिन हम आम तौर पर देखते हैं कि यहाँ अक्सर क्या खराब होता है, और इसमें कुछ पैटर्न होते हैं कि क्या खराब होता है।
00:14:31तो, उचित संज्ञाएँ (proper nouns), शब्दजाल (jargons), फोन नंबर, जैसे फोन नंबरों में गायब होने वाले यादृच्छिक अंक,
00:14:38गलत प्रतिस्थापन (substitutions)। मैं, मैं कुछ उदाहरणों के साथ चलूँगा कि आप इन पतों को कैसे हल करते हैं।
00:14:43जब आप एक लंबा पता एकत्र करने का प्रयास कर रहे होते हैं, तो ट्रांसक्रिप्शन इंजन
00:14:48उसके कुछ हिस्सों को छोड़ सकता है। कोड-स्विच की गई भाषाएँ। मैं, मैं एक ऐसी भाषा का उदाहरण लेता हूँ जिसे मैं बोलता हूँ,
00:14:55क्योंकि यह मेरे लिए स्लाइड पर डालना आसान था, जहाँ, यदि आप अंग्रेजी लेते हैं,
00:15:01लेकिन एक अलग लिपि में लिखी गई है, तो वही हिंदी के लिए उपयोग किया जाता है,
00:15:06है ना? जैसे, यह उस लिपि में लिखी गई अंग्रेजी है, जबकि इसका वास्तविक अंग्रेजी संस्करण
00:15:11है: hello, how are you? तो, अगर मैं किसी अलग देश में दर्शकों को संबोधित कर रहा हूँ,
00:15:16जहाँ मैंने कोड-स्विच की हुई भाषाएँ इस्तेमाल की हैं, और मुझे अपनी अंग्रेजी एक अलग लिपि में मिलने लगती है,
00:15:21तो ट्रांसक्रिप्शन इंजन से लेकर LLM स्तर तक और उसके आगे सब कुछ खराब होने लगता है,
00:15:26क्योंकि आपका LLM फिर कई बार उस तरह की लिपि में आउटपुट देने लगता है, और फिर आपका TTS गड़बड़ा जाता है।
00:15:32ठीक है, तो, इसके बारे में सावधान रहना बहुत महत्वपूर्ण है, और यदि आप अपने एजेंट को ट्रांसक्रिप्शन इंजन से स्वतंत्र बनाना चाहते हैं,
00:15:38तो आपको एक ऐसी परत (layer) बनाने की जरूरत है जो इन सभी को सामान्यीकृत (normalize) कर सके, है ना?
00:15:44हम एक मिनट में समाधानों के बारे में बात करेंगे। और दूसरा मामला है, जो कि, हिंदी है,
00:15:48लैटिन या रोमन लिपि में, है ना? जो कि इस तरह है कि यह हिंदी है, लेकिन अंग्रेजी जैसी दिखती है,
00:15:54जो फिर से आगे की हर चीज़ को गड़बड़ा देती है। ये सिर्फ उदाहरण हैं। यह लागू होता है,
00:15:59अरबी, मंदारिन, जापानी, या लगभग किसी भी भाषा पर। तो,
00:16:04ट्रांसक्रिप्शन स्तर पर वास्तव में क्या बदलाव लाता है? उचित संज्ञाओं (proper nouns) के लिए,
00:16:11हम अनुशंसा करते हैं कि आप केवल कीवर्ड बूस्टिंग का उपयोग न करें। मुझे लगता है कि कई ट्रांसक्रिप्शन इंजन
00:16:16आपको कीवर्ड बूस्टिंग प्रदान करते हैं, जहाँ आप उनके इंजन में विशिष्ट शब्द डाल सकते हैं,
00:16:21लेकिन गतिशील कीवर्ड बूस्टिंग (dynamic keyword boosting) करें। इसका मतलब यह है कि कॉल की पूरी स्थिति के दौरान कीवर्ड को न रखें।
00:16:26जब आपको लगे कि उत्तर के रूप में इसकी आवश्यकता है, तो इसे गतिशील रूप से जोड़ें, ताकि आपको उच्चतम सटीकता मिले,
00:16:32यानी कॉल के विभिन्न चरणों में, ट्रांसक्रिप्शन इंजन में अलग-अलग चरणों के दौरान अलग-अलग कीवर्ड बूस्ट किए गए होंगे, है ना?
00:16:38और हमने देखा है कि यही सबसे अच्छा काम करता है, क्योंकि यदि आप ट्रांसक्रिप्शन इंजन के संदर्भ को
00:16:43ढेर सारे कीवर्ड से दूषित कर देते हैं, तो यह फिर से मतिभ्रम (hallucinate) करने लगेगा, है ना?
00:16:49तो, आम तौर पर यही सबसे अच्छा काम करता है। हाँ, अपने ट्रांसक्रिप्ट को एक LLM के साथ पोस्ट-प्रोसेस करें,
00:16:55क्योंकि आपके LLM के पास डोमेन संदर्भ होता है, आपके ट्रांसक्रिप्शन इंजन के पास नहीं। इसलिए, बहुत से शब्द जो यह कहेगा,
00:17:02मैं आपको कुछ उदाहरण दूँगा, शायद समझ न आएँ। यह ट्रांसक्रिप्शन है,
00:17:07जैसे किसी ट्रांसक्रिप्शन इंजन से एक फोन नंबर, है ना? आपको क्या लगता है कि वह E क्या है?
00:17:13है ना? यदि आप इसे किसी LLM को देते हैं, तो वह जानता है कि वह 3 है। इसी तरह, जैसे कि वह वन क्या है, वह अंक
00:17:181 है। तो, आपका ट्रांसक्रिप्शन इंजन कई बार इसे गड़बड़ा सकता है, लेकिन जब आप इसे LLM परत के साथ
00:17:24पोस्ट-प्रोसेस करते हैं, तो यह डेटा संग्रह के दृष्टिकोण से तुरंत उसे ठीक कर देगा। मेरा मतलब है, और आखिरी वाला,
00:17:30जैसा कि मैंने कहा, लिप्यंतरण (transliteration) है कि आपका STT आउटपुट जो कि बहुभाषी भी है,
00:17:37या तो किसी LLM का उपयोग करके सामान्यीकृत किया जाता है जिसे आप पहले लिप्यंतरित करते हैं या किसी प्रकार के तंत्रिका (neural) लिप्यंतरण इंजन का उपयोग करते हैं।
00:17:46इनमें से कई ओपन-सोर्स हैं। आप उनमें से किसी एक को चुन सकते हैं,
00:17:49है ना? जो आपके लिए वह सारा काम कर देगा। ट्रांसक्रिप्शन इंजन से स्वतंत्र होकर
00:17:55 लगातार साफ किए गए ट्रांसक्रिप्ट अपने LLM को भेजें।
00:18:00ठीक है। तीसरा मामला जो हम आमतौर पर देखते हैं वह है डेटा एकत्र करना। यहीं पर मुझे लगता है कि 50 से 60
00:18:05प्रतिशत AI एजेंट बुरी तरह से असफल हो जाते हैं। और हम इसके बारे में एक UX समस्या के रूप में सोचते हैं,
00:18:14लेकिन केवल आवाज के लिए। इसलिए डेटा मॉडल के बारे में सोचें, न कि किसी ट्रांसक्रिप्ट के बारे में जो LLM में आ रहा है और यह पता लगाने की कोशिश कर रहा है कि ट्रांसक्रिप्ट ने क्या कहा।
00:18:21तो आइए प्रेरणा लें, मैं यह मान रहा हूँ कि हम में से अधिकांश यहाँ डेवलपर हैं।
00:18:27Python के डेटा क्लास, Pydantic, TypeScript से Zod
00:18:32या UI में फॉर्म फील्ड्स से प्रेरणा लें, है ना? यदि आप उस समस्या विवरण से सोचना शुरू करते हैं,
00:18:39तो हमने डेटा संग्रह के दृष्टिकोण से सटीकता को 30% से बढ़ाकर 95% तक पहुँचते हुए देखा है
00:18:46जब आप इस तरह से सोचना शुरू करते हैं। तो पूछने से पहले अपना आकार तय करें, है ना?
00:18:52इसे खुला रखने के बजाय, क्या आप इसे सीमित रख सकते हैं? क्या फोन नंबर एक
00:18:58फोन नंबर प्रकार का फील्ड हो सकता है? जिस क्षण आप ऐसा करते हैं, आप जानते हैं कि इसमें कितने अंक होने चाहिए।
00:19:03आप उसके ऊपर सत्यापन (validation) कर सकते हैं, और फिर यह देख सकते हैं कि कौन से अनुमत मान (allowed values) वहाँ हो सकते हैं।
00:19:10तो पिछले उदाहरण में हमने देखा, यदि फोन नंबर के बीच में कोई E आ जाता है और आप जानते हैं कि यह एक फोन नंबर है,
00:19:15तो आप तुरंत समझ जाते हैं या तो आप उसका बुद्धिमानी से अनुमान लगाकर 3 कर लेते हैं और उपयोगकर्ता के साथ उसकी पुष्टि करते हैं,
00:19:20या आप जानते हैं कि यह एक त्रुटि है और फिर आप उसका सत्यापन करते हैं और उपयोगकर्ता से दोबारा दोहराने के लिए कहते हैं,
00:19:26है ना? तो, यह हमारे द्वारा देखे गए सामान्य पैटर्न में से एक है।
00:19:31नाम, मुझे लगता है, एक दिलचस्प मामला है। मैंने एक ऐसा नाम चुना है
00:19:36जिसे उच्चारण करना कठिन है। ऐसा कोई तरीका नहीं है कि कोई इंसान इसे सही से समझ पाए और न ही
00:19:43हमारा ट्रांसक्रिप्शन इंजन इसे सही से समझ पाएगा, चाहे आप इसे कितनी भी बार करें, है ना?
00:19:47तो जैसे ही आप इसके बारे में फील्ड के रूप में सोचना शुरू करते हैं और फिर नियम बनाते हैं और फिर इसकी वर्तनी
00:19:53अक्षर-दर-अक्षर (letter by letter) पुष्टि करने के तंत्र बनाते हैं, तभी आप इसे सही से समझ पाते हैं।
00:19:58अन्यथा, वॉयस कॉल पर इसे एकत्र करने के तरीके में यह बुरी तरह से गड़बड़ा जाएगा।
00:20:03और यह डेटा संग्रह के उस हिस्से के बारे में बात करने का एक उदाहरण है।
00:20:11दूसरी जगह जहाँ यह नाटकीय रूप से खराब हो जाता है, वह है सापेक्ष मान (relative values), जिसमें तारीख इसका एक उदाहरण है।
00:20:18यदि कोई कहता है कि अगले सप्ताह बुधवार 8, तो इसका मतलब सुबह के 8 बजे, शाम के 8 बजे हो सकता है,
00:20:25और फिर यह पता लगाना कि वह तारीख वास्तव में क्या है, फिर से एक बहुत सीमित समस्या बन जाती है।
00:20:30यदि आप जानते हैं कि यह एक दिनांक-समय फील्ड है और मैं एक दिनांक-समय फील्ड एकत्र कर रहा हूँ, तो आप वर्तमान तारीख लेते हैं
00:20:35और फिर यह पता लगाते हैं कि उसके आधार पर यह मान क्या होगा, है ना? तो, आप यह सुनिश्चित करना चाहते हैं
00:20:39कि आप इसे LLM और टूल कॉलिंग के संयोजन के साथ करें, और टूल कॉलिंग
00:20:44फील्ड के दृष्टिकोण से आपके लिए इनमें से बहुत सा भारी काम कर रही है।
00:20:50हाँ। और फिर आप इसे यूनिट टेस्ट के दृष्टिकोण से चलाते हैं। इसलिए आपके सभी मूल्यांकनों को
00:20:58इन फील्ड्स को यूनिट टेस्ट के रूप में मानना शुरू करना चाहिए। और जब तक आपके यूनिट टेस्ट
00:21:06जान aपका एजेंट काफी हद तक विश्वसनीय और बार-बार
00:21:10दहराने योग्य होगा। आपको, आपको सिर्फ यह पता लगाने के लिए
00:21:15सैकड़ों एंड-टू-एंड एजेंट टेस्ट केस नहीं चलाने पड़ते कि...
00:21:24और फिर, हाँ, जैसा कि मैंने कहा, मुझे लगता है कि यह मानसिकता...
00:21:30सब कुछ अधिक संरचित बनाती है, बजाय इसके कि मैं ढेर सारे प्रॉम्प्ट रखूँ
00:21:36और हर बार प्रॉम्प्ट में कुछ वर्ण बदलते रहें,
00:21:41और किसी तरह मेरी प्रॉम्प्ट इंजीनियरिंग एलएलएम को अधिक निर्देश-अनुकूल बना देगी...
00:21:47वास्तव में, जैसा कि मैंने कहा, हमने मॉडल को फाइन-ट्यून किए बिना...
00:21:53ठीक है। और फिर, और इसका तरीका मुख्य रूप से यह है कि एजेंट उस समय क्या कर रहा है,
00:21:57एजेंट उस समय क्या कर रहा है, उसके संदर्भ को विशिष्ट अवस्थाओं के साथ तोड़ा जाए।
00:22:04ठीक है। मैं समय के दृष्टिकोण से...
00:22:10इसे जल्दी से छोड़ रहा हूँ। मैं देख रहा हूँ कि मेरे पास तीन मिनट और हैं। उम्मीद है कि यह कोई बग है, लेकिन...
00:22:16हम इसे यहीं छोड़ते हैं। ठीक है। तो, यह चौथा क्षेत्र है जहाँ हम समस्याएँ आते हुए देखते हैं। अधिकांश लोग...
00:22:24एलएलएम आउटपुट लेते हैं और फिर हम इसे टीटीएस पर भेजते हैं। जाहिर है, मुझे लगता है कि बाजार में...
00:22:30कई अच्छे टीटीएस हैं जो काफी कठिन काम संभाल लेते हैं, लेकिन कई बार यह गड़बड़ कर देता है।
00:22:37हम जिसकी अनुशंसा करते हैं और जो हमने देखा है, वह यह है कि आमतौर पर आप अपने एलएलएम और...
00:22:43टीटीएस में फीड किए जाने वाले डेटा के बीच एक नॉर्मलाइजेशन लेयर रखना चाहते हैं। आप अपने एलएलएम आउटपुट को सीधे टीटीएस पर नहीं भेजते हैं, है ना?
00:22:50और हम कुछ उदाहरणों पर चर्चा करेंगे। मूल बातें, जैसे टीटीएस में किसी भी संश्लेषण से पहले...
00:22:58इमोजी, मार्कडाउन को हटाना। अधिकांश ऑर्केस्ट्रा पाइपलाइन ऐसा करती हैं...
00:23:02जैसे LiveCAD या PipeCAD यदि आप कुछ फ्लैग सेट करते हैं तो आपके लिए ऐसा कर देंगे। इसलिए, मैं...
00:23:08बस यह सुनिश्चित कर लें कि यदि आप उनका उपयोग नहीं कर रहे हैं या शुरुआत से निर्माण कर रहे हैं,
00:23:12तो आपने इसे स्पष्ट रूप से सेट किया है क्योंकि आप नहीं चाहते कि कोई इमोजी...
00:23:17ठीक है। मुझे लगता है, कुछ अधिक सामान्य, कस्टम डिक्शनरीज़। अधिकांश टीटीएस इंजन...
00:23:23आपको यह प्रदान करते हैं, जैसे कस्टम शब्दों का उच्चारण कैसे करें, चाहे वह...
00:23:30उचित संज्ञाएँ, ब्रांड, संक्षिप्त नाम आदि हों। इसलिए, जब आप अपने एलएलएम से...
00:23:36टीटीएस आउटपुट पर जाते हैं, तो इन्हें सेट कर लें, क्योंकि यदि आप ऐसा नहीं करते हैं, तो आप गड़बड़ कर देंगे।
00:23:40और मैं आपको इसका एक उदाहरण दिखाऊँगा कि हम इसका परीक्षण कैसे करते हैं। दूसरा यह है कि...
00:23:47अधिकांश इंजन आपको गति भी देते हैं। इसलिए, यदि आप जानते हैं कि आप किसी इकाई का उच्चारण कर रहे हैं, तो धीमा हो जाएँ...
00:23:54अपने एजेंट को धीमा करें। तो 0.8x या 0.7x पर, ताकि वह उस विशिष्ट इकाई पर...
00:24:00जोर दे सके और ईमेल या फोन नंबर या नाम के एक-एक अक्षर के उच्चारण में गड़बड़ न करे। और हाँ, सभी गंदी चीज़ों को सामान्य करें...
00:24:09जैसे ईमेल, मुद्रा, तिथियाँ। इसे करने के लिए टीटीएस पर भरोसा न करें। अधिकांश ऐसा करते हैं, लेकिन...
00:24:15इसे करने के लिए टीटीएस पर न छोड़ें। जैसे अपने अंत में अपनी नॉर्मलाइजेशन लेयर बनाएँ...
00:24:21ताकि कल को आपको लगे कि आपको टीटीएस बदलने की जरूरत है, या किसी भी कारण से...
00:24:25पहला डाउन है और आप दूसरा टीटीएस उपयोग करना चाहते हैं, तो आप टीटीएस के इंजन पर मूल रूप से...
00:24:32निर्भर न रहें, बल्कि इसे प्रबंधित करने के लिए इसे इन-हाउस बना रहे हों। और फिर, हाँ...
00:24:39मुझे लगता है कि यहाँ मेरा बैच नहीं है, लेकिन मेरे पास उस पर मेरा उपनाम नहीं है। इसलिए, मेरा पहला परीक्षण...
00:24:44यह है कि यदि यह मेरे उपनाम या मेरी कंपनी के नाम का उच्चारण नहीं कर सकता है, तो यह पहले ही असफल हो रहा है। इसलिए, मेरा उपनाम है...
00:24:50बालसुब्रामनियन, और यदि आप वॉयस एआई एजेंट का उपयोग करके इसका उच्चारण नहीं कर सकते हैं, तो यह मेरे लिए एक जाँच है।
00:24:56मैं जानता हूँ, जैसे, एजेंट कई ऐसे शब्दों में गड़बड़ कर देगा जिन्हें दिन-प्रतिदिन...
00:25:04शब्दशः बोलना पड़ता है। दूसरा हमारी कंपनी का नाम Pliwo है। इसलिए, कई इंजन...
00:25:09इसका उच्चारण Pliwo या Pliwo आदि करते हैं। लेकिन मुझे लगता है कि विशेष रूप से...
00:25:16अपनी पाइपलाइन में इसे नियंत्रित करने में सक्षम होना बेहद महत्वपूर्ण है। और फिर यदि आप निर्माण कर रहे हैं...
00:25:21एक ग्राहक-सामने वाला उत्पाद, तो, अपने ग्राहकों को यह विकल्प दें। ठीक है...
00:25:26मैं आखिरी दो स्लाइडों को सरसरी तौर पर देखने जा रहा हूँ। मैं समय से काफी आगे निकल रहा हूँ।
00:25:32एंड-ऑफ़-टर्न डिटेक्शन, मुझे लगता है कि यह एक अलग विषय है, लेकिन मैं...
00:25:36जल्दी से सभी बिंदुओं को सामने ला रहा हूँ ताकि आप लोग इसे देख सकें। और यदि आपको...
00:25:41इसके बाद चैट की आवश्यकता है, तो हम इस पर चर्चा कर सकते हैं। ठीक है, मैं इसे लगभग पाँच सेकंड के लिए...
00:25:49छोड़ रहा हूँ और फिर हम इसके बारे में ऑफ़लाइन बात कर सकते हैं। मैं समय से काफी आगे हूँ।
00:25:53और आखिरी वाला है, बार्ज-इन और बैक-चैनलिंग। मुझे लगता है कि स्पीच-टू-स्पीच मॉडल के बारे में...
00:25:58बहुत सी बातें हो रही हैं जो इनमें से कुछ को करते हैं, लेकिन हम यह देखने में सक्षम रहे हैं कि हम...
00:26:03स्पीच-टू-स्पीच पाइपलाइन में यह सब कैसे कर सकते हैं। इसके लिए वास्तव में आपको...
00:26:07स्पीच-टू-स्पीच मॉडल की आवश्यकता नहीं है। एक बार फिर, मैं इसे स्लाइड पर रखता हूँ...
00:26:15ठीक है। मुझे नहीं लगता कि हमारे पास प्रश्नों के लिए समय है। यदि आपके पास कोई समय है तो हम...
00:26:19उन्हें ऑफ़लाइन ले सकते हैं, लेकिन उम्मीद है कि यह मददगार रहा होगा और आपको इस बारे में कुछ अंतर्दृष्टि दी होगी कि हम...
00:26:24उत्पादन में, बड़े पैमाने पर अरबों कॉल के साथ क्या देख रहे हैं। ठीक है। धन्यवाद।
00:26:29हम आपसे अगली बार मिलते हैं।

핵심 요약

VOICE AI AGENTS KO PRODUCTION MEIN SAFAL BANANE KE LIYE LATENCY, TRANSCRIPTION TRUTHIYON, DATA SANGRAH AUR TEXT-TO-SPEECH NORMALIZATION PAR VISHESH DHYAN DENA ZAROORI HAI.

하이라이트

  • VOICE AI AGENTS KAA PRODUCTION MEIN TAYAR KARTE SAMAY PEHLE HAFTE MEin PAANCH MUKHYA VIFALTA MOD AATE HAIN.

  • LATENCY KO 550 MILLISECOND SE 750 SE 1.2 SECOND KE BEECH RAKHNE PAR USER CALL KATE KARNA SHURU KAR DETE HAIN.

  • OPEN SOURCE MODEL JAISE QUINN 3.5 AUR GEMMA 4 LATENCY, LAAGAT AUR BUDDHIMATTA KE BEECH BEHTAR SANTULAN PRADAN KARTE HAIN.

  • TRANSCRIPTION ENGINE KA WORD ERROR RATE SHORGUL WALI CALLON MEIN DO ANKO TAK PAHUNCH JATA HAI.

  • DATA SANGRAH KE DHRISHTIKON SE PYDANTIC YA ZOD JAISE DATA MODEL KA UPAYOG KARNE PAR SATIKTA 30 PRATISHAT SE 95 PRATISHAT TAK BADH JAATI HAI.

타임라인

PARICHAY AUR VIFALTA MOD

  • DEV ENVIRONMENT SE PRODUCTION MEIN JAANE PAR VOICE AI AGENTS FAIL HONE LAGTE HAIN
  • PLEVO DUNIA BHAR MEIN HAR MAHINE EK ARAB SE ADHIK VOICE CALL DEKHTA HAI

DEVELOPMENT SE PRODUCTION MEIN JANE WALE AI AGENTS KO PAANCH MUKHYA VIFALTA MODS KA SAMNA KARNA PADTA HAI.

LATENCY AUR LLM

  • LATENCY, LAAGAT AUR BUDDHIMATTA KE BEECH SANTULAN BANANA ZAROORI HAI
  • QUINN 3.5 AUR GEMMA 4 OPEN SOURCE MODELS BEHTAR VIKALP HAIN

FRONTIER MODELS KI UCIN LATENCY KO KAM KARNE KE LIYE OPEN SOURCE MODELLING KA UPYOG KIYA JATA HAI.

TRANSCRIPTION AUR DATA SANGRAH

  • TRANSCRIPTION ENGINE MEIN PROPER NOUNS AUR PHONE NUMBERS MEIN GADBADI HOTI HAI
  • PYDANTIC AUR ZOD JAISE DATA MODELS SE DATA COLLECTION SATIKTA 95 PRATISHAT TAK PAHUNCH JAATI HAI

REAL WORLD NOISE AUR ACCENTS KI WAJAH SE TRANSCRIPTION ERRORS AATE HAIN JINHE NORMALIZATION LAYERS SE THIK KIYA JATA HAI.

TTS AUR BARGE-IN

  • LLM OUTPUT AUR TTS KE BEECH NORMALIZATION LAYER RAKHNA CHAHIYE
  • EMOJI AUR MARKDOWN KO HATA KAR CUSTOM DICTIONARY KA UPYOG KAREIN

TEXT-TO-SPEECH SE PULEH EMOJI AUR MARKDOWN HATA KAR SAHI UCCAARAN SUNISCHIT KIYA JATA HAI.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기