"मेरा नाम है... मेरा नाम है...": वॉइस एजेंट्स के लिए एक भाषाई मानचित्र — मिदाम किम, सर्विस नाउ

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00ठीक है, आप सभी को नमस्कार। मेरा नाम मिदाम किम है। मैं ServiceNow में एक ML इंजीनियर हूँ और मैं
00:00:25VoiceAI के भाषाई ढाँचे (linguistic framework) के बारे में बात करूँगा। तो, मेरे बारे में थोड़ा परिचय, ताकि आप
00:00:37जान सकें कि मेरा दृष्टिकोण क्या है। जैसा कि मैंने कहा, मैं ServiceNow में एक ML इंजीनियर हूँ, लेकिन मैं
00:00:42वास्तविक जीवन में वाक संचार (speech communication) का एक निरंतर शोधकर्ता भी हूँ। तो, मेरा
00:00:48मूल मंत्र भाषाविज्ञान का प्रयोग करना है और आज मैं आपको
00:00:54भाषाविज्ञान का वही नजरिया देने जा रहा हूँ। क्या आपने कभी VoiceAI की विफलताओं का अनुभव किया है? जी हाँ, बिल्कुल
00:01:05हर किसी की तरह। तो मैं एक उदाहरण देना चाहता हूँ जिसका अनुभव मैंने खुद किया है।
00:01:15बॉट ने मुझसे पूछा, “क्या आप अपने नाम की स्पेलिंग बता सकते हैं?” और फिर मैंने धीरे-धीरे अपने नाम की स्पेलिंग बतानी शुरू की।
00:01:22जी हाँ, यह है M-I-D-A-M। और बॉट कहता है, “पुष्टि करने के लिए, क्या यह M-I-D-A-N है?” फिर मैं कहता हूँ, “नहीं, यह M-I-D-A-M है।”
00:01:40और फिर मैं थोड़ा झुंझला जाता हूँ, और ज्यादा झुंझला जाता हूँ, क्योंकि मेरा नाम M-I-D-A-M है, ना कि M-I-D-A-N। फिर वह मुझसे पूछता है, “अब, आपका खाता संख्या क्या है?” और फिर मैं उलझन में पड़ जाता हूँ। यह खाता संख्या क्या चीज है? फिर मैं उस बारे में जानकारी ढूँढने की कोशिश करता हूँ। तो, मैं जानकारी ढूँढने की कोशिश करता हूँ।
00:02:09तो, कौन सा? यह होना चाहिए, और मैं धीरे-धीरे खाता संख्या बोलना शुरू करता हूँ। यह है A-X-4-5-1। और फिर मैं समय लेता हूँ क्योंकि मुझे इस अजीब नंबर को पढ़ने की आदत नहीं है। और फिर बॉट मुझे बीच में ही टोक देता है। और फिर वह कहता है, “मुझे आपका रिकॉर्ड नहीं मिला।” और फिर, बिना
00:02:14दोबारा कोशिश किए भी, यह मुझसे उसे फिर से दोहराने के लिए कहता है। “क्या आप कृपया इसे दोहरा सकते हैं?” और फिर मैं परेशान हो जाता हूँ, “मुझे आपका रिकॉर्ड नहीं मिला।” और फिर यह कहता है, “मुझे आपका रिकॉर्ड नहीं मिला।” और फिर, बिना कोई प्रयास किए, यह मुझसे इसे फिर से दोहराने के लिए कहता है। “क्या आप कृपया इसे दोहरा सकते हैं?” और फिर मैं तनाव में आ जाता हूँ। और फिर यह कहता है, “मुझे आपका रिकॉर्ड नहीं मिला।” और फिर,
00:02:21A, X, 4, 5, 1 और फिर मैं समय लेता हूँ क्योंकि मुझे इस
00:02:30अजीब नंबर को पढ़ने की आदत नहीं है और फिर बॉट मेरी बात काट देता है और फिर कहता है कि मुझे आपका
00:02:36रिकॉर्ड नहीं मिला और फिर बिना कोई प्रयास किए उसने मुझसे फिर से दोहराने के लिए कहा, क्या आप
00:02:42कृपया इसे दोहरा सकते हैं और फिर मैं बहुत चिढ़ जाता हूँ और फिर मैं कहता हूँ क्या मैं किसी
00:02:46व्यक्ति से बात कर सकता हूँ, मैं अब आपसे और बात नहीं करना चाहता। तो यह बहुत ही
00:02:51आम पैटर्न है वॉइस AI का, दुर्भाग्य से इस मोड़ पर। इसलिए मैं बस
00:02:57यह समझना चाहता हूँ कि हम भाषाविज्ञान की मदद से इस समस्या को कैसे हल कर सकते हैं। तो वॉइस AI
00:03:06तेजी से बढ़ रहा है लेकिन उपयोगकर्ता अभी भी अक्सर वॉइस एजेंटों के बजाय मानव एजेंटों को
00:03:11तरजीह देते हैं। हम इस समस्या को कैसे कम कर सकते हैं? लेकिन सबसे पहले, असल
00:03:19समस्याएं क्या हैं? तो मुझे लगता है कि हम एक बुनियादी ढाँचे के बारे में सोच सकते हैं
00:03:25वॉइस AI के इस एंड-टू-एंड आर्किटेक्चर को समझने के लिए, जिसे भाषाविज्ञान कहा जाता है। तो
00:03:35जैसा कि हम सभी पहले से ही जानते हैं कि मानव संचार एक संयुक्त गतिविधि है, जैसे
00:03:41कि वह चीज जो हम अभी कर रहे हैं। तो मैं आपको अपनी आवाज और शब्द देता हूँ, आप उन्हें सुनते हैं
00:03:48और फिर अगर यह एक बातचीत है, तो आप मुझे अपनी आवाज और अपने
00:03:53शब्द देंगे और फिर यह बातचीत के जरिए आगे-पीछे चलता रहता है। और फिर इस
00:04:02प्रक्रिया में हम लगातार अपने मानसिक मॉडल (mental models) को संसाधित और अपडेट कर रहे होते हैं। तो यह
00:04:09मानव संचार के लिए एक संयुक्त गतिविधि है। और मैं यह कहना चाहूँगा कि वॉइस AI
00:04:18और मानव संचार में भी, इसे इस तरह की एक संयुक्त गतिविधि होना चाहिए क्योंकि यही
00:04:25एकमात्र चीज है जो हम मानव संचार के बारे में जानते हैं। एक इंसान के रूप में हम
00:04:30संचारकों के रूप में हजारों वर्षों से विकसित हो रहे हैं और यही बात हम जानते हैं,
00:04:35इसलिए हम बॉट्स से भी यही उम्मीद करते हैं। तो चलिए इस ढाँचे के तहत वॉइस एजेंट के साथ मेरी
00:04:45कॉल के विफलता वाले दृश्य को देखते हैं। तो आप देख सकते हैं कि दोनों पक्षों के लिए 'सुनना' और 'बोलना' शामिल है।
00:04:53तो मैं अपने नाम की स्पेलिंग बोलना शुरू करता हूँ और फिर बॉट M और N के अंतर को
00:05:04सही ढंग से नहीं सुन पाता। तो यह सुनने के स्तर पर एक STT विफलता है। और फिर TTS मेरे नाम पर केवल
00:05:14अंग्रेजी-केंद्रित उच्चारण नियम लागू करता है। M-I-D-A-M को अमेरिकी
00:05:22अंग्रेजी संस्करण में M-I-D-A-M की तरह पढ़ा जाएगा। इसलिए मैं उलझन में हूँ, लेकिन इस बार मैं थोड़ा उदार हूँ क्योंकि
00:05:29ऐसा अक्सर होता है, इंसानों के साथ भी। इसलिए मैं ठीक हूँ। लेकिन फिर जब बॉट ने
00:05:36खाता संख्या की बात उठाई, तो चूंकि मुझे नहीं पता कि वह क्या है, मैं फिर से उलझन में पड़ गया। लेकिन मैं ढलने योग्य हूँ, मैं खोज सकता हूँ,
00:05:44मैं इसे ढूंढ सकता हूँ। तो मैंने नंबर ढूंढ लिया, उसे पढ़ना शुरू किया, लेकिन STT ने शब्द इकाई
00:05:52को सही ढंग से नहीं पहचाना। तो उसने मेरी बात काट दी और अंततः उसने मेरी बात के ऊपर बोलना शुरू कर दिया, जिससे मैं बहुत चिढ़ गया।
00:06:06और फिर जब उसने मुझसे वही जानकारी दोहराने के लिए कहा, तो यह स्पष्ट हो गया
00:06:14कि बॉट मेरे साथ मानसिक मॉडल का तालमेल नहीं रख पा रहा है। और बहुत ही अशिष्टता से, उसने
00:06:22बातचीत के जरिए स्पष्टीकरण मांगने की कोशिश भी नहीं की, जो कि इंसानों की एक सामान्य रणनीति है। इसलिए मैं अब इस स्थिति से नहीं निपटना चाहता,
00:06:28इसलिए मैं कहता हूँ कि क्या मैं किसी व्यक्ति से बात कर सकता हूँ? तो चलिए फिर से इस ढाँचे पर नज़र डालते हैं। तो ये
00:06:38भाषाई घटक हैं जो इंसान से इंसान की बातचीत में अपेक्षित होते हैं और अच्छी तरह से बनाए रखे जाते हैं।
00:06:47तो यहाँ सुनने के चैनल हैं — एक सुनने का चैनल और एक बोलने का चैनल — और इसमें अलग-अलग घटक हैं,
00:06:52जैसे आवाजें, शब्द, बातचीत और मानसिक मॉडल। तो पहला घटक यह है कि क्या बॉट उपयोगकर्ता की
00:06:59बात को अच्छी तरह पहचानता है? और ये सभी तकनीकी शब्द इसी के अंतर्गत आएंगे। और फिर यह
00:07:09दूसरा घटक होगा, जो सुनने के चैनल में शब्द हैं: क्या बॉट उपयोगकर्ता के शब्दों को समझता है?
00:07:17और फिर तीसरा घटक यह है कि क्या बॉट अपनी बारी के सही समय तक इंतजार करता है? यह सुनने के चैनल की बातचीत के बारे में होगा।
00:07:28और फिर अंतिम भाग मानसिक मॉडल है: क्या बॉट सुनने के भाग में उपयोगकर्ता की मंशा को समझता है?
00:07:38और फिर हम बोलने वाले चैनल पर भी जा सकते हैं: तो यह आवाज के उच्चारण के बारे में होगा
00:07:43और साथ ही क्या बॉट उन शब्दों को समझता है जो उपयोगकर्ता बोल रहे हैं? क्या बॉट ऐसे शब्द चुनता है जिन्हें उपयोगकर्ता समझ सके?
00:07:53और बातचीत वाले हिस्से में, क्या बॉट सही समय पर बोलता है? और अंत में, क्या बॉट उस
00:08:01जानकारी के साथ बोलता है जिसकी वास्तव में उपयोगकर्ता को आवश्यकता है?
00:08:05तो यहाँ इंजीनियरिंग या भाषाविज्ञान या संज्ञानात्मक विज्ञान के बहुत सारे शब्द हैं जो यहाँ मौजूद हैं।
00:08:13तो अब आप देख सकते हैं कि इन सभी का इस भाषाई ढाँचे में अपना सही स्थान है।
00:08:23और महत्वपूर्ण बात यह है कि ये घटक एक-दूसरे पर निर्भर हैं, न कि एक-दूसरे से अलग या स्वतंत्र।
00:08:30वे एक-दूसरे पर निर्भर हैं और एक कतार में जुड़े हैं। इसलिए जब आप ध्वनियों के स्तर पर काम करना चाहते हैं,
00:08:36तो आपको शब्दों के स्तर के बारे में सोचना होगा, और जब आप इन ध्वनियों और शब्दों के बारे में बेहतर काम करना चाहते हैं,
00:08:43तो आपको बातचीत का भी ध्यान रखना होगा — जैसे बारी लेने का समय या बारी की पहचान करना।
00:08:50और अंत में, आप कार्य को सफलतापूर्वक पूरा करना चाहते हैं, जो कि इस मानसिक मॉडल परत का लक्ष्य है; इसके लिए आपके पास ये सभी होने चाहिए।
00:09:02इनमें से किसी भी घटक के बिना, आपका वॉइस एजेंट विफल हो जाएगा।
00:09:09और अंत में, इसे अच्छी तरह से संरेखित होना चाहिए; इन सभी को आपस में अच्छी तरह से तालमेल में होना चाहिए।
00:09:17और इसके अतिरिक्त, आपको यह ध्यान में रखना होगा कि यह सब एक समयावधि (timeline) पर हो रहा है।
00:09:26मेरे कहने का मतलब यह है कि इसे पृष्ठभूमि में ट्रैक किया जाता है, चैट की तरह नहीं। चैट में आप देखते हैं कि क्या कहा गया था
00:09:34टेक्स्ट के रूप में, लेकिन वॉइस एजेंट के अनुभव में, आप कुछ कहते हैं और बॉट कुछ कहता है, और बातचीत आगे-पीछे चलती है।
00:09:45और फिर इन सभी साउंड वेवफॉर्म्स को देखिए, हवा में कंपन के माध्यम से जो होता है, वे सब गायब हो जाते हैं।
00:09:53और केवल उपयोगकर्ता का मानसिक मॉडल ही बचता है, और वही मायने रखता है।
00:10:00इसलिए ध्वनियाँ, शब्द और बातचीत बोलते ही गायब हो जाते हैं,
00:10:04लेकिन मानसिक मॉडल आगे बढ़ता है और समय के साथ विकसित होता है।
00:10:09इसलिए आपको इसी चीज़ को
00:10:12उपयोगकर्ता की संतुष्टि के लिए लक्षित करना होगा।
00:10:16और फिर हम क्या कर सकते हैं
00:10:19ताकि बॉट उपयोगकर्ता के मानकों पर खरा उतर सके?
00:10:25तो हम जो कर सकते हैं उसमें बेशक अच्छे ASR मॉडल या कॉन्फ़िगरेशन चुनना और कुछ पोस्ट-प्रोसेसिंग करना शामिल होगा,
00:10:34अच्छे TTS मॉडल, कॉन्फ़िगरेशन चुनना और प्री-प्रोसेसिंग करना,
00:10:38और उस शब्दावली को ध्यान से चुनना जो बॉट और उपयोगकर्ता के बीच साझा की जा सकती है,
00:10:46और बारी-दर-बारी पहचान की लेटेंसी और बारी लेने का सही प्रबंधन करना।
00:10:52और बहुत महत्वपूर्ण बात यह है कि यह बहुत अच्छा होगा यदि हम भावनाओं की सही पहचान और उन्हें संभाल सकें,
00:10:59और संदर्भ को बनाए रख सकें — और संदर्भ से मेरा मतलब इन सभी के संदर्भ से है।
00:11:07और महत्वपूर्ण बात यह है कि इसे गतिशील (dynamic) होना चाहिए क्योंकि पूरी कॉल के दौरान चीज़ें हमेशा बदलती रहती हैं।
00:11:16इसलिए हमें समय रेखा के साथ-साथ इसका प्रबंधन गतिशील रूप से करना होगा,
00:11:21विभिन्न प्रकार के लोगों के लिए।
00:11:24इसलिए बच्चों या इस तरह के अलग-अलग लोगों की अलग-अलग अपेक्षाएं होंगी जिन्हें हमें पूरा करना होगा,
00:11:32न केवल तब जब वे खुश हों, बल्कि तब भी जब वे खुश न हों।
00:11:36तो केवल तभी आप वॉइस AI के एक गतिशील और वास्तव में स्केलेबल आर्केस्ट्रेशन को अपना सकते हैं।
00:11:42इसलिए यह करना बहुत कठिन काम है।
00:11:48हम हमेशा कहते हैं कि आवाज संचार का सबसे स्वाभाविक तरीका है, लेकिन वास्तव में यह आसान नहीं है।
00:11:54पर्दे के पीछे, यह सब इस भाषाई तालमेल (linguistic orchestration) की बदौलत है।
00:11:59जब आपका बॉट इसमें अच्छा नहीं होता, तो यह एक बेहद विनाशकारी विफलता होती है
00:12:07इसलिए इस भाषाई ढाँचे पर ध्यान देने के कई व्यावसायिक प्रभाव होंगे क्योंकि तब आप
00:12:17उपयोगकर्ता की निराशा, कार्य की विफलता, लाइव एजेंट को कॉल ट्रांसफर, अधूरी कॉल्स या अदृश्य विफलताओं को कम कर सकते हैं।
00:12:28तो ServiceNow में हमने eva bench नामक एक अच्छा एंड-टू-एंड बेंचमार्क बनाया है, ताकि आप अपने वॉइस एजेंट की स्थिति का परीक्षण करने के लिए इसका उपयोग कर सकें।
00:12:43मुख्य बातें
00:12:45तो वॉइस AI एक संयुक्त गतिविधि है
00:12:49बॉट और उपयोगकर्ता के बीच, केवल एक पाइपलाइन नहीं।
00:12:54और हमें वास्तविक समय में कई परतों पर उपयोगकर्ताओं की आवश्यकताओं को पूरा करना चाहिए।
00:12:59ऐसा नहीं है कि मैंने आज आपको कोई पक्का समाधान दिया है, क्योंकि ऐसा कुछ नहीं होता।
00:13:04यह बस ऐसा है कि समाधान आपके और आपके सिस्टम के भीतर है।
00:13:10लेकिन आज मैंने आपको जो दिया है वह भाषाई ढाँचा है जिसका आप उपयोग कर सकते हैं
00:13:16अपने सिस्टम का निदान करने और अपने सिस्टम का निर्माण करने के लिए।
00:13:21आप eva को आजमा सकते हैं, लेकिन आप भाषाविज्ञान भी सीख सकते हैं और भाषाविदों को काम पर रख सकते हैं।
00:13:28एक और बात जो मैं आपको याद दिलाना चाहता हूँ वह यह है कि
00:13:31व्यावसायिक प्रभाव ही भाषाई प्रभाव हैं और इसके विपरीत भी,
00:13:35इस वॉइस AI क्षेत्र में।
00:13:37क्योंकि आवाज मूलभूत रूप से एक भाषाई, बहुत ही मानवीय और संज्ञानात्मक अनुभव है।
00:13:45मैं आपसे एक दीर्घकालिक प्रश्न पूछना चाहूँगा।
00:13:50वक्ता खुद को ढाल लेते हैं, इसलिए मुझे पूरा यकीन है कि इस बातचीत में, आप लोगों के साथ मेरी इस बात में
00:13:59आपने मेरे बारे में, मेरी बोलने की शैली के बारे में कुछ सीखा होगा कि मैं किस तरह के लहजे में बोलता हूँ,
00:14:05मैं किस तरह के शब्दों का इस्तेमाल कर रहा हूँ। इसलिए अगली बार जब मैं आप लोगों से व्यक्तिगत रूप से मिलूँगा, तो आपको मुझसे बात करने में अधिक आसानी महसूस होगी
00:14:12क्योंकि आपने मुझ पर ध्यान दिया है, सही बात है ना? तो वक्ता हमेशा खुद को ढालते रहते हैं। इसलिए उपयोगकर्ता
00:14:18पूरी कॉल के दौरान आपके वॉइस एजेंट के अनुकूल ढल जाएगा। तो क्या आपका सिस्टम उनके लिए तैयार है ताकि वे
00:14:27अगली बार आपके वॉइस एजेंट का और बेहतर उपयोग कर सकें?
00:14:31और भाषाएँ हमेशा बदलती रहती हैं। तो क्या आपका वॉइस एजेंट एक साल या यहाँ तक कि छह महीने में भाषा परिवर्तन के लिए तैयार है?
00:14:44क्या आपका वॉइस एजेंट अगली बार अधिक बेहतर होगा? तो आपका धन्यवाद।
00:14:57तो आपका बहुत-बहुत धन्यवाद।
00:14:57तो आप सभी का धन्यवाद।
00:14:57तो धन्यवाद।
00:15:04धन्यवाद।

Key Takeaway

वॉइस AI केवल एक तकनीकी पाइपलाइन नहीं बल्कि एक भाषाई और संज्ञानात्मक संयुक्त गतिविधि है, जिसे सफल बनाने के लिए ASR, TTS और टर्न-टेकिंग का मानसिक मॉडल के साथ वास्तविक समय में समन्वय आवश्यक है।

Highlights

  • मानव संचार एक संयुक्त गतिविधि है, जिसके तहत वक्ता और श्रोता लगातार अपने मानसिक मॉडल को अपडेट करते हैं।

  • ध्वनियां, शब्द और बातचीत बोलते ही गायब हो जाते हैं, केवल उपयोगकर्ता का मानसिक मॉडल ही समय के साथ विकसित होता है।

  • एआई वॉइस एजेंट में ASR, TTS, शब्दावली और टर्न-टेकिंग लेटेंसी की गतिशील मॉडलिंग के बिना विफलता की संभावना अधिक होती है।

  • भाषाविज्ञान के ढाँचे पर ध्यान देने से लाइव एजेंट को कॉल ट्रांसफर, अधूरी कॉल्स और उपयोगकर्ता की निराशा में कमी आती है।

  • ServiceNow ने वॉइस एजेंट्स की स्थिति का एंड-टू-एंड परीक्षण करने के लिए eva bench नामक बेंचमार्क तैयार किया है।

Timeline

वर्तमान वॉइस AI की विफलताएं और व्यावहारिक उदाहरण

  • वॉइस एजेंट अक्सर उच्चारण और वर्तनी की सूक्ष्मताओं को पहचानने में विफल रहते हैं।
  • अकाउट नंबर या जटिल जानकारी पढ़ते समय बॉट उपयोगकर्ता को बीच में ही टोक देते हैं।
  • बातचीत में बार-बार विफलता होने पर उपयोगकर्ता मानव एजेंट से बात करना पसंद करते हैं।

नाम की स्पेलिंग M-I-D-A-M बताते समय STT और TTS प्रणाली इसे M-I-D-A-N समझकर गलत उच्चारण करती है। खाता संख्या जैसे अपरिचित नंबर पढ़ते समय जब उपयोगकर्ता रुकता है, तो बॉट बीच में बोलकर रिकॉर्ड न मिलने की बात कहता है। संवाद स्पष्ट करने के प्रयास के बिना बार-बार दोहराने का अनुरोध उपयोगकर्ता में चिड़चिड़ाहट पैदा करता है, जिससे वह कॉल ट्रांसफर की मांग करता है।

संयुक्त गतिविधि के रूप में मानव और एआई संचार

  • मानव संचार दो पक्षों के बीच एक सतत संयुक्त गतिविधि है।
  • बातचीत के दौरान दोनों पक्ष लगातार एक-दूसरे के मानसिक मॉडल को संसाधित और अपडेट करते हैं।
  • इंसान हजारों वर्षों के विकास के कारण बॉट से भी इसी तरह की संयुक्त बातचीत की अपेक्षा करते हैं।

सुनने और बोलने के दोहरे चैनलों के माध्यम से विचारों का आदान-प्रदान होता है। जब वॉइस एजेंट केवल अंग्रेजी-केंद्रित उच्चारण नियमों का पालन करता है या सही समय पर स्पष्टीकरण नहीं मांगता, तो मानसिक मॉडल का तालमेल बिगड़ जाता है। इंसान बातचीत के दौरान एक-दूसरे की क्षमता के अनुसार ढलते हैं, इसलिए एआई एजेंट से भी यही उम्मीद की जाती है।

वॉइस एजेंट का भाषाई ढांचा और उसके घटक

  • ध्वनियां, शब्द, बातचीत और मानसिक मॉडल भाषाई ढाँचे के मुख्य परस्पर निर्भर घटक हैं।
  • ध्वनि तरंगे और बोले गए शब्द हवा में गायब हो जाते हैं, केवल मानसिक मॉडल ही शेष रहता है।
  • कार्य की सफलता के लिए सुनने और बोलने वाले दोनों चैनलों का सही तालमेल होना अनिवार्य है।

शब्दावली, टर्न-टेकिंग लेटेंसी और मंशा की पहचान एक ही श्रृंखला में जुड़े हुए हैं। केवल एक घटक पर काम करने से प्रणाली सफल नहीं होती; ध्वनियों के स्तर से लेकर मानसिक मॉडल तक सभी का संरेखण जरूरी है। बातचीत समाप्त होने के बाद केवल उपयोगकर्ता का मानसिक मॉडल ही आगे बढ़ता है, इसलिए संतुष्टि का मुख्य लक्ष्य वही होना चाहिए।

गतिशील ऑर्केस्ट्रेशन और व्यावसायिक प्रभाव

  • विभिन्न प्रकार के उपयोगकर्ताओं और परिस्थितियों के लिए प्रणाली को गतिशील रूप से प्रबंधन करना होता है।
  • भाषाई तालमेल की कमी से कार्य विफलता, अधूरी कॉल्स और अदृश्य विफलताएं बढ़ती हैं।
  • ServiceNow द्वारा विकसित eva bench वॉइस एजेंट के प्रदर्शन का सटीक निदान करता है।

समय रेखा के साथ-साथ ASR/TTS मॉडल, शब्दावली और भावनाओं की पहचान को वास्तविक समय में समायोजित करना पड़ता है। भाषाएं और बोलने की शैलियां समय के साथ बदलती रहती हैं, जिससे एजेंट को भी लगातार अनुकूल होना पड़ता है। भाषाई प्रभाव सीधे तौर पर व्यावसायिक परिणामों को प्रभावित करते हैं, जिससे लाइव एजेंट पर निर्भरता कम होती है।

Community Posts

No posts yet. Be the first to write about this video!

Write about this video