Google DeepMind में स्पीच-टू-स्पीच मॉडल अनुसंधान — वैलेरिया वू फों और टॉम ओउयांग, Google DeepMind

AAI Engineer
Computing/SoftwareConsumer Electronics

Transcript

00:00:00बिना किसी शोरगुल के, जानते हैं, एक बंद वातावरण में, ये सब चलते-फिरते, ट्रेन में,
00:00:04सैर पर जाते समय होते हैं, और हम स्पीच-टू-स्पीच
00:00:08मॉडल के साथ इसी तरह के अनुभव प्रदान करना चाहते हैं। अंत में, एक और चीज़ जिसके बारे में हम वास्तव में उत्साहित हैं, वह न केवल आवाज़ आउटपुट है बल्कि मल्टीमॉडल
00:00:15आउटपुट भी है। हमारा मानना है कि, आप जानते हैं, सच्ची AGI संवादात्मक सीमा के लिए
00:00:20दृश्य उपस्थिति की भी आवश्यकता होगी, इसलिए हम क्लाउड नेक्स्ट में सिटी के साथ अपना पहला तरह का पायलट डेमो लॉन्च करने के लिए उत्साहित थे
00:00:26जो अनुकूलित वास्तविक समय के अवतारों का समर्थन करता है और आप किसी भी चीज़ को व्यक्तिगत बना सकते हैं जैसे कि
00:00:33अति-यथार्थवादी इंसान से लेकर कार्टून रूप और बीच की हर चीज़, और उसी द्वारा संचालित
00:00:38स्पीच-टू-स्पीच मॉडल जिसे हमने दिखाया है, यह कम विलंबता वाली बहुभाषी लिप-सिंकिंग की अनुमति देता है
00:00:43और वास्तव में एक तरह से चल रही, धाराप्रवाह बातचीत जिसमें दृश्य उपस्थिति है, तो आइए
00:00:48मैं आपको एक ऐसा डेमो दिखाता हूँ जो हमारे वेन आरेख को भी एक साथ लाता है और इन सबके बारे में हम जिस बात से उत्साहित हैं, वह यह है
00:00:54मुझे मेरी बेटी के कॉलेज फंड की याद दिला रहा है, हम उस पर कैसे ट्रैक कर रहे हैं
00:01:00आप अच्छा कर रहे हैं जैक्सन, मैंने एक नया अवसर भी पहचाना है जो आपको वहाँ और भी जल्दी पहुँचा सकता है
00:01:06ओह और मैं देख सकता हूँ कि लीज़ा अभी आपके साथ जुड़ी है, नमस्ते लीज़ा, वह अपने कॉलेज में प्रवेश को लेकर बहुत उत्साहित होगी
00:01:12बधाई हो, आपकी बचत के लक्ष्यों को जीवन में आते देखना अद्भुत है
00:01:16उत्कृष्ट, यह अच्छी खबर है। मैं हमेशा मज़ाक में कहता हूँ कि स्पेनिश में उपयोगकर्ता का ऑडियो ऑडियो मॉडल की तुलना में खराब है
00:01:34वापस बोलने से, लेकिन यह दिखाने के लिए है कि कैसे हमारा संयोजन का वेन आरेख, आप जानते हैं
00:01:40इन और आउट मल्टीमोडेलिटी, उपयोगकर्ता से प्रासंगिक उदाहरण खींचने के लिए टूल कॉलिंग
00:01:45और इसके साथ संवादात्मक तरलता धीरे-धीरे इन प्रकारों में एक साथ आने लगी है
00:01:50उन डेमो में से जिनके बारे में हम सीमा को आगे बढ़ाते रहने के लिए उत्साहित हैं, तो इस विदाई विचार के साथ मुझे लगता है आखिरी
00:01:57तरह का विचार जो हमारे पास आपके लिए है वह यह है कि हमारा मानना है कि AGI टाइप नहीं किया जाएगा, बल्कि यह होगा
00:02:01बोला जाएगा, और इसके बोले जाने के लिए बहुत सारी चीजें हैं जिन्हें एक ही स्थान पर एक साथ काम करने की आवश्यकता है
00:02:06प्रॉम्प्ट करने योग्य बहुमुखी मॉडल जो उपयोगकर्ता को सभी प्रकार के वार्तालाप मोड के बीच स्विच करने की अनुमति देता है
00:02:12जिसे हम देख रहे हैं, अनुवाद से लेकर कार्रवाई करने, विचार-मंथन करने और बातूनी होने तक और हम
00:02:17उस तरह की निर्बाध स्विचिंग को प्राप्त करने के लिए इन स्पीच-टू-स्पीच मॉडल की शक्ति में वास्तव में विश्वास करते हैं
00:02:22इसलिए हम उस पर सीमा को आगे बढ़ाने के लिए उत्साहित हैं, इसलिए यदि आप उत्साहित हैं या अधिक जानना चाहते हैं
00:02:26कृपया हमसे बात करने आएं और आने के लिए बहुत-बहुत धन्यवाद
00:02:46आप
00:02:56शुक्रिया।

Key Takeaway

स्पीच-टू-स्पीच मॉडल और वास्तविक समय के अवतारों के संयोजन से संवादात्मक सीमा में दृश्य उपस्थिति और बहुभाषी लिप-सिंकिंग प्राप्त होती है।

Highlights

  • स्पीच-टू-स्पीच मॉडल में दृश्य उपस्थिति और वास्तविक समय के अवतार शामिल हैं।

  • क्लाउड नेक्स्ट में सिटी के साथ पहले तरह के पायलट डेमो को लॉन्च किया गया।

  • यह तकनीक कम विलंबता वाली बहुभाषी लिप-सिंकिंग की अनुमति देती है।

  • AGI टाइप नहीं किया जाएगा बल्कि इसे बोला जाएगा।

Timeline

स्पीच-टू-स्पीच मॉडल और दृश्य उपस्थिति

  • स्पीच-टू-स्पीच मॉडल में आवाज़ के साथ मल्टीमॉडल आउटपुट शामिल हैं।
  • क्लाउड नेक्स्ट में सिटी के साथ अनुकूलित वास्तविक समय के अवतारों का पायलट डेमो लॉन्च किया गया।

बंद वातावरण या चलते-फिरते अनुभवों के लिए स्पीच-टू-स्पीच मॉडल तैयार किए गए हैं। दृश्य उपस्थिति के साथ अति-यथार्थवादी इंसान से लेकर कार्टून रूप तक को व्यक्तिगत बनाया जा सकता है। यह तकनीक कम विलंबता वाली बहुभाषी लिप-सिंकिंग और धाराप्रवाह बातचीत की अनुमति देती है।

मल्टीमोडेलिटी और संवादात्मक भविष्य

  • इन और आउट मल्टीमोडेलिटी और टूल कॉलिंग बातचीत को बेहतर बनाते हैं।
  • AGI को टाइप करने के बजाय बोला जाएगा जिसमें कई कार्य एक साथ काम करेंगे।

उपयोगकर्ता से प्रासंगिक उदाहरण खींचने के लिए टूल कॉलिंग का उपयोग किया जाता है। अनुवाद से लेकर कार्रवाई करने और विचार-मंथन तक सभी मोड के बीच निर्बाध स्विचिंग स्पीच-टू-स्पीच मॉडल की शक्ति से प्राप्त होती है।

Community Posts

No posts yet. Be the first to write about this video!

Write about this video