Google DeepMind में स्पीच-टू-स्पीच मॉडल अनुसंधान — वैलेरिया वू फों और टॉम ओउयांग, Google DeepMind
AAI Engineer
Computing/SoftwareConsumer Electronics
Transcript
00:00:00बिना किसी शोरगुल के, जानते हैं, एक बंद वातावरण में, ये सब चलते-फिरते, ट्रेन में,
00:00:04सैर पर जाते समय होते हैं, और हम स्पीच-टू-स्पीच
00:00:08मॉडल के साथ इसी तरह के अनुभव प्रदान करना चाहते हैं। अंत में, एक और चीज़ जिसके बारे में हम वास्तव में उत्साहित हैं, वह न केवल आवाज़ आउटपुट है बल्कि मल्टीमॉडल
00:00:15आउटपुट भी है। हमारा मानना है कि, आप जानते हैं, सच्ची AGI संवादात्मक सीमा के लिए
00:00:20दृश्य उपस्थिति की भी आवश्यकता होगी, इसलिए हम क्लाउड नेक्स्ट में सिटी के साथ अपना पहला तरह का पायलट डेमो लॉन्च करने के लिए उत्साहित थे
00:00:26जो अनुकूलित वास्तविक समय के अवतारों का समर्थन करता है और आप किसी भी चीज़ को व्यक्तिगत बना सकते हैं जैसे कि
00:00:33अति-यथार्थवादी इंसान से लेकर कार्टून रूप और बीच की हर चीज़, और उसी द्वारा संचालित
00:00:38स्पीच-टू-स्पीच मॉडल जिसे हमने दिखाया है, यह कम विलंबता वाली बहुभाषी लिप-सिंकिंग की अनुमति देता है
00:00:43और वास्तव में एक तरह से चल रही, धाराप्रवाह बातचीत जिसमें दृश्य उपस्थिति है, तो आइए
00:00:48मैं आपको एक ऐसा डेमो दिखाता हूँ जो हमारे वेन आरेख को भी एक साथ लाता है और इन सबके बारे में हम जिस बात से उत्साहित हैं, वह यह है
00:00:54मुझे मेरी बेटी के कॉलेज फंड की याद दिला रहा है, हम उस पर कैसे ट्रैक कर रहे हैं
00:01:00आप अच्छा कर रहे हैं जैक्सन, मैंने एक नया अवसर भी पहचाना है जो आपको वहाँ और भी जल्दी पहुँचा सकता है
00:01:06ओह और मैं देख सकता हूँ कि लीज़ा अभी आपके साथ जुड़ी है, नमस्ते लीज़ा, वह अपने कॉलेज में प्रवेश को लेकर बहुत उत्साहित होगी
00:01:12बधाई हो, आपकी बचत के लक्ष्यों को जीवन में आते देखना अद्भुत है
00:01:16उत्कृष्ट, यह अच्छी खबर है। मैं हमेशा मज़ाक में कहता हूँ कि स्पेनिश में उपयोगकर्ता का ऑडियो ऑडियो मॉडल की तुलना में खराब है
00:01:34वापस बोलने से, लेकिन यह दिखाने के लिए है कि कैसे हमारा संयोजन का वेन आरेख, आप जानते हैं
00:01:40इन और आउट मल्टीमोडेलिटी, उपयोगकर्ता से प्रासंगिक उदाहरण खींचने के लिए टूल कॉलिंग
00:01:45और इसके साथ संवादात्मक तरलता धीरे-धीरे इन प्रकारों में एक साथ आने लगी है
00:01:50उन डेमो में से जिनके बारे में हम सीमा को आगे बढ़ाते रहने के लिए उत्साहित हैं, तो इस विदाई विचार के साथ मुझे लगता है आखिरी
00:01:57तरह का विचार जो हमारे पास आपके लिए है वह यह है कि हमारा मानना है कि AGI टाइप नहीं किया जाएगा, बल्कि यह होगा
00:02:01बोला जाएगा, और इसके बोले जाने के लिए बहुत सारी चीजें हैं जिन्हें एक ही स्थान पर एक साथ काम करने की आवश्यकता है
00:02:06प्रॉम्प्ट करने योग्य बहुमुखी मॉडल जो उपयोगकर्ता को सभी प्रकार के वार्तालाप मोड के बीच स्विच करने की अनुमति देता है
00:02:12जिसे हम देख रहे हैं, अनुवाद से लेकर कार्रवाई करने, विचार-मंथन करने और बातूनी होने तक और हम
00:02:17उस तरह की निर्बाध स्विचिंग को प्राप्त करने के लिए इन स्पीच-टू-स्पीच मॉडल की शक्ति में वास्तव में विश्वास करते हैं
00:02:22इसलिए हम उस पर सीमा को आगे बढ़ाने के लिए उत्साहित हैं, इसलिए यदि आप उत्साहित हैं या अधिक जानना चाहते हैं
00:02:26कृपया हमसे बात करने आएं और आने के लिए बहुत-बहुत धन्यवाद
00:02:46आप
00:02:56शुक्रिया।
Community Posts
No posts yet. Be the first to write about this video!
Write about this video