Google DeepMind में स्पीच-टू-स्पीच मॉडल अनुसंधान — वैलेरिया वू फों और टॉम ओउयांग, Google DeepMind
AAI Engineer
컴퓨터/소프트웨어가전제품/카메라
스크립트
00:00:00बिना किसी शोरगुल के, जानते हैं, एक बंद वातावरण में, ये सब चलते-फिरते, ट्रेन में,
00:00:04सैर पर जाते समय होते हैं, और हम स्पीच-टू-स्पीच
00:00:08मॉडल के साथ इसी तरह के अनुभव प्रदान करना चाहते हैं। अंत में, एक और चीज़ जिसके बारे में हम वास्तव में उत्साहित हैं, वह न केवल आवाज़ आउटपुट है बल्कि मल्टीमॉडल
00:00:15आउटपुट भी है। हमारा मानना है कि, आप जानते हैं, सच्ची AGI संवादात्मक सीमा के लिए
00:00:20दृश्य उपस्थिति की भी आवश्यकता होगी, इसलिए हम क्लाउड नेक्स्ट में सिटी के साथ अपना पहला तरह का पायलट डेमो लॉन्च करने के लिए उत्साहित थे
00:00:26जो अनुकूलित वास्तविक समय के अवतारों का समर्थन करता है और आप किसी भी चीज़ को व्यक्तिगत बना सकते हैं जैसे कि
00:00:33अति-यथार्थवादी इंसान से लेकर कार्टून रूप और बीच की हर चीज़, और उसी द्वारा संचालित
00:00:38स्पीच-टू-स्पीच मॉडल जिसे हमने दिखाया है, यह कम विलंबता वाली बहुभाषी लिप-सिंकिंग की अनुमति देता है
00:00:43और वास्तव में एक तरह से चल रही, धाराप्रवाह बातचीत जिसमें दृश्य उपस्थिति है, तो आइए
00:00:48मैं आपको एक ऐसा डेमो दिखाता हूँ जो हमारे वेन आरेख को भी एक साथ लाता है और इन सबके बारे में हम जिस बात से उत्साहित हैं, वह यह है
00:00:54मुझे मेरी बेटी के कॉलेज फंड की याद दिला रहा है, हम उस पर कैसे ट्रैक कर रहे हैं
00:01:00आप अच्छा कर रहे हैं जैक्सन, मैंने एक नया अवसर भी पहचाना है जो आपको वहाँ और भी जल्दी पहुँचा सकता है
00:01:06ओह और मैं देख सकता हूँ कि लीज़ा अभी आपके साथ जुड़ी है, नमस्ते लीज़ा, वह अपने कॉलेज में प्रवेश को लेकर बहुत उत्साहित होगी
00:01:12बधाई हो, आपकी बचत के लक्ष्यों को जीवन में आते देखना अद्भुत है
00:01:16उत्कृष्ट, यह अच्छी खबर है। मैं हमेशा मज़ाक में कहता हूँ कि स्पेनिश में उपयोगकर्ता का ऑडियो ऑडियो मॉडल की तुलना में खराब है
00:01:34वापस बोलने से, लेकिन यह दिखाने के लिए है कि कैसे हमारा संयोजन का वेन आरेख, आप जानते हैं
00:01:40इन और आउट मल्टीमोडेलिटी, उपयोगकर्ता से प्रासंगिक उदाहरण खींचने के लिए टूल कॉलिंग
00:01:45और इसके साथ संवादात्मक तरलता धीरे-धीरे इन प्रकारों में एक साथ आने लगी है
00:01:50उन डेमो में से जिनके बारे में हम सीमा को आगे बढ़ाते रहने के लिए उत्साहित हैं, तो इस विदाई विचार के साथ मुझे लगता है आखिरी
00:01:57तरह का विचार जो हमारे पास आपके लिए है वह यह है कि हमारा मानना है कि AGI टाइप नहीं किया जाएगा, बल्कि यह होगा
00:02:01बोला जाएगा, और इसके बोले जाने के लिए बहुत सारी चीजें हैं जिन्हें एक ही स्थान पर एक साथ काम करने की आवश्यकता है
00:02:06प्रॉम्प्ट करने योग्य बहुमुखी मॉडल जो उपयोगकर्ता को सभी प्रकार के वार्तालाप मोड के बीच स्विच करने की अनुमति देता है
00:02:12जिसे हम देख रहे हैं, अनुवाद से लेकर कार्रवाई करने, विचार-मंथन करने और बातूनी होने तक और हम
00:02:17उस तरह की निर्बाध स्विचिंग को प्राप्त करने के लिए इन स्पीच-टू-स्पीच मॉडल की शक्ति में वास्तव में विश्वास करते हैं
00:02:22इसलिए हम उस पर सीमा को आगे बढ़ाने के लिए उत्साहित हैं, इसलिए यदि आप उत्साहित हैं या अधिक जानना चाहते हैं
00:02:26कृपया हमसे बात करने आएं और आने के लिए बहुत-बहुत धन्यवाद
00:02:46आप
00:02:56शुक्रिया।
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기