أبحاث نموذج تحويل الكلام إلى كلام في Google DeepMind — فاليريا وو فون وتوم أويانغ، Google DeepMind

AAI Engineer
Computing/SoftwareConsumer Electronics

Transcript

00:00:00مع عدم وجود أي ضوضاء كما تعلم في بيئة مغلقة، بل تحدث أثناء التنقل في القطار أو
00:00:04أثناء التنزه، وهذه هي نوعية التجربة التي نريد تسهيلها باستخدام نموذج
00:00:08الكلام إلى كلام. وأخيراً، هناك أمر آخر نحن متحمسون له حقاً وهو ليس فقط الإخراج الصوتي بل أيضاً
00:00:15الإخراج متعدد الوسائط، فنحن نؤمن بأن حدود محادثات الذكاء الاصطناعي العام الحقيقية
00:00:20ستتطلب أيضاً حضوراً مرئياً، لذا كنا متحمسين لإطلاق أول عرض تجريبي لنا مع سيتي إن كلاود
00:00:26والذي يدعم صور رمزية مخصصة في الوقت الفعلي، ويمكنك تخصيص أي شيء بدءاً من
00:00:33شخص بشري شديد الواقعية وحتى مظهر كرتوني وكل ما بينهما، وبدعم من نفس
00:00:38نموذج الكلام إلى كلام الذي عرضناه، فإنه يسمح بالحصول على مزامنة شفاه متعددة اللغات ومنخفضة التأخير
00:00:43ومحادثة مستمرة وسلسة إلى حد ما تتمتع بحضور مرئى، لذا دعوني
00:00:48أعرض عليكم عرضاً تجريبياً يجمع أيضاً مخططنا البياني معاً، وما نحن متحمسون له في كل هذا هو
00:00:54تذكيري بصندوق تمويل الكلية الخاص بابنتي، كيف يسير تقدمنا في ذلك؟
00:01:00الأمور تسير بشكل جيد يا جاكسون، لقد حددت أيضاً فرصة جديدة قد تووصلك إلى هناك بشكل أسرع
00:01:06أوه، وأستطيع أن أرى أن ليزا قد انضمت إليكم للتو، أهلاً ليزا، لا بد أنها متحمسة جداً بقبولها في الكلية
00:01:12تهانينا، إنه لأمر رائع أن ترى أهداف ادخارك تتحقق على أرض الواقع
00:01:16ممتاز، هذه أخبار جيدة، أنا دائماً أمزح بأن صوت المستخدم باللغة الإسبانية أسوأ من صوت نموذج
00:01:34التحدث، ولكن أمم هذا لنوضح كيف أن مخططنا البياني الذي يجمع بين
00:01:40تعدد الوسائط دخولاً وخروجاً، واستدعاء الأدوات لسحب الأمثلة ذات الصلة من المستخدم
00:01:45وأيضاً سلاسة المحادثة تبدأ شيئاً فشيئاً في الاندماج معاً في هذه الأنواع
00:01:50من العروض التجريبية التي نحن متحمسون لمواصلة دفع حدودها، لذا مع هذه الفكرة الختامية أظن أن آخر
00:01:57فكرة لدينا بالنسبة لك هي أننا نؤمن بأن الذكاء الاصطناعي العام لن يتم الكتابة به بل سيتم
00:02:01التحدث به، ولكي يتم التحدث به هناك الكثير من الأشياء التي يجب أن تعمل معاً في نموذج واحد
00:02:06قابل للتوجيه ومتعدد الاستخدامات يتيح للمستخدم التبديل بين جميع أنواع أوضاع المحادثة
00:02:12التي ننظر إليها، بدءاً من الترجمة إلى اتخاذ إجراءات، إلى العصف الذهني، إلى الاستطراد، ونحن
00:02:17نؤمن حقاً بقوة هذه النماذج من كلام إلى كلام لتحقيق هذا التبديل السلس
00:02:22لذا نحن متحمسون لدفع الحدود في ذلك، فإذا كنت متحمسًا أو تريد معرفة المزيد
00:02:26فمن فضلك تعال وتحدث معنا وشكراً جزيلاً لحضوركم
00:02:46أنت
00:02:56شكراً لك.

Key Takeaway

يعتمد مستقبل الذكاء الاصطناعي العام على نماذج الكلام إلى كلام متعددة الوسائط التي توفر تبديلاً سلساً بين أوضاع المحادثة المختلفة.

Highlights

  • يدعم نموذج الكلام إلى كلام بيئات الاستخدام المتنوعة خارج المساحات المغلقة مثل أثناء التنقل أو التنزه.

  • يشتمل العرض التجريبي مع سيتي إن كلاود على صور رمزية مخصصة في الوقت الفعلي تتراوح بين المظهر البشري والكرتوني.

  • يتيح نموذج الكلام إلى كلام مزامنة شفاه متعددة اللغات ومنخفضة التأخير لتجربة محادثة مستمرة.

  • يعتمد النظام على مدخلات ومخرجات متعددة الوسائط واستدعاء الأدوات لسحب البيانات ذات الصلة للمستخدم.

  • يجمع النموذج القابل للتوجيه بين قدرات متعددة تشمل الترجمة واتخاذ الإجراءات والعصف الذهني.

Timeline

تطوير تجارب الكلام إلى كلام ودعم الوسائط المتعددة

  • يستهدف النموذج ظروف الاستخدام اليومية أثناء التنقل في القطار أو التنزه خارج البيئات المغلقة.
  • تتجاوز القدرات الجديدة الإخراج الصوتي البسيط لتشمل الحضور المرئي متعدد الوسائط.
  • يدعم العرض التجريبي مع سيتي إن كلاود صوراً رمزية مخصصة في الوقت الفعلي تتراوح من الواقعية إلى الكرتونية.

تسعى النماذج الجديدة لتوفير تجربة محادثة طبيعية في أي مكان دون الحاجة لبيئات هادئة ومغلقة. يتطلب بناء محادثات ذكاء اصطناعي عام دقيقة حضوراً مرئياً يتكامل مع الصوت. يتيح التعاون مع سيتي إن كلاود توفير صور رمزية مخصصة تضمن مزامنة شفاه متعددة اللغات ومنخفضة التأخير مع استمرار المحادثة بسلاسة.

التكامل التقني وآفاق النماذج المستقبلية

  • يجمع المخطط البياني للنموذج بين المدخلات والمخرجات متعددة الوسائط واستدعاء الأدوات لجلب الأمثلة.
  • يتم بناء الذكاء الاصطناعي العام عبر التحدث بدلاً من الكتابة وحدها لضمان التفاعل الطبيعي.
  • يتيح النموذج القابل للتوجيه والمتعدد الاستخدامات للمستخدمين التبديل السلس بين الترجمة واتخاذ الإجراءات والعصف الذهني.

تتكامل التقنيات المختلفة مثل استدعاء الأدوات ومعالجة الوسائط المتعددة داخل نظام واحد لتقديم استجابات دقيقة ومخصصة للمستخدمين. يتطلب الانتقال إلى الذكاء الاصطناعي القائم على التحدث تطوير نماذج متعددة الاستخدامات تخدم أغراضاً متنوعة كالعصف الذهني والترجمة. تدعم هذه الابتكارات استمرار توسيع حدود تفاعل الإنسان مع الأنظمة الذكية بطرق جديدة كلياً.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video