Penelitian Model Speech-to-Speech di Google DeepMind — Valeria Wu Fon & Tom Ouyang, Google DeepMind
AAI Engineer
컴퓨터/소프트웨어가전제품/카메라
스크립트
00:00:00dengan tanpa kebisingan di lingkungan yang tertutup hal ini terjadi saat bepergian di kereta saat
00:00:04anda berjalan-jalan dan itulah jenis pengalaman yang ingin kami fasilitasi dengan model
00:00:08ucapan ke ucapan. Terakhir, hal lain yang sangat kami antusiaskan adalah bukan hanya keluaran suara tetapi juga
00:00:15keluaran multimodal. Kami percaya bahwa batas percakapan AGI yang sejati juga akan memerlukan
00:00:20kehadiran visual, jadi kami sangat bersemangat meluncurkan demo pilot pertama kami dengan Citi di Cloud Next
00:00:26yang mendukung avatar waktu nyata yang disesuaikan dan anda dapat mempersonalisasi apa saja mulai dari
00:00:33manusia yang sangat hiper-realistis hingga penampilan kartun dan segala hal di antaranya, dan didukung oleh model
00:00:38ucapan ke ucapan yang sama yang telah kami tunjukkan, ini memungkinkan sinkronisasi bibir multibahasa latensi rendah
00:00:43dan percakapan yang mengalir lancar yang memiliki kehadiran visual, jadi izinkan saya
00:00:48menunjukkan kepada anda demo yang juga menyatukan diagram venn kita, dan apa yang membuat kami antusias dari semua ini adalah
00:00:54mengingatkan saya pada dana kuliah putri saya, bagaimana perkembangan kita mengenai hal itu?
00:01:00Perkembangan anda bagus, Jackson. Saya juga telah mengidentifikasi peluang baru yang mungkin membawa anda ke sana lebih cepat.
00:01:06Oh, dan saya bisa melihat Lisa baru saja bergabung dengan anda. Hai Lisa, dia pasti sangat antusias dengan penerimaan kuliahnya.
00:01:12Selamat, sungguh luar biasa melihat tujuan tabungan anda terwujud.
00:01:16Bagus, itu berita bagus. Saya selalu bercanda bahwa audio pengguna dalam bahasa Spanyol lebih buruk daripada audio model yang berbicara kembali, tetapi um ini hanya untuk menunjukkan bagaimana diagram venn kita dalam menggabungkan
00:01:34multimodalitas masuk dan keluar, pemanggilan alat untuk menarik contoh yang relevan dari pengguna
00:01:40serta kelancaran percakapan dengan itnn perlahan-lahan mulai menyatu dalam jenis
00:01:45demo ini yang kami nantikan untuk terus mendorong batas-batasnya um jadi dengan pemikiran penutup ini, saya rasa pemikiran terakhir
00:01:50yang kami miliki untuk anda adalah bahwa kami percaya AGI tidak akan diketik melainkan
00:01:57diucapkan, um dan agar dapat diucapkan, ada banyak hal yang perlu bekerja sama dalam satu
00:02:01model serbaguna yang dapat diberi perintah, yang memungkinkan pengguna untuk beralih di antara semua jenis mode percakapan
00:02:06yang kita lihat, mulai dari penerjemahan hingga mengambil tindakan, bertukar pikiran, hingga mengoceh, dan kami
00:02:12benar-benar percaya pada kekuatan model ucapan-ke-ucapan ini untuk mencapai peralihan yang mulus tersebut, um
00:02:17jadi kami sangat bersemangat untuk mendobrak batas dalam hal itu. Jadi jika anda antusias atau ingin tahu lebih banyak,
00:02:22silakan datang dan mengobrol dengan kami, dan terima kasih banyak telah datang.
00:02:26Terima kasih banyak.
00:02:46Anda
00:02:56Terima kasih.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기