Agen Suara Waktu Nyata dengan Kecerdasan Tingkat Lanjut — Bohan Li, EliseAI
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Nama saya Bo. Saya akan membawakan materi mengenai Agen Suara Real-Time dengan Frontier
00:00:18Intelligence. Kita akan membahas sedikit tentang bagaimana kami di
00:00:22Elise AI merancang kerangka kerja agen suara untuk menghasilkan suara real-time dengan
00:00:28tingkat kecerdasan frontier yang kita perlukan. Jadi sebelum saya mulai, saya ingin
00:00:36menarik beberapa kesamaan tentang mengapa kami memutuskan untuk memilih agen suara kaskade
00:00:42dan khususnya membandingkannya dengan mobil otonom yang dulu saya kerjakan
00:00:48sebelumnya. Jadi bagi saya, agen suara kaskade sangat masuk akal jika Anda melihatnya
00:00:53dari sudut pandang membaginya ke dalam persepsi, yang mana untuk mobil otonom
00:00:59itu adalah kotak pembatas, kamera, lidar. Untuk suara, itu akan menjadi
00:01:05transkripsi, pada dasarnya mengubah sinyal dari dunia nyata ini
00:01:09menjadi elemen data yang dapat diproses oleh model bahasa atau otak apa pun yang Anda gunakan.
00:01:17Yang kedua adalah tumpukan perencanaan yang cukup mudah dipahami.
00:01:23Di sinilah model bahasa akan mengambil masukan dari tahap persepsi dan menghasilkan
00:01:29keluaran yang ingin Anda keluarkan kembali ke dunia nyata. Dan akhirnya ada lapisan kontrol
00:01:36di mana dalam mengemudi sendiri, Anda akan mengambil lintasan yang dikeluarkan oleh perencana dan
00:01:43mengubahnya menjadi kontrol nyata untuk mengemudikan mobil. Di sini kita mengubah teks menjadi
00:01:50audio yang kita gunakan untuk mengekspresikan pikiran agen suara kita. Dan ya, jadi di sini saya akan membahas lebih mendalam
00:02:00masing-masing elemen ini dan kami telah membuat beberapa trik menarik di setiap area tersebut untuk
00:02:08meningkatkan kecepatan agen suara kami tanpa mengorbankan kecerdasannya.
00:02:13Jadi yang pertama adalah lapisan transkripsi. Jadi kami datang dengan konsep ini yang disebut seperti
00:02:19transkriber spekulatif streaming di mana secara efektif kita melapisi transkriber streaming cepat
00:02:24seperti flux di atas atau di bawah scribe v2 atau transkripsi batch yang akurat
00:02:33yang mengambil lebih banyak konteks. Ini sedikit lebih lambat tetapi akan memberi Anda deteksi yang lebih akurat.
00:02:39Jadi mari kita telusuri pengaturannya sekarang, dalam hal ini agen baru saja bertanya, memberikan
00:02:44bisakah Anda menuliskan nama dan tanggal lahir Anda, dan pengguna akan mengatakan ini dan kita akan melihat bagaimana kelanjutannya
00:02:49dari segi waktu. Jadi pertama kita akan mendapatkan deteksi cepat. Kita akan mendapatkannya dari
00:02:57lapisan streaming. Lapisan yang akurat, lapisan korektif tidak akan aktif karena teksnya sama.
00:03:05Kita akan mendapatkan beberapa deteksi teks streaming lagi dan dalam hal ini lapisan korektif sebenarnya
00:03:11dibatalkan karena kita mendapatkan teks baru, jadi konteks yang lebih banyak, audio yang lebih banyak akan mengalahkan yang akurat yang lama.
00:03:21Dan di sinilah koreksi pertama masuk. Karena lapisan scribe v2 memahami
00:03:27konteks pertanyaan, ia dapat memahami bahwa ini membahas tentang nama dan ini adalah tanggal lahir.
00:03:34Dan kemudian beberapa deteksi lagi. Ini hanya tanda baca. Kita tidak peduli.
00:03:37Dan pada akhirnya kita merilis teks ini ke agen.
00:03:44Dan beralih ke lapisan model bahasa. Di sini karena kita menggunakan LLM yang lambat namun
00:03:52LLM yang lambat namun cerdas ini, kita benar-benar ingin mengurangi jumlah bolak-balik, dan hal yang menyebabkan kita melakukan
00:03:58banyak inferensi adalah pemanggilan alat (tool calling). Jadi salah satu cara untuk menghilangkannya adalah dengan meminta agen latar belakang melakukan pemanggilan alat
00:04:05untuk Anda dan mendorong alat-alat tersebut kembali ke konteks agen utama sehingga ia berpikir
00:04:13bahwa ia membuat pemanggilan alat padahal sebenarnya tidak. Jadi ingat dari deteksi sebelumnya. Jadi apa yang akan terjadi adalah setiap deteksi ini akan memicu
00:04:26generasi awal dari agen dan kita tidak akan mengeluarkannya sampai kita mengonfirmasi bahwa
00:04:38pengguna telah selesai berbicara. Dalam hal ini pengguna mengatakan tentu. Agen tahu bahwa pengguna akan mengatakan hal lain.
00:04:45Pemanggilan alat latar belakang kita di sini yang akan membantu kita mencari nama dan tanggal lahir dari deteksi pengguna
00:04:51tidak aktif jadi tidak banyak yang terjadi di sana. Deteksi instan berikutnya masuk. Dikatakan bahwa itu masih belum benar-benar sebuah nama.
00:05:02Agen kita mengikuti alur dan melanjutkan di sana.
00:05:06Sekarang lebih banyak konteks yang kembali. Agen merasa seharusnya ada sebuah nama.
00:05:11Ia akan meminta untuk mengeja karena mungkin ia berpikir ada beberapa kesalahan transkripsi di sini.
00:05:16Masih belum ada nama atau tanggal lahir. Dan akhirnya ingat ini adalah deteksi instan akhir
00:05:22yang telah dikoreksi dari transkriber dari scribe v2.
00:05:27Di sini pembuatan agen yang penuh semangat yang dibuat tanpa pemanggilan alat apa pun akan dibatalkan
00:05:34karena agen latar belakang akhirnya dapat menemukan nama dan tanggal lahir yang dicarinya.
00:05:38Jadi ia akan memicu ulang dan sekarang agen benar-benar memiliki konteks yang dibutuhkannya.
00:05:45Dan Anda melihat di sini kita sedang melakukannya. Pemanggilan alat di sini sedikit
00:05:49memiliki kecerdasan di sana. Kita akan mengoreksi kesalahan transkripsi nama,
00:05:53melakukan pencocokan fonetik di sini.
00:05:57Dan ya, begitu kita memahami bahwa ini adalah akhir dari ucapan pengguna,
00:06:02kita akan mengeluarkannya. Jadi cukup standar.
00:06:06Baiklah dan lapisan berikutnya di sini adalah text-to-speech (teks-ke-suara). Jadi dengan text-to-speech tujuannya
00:06:12adalah mengambil apa yang dikatakan agen dan agen akan mengeluarkannya dalam bentuk
00:06:16streaming. Jadi kita harus menghasilkan audio secepat mungkin. Dan idealnya yang bisa Anda lakukan adalah
00:06:24sebelum agen bahkan selesai menghasilkan teks lengkap, Anda sudah bisa memutar audionya. Jadi ini menyembunyikan
00:06:31latensi penyelesaian pembuatan teks. Jadi saya akan memutar streaming
00:06:39keluaran agen streaming sekarang. Jadi dimulai dengan U. Dan sebenarnya sebelum saya membahas lebih jauh ada
00:06:46konsep baru yang kita perkenalkan di sini yang disebut prefiks cache. Jadi prefiks cache akan
00:06:52melihat aliran agen dan melihat apakah kita sudah menghasilkan audio untuk urutan kata tersebut
00:07:02dari generasi sebelumnya atau mungkin generasi yang sama dalam panggilan ini juga.
00:07:10Jadi ia melihat kata U. Untuk prefiks cache ini kita tidak ingin
00:07:17langsung mendeteksi setiap kata. Kita akan menunggu beberapa kata lagi. Jadi setelah
00:07:24tiga kata, prefiks cache mendapati kecocokan pertamanya. Dan di sebelah kanan ini adalah
00:07:31penyedia standar text-to-speech kita, Cartesia adalah mesin text-to-speech dengan dukungan WebSocket.
00:07:36Jadi kita mengalirkan agen melalui cache dan juga mengalirkannya melalui WebSocket.
00:07:45Lebih banyak token masuk, lebih banyak cache, lebih banyak pengiriman ke WebSocket. Tidak banyak yang perlu dikatakan di sini.
00:07:51Dan oke, sekarang kita mendapatkan hal unik pertama yaitu kita menemukan token yang benar-benar
00:07:59menyebabkan cache miss (tidak cocok). Masuk akal jika kita melakukan cache pada generasi sebelumnya. Anda mengatakan nama Anda
00:08:05adalah hal yang cukup umum, tetapi begitu kita menambahkan namanya, tiba-tiba itu akan menghasilkan cache miss.
00:08:12Pada titik ini kita benar-benar akan mengeluarkan audio yang di-cache. Jadi Anda mengatakan nama Anda adalah akan
00:08:19dipancarkan saat sisa teks streaming kembali. Jadi pada titik ini pengguna mendengarkan agen.
00:08:25Pengguna tidak begitu tahu apa yang terjadi. Bagi mereka itu hanya terlihat seperti waktu respons yang sangat cepat.
00:08:32Dan sekarang sisa teks mengalir. Dan pada titik ini kita sudah mengeluarkannya dari cache.
00:08:38Cache telah melakukan tugasnya. Sisanya bisa kita masukkan ke Cartesia. Dan di sinilah triknya
00:08:46di mana Cartesia telah melihat seluruh transkrip hingga titik ini. Bagi Cartesia, ia tidak tahu
00:08:56tentang keberadaan prefiks cache ini. Ia hanya akan menghasilkan kalimat lengkap ini dengan
00:09:01prosodi alami standar. Tapi yang kita lakukan adalah ketika generasi kembali karena kita sudah memutar
00:09:08audio di sini, kita sebenarnya dapat menekan audio dari Cartesia di sini dan hanya memutar bagian yang tersisa.
00:09:13Jadi pengguna mungkin akan merasakan sedikit gangguan kecil. Tahu kan, saya akan memutar audio nanti dan Anda
00:09:21tahu bahwa Anda mungkin tidak akan dapat menyadarinya. Dan secara efektif kita mengambil ini dan
00:09:28mengambil bagian ini dan mengeluarkannya langsung setelah audio ini selesai diputar. Jadi terlihat mulus bagi pengguna.
00:09:35Dan ya, jadi saya rasa pada titik ini ada banyak detail teknis. Saya pikir cara terbaik adalah
00:09:43hanya memutar panggilan dan melihat ini beraksi. Jadi di sini saya merekam panggilan dan mari kita dengar apa yang terjadi.
00:09:53Jadi di sini kami akan berbicara dengan kalian. Ini Bo, OB-GYN. Elise berbicara.
00:09:59Halo, sepertinya saya hamil dan saya ingin menjadwalkan USG untuk memastikannya.
00:10:03Itu berita yang menarik. Bisakah Anda sebutkan nama dan tanggal lahir Anda?
00:10:08Tentu, ini Elise trial. Tanggal lahir, 2303.
00:10:15Terima kasih. Apakah Anda pasien baru kami?
00:10:24Ya. Selamat datang di Bo, OB-GYN. Bisakah saya mengirimkan tautan melalui teks untuk mengunggah informasi asuransi Anda?
00:10:34Tentu. Oke. Terkirim. Beritahu saya jika Anda sudah menerimanya.
00:10:48Saya telah menerima informasi asuransi Anda. Jadwal paling awal yang saya miliki adalah hari Kamis,
00:10:532 Juli pukul 10 pagi. Sebenarnya, beri saya waktu sebentar. Biarkan saya memeriksa kalender saya.
00:11:01Tentu. Santai saja. Apakah Anda memiliki waktu untuk minggu depan?
00:11:09Untuk minggu depan, saya dapat menawarkan USG dengan Dr. Avery Stone di North Clinic pada hari Selasa,
00:11:147 Juli pukul 2 siang atau 3 sore. Apakah salah satu dari waktu itu cocok untuk Anda?
00:11:20Ya, pukul 2 siang bisa. Bagus. Janji temu Anda telah dipesan. Kami menantikan kehadiran Anda saat itu.
00:11:29Terima kasih. Sampai jumpa. Baiklah. Ya, kurang lebih seperti itu.
00:11:35Ya, Anda bisa melihat -- semua streaming ini dan, tahukah Anda, banyak hal yang
00:11:43terjadi di latar belakang. Dan, ya, inilah yang benar-benar membuat agen suara menjadi menarik.
00:11:48Dan ada banyak upaya yang dapat dilakukan dalam kerangka kerja untuk benar-benar mendapatkan
00:11:55percakapan yang natural, itulah yang kita cari.
00:11:59Oke. Ya. Jadi, saya rasa secara singkat, di bagian akhir, saya ingin membahas sedikit
00:12:04tentang Elyse. Jadi, saya pikir Elyse, kantor pusat kami di New York, dan kita
00:12:09berusaha memperluas kehadiran kita di sini di Bay Area. Kita -- saya pikir ini mungkin gaya perusahaan yang berbeda
00:12:15yang dipikirkan orang ketika mereka memikirkan startup AI di San Francisco,
00:12:23di mana kita sebenarnya sangat fokus hanya pada membantu orang dan membantu orang di tempat yang mereka butuhkan,
00:12:31seperti di area kehidupan yang paling krusial. Kami bekerja di bidang perumahan, perawatan kesehatan, dan kami melakukannya dengan sangat
00:12:37baik, dan, tahukah Anda, di sini -- ada tautan di sini untuk bergabung dengan tim kami, dan akan -- kami
00:12:45akan memposting banyak hal di Twitter, jadi Anda juga dapat mengikuti kami di @Elyse.ai. Ya, sekian.
00:12:57Jadi, kita akan memposting sedikit lebih banyak di Twitter, dan kita akan memposting sedikit lebih banyak di Twitter.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기