Agen Suara Waktu Nyata dengan Kecerdasan Tingkat Lanjut — Bohan Li, EliseAI

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Nama saya Bo. Saya akan membawakan materi mengenai Agen Suara Real-Time dengan Frontier
00:00:18Intelligence. Kita akan membahas sedikit tentang bagaimana kami di
00:00:22Elise AI merancang kerangka kerja agen suara untuk menghasilkan suara real-time dengan
00:00:28tingkat kecerdasan frontier yang kita perlukan. Jadi sebelum saya mulai, saya ingin
00:00:36menarik beberapa kesamaan tentang mengapa kami memutuskan untuk memilih agen suara kaskade
00:00:42dan khususnya membandingkannya dengan mobil otonom yang dulu saya kerjakan
00:00:48sebelumnya. Jadi bagi saya, agen suara kaskade sangat masuk akal jika Anda melihatnya
00:00:53dari sudut pandang membaginya ke dalam persepsi, yang mana untuk mobil otonom
00:00:59itu adalah kotak pembatas, kamera, lidar. Untuk suara, itu akan menjadi
00:01:05transkripsi, pada dasarnya mengubah sinyal dari dunia nyata ini
00:01:09menjadi elemen data yang dapat diproses oleh model bahasa atau otak apa pun yang Anda gunakan.
00:01:17Yang kedua adalah tumpukan perencanaan yang cukup mudah dipahami.
00:01:23Di sinilah model bahasa akan mengambil masukan dari tahap persepsi dan menghasilkan
00:01:29keluaran yang ingin Anda keluarkan kembali ke dunia nyata. Dan akhirnya ada lapisan kontrol
00:01:36di mana dalam mengemudi sendiri, Anda akan mengambil lintasan yang dikeluarkan oleh perencana dan
00:01:43mengubahnya menjadi kontrol nyata untuk mengemudikan mobil. Di sini kita mengubah teks menjadi
00:01:50audio yang kita gunakan untuk mengekspresikan pikiran agen suara kita. Dan ya, jadi di sini saya akan membahas lebih mendalam
00:02:00masing-masing elemen ini dan kami telah membuat beberapa trik menarik di setiap area tersebut untuk
00:02:08meningkatkan kecepatan agen suara kami tanpa mengorbankan kecerdasannya.
00:02:13Jadi yang pertama adalah lapisan transkripsi. Jadi kami datang dengan konsep ini yang disebut seperti
00:02:19transkriber spekulatif streaming di mana secara efektif kita melapisi transkriber streaming cepat
00:02:24seperti flux di atas atau di bawah scribe v2 atau transkripsi batch yang akurat
00:02:33yang mengambil lebih banyak konteks. Ini sedikit lebih lambat tetapi akan memberi Anda deteksi yang lebih akurat.
00:02:39Jadi mari kita telusuri pengaturannya sekarang, dalam hal ini agen baru saja bertanya, memberikan
00:02:44bisakah Anda menuliskan nama dan tanggal lahir Anda, dan pengguna akan mengatakan ini dan kita akan melihat bagaimana kelanjutannya
00:02:49dari segi waktu. Jadi pertama kita akan mendapatkan deteksi cepat. Kita akan mendapatkannya dari
00:02:57lapisan streaming. Lapisan yang akurat, lapisan korektif tidak akan aktif karena teksnya sama.
00:03:05Kita akan mendapatkan beberapa deteksi teks streaming lagi dan dalam hal ini lapisan korektif sebenarnya
00:03:11dibatalkan karena kita mendapatkan teks baru, jadi konteks yang lebih banyak, audio yang lebih banyak akan mengalahkan yang akurat yang lama.
00:03:21Dan di sinilah koreksi pertama masuk. Karena lapisan scribe v2 memahami
00:03:27konteks pertanyaan, ia dapat memahami bahwa ini membahas tentang nama dan ini adalah tanggal lahir.
00:03:34Dan kemudian beberapa deteksi lagi. Ini hanya tanda baca. Kita tidak peduli.
00:03:37Dan pada akhirnya kita merilis teks ini ke agen.
00:03:44Dan beralih ke lapisan model bahasa. Di sini karena kita menggunakan LLM yang lambat namun
00:03:52LLM yang lambat namun cerdas ini, kita benar-benar ingin mengurangi jumlah bolak-balik, dan hal yang menyebabkan kita melakukan
00:03:58banyak inferensi adalah pemanggilan alat (tool calling). Jadi salah satu cara untuk menghilangkannya adalah dengan meminta agen latar belakang melakukan pemanggilan alat
00:04:05untuk Anda dan mendorong alat-alat tersebut kembali ke konteks agen utama sehingga ia berpikir
00:04:13bahwa ia membuat pemanggilan alat padahal sebenarnya tidak. Jadi ingat dari deteksi sebelumnya. Jadi apa yang akan terjadi adalah setiap deteksi ini akan memicu
00:04:26generasi awal dari agen dan kita tidak akan mengeluarkannya sampai kita mengonfirmasi bahwa
00:04:38pengguna telah selesai berbicara. Dalam hal ini pengguna mengatakan tentu. Agen tahu bahwa pengguna akan mengatakan hal lain.
00:04:45Pemanggilan alat latar belakang kita di sini yang akan membantu kita mencari nama dan tanggal lahir dari deteksi pengguna
00:04:51tidak aktif jadi tidak banyak yang terjadi di sana. Deteksi instan berikutnya masuk. Dikatakan bahwa itu masih belum benar-benar sebuah nama.
00:05:02Agen kita mengikuti alur dan melanjutkan di sana.
00:05:06Sekarang lebih banyak konteks yang kembali. Agen merasa seharusnya ada sebuah nama.
00:05:11Ia akan meminta untuk mengeja karena mungkin ia berpikir ada beberapa kesalahan transkripsi di sini.
00:05:16Masih belum ada nama atau tanggal lahir. Dan akhirnya ingat ini adalah deteksi instan akhir
00:05:22yang telah dikoreksi dari transkriber dari scribe v2.
00:05:27Di sini pembuatan agen yang penuh semangat yang dibuat tanpa pemanggilan alat apa pun akan dibatalkan
00:05:34karena agen latar belakang akhirnya dapat menemukan nama dan tanggal lahir yang dicarinya.
00:05:38Jadi ia akan memicu ulang dan sekarang agen benar-benar memiliki konteks yang dibutuhkannya.
00:05:45Dan Anda melihat di sini kita sedang melakukannya. Pemanggilan alat di sini sedikit
00:05:49memiliki kecerdasan di sana. Kita akan mengoreksi kesalahan transkripsi nama,
00:05:53melakukan pencocokan fonetik di sini.
00:05:57Dan ya, begitu kita memahami bahwa ini adalah akhir dari ucapan pengguna,
00:06:02kita akan mengeluarkannya. Jadi cukup standar.
00:06:06Baiklah dan lapisan berikutnya di sini adalah text-to-speech (teks-ke-suara). Jadi dengan text-to-speech tujuannya
00:06:12adalah mengambil apa yang dikatakan agen dan agen akan mengeluarkannya dalam bentuk
00:06:16streaming. Jadi kita harus menghasilkan audio secepat mungkin. Dan idealnya yang bisa Anda lakukan adalah
00:06:24sebelum agen bahkan selesai menghasilkan teks lengkap, Anda sudah bisa memutar audionya. Jadi ini menyembunyikan
00:06:31latensi penyelesaian pembuatan teks. Jadi saya akan memutar streaming
00:06:39keluaran agen streaming sekarang. Jadi dimulai dengan U. Dan sebenarnya sebelum saya membahas lebih jauh ada
00:06:46konsep baru yang kita perkenalkan di sini yang disebut prefiks cache. Jadi prefiks cache akan
00:06:52melihat aliran agen dan melihat apakah kita sudah menghasilkan audio untuk urutan kata tersebut
00:07:02dari generasi sebelumnya atau mungkin generasi yang sama dalam panggilan ini juga.
00:07:10Jadi ia melihat kata U. Untuk prefiks cache ini kita tidak ingin
00:07:17langsung mendeteksi setiap kata. Kita akan menunggu beberapa kata lagi. Jadi setelah
00:07:24tiga kata, prefiks cache mendapati kecocokan pertamanya. Dan di sebelah kanan ini adalah
00:07:31penyedia standar text-to-speech kita, Cartesia adalah mesin text-to-speech dengan dukungan WebSocket.
00:07:36Jadi kita mengalirkan agen melalui cache dan juga mengalirkannya melalui WebSocket.
00:07:45Lebih banyak token masuk, lebih banyak cache, lebih banyak pengiriman ke WebSocket. Tidak banyak yang perlu dikatakan di sini.
00:07:51Dan oke, sekarang kita mendapatkan hal unik pertama yaitu kita menemukan token yang benar-benar
00:07:59menyebabkan cache miss (tidak cocok). Masuk akal jika kita melakukan cache pada generasi sebelumnya. Anda mengatakan nama Anda
00:08:05adalah hal yang cukup umum, tetapi begitu kita menambahkan namanya, tiba-tiba itu akan menghasilkan cache miss.
00:08:12Pada titik ini kita benar-benar akan mengeluarkan audio yang di-cache. Jadi Anda mengatakan nama Anda adalah akan
00:08:19dipancarkan saat sisa teks streaming kembali. Jadi pada titik ini pengguna mendengarkan agen.
00:08:25Pengguna tidak begitu tahu apa yang terjadi. Bagi mereka itu hanya terlihat seperti waktu respons yang sangat cepat.
00:08:32Dan sekarang sisa teks mengalir. Dan pada titik ini kita sudah mengeluarkannya dari cache.
00:08:38Cache telah melakukan tugasnya. Sisanya bisa kita masukkan ke Cartesia. Dan di sinilah triknya
00:08:46di mana Cartesia telah melihat seluruh transkrip hingga titik ini. Bagi Cartesia, ia tidak tahu
00:08:56tentang keberadaan prefiks cache ini. Ia hanya akan menghasilkan kalimat lengkap ini dengan
00:09:01prosodi alami standar. Tapi yang kita lakukan adalah ketika generasi kembali karena kita sudah memutar
00:09:08audio di sini, kita sebenarnya dapat menekan audio dari Cartesia di sini dan hanya memutar bagian yang tersisa.
00:09:13Jadi pengguna mungkin akan merasakan sedikit gangguan kecil. Tahu kan, saya akan memutar audio nanti dan Anda
00:09:21tahu bahwa Anda mungkin tidak akan dapat menyadarinya. Dan secara efektif kita mengambil ini dan
00:09:28mengambil bagian ini dan mengeluarkannya langsung setelah audio ini selesai diputar. Jadi terlihat mulus bagi pengguna.
00:09:35Dan ya, jadi saya rasa pada titik ini ada banyak detail teknis. Saya pikir cara terbaik adalah
00:09:43hanya memutar panggilan dan melihat ini beraksi. Jadi di sini saya merekam panggilan dan mari kita dengar apa yang terjadi.
00:09:53Jadi di sini kami akan berbicara dengan kalian. Ini Bo, OB-GYN. Elise berbicara.
00:09:59Halo, sepertinya saya hamil dan saya ingin menjadwalkan USG untuk memastikannya.
00:10:03Itu berita yang menarik. Bisakah Anda sebutkan nama dan tanggal lahir Anda?
00:10:08Tentu, ini Elise trial. Tanggal lahir, 2303.
00:10:15Terima kasih. Apakah Anda pasien baru kami?
00:10:24Ya. Selamat datang di Bo, OB-GYN. Bisakah saya mengirimkan tautan melalui teks untuk mengunggah informasi asuransi Anda?
00:10:34Tentu. Oke. Terkirim. Beritahu saya jika Anda sudah menerimanya.
00:10:48Saya telah menerima informasi asuransi Anda. Jadwal paling awal yang saya miliki adalah hari Kamis,
00:10:532 Juli pukul 10 pagi. Sebenarnya, beri saya waktu sebentar. Biarkan saya memeriksa kalender saya.
00:11:01Tentu. Santai saja. Apakah Anda memiliki waktu untuk minggu depan?
00:11:09Untuk minggu depan, saya dapat menawarkan USG dengan Dr. Avery Stone di North Clinic pada hari Selasa,
00:11:147 Juli pukul 2 siang atau 3 sore. Apakah salah satu dari waktu itu cocok untuk Anda?
00:11:20Ya, pukul 2 siang bisa. Bagus. Janji temu Anda telah dipesan. Kami menantikan kehadiran Anda saat itu.
00:11:29Terima kasih. Sampai jumpa. Baiklah. Ya, kurang lebih seperti itu.
00:11:35Ya, Anda bisa melihat -- semua streaming ini dan, tahukah Anda, banyak hal yang
00:11:43terjadi di latar belakang. Dan, ya, inilah yang benar-benar membuat agen suara menjadi menarik.
00:11:48Dan ada banyak upaya yang dapat dilakukan dalam kerangka kerja untuk benar-benar mendapatkan
00:11:55percakapan yang natural, itulah yang kita cari.
00:11:59Oke. Ya. Jadi, saya rasa secara singkat, di bagian akhir, saya ingin membahas sedikit
00:12:04tentang Elyse. Jadi, saya pikir Elyse, kantor pusat kami di New York, dan kita
00:12:09berusaha memperluas kehadiran kita di sini di Bay Area. Kita -- saya pikir ini mungkin gaya perusahaan yang berbeda
00:12:15yang dipikirkan orang ketika mereka memikirkan startup AI di San Francisco,
00:12:23di mana kita sebenarnya sangat fokus hanya pada membantu orang dan membantu orang di tempat yang mereka butuhkan,
00:12:31seperti di area kehidupan yang paling krusial. Kami bekerja di bidang perumahan, perawatan kesehatan, dan kami melakukannya dengan sangat
00:12:37baik, dan, tahukah Anda, di sini -- ada tautan di sini untuk bergabung dengan tim kami, dan akan -- kami
00:12:45akan memposting banyak hal di Twitter, jadi Anda juga dapat mengikuti kami di @Elyse.ai. Ya, sekian.
00:12:57Jadi, kita akan memposting sedikit lebih banyak di Twitter, dan kita akan memposting sedikit lebih banyak di Twitter.

핵심 요약

Arsitektur agen suara real-time dipecah menjadi lapisan transkripsi, perencanaan, dan kontrol yang dioptimalkan menggunakan transkripsi spekulatif dan prefiks cache untuk mengurangi latensi tanpa mengorbankan kecerdasan.

하이라이트

  • Arsitektur agen suara kaskade dibagi menjadi tiga lapisan utama: transkripsi, perencanaan model bahasa, dan kontrol.

  • Transkriber spekulatif streaming menggabungkan transkriber streaming cepat dengan lapisan scribe v2 yang lebih akurat untuk mendeteksi teks secara real-time.

  • Prefiks cache memeriksa aliran agen untuk menggunakan kembali audio dari generasi sebelumnya guna meminimalkan latensi pemutaran.

  • Mesin text-to-speech Cartesia menggunakan dukungan WebSocket untuk mengalirkan audio agen dengan prosodi alami standar.

  • EliseAI memfokuskan penerapan agen suara pada sektor perawatan kesehatan dan perumahan untuk membantu pengguna di area kehidupan yang krusial.

타임라인

Arsitektur Agen Suara Kaskade

  • Kerangka kerja agen suara dirancang mirip dengan sistem mobil otonom.
  • Lapisan persepsi bertugas mengubah sinyal dunia nyata menjadi elemen data yang dapat diproses oleh model bahasa.
  • Lapisan kontrol menerjemahkan teks menjadi audio untuk mengekspresikan pikiran agen suara.

Perancangan agen suara kaskade membagi proses menjadi persepsi, perencanaan, dan kontrol. Pendekatan ini menyamakan transkripsi dengan kotak pembatas atau sensor pada kendaraan otonom. Setiap elemen dirancang untuk meningkatkan kecepatan agen suara tanpa menurunkan tingkat kecerdasannya.

Lapisan Transkripsi Spekulatif Streaming

  • Sistem melapisi transkriber streaming cepat seperti flux di bawah scribe v2 yang lebih akurat.
  • Lapisan korektif membatalkan transkripsi lama saat konteks dan audio baru yang lebih banyak masuk.
  • Scribe v2 memahami konteks pertanyaan untuk mendeteksi informasi spesifik seperti nama dan tanggal lahir.

Pengaturan transkripsi menggunakan metode spekulatif streaming. Lapisan streaming memberikan deteksi cepat awal. Lapisan korektif meninjau ulang data berdasarkan konteks tambahan yang masuk untuk memastikan akurasi transkripsi sebelum dilepaskan ke agen.

Model Bahasa dan Pemanggilan Alat Latar Belakang

  • Agen latar belakang melakukan pemanggilan alat untuk mengurangi bolak-balik inferensi pada model bahasa.
  • Generasi awal agen ditahan sampai sistem mengonfirmasi pengguna selesai berbicara.
  • Pencocokan fonetik digunakan untuk mengoreksi kesalahan transkripsi nama pengguna secara otomatis.

Model bahasa yang cerdas namun lambat dioptimalkan dengan memindahkan tugas pemanggilan alat ke agen latar belakang. Hasil pemanggilan didorong kembali ke konteks agen utama. Sistem menunda keluaran audio hingga ucapan pengguna benar-benar selesai.

Optimasi Text-to-Speech Menggunakan Prefiks Cache

  • Prefiks cache memindai aliran agen untuk mencocokkan audio dari generasi kata sebelumnya.
  • Audio yang di-cache dipancarkan terlebih dahulu saat terjadi cache miss pada nama yang spesifik.
  • Mesin text-to-speech Cartesia menghasilkan kalimat lengkap dengan prosodi alami melalui WebSocket.

Lapisan text-to-speech mempercepat respons dengan memutar audio dari cache sebelum teks lengkap selesai dihasilkan. Ketika cache miss terjadi pada kata-kata baru seperti nama, sistem memutar audio yang di-cache sambil menekan sisa audio dari Cartesia untuk menciptakan transisi yang mulus.

Demonstrasi Panggilan dan Fokus Perusahaan

  • Rekaman demonstrasi memperlihatkan interaksi penjadwalan USG medis secara real-time.
  • EliseAI berpusat di New York dengan fokus ekspansi di Bay Area.
  • Perusahaan memfokuskan pengembangan AI pada sektor perawatan kesehatan dan perumahan.

Demonstrasi panggilan membuktikan efektivitas sistem dalam menangani percakapan medis yang kompleks secara alami. EliseAI mengarahkan teknologi agen suaranya untuk membantu pengguna pada area kehidupan yang paling krusial seperti perumahan dan kesehatan.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기