Transcript
00:00:00Ini Handy. Aplikasi pengenalan suara dan dikte sumber terbuka yang berjalan
00:00:06sepenuhnya secara luring tanpa cloud, tanpa langganan, tanpa akun, dan memungkinkan Anda memilih
00:00:12model dikte favorit Anda sendiri. Dan sejujurnya, ini telah menjadi alat dikte
00:00:18suara-ke-teks favorit saya. Di video ini, kita akan melihat Handy, cara kerjanya, dan menjalankan
00:00:24beberapa pengujian untuk melihat performanya dan perbandingannya dengan aplikasi komersial besar seperti
00:00:29Whisperflow. Ini akan sangat seru, jadi mari kita mulai. Hingga saat ini, saya agak skeptis
00:00:39terhadap aplikasi dikte suara, dan sulit menemukan yang ingin saya gunakan. Saya tidak ingin menggunakan
00:00:45produk komersial dan membayar untuk dikte, dan saya juga khawatir bahwa alat open-source
00:00:51dengan model dikte lokal mungkin akan memberatkan CPU saya. Namun Handy mengubah pemikiran saya tentang kedua
00:00:58masalah tersebut. Pertama, mari bicara tentang bagaimana Handy dibuat dan cara kerjanya. Handy dibuat oleh
00:01:04pengembang CJ Pace menggunakan Tauri, jadi menggunakan Rust untuk backend serta React dan TypeScript untuk menangani
00:01:12UI pengaturannya. Transcribe CPP menjalankan keluarga model Whisper dalam format GGML dan GGUF. Transcribe RS
00:01:20menjalankan Parakeet. Pustaka CPAL menangani input audio lintas platform. RDEV menangani pintasan
00:01:28papan ketik global, dan menggunakan pustaka bernama Rubato yang menyediakan streaming audio real-time dan menangani
00:01:33resampling. Kombinasi ini membuatnya sangat mudah dan sangat ringan digunakan bahkan di Macbook saya.
00:01:40Alurnya sendiri sangat sederhana dari sisi pengguna. Anda mengatur pintasan papan ketik khusus lalu
00:01:46mengaktifkan/mematikannya atau menahannya untuk push-to-talk. Saat Anda menahannya, ada utilitas
00:01:52bernama Silero VAD yang secara senyap menyaring keheningan di latar belakang sehingga tidak menyedot
00:01:58daya komputasi untuk menranskrip keheningan. Saat dilepas, Handy mengirim audio ke model yang Anda
00:02:04pilih lalu menempelkan teks transkrip langsung ke input yang sedang aktif saat itu. Dan sejujurnya,
00:02:11Handy tidak unik dalam hal ini. Banyak aplikasi dikte lain di pasaran bekerja dengan cara serupa.
00:02:17Namun hal yang paling saya sukai adalah Anda bisa memilih model pilihan sendiri, dan setiap model
00:02:22yang terdaftar di bagian model memiliki pengukur kecepatan dan akurasi. Ini seperti memilih karakter
00:02:28favorit di Mario Kart. Anda bisa menentukan metrik mana yang menjadi prioritas. Dalam kasus saya,
00:02:34menggunakan model Parakeet Unified 0.6 miliar parameter bekerja sangat baik karena Parakeet adalah model
00:02:42khusus CPU. Menurut data mereka sendiri, model ini berjalan sekitar lima kali kecepatan real-time pada prosesor
00:02:48i5 kelas menengah. Dan M2 Max saya jauh di atas spesifikasi itu. Jadi saya bahkan tidak merasakannya saat berjalan di
00:02:54latar belakang. Ada begitu banyak pilihan lain yang bisa dipilih. Mereka bahkan memiliki model khusus
00:02:59untuk satu bahasa. Misalnya, ada model bahasa Rusia dan Ukraina. Dan saya menyukai kejujuran
00:03:05dari pernyataan misi Handy. Handy tidak berusaha menjadi aplikasi ucapan-ke-teks terbaik.
00:03:11Aplikasi ini berusaha menjadi yang paling mudah di-fork. Anda bahkan bisa memasukkan model Whisper
00:03:17GGML buatan sendiri ke folder model aplikasi, muat ulang, lalu model tersebut akan muncul sebagai opsi khusus.
00:03:23Dan menurut saya alasan terbesar mengapa saya memilih Handy daripada aplikasi seperti Whisperflow adalah
00:03:28karena Handy bekerja secara luring, tidak perlu membuat akun, dan tanpa berlangganan.
00:03:34Saya yakin sepenuhnya bahwa semua sampel audio dikte tetap berada di perangkat saya dan tidak
00:03:40digunakan secara rahasia untuk melatih model suara lain. Saya sangat senang kita sekarang memiliki alat dikte
00:03:46berlisensi MIT seperti ini. Semua itu terdengar hebat, tetapi mari kita uji Handy secara langsung
00:03:52dan lihat performanya. Saya akan membandingkan performa Handy dengan Whisperflow dan juga dengan
00:03:58layanan transkripsi milik Google sendiri yang tersedia di Google Docs. Di halaman Google Docs ini,
00:04:05saya akan mengaktifkan mode pengetikan suara Google. Pada saat yang sama, saya akan menahan
00:04:11pintasan transkripsi Handy. Lalu saya akan berbicara secara acak. Dan di akhir,
00:04:18kita akan melihat hasil yang diberikan masing-masing layanan dan membandingkannya.
00:04:26Kemarin saya pergi membeli bahan makanan dan dalam perjalanan pulang, saya mendadak teringat harus
00:04:34kembali dan menghubungkan basis data SQLite saya ke layanan COBOL yang berjalan di kluster GPU kustom saya.
00:04:43Sebenarnya saya tidak tahu cara melakukannya. Jadi saya harus meminta bantuan. Satu-satunya alat yang terpikirkan oleh saya yang bisa membantu
00:04:55adalah LLM bernama Grok. Lalu saya juga mendapat sedikit bantuan dari ChatGPT. Dan pada akhirnya,
00:05:04aplikasi berhasil berjalan, tetapi prosesnya cukup merepotkan. Mari pisahkan keduanya.
00:05:12Seperti yang Anda lihat di sini, layanan pengetikan suara Google jauh lebih buruk. Layanan ini tidak menambahkan tanda baca.
00:05:20Tidak tahu cara memisah kalimat. Kata COBOL tidak ditangkap dengan benar, begitu juga basis data SQLite
00:05:27tidak ditangkap dengan benar. Bahkan kata LLM tidak tepat. Mengira Grok sebagai “rock”. Dan bagian
00:05:35favorit saya: mengira ChatGPT sebagai Chad GPT. Chad GPT. Lucu juga. Ya, jadi Anda bisa melihat
00:05:45dengan jelas bahwa Handy jauh lebih baik karena memberikan tanda baca. Handy mengenali istilah tertentu,
00:05:52dan sebagian besar istilah teknis berhasil ditangkap dengan benar. Sekarang mari bandingkan juga hasil ini dengan
00:05:58Whisperflow. Saya akan mencoba mengulangi teks yang sama semirip mungkin agar pengujian ini adil.
00:06:08Kemarin saya pergi membeli bahan makanan dan dalam perjalanan pulang, saya mendadak teringat harus
00:06:16pulang ke rumah dan menghubungkan basis data SQLite saya ke layanan COBOL yang berjalan di kluster GPU kustom saya.
00:06:26Sebenarnya saya tidak tahu cara melakukannya. Jadi saya harus meminta bantuan. Dan satu-satunya alat yang terpikirkan
00:06:33yang bisa membantu adalah LLM bernama Grok. Lalu saya juga mendapat sedikit bantuan dari Chad GPT.
00:06:41Dan pada akhirnya, aplikasi berhasil berjalan, tetapi prosesnya cukup merepotkan.
00:06:48Oke. Anda bisa melihat dengan jelas bahwa Whisperflow melakukan tugas terbaik. Memisahkan kalimat dengan benar,
00:06:55dan menangkap semua istilah dengan tepat. Karena ini adalah aplikasi komersial, wajar jika diperkirakan
00:07:03performa hasilnya lebih baik daripada alat open-source. Namun jujur saja, tidak ada banyak perbedaan
00:07:09antara hasil Handy dan Whisperflow. Jadi saya tetap lebih suka menggunakan Handy hanya karena gratis,
00:07:17menjaga privasi, dan open-source. Meski begitu, Whisperflow bekerja sangat baik di sini, tetap merupakan layanan yang solid.
00:07:25Itulah gambaran singkatan mengenai Handy. Saya tidak bercanda saat mengatakan bahwa
00:07:30ini telah menjadi alat dikte favorit saya. Dan sejujurnya saya takut akan lupa cara
00:07:36mengetik di papan ketik jika terlalu sering menggunakannya. Namun itu hanya pemikiran dan pengamatan saya.
00:07:42Bagaimana pendapat Anda tentang Handy? Sudah pernah mencobanya? Apakah Anda akan menggunakannya? Beri tahu kami di kolom komentar
00:07:47di bawah. Dan teman-teman, jika menyukai pembahasan teknis seperti ini, berikan tanggapan Anda dengan
00:07:52menekan tombol like di bawah video. Dan jangan lupa juga untuk berlangganan di saluran kami.
00:07:57Saya Andres dari BetterStack dan sampai jumpa di video-video berikutnya!