Beli Aplikasi Dikte? Pakai yang Lebih Bagus dan Gratis Ini! (handy)

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Ini Handy. Aplikasi pengenalan suara dan dikte sumber terbuka yang berjalan
00:00:06sepenuhnya secara luring tanpa cloud, tanpa langganan, tanpa akun, dan memungkinkan Anda memilih
00:00:12model dikte favorit Anda sendiri. Dan sejujurnya, ini telah menjadi alat dikte
00:00:18suara-ke-teks favorit saya. Di video ini, kita akan melihat Handy, cara kerjanya, dan menjalankan
00:00:24beberapa pengujian untuk melihat performanya dan perbandingannya dengan aplikasi komersial besar seperti
00:00:29Whisperflow. Ini akan sangat seru, jadi mari kita mulai. Hingga saat ini, saya agak skeptis
00:00:39terhadap aplikasi dikte suara, dan sulit menemukan yang ingin saya gunakan. Saya tidak ingin menggunakan
00:00:45produk komersial dan membayar untuk dikte, dan saya juga khawatir bahwa alat open-source
00:00:51dengan model dikte lokal mungkin akan memberatkan CPU saya. Namun Handy mengubah pemikiran saya tentang kedua
00:00:58masalah tersebut. Pertama, mari bicara tentang bagaimana Handy dibuat dan cara kerjanya. Handy dibuat oleh
00:01:04pengembang CJ Pace menggunakan Tauri, jadi menggunakan Rust untuk backend serta React dan TypeScript untuk menangani
00:01:12UI pengaturannya. Transcribe CPP menjalankan keluarga model Whisper dalam format GGML dan GGUF. Transcribe RS
00:01:20menjalankan Parakeet. Pustaka CPAL menangani input audio lintas platform. RDEV menangani pintasan
00:01:28papan ketik global, dan menggunakan pustaka bernama Rubato yang menyediakan streaming audio real-time dan menangani
00:01:33resampling. Kombinasi ini membuatnya sangat mudah dan sangat ringan digunakan bahkan di Macbook saya.
00:01:40Alurnya sendiri sangat sederhana dari sisi pengguna. Anda mengatur pintasan papan ketik khusus lalu
00:01:46mengaktifkan/mematikannya atau menahannya untuk push-to-talk. Saat Anda menahannya, ada utilitas
00:01:52bernama Silero VAD yang secara senyap menyaring keheningan di latar belakang sehingga tidak menyedot
00:01:58daya komputasi untuk menranskrip keheningan. Saat dilepas, Handy mengirim audio ke model yang Anda
00:02:04pilih lalu menempelkan teks transkrip langsung ke input yang sedang aktif saat itu. Dan sejujurnya,
00:02:11Handy tidak unik dalam hal ini. Banyak aplikasi dikte lain di pasaran bekerja dengan cara serupa.
00:02:17Namun hal yang paling saya sukai adalah Anda bisa memilih model pilihan sendiri, dan setiap model
00:02:22yang terdaftar di bagian model memiliki pengukur kecepatan dan akurasi. Ini seperti memilih karakter
00:02:28favorit di Mario Kart. Anda bisa menentukan metrik mana yang menjadi prioritas. Dalam kasus saya,
00:02:34menggunakan model Parakeet Unified 0.6 miliar parameter bekerja sangat baik karena Parakeet adalah model
00:02:42khusus CPU. Menurut data mereka sendiri, model ini berjalan sekitar lima kali kecepatan real-time pada prosesor
00:02:48i5 kelas menengah. Dan M2 Max saya jauh di atas spesifikasi itu. Jadi saya bahkan tidak merasakannya saat berjalan di
00:02:54latar belakang. Ada begitu banyak pilihan lain yang bisa dipilih. Mereka bahkan memiliki model khusus
00:02:59untuk satu bahasa. Misalnya, ada model bahasa Rusia dan Ukraina. Dan saya menyukai kejujuran
00:03:05dari pernyataan misi Handy. Handy tidak berusaha menjadi aplikasi ucapan-ke-teks terbaik.
00:03:11Aplikasi ini berusaha menjadi yang paling mudah di-fork. Anda bahkan bisa memasukkan model Whisper
00:03:17GGML buatan sendiri ke folder model aplikasi, muat ulang, lalu model tersebut akan muncul sebagai opsi khusus.
00:03:23Dan menurut saya alasan terbesar mengapa saya memilih Handy daripada aplikasi seperti Whisperflow adalah
00:03:28karena Handy bekerja secara luring, tidak perlu membuat akun, dan tanpa berlangganan.
00:03:34Saya yakin sepenuhnya bahwa semua sampel audio dikte tetap berada di perangkat saya dan tidak
00:03:40digunakan secara rahasia untuk melatih model suara lain. Saya sangat senang kita sekarang memiliki alat dikte
00:03:46berlisensi MIT seperti ini. Semua itu terdengar hebat, tetapi mari kita uji Handy secara langsung
00:03:52dan lihat performanya. Saya akan membandingkan performa Handy dengan Whisperflow dan juga dengan
00:03:58layanan transkripsi milik Google sendiri yang tersedia di Google Docs. Di halaman Google Docs ini,
00:04:05saya akan mengaktifkan mode pengetikan suara Google. Pada saat yang sama, saya akan menahan
00:04:11pintasan transkripsi Handy. Lalu saya akan berbicara secara acak. Dan di akhir,
00:04:18kita akan melihat hasil yang diberikan masing-masing layanan dan membandingkannya.
00:04:26Kemarin saya pergi membeli bahan makanan dan dalam perjalanan pulang, saya mendadak teringat harus
00:04:34kembali dan menghubungkan basis data SQLite saya ke layanan COBOL yang berjalan di kluster GPU kustom saya.
00:04:43Sebenarnya saya tidak tahu cara melakukannya. Jadi saya harus meminta bantuan. Satu-satunya alat yang terpikirkan oleh saya yang bisa membantu
00:04:55adalah LLM bernama Grok. Lalu saya juga mendapat sedikit bantuan dari ChatGPT. Dan pada akhirnya,
00:05:04aplikasi berhasil berjalan, tetapi prosesnya cukup merepotkan. Mari pisahkan keduanya.
00:05:12Seperti yang Anda lihat di sini, layanan pengetikan suara Google jauh lebih buruk. Layanan ini tidak menambahkan tanda baca.
00:05:20Tidak tahu cara memisah kalimat. Kata COBOL tidak ditangkap dengan benar, begitu juga basis data SQLite
00:05:27tidak ditangkap dengan benar. Bahkan kata LLM tidak tepat. Mengira Grok sebagai “rock”. Dan bagian
00:05:35favorit saya: mengira ChatGPT sebagai Chad GPT. Chad GPT. Lucu juga. Ya, jadi Anda bisa melihat
00:05:45dengan jelas bahwa Handy jauh lebih baik karena memberikan tanda baca. Handy mengenali istilah tertentu,
00:05:52dan sebagian besar istilah teknis berhasil ditangkap dengan benar. Sekarang mari bandingkan juga hasil ini dengan
00:05:58Whisperflow. Saya akan mencoba mengulangi teks yang sama semirip mungkin agar pengujian ini adil.
00:06:08Kemarin saya pergi membeli bahan makanan dan dalam perjalanan pulang, saya mendadak teringat harus
00:06:16pulang ke rumah dan menghubungkan basis data SQLite saya ke layanan COBOL yang berjalan di kluster GPU kustom saya.
00:06:26Sebenarnya saya tidak tahu cara melakukannya. Jadi saya harus meminta bantuan. Dan satu-satunya alat yang terpikirkan
00:06:33yang bisa membantu adalah LLM bernama Grok. Lalu saya juga mendapat sedikit bantuan dari Chad GPT.
00:06:41Dan pada akhirnya, aplikasi berhasil berjalan, tetapi prosesnya cukup merepotkan.
00:06:48Oke. Anda bisa melihat dengan jelas bahwa Whisperflow melakukan tugas terbaik. Memisahkan kalimat dengan benar,
00:06:55dan menangkap semua istilah dengan tepat. Karena ini adalah aplikasi komersial, wajar jika diperkirakan
00:07:03performa hasilnya lebih baik daripada alat open-source. Namun jujur saja, tidak ada banyak perbedaan
00:07:09antara hasil Handy dan Whisperflow. Jadi saya tetap lebih suka menggunakan Handy hanya karena gratis,
00:07:17menjaga privasi, dan open-source. Meski begitu, Whisperflow bekerja sangat baik di sini, tetap merupakan layanan yang solid.
00:07:25Itulah gambaran singkatan mengenai Handy. Saya tidak bercanda saat mengatakan bahwa
00:07:30ini telah menjadi alat dikte favorit saya. Dan sejujurnya saya takut akan lupa cara
00:07:36mengetik di papan ketik jika terlalu sering menggunakannya. Namun itu hanya pemikiran dan pengamatan saya.
00:07:42Bagaimana pendapat Anda tentang Handy? Sudah pernah mencobanya? Apakah Anda akan menggunakannya? Beri tahu kami di kolom komentar
00:07:47di bawah. Dan teman-teman, jika menyukai pembahasan teknis seperti ini, berikan tanggapan Anda dengan
00:07:52menekan tombol like di bawah video. Dan jangan lupa juga untuk berlangganan di saluran kami.
00:07:57Saya Andres dari BetterStack dan sampai jumpa di video-video berikutnya!

Key Takeaway

Handy menyediakan alternatif dikte suara-ke-teks gratis berlisensi MIT yang berjalan sepenuhnya lokal di CPU dengan tingkat akurasi istilah teknis yang setara dengan aplikasi komersial berbayar.

Highlights

  • Handy adalah aplikasi dikte suara-ke-teks sumber terbuka berlisensi MIT yang berjalan sepenuhnya secara luring tanpa akun, langganan, atau pemrosesan cloud.

  • Aplikasi ini dibangun menggunakan framework Tauri dengan backend Rust, UI React/TypeScript, serta mendukung pustaka Transcribe CPP untuk model Whisper dan Transcribe RS untuk model Parakeet.

  • Model Parakeet Unified 0.6B berjalan pada pemrosesan CPU dengan kecepatan sekitar lima kali kecepatan real-time pada prosesor i5 kelas menengah.

  • Pengujian pengenalan istilah teknis menunjukkan Handy jauh melampaui pengetikan suara Google Docs dan memberikan hasil akurasi yang mendekati aplikasi komersial berbayar seperti Whisperflow.

  • Pengguna dapat menambahkan model Whisper GGML buatan sendiri secara langsung ke folder model aplikasi tanpa perlu mengonfigurasi ulang sistem.

Timeline

Arsitektur Teknis dan Cara Kerja Handy

  • Handy menggabungkan Rust, Tauri, React, dan TypeScript untuk membentuk aplikasi dikte lokal yang ringan.
  • Komponen Silero VAD menyaring keheningan secara otomatis agar proses pemrosesan tidak membebani CPU saat pengguna diam.
  • Teks hasil transkripsi langsung ditempelkan secara otomatis ke dalam kolom input teks yang sedang aktif.

Pengembangan Handy mengandalkan Tauri dan Rust pada backend untuk menjaga penggunaan memori tetap rendah, sementara React dan TypeScript menangani antarmuka pengguna. Transcribe CPP mengelola deretan model Whisper berbasis format GGML/GGUF, sedangkan Transcribe RS menjalankan model Parakeet. Pengisian input audio difasilitasi oleh pustaka CPAL dan pengolahan waktu nyata ditangani oleh Rubato. Penanganan pintasan papan ketik global dikelola oleh RDEV untuk mengaktifkan pemrosesan suara secara instan.

Fleksibilitas Model dan Kerangka Privasi Lokal

  • Setiap opsi model dalam aplikasi dilengkapi dengan metrik pengukur kecepatan dan tingkat akurasi.
  • Model Parakeet Unified 0.6B dioptimalkan khusus untuk pemrosesan berbasis CPU tanpa membutuhkan GPU terpisah.
  • Seluruh data audio diproses penuh di dalam perangkat tanpa risiko pengiriman sampel suara ke server eksternal.

Handy memberikan kebebasan memilih model sesuai prioritas kinerja perangkat, termasuk ketersediaan model khusus bahasa tertentu seperti Rusia dan Ukraina. Desain kodenya sengaja dibuat agar mudah di-fork oleh pengembang lain. Pengguna juga dapat memasukkan model kustom berformat GGML ke folder aplikasi untuk langsung digunakan. Karena tidak ada kewajiban membuat akun atau berlangganan, privasi data suara pengguna terjamin penuh di tingkat lokal.

Pengujian Perbandingan: Handy, Google Docs, dan Whisperflow

  • Fitur pengetikan suara Google Docs gagal mengenali istilah teknis spesifik seperti SQLite, COBOL, LLM, Grok, dan ChatGPT.
  • Handy berhasil menangkap istilah teknis serta memberikan tanda baca dan pemisahan kalimat yang tepat.
  • Hasil transkripsi Handy mendekati kualitas aplikasi berbayar Whisperflow meskipun dijalankan tanpa biaya dan tanpa jaringan internet.

Pengujian komparatif dilakukan menggunakan sampel kalimat berisi istilah teknis pemrograman dan kecerdasan buatan. Pengetikan suara Google Docs menghasilkan banyak kesalahan fatal seperti menerjemahkan Grok menjadi 'rock' dan ChatGPT menjadi 'Chad GPT' tanpa adanya tanda baca. Handy mampu mentranskrip sebagian besar struktur kalimat serta istilah teknis dengan akurat. Meskipun Whisperflow mencatat akurasi paling sempurna sebagai solusi komersial, performa Handy terbukti cukup dekat sehingga menjadi alternatif lokal yang lebih efisien.

Community Posts

View all posts