Хватит платить за диктовку! Это приложение лучше и абсолютно бесплатно (handy)

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Это Handy — open-source приложение для распознавания речи и диктовки, которое работает
00:00:06полностью офлайн, без облака, подписок и аккаунтов. Оно позволяет выбрать
00:00:12предпочитаемую модель диктовки. И, честно говоря, это приложение стало моим любимым инструментом
00:00:18для голосового ввода. В этом видео мы разберём Handy, посмотрим, как он работает, и проведём
00:00:24несколько тестов, чтобы оценить его точность в сравнении с такими гигантами, как коммерческий
00:00:29Whisperflow. Будет интересно, так что давайте начнём. До этого момента я довольно скептически относился
00:00:39к приложениям для диктовки и никак не мог найти подходящее. Мне не хотелось пользоваться
00:00:45платными коммерческими сервисами, а также я опасался, что open-source утилита
00:00:51с локальной моделью сильно перегрузит процессор. Но Handy полностью изменил моё мнение
00:00:58по обоим пунктам. Сначала давайте поговорим о том, как устроена программа. Handy создан
00:01:04разработчиком CJ Pace с помощью Tauri: бэкенд написан на Rust, а интерфейс настроек —
00:01:12на React и TypeScript. Transcribe CPP запускает модели семейства Whisper в форматах GGML и GGUF. Transcribe RS
00:01:20запускает Parakeet. Библиотека CPAL отвечает за кроссплатформенный аудиоввод. RDEV обрабатывает глобальные
00:01:28горячие клавиши, а библиотека Rubato обеспечивает потоковую передачу звука
00:01:33в реальном времени и его редискретизацию. Такая связка делает приложение невероятно лёгким и быстрым даже на Macbook.
00:01:40Сам процесс работы предельно прост. Вы задаёте сочетание клавиш,
00:01:46а затем переключаете режим записи либо зажимаете клавишу для функции Push-to-talk. Пока вы её удерживаете,
00:01:52утилита Silero VAD незаметно отфильтровывает тишину на фоне, чтобы вы не тратили
00:01:58ресурсы на распознавание паузы. А когда вы отпускаете клавишу, Handy отправляет аудио на выбранную модель
00:02:04и вставляет распознанный текст прямо в активное текстовое поле. Справедливости ради,
00:02:11в этом Handy не уникален. Многие аналогичные программы работают похожим образом.
00:02:17Но больше всего мне нравится возможность самому выбирать модель. При этом для каждой из них
00:02:22отображаются шкалы скорости и точности. Это похоже на выбор персонажа
00:02:28в Mario Kart: вы решаете, какой параметр для вас приоритетнее. Лично мне
00:02:34отлично подошла модель Parakeet Unified на 600 миллионов параметров, так как Parakeet работает
00:02:42исключительно на ЦП. По заявлениям разработчиков, она работает примерно в 5 раз быстрее реального времени
00:02:48на среднем процессоре i5. А мой M2 Max значительно превосходит эти характеристики, поэтому я даже не замечаю
00:02:54работу программы в фоновом режиме. Доступно и множество других вариантов, включая модели,
00:02:59для конкретного языка. Например, есть несколько моделей для русского, для украинского. И мне очень нравится честность
00:03:05подход в описании миссии Handy. Программа не пытается быть лучшим сервисом распознавания речи,
00:03:11она стремится быть максимально удобной для модификации. Вы можете просто закинуть свои обученные
00:03:17модели Whisper GGML в папку models, перезапустить приложение, и они появятся в списке.
00:03:23Главная причина, почему я без колебаний предпочту Handy тому же Whisperflow,
00:03:28заключается в том, что Handy работает офлайн, не требует регистрации и подписок.
00:03:34Я на 100% уверен, что все мои записи остаются на компьютере и не используются
00:03:40втайне для обучения сторонних моделей. Я очень рад, что у нас появился такой инструмент
00:03:46под лицензией MIT. Всё это звучит здорово, но давайте протестируем Handy
00:03:52и посмотрим на него в деле. Я сравню работу Handy с Whisperflow, а также
00:03:58со встроенной системой транскрибации Google, которая доступна в Google Документах. Итак, на странице Google Документов
00:04:05я включу стандартный голосовой ввод Google и одновременно зажму
00:04:11горячую клавишу записи в Handy. Затем я наговорю случайный текст, а в конце
00:04:18мы оценим и сравним полученные результаты.
00:04:26Вчера я ходил за продуктами, и по дороге домой мне внезапно вспомнилось, что нужно
00:04:34подключить базу данных SQLite к сервису на COBOL, который работает на моём кастомном GPU-кластере.
00:04:43Я толком не знал, как это сделать, поэтому пришлось просить помощи. Единственным инструментом, способным помочь,
00:04:55оказалась языковая модель Grok. Также мне немного помог ChatGPT. В итоге
00:05:04наше приложение заработало, но пришлось изрядно повозиться. Давайте разделим эти тексты.
00:05:12Как видите, голосовой ввод Google справился намного хуже. Он вообще не расставил знаки препинания,
00:05:20не смог разбить текст на предложения, неправильно распознал COBOL и базу данных
00:05:27SQLite. Он даже аббревиатуру LLM расслышал с ошибкой, а вместо Grok написал rock. Но самое
00:05:35смешное — он распознал ChatGPT как Chad GPT. Chad GPT, забавно! Так что
00:05:45разница очевидна: Handy справился намного лучше, ведь он расставляет пунктуацию, определяет термины
00:05:52и верно передал большинство технических названий. Теперь давайте сравним этот результат
00:05:58с Whisperflow. Я постараюсь максимально точно повторить тот же текст для чистоты эксперимента.
00:06:08Вчера я ходил за продуктами, и по дороге домой мне внезапно вспомнилось, что нужно
00:06:16вернуться и подключить базу данных SQLite к сервису на COBOL, который работает на моём GPU-кластере.
00:06:26На самом деле я не знал, как это сделать, и мне потребовалась помощь. Единственным инструментом,
00:06:33который мог помочь, оказалась нейросеть Grok. А еще мне немного помог ChatGPT.
00:06:41В конечном счёте нам удалось запустить рабочее приложение, хоть это и было непросто.
00:06:48Итак, отлично видно, что Whisperflow справился лучше всех. Он верно разбил текст на предложения
00:06:55и без ошибок распознал все термины. Но поскольку это коммерческий продукт, логично ожидать,
00:07:03что он превзойдёт open-source решение. Однако разница между его результатом
00:07:09и работой Handy не так уж велика. Поэтому я всё равно предпочитаю Handy — просто потому, что он бесплатный,
00:07:17конфиденциальный и открытый. Тем не менее Whisperflow покачественнее, это действительно отличный сервис.
00:07:25Вот и всё, друзья, это был краткий обзор Handy. Я не шутил, когда говорил,
00:07:30что это приложение действительно стало моим любимым инструментом. Боюсь, я вообще отвыкну
00:07:36печать на клавиатуре, если буду пользоваться им слишком часто. Но это лишь моё мнение и наблюдения.
00:07:42А что думаете вы о Handy? Успели попробовать? Планируете использовать? Напишите
00:07:47в комментариях под этим видео. И если вам нравятся подобные технические разборы, дайте знать —
00:07:52поставьте лайк под видео и не забудьте подписаться на наш канал.
00:07:57С вами был Андрес из BetterStack, увидимся в следующих выпусках!

Key Takeaway

Бесплатное open-source приложение Handy обеспечивает высокую точность голосового ввода сложных технических терминов и полную конфиденциальность данных за счет локальной обработки речи на базе моделей Whisper и Parakeet без интернет-соединения.

Highlights

  • Handy — это полностью бесплатное open-source приложение под лицензией MIT для диктовки и распознавания речи, работающее локально без подключения к интернету, аккаунтов и подписок.

  • Архитектура программы объединяет бэкенд на Rust (Tauri), интерфейс на React и TypeScript, движок Transcribe CPP для моделей Whisper, Transcribe RS для моделей Parakeet, а также утилиту Silero VAD для фильтрации фонового молчания.

  • Модель Parakeet Unified с 600 млн параметров обрабатывается исключительно на центральном процессоре и работает примерно в 5 раз быстрее реального времени на среднем процессоре Intel Core i5.

  • Программа поддерживает локальную подгрузку пользовательских моделей Whisper в формате GGML в папку models без сложной настройки.

  • В сравнении распознавания сложных технических терминов (COBOL, SQLite, LLM, Grok, ChatGPT) Handy значительно превосходит встроенный голосовой ввод Google Documents и приближается к точности коммерческого сервиса Whisperflow.

Timeline

Архитектура и технический стек Handy

  • Handy работает полностью офлайн и отключает передачу аудиозаписей в сторонние облачные сервисы.
  • Технологический стек включает Tauri (Rust), React, TypeScript, CPAL для звукового ввода, RDEV для горячих клавиш и Rubato для редискретизации аудиопотока.
  • Обработку речи выполняют Transcribe CPP для моделей Whisper (форматы GGML/GGUF) и Transcribe RS для архитектуры Parakeet.

Локальная обработка данных решает проблему высокое нагрузки на процессор и зависимости от платных коммерческих подписок. Использование Tauri и Rust снижает потребление системных ресурсов, делая фоновую работу утилиты незаметной даже на портативных устройствах вроде Apple Macbook.

Механика работы и выбор локальных моделей

  • Алгоритм Silero VAD отсекает тишину во время записи, экономя вычислительные ресурсы процессора.
  • Распознанный текст вставляется напрямую в активное текстовое поле операционной системы после отпускания горячей клавиши.
  • Модель Parakeet Unified на 600 миллионов параметров работает исключительно на ЦП и достигает 5-кратного превышения скорости реального времени на процессоре Core i5.
  • Пользовательские обученные модели Whisper GGML подключаются путем простого копирования файлов в каталог models.

Пользователю доступна гибкая настройка баланса между скоростью и точностью распознавания через интерфейс со шкалами параметров. Модели Parakeet демонстрируют оперативность при работе на CPU, а открытая структура проекта позволяет добавлять языковые пакеты (включая русский и украинский) без модификации исходного кода.

Сравнительное тестирование точности транскрибации

  • Встроенный инструмент голосового ввода Google Documents полностью игнорирует пунктуацию и искажает специфические термины (COBOL, SQLite, LLM, Grok, ChatGPT).
  • Handy корректно расставляет знаки препинания и без ошибок распознает большинство узкоспециализированных IT-терминов.
  • Коммерческий сервис Whisperflow демонстрирует эталонное качество расшифровки, однако разрыв в точности с бесплатным Handy минимален.

Сравнение трех систем на тексте с упоминанием языков программирования, баз данных и нейросетей показывает полную непригодность стандартного ввода Google для технических задач. Handy предлагает уровень распознавания, сопоставимый с проприетарными платными решениями, сохраняя при этом приватность пользователя.

Community Posts

View all posts