¡Deja de pagar por la dictación! Esta app es mejor y es gratis. (handy)

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Esto es Handy. Es una aplicación de dictado y reconocimiento de voz de código abierto que funciona
00:00:06completamente fuera de línea, sin nube, sin suscripciones ni cuentas, y te permite elegir tu propio
00:00:12modelo de dictado favorito. Honestamente, creo que se ha convertido en mi herramienta preferida
00:00:18de dictado por voz. En este video, exploraremos Handy, veremos cómo funciona y haremos
00:00:24algunas pruebas para evaluar su rendimiento y compararlo con pesos pesados comerciales
00:00:29como Whisperflow. Va a ser muy divertido, así que empecemos. Hasta ahora, era bastante escéptico
00:00:39sobre las apps de dictado por voz y no encontraba ninguna que quisiera usar. No quería recurrir
00:00:45a productos comerciales ni pagar por dictado, y también me preocupaba que una herramienta de código abierto
00:00:51con un modelo local consumiera demasiada CPU. Pero Handy me hizo cambiar de opinión al respecto.
00:00:58Primero, hablemos de cómo está construido Handy y de cómo funciona. Fue desarrollado
00:01:04por CJ Pace con Tauri; usa Rust en el backend y React con TypeScript para la interfaz de
00:01:12configuración. Transcribe CPP ejecuta la familia de modelos Whisper en formato GGML y GGUF. Transcribe RS
00:01:20ejecuta Parakeet. La librería CPAL gestiona la entrada de audio multiplataforma. RDEV administra los atajos
00:01:28de teclado globales, y utiliza una librería llamada Rubato, que ofrece transmisión de audio en tiempo real
00:01:33y se encarga del remuestreo. Esta combinación hace que sea súper fácil y ligero de usar, incluso en mi Macbook.
00:01:40El flujo de trabajo es facilísimo para el usuario. Defines un atajo de teclado personalizado
00:01:46y luego lo activas/desactivas, o mantienes presionado para hablar. Mientras lo mantienes presionado, una utilidad
00:01:52llamada Silero VAD filtra silenciosamente el silencio de fondo para no malgastar
00:01:58procesamiento en transcribir silencios. Al soltarlo, Handy envía el audio al modelo que
00:02:04hayas elegido e pega el texto transcrito directamente en el campo que tengas enfocado en ese momento.
00:02:11Para ser justos, Handy no es único en esto. Muchas otras aplicaciones de dictado del mercado funcionan igual.
00:02:17Pero lo que más me encanta es que puedes elegir tu modelo preferido, y cada modelo
00:02:22incluido en la lista tiene un medidor de velocidad y precisión. Es como elegir tu personaje
00:02:28favorito en Mario Kart: tú decides qué métrica es tu prioridad. En mi caso, descubrí
00:02:34que usar el modelo Parakeet Unified de 600 millones de parámetros funciona genial, porque Parakeet corre
00:02:42exclusivamente en CPU. Según sus propios datos, se ejecuta a unas cinco veces la velocidad en tiempo real
00:02:48en un procesador i5 de gama media. Mi M2 Max supera con creces esa especificación, así que ni lo noto
00:02:54cuando se ejecuta en segundo plano. Hay muchísimas otras opciones para elegir. Incluso tienen modelos
00:02:59específicos para un solo idioma. Por ejemplo, hay algunos en ruso y otros en ucraniano. Y me encanta la honestidad
00:03:05de la misión de Handy: no pretende ser la mejor aplicación de dictado por voz,
00:03:11sino la más fácil de adaptar o modificar. Incluso puedes copiar tus propios modelos Whisper GGML
00:03:17personalizados en la carpeta de modelos de la app, reiniciarla y aparecerá como una opción personalizada.
00:03:23Creo que la razón principal por la que elegiría Handy antes que algo como Whisperflow en cualquier momento
00:03:28es que Handy funciona sin conexión, sin necesidad de crear una cuenta ni pagar suscripciones.
00:03:34Tengo la seguridad de que mis muestras de audio de dictado se quedan en mi equipo y no se usan
00:03:40a escondidas para entrenar otros modelos de voz. Me alegra mucho que contemos con una herramienta
00:03:46de dictado con licencia MIT como esta. Todo esto suena genial, pero pongamos a prueba a Handy
00:03:52para ver cómo rinde. Compararé el rendimiento de Handy con Whisperflow y también con
00:03:58el servicio de transcripción propio de Google, disponible aquí en Google Docs. En la página de Google Docs,
00:04:05activaré el modo de dictado por voz de Google. Al mismo tiempo, mantendré presionado
00:04:11el atajo de transcripción de Handy. Luego hablaré de forma espontánea y, al terminar,
00:04:18veremos qué resultado nos da cada servicio y los compararemos.
00:04:26Ayer fui a comprar algo de comer y, de camino a casa, recordé de repente que tenía que
00:04:34regresar y conectar mi base de datos SQLite a un servicio COBOL que se ejecuta en mi cluster de GPU personalizado.
00:04:43En realidad no sabía cómo hacerlo, así que tuve que pedir ayuda. La única herramienta que se me ocurrió que podía ayudarme
00:04:55era un LLM llamado Grok. Y también recibí un poco de ayuda de ChatGPT. Al final,
00:05:04logramos tener una aplicación funcional ejecutándose, pero fue todo un lío. Separemos estos dos.
00:05:12Como ven aquí, el servicio de dictado por voz de Google es mucho peor. No añade signos de puntuación,
00:05:20no sabe cómo separar las oraciones, no captó COBOL correctamente, ni la base de datos
00:05:27SQLite. Ni siquiera entendió bien la palabra LLM. Creyó que Grok era “rock”. Y esta
00:05:35es mi parte favorita: pensó que ChatGPT era “Chad GPT”. Chad GPT. Qué bien. En fin, pueden ver
00:05:45claramente que Handy es mucho mejor porque sí incluye puntuación, reconoce ciertos términos
00:05:52y captó bien la mayoría de los términos técnicos. Ahora comparemos también este resultado con
00:05:58Whisperflow. Intentaré repetir exactamente el mismo texto para ser lo más justo posible con la prueba.
00:06:08Ayer fui a comprar algo de comer y, de camino a casa, recordé de repente que tenía que
00:06:16regresar y conectar mi base de datos SQLite a un servicio COBOL que se ejecuta en mi cluster de GPU personalizado.
00:06:26En realidad no sabía cómo hacerlo, así que tuve que pedir ayuda. La única herramienta que se me ocurrió
00:06:33que podía ayudarme era un LLM llamado Grok. Y también recibí un poco de ayuda de ChatGPT.
00:06:41Al final, logramos tener una aplicación funcional ejecutándose, pero fue todo un lío.
00:06:48Bien. Se ve claramente que Whisperflow hizo el mejor trabajo. Separó las oraciones correctamente
00:06:55y captó bien todos los términos. Al ser una aplicación comercial, es de esperar que sea
00:07:03mejor que la herramienta de código abierto. Pero sinceramente, no hay tanta diferencia
00:07:09entre este resultado y el de Whisperflow. Sigo prefiriendo usar Handy simplemente porque es gratis,
00:07:17privado y de código abierto. Sin embargo, Whisperflow hizo un gran trabajo, así que sigue siendo un servicio sólido.
00:07:25Ahí lo tienen, amigos. Eso es Handy en pocas palabras. No bromeaba cuando dije que
00:07:30se ha convertido en mi herramienta de dictado favorita. De verdad me da miedo olvidar cómo
00:07:36escribir en el teclado si empiezo a usarla demasiado. Pero esas son solo mis opiniones y observaciones.
00:07:42¿Qué opinan ustedes de Handy? ¿Ya la probaron? ¿La usarían? Déjenoslo saber en la sección de comentarios
00:07:47aquí abajo. Amigos, si les gusta este tipo de análisis técnico, por favor déjenmelo saber
00:07:52dándole al botón de me gusta debajo del video. Tampoco olviden suscribirse al canal.
00:07:57Soy Andrés, de BetterStack, ¡y nos vemos en los próximos videos!

Key Takeaway

Handy ofrece dictado por voz gratuito, privado y fuera de línea al ejecutar modelos como Parakeet y Whisper en la CPU local con una precisión técnica superior a la de herramientas comerciales nativas.

Highlights

  • Handy es una aplicación de dictado por voz de código abierto con licencia MIT que funciona totalmente fuera de línea sin suscripciones ni almacenamiento en la nube.

  • El flujo de trabajo utiliza la utilidad Silero VAD para filtrar el silencio en tiempo real y evitar procesar audio innecesario.

  • El modelo Parakeet Unified de 600 millones de parámetros se ejecuta exclusivamente en CPU a cinco veces la velocidad en tiempo real en un procesador i5 de gama media.

  • Handy permite agregar modelos Whisper GGML personalizados copiando los archivos directamente en la carpeta de modelos de la aplicación.

  • En pruebas comparativas de dictado técnico, Handy superó a la herramienta nativa de Google Docs al integrar puntuación correcta y reconocer términos como SQLite y COBOL.

Timeline

Arquitectura técnica y componentes de Handy

  • Handy opera completamente fuera de línea sin requerir cuentas ni suscripciones de pago.
  • El backend está desarrollado en Rust mediante Tauri, mientras que la interfaz utiliza React con TypeScript.
  • La arquitectura combina Transcribe CPP para modelos Whisper, Transcribe RS para Parakeet, CPAL para audio, RDEV para atajos y Rubato para remuestreo en tiempo real.

Handy elimina la dependencia de servidores externos ejecutando los modelos de reconocimiento de voz de forma local. Su diseño ligero permite un procesamiento ágil en hardware convencional sin consumir recursos de CPU en exceso. La integración de librerías especializadas gestiona la captura de audio y los atajos globales sin añadir latencia perceptible.

Flujo de trabajo y selección de modelos locales

  • La herramienta Silero VAD filtra el silencio durante la grabación para optimizar el procesamiento de audio.
  • El modelo Parakeet Unified de 600 millones de parámetros se procesa en CPU a cinco veces la velocidad en tiempo real en un procesador i5.
  • La interfaz incluye indicadores de velocidad y precisión para cada modelo disponible y admite la adición manual de archivos Whisper GGML.

El usuario activa la grabación mediante un atajo de teclado y, al soltarlo, el texto se pega en el campo de texto enfocado. Cada modelo dentro de la aplicación presenta métricas claras que facilitan elegir entre velocidad o precisión según el hardware disponible. La privacidad queda garantizada al procesar todas las muestras de audio directamente en el equipo del usuario.

Prueba comparativa: Handy frente a Google Docs y Whisperflow

  • El dictado de Google Docs falló al omitir puntuación y confundir términos técnicos como SQLite, COBOL, LLM, Grok y ChatGPT.
  • Handy estructuró correctamente las oraciones e identificó con precisión la mayoría del vocabulario técnico de la prueba.
  • Whisperflow logró la transcripción más exacta, aunque la diferencia de rendimiento respecto a Handy no justifica el coste de una suscripción de pago.

Una prueba práctica con un texto técnico que contenía jerga de programación expuso las limitaciones de los servicios convencionales. Mientras Google Docs cometió errores de interpretación graves como transformar ChatGPT en “Chad GPT”, Handy mantuvo una estructura gramatical correcta y un reconocimiento preciso de las tecnologías mencionadas sin depender de la nube.

Community Posts

View all posts