Arrêtez de payer pour la dictée vocale ! Cette application gratuite est bien meilleure. (handy)
BBetter Stack
컴퓨터/소프트웨어AI/미래기술
Transcript
00:00:00Voici Handy. C'est une application de dictée et de reconnaissance vocale open source qui fonctionne
00:00:06entièrement hors ligne, sans cloud, sans abonnement, sans compte, et qui vous laisse choisir votre propre
00:00:12modèle de dictée préféré. Et honnêtement, je pense que c'est devenu mon outil de dictée
00:00:18vocal préféré. Dans cette vidéo, nous allons donc examiner Handy, voir comment il fonctionne et effectuer
00:00:24quelques tests pour voir ses performances et son classement face à des poids lourds commerciaux comme
00:00:29Whisperflow. Ça va être très sympa, alors plongeons dedans. Jusqu'à présent, j'étais plutôt sceptique
00:00:39vis-à-vis des applications de dictée vocale, et je ne trouvais rien qui me convenait. Je ne voulais pas utiliser
00:00:45de produits commerciaux ni payer pour de la dictée, et j'avais aussi peur qu'utiliser un outil
00:00:51open source avec un modèle local ne monopolise mon processeur. Mais Handy m'a fait changer d'avis sur ces deux
00:00:58points. Tout d'abord, parlons de la façon dont Handy est conçu et fonctionne. Handy a été créé par
00:01:04le développeur CJ Pace avec Taurai. Il utilise Rust pour le backend, ainsi que React et TypeScript pour gérer
00:01:12l'interface des paramètres. Transcribe CPP fait tourner la famille de modèles Whisper aux formats GGML et GGUF. Transcribe RS
00:01:20fait tourner Parakeet. La bibliothèque CPAL gère l'entrée audio multiplateforme. RDEV gère les raccourcis
00:01:28clavier globaux, et l'appli utilise une bibliothèque appelée Rubato pour le streaming audio en temps réel
00:01:33et le rééchantillonnage. Cette combinaison le rend super facile et extrêmement léger à utiliser, même sur mon MacBook.
00:01:40Côté utilisateur, le fonctionnement est d'une simplicité enfantine. Vous définissez un raccourci clavier personnalisé,
00:01:46puis vous l'activez/désactivez ou le maintenez enfoncé pour parler. Et pendant que vous le maintenez,
00:01:52un utilitaire nommé Silero VAD filtre silencieusement le silence en arrière-plan pour ne pas gâcher
00:01:58de puissance de calcul à transcrire du silence complet. Quand vous relâchez, Handy envoie l'audio au modèle
00:02:04que vous avez choisi, puis colle le texte transcrit directement dans le champ actif à ce moment-là. Pour être
00:02:11tout à fait juste, Handy n'est pas le seul ainsi. De nombreuses autres applications de dictée fonctionnent de manière similaire.
00:02:17Mais ce que j'aime le plus, c'est qu'on peut choisir son propre modèle préféré, et chaque modèle
00:02:22listé dans la section dédiée possède un indicateur de vitesse et de précision. C'est un peu comme choisir son
00:02:28personnage préféré dans Mario Kart : vous décidez quel critère est prioritaire pour vous. Dans mon cas,
00:02:34j'ai trouvé que le modèle Parakeet Unified de 600 millions de paramètres fonctionnait très bien, car Parakeet tourne
00:02:42uniquement sur CPU. Selon leurs propres chiffres, il s'exécute à environ cinq fois la vitesse du temps réel sur un processeur
00:02:48i5 milieu de gamme. Et mon M2 Max dépasse de loin cette configuration. Je ne le remarque même pas quand il tourne en
00:02:54arrière-plan. Et il y a tellement d'autres options. Ils ont même des modèles spécifiques
00:02:59à une seule langue. Par exemple, il y en a pour le russe, d'autres pour l'ukrainien. Et j'adore l'honnêteté
00:03:05de la mission de Handy. Handy ne cherche pas à être la meilleure application de reconnaissance vocale,
00:03:11mais la plus facile à forker. On peut même déposer ses propres modèles Whisper
00:03:17GGML affinés dans le dossier des modèles, redémarrer l'appli, et ils apparaissent comme option personnalisée.
00:03:23La raison principale pour laquelle je choisirais Handy plutôt que Whisperflow à tout moment de la
00:03:28journée, c'est qu'il fonctionne hors ligne, sans création de compte ni abonnement.
00:03:34J'ai la certitude que tous mes échantillons audio restent sur ma machine et ne sont pas
00:03:40utilisés en secret pour entraîner d'autres modèles vocaux. Je suis donc ravi qu'on dispose d'un outil
00:03:46de dictée sous licence MIT comme celui-ci. Tout cela a l'air formidable, mais mettons Handy à l'épreuve
00:03:52pour voir ce qu'il vaut. Je vais comparer ses performances à celles de Whisperflow et à celles du
00:03:58service de transcription de Google, disponible ici dans Google Docs. Sur cette page Google Docs,
00:04:05je vais activer le mode de saisie vocale de Google. En même temps, je vais maintenir enfoncé
00:04:11le raccourci de transcription de Handy. Ensuite, je vais me lancer dans un discours improvisé. À la fin,
00:04:18nous verrons quel résultat chaque service nous donne et nous les comparerons.
00:04:26Hier, je suis allé faire des courses et sur le chemin du retour, je me suis soudain rappelé que je devais
00:04:34rentrer brancher ma base de données SQLite à un service COBOL qui tourne sur mon cluster GPU personnalisé.
00:04:43Je ne savais pas vraiment comment faire. J'ai donc dû demander de l'aide. Le seul outil qui pouvait m'aider,
00:04:55selon moi, était un LLM appelé Grok. J'ai aussi obtenu un peu d'aide de ChatGPT. Au final,
00:05:04nous avons obtenu une application fonctionnelle, mais ce fut une vraie galère. Séparons les deux.
00:05:12Comme vous pouvez le voir, le service de saisie vocale de Google est bien pire. Il ne met aucune ponctuation,
00:05:20ne sait pas couper les phrases, n'a pas compris COBOL correctement, ni la base de données
00:05:27SQLite. Il n'a même pas saisi le mot LLM correctement. Il a pris Grok pour “rock”. Et voici
00:05:35mon préféré : il a pris ChatGPT pour “Chad GPT”. Chad GPT. Pas mal ! Donc voilà, vous pouvez clairement
00:05:45voir que Handy est bien meilleur car il met la ponctuation, reconnaît certains termes,
00:05:52et a bien retranscrit la plupart des termes techniques. Comparons maintenant ce résultat avec
00:05:58Whisperflow. Je vais essayer de répéter le même texte aussi fidèlement que possible pour être équitable.
00:06:08Hier, je suis allé faire quelques courses et sur le chemin du retour, je me suis soudain rappelé que je devais
00:06:16rentrer à la maison brancher ma base de données SQLite à un service COBOL qui tourne sur mon cluster GPU personnalisé.
00:06:26En réalité, je ne savais pas comment faire. J'ai donc dû demander de l'aide. Le seul outil capable de m'aider,
00:06:33selon moi, était un LLM appelé Grok. Et puis j'ai aussi reçu un peu d'aide de Chad GPT.
00:06:41Et à la fin, nous avons eu une application fonctionnelle, mais c'était vraiment une grosse galère.
00:06:48D'accord. Vous voyez clairement que Whisperflow a fait le meilleur travail. Il a bien séparé les phrases,
00:06:55et il a correctement orthographié tous les termes. Comme c'est une application commerciale, on s'attend
00:07:03à ce qu'elle soit meilleure que l'outil open source. Mais honnêtement, il n'y a pas une si grande différence
00:07:09entre ce résultat et celui de Whisperflow. Je préfère donc toujours utiliser Handy, simplement parce qu'il est gratuit,
00:07:17respectueux de la vie privée et open source. Mais Whisperflow a fait du très bon travail, c'est un excellent service malgré tout.
00:07:25Voilà tout, chers amis. C'est Handy en quelques mots. Je ne plaisantais pas en disant que
00:07:30c'est vraiment devenu mon outil de dictée préféré. Et j'ai presque peur d'oublier comment
00:07:36taper sur mon clavier si je me mets à trop l'utiliser ! Ce ne sont que mes impressions et mes observations,
00:07:42mais vous, que pensez-vous de Handy ? L'avez-vous essayé ? Comptez-vous l'utiliser ? Dites-le-nous dans les commentaires
00:07:47ci-dessous. Et si vous aimez ce genre d'analyses techniques, faites-le-moi savoir en
00:07:52cliquant sur le bouton « J'aime » sous la vidéo. N'oubliez pas non plus de vous abonner à notre chaîne.
00:07:57C'était Andres de BetterStack, et je vous dis à bientôt dans de prochaines vidéos !