Wie Sie mit Whisper Besprechungsprotokolle auf isolierten Sicherheits-PCs ohne Abtippen erstellen
30 de julho de 2026
0
Computing/SoftwareComments (0)
Log in to leave a comment
No posts yet
Log in to leave a comment
No posts yet
In Entwicklerräumen oder Rechenzentren von Finanzinstituten, die man ohne Sicherheitskarte nicht einmal betreten kann, eine Stunde lang Überstunden für Besprechungsprotokolle zu machen, ist wirklich quälend. Anträge auf kostenpflichtige KI-Tools werden vom Informationssicherheitsteam ohnehin nicht genehmigt, sodass am Ende nur manuelles Abtippen als Lösung bleibt. Mit Handy, einem Open-Source-Tool zur lokalen Spracherkennung, können Sie diesem Schmerz entkommen. Dies ist ein optimiertes Setup, bei dem kein einziges Byte an Audiodaten an externe Server gesendet wird und alles ausschließlich auf Ihrem Laptop läuft.
Auch wenn Handy ein Programm ist, das nur lokal läuft, bleibt es aus Sicht des Sicherheitsteams verdächtig. Da anfängliche Modell-Downloads oder Update-Pakete gesendet werden könnten, ist es beruhigender, Netzwerkeepakete auf Betriebssystemebene eigenhändig zu blockieren.
In einer Windows-Umgebung öffnen Sie einfach die Eingabeaufforderung mit Administratorrechten und fügen die Ausgehende Regel direkt ein.
netsh advfirewall firewall add rule name="Block Handy Outbound OUT" dir=out program="%LOCALAPPDATA%\Programs\handy\Handy.exe" action=block enable=yes aus.netsh advfirewall firewall show rule name="Block Handy Outbound OUT" ein, um den Blockierungsstatus direkt zu überprüfen.Wenn Sie macOS verwenden, blockieren Sie die Handy-Pakete in Little Snitch 6 einfach auf Basis von "Connections to Any Server" mit "Always Deny". Mit dieser einzigen Zeile sinkt die Wahrscheinlichkeit von Traffic, der gegen Sicherheitsrichtlinien verstößt, auf null.
Auch die Einstellung der Tastenkombinationen erfordert Aufmerksamkeit. Handy erkennt globale Eingabetasten über die rdev-Bibliothek der Sprache Rust, was häufig zu Konflikten mit den System-Standardkürzeln führt. Unter macOS ist es sauberer, Option + Space und unter Windows Alt + Space als Push-to-Talk-Taste zuzuweisen.
Die Architektur von OpenAI Whisper nutzt einen Text-Decoder, der das nächste Wort basierend auf den vorherigen Wörtern vorhersagt. Wenn Sie den Parameter initial_prompt dieses Decoders innerhalb des Limits von 224 Tokens mit häufig verwendeten Einzelwörtern und Projektnamen füllen, sinken Fehlliterationen spürbar. Das ist der Grund, warum die Worterkennungsfehlerrate (WER) sinkt, ohne dass das Modell neu trainiert werden muss.
다음은 IT 개발 및 아키텍처 회의입니다. 주요 용어: Kubernetes, CI/CD, React Native, Rust, Obsidian, AutoHotkey, PostgreSQL, gRPC, Docker, PR, Issue, Sprint.Bei starkem Hintergrundrauschen müssen auch Halluzinationen abgefangen werden, bei denen bestimmte Wörter kontinuierlich ausgegeben werden. Wenn Sie die Größe des Textkontextfensters n_max_text_ctx auf 128 senken und den temperature-Wert auf 0.0 fixieren, stoppt die Generierung zufälliger Texte.
Das Standardverhalten von Handy besteht darin, den konvertierten Text in die Zwischenablage zu legen. Das Problem dabei ist, dass bereits kopierter Code überschrieben wird. Es ist viel besser, die Zwischenablage zu umgehen und den Text zusammen mit einem Zeitstempel direkt an eine tägliche Obsidian-Notizdatei (.md) anzuhängen.
In einer Windows-Umgebung lässt sich dies lösen, indem Sie ein AutoHotkey-Skript im Hintergrund laufen lassen.
VaultPath := "C:\Users\" . A_UserName . "\ObsidianVault\DailyNotes\" . CurrentDate . ".md") und die Anweisung zum Hinzufügen von Dateitext (FileAppend, %LogEntry%, %VaultPath%, UTF-8).Sobald Sie dieses Automatisierungs-Setup abgeschlossen haben, reduziert sich die Zeit von über 40 Minuten, die Sie täglich mit Tippen und Fensterwechseln verschwendet haben, auf knapp 3 Minuten.
Sie können auch dafür sorgen, dass Markdown-Formatierungen automatisch angewendet werden, wenn Sie beim Sprechen bestimmte Steuerbefehle verwenden. Wenn Sie "안건 입력" sagen, erkennt das Skript dies und wandelt es in die Überschrift ### 📌 안건 um, und "액션 아이템" wird in ein #### ✅ 액션 아이템-Kontrollkästchen umgewandelt.
Handy nutzt das auf whisper.cpp basierende GGML/GGUF-Format. Wenn Sie die FP16-Modellgewichte auf das Niveau von Q5_1 (5,5 Bit) oder Q4_1 (4 Bit) reduzieren, sinkt der verfügbare RAM-Verbrauch auf ein Drittel.
Für ein M2 MacBook Air oder einen Laptop mit integrierter Grafik ist das Modell Whisper Small (Q5_1) angemessen. Bei 250 MB Speicherplatz auf der Festplatte und einer Speicherbelegung von etwa 350 MB wird die laufende Entwicklungsumgebung nicht belastet. In einer Desktop-Umgebung mit reichlich Grafikkarte können Sie das Modell Whisper Large-v3 (Q5_1) laden, um die Erkennungsrate zu maximieren.
Hier ist das Verfahren zur Optimierung des Arbeitsspeicherbedarfs:
C:\Users\{username}\AppData\Roaming\com.pais.handy\models\) auf und löschen Sie ungenutzte, gigabytegroße Modelldateien (.bin) vollständig.Dass es bei der Konvertierung langer Besprechungen aufgrund von Thread-Engpässen zu Stockungen kommt, liegt an den Einstellungen der physischen Kernanzahl. Anstatt sie an die Anzahl der logischen Kerne basierend auf Hyperthreading anzupassen, sollten Sie die Anzahl der Threads (n_threads) 1:1 mit der Anzahl der actual physical cores abgleichen, damit alles ohne Switching-Overhead sauber läuft.