Dieses 600M-Modell korrigiert, was Whisper hinterlässt
BBetter Stack
Computing/SoftwareInternet Technology
Transcript
00:00:00Die Spracherkennung ist mittlerweile so gut, dass die Transkription meistens nicht mehr das Problem ist, aber die Nachbearbeitung schon.
00:00:06Man kann GPT oder Claude auf jedes unübersichtliche Transkript loslassen oder ein 600-Millionen-Parameter-Modell verwenden, das genau dafür entwickelt wurde.
00:00:14Super Whisper hat gerade S1 Mini veröffentlicht. Es läuft komplett lokal, bereinigt Füllwörter, Korrekturen, Zahlen und die Formatierung.
00:00:22Außerdem ist es klein genug, um es direkt in die eigene ASR-Pipeline einzubinden.
00:00:26Ich habe es getestet und es ist Zeit, dir zu zeigen, wohin das alles führt.
00:00:30S1 Mini. Es dreht sich alles um die Pipeline, stell dir das also am besten so vor.
00:00:39Deine Sprache geht in das Transkriptionssystem ein, das du ohnehin schon nutzt.
00:00:43Whisper, Whisper CPP, Parakeet, dein eigener ASR-Dienst.
00:00:47Das liefert dir den Rohtext.
00:00:50Danach klinkt sich S1 Mini direkt ein.
00:00:53Rohtext rein, sauberer Text raus.
00:00:56Es entfernt Füllwörter wie "ähm", "äh", behebt Fehlstarts und Selbstkorrekturen und formatiert Zahlen, Daten sowie E-Mail-Adressen.
00:01:06Du kannst sogar den Tonfall der Ausgabe steuern.
00:01:09Dazu ist es nicht erforderlich, dein Transkript an eine andere API zu senden.
00:01:12Ich denke, genau darin liegt der Hauptwert.
00:01:16Ich ersetze damit keinen Transkriptions-Stack.
00:01:18Ich füge dem Ganzen lediglich eine winzige Bereinigungsschicht hinzu.
00:01:21Super Whisper hat außerdem S1 Voice und S1 Language veröffentlicht, aber das sind deren Cloud-Modelle.
00:01:27Für uns ist S1 Mini das Interessante, weil dieses Modell frei verfügbar ist.
00:01:32Und es kann komplett lokal ausgeführt werden, schauen wir also mal, ob es tatsächlich funktioniert.
00:01:36Wenn du Spaß an Coding-Tools hast, die deinen Workflow beschleunigen, abonniere gerne den Kanal.
00:01:39Bei uns erscheinen laufend neue Videos.
00:01:41Gut, ich lasse das Ganze auf meinem Mac M4 Pro laufen und die erste Überraschung ist die Größe.
00:01:46Ich muss kein riesiges lokales Modell herunterladen.
00:01:49Die quantisierte Version, die ich verwende, ist etwa 462 Megabyte groß.
00:01:53Ich habe sie mir einfach von Hugging Face geholt und über einen Curl-Befehl installiert.
00:01:57Und da GGUF-Versionen verfügbar sind, kannst du es mit den üblichen lokalen Werkzeugen ausführen.
00:02:02Ob Llama CPP, Ollama oder LM Studio, das bleibt ganz dir überlassen.
00:02:07Was auch immer schon zu Ihrem Workflow passt, aber hier habe ich Ollama gewählt, da es bereits lief.
00:02:13Nachdem ich das Modell installiert und eine einfache Modelfile auf meinem Desktop erstellt habe, kann ich es bereitstellen.
00:02:18und mit Ollama ausführen.
00:02:20Denke daran, das ist ein Transkriptionsbereiniger.
00:02:23Schauen wir uns also an, wie die Bereinigung aussieht und wie wir das in unseren Workflow integrieren können.
00:02:28Ich gebe ihm jetzt mal etwas Absichtlich Fehlerhaftes, in Ordnung?
00:02:31Hier ist das Rohtranskript.
00:02:33Du siehst hier, dass ich über einiges gestolpert bin.
00:02:36Ich hatte, äh, es ist kaputt.
00:02:37All diese Dinge passieren da wirklich.
00:02:39Und ganz am Ende sage ich: Schreibt an support@betterstack.com.
00:02:43Das enthält im Grunde alles, was Spracherkennung nervig macht.
00:02:47Es gibt ein Füllwort am Anfang, eine Korrektur mitten drin.
00:02:50Es kommen gesprochene Zahlen darin vor.
00:02:52Und in dieser laut ausgesprochenen E-Mail-Adresse ist einfach eine Menge los.
00:02:55Genau das ist der Punkt, an dem ein allgemeines LLM leicht zu viel tun könnte.
00:03:00Schauen wir mal, stattdessen macht S1 mini.
00:03:02Durch das Modell jagen und Bums, da haben wir es.
00:03:05Und diese Füllwörter verschwinden sofort und ohne jegliche Verzögerung.
00:03:08Es versteht, dass ich meine Meinung zwischendurch geändert habe.
00:03:11Die E-Mail-Adresse wird korrekt formatiert und das Ergebnis liest sich viel mehr wie das, was ich eigentlich.
00:03:17tippen wollte.
00:03:18Klar.
00:03:19Hier sind noch ein paar andere schnelle Beispiele, die ich durchgehen kann.
00:03:22Wir haben hier eins.
00:03:23Okay.
00:03:24Okay, schnell.
00:03:25Noch eins hier.
00:03:26Sieht gut aus.
00:03:27Und dieses hier.
00:03:29Du siehst, dass all das nahezu in Echtzeit geschah und du siehst das Ergebnis davon mit einer schnellen.
00:03:34Bereinigung.
00:03:35Es verwandelt einen Satz nicht plötzlich in eine lange, ausschweifende E-Mail.
00:03:39Es lässt den Großteil der Bedeutung unberührt.
00:03:41Es räumt lediglich das Chaos drumherum auf.
00:03:44Und für die Transkriptbereinigung ist das genau das, was ich mir wünsche.
00:03:47Jetzt baue ich das in einen schnellen Ablauf ein, denn es wäre cool, das in eine andere.
00:03:51echte Ebene mit Live-Sprache zu integrieren.
00:03:53Ich habe hier etwas voraufgezeichnetes Audio auf meinem Mac.
00:03:56Das dauert ungefähr 10 Sekunden.
00:03:57Ich nutze einfach MLX Whisper, da es sich unkompliziert zuerst auf meinem Mac ausführen lässt.
00:04:02Wir transkribieren es hier mit diesem Durchlauf.
00:04:05Wenn ich dann diesen Befehl hier ausführe, erledigt es die Bereinigung ebenso gut und gibt es als.
00:04:09Text aus.
00:04:10Das war die Verwendung meiner echten Audiodatei und die Arbeit damit.
00:04:14Nun, da S1 mini wahrscheinlich nicht das Hauptmodell in deiner Anwendung sein sollte.
00:04:18Das wollen wir eigentlich nicht.
00:04:19Es macht mehr Sinn als winzige Schicht zwischen zwei anderen Dingen.
00:04:23Stell dir vor, du baust ein komplett lokales Diktier-Setup auf.
00:04:26Whisper CPP verarbeitet das Audio.
00:04:29S1 mini übernimmt die Bereinigung.
00:04:31Dann wandert der Text direkt in deinen Editor, sodass nichts unseren Rechner verlässt.
00:04:35Das war's.
00:04:36Und genau da gehört S1 mini hin.
00:04:38Rohtext kommt rein.
00:04:40Sauberer Text geht raus.
00:04:42Und es gibt eine Menge Bereiche, in denen das wichtiger ist als bei Diktaten, oder?
00:04:46Also, ich weiß nicht.
00:04:46Nehmen wir Coding-Agenten.
00:04:47Bereinige die Korrektur, bevor sie den Agenten erreicht, und die Anweisung wird deutlich klarer.
00:04:52Das Gleiche gilt für per Sprache verfasste Slack-Nachrichten.
00:04:54E-Mail-Support-Tickets.
00:04:56Meeting-Notizen.
00:04:57Überall dort, wo du die Eingabe sprichst, das Ergebnis aber wie geschriebener Text aussehen soll.
00:05:01Jeder Bereinigungsschritt kann lokal ablaufen.
00:05:04Es gibt keinen zusätzlichen API-Aufruf und kein Transkript, das woanders hinwandert.
00:05:08Und dabei stellt sich eine naheliegende Frage.
00:05:10Wenn große Modelle das ohnehin schon gut machen, warum plagen wir uns überhaupt mit diesem winzigen Modell ab?
00:05:14Klar, ja.
00:05:15Du könntest das Transkript absolut an GPT, Claude oder ein lokales Llama-Modell schicken und sie.
00:05:21würden es wahrscheinlich völlig in Ordnung bereinigen.
00:05:23Aber genau darin liegt auch das Problem.
00:05:25Weil all diese Modelle im Grunde zu viel tun können.
00:05:28Ein allgemeines LLM kann dein Transkript umschreiben, zusammenfassen oder erweitern.
00:05:32Das habt ihr alle schon mal gesehen.
00:05:34Du weißt, was passiert, wenn wir einem LLM so etwas geben.
00:05:37Es kann den Text im Grunde in jede beliebige Richtung lenken.
00:05:41S1 mini hat eine viel überschaubarere Aufgabe.
00:05:43Unsaubere Sprache nehmen, normalisieren.
00:05:46Das ist eigentlich schon alles.
00:05:47Wir verwenden also ein 600-Millionen-Parameter-Modell, das exakt für diese Art von Transformation entwickelt wurde.
00:05:53Für diese eine Aufgabe erhältst du potenziell einen geringeren Ressourcenverbrauch und eine niedrigere Latenz.
00:05:57Und wenn du das im großen Stil machst, fällt keine API-Rechnung für die Bereinigung an.
00:06:01Es lohnt sich außerdem, S1 mini von etwas wie lokalem Whisper abzugrenzen.
00:06:05Whisper löst ein Problem.
00:06:07Audio wird zu Text.
00:06:09S1 mini löst das nächste.
00:06:12Dieser Text wird zu etwas, das aussieht, als hätte es ein Mensch bewusst getippt oder aufgeschrieben.
00:06:17Die Pipeline ist also wirklich einfach.
00:06:20Sprache, Rohtranskript, sauberer Text.
00:06:22Whisper bietet mittlerweile Modelle für beide Seiten dieses Workflows.
00:06:25Das Wichtige ist jedoch, dass du nicht deren gesamten Stack nutzen musst.
00:06:28Du kannst S1 mini nehmen und in deine eigene Pipeline einbauen.
00:06:31Und ich denke, genau deshalb ist dieses Modell interessanter als die Veröffentlichung eines weiteren winzigen LLMs.
00:06:35Aber hey, es ist nicht perfekt.
00:06:36Es gibt ein paar Einschränkungen, die wir kennen müssen, bevor wir es für etwas Wichtiges einsetzen.
00:06:40Kommen wir zu den guten Nachrichten.
00:06:41Nun, den guten Nachrichten.
00:06:42Es ist winzig.
00:06:43Es ist schnell.
00:06:43Es kann komplett lokal ausgeführt werden.
00:06:44Sobald die Transkription also abgeschlossen ist, gibt es keinen Netzwerk-Roundtrip nur für die Textbereinigung.
00:06:49Das ist ein riesiger Gewinn.
00:06:50Besonders stark ist es bei den offensichtlichen Dingen.
00:06:53Füllwörter, Selbstkorrekturen, gesprochene Zahlen, grundlegende Formatierung.
00:06:56Aber jetzt kommen wir zur ersten wirklich großen Einschränkung.
00:06:59Es unterstützt im Moment nur Englisch.
00:07:01Wenn dein Workflow mehrsprachige Transkriptbereinigung erfordert, ist das heute noch nicht das richtige Werkzeug.
00:07:05Zweitens: Verwechsle seine enge Fokussierung nicht mit einer Schwäche.
00:07:08Du lädst S1 mini nicht herunter, um Claude oder etwas Ähnliches zu ersetzen.
00:07:12Wenn du logisches Schlussfolgern, Zusammenfassungen oder einen allgemeinen lokalen Agenten brauchst, nutze Claude.
00:07:17Nutze ein allgemeines Modell.
00:07:18S1 mini bereinigt ausschließlich Transkripte.
00:07:21Das ist die Aufgabe.
00:07:22Und es gibt noch einen weiteren Unterschied, den man leicht verwechseln kann.
00:07:24S1 mini ist nicht S1 voice.
00:07:26S1 voice ist das Cloud-Spracherkennungsmodell von Super Whisper.
00:07:30Das ist ein anderer Teil des Stacks als das, was ich hier teste.
00:07:34Die gesamte S1-Familie ist außerdem noch sehr neu.
00:07:36Sie wurde am 19. August veröffentlicht, daher würde ich sie noch als frühe Software betrachten.
00:07:41Das Modell selbst kann eigenständig laufen, wodurch die Frage nach dem Nutzen recht einfach wird.
00:07:46Wer sollte das tatsächlich verwenden?
00:07:48Wenn du bereits lokale Spracherkennung betreibst, ergibt S1 mini viel Sinn, besonders wenn du.
00:07:53Whisper CPP, Parakeet oder ein eigenes ASR-System nutzt und dich gefragt hast, was du.
00:07:58danach mit dem Transkript anfangen sollst.
00:08:00Anstatt alles an ein vollständiges Allzweck-LLM zu senden, was viele von uns bereits tun, kannst du.
00:08:06dieses kleine Modell direkt nach der Transkription einsetzen und es die Bereinigung übernehmen lassen.
00:08:10Wenn Datenschutz wichtig ist, wird das Ganze noch nützlicher.
00:08:12Es läuft lokal.
00:08:13Das Transkript nur für die Formatierung an ein anderes Cloud-Modell zu schicken, fühlt sich unnötig an.
00:08:18Wenn du große Mengen Sprache verarbeitest, macht das Sinn.
00:08:20All diese kleinen Bereinigungen sind API-Aufrufe, die wir bei der Nutzung von.
00:08:24S1 mini gar nicht mehr brauchen.
00:08:25Ich verlinke die Hugging-Face-Seite von S1 mini in der Beschreibung, falls du es selbst ausprobieren möchtest.
00:08:30Wenn dir solche Coding-Tipps und -Tricks gefallen, abonniere unbedingt den BetterStack-Kanal.
00:08:33Wir sehen uns im nächsten Video.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video