Dieses 600M-Modell korrigiert, was Whisper hinterlässt

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Die Spracherkennung ist mittlerweile so gut, dass die Transkription meistens nicht mehr das Problem ist, aber die Nachbearbeitung schon.
00:00:06Man kann GPT oder Claude auf jedes unübersichtliche Transkript loslassen oder ein 600-Millionen-Parameter-Modell verwenden, das genau dafür entwickelt wurde.
00:00:14Super Whisper hat gerade S1 Mini veröffentlicht. Es läuft komplett lokal, bereinigt Füllwörter, Korrekturen, Zahlen und die Formatierung.
00:00:22Außerdem ist es klein genug, um es direkt in die eigene ASR-Pipeline einzubinden.
00:00:26Ich habe es getestet und es ist Zeit, dir zu zeigen, wohin das alles führt.
00:00:30S1 Mini. Es dreht sich alles um die Pipeline, stell dir das also am besten so vor.
00:00:39Deine Sprache geht in das Transkriptionssystem ein, das du ohnehin schon nutzt.
00:00:43Whisper, Whisper CPP, Parakeet, dein eigener ASR-Dienst.
00:00:47Das liefert dir den Rohtext.
00:00:50Danach klinkt sich S1 Mini direkt ein.
00:00:53Rohtext rein, sauberer Text raus.
00:00:56Es entfernt Füllwörter wie "ähm", "äh", behebt Fehlstarts und Selbstkorrekturen und formatiert Zahlen, Daten sowie E-Mail-Adressen.
00:01:06Du kannst sogar den Tonfall der Ausgabe steuern.
00:01:09Dazu ist es nicht erforderlich, dein Transkript an eine andere API zu senden.
00:01:12Ich denke, genau darin liegt der Hauptwert.
00:01:16Ich ersetze damit keinen Transkriptions-Stack.
00:01:18Ich füge dem Ganzen lediglich eine winzige Bereinigungsschicht hinzu.
00:01:21Super Whisper hat außerdem S1 Voice und S1 Language veröffentlicht, aber das sind deren Cloud-Modelle.
00:01:27Für uns ist S1 Mini das Interessante, weil dieses Modell frei verfügbar ist.
00:01:32Und es kann komplett lokal ausgeführt werden, schauen wir also mal, ob es tatsächlich funktioniert.
00:01:36Wenn du Spaß an Coding-Tools hast, die deinen Workflow beschleunigen, abonniere gerne den Kanal.
00:01:39Bei uns erscheinen laufend neue Videos.
00:01:41Gut, ich lasse das Ganze auf meinem Mac M4 Pro laufen und die erste Überraschung ist die Größe.
00:01:46Ich muss kein riesiges lokales Modell herunterladen.
00:01:49Die quantisierte Version, die ich verwende, ist etwa 462 Megabyte groß.
00:01:53Ich habe sie mir einfach von Hugging Face geholt und über einen Curl-Befehl installiert.
00:01:57Und da GGUF-Versionen verfügbar sind, kannst du es mit den üblichen lokalen Werkzeugen ausführen.
00:02:02Ob Llama CPP, Ollama oder LM Studio, das bleibt ganz dir überlassen.
00:02:07Was auch immer schon zu Ihrem Workflow passt, aber hier habe ich Ollama gewählt, da es bereits lief.
00:02:13Nachdem ich das Modell installiert und eine einfache Modelfile auf meinem Desktop erstellt habe, kann ich es bereitstellen.
00:02:18und mit Ollama ausführen.
00:02:20Denke daran, das ist ein Transkriptionsbereiniger.
00:02:23Schauen wir uns also an, wie die Bereinigung aussieht und wie wir das in unseren Workflow integrieren können.
00:02:28Ich gebe ihm jetzt mal etwas Absichtlich Fehlerhaftes, in Ordnung?
00:02:31Hier ist das Rohtranskript.
00:02:33Du siehst hier, dass ich über einiges gestolpert bin.
00:02:36Ich hatte, äh, es ist kaputt.
00:02:37All diese Dinge passieren da wirklich.
00:02:39Und ganz am Ende sage ich: Schreibt an support@betterstack.com.
00:02:43Das enthält im Grunde alles, was Spracherkennung nervig macht.
00:02:47Es gibt ein Füllwort am Anfang, eine Korrektur mitten drin.
00:02:50Es kommen gesprochene Zahlen darin vor.
00:02:52Und in dieser laut ausgesprochenen E-Mail-Adresse ist einfach eine Menge los.
00:02:55Genau das ist der Punkt, an dem ein allgemeines LLM leicht zu viel tun könnte.
00:03:00Schauen wir mal, stattdessen macht S1 mini.
00:03:02Durch das Modell jagen und Bums, da haben wir es.
00:03:05Und diese Füllwörter verschwinden sofort und ohne jegliche Verzögerung.
00:03:08Es versteht, dass ich meine Meinung zwischendurch geändert habe.
00:03:11Die E-Mail-Adresse wird korrekt formatiert und das Ergebnis liest sich viel mehr wie das, was ich eigentlich.
00:03:17tippen wollte.
00:03:18Klar.
00:03:19Hier sind noch ein paar andere schnelle Beispiele, die ich durchgehen kann.
00:03:22Wir haben hier eins.
00:03:23Okay.
00:03:24Okay, schnell.
00:03:25Noch eins hier.
00:03:26Sieht gut aus.
00:03:27Und dieses hier.
00:03:29Du siehst, dass all das nahezu in Echtzeit geschah und du siehst das Ergebnis davon mit einer schnellen.
00:03:34Bereinigung.
00:03:35Es verwandelt einen Satz nicht plötzlich in eine lange, ausschweifende E-Mail.
00:03:39Es lässt den Großteil der Bedeutung unberührt.
00:03:41Es räumt lediglich das Chaos drumherum auf.
00:03:44Und für die Transkriptbereinigung ist das genau das, was ich mir wünsche.
00:03:47Jetzt baue ich das in einen schnellen Ablauf ein, denn es wäre cool, das in eine andere.
00:03:51echte Ebene mit Live-Sprache zu integrieren.
00:03:53Ich habe hier etwas voraufgezeichnetes Audio auf meinem Mac.
00:03:56Das dauert ungefähr 10 Sekunden.
00:03:57Ich nutze einfach MLX Whisper, da es sich unkompliziert zuerst auf meinem Mac ausführen lässt.
00:04:02Wir transkribieren es hier mit diesem Durchlauf.
00:04:05Wenn ich dann diesen Befehl hier ausführe, erledigt es die Bereinigung ebenso gut und gibt es als.
00:04:09Text aus.
00:04:10Das war die Verwendung meiner echten Audiodatei und die Arbeit damit.
00:04:14Nun, da S1 mini wahrscheinlich nicht das Hauptmodell in deiner Anwendung sein sollte.
00:04:18Das wollen wir eigentlich nicht.
00:04:19Es macht mehr Sinn als winzige Schicht zwischen zwei anderen Dingen.
00:04:23Stell dir vor, du baust ein komplett lokales Diktier-Setup auf.
00:04:26Whisper CPP verarbeitet das Audio.
00:04:29S1 mini übernimmt die Bereinigung.
00:04:31Dann wandert der Text direkt in deinen Editor, sodass nichts unseren Rechner verlässt.
00:04:35Das war's.
00:04:36Und genau da gehört S1 mini hin.
00:04:38Rohtext kommt rein.
00:04:40Sauberer Text geht raus.
00:04:42Und es gibt eine Menge Bereiche, in denen das wichtiger ist als bei Diktaten, oder?
00:04:46Also, ich weiß nicht.
00:04:46Nehmen wir Coding-Agenten.
00:04:47Bereinige die Korrektur, bevor sie den Agenten erreicht, und die Anweisung wird deutlich klarer.
00:04:52Das Gleiche gilt für per Sprache verfasste Slack-Nachrichten.
00:04:54E-Mail-Support-Tickets.
00:04:56Meeting-Notizen.
00:04:57Überall dort, wo du die Eingabe sprichst, das Ergebnis aber wie geschriebener Text aussehen soll.
00:05:01Jeder Bereinigungsschritt kann lokal ablaufen.
00:05:04Es gibt keinen zusätzlichen API-Aufruf und kein Transkript, das woanders hinwandert.
00:05:08Und dabei stellt sich eine naheliegende Frage.
00:05:10Wenn große Modelle das ohnehin schon gut machen, warum plagen wir uns überhaupt mit diesem winzigen Modell ab?
00:05:14Klar, ja.
00:05:15Du könntest das Transkript absolut an GPT, Claude oder ein lokales Llama-Modell schicken und sie.
00:05:21würden es wahrscheinlich völlig in Ordnung bereinigen.
00:05:23Aber genau darin liegt auch das Problem.
00:05:25Weil all diese Modelle im Grunde zu viel tun können.
00:05:28Ein allgemeines LLM kann dein Transkript umschreiben, zusammenfassen oder erweitern.
00:05:32Das habt ihr alle schon mal gesehen.
00:05:34Du weißt, was passiert, wenn wir einem LLM so etwas geben.
00:05:37Es kann den Text im Grunde in jede beliebige Richtung lenken.
00:05:41S1 mini hat eine viel überschaubarere Aufgabe.
00:05:43Unsaubere Sprache nehmen, normalisieren.
00:05:46Das ist eigentlich schon alles.
00:05:47Wir verwenden also ein 600-Millionen-Parameter-Modell, das exakt für diese Art von Transformation entwickelt wurde.
00:05:53Für diese eine Aufgabe erhältst du potenziell einen geringeren Ressourcenverbrauch und eine niedrigere Latenz.
00:05:57Und wenn du das im großen Stil machst, fällt keine API-Rechnung für die Bereinigung an.
00:06:01Es lohnt sich außerdem, S1 mini von etwas wie lokalem Whisper abzugrenzen.
00:06:05Whisper löst ein Problem.
00:06:07Audio wird zu Text.
00:06:09S1 mini löst das nächste.
00:06:12Dieser Text wird zu etwas, das aussieht, als hätte es ein Mensch bewusst getippt oder aufgeschrieben.
00:06:17Die Pipeline ist also wirklich einfach.
00:06:20Sprache, Rohtranskript, sauberer Text.
00:06:22Whisper bietet mittlerweile Modelle für beide Seiten dieses Workflows.
00:06:25Das Wichtige ist jedoch, dass du nicht deren gesamten Stack nutzen musst.
00:06:28Du kannst S1 mini nehmen und in deine eigene Pipeline einbauen.
00:06:31Und ich denke, genau deshalb ist dieses Modell interessanter als die Veröffentlichung eines weiteren winzigen LLMs.
00:06:35Aber hey, es ist nicht perfekt.
00:06:36Es gibt ein paar Einschränkungen, die wir kennen müssen, bevor wir es für etwas Wichtiges einsetzen.
00:06:40Kommen wir zu den guten Nachrichten.
00:06:41Nun, den guten Nachrichten.
00:06:42Es ist winzig.
00:06:43Es ist schnell.
00:06:43Es kann komplett lokal ausgeführt werden.
00:06:44Sobald die Transkription also abgeschlossen ist, gibt es keinen Netzwerk-Roundtrip nur für die Textbereinigung.
00:06:49Das ist ein riesiger Gewinn.
00:06:50Besonders stark ist es bei den offensichtlichen Dingen.
00:06:53Füllwörter, Selbstkorrekturen, gesprochene Zahlen, grundlegende Formatierung.
00:06:56Aber jetzt kommen wir zur ersten wirklich großen Einschränkung.
00:06:59Es unterstützt im Moment nur Englisch.
00:07:01Wenn dein Workflow mehrsprachige Transkriptbereinigung erfordert, ist das heute noch nicht das richtige Werkzeug.
00:07:05Zweitens: Verwechsle seine enge Fokussierung nicht mit einer Schwäche.
00:07:08Du lädst S1 mini nicht herunter, um Claude oder etwas Ähnliches zu ersetzen.
00:07:12Wenn du logisches Schlussfolgern, Zusammenfassungen oder einen allgemeinen lokalen Agenten brauchst, nutze Claude.
00:07:17Nutze ein allgemeines Modell.
00:07:18S1 mini bereinigt ausschließlich Transkripte.
00:07:21Das ist die Aufgabe.
00:07:22Und es gibt noch einen weiteren Unterschied, den man leicht verwechseln kann.
00:07:24S1 mini ist nicht S1 voice.
00:07:26S1 voice ist das Cloud-Spracherkennungsmodell von Super Whisper.
00:07:30Das ist ein anderer Teil des Stacks als das, was ich hier teste.
00:07:34Die gesamte S1-Familie ist außerdem noch sehr neu.
00:07:36Sie wurde am 19. August veröffentlicht, daher würde ich sie noch als frühe Software betrachten.
00:07:41Das Modell selbst kann eigenständig laufen, wodurch die Frage nach dem Nutzen recht einfach wird.
00:07:46Wer sollte das tatsächlich verwenden?
00:07:48Wenn du bereits lokale Spracherkennung betreibst, ergibt S1 mini viel Sinn, besonders wenn du.
00:07:53Whisper CPP, Parakeet oder ein eigenes ASR-System nutzt und dich gefragt hast, was du.
00:07:58danach mit dem Transkript anfangen sollst.
00:08:00Anstatt alles an ein vollständiges Allzweck-LLM zu senden, was viele von uns bereits tun, kannst du.
00:08:06dieses kleine Modell direkt nach der Transkription einsetzen und es die Bereinigung übernehmen lassen.
00:08:10Wenn Datenschutz wichtig ist, wird das Ganze noch nützlicher.
00:08:12Es läuft lokal.
00:08:13Das Transkript nur für die Formatierung an ein anderes Cloud-Modell zu schicken, fühlt sich unnötig an.
00:08:18Wenn du große Mengen Sprache verarbeitest, macht das Sinn.
00:08:20All diese kleinen Bereinigungen sind API-Aufrufe, die wir bei der Nutzung von.
00:08:24S1 mini gar nicht mehr brauchen.
00:08:25Ich verlinke die Hugging-Face-Seite von S1 mini in der Beschreibung, falls du es selbst ausprobieren möchtest.
00:08:30Wenn dir solche Coding-Tipps und -Tricks gefallen, abonniere unbedingt den BetterStack-Kanal.
00:08:33Wir sehen uns im nächsten Video.

Key Takeaway

Das 600-Millionen-Parameter-Modell S1 Mini bereinigt lokale Sprachtranskripte in Echtzeit, indem es Füllwörter entfernt und Daten formatiert, ohne dass Allzweck-LLMs oder Cloud-APIs erforderlich sind.

Highlights

  • Das Modell S1 Mini verfügt über 600 Millionen Parameter und bereinigt Rohtranskripte von Spracherkennungssystemen.

  • Die quantisierte GGUF-Version von S1 Mini ist rund 462 Megabyte groß und läuft vollständig lokal.

  • Die Ausführung erfolgt über lokale Werkzeuge wie Ollama, Llama CPP oder LM Studio auf einem Mac M4 Pro.

  • S1 Mini entfernt Füllwörter wie “ähm”, behebt Selbstkorrekturen und formatiert Zahlen, Daten sowie E-Mail-Adressen.

  • Das Modell unterstützt gegenwärtig ausschließlich die englische Sprache.

Timeline

Einführung in S1 Mini als lokale Bereinigungsschicht

  • S1 Mini klinkt sich direkt nach dem Transkriptionssystem ein.
  • Das Modell entfernt Füllwörter, behebt Fehlstarts und formatiert Zahlen sowie E-Mail-Adressen.
  • Der Tonfall der Ausgabe lässt sich direkt steuern.

Die Nachbearbeitung von Spracherkennung stellt oft ein größeres Problem dar als die eigentliche Transkription. Anstelle von großen Sprachmodellen wie GPT oder Claude übernimmt S1 Mini diese Aufgabe als winzige Schicht. Das Modell ist frei verfügbar und läuft komplett lokal, wodurch keine Daten an externe APIs gesendet werden müssen.

Lokale Installation und Integration in den Workflow

  • Die quantisierte Version des Modells hat eine Dateigröße von etwa 462 Megabyte.
  • Die Installation erfolgt über Hugging Face und Curl.
  • Das Modell lässt sich nahtlos mit lokalen Werkzeugen wie Ollama ausführen.

Auf einem Mac M4 Pro lässt sich die quantisierte GGUF-Version unkompliziert einrichten. Nach dem Erstellen einer einfachen Modelfile läuft das Modell über Ollama. Bei der Eingabe von fehlerhaftem Rohtext mit Füllwörtern und unstrukturierten E-Mail-Adressen entfernt das Modell die Störfaktoren nahezu verzögerungsfrei.

Anwendungsbereiche und Abgrenzung zu Allzweck-LLMs

  • S1 Mini lässt sich in Kombination mit MLX Whisper für voraufgezeichnetes Audio einsetzen.
  • Das Modell eignet sich für Diktat-Setups, Coding-Agenten und Slack-Nachrichten.
  • Allzweck-Modelle neigen oft dazu, den Text zu stark umzuschreiben oder zu erweitern.

Im Vergleich zu großen Sprachmodellen besitzt S1 Mini eine klar umrissene Aufgabe: rohe Sprache nehmen und normalisieren. Dadurch entfallen unnötige API-Kosten und unkontrollierte Textänderungen. Der saubere Text fließt direkt in den Editor oder an nachfolgende Agenten weiter, während sämtliche Berechnungen lokal auf dem Rechner verbleiben.

Einschränkungen und Zielgruppe des Modells

  • S1 Mini unterstützt zurzeit ausschließlich die englische Sprache.
  • Das Modell ist nicht für logisches Schlussfolgern oder allgemeine Zusammenfassungen gedacht.
  • Die gesamte S1-Familie befindet sich seit ihrer Veröffentlichung im August in einem frühen Software-Stadium.

Trotz der hohen Geschwindigkeit und des lokalen Datenschutzes existieren klare Grenzen. Mehrsprachige Transkripte können aktuell nicht verarbeitet werden, und für komplexe Aufgaben bleibt Claude die bessere Wahl. Dennoch bietet S1 Mini einen enormen Nutzen für alle Anwender, die bereits lokale Spracherkennung nutzen und eine effiziente Lösung für die nachgelagerte Textbereinigung suchen.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video