Dieses Open-Weights-TTS schlägt ElevenLabs... Dann habe ich die Lizenz gelesen

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Ein Open-Weight-Text-zu-Sprache-Modell hat gerade 11Labs bei Artificial Analysis geschlagen.
00:00:05Das ist Breeze.
00:00:07Es ist ein 3 GB großer Download.
00:00:09Es läuft auf deinem MacBook, und wenn du das Generierte tatsächlich für die Arbeit nutzen willst,
00:00:13darfst du das wahrscheinlich nicht einmal.
00:00:15Es liegt nicht daran, dass das Ergebnis so gut ist.
00:00:17Nun, es ist ganz in Ordnung.
00:00:18Es ist ziemlich gut.
00:00:19Aber die eigentliche Lizenz ist das Problem.
00:00:21Ich möchte dir also zuerst zeigen, was Breeze kann und wie wir das Ganze tatsächlich nutzen können.
00:00:30Das ist Breeze TTS 2.
00:00:33Es wurde erstmals am 25. August von einem Unternehmen namens Breeze Blue veröffentlicht.
00:00:37Der Benchmark ist ja ganz nett, aber wie wir eine Stimme erstellen, ist so viel besser.
00:00:41Die meisten Open-Text-to-Speech-Modelle heutzutage bieten Stimmklonierung.
00:00:45Man gibt ihnen etwa 10 Sekunden Referenzaudio, meist mit einem genauen Transkript,
00:00:50und sie versuchen, diese Stimme zu kopieren.
00:00:52Das funktioniert, aber wir brauchen natürlich von Anfang an eine Stimme.
00:00:56Breeze braucht keine.
00:00:58Du beschreibst einfach die Stimme, die du tatsächlich verwenden möchtest.
00:01:01Das könnte also etwa so klingen:
00:01:03ein warmer, nachdenklicher, weiser alter Mann mit einer ruhigen, reflektierten Art.
00:01:08Denk an Morgan Freeman.
00:01:09Und es generiert diese Stimme anhand der Beschreibung.
00:01:12Es gibt keine Referenzaufnahme.
00:01:14Heutzutage nennt man das Voice Design,
00:01:16und wir sehen immer mehr Open-Weight-Sprachmodelle
00:01:19mit zunehmend guten Fähigkeiten im Bereich Voice Design.
00:01:23Das schließt eine echte Lücke bei Open-TTS.
00:01:26Kokoro bietet feste Voreinstellungen.
00:01:29Chatterbox benötigt Referenzaudio.
00:01:31Breeze kann die Stimme aus einem Satz aufbauen.
00:01:34Hören wir es uns also an.
00:01:35Wenn du Programmiertools magst, die deinen Workflow beschleunigen, abonniere unbedingt den Kanal.
00:01:39Bei uns erscheinen laufend neue Videos.
00:01:41Das Ganze einzurichten passiert größtenteils direkt in meinem Terminal.
00:01:45Ich habe einfach eine virtuelle Umgebung erstellt und dann MLX Audio per pip installiert.
00:01:49Das läuft auf meinem Mac, weshalb ich hier MLX brauchte.
00:01:53Wenn du Linux nutzt oder eine NVIDIA-GPU hast,
00:01:56ist die Einrichtung etwas anders, aber genauso unkompliziert.
00:02:00Ich habe also denselben Satz genommen und ihn hier in meinem Terminal
00:02:03mit zwei verschiedenen Stimmungsanweisungen ausgeführt.
00:02:05Lass uns die erste starten.
00:02:06Willkommen beim BetterStack-Kanal.
00:02:09Alles rund um Tech und KI – hast du schon abonniert?
00:02:13Jetzt genau derselbe Satz noch einmal mit etwas anderer Intonation.
00:02:19Willkommen beim BetterStack-Kanal.
00:02:21Alles rund um Tech und KI – hast du schon abonniert?
00:02:27Das waren dieselben Wörter, aber völlig unterschiedliche Personen beziehungsweise KI-Stimmen.
00:02:33Obwohl das weit oben rangiert, kann ich immer noch hören, dass es eine KI-Stimme ist, oder?
00:02:37Es ist also gut.
00:02:38Es schlägt sich recht passabel, und die Möglichkeit, Emotionen festzulegen, ist tatsächlich auch da.
00:02:42Nun gibt es hier eine Einstellung, die dafür der Schlüssel ist: die sogenannte CFG-Skala.
00:02:47Die steuert, wie stark das Modell deiner Stimmbeschreibung folgt.
00:02:51Wenn du sie verringerst, driftet das Modell wieder zu einer generischeren Stimme ab.
00:02:55Vier ist der Wert in deren Dokumentation, den ich hier für ein paar Stimmen ebenfalls verwende.
00:03:00Aber lass mich das mal schnell auf eins herunterregeln, um eine reine KI-Stimme zu bekommen.
00:03:05Los geht's.
00:03:05Willkommen beim BetterStack-Kanal.
00:03:08Diese Stimme ist eindeutig KI.
00:03:10Du verstehst, was ich meine, oder?
00:03:11Das klang nach purer KI.
00:03:12Man kann jetzt also auch vokale Ereignisse direkt in den Text einfügen, was wirklich cool ist.
00:03:18Ich kann buchstäblich tippen, ich kann Klammern setzen.
00:03:20Ich könnte “Seufzen” eingeben und die Klammern schließen.
00:03:23Am Ende könnte ich “Lachen” oder “Weinen” einfügen, mitten im Satz, am Ende oder am Anfang.
00:03:28Hören wir es uns an.
00:03:30Wenn ich versuche, dir einen Witz zu erzählen, kann ich mich einfach nicht mehr halten.
00:03:35Das ist Teil des Textes, was ein nettes Feature ist.
00:03:38Aber viele Open-Weight-Sprachmodelle kommen mittlerweile ebenfalls damit auf den Markt.
00:03:42Urteile also selbst, wie gut Breeze im Vergleich zu anderen KIs tatsächlich klang.
00:03:46Ist es gut?
00:03:47Verdient es das Ranking, das es hat?
00:03:50Nun, Breeze ist aus Bausteinen zusammengesetzt, die dir vielleicht bekannt vorkommen.
00:03:54Ein Qwen-3-Backbone übernimmt die Sprachmodellierung.
00:03:57Es gibt einen T5-Gemma-2-Textencoder.
00:03:59Und MIMI kümmert sich um den Audiocodec.
00:04:01Das Modell hat rund 3 Milliarden Parameter und gibt 24-Kilohertz-Monoaudio aus.
00:04:07Aber es gibt ein Detail, an das du dich erinnern solltest.
00:04:09Der Audio-Tokenizer stammt von Qwen 3 TTS ab, und Qwen 3 TTS ist unter Apache 2.0 lizenziert.
00:04:16Ein Teil dieses Modells basiert also auf equivalenter Open Source.
00:04:19Behalte das im Hinterkopf, denn in einer Minute wird das ziemlich ironisch.
00:04:23Zuerst müssen wir jedoch über die Behauptung sprechen, die Breeze bekannt gemacht hat.
00:04:27Breeze hat 11Labs geschlagen.
00:04:29Ja, sie haben sie geschlagen.
00:04:30Das stimmt technisch gesehen, aber basierend auf dem Klang bin ich mir nicht sicher, wie.
00:04:36Hier wird es auch komplizierter, als es einfach so zu behaupten.
00:04:40Artificial Analysis betreibt eine Sprach-Arena basierend auf blinden, paarweisen menschlichen Bewertungen.
00:04:45Das ist eine unabhängige Benchmarking-Firma, nicht Breeze Blue.
00:04:49In deren Anbieter-Bestenliste für Stimmen liegt Breeze bei 1215.
00:04:53Das ist der Elo-Score.
00:04:5411Labs Conversational liegt bei 1210.
00:04:57Also ja, rein technisch gesehen schlagen sie sie um fünf Punkte.
00:05:00Breeze schlägt 11Labs.
00:05:01Okay, aber wenn ich dem jetzt noch weiter nachgehe, tauchen Probleme auf.
00:05:06Erstens hat Breeze im oberen Bereich die wenigsten Stimmen erhalten.
00:05:09Etwa 1200.
00:05:1111Labs hat über 4.500 Stimmen.
00:05:14Breeze hat also den am wenigsten gefestigten Score in diesem Teil der Tabelle.
00:05:17Und neue Modelle bekommen manchmal einen kleinen Willkommensbonus.
00:05:21Zweitens ist Breeze eigentlich gar nicht die Nummer eins.
00:05:24Cartesia Sonic 3.6 liegt bei 1282.
00:05:27Zu sagen, Breeze schlägt kommerzielle Spitzensysteme, stimmt also in gewisser Weise.
00:05:32Es ist aber auch ziemlich selektiv.
00:05:33Das dritte Problem ist jedoch der springende Punkt.
00:05:36Diese Bestenliste erlaubt es jedem Modell, seine eigenen Stimmen zu verwenden.
00:05:39Artificial Analysis hat eine weitere Bestenliste, bei der die Modelle exakt denselben Prompt erhalten.
00:05:45Derselbe Test.
00:05:46Es ist im Grunde ein fairer Vergleich.
00:05:49Und plötzlich sieht Breeze ganz anders aus.
00:05:51In diesem Ranking erzielt es einen Wert von 1002.
00:05:54Platz drei unter den Open-Weight-Modellen.
00:05:56Platz 16 von insgesamt 39.
00:05:59Und hinter VoxTroll von Mistral.
00:06:01Breeze ist also verdammt gut darin, mit vielen davon zu konkurrieren.
00:06:04Aber es ist nicht die Nummer eins.
00:06:05Und es scheint besonders gut abzuschneiden, wenn es die zu vergleichenden Stimmen selbst aussuchen darf.
00:06:10Das ändert die Art und Weise, wie wir das betrachten sollten, gewaltig.
00:06:13Aber das war noch nicht einmal das Grösste, das mir aufgefallen ist.
00:06:16Das größte Problem an der ganzen Sache ist die Lizenz.
00:06:19Und das ist der Punkt, den viele einfach übergehen.
00:06:22Ja, der Code ist unter Apache 2.0 lizenziert.
00:06:24Da gibt es kein Problem.
00:06:26Die Gewichte allerdings nicht.
00:06:27Für die Gewichte gilt die sogenannte Breeze Blue Research and Non-Commercial License.
00:06:33Ich möchte hier deren genaue Formulierungen verwenden, da dieser Unterschied tatsächlich von Bedeutung ist.
00:06:38Was das besagt, was das tatsächlich besagt, ist Folgendes:
00:06:42Diese Vereinbarung erlaubt die kostenlose Nutzung der Modellmaterialien zu Forschungs- und nicht-kommerziellen Zwecken.
00:06:47Sie gewährt keinerlei kommerzielle Rechte und ist keine Open-Source-Lizenz.
00:06:52Das sind deren Worte.
00:06:53Keine Open-Source-Lizenz.
00:06:55Okay.
00:06:56Manchmal sieht man die Kennzeichnung “nicht-kommerziell” bei einem Modell, und das bedeutet im Grunde nur: “Verkauft unsere Gewichte nicht weiter.”
00:07:02Ja, okay.
00:07:02Das ergibt Sinn.
00:07:04Das ist hier aber nicht gemeint.
00:07:05Deren Definition eines kommerziellen Zwecks schließt die produktive Nutzung ein,
00:07:09die Verwendung in einem Produkt oder Dienst sowie das Hosten hinter einer API.
00:07:13Und dann kommt der Teil, der hier erst richtig reinhaut.
00:07:16Als ob das nicht schon genug wäre,
00:07:17schließt es auch die Nutzung der Ergebnisse für interne Abläufe über begrenzte Evaluierungen hinaus ein.
00:07:23Die Ergebnisse.
00:07:24Okay, was bedeutet das eigentlich?
00:07:26Nicht nur das Modell selbst, sondern auch das Audio, das es generiert.
00:07:29Und das geht noch immer weiter so.
00:07:31Es gibt keine Ausnahme für Creator, keine Ausnahme für kleine Unternehmen.
00:07:35Es gibt keine Umsatzgrenze.
00:07:37Hier gibt es gar nichts.
00:07:38Viele Lizenzen für nicht-kommerzielle Nutzung lassen Grauzonen zu.
00:07:42Hier wird sehr weit gegangen, um vieles davon im Grunde zu blockieren.
00:07:45Machen wir das Ganze also mal etwas praxisnaher.
00:07:47Wann könnte man das nutzen?
00:07:48Eine generierte Breeze-Stimme in ein Produkt einbauen?
00:07:51Nope.
00:07:52Das wird wohl nichts.
00:07:53In einem monetarisierten YouTube-Video verwenden?
00:07:56Das ist nicht monetarisiert.
00:07:58Ja, nee.
00:07:58Wird nichts.
00:07:59In irgendeinem Podcast?
00:08:00Wiederum: Wird nichts.
00:08:02Das blockiert also so ziemlich alles.
00:08:04Die Lizenz nennt explizit Sponsoring- und Abonnement-Einnahmen.
00:08:0934 Dollar pro Million Zeichen, sobald man dafür zahlt.
00:08:12Aber selbst da stellt die Lizenz etwas sehr klar.
00:08:15Das Bezahlen für die API gibt einem keine kommerziellen Rechte für selbst gehostete Modelle
00:08:19oder die Ausgaben von deren selbst gehostetem Modell.
00:08:22Und wenn man das sieht, ergibt das ganze Setup total viel Sinn.
00:08:25Die offenen Gewichte sind die Demo.
00:08:27Die API ist ihr eigentliches Produkt.
00:08:30Wie nutzbar sind diese offenen Gewichte also überhaupt?
00:08:33Da könnt ihr selbst urteilen.
00:08:34Nun, das war sehr cool.
00:08:36Voice-KI ist sehr cool.
00:08:37Aber ich habe mir Vox CPM2 vor gar nicht langer Zeit mal genauer angesehen.
00:08:41Vox CPM2 war ehrlich gesagt Wahnsinn.
00:08:43Es war sehr, und ich meine sehr, beeindruckend.
00:08:45Wenn ich Breeze also gegen Vox CPM antreten lasse,
00:08:48würde Breeze das im Handumdrehen verlieren.
00:08:50Und das hat alles mit der Lizenz zu tun.
00:08:52Spektakel.
00:08:53Wer also eine ehrliche, offene Voice-Clone-Stimmen-KI sucht,
00:08:56bleibe ich vorerst bei Vox CPM2.
00:08:58Da es im Grunde dieselben Funktionen wie Breeze hat,
00:09:00und vielleicht sogar noch besser ist.
00:09:02Solltest du Breeze nutzen?
00:09:03Das ist hier die Frage.
00:09:04Ich glaube, das habe ich beantwortet, aber schauen wir uns das mal an.
00:09:06Um ein bisschen mit Voice-KI zu spielen, ja, durchaus.
00:09:09Es ist cool zu sehen, wohin sich Voice-KI entwickelt.
00:09:12Breeze ist ziemlich gut, okay?
00:09:14Modelle zu testen macht Spaß,
00:09:16vor allem, wenn sie immer besser werden.
00:09:18Wohin geht die Reise?
00:09:19Stimmendesign aus einer Textbeschreibung
00:09:21ist eine wirklich verdammt coole Funktion.
00:09:23Aber wenn ihr irgendetwas kommerziell veröffentlicht,
00:09:25nutzt das nicht.
00:09:26Ich würde etwas anderes verwenden,
00:09:27egal wo Breeze in der Bestenliste steht.
00:09:30Kokoro nutzt Apache 2.0.
00:09:32Chatterbox nutzt MIT.
00:09:34Vox CPM sehen wir uns noch an,
00:09:35denn das könnte sie alle schlagen.
00:09:36Offene Gewichte und Open Source
00:09:38hörten vor einer Weile auf, dasselbe zu bedeuten.
00:09:40Breeze macht diesen Unterschied unmöglich zu ignorieren.
00:09:43Das Benchmark zeigt euch, was das Modell leisten kann.
00:09:45Die Lizenz sagt euch, was ihr damit machen dürft.
00:09:48Ich bin Josh von BetterStack.
00:09:49Wenn ihr solche Coding-Tipps und -Tricks mögt,
00:09:51abonniert gerne den Kanal.
00:09:53Wir sehen uns im nächsten Video.

핵심 요약

Das Open-Weight-Modell Breeze Blue TTS 2 liefert starke Audioergebnisse und schlägt in bestimmten Benchmarks kommerzielle Systeme, ist jedoch aufgrund strenger nicht-kommerzieller Lizenzbedingungen für die reale Produktivnutzung ungeeignet.

하이라이트

  • Das Open-Weight-Modell Breeze Blue TTS 2 erfordert eine 3 GB große Datei und läuft lokal auf einem MacBook.

  • Breeze Blue erreicht im Elo-Score der Sprach-Arena von Artificial Analysis 1215 Punkte und schlägt damit 11Labs Conversational knapp.

  • In einem fairen Blindtest mit identischen Prompts belegt Breeze Platz 16 von insgesamt 39 Modellen.

  • Die Modellgewichte von Breeze unterliegen der Breeze Blue Research and Non-Commercial License und verbieten jegliche kommerzielle Nutzung.

  • Das Modell setzt sich aus einem Qwen-3-Backbone, einem T5-Gemma-2-Textencoder und dem MIMI-Audiocodec zusammen.

  • Vokale Ereignisse wie Seufzen oder Lachen lassen sich direkt durch Klammern in den Text einfügen.

타임라인

Einführung in Breeze TTS 2 und Voice Design

  • Das Modell Breeze Blue TTS 2 benötigt einen 3 GB großen Download und läuft lokal auf dem MacBook.
  • Im Gegensatz zu Systemen mit Stimmklonierung erzeugt Breeze Stimmen direkt aus einer reinen Textbeschreibung.
  • Die Stimmgenerierung erfolgt komplett ohne Referenzaufnahme.

Das Text-zu-Sprache-Modell Breeze Blue TTS 2 zeichnet sich durch die Fähigkeit aus, Stimmen über einfache Beschreibungen wie einen weisen alten Mann zu erzeugen. Die Installation erfolgt unkompliziert über MLX Audio im Terminal, wodurch das Modell direkt auf Apple-Silicon-Geräten läuft.

Stimmsteuerung und vokale Ereignisse

  • Die CFG-Skala steuert, wie exakt das Modell der zugewiesenen Stimmbeschreibung folgt.
  • Zusätzlich zur Intonation lassen sich vokale Ereignisse wie Seufzen oder Lachen direkt über Klammern in den Text integrieren.
  • Das Modell baut auf einem Qwen-3-Backbone, einem T5-Gemma-2-Textencoder und dem MIMI-Audiocodec auf.

Durch die Anpassung der CFG-Skala lässt sich die Intensität der Stimmbeschreibung regulieren. Zudem erlaubt das System die direkte Platzierung von Emotionen und Geräuschen im Textfluss, was die Natürlichkeit der ausgegebenen Sprache erhöht. Das 3 Milliarden Parameter große Modell gibt dabei 24-Kilohertz-Monoaudio aus.

Benchmark-Ergebnisse und Leistungsvergleich

  • In der Anbieter-Bestenliste von Artificial Analysis erreicht Breeze einen Elo-Score von 1215 und übertrifft knapp 11Labs.
  • Bei einem fairen Vergleich mit exakt demselben Test-Prompt landet Breeze lediglich auf Platz 16 von 39.
  • Das Modell profitiert in der Gesamtwertung stark davon, eigene Teststimmen frei auswählen zu dürfen.

Obwohl Breeze in bestimmten Metriken kommerzielle Spitzenreiter schlägt, relativieren sich die Ergebnisse bei standardisierten Tests. In direkten Vergleichen mit einheitlichen Vorgaben positionieren sich andere Open-Weight-Modelle und Alternativen wie VoxTroll vor dem System.

Lizenzbeschränkungen und kommerzielle Nutzung

  • Die Modellgewichte unterliegen einer strengen Research and Non-Commercial License.
  • Die Lizenz untersagt jegliche kommerzielle Nutzung, den produktiven Einsatz in Produkten sowie die Generierung von Audio für monetarisierte Videos.
  • Alternativen wie Kokoro oder Chatterbox bieten deutlich offenere Lizenzen wie Apache 2.0 oder MIT.

Der entscheidende Haken an Breeze liegt in der Lizenzierung der Gewichte, die kommerzielle Anwendungen, interne Betriebsabläufe und jegliche Monetarisierung ausschließt. Wer offene Sprach-KIs für reale Projekte sucht, greift stattdessen zu Modellen mit freizügigeren Lizenzen.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기