Dieses Open-Weights-TTS schlägt ElevenLabs... Dann habe ich die Lizenz gelesen
BBetter Stack
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Ein Open-Weight-Text-zu-Sprache-Modell hat gerade 11Labs bei Artificial Analysis geschlagen.
00:00:05Das ist Breeze.
00:00:07Es ist ein 3 GB großer Download.
00:00:09Es läuft auf deinem MacBook, und wenn du das Generierte tatsächlich für die Arbeit nutzen willst,
00:00:13darfst du das wahrscheinlich nicht einmal.
00:00:15Es liegt nicht daran, dass das Ergebnis so gut ist.
00:00:17Nun, es ist ganz in Ordnung.
00:00:18Es ist ziemlich gut.
00:00:19Aber die eigentliche Lizenz ist das Problem.
00:00:21Ich möchte dir also zuerst zeigen, was Breeze kann und wie wir das Ganze tatsächlich nutzen können.
00:00:30Das ist Breeze TTS 2.
00:00:33Es wurde erstmals am 25. August von einem Unternehmen namens Breeze Blue veröffentlicht.
00:00:37Der Benchmark ist ja ganz nett, aber wie wir eine Stimme erstellen, ist so viel besser.
00:00:41Die meisten Open-Text-to-Speech-Modelle heutzutage bieten Stimmklonierung.
00:00:45Man gibt ihnen etwa 10 Sekunden Referenzaudio, meist mit einem genauen Transkript,
00:00:50und sie versuchen, diese Stimme zu kopieren.
00:00:52Das funktioniert, aber wir brauchen natürlich von Anfang an eine Stimme.
00:00:56Breeze braucht keine.
00:00:58Du beschreibst einfach die Stimme, die du tatsächlich verwenden möchtest.
00:01:01Das könnte also etwa so klingen:
00:01:03ein warmer, nachdenklicher, weiser alter Mann mit einer ruhigen, reflektierten Art.
00:01:08Denk an Morgan Freeman.
00:01:09Und es generiert diese Stimme anhand der Beschreibung.
00:01:12Es gibt keine Referenzaufnahme.
00:01:14Heutzutage nennt man das Voice Design,
00:01:16und wir sehen immer mehr Open-Weight-Sprachmodelle
00:01:19mit zunehmend guten Fähigkeiten im Bereich Voice Design.
00:01:23Das schließt eine echte Lücke bei Open-TTS.
00:01:26Kokoro bietet feste Voreinstellungen.
00:01:29Chatterbox benötigt Referenzaudio.
00:01:31Breeze kann die Stimme aus einem Satz aufbauen.
00:01:34Hören wir es uns also an.
00:01:35Wenn du Programmiertools magst, die deinen Workflow beschleunigen, abonniere unbedingt den Kanal.
00:01:39Bei uns erscheinen laufend neue Videos.
00:01:41Das Ganze einzurichten passiert größtenteils direkt in meinem Terminal.
00:01:45Ich habe einfach eine virtuelle Umgebung erstellt und dann MLX Audio per pip installiert.
00:01:49Das läuft auf meinem Mac, weshalb ich hier MLX brauchte.
00:01:53Wenn du Linux nutzt oder eine NVIDIA-GPU hast,
00:01:56ist die Einrichtung etwas anders, aber genauso unkompliziert.
00:02:00Ich habe also denselben Satz genommen und ihn hier in meinem Terminal
00:02:03mit zwei verschiedenen Stimmungsanweisungen ausgeführt.
00:02:05Lass uns die erste starten.
00:02:06Willkommen beim BetterStack-Kanal.
00:02:09Alles rund um Tech und KI – hast du schon abonniert?
00:02:13Jetzt genau derselbe Satz noch einmal mit etwas anderer Intonation.
00:02:19Willkommen beim BetterStack-Kanal.
00:02:21Alles rund um Tech und KI – hast du schon abonniert?
00:02:27Das waren dieselben Wörter, aber völlig unterschiedliche Personen beziehungsweise KI-Stimmen.
00:02:33Obwohl das weit oben rangiert, kann ich immer noch hören, dass es eine KI-Stimme ist, oder?
00:02:37Es ist also gut.
00:02:38Es schlägt sich recht passabel, und die Möglichkeit, Emotionen festzulegen, ist tatsächlich auch da.
00:02:42Nun gibt es hier eine Einstellung, die dafür der Schlüssel ist: die sogenannte CFG-Skala.
00:02:47Die steuert, wie stark das Modell deiner Stimmbeschreibung folgt.
00:02:51Wenn du sie verringerst, driftet das Modell wieder zu einer generischeren Stimme ab.
00:02:55Vier ist der Wert in deren Dokumentation, den ich hier für ein paar Stimmen ebenfalls verwende.
00:03:00Aber lass mich das mal schnell auf eins herunterregeln, um eine reine KI-Stimme zu bekommen.
00:03:05Los geht's.
00:03:05Willkommen beim BetterStack-Kanal.
00:03:08Diese Stimme ist eindeutig KI.
00:03:10Du verstehst, was ich meine, oder?
00:03:11Das klang nach purer KI.
00:03:12Man kann jetzt also auch vokale Ereignisse direkt in den Text einfügen, was wirklich cool ist.
00:03:18Ich kann buchstäblich tippen, ich kann Klammern setzen.
00:03:20Ich könnte “Seufzen” eingeben und die Klammern schließen.
00:03:23Am Ende könnte ich “Lachen” oder “Weinen” einfügen, mitten im Satz, am Ende oder am Anfang.
00:03:28Hören wir es uns an.
00:03:30Wenn ich versuche, dir einen Witz zu erzählen, kann ich mich einfach nicht mehr halten.
00:03:35Das ist Teil des Textes, was ein nettes Feature ist.
00:03:38Aber viele Open-Weight-Sprachmodelle kommen mittlerweile ebenfalls damit auf den Markt.
00:03:42Urteile also selbst, wie gut Breeze im Vergleich zu anderen KIs tatsächlich klang.
00:03:46Ist es gut?
00:03:47Verdient es das Ranking, das es hat?
00:03:50Nun, Breeze ist aus Bausteinen zusammengesetzt, die dir vielleicht bekannt vorkommen.
00:03:54Ein Qwen-3-Backbone übernimmt die Sprachmodellierung.
00:03:57Es gibt einen T5-Gemma-2-Textencoder.
00:03:59Und MIMI kümmert sich um den Audiocodec.
00:04:01Das Modell hat rund 3 Milliarden Parameter und gibt 24-Kilohertz-Monoaudio aus.
00:04:07Aber es gibt ein Detail, an das du dich erinnern solltest.
00:04:09Der Audio-Tokenizer stammt von Qwen 3 TTS ab, und Qwen 3 TTS ist unter Apache 2.0 lizenziert.
00:04:16Ein Teil dieses Modells basiert also auf equivalenter Open Source.
00:04:19Behalte das im Hinterkopf, denn in einer Minute wird das ziemlich ironisch.
00:04:23Zuerst müssen wir jedoch über die Behauptung sprechen, die Breeze bekannt gemacht hat.
00:04:27Breeze hat 11Labs geschlagen.
00:04:29Ja, sie haben sie geschlagen.
00:04:30Das stimmt technisch gesehen, aber basierend auf dem Klang bin ich mir nicht sicher, wie.
00:04:36Hier wird es auch komplizierter, als es einfach so zu behaupten.
00:04:40Artificial Analysis betreibt eine Sprach-Arena basierend auf blinden, paarweisen menschlichen Bewertungen.
00:04:45Das ist eine unabhängige Benchmarking-Firma, nicht Breeze Blue.
00:04:49In deren Anbieter-Bestenliste für Stimmen liegt Breeze bei 1215.
00:04:53Das ist der Elo-Score.
00:04:5411Labs Conversational liegt bei 1210.
00:04:57Also ja, rein technisch gesehen schlagen sie sie um fünf Punkte.
00:05:00Breeze schlägt 11Labs.
00:05:01Okay, aber wenn ich dem jetzt noch weiter nachgehe, tauchen Probleme auf.
00:05:06Erstens hat Breeze im oberen Bereich die wenigsten Stimmen erhalten.
00:05:09Etwa 1200.
00:05:1111Labs hat über 4.500 Stimmen.
00:05:14Breeze hat also den am wenigsten gefestigten Score in diesem Teil der Tabelle.
00:05:17Und neue Modelle bekommen manchmal einen kleinen Willkommensbonus.
00:05:21Zweitens ist Breeze eigentlich gar nicht die Nummer eins.
00:05:24Cartesia Sonic 3.6 liegt bei 1282.
00:05:27Zu sagen, Breeze schlägt kommerzielle Spitzensysteme, stimmt also in gewisser Weise.
00:05:32Es ist aber auch ziemlich selektiv.
00:05:33Das dritte Problem ist jedoch der springende Punkt.
00:05:36Diese Bestenliste erlaubt es jedem Modell, seine eigenen Stimmen zu verwenden.
00:05:39Artificial Analysis hat eine weitere Bestenliste, bei der die Modelle exakt denselben Prompt erhalten.
00:05:45Derselbe Test.
00:05:46Es ist im Grunde ein fairer Vergleich.
00:05:49Und plötzlich sieht Breeze ganz anders aus.
00:05:51In diesem Ranking erzielt es einen Wert von 1002.
00:05:54Platz drei unter den Open-Weight-Modellen.
00:05:56Platz 16 von insgesamt 39.
00:05:59Und hinter VoxTroll von Mistral.
00:06:01Breeze ist also verdammt gut darin, mit vielen davon zu konkurrieren.
00:06:04Aber es ist nicht die Nummer eins.
00:06:05Und es scheint besonders gut abzuschneiden, wenn es die zu vergleichenden Stimmen selbst aussuchen darf.
00:06:10Das ändert die Art und Weise, wie wir das betrachten sollten, gewaltig.
00:06:13Aber das war noch nicht einmal das Grösste, das mir aufgefallen ist.
00:06:16Das größte Problem an der ganzen Sache ist die Lizenz.
00:06:19Und das ist der Punkt, den viele einfach übergehen.
00:06:22Ja, der Code ist unter Apache 2.0 lizenziert.
00:06:24Da gibt es kein Problem.
00:06:26Die Gewichte allerdings nicht.
00:06:27Für die Gewichte gilt die sogenannte Breeze Blue Research and Non-Commercial License.
00:06:33Ich möchte hier deren genaue Formulierungen verwenden, da dieser Unterschied tatsächlich von Bedeutung ist.
00:06:38Was das besagt, was das tatsächlich besagt, ist Folgendes:
00:06:42Diese Vereinbarung erlaubt die kostenlose Nutzung der Modellmaterialien zu Forschungs- und nicht-kommerziellen Zwecken.
00:06:47Sie gewährt keinerlei kommerzielle Rechte und ist keine Open-Source-Lizenz.
00:06:52Das sind deren Worte.
00:06:53Keine Open-Source-Lizenz.
00:06:55Okay.
00:06:56Manchmal sieht man die Kennzeichnung “nicht-kommerziell” bei einem Modell, und das bedeutet im Grunde nur: “Verkauft unsere Gewichte nicht weiter.”
00:07:02Ja, okay.
00:07:02Das ergibt Sinn.
00:07:04Das ist hier aber nicht gemeint.
00:07:05Deren Definition eines kommerziellen Zwecks schließt die produktive Nutzung ein,
00:07:09die Verwendung in einem Produkt oder Dienst sowie das Hosten hinter einer API.
00:07:13Und dann kommt der Teil, der hier erst richtig reinhaut.
00:07:16Als ob das nicht schon genug wäre,
00:07:17schließt es auch die Nutzung der Ergebnisse für interne Abläufe über begrenzte Evaluierungen hinaus ein.
00:07:23Die Ergebnisse.
00:07:24Okay, was bedeutet das eigentlich?
00:07:26Nicht nur das Modell selbst, sondern auch das Audio, das es generiert.
00:07:29Und das geht noch immer weiter so.
00:07:31Es gibt keine Ausnahme für Creator, keine Ausnahme für kleine Unternehmen.
00:07:35Es gibt keine Umsatzgrenze.
00:07:37Hier gibt es gar nichts.
00:07:38Viele Lizenzen für nicht-kommerzielle Nutzung lassen Grauzonen zu.
00:07:42Hier wird sehr weit gegangen, um vieles davon im Grunde zu blockieren.
00:07:45Machen wir das Ganze also mal etwas praxisnaher.
00:07:47Wann könnte man das nutzen?
00:07:48Eine generierte Breeze-Stimme in ein Produkt einbauen?
00:07:51Nope.
00:07:52Das wird wohl nichts.
00:07:53In einem monetarisierten YouTube-Video verwenden?
00:07:56Das ist nicht monetarisiert.
00:07:58Ja, nee.
00:07:58Wird nichts.
00:07:59In irgendeinem Podcast?
00:08:00Wiederum: Wird nichts.
00:08:02Das blockiert also so ziemlich alles.
00:08:04Die Lizenz nennt explizit Sponsoring- und Abonnement-Einnahmen.
00:08:0934 Dollar pro Million Zeichen, sobald man dafür zahlt.
00:08:12Aber selbst da stellt die Lizenz etwas sehr klar.
00:08:15Das Bezahlen für die API gibt einem keine kommerziellen Rechte für selbst gehostete Modelle
00:08:19oder die Ausgaben von deren selbst gehostetem Modell.
00:08:22Und wenn man das sieht, ergibt das ganze Setup total viel Sinn.
00:08:25Die offenen Gewichte sind die Demo.
00:08:27Die API ist ihr eigentliches Produkt.
00:08:30Wie nutzbar sind diese offenen Gewichte also überhaupt?
00:08:33Da könnt ihr selbst urteilen.
00:08:34Nun, das war sehr cool.
00:08:36Voice-KI ist sehr cool.
00:08:37Aber ich habe mir Vox CPM2 vor gar nicht langer Zeit mal genauer angesehen.
00:08:41Vox CPM2 war ehrlich gesagt Wahnsinn.
00:08:43Es war sehr, und ich meine sehr, beeindruckend.
00:08:45Wenn ich Breeze also gegen Vox CPM antreten lasse,
00:08:48würde Breeze das im Handumdrehen verlieren.
00:08:50Und das hat alles mit der Lizenz zu tun.
00:08:52Spektakel.
00:08:53Wer also eine ehrliche, offene Voice-Clone-Stimmen-KI sucht,
00:08:56bleibe ich vorerst bei Vox CPM2.
00:08:58Da es im Grunde dieselben Funktionen wie Breeze hat,
00:09:00und vielleicht sogar noch besser ist.
00:09:02Solltest du Breeze nutzen?
00:09:03Das ist hier die Frage.
00:09:04Ich glaube, das habe ich beantwortet, aber schauen wir uns das mal an.
00:09:06Um ein bisschen mit Voice-KI zu spielen, ja, durchaus.
00:09:09Es ist cool zu sehen, wohin sich Voice-KI entwickelt.
00:09:12Breeze ist ziemlich gut, okay?
00:09:14Modelle zu testen macht Spaß,
00:09:16vor allem, wenn sie immer besser werden.
00:09:18Wohin geht die Reise?
00:09:19Stimmendesign aus einer Textbeschreibung
00:09:21ist eine wirklich verdammt coole Funktion.
00:09:23Aber wenn ihr irgendetwas kommerziell veröffentlicht,
00:09:25nutzt das nicht.
00:09:26Ich würde etwas anderes verwenden,
00:09:27egal wo Breeze in der Bestenliste steht.
00:09:30Kokoro nutzt Apache 2.0.
00:09:32Chatterbox nutzt MIT.
00:09:34Vox CPM sehen wir uns noch an,
00:09:35denn das könnte sie alle schlagen.
00:09:36Offene Gewichte und Open Source
00:09:38hörten vor einer Weile auf, dasselbe zu bedeuten.
00:09:40Breeze macht diesen Unterschied unmöglich zu ignorieren.
00:09:43Das Benchmark zeigt euch, was das Modell leisten kann.
00:09:45Die Lizenz sagt euch, was ihr damit machen dürft.
00:09:48Ich bin Josh von BetterStack.
00:09:49Wenn ihr solche Coding-Tipps und -Tricks mögt,
00:09:51abonniert gerne den Kanal.
00:09:53Wir sehen uns im nächsten Video.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기