Este TTS de pesos abiertos superó a ElevenLabs... Luego leí la licencia
BBetter Stack
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Un modelo de conversión de texto a voz de código abierto acaba de superar a ElevenLabs en Artificial Analysis.
00:00:05Este es Breeze.
00:00:07Es una descarga de 3 GB.
00:00:09Funciona en tu MacBook y, si realmente quieres usar lo que genera para trabajar,
00:00:13probablemente ni siquiera tengas permitido hacerlo.
00:00:15No es que el resultado sea tan bueno.
00:00:17Bueno, está bien.
00:00:18Es bastante bueno.
00:00:19Pero el verdadero problema es la licencia.
00:00:21Así que quiero mostrarte primero lo que Breeze puede hacer y luego cómo podemos usarlo realmente.
00:00:30Este es Breeze TTS 2.
00:00:33Se lanzó por primera vez el 25 de agosto por una empresa llamada Breeze Blue.
00:00:37Ahora bien, la prueba comparativa está genial, pero cómo creamos una voz es mucho mejor.
00:00:41La mayoría de los modelos abiertos de texto a voz hoy en día tienen clonación de voz.
00:00:45Les das unos 10 segundos de audio de referencia, normalmente con una transcripción exacta,
00:00:50e intentan copiar esa voz.
00:00:52Funciona, pero obviamente necesitamos una voz desde el principio.
00:00:56Breeze no necesita una.
00:00:58Simplemente describes la voz que realmente quieres usar.
00:01:01Así que podría ser algo así como
00:01:03un anciano cálido, reflexivo y sabio, con una entonación calmada y contemplativa.
00:01:08Piensa en Morgan Freeman.
00:01:09Y genera esa voz a partir de la descripción.
00:01:12No hay ninguna grabación de referencia.
00:01:14Hoy en día, a esto se le llama diseño de voz,
00:01:16y empezamos a ver cada vez más modelos de voz de pesos abiertos
00:01:19con capacidades cada vez mejores en el diseño de voz.
00:01:23Y esto llena un vacío real en el TTS abierto.
00:01:26Kokoro te ofrece ajustes preestablecidos fijos.
00:01:29Chatterbox necesita audio de referencia.
00:01:31Breeze puede construir la voz a partir de una frase.
00:01:34Así que vamos a escucharla.
00:01:35Si disfrutas de las herramientas de programación que aceleran tu flujo de trabajo, asegúrate de suscribirte.
00:01:39Tenemos videos nuevos todo el tiempo.
00:01:41Poner esto en marcha se hace principalmente directo en mi terminal.
00:01:45Simplemente creé un entorno virtual y luego instalé MLX audio con pip.
00:01:49Esto se está ejecutando en mi Mac, por lo que necesitaba MLX aquí.
00:01:53Si estás en Linux o tienes una GPU de NVIDIA,
00:01:56entonces la configuración es un poco diferente, pero igual de sencilla.
00:02:00Así que hice la misma frase, ejecutándola aquí en mi terminal
00:02:03con dos instrucciones de voz diferentes.
00:02:05Ejecutemos la primera.
00:02:06Bienvenido al canal BetterStack.
00:02:09Sobre todo lo relacionado con tecnología e inteligencia artificial, ¿te has suscrito ya?
00:02:13Ahora exactamente la misma frase de nuevo con una entonación un poco diferente.
00:02:19Bienvenido al canal BetterStack.
00:02:21Sobre todo lo relacionado con tecnología e inteligencia artificial, ¿te has suscrito ya?
00:02:27Esas fueron las mismas palabras, personas completamente diferentes o una voz de IA.
00:02:33Aunque esto ocupa un puesto alto, todavía puedo notar que es una voz de IA, ¿verdad?
00:02:37Así que está bien.
00:02:38Lo hace bastante decente, y la capacidad de configurar una emoción también está presente.
00:02:42Ahora bien, hay un parámetro aquí que es clave para todo esto, llamado escala CFG.
00:02:47Eso controla con qué intensidad el modelo sigue la descripción de tu voz.
00:02:51Si la reduces, el modelo comienza a desviarse hacia una voz más genérica.
00:02:55Cuatro es el número que aparece en su documentación, el cual también estoy usando aquí para algunas voces.
00:03:00Pero déjame bajarlo rápidamente a uno, solo para obtener una voz de IA pura.
00:03:05Aquí vamos.
00:03:05Bienvenido al canal BetterStack.
00:03:08Esta voz es una IA evidente.
00:03:10¿Ves a qué me refiero con eso, verdad?
00:03:11Eso sonó a pura IA.
00:03:12Así que ahora también puedes incluir eventos vocales directamente dentro del texto, lo cual es genial.
00:03:18Puedo escribir literalmente, puedo poner paréntesis.
00:03:20Podría poner suspiro y cerrar esos paréntesis.
00:03:23Al final, podría poner risas o llanto justo en medio de una frase, al final, al principio.
00:03:28Vamos a escucharlo.
00:03:30Cuando intento contarte un chiste, no puedo contenerme.
00:03:35Eso es parte del texto, lo cual es una característica agradable.
00:03:38Pero muchos modelos de voz de pesos abiertos también están saliendo con esto ahora.
00:03:42Así que tú juzga qué tan bien sonó realmente Breeze.
00:03:46Para ser una IA, ¿es buena?
00:03:47¿Se merece el puesto que realmente tiene?
00:03:50Ahora bien, Breeze está construido a partir de un conjunto de componentes que quizás reconozcas.
00:03:54Una columna vertebral Qwen 3 maneja el modelado del lenguaje.
00:03:57Hay un codificador de texto T5 Gemma 2.
00:03:59Y MIMI maneja el códec de audio.
00:04:01El modelo tiene alrededor de 3 mil millones de parámetros y emite audio mono de 24 kilohercios.
00:04:07Pero hay un detalle aquí que quiero que recuerdes.
00:04:09El tokenizador de audio se deriva de Qwen 3 TTS, y Qwen 3 TTS es Apache 2.0.
00:04:16Así que parte de este modelo está construido sobre un trabajo verdaderamente abierto.
00:04:19Ten eso en cuenta, porque en un minuto eso resulta bastante irónico.
00:04:23Primero, sin embargo, debemos hablar de la afirmación que hizo que Breeze se volviera viral.
00:04:27Breeze superó a ElevenLabs.
00:04:29Sí, los superaron.
00:04:30Eso es técnicamente verdad, pero basándome en la salida de sonido, no estoy seguro de cómo, la verdad.
00:04:36Aquí es también donde se vuelve más complicado que simplemente decir eso.
00:04:40Artificial Analysis dirige una arena de voz basada en votos humanos ciegos por pares.
00:04:45Son una firma de evaluación comparativa independiente, no Breeze Blue.
00:04:49En su tabla de clasificación de voces de proveedores, Breeze se sitúa en el 1215.
00:04:53Esa es la puntuación ELO.
00:04:54ElevenLabs conversacional está en el 1210.
00:04:57Así que sí, técnicamente los superaron por cinco puntos.
00:05:00Breeze supera a ElevenLabs.
00:05:01De acuerdo, pero ahora, si investigo esto aún más, empiezan a surgir problemas.
00:05:06En primer lugar, Breeze tiene la menor cantidad de votos cerca de la cima.
00:05:09Alrededor de 1200.
00:05:11ElevenLabs tiene más de 4500 votos.
00:05:14Así que Breeze tiene la puntuación menos consolidada en esa parte de la tabla.
00:05:17Y ahora los nuevos modelos pueden recibir un pequeño impulso de bienvenida.
00:05:21En segundo lugar, Breeze no es realmente el número uno.
00:05:24Cartesia Sonic 3.6 está en el 1282.
00:05:27Así que decir que Breeze supera a los sistemas propietarios de vanguardia es cierto en un sentido.
00:05:32También es bastante selectivo.
00:05:33Pero el tercer problema es clave para todo esto.
00:05:36Esa tabla de clasificación permite que cada modelo use sus propias voces.
00:05:39Artificial Analysis tiene otra tabla de clasificación donde a los modelos se les da exactamente la misma indicación.
00:05:45La misma prueba.
00:05:46Básicamente es comparar peras con peras.
00:05:49Y ahora Breeze luce muy diferente.
00:05:51En esa clasificación, obtiene una puntuación de 1002.
00:05:54Tercero entre los modelos de pesos abiertos.
00:05:56Decimosexto de 39 en total.
00:05:59Y detrás de Vox Troll de Mistral.
00:06:01Así que Breeze es bastante bueno para competir con muchos de estos.
00:06:04Pero no es el número uno.
00:06:05Y parece ser especialmente bueno cuando puede elegir las voces que se están comparando.
00:06:10Eso cambia la forma en que deberíamos estar analizando esto en realidad.
00:06:13Pero aún así no fue lo más importante que encontré.
00:06:16El mayor problema de todo esto es la licencia.
00:06:19Y esta es la parte que mucha gente simplemente está pasando por alto.
00:06:22Sí, el código es Apache 2.0.
00:06:24No hay ningún problema ahí.
00:06:26Los pesos no lo son.
00:06:27Los pesos utilizan algo llamado Licencia de Investigación y No Comercial de Breeze Blue.
00:06:33Y quiero usar su lenguaje exacto aquí porque esta distinción realmente importa.
00:06:38Lo que esto va a decir, lo que esto dice en realidad es:
00:06:42este acuerdo permite la investigación y el uso no comercial de los materiales del modelo de forma gratuita.
00:06:47No otorga ningún derecho comercial y no es una licencia de código abierto.
00:06:52Esas son sus palabras.
00:06:53No es una licencia de código abierto.
00:06:55De acuerdo.
00:06:56Ahora bien, a veces ves la mención de no comercial en un modelo y básicamente solo significa que no revendas nuestros pesos.
00:07:02Sí, de acuerdo.
00:07:02Eso tiene sentido.
00:07:04Esto no es lo que dice esto.
00:07:05Su definición de propósito comercial incluye el uso en producción,
00:07:09usarlo en un producto o servicio, alojarlo detrás de una API.
00:07:13Y luego está la parte que realmente entra en juego aquí.
00:07:16Como si eso no fuera ya suficiente,
00:07:17también incluye usar las salidas para cualquier operación interna más allá de una evaluación limitada.
00:07:23Las salidas.
00:07:24De acuerdo, entonces, ¿qué significa esto en realidad?
00:07:26No solo el modelo en sí, sino el audio que genera.
00:07:29Y todo esto sigue y sigue.
00:07:31No hay excepción para creadores, ni excepción para pequeñas empresas.
00:07:35No hay un umbral de ingresos.
00:07:37No hay nada aquí.
00:07:38Muchas licencias no comerciales dejan cierta zona gris.
00:07:42Esta se esfuerza por bloquear gran parte de eso.
00:07:45Hagamos esto más práctico ahora.
00:07:47¿Cuándo podrías usar esto?
00:07:48¿Poner una voz generada de Breeze dentro de un producto?
00:07:51Nones.
00:07:52Eso no va a pasar.
00:07:53¿Usarlo en un video de YouTube monetizado?
00:07:56Este no está monetizado.
00:07:58Sí, claro.
00:07:58No va a pasar.
00:07:59¿En algún tipo de podcast?
00:08:00De nuevo, tampoco va a pasar.
00:08:02Así que esto bloquea prácticamente todo.
00:08:04La licencia nombra específicamente los ingresos por patrocinio y suscripción.
00:08:0934 dólares por millón de caracteres una vez que empiezas a pagar por esto.
00:08:12Pero aun así, la licencia deja algo muy claro.
00:08:15Pagar por la API no te da derechos comerciales sobre modelos autohospedados
00:08:19ni sobre las salidas de su modelo autohospedado.
00:08:22Y una vez que ves eso, todo el planteamiento cobra mucho sentido.
00:08:25Los pesos abiertos son la demostración.
00:08:27La API es todo su producto.
00:08:30Entonces, ¿qué tan utilizables son esos pesos abiertos para empezar?
00:08:33Juzguen ustedes mismos.
00:08:34Ahora bien, esto era muy genial.
00:08:36La IA de voz es muy genial.
00:08:37Pero hice un análisis de Vox CPM2 hace un tiempo.
00:08:41Vox CPM2 era, sinceramente, una locura.
00:08:43Era muy, y digo muy, impresionante.
00:08:45Así que, si comparo a Breeze con Vox CPM,
00:08:48Breeze perdería en un abrir y cerrar de ojos.
00:08:50Y todo tiene que ver con la licencia.
00:08:52Espectáculo.
00:08:53Así que, si quieres una IA de voz clonada honesta y abierta,
00:08:56sigo prefiriendo Vox CPM2.
00:08:58Ya que tiene todas las mismas características que Breeze,
00:09:00y podría ser incluso mejor.
00:09:02¿Deberías usar Breeze?
00:09:03Esa es la pregunta.
00:09:04Creo que ya lo respondí, pero juguemos un rato con esto.
00:09:06Para experimentar con la IA de voz, sí, podrías.
00:09:09Es genial ver hacia dónde se dirige la IA de voz.
00:09:12Breeze es bastante buena, ¿de acuerdo?
00:09:14Probar modelos es divertido,
00:09:16especialmente a medida que mejoran cada vez más.
00:09:18¿Hacia dónde van las cosas?
00:09:19Diseñar voces a partir de una descripción de texto
00:09:21es una capacidad genuinamente muy genial.
00:09:23Pero si vas a lanzar algo comercial,
00:09:25no uses esto.
00:09:26Yo usaría otra cosa,
00:09:27sin importar en qué puesto esté Breeze en la tabla de clasificación.
00:09:30Kokoro usa Apache 2.0.
00:09:32Chatterbox usa MIT.
00:09:34Vox CPM, ya lo veremos,
00:09:35porque podría aplastarlos a todos.
00:09:36Los pesos abiertos y el código abierto
00:09:38dejaron de significar lo mismo hace un tiempo.
00:09:40Breeze hace que esa diferencia sea imposible de ignorar.
00:09:43La prueba de rendimiento te dice lo que el modelo puede hacer.
00:09:45La licencia te dice lo que tú puedes hacer.
00:09:48Soy Josh de BetterStack.
00:09:49Si disfrutas de los consejos y trucos de programación como este,
00:09:51asegúrate de suscribirte.
00:09:53Nos vemos en otro video.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기