Este TTS de pesos abiertos superó a ElevenLabs... Luego leí la licencia

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Un modelo de conversión de texto a voz de código abierto acaba de superar a ElevenLabs en Artificial Analysis.
00:00:05Este es Breeze.
00:00:07Es una descarga de 3 GB.
00:00:09Funciona en tu MacBook y, si realmente quieres usar lo que genera para trabajar,
00:00:13probablemente ni siquiera tengas permitido hacerlo.
00:00:15No es que el resultado sea tan bueno.
00:00:17Bueno, está bien.
00:00:18Es bastante bueno.
00:00:19Pero el verdadero problema es la licencia.
00:00:21Así que quiero mostrarte primero lo que Breeze puede hacer y luego cómo podemos usarlo realmente.
00:00:30Este es Breeze TTS 2.
00:00:33Se lanzó por primera vez el 25 de agosto por una empresa llamada Breeze Blue.
00:00:37Ahora bien, la prueba comparativa está genial, pero cómo creamos una voz es mucho mejor.
00:00:41La mayoría de los modelos abiertos de texto a voz hoy en día tienen clonación de voz.
00:00:45Les das unos 10 segundos de audio de referencia, normalmente con una transcripción exacta,
00:00:50e intentan copiar esa voz.
00:00:52Funciona, pero obviamente necesitamos una voz desde el principio.
00:00:56Breeze no necesita una.
00:00:58Simplemente describes la voz que realmente quieres usar.
00:01:01Así que podría ser algo así como
00:01:03un anciano cálido, reflexivo y sabio, con una entonación calmada y contemplativa.
00:01:08Piensa en Morgan Freeman.
00:01:09Y genera esa voz a partir de la descripción.
00:01:12No hay ninguna grabación de referencia.
00:01:14Hoy en día, a esto se le llama diseño de voz,
00:01:16y empezamos a ver cada vez más modelos de voz de pesos abiertos
00:01:19con capacidades cada vez mejores en el diseño de voz.
00:01:23Y esto llena un vacío real en el TTS abierto.
00:01:26Kokoro te ofrece ajustes preestablecidos fijos.
00:01:29Chatterbox necesita audio de referencia.
00:01:31Breeze puede construir la voz a partir de una frase.
00:01:34Así que vamos a escucharla.
00:01:35Si disfrutas de las herramientas de programación que aceleran tu flujo de trabajo, asegúrate de suscribirte.
00:01:39Tenemos videos nuevos todo el tiempo.
00:01:41Poner esto en marcha se hace principalmente directo en mi terminal.
00:01:45Simplemente creé un entorno virtual y luego instalé MLX audio con pip.
00:01:49Esto se está ejecutando en mi Mac, por lo que necesitaba MLX aquí.
00:01:53Si estás en Linux o tienes una GPU de NVIDIA,
00:01:56entonces la configuración es un poco diferente, pero igual de sencilla.
00:02:00Así que hice la misma frase, ejecutándola aquí en mi terminal
00:02:03con dos instrucciones de voz diferentes.
00:02:05Ejecutemos la primera.
00:02:06Bienvenido al canal BetterStack.
00:02:09Sobre todo lo relacionado con tecnología e inteligencia artificial, ¿te has suscrito ya?
00:02:13Ahora exactamente la misma frase de nuevo con una entonación un poco diferente.
00:02:19Bienvenido al canal BetterStack.
00:02:21Sobre todo lo relacionado con tecnología e inteligencia artificial, ¿te has suscrito ya?
00:02:27Esas fueron las mismas palabras, personas completamente diferentes o una voz de IA.
00:02:33Aunque esto ocupa un puesto alto, todavía puedo notar que es una voz de IA, ¿verdad?
00:02:37Así que está bien.
00:02:38Lo hace bastante decente, y la capacidad de configurar una emoción también está presente.
00:02:42Ahora bien, hay un parámetro aquí que es clave para todo esto, llamado escala CFG.
00:02:47Eso controla con qué intensidad el modelo sigue la descripción de tu voz.
00:02:51Si la reduces, el modelo comienza a desviarse hacia una voz más genérica.
00:02:55Cuatro es el número que aparece en su documentación, el cual también estoy usando aquí para algunas voces.
00:03:00Pero déjame bajarlo rápidamente a uno, solo para obtener una voz de IA pura.
00:03:05Aquí vamos.
00:03:05Bienvenido al canal BetterStack.
00:03:08Esta voz es una IA evidente.
00:03:10¿Ves a qué me refiero con eso, verdad?
00:03:11Eso sonó a pura IA.
00:03:12Así que ahora también puedes incluir eventos vocales directamente dentro del texto, lo cual es genial.
00:03:18Puedo escribir literalmente, puedo poner paréntesis.
00:03:20Podría poner suspiro y cerrar esos paréntesis.
00:03:23Al final, podría poner risas o llanto justo en medio de una frase, al final, al principio.
00:03:28Vamos a escucharlo.
00:03:30Cuando intento contarte un chiste, no puedo contenerme.
00:03:35Eso es parte del texto, lo cual es una característica agradable.
00:03:38Pero muchos modelos de voz de pesos abiertos también están saliendo con esto ahora.
00:03:42Así que tú juzga qué tan bien sonó realmente Breeze.
00:03:46Para ser una IA, ¿es buena?
00:03:47¿Se merece el puesto que realmente tiene?
00:03:50Ahora bien, Breeze está construido a partir de un conjunto de componentes que quizás reconozcas.
00:03:54Una columna vertebral Qwen 3 maneja el modelado del lenguaje.
00:03:57Hay un codificador de texto T5 Gemma 2.
00:03:59Y MIMI maneja el códec de audio.
00:04:01El modelo tiene alrededor de 3 mil millones de parámetros y emite audio mono de 24 kilohercios.
00:04:07Pero hay un detalle aquí que quiero que recuerdes.
00:04:09El tokenizador de audio se deriva de Qwen 3 TTS, y Qwen 3 TTS es Apache 2.0.
00:04:16Así que parte de este modelo está construido sobre un trabajo verdaderamente abierto.
00:04:19Ten eso en cuenta, porque en un minuto eso resulta bastante irónico.
00:04:23Primero, sin embargo, debemos hablar de la afirmación que hizo que Breeze se volviera viral.
00:04:27Breeze superó a ElevenLabs.
00:04:29Sí, los superaron.
00:04:30Eso es técnicamente verdad, pero basándome en la salida de sonido, no estoy seguro de cómo, la verdad.
00:04:36Aquí es también donde se vuelve más complicado que simplemente decir eso.
00:04:40Artificial Analysis dirige una arena de voz basada en votos humanos ciegos por pares.
00:04:45Son una firma de evaluación comparativa independiente, no Breeze Blue.
00:04:49En su tabla de clasificación de voces de proveedores, Breeze se sitúa en el 1215.
00:04:53Esa es la puntuación ELO.
00:04:54ElevenLabs conversacional está en el 1210.
00:04:57Así que sí, técnicamente los superaron por cinco puntos.
00:05:00Breeze supera a ElevenLabs.
00:05:01De acuerdo, pero ahora, si investigo esto aún más, empiezan a surgir problemas.
00:05:06En primer lugar, Breeze tiene la menor cantidad de votos cerca de la cima.
00:05:09Alrededor de 1200.
00:05:11ElevenLabs tiene más de 4500 votos.
00:05:14Así que Breeze tiene la puntuación menos consolidada en esa parte de la tabla.
00:05:17Y ahora los nuevos modelos pueden recibir un pequeño impulso de bienvenida.
00:05:21En segundo lugar, Breeze no es realmente el número uno.
00:05:24Cartesia Sonic 3.6 está en el 1282.
00:05:27Así que decir que Breeze supera a los sistemas propietarios de vanguardia es cierto en un sentido.
00:05:32También es bastante selectivo.
00:05:33Pero el tercer problema es clave para todo esto.
00:05:36Esa tabla de clasificación permite que cada modelo use sus propias voces.
00:05:39Artificial Analysis tiene otra tabla de clasificación donde a los modelos se les da exactamente la misma indicación.
00:05:45La misma prueba.
00:05:46Básicamente es comparar peras con peras.
00:05:49Y ahora Breeze luce muy diferente.
00:05:51En esa clasificación, obtiene una puntuación de 1002.
00:05:54Tercero entre los modelos de pesos abiertos.
00:05:56Decimosexto de 39 en total.
00:05:59Y detrás de Vox Troll de Mistral.
00:06:01Así que Breeze es bastante bueno para competir con muchos de estos.
00:06:04Pero no es el número uno.
00:06:05Y parece ser especialmente bueno cuando puede elegir las voces que se están comparando.
00:06:10Eso cambia la forma en que deberíamos estar analizando esto en realidad.
00:06:13Pero aún así no fue lo más importante que encontré.
00:06:16El mayor problema de todo esto es la licencia.
00:06:19Y esta es la parte que mucha gente simplemente está pasando por alto.
00:06:22Sí, el código es Apache 2.0.
00:06:24No hay ningún problema ahí.
00:06:26Los pesos no lo son.
00:06:27Los pesos utilizan algo llamado Licencia de Investigación y No Comercial de Breeze Blue.
00:06:33Y quiero usar su lenguaje exacto aquí porque esta distinción realmente importa.
00:06:38Lo que esto va a decir, lo que esto dice en realidad es:
00:06:42este acuerdo permite la investigación y el uso no comercial de los materiales del modelo de forma gratuita.
00:06:47No otorga ningún derecho comercial y no es una licencia de código abierto.
00:06:52Esas son sus palabras.
00:06:53No es una licencia de código abierto.
00:06:55De acuerdo.
00:06:56Ahora bien, a veces ves la mención de no comercial en un modelo y básicamente solo significa que no revendas nuestros pesos.
00:07:02Sí, de acuerdo.
00:07:02Eso tiene sentido.
00:07:04Esto no es lo que dice esto.
00:07:05Su definición de propósito comercial incluye el uso en producción,
00:07:09usarlo en un producto o servicio, alojarlo detrás de una API.
00:07:13Y luego está la parte que realmente entra en juego aquí.
00:07:16Como si eso no fuera ya suficiente,
00:07:17también incluye usar las salidas para cualquier operación interna más allá de una evaluación limitada.
00:07:23Las salidas.
00:07:24De acuerdo, entonces, ¿qué significa esto en realidad?
00:07:26No solo el modelo en sí, sino el audio que genera.
00:07:29Y todo esto sigue y sigue.
00:07:31No hay excepción para creadores, ni excepción para pequeñas empresas.
00:07:35No hay un umbral de ingresos.
00:07:37No hay nada aquí.
00:07:38Muchas licencias no comerciales dejan cierta zona gris.
00:07:42Esta se esfuerza por bloquear gran parte de eso.
00:07:45Hagamos esto más práctico ahora.
00:07:47¿Cuándo podrías usar esto?
00:07:48¿Poner una voz generada de Breeze dentro de un producto?
00:07:51Nones.
00:07:52Eso no va a pasar.
00:07:53¿Usarlo en un video de YouTube monetizado?
00:07:56Este no está monetizado.
00:07:58Sí, claro.
00:07:58No va a pasar.
00:07:59¿En algún tipo de podcast?
00:08:00De nuevo, tampoco va a pasar.
00:08:02Así que esto bloquea prácticamente todo.
00:08:04La licencia nombra específicamente los ingresos por patrocinio y suscripción.
00:08:0934 dólares por millón de caracteres una vez que empiezas a pagar por esto.
00:08:12Pero aun así, la licencia deja algo muy claro.
00:08:15Pagar por la API no te da derechos comerciales sobre modelos autohospedados
00:08:19ni sobre las salidas de su modelo autohospedado.
00:08:22Y una vez que ves eso, todo el planteamiento cobra mucho sentido.
00:08:25Los pesos abiertos son la demostración.
00:08:27La API es todo su producto.
00:08:30Entonces, ¿qué tan utilizables son esos pesos abiertos para empezar?
00:08:33Juzguen ustedes mismos.
00:08:34Ahora bien, esto era muy genial.
00:08:36La IA de voz es muy genial.
00:08:37Pero hice un análisis de Vox CPM2 hace un tiempo.
00:08:41Vox CPM2 era, sinceramente, una locura.
00:08:43Era muy, y digo muy, impresionante.
00:08:45Así que, si comparo a Breeze con Vox CPM,
00:08:48Breeze perdería en un abrir y cerrar de ojos.
00:08:50Y todo tiene que ver con la licencia.
00:08:52Espectáculo.
00:08:53Así que, si quieres una IA de voz clonada honesta y abierta,
00:08:56sigo prefiriendo Vox CPM2.
00:08:58Ya que tiene todas las mismas características que Breeze,
00:09:00y podría ser incluso mejor.
00:09:02¿Deberías usar Breeze?
00:09:03Esa es la pregunta.
00:09:04Creo que ya lo respondí, pero juguemos un rato con esto.
00:09:06Para experimentar con la IA de voz, sí, podrías.
00:09:09Es genial ver hacia dónde se dirige la IA de voz.
00:09:12Breeze es bastante buena, ¿de acuerdo?
00:09:14Probar modelos es divertido,
00:09:16especialmente a medida que mejoran cada vez más.
00:09:18¿Hacia dónde van las cosas?
00:09:19Diseñar voces a partir de una descripción de texto
00:09:21es una capacidad genuinamente muy genial.
00:09:23Pero si vas a lanzar algo comercial,
00:09:25no uses esto.
00:09:26Yo usaría otra cosa,
00:09:27sin importar en qué puesto esté Breeze en la tabla de clasificación.
00:09:30Kokoro usa Apache 2.0.
00:09:32Chatterbox usa MIT.
00:09:34Vox CPM, ya lo veremos,
00:09:35porque podría aplastarlos a todos.
00:09:36Los pesos abiertos y el código abierto
00:09:38dejaron de significar lo mismo hace un tiempo.
00:09:40Breeze hace que esa diferencia sea imposible de ignorar.
00:09:43La prueba de rendimiento te dice lo que el modelo puede hacer.
00:09:45La licencia te dice lo que tú puedes hacer.
00:09:48Soy Josh de BetterStack.
00:09:49Si disfrutas de los consejos y trucos de programación como este,
00:09:51asegúrate de suscribirte.
00:09:53Nos vemos en otro video.

핵심 요약

Breeze supera técnicamente a ElevenLabs en pruebas de rendimiento de texto a voz, pero su licencia de investigación prohíbe cualquier uso comercial de los pesos o del audio generado.

하이라이트

  • El modelo de conversión de texto a voz Breeze Blue supera a ElevenLabs en Artificial Analysis con una puntuación ELO de 1215 frente a 1210.

  • El tamaño de descarga de Breeze es de 3 GB y funciona localmente en un MacBook utilizando el marco MLX.

  • Breeze permite generar voces personalizadas a partir de una descripción textual sin necesidad de audio de referencia.

  • La arquitectura de Breeze incluye una columna vertebral Qwen 3, un codificador T5 Gemma 2 y un códec de audio MIMI para emitir audio mono de 24 kHz.

  • La licencia de los pesos de Breeze prohíbe explícitamente cualquier uso comercial, producción, servicio o uso interno de las salidas generadas.

  • En la tabla de clasificación de pruebas directas con la misma indicación, Breeze obtiene una puntuación de 1002, situándose decimosexto entre 39 modelos.

타임라인

Presentación y capacidades de diseño de voz

  • El modelo de texto a voz Breeze alcanza una puntuación superior a ElevenLabs en Artificial Analysis con una descarga de 3 GB.
  • El sistema genera voces a partir de descripciones textuales sin requerir grabaciones de referencia previas.
  • La escala CFG controla la intensidad con la que el modelo sigue la descripción de la voz configurada.

El modelo Breeze Blue introduce la capacidad de diseñar voces mediante descripciones detalladas de texto en lugar de utilizar fragmentos de audio de referencia. Esta característica llena un vacío en las herramientas de código abierto actuales. Además, el parámetro de escala CFG permite ajustar la fidelidad de la descripción y se pueden incluir eventos vocales como suspiros o risas directamente en el texto.

Configuración técnica y arquitectura del modelo

  • La ejecución local en un MacBook requiere la creación de un entorno virtual y la instalación de MLX audio mediante pip.
  • La arquitectura combina una columna vertebral Qwen 3, un codificador T5 Gemma 2 y un códec MIMI.
  • El modelo cuenta con 3 mil millones de parámetros y emite audio mono de 24 kilohercios.

La puesta en marcha del modelo en un entorno local se realiza principalmente a través de la terminal utilizando MLX para equipos Mac, o configuraciones similares para Linux y GPU de NVIDIA. El modelo integra componentes avanzados de lenguaje y codificación de audio, utilizando un tokenizador derivado de Qwen 3 TTS.

Análisis comparativo de rendimiento

  • Breeze obtiene una puntuación ELO de 1215 en la arena de voz basada en votos humanos ciegos por pares.
  • La puntuación de Breeze se basa en aproximadamente 1200 votos, frente a los más de 4500 votos de ElevenLabs.
  • En la tabla de clasificación con indicaciones idénticas, Breeze obtiene 1002 puntos y se sitúa decimosexto en total.

La afirmación de que Breeze supera a ElevenLabs se sustenta en una tabla de clasificación donde los modelos utilizan sus propias voces preferidas. Sin embargo, al someter a todos los modelos a una prueba estandarizada con la misma indicación, el rendimiento relativo desciende significativamente frente a otras alternativas abiertas.

Restricciones de la licencia no comercial

  • El código es Apache 2.0, pero los pesos operan bajo una licencia de investigación y uso no comercial estricta.
  • La definición comercial prohíbe el uso en producción, productos, servicios, alojamiento en API y operaciones internas.
  • Modelos alternativos como Kokoro y Chatterbox ofrecen licencias más permisivas como Apache 2.0 y MIT.

El obstáculo principal de Breeze radica en su licencia, la cual prohíbe expresamente el uso comercial tanto del modelo como del audio generado. Esta restricción anula su utilidad para vídeos de YouTube monetizados, podcasts o productos comerciales. Ante estas limitaciones, alternativas como Vox CPM2 o Kokoro representan opciones más viables para desarrolladores y creadores.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기