이 오픈 웨이트 TTS가 ElevenLabs를 이겼습니다... 그리고 라이선스를 읽어보았습니다

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00오픈 웨이트 텍스트 음성 변환 모델이 방금 인공 분석에서 일레븐랩스를 이겼습니다.
00:00:05바로 Breeze입니다.
00:00:07다운로드 용량은 3GB입니다.
00:00:09맥북에서 실행되는데, 생성된 결과물을 업무에 실제로 사용하고 싶다면
00:00:13아마 허용되지도 않을 겁니다.
00:00:15결과물이 엄청나게 좋아서가 아닙니다.
00:00:17글쎄요, 괜찮은 편이죠.
00:00:18꽤 좋습니다.
00:00:19하지만 진짜 문제는 라이선스입니다.
00:00:21그래서 먼저 Breeze가 무엇을 할 수 있는지 보여드리고, 이를 실제로 어떻게 사용할 수 있는지 다루겠습니다.
00:00:30이것은 Breeze TTS 2입니다.
00:00:338월 25일에 Breeze Blue라는 회사에서 처음 공개했습니다.
00:00:37벤치마크도 좋지만, 음성을 생성하는 방식이 훨씬 더 멋집니다.
00:00:41요즘 대다수의 오픈 텍스트 음성 변환 모델은 음성 복제를 지원합니다.
00:00:45보통 정확한 대본과 함께 10초 정도의 참고용 오디오를 제공하면
00:00:50그 목소리를 흉내 내려 하죠.
00:00:52작동은 하지만, 당연히 처음부터 목소리 파일이 필요합니다.
00:00:56하지만 Breeze는 그럴 필요가 없습니다.
00:00:58사용하고 싶은 목소리를 말로 설명하기만 하면 됩니다.
00:01:01예를 들면 이런 식일 수 있죠.
00:01:03차분하고 사색적인 어조를 가진, 따뜻하고 깊이 있는 지혜로운 노인.
00:01:08모건 프리먼을 떠올려보세요.
00:01:09그러면 그 묘사에 맞춰 목소리를 생성해 냅니다.
00:01:12참고 녹음 파일이 필요 없습니다.
00:01:14요즘에는 이를 '음성 디자인'이라고 부르며,
00:01:16점점 더 뛰어난 음성 디자인 기능을 갖춘 오픈 웨이트 음성 모델들이
00:01:19속속 등장하고 있습니다.
00:01:23그리고 이것은 오픈 TTS의 빈틈을 완벽히 메워줍니다.
00:01:26Kokoro는 고정된 프리셋을 제공합니다.
00:01:29Chatterbox는 참고 오디오가 필요하죠.
00:01:31하지만 Breeze는 한 줄의 문장만으로 목소리를 만들어낼 수 있습니다.
00:01:34그러면 실제로 한번 들어보죠.
00:01:35작업 속도를 높여주는 코딩 도구를 좋아하신다면 꼭 구독해 주세요.
00:01:39유용한 영상들이 계속 업로드됩니다.
00:01:41이 프로그램을 실행하는 과정은 대부분 제 터미널에서 진행됩니다.
00:01:45가상 환경을 만들고 pip를 통해 MLX audio를 설치했습니다.
00:01:49제 맥에서 실행 중이기 때문에 여기서 MLX가 필요했던 겁니다.
00:01:53만약 리눅스를 사용 중이거나 엔비디아 GPU가 있다면
00:01:56설정 방법은 조금 다르겠지만 역시나 아주 간단합니다.
00:02:00그래서 똑같은 문장을 가지고 터미널에서 실행해 보았습니다.
00:02:03두 가지 서로 다른 목소리 지시사항을 사용해서요.
00:02:05첫 번째 것을 실행해 보죠.
00:02:06BetterStack 채널에 오신 것을 환영합니다.
00:02:09기술과 AI에 관한 모든 것, 아직 구독하지 않으셨나요?
00:02:13이번에는 억양을 살짝 다르게 한 정확히 같은 문장입니다.
00:02:19BetterStack 채널에 오신 것을 환영합니다.
00:02:21기술과 AI에 관한 모든 것, 아직 구독하지 않으셨나요?
00:02:27단어는 똑같지만 완전히 다른 사람, 혹은 AI 목소리였습니다.
00:02:33순위는 높게 나오지만, 여전히 AI 목소리라는 티는 나죠?
00:02:37그래도 좋습니다.
00:02:38꽤 쓸 만하고 감정을 설정하는 기능도 실제로 탑재되어 있습니다.
00:02:42여기서 이 모든 것의 핵심이 되는 설정이 하나 있는데, 바로 CFG 스케일입니다.
00:02:47모델이 사용자의 목소리 설명을 얼마나 강하게 따를지 제어하죠.
00:02:51이 값을 낮추면 모델은 점차 더 일반적인 목소리로 돌아가게 됩니다.
00:02:55문서에 나온 권장 숫자는 4이며, 저 역시 일부 목소리에 이 값을 사용하고 있습니다.
00:03:00하지만 순수한 AI 목소리를 느껴보기 위해 이 값을 1로 빠르게 낮춰보겠습니다.
00:03:05자, 갑니다.
00:03:05BetterStack 채널에 오신 것을 환영합니다.
00:03:08이 목소리는 명백한 AI입니다.
00:03:10무슨 뜻인지 아시겠죠?
00:03:11완전한 AI 소리가 났습니다.
00:03:12이제 텍스트 안에 음성 효과를 직접 넣을 수도 있는데 이게 정말 멋진 기능입니다.
00:03:18말 그대로 괄호를 입력할 수 있죠.
00:03:20한숨(sigh)이라고 적고 괄호를 닫을 수 있습니다.
00:03:23문장 한가운데나 끝, 혹은 시작 부분에 웃음이나 울음 같은 효과를 직접 넣을 수 있죠.
00:03:28한번 들어보죠.
00:03:30너한테 농담을 하려고 하면 웃음이 터져서 참을 수가 없어.
00:03:35텍스트의 일부로 작동하는 멋진 기능입니다.
00:03:38하지만 요즘 많은 오픈 웨이트 음성 모델들도 이런 기능을 탑재하고 나오고 있죠.
00:03:42Breeze의 성능이 실제로 얼마나 좋은지는 여러분이 직접 판단해 보세요.
00:03:46AI 입장에서 정말 좋은가요?
00:03:47지금 차지하고 있는 순위가 마땅한가요?
00:03:50자, Breeze는 여러분이 아마 들어봤을 익숙한 구성 요소들로 만들어졌습니다.
00:03:54언어 모델링은 Qwen 3 백본이 담당합니다.
00:03:57T5 Gemma 2 텍스트 인코더도 있습니다.
00:03:59그리고 오디오 코덱은 MIMI가 처리합니다.
00:04:01이 모델은 약 30억 개의 매개변수를 가지며 24킬로헤르츠 모노 오디오를 출력합니다.
00:04:07하지만 여기서 기억해야 할 세부 사항이 하나 있습니다.
00:04:09오디오 토크나이저는 Qwen 3 TTS에서 파생되었으며, Qwen 3 TTS는 Apache 2.0 라이선스를 따릅니다.
00:04:16즉, 이 모델의 일부는 진정한 오픈 소스를 기반으로 만들어졌습니다.
00:04:19이 점을 명심하세요. 잠시 후에 이 사실이 꽤 아이러니해지니까요.
00:04:23하지만 먼저 Breeze를 떡상하게 만든 그 주장에 대해 이야기해 보겠습니다.
00:04:27Breeze가 일레븐랩스를 이겼다는 주장 말이죠.
00:04:29네, 정말 이겼습니다.
00:04:30기술적으로는 사실이지만, 들리는 음성 결과물을 보면 어떻게 이겼는지 잘 모르겠습니다.
00:04:36또한 이 부분은 단순히 그렇게 말하는 것보다 훨씬 더 복잡합니다.
00:04:40인공 분석(Artificial Analysis)은 블라인드 쌍대 비교 방식의 인간 투표를 기반으로 음성 아레나를 운영합니다.
00:04:45Breeze Blue가 아니라 독립된 벤치마크 기업이죠.
00:04:49공급자 음성 리더보드에서 Breeze는 1215점을 기록하고 있습니다.
00:04:53ELO 점수입니다.
00:04:54일레븐랩스 대화형 모델은 1210점입니다.
00:04:57그러니까 기술적으로는 5점 차로 이긴 게 맞습니다.
00:05:00Breeze가 일레븐랩스를 이긴 거죠.
00:05:01좋습니다, 하지만 이 내용을 더 파고들면 문제들이 튀어나오기 시작합니다.
00:05:06우선, 상위권 모델 중 Breeze는 투표 수가 가장 적습니다.
00:05:09약 1,200표 정도죠.
00:05:11일레븐랩스는 4,500표가 넘습니다.
00:05:14즉, Breeze는 순위표 해당 부문에서 가장 검증이 덜 된 점수를 가지고 있습니다.
00:05:17신규 모델들은 보통 약간의 신제품 효과 버프를 받기도 하니까요.
00:05:21두 번째로, Breeze가 실제로 1위도 아닙니다.
00:05:24Cartesia Sonic 3.6은 1282점입니다.
00:05:27따라서 Breeze가 프론티어 독점 시스템을 이겼다고 말하는 것은 한편으로는 사실이지만
00:05:32굉장히 취사선택된 주장이기도 합니다.
00:05:33하지만 세 번째 문제가 이 모든 것의 핵심입니다.
00:05:36해당 리더보드는 각 모델이 자체 목소리를 사용하도록 허용합니다.
00:05:39Artificial Analysis에는 모든 모델에 정확히 동일한 프롬프트를 제공하는 또 다른 순위표가 있습니다.
00:05:45똑같은 테스트죠.
00:05:46말하자면 공정한 1대1 비교입니다.
00:05:49그리고 이 테스트에서 Breeze의 성적은 완전히 달라집니다.
00:05:51그 순위에서 점수는 1002점입니다.
00:05:54오픈 웨이트 모델 중에서는 3위입니다.
00:05:56전체 39개 중에서는 16위고요.
00:05:59미스트랄의 Vox Troll 뒤에 위치해 있습니다.
00:06:01그러니 Breeze는 이 많은 모델들과 경쟁하기에 꽤나 훌륭한 수준입니다.
00:06:04하지만 1위는 아닙니다.
00:06:05그리고 비교 대상이 될 목소리를 직접 고를 수 있을 때 유독 더 뛰어난 성적을 내는 것으로 보입니다.
00:06:10이 점은 우리가 이 모델을 바라보는 시각을 바꿔야 함을 시사합니다.
00:06:13하지만 이것이 제가 발견한 가장 큰 문제는 아니었습니다.
00:06:16이 모든 문제 중 가장 큰 쟁점은 바로 라이선스입니다.
00:06:19그리고 많은 사람들이 이 부분을 그냥 대충 넘어가고 있죠.
00:06:22그래요, 코드는 Apache 2.0입니다.
00:06:24거기에선 아무런 문제가 없습니다.
00:06:26하지만 가중치는 그렇지 않습니다.
00:06:27가중치는 Breeze Blue 연구 및 비상업용 라이선스(Breeze Blue Research and Non-Commercial License)라는 것을 사용합니다.
00:06:33이 구분이 실제로 매우 중요하기 때문에 그들의 원문을 그대로 짚어보고 싶습니다.
00:06:38이 라이선스가 명시하는 내용은 다음과 같습니다.
00:06:42본 계약은 모델 자료의 연구 및 비상업적 용도의 사용을 무료로 허가합니다.
00:06:47상업적 권리를 일절 부여하지 않으며 오픈소스 라이선스가 아닙니다.
00:06:52그들의 표현 그대로입니다.
00:06:53오픈소스 라이선스가 아니라는 거죠.
00:06:55좋습니다.
00:06:56가끔 어떤 모델에 비상업용 표시가 붙어 있어도 대개는 우리 가중치를 재판매하지 말라는 의미일 뿐입니다.
00:07:02그래요, 이해합니다.
00:07:02그건 말이 되죠.
00:07:04하지만 이건 그런 뜻이 아닙니다.
00:07:05상업적 목적의 정의에는 프로덕션 용도나
00:07:09제품이나 서비스에서의 활용, API 뒤에 모델을 호스팅하는 행위까지 포함됩니다.
00:07:13그리고 진짜 쐐기를 박는 부분이 있습니다.
00:07:16이것만으로도 충분하지 않다는 듯이,
00:07:17제한적인 평가 목적을 넘어선 내부 업무 운영에 출력물을 사용하는 것조차 포함됩니다.
00:07:23출력물 말입니다.
00:07:24자, 이게 도대체 무슨 뜻일까요?
00:07:26모델 자체뿐만 아니라 모델이 생성하는 오디오까지 해당된다는 겁니다.
00:07:29규제는 여기서 그치지 않고 계속 이어집니다.
00:07:31크리에이터 예외 조항도 없고, 소상공인 예외 조항도 없습니다.
00:07:35매출 기준 면제 조항도 없죠.
00:07:37아무것도 없습니다.
00:07:38많은 비상업용 라이선스들은 어느 정도 회색 지대를 남겨둡니다.
00:07:42이 라이선스는 그런 부분들을 거의 다 차단하려고 작정한 것 같습니다.
00:07:45자, 그럼 좀 더 현실적으로 생각해 봅시다.
00:07:47언제 이걸 쓸 수 있을까요?
00:07:48생성된 브리즈(Breeze) 음성을 제품 안에 넣는다고요?
00:07:51아니요.
00:07:52어림도 없습니다.
00:07:53수익 창출되는 유튜브 영상에 쓸 수 있나요?
00:07:56수익 창출이 되니까요.
00:07:58네, 안 됩니다.
00:07:58당연히 안 되죠.
00:07:59각종 팟캐스트 같은 곳은요?
00:08:00역시 마찬가지로 안 됩니다.
00:08:02결국 이건 거의 모든 걸 다 막아둡니다.
00:08:04라이선스에서는 스폰서십과 구독 수익까지 구체적으로 명시하고 있으니까요.
00:08:09비용을 지불하기 시작하면 백만 자당 34달러를 내야 합니다.
00:08:12하지만 그조차도 라이선스에서 아주 명확히 하는 점이 있습니다.
00:08:15API 비용을 낸다고 해서 자체 호스팅 모델에 대한 상업적 권리가 주어지는 것은 아니며
00:08:19자체 호스팅 모델에서 나온 결과물에 대한 권리도 주어지지 않습니다.
00:08:22이걸 알고 나면 이 모든 구조가 아주 명확히 이해됩니다.
00:08:25오픈 웨이트는 말 그대로 데모일 뿐이고
00:08:27API가 진짜 핵심 상품인 겁니다.
00:08:30그렇다면 애초에 오픈 웨이트는 얼마나 쓸 만할까요?
00:08:33그건 여러분이 직접 판단해 보세요.
00:08:34자, 이것 자체는 정말 멋졌습니다.
00:08:36음성 AI는 정말 대단하죠.
00:08:37하지만 얼마 전에 제가 Vox CPM2를 분석해 본 적이 있습니다.
00:08:41Vox CPM2는 솔직히 엄청났습니다.
00:08:43정말, 말 그대로 엄청나게 인상적이었죠.
00:08:45그러니 브리즈를 Vox CPM과 비교해 본다면
00:08:48브리즈는 단숨에 밀리고 말 겁니다.
00:08:50그리고 그 이유는 전부 저 라이선스 때문입니다.
00:08:52관건이죠.
00:08:53그러니 진정으로 자유롭고 오픈된 음성 복제 AI를 원한다면
00:08:56저는 여전히 Vox CPM2를 택하겠습니다.
00:08:58브리즈가 가진 기능을 모두 갖추고 있으면서도
00:09:00어쩌면 훨씬 더 나을 수도 있으니까요.
00:09:02그럼 브리즈를 써야 할까요?
00:09:03그게 문제겠죠.
00:09:04앞서 답을 드린 것 같지만, 가볍게 다뤄보자면요.
00:09:06음성 AI를 가지고 놀아보는 용도로는, 네, 써도 됩니다.
00:09:09음성 AI가 어디까지 발전하고 있는지 보는 건 재밌으니까요.
00:09:12브리즈는 꽤 좋습니다, 아시겠어요?
00:09:14모델을 테스트해 보는 건 재밌습니다.
00:09:16특히 성능이 갈수록 좋아질 때는 더 그렇죠.
00:09:18앞으로 어떻게 흘러갈까요?
00:09:19텍스트 설명만으로 목소리를 디자인하는 건
00:09:21진심으로 정말 멋진 기능입니다.
00:09:23하지만 상용 제품으로 무언가를 출시한다면
00:09:25이건 쓰지 마세요.
00:09:26다른 걸 쓰는 게 나을 겁니다.
00:09:27브리즈가 리더보드 어디에 위치하든 상관없이 말이죠.
00:09:30코코로(Kokoro)는 Apache 2.0입니다.
00:09:32채터박스(Chatterbox)는 MIT죠.
00:09:34Vox CPM도 한번 살펴보겠습니다.
00:09:35저것들을 전부 압도할지도 모르니까요.
00:09:36오픈 웨이트와 오픈소스는
00:09:38이미 오래전에 같은 의미가 아니게 되었습니다.
00:09:40브리즈는 그 차이를 무시할 수 없게 만듭니다.
00:09:43벤치마크는 모델이 무엇을 할 수 있는지 알려주지만
00:09:45라이선스는 여러분이 무엇을 할 수 있는지 알려줍니다.
00:09:48BetterStack의 조시였습니다.
00:09:49이와 같은 코딩 팁과 요령이 유익하셨다면
00:09:51구독을 꼭 눌러주세요.
00:09:53다음 영상에서 뵙겠습니다.

핵심 요약

Breeze TTS 2는 음성 아레나 리더보드에서 일레븐랩스를 뛰어넘는 성능을 보여주었으나, 상업적 사용을 엄격히 금지하는 비상업용 라이선스로 인해 실제 제품이나 수익 창출 콘텐츠에는 사용할 수 없다.

하이라이트

  • Breeze TTS 2는 3GB 용량의 30억 개 매개변수를 가진 오픈 웨이트 텍스트 음성 변환 모델이다.

  • Breeze는 별도의 참고 오디오 없이 문장 한 줄의 텍스트 설명만으로 목소리를 생성하는 음성 디자인 기능을 지원한다.

  • Artificial Analysis의 공급자 음성 리더보드에서 Breeze는 ELO 점수 1215점을 기록하며 일레븐랩스를 5점 차로 앞섰다.

  • 동일한 프롬프트를 사용하는 공정한 1대1 비교 리더보드에서 Breeze는 오픈 웨이트 모델 중 3위이자 전체 16위를 기록했다.

  • Breeze 가중치는 상업적 사용, 프로덕션 용도, 심지어 내부 업무 운영의 출력물 활용까지 금지하는 비상업용 라이선스를 적용한다.

타임라인

Breeze TTS 2의 기능과 실행 방법

  • Breeze TTS 2는 8월 25일에 공개된 3GB 용량의 오픈 웨이트 모델이다.
  • 참고 녹음 파일 없이 텍스트 설명만으로 목소리를 생성하는 음성 디자인 기능을 제공한다.
  • Qwen 3 백본, T5 Gemma 2 텍스트 인코더, MIMI 오디오 코덱을 사용하며 24킬로헤르츠 모노 오디오를 출력한다.

대다수의 오픈 텍스트 음성 변환 모델은 음성 복제를 위해 10초 분량의 참고 오디오를 필요로 한다. 반면 Breeze는 텍스트로 목소리를 묘사하는 방식을 채택하여 빈틈을 메운다. 맥북 환경에서 MLX audio를 통해 실행할 수 있으며, 괄호를 이용해 텍스트 중간에 웃음이나 한숨 같은 음성 효과를 직접 삽입할 수 있다.

리더보드 순위와 성능 분석

  • Artificial Analysis의 공급자 음성 리더보드에서 Breeze는 1215점을 기록하며 일레븐랩스를 앞질렀다.
  • 상위권 모델 중 Breeze는 약 1,200표로 가장 적은 투표 수를 기록하여 검증이 상대적으로 부족하다.
  • 모든 모델에 동일한 프롬프트를 제공하는 1대1 비교 리더보드에서 Breeze는 1002점으로 오픈 웨이트 중 3위를 기록했다.

Breeze가 일레븐랩스를 이겼다는 주장은 기술적으로는 사실이지만, 각 모델이 자체 목소리를 사용하도록 허용하는 리더보드의 특성에 기인한다. 공정한 비교 테스트에서는 순위가 하락하며, 비교 대상 목소리를 직접 고를 수 있을 때 더 뛰어난 성적을 내는 경향이 있다.

제한적인 라이선스와 활용 대안

  • Breeze 가중치는 모델 자료뿐만 아니라 생성된 오디오의 상업적 사용까지 금지하는 비상업용 라이선스를 사용한다.
  • 수익 창출 유튜브 영상, 팟캐스트, 제품 내 활용 등 거의 모든 실무적 용도가 제한된다.
  • 자유로운 활용을 원하는 경우 Apache 2.0 라이선스의 코코로와 MIT 라이선스의 채터박스, 혹은 Vox CPM2를 대안으로 선택할 수 있다.

코드는 Apache 2.0을 따르지만 가중치는 Breeze Blue Research and Non-Commercial License를 적용받는다. 프로덕션 용도와 내부 업무 운영에 출력물을 사용하는 것조차 차단되므로 상업적 제품에는 사용할 수 없다. 따라서 진정한 오픈 소스 모델인 다른 대안을 찾는 것이 더 안전하다.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기