스크립트
00:00:00오픈 웨이트 텍스트 음성 변환 모델이 방금 인공 분석에서 일레븐랩스를 이겼습니다.
00:00:05바로 Breeze입니다.
00:00:07다운로드 용량은 3GB입니다.
00:00:09맥북에서 실행되는데, 생성된 결과물을 업무에 실제로 사용하고 싶다면
00:00:13아마 허용되지도 않을 겁니다.
00:00:15결과물이 엄청나게 좋아서가 아닙니다.
00:00:17글쎄요, 괜찮은 편이죠.
00:00:18꽤 좋습니다.
00:00:19하지만 진짜 문제는 라이선스입니다.
00:00:21그래서 먼저 Breeze가 무엇을 할 수 있는지 보여드리고, 이를 실제로 어떻게 사용할 수 있는지 다루겠습니다.
00:00:30이것은 Breeze TTS 2입니다.
00:00:338월 25일에 Breeze Blue라는 회사에서 처음 공개했습니다.
00:00:37벤치마크도 좋지만, 음성을 생성하는 방식이 훨씬 더 멋집니다.
00:00:41요즘 대다수의 오픈 텍스트 음성 변환 모델은 음성 복제를 지원합니다.
00:00:45보통 정확한 대본과 함께 10초 정도의 참고용 오디오를 제공하면
00:00:50그 목소리를 흉내 내려 하죠.
00:00:52작동은 하지만, 당연히 처음부터 목소리 파일이 필요합니다.
00:00:56하지만 Breeze는 그럴 필요가 없습니다.
00:00:58사용하고 싶은 목소리를 말로 설명하기만 하면 됩니다.
00:01:01예를 들면 이런 식일 수 있죠.
00:01:03차분하고 사색적인 어조를 가진, 따뜻하고 깊이 있는 지혜로운 노인.
00:01:08모건 프리먼을 떠올려보세요.
00:01:09그러면 그 묘사에 맞춰 목소리를 생성해 냅니다.
00:01:12참고 녹음 파일이 필요 없습니다.
00:01:14요즘에는 이를 '음성 디자인'이라고 부르며,
00:01:16점점 더 뛰어난 음성 디자인 기능을 갖춘 오픈 웨이트 음성 모델들이
00:01:19속속 등장하고 있습니다.
00:01:23그리고 이것은 오픈 TTS의 빈틈을 완벽히 메워줍니다.
00:01:26Kokoro는 고정된 프리셋을 제공합니다.
00:01:29Chatterbox는 참고 오디오가 필요하죠.
00:01:31하지만 Breeze는 한 줄의 문장만으로 목소리를 만들어낼 수 있습니다.
00:01:34그러면 실제로 한번 들어보죠.
00:01:35작업 속도를 높여주는 코딩 도구를 좋아하신다면 꼭 구독해 주세요.
00:01:39유용한 영상들이 계속 업로드됩니다.
00:01:41이 프로그램을 실행하는 과정은 대부분 제 터미널에서 진행됩니다.
00:01:45가상 환경을 만들고 pip를 통해 MLX audio를 설치했습니다.
00:01:49제 맥에서 실행 중이기 때문에 여기서 MLX가 필요했던 겁니다.
00:01:53만약 리눅스를 사용 중이거나 엔비디아 GPU가 있다면
00:01:56설정 방법은 조금 다르겠지만 역시나 아주 간단합니다.
00:02:00그래서 똑같은 문장을 가지고 터미널에서 실행해 보았습니다.
00:02:03두 가지 서로 다른 목소리 지시사항을 사용해서요.
00:02:05첫 번째 것을 실행해 보죠.
00:02:06BetterStack 채널에 오신 것을 환영합니다.
00:02:09기술과 AI에 관한 모든 것, 아직 구독하지 않으셨나요?
00:02:13이번에는 억양을 살짝 다르게 한 정확히 같은 문장입니다.
00:02:19BetterStack 채널에 오신 것을 환영합니다.
00:02:21기술과 AI에 관한 모든 것, 아직 구독하지 않으셨나요?
00:02:27단어는 똑같지만 완전히 다른 사람, 혹은 AI 목소리였습니다.
00:02:33순위는 높게 나오지만, 여전히 AI 목소리라는 티는 나죠?
00:02:37그래도 좋습니다.
00:02:38꽤 쓸 만하고 감정을 설정하는 기능도 실제로 탑재되어 있습니다.
00:02:42여기서 이 모든 것의 핵심이 되는 설정이 하나 있는데, 바로 CFG 스케일입니다.
00:02:47모델이 사용자의 목소리 설명을 얼마나 강하게 따를지 제어하죠.
00:02:51이 값을 낮추면 모델은 점차 더 일반적인 목소리로 돌아가게 됩니다.
00:02:55문서에 나온 권장 숫자는 4이며, 저 역시 일부 목소리에 이 값을 사용하고 있습니다.
00:03:00하지만 순수한 AI 목소리를 느껴보기 위해 이 값을 1로 빠르게 낮춰보겠습니다.
00:03:05자, 갑니다.
00:03:05BetterStack 채널에 오신 것을 환영합니다.
00:03:08이 목소리는 명백한 AI입니다.
00:03:10무슨 뜻인지 아시겠죠?
00:03:11완전한 AI 소리가 났습니다.
00:03:12이제 텍스트 안에 음성 효과를 직접 넣을 수도 있는데 이게 정말 멋진 기능입니다.
00:03:18말 그대로 괄호를 입력할 수 있죠.
00:03:20한숨(sigh)이라고 적고 괄호를 닫을 수 있습니다.
00:03:23문장 한가운데나 끝, 혹은 시작 부분에 웃음이나 울음 같은 효과를 직접 넣을 수 있죠.
00:03:28한번 들어보죠.
00:03:30너한테 농담을 하려고 하면 웃음이 터져서 참을 수가 없어.
00:03:35텍스트의 일부로 작동하는 멋진 기능입니다.
00:03:38하지만 요즘 많은 오픈 웨이트 음성 모델들도 이런 기능을 탑재하고 나오고 있죠.
00:03:42Breeze의 성능이 실제로 얼마나 좋은지는 여러분이 직접 판단해 보세요.
00:03:46AI 입장에서 정말 좋은가요?
00:03:47지금 차지하고 있는 순위가 마땅한가요?
00:03:50자, Breeze는 여러분이 아마 들어봤을 익숙한 구성 요소들로 만들어졌습니다.
00:03:54언어 모델링은 Qwen 3 백본이 담당합니다.
00:03:57T5 Gemma 2 텍스트 인코더도 있습니다.
00:03:59그리고 오디오 코덱은 MIMI가 처리합니다.
00:04:01이 모델은 약 30억 개의 매개변수를 가지며 24킬로헤르츠 모노 오디오를 출력합니다.
00:04:07하지만 여기서 기억해야 할 세부 사항이 하나 있습니다.
00:04:09오디오 토크나이저는 Qwen 3 TTS에서 파생되었으며, Qwen 3 TTS는 Apache 2.0 라이선스를 따릅니다.
00:04:16즉, 이 모델의 일부는 진정한 오픈 소스를 기반으로 만들어졌습니다.
00:04:19이 점을 명심하세요. 잠시 후에 이 사실이 꽤 아이러니해지니까요.
00:04:23하지만 먼저 Breeze를 떡상하게 만든 그 주장에 대해 이야기해 보겠습니다.
00:04:27Breeze가 일레븐랩스를 이겼다는 주장 말이죠.
00:04:29네, 정말 이겼습니다.
00:04:30기술적으로는 사실이지만, 들리는 음성 결과물을 보면 어떻게 이겼는지 잘 모르겠습니다.
00:04:36또한 이 부분은 단순히 그렇게 말하는 것보다 훨씬 더 복잡합니다.
00:04:40인공 분석(Artificial Analysis)은 블라인드 쌍대 비교 방식의 인간 투표를 기반으로 음성 아레나를 운영합니다.
00:04:45Breeze Blue가 아니라 독립된 벤치마크 기업이죠.
00:04:49공급자 음성 리더보드에서 Breeze는 1215점을 기록하고 있습니다.
00:04:53ELO 점수입니다.
00:04:54일레븐랩스 대화형 모델은 1210점입니다.
00:04:57그러니까 기술적으로는 5점 차로 이긴 게 맞습니다.
00:05:00Breeze가 일레븐랩스를 이긴 거죠.
00:05:01좋습니다, 하지만 이 내용을 더 파고들면 문제들이 튀어나오기 시작합니다.
00:05:06우선, 상위권 모델 중 Breeze는 투표 수가 가장 적습니다.
00:05:09약 1,200표 정도죠.
00:05:11일레븐랩스는 4,500표가 넘습니다.
00:05:14즉, Breeze는 순위표 해당 부문에서 가장 검증이 덜 된 점수를 가지고 있습니다.
00:05:17신규 모델들은 보통 약간의 신제품 효과 버프를 받기도 하니까요.
00:05:21두 번째로, Breeze가 실제로 1위도 아닙니다.
00:05:24Cartesia Sonic 3.6은 1282점입니다.
00:05:27따라서 Breeze가 프론티어 독점 시스템을 이겼다고 말하는 것은 한편으로는 사실이지만
00:05:32굉장히 취사선택된 주장이기도 합니다.
00:05:33하지만 세 번째 문제가 이 모든 것의 핵심입니다.
00:05:36해당 리더보드는 각 모델이 자체 목소리를 사용하도록 허용합니다.
00:05:39Artificial Analysis에는 모든 모델에 정확히 동일한 프롬프트를 제공하는 또 다른 순위표가 있습니다.
00:05:45똑같은 테스트죠.
00:05:46말하자면 공정한 1대1 비교입니다.
00:05:49그리고 이 테스트에서 Breeze의 성적은 완전히 달라집니다.
00:05:51그 순위에서 점수는 1002점입니다.
00:05:54오픈 웨이트 모델 중에서는 3위입니다.
00:05:56전체 39개 중에서는 16위고요.
00:05:59미스트랄의 Vox Troll 뒤에 위치해 있습니다.
00:06:01그러니 Breeze는 이 많은 모델들과 경쟁하기에 꽤나 훌륭한 수준입니다.
00:06:04하지만 1위는 아닙니다.
00:06:05그리고 비교 대상이 될 목소리를 직접 고를 수 있을 때 유독 더 뛰어난 성적을 내는 것으로 보입니다.
00:06:10이 점은 우리가 이 모델을 바라보는 시각을 바꿔야 함을 시사합니다.
00:06:13하지만 이것이 제가 발견한 가장 큰 문제는 아니었습니다.
00:06:16이 모든 문제 중 가장 큰 쟁점은 바로 라이선스입니다.
00:06:19그리고 많은 사람들이 이 부분을 그냥 대충 넘어가고 있죠.
00:06:22그래요, 코드는 Apache 2.0입니다.
00:06:24거기에선 아무런 문제가 없습니다.
00:06:26하지만 가중치는 그렇지 않습니다.
00:06:27가중치는 Breeze Blue 연구 및 비상업용 라이선스(Breeze Blue Research and Non-Commercial License)라는 것을 사용합니다.
00:06:33이 구분이 실제로 매우 중요하기 때문에 그들의 원문을 그대로 짚어보고 싶습니다.
00:06:38이 라이선스가 명시하는 내용은 다음과 같습니다.
00:06:42본 계약은 모델 자료의 연구 및 비상업적 용도의 사용을 무료로 허가합니다.
00:06:47상업적 권리를 일절 부여하지 않으며 오픈소스 라이선스가 아닙니다.
00:06:52그들의 표현 그대로입니다.
00:06:53오픈소스 라이선스가 아니라는 거죠.
00:06:55좋습니다.
00:06:56가끔 어떤 모델에 비상업용 표시가 붙어 있어도 대개는 우리 가중치를 재판매하지 말라는 의미일 뿐입니다.
00:07:02그래요, 이해합니다.
00:07:02그건 말이 되죠.
00:07:04하지만 이건 그런 뜻이 아닙니다.
00:07:05상업적 목적의 정의에는 프로덕션 용도나
00:07:09제품이나 서비스에서의 활용, API 뒤에 모델을 호스팅하는 행위까지 포함됩니다.
00:07:13그리고 진짜 쐐기를 박는 부분이 있습니다.
00:07:16이것만으로도 충분하지 않다는 듯이,
00:07:17제한적인 평가 목적을 넘어선 내부 업무 운영에 출력물을 사용하는 것조차 포함됩니다.
00:07:23출력물 말입니다.
00:07:24자, 이게 도대체 무슨 뜻일까요?
00:07:26모델 자체뿐만 아니라 모델이 생성하는 오디오까지 해당된다는 겁니다.
00:07:29규제는 여기서 그치지 않고 계속 이어집니다.
00:07:31크리에이터 예외 조항도 없고, 소상공인 예외 조항도 없습니다.
00:07:35매출 기준 면제 조항도 없죠.
00:07:37아무것도 없습니다.
00:07:38많은 비상업용 라이선스들은 어느 정도 회색 지대를 남겨둡니다.
00:07:42이 라이선스는 그런 부분들을 거의 다 차단하려고 작정한 것 같습니다.
00:07:45자, 그럼 좀 더 현실적으로 생각해 봅시다.
00:07:47언제 이걸 쓸 수 있을까요?
00:07:48생성된 브리즈(Breeze) 음성을 제품 안에 넣는다고요?
00:07:51아니요.
00:07:52어림도 없습니다.
00:07:53수익 창출되는 유튜브 영상에 쓸 수 있나요?
00:07:56수익 창출이 되니까요.
00:07:58네, 안 됩니다.
00:07:58당연히 안 되죠.
00:07:59각종 팟캐스트 같은 곳은요?
00:08:00역시 마찬가지로 안 됩니다.
00:08:02결국 이건 거의 모든 걸 다 막아둡니다.
00:08:04라이선스에서는 스폰서십과 구독 수익까지 구체적으로 명시하고 있으니까요.
00:08:09비용을 지불하기 시작하면 백만 자당 34달러를 내야 합니다.
00:08:12하지만 그조차도 라이선스에서 아주 명확히 하는 점이 있습니다.
00:08:15API 비용을 낸다고 해서 자체 호스팅 모델에 대한 상업적 권리가 주어지는 것은 아니며
00:08:19자체 호스팅 모델에서 나온 결과물에 대한 권리도 주어지지 않습니다.
00:08:22이걸 알고 나면 이 모든 구조가 아주 명확히 이해됩니다.
00:08:25오픈 웨이트는 말 그대로 데모일 뿐이고
00:08:27API가 진짜 핵심 상품인 겁니다.
00:08:30그렇다면 애초에 오픈 웨이트는 얼마나 쓸 만할까요?
00:08:33그건 여러분이 직접 판단해 보세요.
00:08:34자, 이것 자체는 정말 멋졌습니다.
00:08:36음성 AI는 정말 대단하죠.
00:08:37하지만 얼마 전에 제가 Vox CPM2를 분석해 본 적이 있습니다.
00:08:41Vox CPM2는 솔직히 엄청났습니다.
00:08:43정말, 말 그대로 엄청나게 인상적이었죠.
00:08:45그러니 브리즈를 Vox CPM과 비교해 본다면
00:08:48브리즈는 단숨에 밀리고 말 겁니다.
00:08:50그리고 그 이유는 전부 저 라이선스 때문입니다.
00:08:52관건이죠.
00:08:53그러니 진정으로 자유롭고 오픈된 음성 복제 AI를 원한다면
00:08:56저는 여전히 Vox CPM2를 택하겠습니다.
00:08:58브리즈가 가진 기능을 모두 갖추고 있으면서도
00:09:00어쩌면 훨씬 더 나을 수도 있으니까요.
00:09:02그럼 브리즈를 써야 할까요?
00:09:03그게 문제겠죠.
00:09:04앞서 답을 드린 것 같지만, 가볍게 다뤄보자면요.
00:09:06음성 AI를 가지고 놀아보는 용도로는, 네, 써도 됩니다.
00:09:09음성 AI가 어디까지 발전하고 있는지 보는 건 재밌으니까요.
00:09:12브리즈는 꽤 좋습니다, 아시겠어요?
00:09:14모델을 테스트해 보는 건 재밌습니다.
00:09:16특히 성능이 갈수록 좋아질 때는 더 그렇죠.
00:09:18앞으로 어떻게 흘러갈까요?
00:09:19텍스트 설명만으로 목소리를 디자인하는 건
00:09:21진심으로 정말 멋진 기능입니다.
00:09:23하지만 상용 제품으로 무언가를 출시한다면
00:09:25이건 쓰지 마세요.
00:09:26다른 걸 쓰는 게 나을 겁니다.
00:09:27브리즈가 리더보드 어디에 위치하든 상관없이 말이죠.
00:09:30코코로(Kokoro)는 Apache 2.0입니다.
00:09:32채터박스(Chatterbox)는 MIT죠.
00:09:34Vox CPM도 한번 살펴보겠습니다.
00:09:35저것들을 전부 압도할지도 모르니까요.
00:09:36오픈 웨이트와 오픈소스는
00:09:38이미 오래전에 같은 의미가 아니게 되었습니다.
00:09:40브리즈는 그 차이를 무시할 수 없게 만듭니다.
00:09:43벤치마크는 모델이 무엇을 할 수 있는지 알려주지만
00:09:45라이선스는 여러분이 무엇을 할 수 있는지 알려줍니다.
00:09:48BetterStack의 조시였습니다.
00:09:49이와 같은 코딩 팁과 요령이 유익하셨다면
00:09:51구독을 꼭 눌러주세요.
00:09:53다음 영상에서 뵙겠습니다.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기