새로운 30B 모델 두 개를 테스트해 봤습니다... 하나는 진짜 최악이네요! (Muse Glimmer & Lightning 3.5)
BBetter Stack
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00AI 모델의 결과물에 대해 이렇게 혹평하는 일은 드문데 이번 만큼은 꼭 한마디 해야겠습니다
00:00:08제가 테스트해 본 모델 중 아마 최악일 겁니다. 메타와 엔비디아가 이번 주에 새로운 모델을 각각 출시했는데
00:00:15공교롭게도 단 하루 차이를 두고 나왔으며, 수상하게도 두 모델 모두 300억 개의 파라미터 크기를 가지고 있습니다
00:00:21두 모델 모두 일반 소비자용 하드웨어에서 무난하게 실행되도록 설계되었지만 작동 방식에는
00:00:27명백한 차이가 있습니다. 제가 두 모델을 서로 다른 작업 세트로 테스트해 본 결과, 솔직히 한쪽은
00:00:32완전 쓰레기 수준이었고 다른 쪽은 실제로 꽤 쓸만했습니다. 과연 어느 쪽이 어떤 성능을 보여줄지
00:00:39계속 시청해 주시기 바랍니다. 이번 영상에서는 두 모델을 모두 살펴보고 어떻게 작동하는지 확인한 다음
00:00:44서로 대결을 붙여 최종적으로 더 뛰어난 모델이 무엇인지 가려보겠습니다
00:00:50아주 재미있을 테니 바로 시작하겠습니다
00:00:58먼저 두 모델을 각각 살펴보겠습니다. 첫 번째로는 월요일에 공개된 뮤즈 글리머가 있습니다
00:01:04이 모델은 플래그십 모델인 뮤즈 스파크의 증류 버전으로, RTX 5090 같은
00:01:10소비자용 GPU에서 실행될 수 있도록 특별히 제작되었습니다. 심지어 일반 M4나
00:01:18M5 맥에서도 실행 가능한 양자화 버전도 있습니다. 소문에 따르면 이 모델이 출시된 이유는 뮤즈 스파크가
00:01:25여전히 다들 클로드나 코덱스를 사용하고 있어 그다지 인기가 없다는 것을 깨달았기 때문이라고 합니다. 그래서 오픈소스
00:01:31방향으로 선회하기로 결정했다는군요. 그 소문이 사실인지는 확실하지 않지만, 사실이라 해도 놀랍지는 않습니다. 어쨌든
00:01:38뮤즈 글리머는 D 플래시 지원도 기본 탑재되어 있어 기본적으로 모델이 추측 디코딩을 수행할 수 있게 해줍니다
00:01:45이는 더 작은 초안 모델을 사용하여 16개의 단어 덩어리를 한 번에 추측한 다음
00:01:52메인 모델이 그 추측을 확인하고 틀린 부분을 수정하는 방식으로 작동합니다. 품질 저하 없이
00:01:583배 더 큰 속도 향상을 얻을 수 있으므로 좋은 추가 기능입니다. 하지만 실제로 잘 작동할까요?
00:02:04테스트에서 확인해 보겠습니다. 이제 화요일에 엔비디아가 공개한 네모트론 라이트닝 3.5에 대해 이야기해 보겠습니다
00:02:12이 역시 300억 파라미터 모델이지만 완전히 다른 방식으로 구축되었습니다. 이른바
00:02:18전문가 혼합(MoE) 모델이라고 불리는 방식입니다. 실제로 의미하는 바는
00:02:24무언가를 요청할 때마다 전체 모델을 매번 실행하는 대신, 라우터가 소수의 더 작은
00:02:30전문가 하위 네트워크를 선택하여 진행 중인 각 단어를 처리하도록 한다는 것입니다. 따라서 서류상 모델은 130억 파라미터이지만
00:02:38실제 작동 순간에 작업을 수행하는 것은 그중 약 30억 파라미터에 불과합니다. 바로 이것이
00:02:44서류상으로 거대한 모델임에도 불구하고 실행 속도가 빠르고 비용이 저렴한 이유입니다. 또한 엔비디아는
00:02:50네모 스위치야드(Nemo Switchyard)라는 자체 라우팅 설정 내부에서 이 모델을 실행하기를 강력히 원합니다
00:02:56작업의 각 단계를 가장 적합한 모델에 자동으로 전달하는 시스템입니다
00:03:03작업 요구 사항에 따라 오픈 모델, 독점 모델, 심지어 엔비디아 자체 모델 사이를 오갈 수 있습니다
00:03:10따라서 현실적으로 라이트닝의 가장 좋은 시나리오는 이 설정 내부에서 실행하는 것이겠지만,
00:03:16이번 영상에서는 뮤즈 글리머와 공정하게 비교하기 위해 단독으로 실행해 보겠습니다
00:03:22서류상으로 두 모델은 어떻게 비교될까요? 둘 다 300억 파라미터이며 둘 다
00:03:30도구 호출을 지원합니다. 덕분에 흥미로운 실험들을 진행할 수 있어 반가운 소식이지만
00:03:35네모트론 라이트닝에는 약간의 단점이 있습니다. 이미지를 전혀 볼 수 없어서 사진을 건네주고
00:03:41무슨 일인지 물어볼 수 없습니다. 반면 뮤즈 글리머는 실제 비전 시스템이 내장되어 있어
00:03:48이미지를 보고 추론할 수 있습니다. 컨텍스트 윈도우 크기에서도 실제 차이가 납니다. 뮤즈 글리머는 한 번에 약
00:03:5412만 8천 개의 토큰을 담을 수 있지만 네모트론 라이트닝은 무려 100만 개를 담을 수 있습니다. 따라서 서류상으로 라이트닝은
00:04:03방대한 문서를 파고들어야 할 때 찾는 모델이어야 하고, 글리머는
00:04:09더 짧고 조밀한 질의응답에 더 적합하다고 볼 수 있습니다. 자, 이제 이 두 모델에 대한 제대로 된 테스트를 진행해 보겠습니다
00:04:15RTX 5090과 64GB DDR5 램을 갖춘 소규모 홈랩 워크스테이션이 여기에 있습니다
00:04:23올라마 서버에 두 모델 모두 로드해 두었으며,
00:04:29오픈 코드를 통해 이 서버에 쿼리를 날릴 것입니다. 제 오픈 코드 JSON 설정은 대략 이런 모습입니다
00:04:34여기에 두 개의 모델이 있고, 두 개의 MCP 서버도 로드되어 있습니다. 그중 하나는 어도비
00:04:41프리미어 플러그인으로 편집 소프트웨어를 외부에서 제어하도록 빌드되었고, 다른 하나는
00:04:47음악을 가져오기 위한 에피데믹 사운드용 MCP 서버입니다. 이는 나중에 진행할 테스트 중 하나에 유용하게 쓰일 것입니다
00:04:52알겠습니다. 하지만 먼저 다른 테스트부터 시작하겠습니다. 두 모델 모두에게
00:04:57ESP32-C3 마이크로컨트롤러가 스위치와 다이오드가 있는 브레드보드에 어떻게 연결되는지 보여주는 간단한 웹페이지를 만들도록 요청할 것입니다
00:05:06이 작업에 대한 프롬프트가 꽤 길기 때문에 따라 해보고 싶으신 분들을 위해 깃허브 지스트에 올려두겠습니다
00:05:12이 테스트를 수행하기 전에 최첨단 프론티어 모델이 어떤 결과를 보여줄지 확인하려고 오푸스 5에 이 프롬프트를 주었습니다
00:05:18결과에 꽤 만족스러웠습니다. 기본적으로 이 전자 설정이 어떻게 작동하는지 보여주는 시각적 가이드이며
00:05:24전류가 어떻게 흐르는지 등을 볼 수 있는 약간의 상호작용 기능이 포함되어 있습니다
00:05:30어떤 모델도 그만큼 훌륭한 작업을 해낼 것이라고 기대하지는 않지만, 적어도 단순화된 버전이라도 설정하려고 시도하기를 바랍니다
00:05:36먼저 네모트론 라이트닝으로 이 테스트를 실행해 보겠습니다. 보시다시피 모델은 즉시 여러 개의 컬(curl) 요청을 날려
00:05:42일부 페이지를 가져왔고, 약 5분 동안 작업을 수행했습니다
00:05:47그 결과로 얻은 것은 버튼이 몇 개 있는 빈 페이지였습니다. 시각적 요소가 전혀 없고
00:05:54버튼도 작동하지 않습니다. 이 시점에서 라이트닝이 이 작업을 제대로 수행하지 못했다고 판단되지만
00:06:00한 번 더 기회를 주고 싶어 페이지에 몇 가지 문제가 있다고 프롬프트를 다시 입력하여
00:06:05두 번째 라운드에서 수정되는지 확인해 보았습니다
00:06:10두 번째 라운드는 라이트닝이 완료하는 데 6분이 걸렸고, 그 결과로 얻은 것은
00:06:16첫 번째와 똑같이 고장 난 결과물이었습니다. 아무것도 표시되지 않고 버튼도 작동하지 않습니다. 따라서 안타깝게도 이 시점에서
00:06:21라이트닝이 이 작업을 완전히 실패했다고 선언할 수밖에 없습니다. 좋습니다, 이제
00:06:26뮤즈 글리머로 전환하여 동일한 프롬프트로 동일한 작업을 어떻게 수행했는지 살펴보겠습니다. 뮤즈 글리머는
00:06:32웹 페이지를 가져오기 위해 여러 개의 웹 페치 도구 호출을 실행했고, 전체 라운드는
00:06:38약 2분 50초 만에 완료되었습니다. 그 결과로 얻은 웹페이지는 솔직히
00:06:44라이트닝이 한 것보다 훨씬 나았습니다. 적어도 페이지에 작동하는 버튼이 있었고,
00:06:49전류를 어느 정도 표현했으며, 컨트롤러의 핀 레이아웃도 실제로 만들었습니다. 그리고
00:06:55각 영역이 무엇이고 어떤 역할을 하는지 설명하는 툴팁도 일부 포함되어 있었습니다. 하지만 안타깝게도 여전히
00:07:02적절한 배선도는 만들지 못했으므로 이 결과에 만족한다고 말할 수는 없지만, 라이트닝이 동일한 작업에서 보여준 것에 비하면
00:07:08큰 진전입니다. 따라서 이번 경우에는 뮤즈 글리머의 손을 들어주겠습니다. 적어도 시도는 했으니까요
00:07:15솔직히 몇 번 더 버그 수정을 거치면 작동 가능한 버전으로 만들 수 있을 것으로 생각됩니다. 자, 이제
00:07:21두 번째 테스트로 넘어가겠습니다. 이 테스트는 꽤 기대가 큽니다. 특히 이 테스트를 위해
00:07:26UXP 어도비 브리지를 통해 편집기와 연결되는 어도비 프리미어 플러그인을 만들었기 때문입니다. 즉,
00:07:35도구 호출을 지원하는 모든 AI 모델은 이론적으로 프리미어를 자율적으로 탐색하고
00:07:41편집기에서 특정 작업을 수행할 수 있습니다. 오푸스 5로 테스트해 보았는데 매우 잘 작동합니다. 이 플러그인을
00:07:47확인해 보고 싶으신 분들을 위해 아래 설명란에 깃허브 저장소 링크도 추가해 두었습니다. 자, 두 모델 모두
00:07:52도구 호출을 지원하므로 프리미어 내부에서 작업하는 데 문제가 없어야 합니다. 또한
00:07:58네모트론 라이트닝은 여러 번의 빠른 도구 호출이 필요한 작업과 같은 빠른 처리 작업에 맞춤형으로 최적화되어 있으므로
00:08:05라이트닝이 뮤즈 글리머보다 이 작업을 더 잘 수행할 것으로 기대했습니다
00:08:11하지만 실제로 그런지 확인해 봅시다. 작업 자체를 위해 프리미어 프로젝트를 열어두었고
00:08:16최근 구글 키노트 프레젠테이션 녹화본이 있으며 이미 전사가 완료되어 있습니다
00:08:22재미 삼아 모델이 대본을 파싱하여 누군가 'AI'라는 단어를 말하는 모든 지점을 찾고
00:08:28사람들이 계속해서 AI를 말하는 짧은 클립들의 빠른 몽타주를 만들도록 하고 싶었습니다
00:08:35그런 다음 에피데믹 사운드의 MCP 서버를 사용하여 적절한 배경 음악을 추가하도록 했습니다
00:08:41AI 모델에게는 꽤 간단하고 직관적인 작업입니다. 라이트닝이 어떻게 수행하는지 봅시다. 처음에는 꽤 강력하게 시작합니다
00:08:47라이트닝이 도구 호출을 인식하고 매우 빠르게 실행하는 것을 볼 수 있으며
00:08:52대본을 가져오고 사람들이 AI라고 말하는 모든 지점을 찾아낼 수 있었습니다
00:08:58그 후 개별 조각들을 잘라내어 별도의 시퀀스에 배치하는 작업도 성공적으로 해냈습니다
00:09:04여기까지는 아주 훌륭하지만, 에피데믹 사운드로 배경 음악을 추가하는 단계에 이르러서는
00:09:09상황이 조금 까다로워지기 시작했습니다. 사운드트랙을 찾아 시퀀스에 배치하긴 했지만
00:09:15첫 번째 오디오 트랙에 넣는 바람에 화자 오디오 위에 겹쳐지게 되었습니다. 기본적으로 그 결과
00:09:22실제 음성은 들리지 않고 배경 음악만 남게 되었습니다. 그래서 저는 후속 프롬프트에서 이 점을 지적하여
00:09:28실수를 수정하는지 보았고, 실제로 실수를 인지하고 배경 음악을 별도의 오디오 트랙으로 이동시킨 다음
00:09:33작업이 완료되었다고 선언했습니다. 하지만 사실 이전에 삭제되었기 때문에 화자 오디오는 여전히 없는 상태였습니다
00:09:39그래서 화자 오디오를 다시 가져오라고 프롬프트를 보냈고, 이 시점에서 모델은 완전히 엉망이 되었습니다
00:09:45오디오를 살리려고 하다가 원래 트랙을 삭제하기 시작했고 타임라인을 완전히 망쳐버렸기 때문입니다
00:09:50이 시점에서 저는 너무 좌절하여 계속 진행할 수 없었습니다. 따라서 라이트닝이 또 다른 작업에서 안타깝게도 실패했다고
00:09:56다시 한번 선언할 수밖에 없습니다. 라이트닝이 가장 잘할 것이라 생각했던 종류의 작업이었기에
00:10:03정말 실망스럽습니다. 어쨌든 이제 뮤즈 글리머로 전환하여 동일한 작업에서 어떻게 수행했는지 살펴보겠습니다
00:10:08다시 한번 동일한 프롬프트로 시작했으며, 뮤즈 글리머가 도구 호출에서는 조금 더 느렸지만
00:10:14모든 것을 적절하게 처리하는 것을 확인했습니다. 시퀀스를 올바르게 배치하고 배경 음악을 찾아
00:10:19모든 것을 제대로 처리했습니다. 시퀀스를 올바르게 배치하고 배경 음악을 찾아
00:10:25별도의 오디오 트랙에 적용했으며, 비디오 트랙 길이에 맞게 음악의 재생 시간을 다듬고 페이드 아웃
00:10:31효과까지 프롬프트의 요구대로 음악에 추가했습니다. 이것만 봐도 뮤즈 글리머가
00:10:37이러한 세부 사항과 작은 문제들을 식별하는 데 훨씬 더 영리하다는 것을 알 수 있습니다. 그래서 저는
00:10:42첫 번째 결과에 꽤 만족했으며, 뮤즈 글리머가 이 작업의 승자라고 자신 있게 선언할 수 있습니다.
00:10:48하지만 한 가지 더 부탁하고 싶은 것이 있었습니다. 배경 음악을 바꾸고 싶었는데요,
00:10:53첫 번째 선택에 완전히 만족스럽지는 않았기 때문입니다. 그래서 에피데믹 사운드에서
00:10:59다른 배경 트랙을 찾아달라고 다시 프롬프트를 입력했고, 아주 우아하게 기존 음악 트랙을 새로운
00:11:05트랙으로 성공적으로 교체해 주었습니다. 참 잘했어요, 뮤즈 글리머. 사실 저는 이걸 매일 사용해 볼까 고민 중입니다.
00:11:11클로드 토큰 사용량이 한도에 도달한다면 말이죠. 자, 이 시점에서 라이트닝이 우수해야 할 맞춤형 작업에서조차
00:11:18실패했기 때문에, 이번에는 라이트닝이 더 잘 수행할 수 있어야 하는 마지막 작업을 진행해 보려고 합니다.
00:11:24100만 토큰 컨텍스트 윈도우를 가지고 있기 때문이죠. 이 세 번째 작업에서는 실제로 그 컨텍스트 윈도우의 격차를
00:11:30제대로 활용해 보고 싶었습니다. 그래서 SEC 웹사이트에서 직접 자료를 가져왔는데,
00:11:36엔비디아의 2026 회계연도 10-K 서류입니다. 100페이지가 넘는 방대한 재무 및 법적 내용이 담긴 문서죠.
00:11:46여기에는 약간 재미있는 점도 있습니다. 기본적으로 엔비디아의 자체 모델에게 엔비디아 자신에 대한 서류를
00:11:52읽어달라고 요청하는 셈이니까요. 그래서 질문은 꽤 단순했습니다. 모델에게 엔비디아의
00:11:59가장 큰 두 고객으로부터 전체 매출의 몇 퍼센트가 나왔는지, 그 매출이 어떤 사업 부문에
00:12:04귀속되는지 찾고, 그 숫자가 재무제표 주석에 나중에 다시 등장하는지
00:12:10교차 검증해 달라고 요청했습니다. 먼저 라이트닝이 이 작업을 어떻게 수행했는지 봅시다.
00:12:16솔직히 저는 이 작업이 쉬울 거라고 예상했습니다. 특히 라이트닝에게는요. 큰 컨텍스트 윈도우로
00:12:23방대한 문서를 훑어보는 데 특화되어 있으니까요. 하지만 무슨 일이 일어났는지 보십시오.
00:12:28SEC에 대한 가져오기(fetch) 요청이 오류와 함께 돌아왔고, 재시도하는 대신 일반 검색으로
00:12:35후퇴하여 결과로 나온 내용을 그대로 진행했습니다. 알고 보니 그것은 틀린 내용이었고,
00:12:41두 고객이 매출의 23%를 합산하여 차지했으며, 데이터 센터 부문에 각각 대략 13%와 10%가
00:12:48귀속된다고 말했습니다. 실제 서류에는 22%와 14%, 합산 36%라고 적혀 있으므로 이 중 맞는 것은 하나도 없습니다. 이 작업에
00:12:57실패했을 뿐만 아니라, 내장된 도구 호출을 제대로 활용하는 데도 실패했습니다. 웹페이지조차
00:13:03제대로 가져오지 못했으니까요. 하지만 가장 최악인 점은 전혀 사실이 아닌 숫자를 환각(hallucination)해 냈다는 것입니다.
00:13:13AI 모델의 결과물에 대해 이렇게 혹평하는 경우는 드문데, 이번만큼은 꼭 해야겠습니다.
00:13:19이건 아마 제가 테스트해 본 모델 중 최악일 겁니다. 네모트론의 라이트닝을 위해 꽤 간단하게 만들었고,
00:13:25맞춤형으로 최적화된 작업을 찾으려고 노력했는데도 비참하게 실패했습니다.
00:13:32젠장, 어쨌든 뮤즈 글리머가 같은 작업을 어떻게 해냈는지 확인해 봐야겠죠. 뮤즈 글리머에게
00:13:38동일한 작업을 프롬프트로 주었을 때 완료하는 데 약 3분이 걸렸고 여러 번의 웹 요청을 보냈습니다.
00:13:44그중 일부는 실패했지만, 그럼에도 불구하고 이를 잘 헤쳐나가며 올바른 정보를
00:13:50성공적으로 검색해 냈습니다. 이 경우 정확히 22%, 14%, 합산 36%라는 정보 말이죠. 다시 한번 잘했어요, 뮤즈 글리머.
00:13:59또 하나의 테스트를 통과했습니다. 전반적으로 이 테스트 결과 우리의 위치는 어디쯤일까요? 저는 뮤즈 글리머에게
00:14:063점 만점에 2점을 주겠습니다. 작업 중 두 가지를 수용 가능한 결과로 완수해 냈기 때문입니다. 하지만
00:14:12네모트론의 라이트닝은 말이죠, 정말 실망스럽습니다. 엔비디아에서 이런 모델이 나올 거라고는
00:14:18솔직히 예상하지 못했습니다. 제 말은, 그들이 자기네 모델을 테스트하기는 하는 걸까요? 과연 벤치마크를 믿을 수 있는 걸까요?
00:14:26이제 정말 진짜인 게 하나라도 있긴 한가요? 이는 이번 영상에서 답하지 않을 좋은 실존적 질문들입니다.
00:14:31하지만 우리 채널을 구독하시면 이에 대해 무언가 다루게 될지도 모릅니다. 자, 여러분, 두 모델을
00:14:36간단히 요약하자면 이렇습니다. 이 테스트들을 통해 제가 얻은 결론은, 뮤즈 글리머에게 유쾌하게 놀랐다는 점이며
00:14:42특정 유형의 작업에 대해서는 실제로 일상적으로 이 모델을 사용하는 것을 고려해 보겠다는 것입니다.
00:14:48하지만 네모트론의 라이트닝에 관해서는, 할 말은 다 했으니 더 이상 언급하고 싶지 않습니다.
00:14:55하지만 이건 제 개인적인 생각과 관찰일 뿐입니다. 여러분은 어떻게 생각하시나요? 아래 댓글창에
00:15:00알려주세요. 이번에는 평소의 아웃트로 대신 영상 끝에 재미있는 무언가를 남겨드리려고 합니다.
00:15:06그러니 작업 중 하나에서 뮤즈 글리머가 수행한 AI 몽타주를 보여드리겠습니다. 재미있게 보시고 다음 영상에서 뵙겠습니다.
00:15:14다음 영상들
00:15:22은
00:15:34AI