새로운 30B 모델 두 개를 테스트해 봤습니다... 하나는 진짜 최악이네요! (Muse Glimmer & Lightning 3.5)

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00AI 모델의 결과물에 대해 이렇게 혹평하는 일은 드문데 이번 만큼은 꼭 한마디 해야겠습니다
00:00:08제가 테스트해 본 모델 중 아마 최악일 겁니다. 메타와 엔비디아가 이번 주에 새로운 모델을 각각 출시했는데
00:00:15공교롭게도 단 하루 차이를 두고 나왔으며, 수상하게도 두 모델 모두 300억 개의 파라미터 크기를 가지고 있습니다
00:00:21두 모델 모두 일반 소비자용 하드웨어에서 무난하게 실행되도록 설계되었지만 작동 방식에는
00:00:27명백한 차이가 있습니다. 제가 두 모델을 서로 다른 작업 세트로 테스트해 본 결과, 솔직히 한쪽은
00:00:32완전 쓰레기 수준이었고 다른 쪽은 실제로 꽤 쓸만했습니다. 과연 어느 쪽이 어떤 성능을 보여줄지
00:00:39계속 시청해 주시기 바랍니다. 이번 영상에서는 두 모델을 모두 살펴보고 어떻게 작동하는지 확인한 다음
00:00:44서로 대결을 붙여 최종적으로 더 뛰어난 모델이 무엇인지 가려보겠습니다
00:00:50아주 재미있을 테니 바로 시작하겠습니다
00:00:58먼저 두 모델을 각각 살펴보겠습니다. 첫 번째로는 월요일에 공개된 뮤즈 글리머가 있습니다
00:01:04이 모델은 플래그십 모델인 뮤즈 스파크의 증류 버전으로, RTX 5090 같은
00:01:10소비자용 GPU에서 실행될 수 있도록 특별히 제작되었습니다. 심지어 일반 M4나
00:01:18M5 맥에서도 실행 가능한 양자화 버전도 있습니다. 소문에 따르면 이 모델이 출시된 이유는 뮤즈 스파크가
00:01:25여전히 다들 클로드나 코덱스를 사용하고 있어 그다지 인기가 없다는 것을 깨달았기 때문이라고 합니다. 그래서 오픈소스
00:01:31방향으로 선회하기로 결정했다는군요. 그 소문이 사실인지는 확실하지 않지만, 사실이라 해도 놀랍지는 않습니다. 어쨌든
00:01:38뮤즈 글리머는 D 플래시 지원도 기본 탑재되어 있어 기본적으로 모델이 추측 디코딩을 수행할 수 있게 해줍니다
00:01:45이는 더 작은 초안 모델을 사용하여 16개의 단어 덩어리를 한 번에 추측한 다음
00:01:52메인 모델이 그 추측을 확인하고 틀린 부분을 수정하는 방식으로 작동합니다. 품질 저하 없이
00:01:583배 더 큰 속도 향상을 얻을 수 있으므로 좋은 추가 기능입니다. 하지만 실제로 잘 작동할까요?
00:02:04테스트에서 확인해 보겠습니다. 이제 화요일에 엔비디아가 공개한 네모트론 라이트닝 3.5에 대해 이야기해 보겠습니다
00:02:12이 역시 300억 파라미터 모델이지만 완전히 다른 방식으로 구축되었습니다. 이른바
00:02:18전문가 혼합(MoE) 모델이라고 불리는 방식입니다. 실제로 의미하는 바는
00:02:24무언가를 요청할 때마다 전체 모델을 매번 실행하는 대신, 라우터가 소수의 더 작은
00:02:30전문가 하위 네트워크를 선택하여 진행 중인 각 단어를 처리하도록 한다는 것입니다. 따라서 서류상 모델은 130억 파라미터이지만
00:02:38실제 작동 순간에 작업을 수행하는 것은 그중 약 30억 파라미터에 불과합니다. 바로 이것이
00:02:44서류상으로 거대한 모델임에도 불구하고 실행 속도가 빠르고 비용이 저렴한 이유입니다. 또한 엔비디아는
00:02:50네모 스위치야드(Nemo Switchyard)라는 자체 라우팅 설정 내부에서 이 모델을 실행하기를 강력히 원합니다
00:02:56작업의 각 단계를 가장 적합한 모델에 자동으로 전달하는 시스템입니다
00:03:03작업 요구 사항에 따라 오픈 모델, 독점 모델, 심지어 엔비디아 자체 모델 사이를 오갈 수 있습니다
00:03:10따라서 현실적으로 라이트닝의 가장 좋은 시나리오는 이 설정 내부에서 실행하는 것이겠지만,
00:03:16이번 영상에서는 뮤즈 글리머와 공정하게 비교하기 위해 단독으로 실행해 보겠습니다
00:03:22서류상으로 두 모델은 어떻게 비교될까요? 둘 다 300억 파라미터이며 둘 다
00:03:30도구 호출을 지원합니다. 덕분에 흥미로운 실험들을 진행할 수 있어 반가운 소식이지만
00:03:35네모트론 라이트닝에는 약간의 단점이 있습니다. 이미지를 전혀 볼 수 없어서 사진을 건네주고
00:03:41무슨 일인지 물어볼 수 없습니다. 반면 뮤즈 글리머는 실제 비전 시스템이 내장되어 있어
00:03:48이미지를 보고 추론할 수 있습니다. 컨텍스트 윈도우 크기에서도 실제 차이가 납니다. 뮤즈 글리머는 한 번에 약
00:03:5412만 8천 개의 토큰을 담을 수 있지만 네모트론 라이트닝은 무려 100만 개를 담을 수 있습니다. 따라서 서류상으로 라이트닝은
00:04:03방대한 문서를 파고들어야 할 때 찾는 모델이어야 하고, 글리머는
00:04:09더 짧고 조밀한 질의응답에 더 적합하다고 볼 수 있습니다. 자, 이제 이 두 모델에 대한 제대로 된 테스트를 진행해 보겠습니다
00:04:15RTX 5090과 64GB DDR5 램을 갖춘 소규모 홈랩 워크스테이션이 여기에 있습니다
00:04:23올라마 서버에 두 모델 모두 로드해 두었으며,
00:04:29오픈 코드를 통해 이 서버에 쿼리를 날릴 것입니다. 제 오픈 코드 JSON 설정은 대략 이런 모습입니다
00:04:34여기에 두 개의 모델이 있고, 두 개의 MCP 서버도 로드되어 있습니다. 그중 하나는 어도비
00:04:41프리미어 플러그인으로 편집 소프트웨어를 외부에서 제어하도록 빌드되었고, 다른 하나는
00:04:47음악을 가져오기 위한 에피데믹 사운드용 MCP 서버입니다. 이는 나중에 진행할 테스트 중 하나에 유용하게 쓰일 것입니다
00:04:52알겠습니다. 하지만 먼저 다른 테스트부터 시작하겠습니다. 두 모델 모두에게
00:04:57ESP32-C3 마이크로컨트롤러가 스위치와 다이오드가 있는 브레드보드에 어떻게 연결되는지 보여주는 간단한 웹페이지를 만들도록 요청할 것입니다
00:05:06이 작업에 대한 프롬프트가 꽤 길기 때문에 따라 해보고 싶으신 분들을 위해 깃허브 지스트에 올려두겠습니다
00:05:12이 테스트를 수행하기 전에 최첨단 프론티어 모델이 어떤 결과를 보여줄지 확인하려고 오푸스 5에 이 프롬프트를 주었습니다
00:05:18결과에 꽤 만족스러웠습니다. 기본적으로 이 전자 설정이 어떻게 작동하는지 보여주는 시각적 가이드이며
00:05:24전류가 어떻게 흐르는지 등을 볼 수 있는 약간의 상호작용 기능이 포함되어 있습니다
00:05:30어떤 모델도 그만큼 훌륭한 작업을 해낼 것이라고 기대하지는 않지만, 적어도 단순화된 버전이라도 설정하려고 시도하기를 바랍니다
00:05:36먼저 네모트론 라이트닝으로 이 테스트를 실행해 보겠습니다. 보시다시피 모델은 즉시 여러 개의 컬(curl) 요청을 날려
00:05:42일부 페이지를 가져왔고, 약 5분 동안 작업을 수행했습니다
00:05:47그 결과로 얻은 것은 버튼이 몇 개 있는 빈 페이지였습니다. 시각적 요소가 전혀 없고
00:05:54버튼도 작동하지 않습니다. 이 시점에서 라이트닝이 이 작업을 제대로 수행하지 못했다고 판단되지만
00:06:00한 번 더 기회를 주고 싶어 페이지에 몇 가지 문제가 있다고 프롬프트를 다시 입력하여
00:06:05두 번째 라운드에서 수정되는지 확인해 보았습니다
00:06:10두 번째 라운드는 라이트닝이 완료하는 데 6분이 걸렸고, 그 결과로 얻은 것은
00:06:16첫 번째와 똑같이 고장 난 결과물이었습니다. 아무것도 표시되지 않고 버튼도 작동하지 않습니다. 따라서 안타깝게도 이 시점에서
00:06:21라이트닝이 이 작업을 완전히 실패했다고 선언할 수밖에 없습니다. 좋습니다, 이제
00:06:26뮤즈 글리머로 전환하여 동일한 프롬프트로 동일한 작업을 어떻게 수행했는지 살펴보겠습니다. 뮤즈 글리머는
00:06:32웹 페이지를 가져오기 위해 여러 개의 웹 페치 도구 호출을 실행했고, 전체 라운드는
00:06:38약 2분 50초 만에 완료되었습니다. 그 결과로 얻은 웹페이지는 솔직히
00:06:44라이트닝이 한 것보다 훨씬 나았습니다. 적어도 페이지에 작동하는 버튼이 있었고,
00:06:49전류를 어느 정도 표현했으며, 컨트롤러의 핀 레이아웃도 실제로 만들었습니다. 그리고
00:06:55각 영역이 무엇이고 어떤 역할을 하는지 설명하는 툴팁도 일부 포함되어 있었습니다. 하지만 안타깝게도 여전히
00:07:02적절한 배선도는 만들지 못했으므로 이 결과에 만족한다고 말할 수는 없지만, 라이트닝이 동일한 작업에서 보여준 것에 비하면
00:07:08큰 진전입니다. 따라서 이번 경우에는 뮤즈 글리머의 손을 들어주겠습니다. 적어도 시도는 했으니까요
00:07:15솔직히 몇 번 더 버그 수정을 거치면 작동 가능한 버전으로 만들 수 있을 것으로 생각됩니다. 자, 이제
00:07:21두 번째 테스트로 넘어가겠습니다. 이 테스트는 꽤 기대가 큽니다. 특히 이 테스트를 위해
00:07:26UXP 어도비 브리지를 통해 편집기와 연결되는 어도비 프리미어 플러그인을 만들었기 때문입니다. 즉,
00:07:35도구 호출을 지원하는 모든 AI 모델은 이론적으로 프리미어를 자율적으로 탐색하고
00:07:41편집기에서 특정 작업을 수행할 수 있습니다. 오푸스 5로 테스트해 보았는데 매우 잘 작동합니다. 이 플러그인을
00:07:47확인해 보고 싶으신 분들을 위해 아래 설명란에 깃허브 저장소 링크도 추가해 두었습니다. 자, 두 모델 모두
00:07:52도구 호출을 지원하므로 프리미어 내부에서 작업하는 데 문제가 없어야 합니다. 또한
00:07:58네모트론 라이트닝은 여러 번의 빠른 도구 호출이 필요한 작업과 같은 빠른 처리 작업에 맞춤형으로 최적화되어 있으므로
00:08:05라이트닝이 뮤즈 글리머보다 이 작업을 더 잘 수행할 것으로 기대했습니다
00:08:11하지만 실제로 그런지 확인해 봅시다. 작업 자체를 위해 프리미어 프로젝트를 열어두었고
00:08:16최근 구글 키노트 프레젠테이션 녹화본이 있으며 이미 전사가 완료되어 있습니다
00:08:22재미 삼아 모델이 대본을 파싱하여 누군가 'AI'라는 단어를 말하는 모든 지점을 찾고
00:08:28사람들이 계속해서 AI를 말하는 짧은 클립들의 빠른 몽타주를 만들도록 하고 싶었습니다
00:08:35그런 다음 에피데믹 사운드의 MCP 서버를 사용하여 적절한 배경 음악을 추가하도록 했습니다
00:08:41AI 모델에게는 꽤 간단하고 직관적인 작업입니다. 라이트닝이 어떻게 수행하는지 봅시다. 처음에는 꽤 강력하게 시작합니다
00:08:47라이트닝이 도구 호출을 인식하고 매우 빠르게 실행하는 것을 볼 수 있으며
00:08:52대본을 가져오고 사람들이 AI라고 말하는 모든 지점을 찾아낼 수 있었습니다
00:08:58그 후 개별 조각들을 잘라내어 별도의 시퀀스에 배치하는 작업도 성공적으로 해냈습니다
00:09:04여기까지는 아주 훌륭하지만, 에피데믹 사운드로 배경 음악을 추가하는 단계에 이르러서는
00:09:09상황이 조금 까다로워지기 시작했습니다. 사운드트랙을 찾아 시퀀스에 배치하긴 했지만
00:09:15첫 번째 오디오 트랙에 넣는 바람에 화자 오디오 위에 겹쳐지게 되었습니다. 기본적으로 그 결과
00:09:22실제 음성은 들리지 않고 배경 음악만 남게 되었습니다. 그래서 저는 후속 프롬프트에서 이 점을 지적하여
00:09:28실수를 수정하는지 보았고, 실제로 실수를 인지하고 배경 음악을 별도의 오디오 트랙으로 이동시킨 다음
00:09:33작업이 완료되었다고 선언했습니다. 하지만 사실 이전에 삭제되었기 때문에 화자 오디오는 여전히 없는 상태였습니다
00:09:39그래서 화자 오디오를 다시 가져오라고 프롬프트를 보냈고, 이 시점에서 모델은 완전히 엉망이 되었습니다
00:09:45오디오를 살리려고 하다가 원래 트랙을 삭제하기 시작했고 타임라인을 완전히 망쳐버렸기 때문입니다
00:09:50이 시점에서 저는 너무 좌절하여 계속 진행할 수 없었습니다. 따라서 라이트닝이 또 다른 작업에서 안타깝게도 실패했다고
00:09:56다시 한번 선언할 수밖에 없습니다. 라이트닝이 가장 잘할 것이라 생각했던 종류의 작업이었기에
00:10:03정말 실망스럽습니다. 어쨌든 이제 뮤즈 글리머로 전환하여 동일한 작업에서 어떻게 수행했는지 살펴보겠습니다
00:10:08다시 한번 동일한 프롬프트로 시작했으며, 뮤즈 글리머가 도구 호출에서는 조금 더 느렸지만
00:10:14모든 것을 적절하게 처리하는 것을 확인했습니다. 시퀀스를 올바르게 배치하고 배경 음악을 찾아
00:10:19모든 것을 제대로 처리했습니다. 시퀀스를 올바르게 배치하고 배경 음악을 찾아
00:10:25별도의 오디오 트랙에 적용했으며, 비디오 트랙 길이에 맞게 음악의 재생 시간을 다듬고 페이드 아웃
00:10:31효과까지 프롬프트의 요구대로 음악에 추가했습니다. 이것만 봐도 뮤즈 글리머가
00:10:37이러한 세부 사항과 작은 문제들을 식별하는 데 훨씬 더 영리하다는 것을 알 수 있습니다. 그래서 저는
00:10:42첫 번째 결과에 꽤 만족했으며, 뮤즈 글리머가 이 작업의 승자라고 자신 있게 선언할 수 있습니다.
00:10:48하지만 한 가지 더 부탁하고 싶은 것이 있었습니다. 배경 음악을 바꾸고 싶었는데요,
00:10:53첫 번째 선택에 완전히 만족스럽지는 않았기 때문입니다. 그래서 에피데믹 사운드에서
00:10:59다른 배경 트랙을 찾아달라고 다시 프롬프트를 입력했고, 아주 우아하게 기존 음악 트랙을 새로운
00:11:05트랙으로 성공적으로 교체해 주었습니다. 참 잘했어요, 뮤즈 글리머. 사실 저는 이걸 매일 사용해 볼까 고민 중입니다.
00:11:11클로드 토큰 사용량이 한도에 도달한다면 말이죠. 자, 이 시점에서 라이트닝이 우수해야 할 맞춤형 작업에서조차
00:11:18실패했기 때문에, 이번에는 라이트닝이 더 잘 수행할 수 있어야 하는 마지막 작업을 진행해 보려고 합니다.
00:11:24100만 토큰 컨텍스트 윈도우를 가지고 있기 때문이죠. 이 세 번째 작업에서는 실제로 그 컨텍스트 윈도우의 격차를
00:11:30제대로 활용해 보고 싶었습니다. 그래서 SEC 웹사이트에서 직접 자료를 가져왔는데,
00:11:36엔비디아의 2026 회계연도 10-K 서류입니다. 100페이지가 넘는 방대한 재무 및 법적 내용이 담긴 문서죠.
00:11:46여기에는 약간 재미있는 점도 있습니다. 기본적으로 엔비디아의 자체 모델에게 엔비디아 자신에 대한 서류를
00:11:52읽어달라고 요청하는 셈이니까요. 그래서 질문은 꽤 단순했습니다. 모델에게 엔비디아의
00:11:59가장 큰 두 고객으로부터 전체 매출의 몇 퍼센트가 나왔는지, 그 매출이 어떤 사업 부문에
00:12:04귀속되는지 찾고, 그 숫자가 재무제표 주석에 나중에 다시 등장하는지
00:12:10교차 검증해 달라고 요청했습니다. 먼저 라이트닝이 이 작업을 어떻게 수행했는지 봅시다.
00:12:16솔직히 저는 이 작업이 쉬울 거라고 예상했습니다. 특히 라이트닝에게는요. 큰 컨텍스트 윈도우로
00:12:23방대한 문서를 훑어보는 데 특화되어 있으니까요. 하지만 무슨 일이 일어났는지 보십시오.
00:12:28SEC에 대한 가져오기(fetch) 요청이 오류와 함께 돌아왔고, 재시도하는 대신 일반 검색으로
00:12:35후퇴하여 결과로 나온 내용을 그대로 진행했습니다. 알고 보니 그것은 틀린 내용이었고,
00:12:41두 고객이 매출의 23%를 합산하여 차지했으며, 데이터 센터 부문에 각각 대략 13%와 10%가
00:12:48귀속된다고 말했습니다. 실제 서류에는 22%와 14%, 합산 36%라고 적혀 있으므로 이 중 맞는 것은 하나도 없습니다. 이 작업에
00:12:57실패했을 뿐만 아니라, 내장된 도구 호출을 제대로 활용하는 데도 실패했습니다. 웹페이지조차
00:13:03제대로 가져오지 못했으니까요. 하지만 가장 최악인 점은 전혀 사실이 아닌 숫자를 환각(hallucination)해 냈다는 것입니다.
00:13:13AI 모델의 결과물에 대해 이렇게 혹평하는 경우는 드문데, 이번만큼은 꼭 해야겠습니다.
00:13:19이건 아마 제가 테스트해 본 모델 중 최악일 겁니다. 네모트론의 라이트닝을 위해 꽤 간단하게 만들었고,
00:13:25맞춤형으로 최적화된 작업을 찾으려고 노력했는데도 비참하게 실패했습니다.
00:13:32젠장, 어쨌든 뮤즈 글리머가 같은 작업을 어떻게 해냈는지 확인해 봐야겠죠. 뮤즈 글리머에게
00:13:38동일한 작업을 프롬프트로 주었을 때 완료하는 데 약 3분이 걸렸고 여러 번의 웹 요청을 보냈습니다.
00:13:44그중 일부는 실패했지만, 그럼에도 불구하고 이를 잘 헤쳐나가며 올바른 정보를
00:13:50성공적으로 검색해 냈습니다. 이 경우 정확히 22%, 14%, 합산 36%라는 정보 말이죠. 다시 한번 잘했어요, 뮤즈 글리머.
00:13:59또 하나의 테스트를 통과했습니다. 전반적으로 이 테스트 결과 우리의 위치는 어디쯤일까요? 저는 뮤즈 글리머에게
00:14:063점 만점에 2점을 주겠습니다. 작업 중 두 가지를 수용 가능한 결과로 완수해 냈기 때문입니다. 하지만
00:14:12네모트론의 라이트닝은 말이죠, 정말 실망스럽습니다. 엔비디아에서 이런 모델이 나올 거라고는
00:14:18솔직히 예상하지 못했습니다. 제 말은, 그들이 자기네 모델을 테스트하기는 하는 걸까요? 과연 벤치마크를 믿을 수 있는 걸까요?
00:14:26이제 정말 진짜인 게 하나라도 있긴 한가요? 이는 이번 영상에서 답하지 않을 좋은 실존적 질문들입니다.
00:14:31하지만 우리 채널을 구독하시면 이에 대해 무언가 다루게 될지도 모릅니다. 자, 여러분, 두 모델을
00:14:36간단히 요약하자면 이렇습니다. 이 테스트들을 통해 제가 얻은 결론은, 뮤즈 글리머에게 유쾌하게 놀랐다는 점이며
00:14:42특정 유형의 작업에 대해서는 실제로 일상적으로 이 모델을 사용하는 것을 고려해 보겠다는 것입니다.
00:14:48하지만 네모트론의 라이트닝에 관해서는, 할 말은 다 했으니 더 이상 언급하고 싶지 않습니다.
00:14:55하지만 이건 제 개인적인 생각과 관찰일 뿐입니다. 여러분은 어떻게 생각하시나요? 아래 댓글창에
00:15:00알려주세요. 이번에는 평소의 아웃트로 대신 영상 끝에 재미있는 무언가를 남겨드리려고 합니다.
00:15:06그러니 작업 중 하나에서 뮤즈 글리머가 수행한 AI 몽타주를 보여드리겠습니다. 재미있게 보시고 다음 영상에서 뵙겠습니다.
00:15:14다음 영상들
00:15:22
00:15:34AI

핵심 요약

30B 파라미터 규모의 두 모델 중 뮤즈 글리머는 도구 호출과 웹 및 문서 처리 작업에서 안정적인 성능을 보인 반면, 네모트론 라이트닝 3.5는 주요 테스트에서 비참하게 실패했다.

하이라이트

  • 메타와 엔비디아가 각각 출시한 30B 파라미터 크기의 모델인 뮤즈 글리머와 네모트론 라이트닝 3.5가 서로 다른 성능을 보여준다.

  • 뮤즈 글리머는 D 플래시를 지원하며 비전 시스템과 12만 8천 개의 토큰 컨텍스트 윈도우를 탑재하고 있다.

  • 네모트론 라이트닝 3.5는 전문가 혼합(MoE) 구조와 100만 토큰의 컨텍스트 윈도우를 가지고 있지만 이미지를 지원하지 않는다.

  • 전자 회로 웹페이지 제작 테스트에서 뮤즈 글리머는 작동하는 버튼과 핀 레이아웃을 구현한 반면 네모트론 라이트닝은 빈 페이지를 출력했다.

  • 어도비 프리미어 자동 편집 및 몽타주 생성 테스트에서 뮤즈 글리머는 오디오 트랙 분리와 페이드 아웃 효과를 정확히 수행했다.

  • 엔비디아 10-K SEC 재무 문서 분석 테스트에서 네모트론 라이트닝은 환각 현상을 일으키며 완전히 틀린 숫자를 제시했다.

타임라인

뮤즈 글리머와 네모트론 라이트닝 3.5의 구조적 특징

  • 두 모델 모두 300억 개의 파라미터 크기를 가지며 일반 소비자용 하드웨어에서 실행되도록 설계되었다.
  • 뮤즈 글리머는 플래시 지원과 비전 시스템을 탑재하고 12만 8천 개의 토큰 컨텍스트를 지원한다.
  • 네모트론 라이트닝 3.5는 전문가 혼합 방식을 사용하여 100만 토큰의 컨텍스트 윈도우를 제공하지만 이미지 인식 기능이 없다.

메타와 엔비디아가 하루 차이를 두고 출시한 30B 모델들을 홈랩 워크스테이션 환경에서 테스트한다. 뮤즈 글리머는 증류 버전으로 추측 디코딩과 시각적 추론이 가능하며, 엔비디아의 라이트닝 3.5는 라우터가 소수의 하위 네트워크를 선택하여 속도를 높이는 구조를 채택했다.

전자 회로 브레드보드 시각화 웹페이지 제작 테스트

  • 네모트론 라이트닝은 두 번의 시도 모두 시각적 요소가 없고 버튼이 작동하지 않는 빈 페이지를 생성했다.
  • 뮤즈 글리머는 작동하는 버튼과 컨트롤러 핀 레이아웃, 툴팁이 포함된 웹페이지를 상대적으로 완성도 있게 구축했다.

ESP32-C3 마이크로컨트롤러 연결 가이드 웹페이지를 제작하는 프롬프트를 두 모델에 입력한다. 네모트론 라이트닝은 반복된 수정 요청에도 결과물을 내놓지 못한 반면, 뮤즈 글리머는 배선도에서 아쉬움이 남지만 시각적 요소와 상호작용 기능을 구현하여 명백한 우위를 보였다.

어도비 프리미어 자동 편집 및 몽타주 생성

  • 네모트론 라이트닝은 대본에서 특정 단어를 추출하고 시퀀스를 배치했으나 오디오 트랙 겹침 현상과 타임라인 오류를 일으켰다.
  • 뮤즈 글리머는 배경 음악을 별도 트랙에 적용하고 재생 시간 다듬기 및 페이드 아웃 효과를 정확하게 처리했다.

어도비 프리미어 플러그인과 MCP 서버를 연동하여 특정 단어가 언급되는 구간을 편집하고 배경 음악을 삽입하는 작업을 진행한다. 라이트닝은 오디오 관리 과정에서 타임라인을 완전히 망가뜨렸고, 뮤즈 글리머는 음악 교체 요청까지 매끄럽게 소화하며 작업의 승자가 된다.

SEC 재무 문서 분석 및 최종 평가

  • 네모트론 라이트닝은 100만 토큰 컨텍스트를 활용하지 못하고 웹 가져오기 오류 후 완전히 잘못된 숫자를 환각해 냈다.
  • 뮤즈 글리머는 3분 만에 정확한 매출 비중 데이터를 검색해 내며 전체 테스트에서 우수한 성적을 거뒀다.

엔비디아의 10-K 서류를 바탕으로 대형 고객사 매출 비중과 사업 부문을 교차 검증하는 마지막 테스트를 수행한다. 라이트닝은 엉터리 수치를 제시하며 실망스러운 모습을 보인 반면, 글리머는 정확한 정보를 찾아내며 3점 만점에 2점을 획득하고 일상적 사용 가능성을 입증했다.

커뮤니티 글

모든 글 보기