스크립트
00:00:00간단한 질문 하나 하겠습니다. 현재 세상에 AI 모델이 얼마나 많이 나와 있는지 아시나요?
00:00:04Hugging Face에 따르면 공개적으로 이용 가능한 모델만 무려 3백만 개가 넘습니다.
00:00:10마음에 드는 모델을 골라 Hugging Face 페이지에 접속했다고 해봅시다.
00:00:15다운로드하려고 보면 약 9개의 양자화 버전과 4개의 서로 다른 파라미터
00:00:21크기가 있는데, 이 중 어떤 것이 내 컴퓨터에서 실제로 구동될지 알 수 있는 방법이 없습니다.
00:00:26이상적으로는 이 모델이 내 기기에서 메모리 부족(OOM) 오류를 일으킬지 여부를
00:00:31전체 8기가바이트를 다운로드하기 전에 미리 알고 싶을 것입니다. 그럼 어떤 것을 쓸지 어떻게 정해야 할까요?
00:00:36다행히도 이를 위한 도구가 있습니다. LLM Fit이라는 도구인데, 실제 하드웨어를 확인합니다.
00:00:43GPU, RAM, CPU를 확인한 다음 수백 가지 모델 중에서 어떤 모델이 내 기기에서 진정으로
00:00:49잘 작동할지, 그리고 성능은 얼마나 좋을지 알려줍니다. 보시다시피 제 앞에도
00:00:55다양한 기기들을 준비해 두었습니다. 이번 영상에서는 LLM Fit이 어떻게 작동하는지 살펴보고,
00:01:01이 기기들에 직접 테스트해 보며 각각에 어떤 모델이 적합한지 확인해 보겠습니다.
00:01:06정말 흥미로운 시간이 될 테니 바로 시작해 보죠.
00:01:13자, LLM Fit은 기본적으로 간단한 터미널 도구입니다. 명령어 하나만 실행하면 시스템을 감지하고,
00:01:19CPU 코어, RAM, 멀티 GPU 구성을 포함한 GPU를 파악합니다. 그런 다음 데이터베이스에 있는 수많은 모델과
00:01:26여러분의 시스템 사양을 비교해 점수를 매깁니다. 그뿐만 아니라,
00:01:32이 특정 모델을 로컬 환경에서 실행할 때 초당 몇 개의 토큰을 처리할 수 있을지도
00:01:37예측해 줍니다. 물론 하드웨어 성능을 정확히 추정하기 위해 GPU 카드와 인프라에 맞춰
00:01:43가장 적합한 도구를 사용합니다. 게다가 기기에 설치된 가속 백엔드 여부도 함께 평가합니다.
00:01:49또한 사용자의 하드웨어 요구 사항에 맞춰 해당 모델의 최적 양자화 수준을 추정하려고 시도합니다.
00:01:55각 모델은 네 가지 기준으로 평가됩니다. 품질, 속도, 적합성, 그리고 컨텍스트입니다.
00:02:01그리고 이 항목들이 결합되어 종합 점수가 산출됩니다.
00:02:08하지만 이 기준들이 가중치가 부여되는 방식은 항상 고정되어 있지 않습니다. 예를 들어 대화형 모델은
00:02:14속도를 더 중요하게 여기고, 추론 모델은 품질에 훨씬 더 높은 가중치를 둡니다.
00:02:20따라서 실제 작업 목적에 따라 동일한 모델이라도 순위가 다를 수 있습니다. 그런데 LLM Fit은
00:02:25이러한 속도 수치를 실제로 어떻게 산출할까요? 작동 방식을 보면, 토큰 하나를 생성할 때마다
00:02:31모델 전체의 가중치를 VRAM에서 한 번씩 읽어와야 합니다. 즉 속도는 결국 VRAM이 GPU에
00:02:38데이터를 얼마나 빨리 공급할 수 있느냐에 달려 있습니다. LLM Fit은 사용 중인 특정 그래픽 카드의
00:02:44실제 메모리 대역폭을 식별합니다. 이 수치를 가져와 모델 크기와 비교하여 실제로
00:02:49초당 몇 개의 토큰을 얻을 수 있을지 추정합니다. 이 모든 과정을 세부적으로 조정하고 싶다면
00:02:54직접 설정할 수 있는 고급 설정 패널도 제공됩니다. 이 기능은 GitHub에서 어떤 사용자가
00:03:00특정 모델의 초당 토큰 추정치가 너무 높게 나온다고 지적한 이후에 추가되었습니다. 그리고 만약 대역폭
00:03:06테이블에 없는 다른 GPU를 사용 중인 경우, CUDA, Metal, ROCm 등 백엔드별 상숫값으로 대체됩니다.
00:03:14따라서 추정치가 0으로 나오는 일은 없으며, 다만 정밀도가 약간 떨어질 수 있습니다. 또 한 가지 멋진 점은
00:03:19커뮤니티 리더보드가 있어서 여러분과 동일한 하드웨어를 사용하는 실제 사용자들의 성능 결과를
00:03:24확인할 수 있다는 것입니다. 따라서 이론적인 수치가 아닌 실제 벤치마크 결과와 비교해 볼 수 있습니다.
00:03:31좋습니다, 이 도구 정말 좋아 보이네요. 다양한 기기에서 직접 테스트해보고 싶어요. 왜냐하면
00:03:36구형 기기에서는 과연 어떤 종류의 모델을 실제로 구동할 수 있을지 정말 궁금하기 때문입니다. 먼저
00:03:42이 1세대 라즈베리 파이부터 시작하겠습니다. 이 제품은 2012년식으로 싱글 코어, 700MHz, 512MB RAM 사양입니다.
00:03:51몇 달 전에 제가 여기에 1,900만 개 파라미터 모델을 성공적으로 배포하는 영상을 올린 적이 있죠.
00:03:56자, 그럼 LLM Fit이 이번 테스트에서 비슷한 것을 제안할지 확인해 봅시다. 음, 실제로는 몇 가지 일이 일어났습니다.
00:04:03첫째, 실행은 되었지만 속도가 끔찍할 정도로 느렸습니다. 이 보드는 러스트 기반 AI를
00:04:09편안하게 돌릴 만큼 성능이 받쳐주지 않습니다. 어쨌든 추천 항목을 살펴보면 정말로
00:04:16황당하기 그지없습니다. 우선 무려 4,000억 개의 파라미터를 가진
00:04:23DeepSeek R1을 최고 추천 모델로 꼽았습니다. 디스크 공간만 230기가바이트가 필요하겠네요.
00:04:30다만 초당 토큰 수를 계산할 때는 0.8개에 불과하다고 정직하게 표시해 주네요. 이 모델에 필요한 메모리 비율도
00:04:38정말 제정신이 아닙니다. 앞서 말씀드렸듯이 저는 이 보드에서 Falcon H1 Mini라는 모델을 테스트한 적이 있습니다.
00:04:46그래서 데이터베이스에 그 모델이 있는지 검색해 보았는데 실제로 존재했습니다.
00:04:51하지만 이상하게도 엄청난 크기의 DeepSeek R1에 비해 점수가 겨우 51점밖에 부여되지 않았습니다.
00:04:58그리고 여기가 가장 웃긴 부분입니다. 초당 241개의 토큰에 도달할 수 있다고 나오네요.
00:05:06제 원래 영상에서는 초당 0.3토큰 정도를 기록했었거든요. 그럼 이건 무려 800배 이상 빠른 셈입니다.
00:05:13분명히 무언가 잘못되었습니다. 이렇게 오래된 보드에서는 현실적인 후보군을 계산해내지 못하는 것 같습니다.
00:05:20하지만 당연한 일이죠. 이 앱이 라즈베리 파이에서 실행될 거라고 생각조차 못 했으니까요. 크게 신경 쓰진 않습니다.
00:05:26이제 Luckfox Pico Ultra W로 넘어가겠습니다. 이건 일반적인 의미의 컴퓨터조차 아닙니다.
00:05:34카메라 모듈이나 보안 시스템 등을 위해 만들어진 초소형 임베디드 보드입니다.
00:05:40하지만 리눅스가 구동되죠. 싱글 코어 Cortex A7에 256MB RAM 사양입니다. 이 Luckfox 보드에는
00:05:48특정 리눅스 버전이 사전 설치되어 있으므로, 맥북에서 SSH로 접속하여
00:05:54원격으로 LLM Fit을 실행할 수 있었습니다. 여기서도 라즈베리 파이 보드와 비슷한 결과가 나옵니다.
00:06:01파라미터가 4,000억 개인 동일한 DeepSeek R1 모델을 추천하고 점수도 똑같이 매깁니다.
00:06:08그래서 잘 모르겠네요. 이 앱은 이런 소형 개발 보드를 위한 모델 추천을 계산하는 용도로는 만들어지지 않은 것 같습니다.
00:06:14다음으로 2015년형 13인치 맥북 프로, 8GB DDR3 RAM, 인텔 코어 i5 기기에서 테스트해 보겠습니다.
00:06:23이 기기는 목록 중에서 사람들이 실제 업무를 처리하는 데 사용하는 최초의 진짜 컴퓨터입니다.
00:06:30과연 실행할 만한 가치가 있는 모델을 찾아낼지, 아니면 여전히 막다른 길일지 궁금합니다.
00:06:36예상대로 이 기기부터는 추천 모델 목록이 꽤 쓸만해 보이기 시작합니다.
00:06:42이제 모두 좋다고 표시된 소형 모델들로 가득 찬 목록을 얻게 됩니다. 아주 좋은 신호죠.
00:06:48대부분 8비트로 양자화되어 있으며, 모델에 따라 초당 40에서 170개 사이의 토큰 속도가 예상됩니다.
00:06:55하지만 솔직히 말해서 이 추정치는 너무 후한 것 같습니다. 이렇게 오래된 2015년형 맥북에서
00:07:02Llama 3 같은 모델이 그렇게 높은 토큰 수를 기록할 수 있을지 잘 모르겠습니다.
00:07:09혹시 이런 오래된 맥북에서 Llama 3 같은 모델을 테스트해보신 분이 있다면 아래 댓글로 알려주세요.
00:07:15이 도구에서 할 수 있는 또 다른 유용한 기능은 사용 사례를 필터링하여
00:07:20예를 들어 괜찮은 코딩 모델이 있는지 확인하는 것입니다. 그렇게 필터를 적용해 보면
00:07:27120억 파라미터와 2비트 양자화가 적용된 Qwen 3.6이 최고의 추천으로 나타납니다.
00:07:35초당 2.3토큰이라는 속도가 아주 마음에 들진 않지만, 그런 오래된 노트북에서 120억 파라미터를
00:07:41구동하기 위해 감수해야 하는 대가인 것 같습니다. 다음은 32GB 통합 메모리를 탑재한
00:07:47제 M2 Max 맥북 Pro에서 테스트해 보겠습니다. 이 기기부터는 상황이 훨씬 더 정상적으로 보이기 시작할 겁니다.
00:07:53실제 GPU 코어와 실제 메모리 대역폭을 갖추고 있으며, LLM Fit은 애플 실리콘을 제대로 이해하기 때문입니다.
00:08:00여기서 어떤 모델을 추천하고 속도 추정치가 제가 평소에 얻는 결과와 얼마나 근접할지 확인해보고 싶습니다.
00:08:06제 M2 맥북에서 보듯이 최고의 추천 모델은 DeepSeek R1입니다.
00:08:13다만 이게 어떤 종류의 모델인지 잘 모르겠습니다. DeepSeek R1이라고 되어 있지만 Qwen도 묶여 있거든요.
00:08:18그래서 일종의 공생 모델 같은 것인지 확실하지 않습니다. 하지만 이 도구로 판단해 볼 때
00:08:23제 맥북에서는 이 경우가 최상의 시나리오인 것 같습니다. 하지만 필터를 적용하여
00:08:27최고의 코딩 모델을 구체적으로 살펴보면 Gemma 4 12B 버전이 1위를 차지하는 것을 볼 수 있습니다.
00:08:34저도 이 모델에 대해 최근에 영상을 다룬 적이 있는데 특히 MLX 환경에서 괴물 같은 성능을 보여줬기 때문에
00:08:39이 결과에는 동의합니다. 마지막으로 제 가장 강력한 하이엔드 장비인
00:08:45RTX 5090, 64GB DDR5 RAM, 인텔 코어 울트라 9 285K에서 테스트해 보겠습니다. 이 기기에서는 LLM Fit이
00:08:55고성능 모델들을 추천하기 시작할 것으로 기대됩니다. 과연 어떤 모델까지 돌릴 수 있다고 판단할지 보죠.
00:09:01성능 좋은 제 기기에서는 Qwen 3.8의 다양한 버전에 대한 추천이 많이 나옵니다.
00:09:07이번에는 거의 모든 모델에서 만점을 받고 있는 것을 볼 수 있습니다. 따라서 선택할 수 있는 모델이 매우 많습니다.
00:09:12그리고 여러 Qwen 버전들 사이에서 Gemma 4 12B 버전도 함께 나타납니다.
00:09:18하지만 여기에서도 최고의 코딩 모델이 무엇인지 확인하기 위해 필터를 적용해 보고 싶습니다. 이 필터를 적용해도
00:09:23여전히 여러 Qwen 3 모델들이 나타납니다. 하지만 컨텍스트 크기순으로 정렬해 보면
00:09:30엔비디아가 출시한 Kimi K 2.7D 플래시 버전이 실제로 존재한다는 것을 알 수 있습니다. 정말 흥미롭네요.
00:09:38그리고 이것이야말로 이 특정 작업을 위해 제가 선택할 실제 모델에 더 가까운 것입니다.
00:09:43Qwen을 비하하려는 의도는 아니지만 솔직히 저는 그 모델들의 열렬한 팬은 아닙니다.
00:09:47따라서 제 생각에는 이러한 점들을 바탕으로 Kimi K 2.7이 더 나은 선택이 될 것입니다.
00:09:53자, 이렇게 해서 LLM Fit을 간략하게 살펴보았습니다. 요즘처럼 선택할 수 있는 AI 모델이 너무 많을 때
00:09:58우리는 분석 마비 상태에 빠지기 쉽습니다. 따라서 올바른 AI 모델을 선택하는 작업을
00:10:04조금이나마 더 쉽게 만들어 주는 도구가 존재한다는 것은 반가운 일입니다.
00:10:10여러분은 이 도구에 대해 어떻게 생각하시나요? 써보셨나요? 사용하실 건가요?
00:10:15아래 댓글창에 여러분의 의견을 남겨주세요. 여러분, 이런 기술적인 분석 콘텐츠가
00:10:20마음에 드신다면 영상 아래의 좋아요 버튼을 눌러 알려주세요. 또한 저희
00:10:25채널 구독도 잊지 마세요. BetterStack의 Andrus였으며 다음 영상에서 뵙겠습니다.