내 하드웨어에 딱 맞는 AI 모델을 찾아주는 도구 (llmfit)

BBetter Stack
컴퓨터/소프트웨어가전제품/카메라AI/미래기술

스크립트

00:00:00간단한 질문 하나 하겠습니다. 현재 세상에 AI 모델이 얼마나 많이 나와 있는지 아시나요?
00:00:04Hugging Face에 따르면 공개적으로 이용 가능한 모델만 무려 3백만 개가 넘습니다.
00:00:10마음에 드는 모델을 골라 Hugging Face 페이지에 접속했다고 해봅시다.
00:00:15다운로드하려고 보면 약 9개의 양자화 버전과 4개의 서로 다른 파라미터
00:00:21크기가 있는데, 이 중 어떤 것이 내 컴퓨터에서 실제로 구동될지 알 수 있는 방법이 없습니다.
00:00:26이상적으로는 이 모델이 내 기기에서 메모리 부족(OOM) 오류를 일으킬지 여부를
00:00:31전체 8기가바이트를 다운로드하기 전에 미리 알고 싶을 것입니다. 그럼 어떤 것을 쓸지 어떻게 정해야 할까요?
00:00:36다행히도 이를 위한 도구가 있습니다. LLM Fit이라는 도구인데, 실제 하드웨어를 확인합니다.
00:00:43GPU, RAM, CPU를 확인한 다음 수백 가지 모델 중에서 어떤 모델이 내 기기에서 진정으로
00:00:49잘 작동할지, 그리고 성능은 얼마나 좋을지 알려줍니다. 보시다시피 제 앞에도
00:00:55다양한 기기들을 준비해 두었습니다. 이번 영상에서는 LLM Fit이 어떻게 작동하는지 살펴보고,
00:01:01이 기기들에 직접 테스트해 보며 각각에 어떤 모델이 적합한지 확인해 보겠습니다.
00:01:06정말 흥미로운 시간이 될 테니 바로 시작해 보죠.
00:01:13자, LLM Fit은 기본적으로 간단한 터미널 도구입니다. 명령어 하나만 실행하면 시스템을 감지하고,
00:01:19CPU 코어, RAM, 멀티 GPU 구성을 포함한 GPU를 파악합니다. 그런 다음 데이터베이스에 있는 수많은 모델과
00:01:26여러분의 시스템 사양을 비교해 점수를 매깁니다. 그뿐만 아니라,
00:01:32이 특정 모델을 로컬 환경에서 실행할 때 초당 몇 개의 토큰을 처리할 수 있을지도
00:01:37예측해 줍니다. 물론 하드웨어 성능을 정확히 추정하기 위해 GPU 카드와 인프라에 맞춰
00:01:43가장 적합한 도구를 사용합니다. 게다가 기기에 설치된 가속 백엔드 여부도 함께 평가합니다.
00:01:49또한 사용자의 하드웨어 요구 사항에 맞춰 해당 모델의 최적 양자화 수준을 추정하려고 시도합니다.
00:01:55각 모델은 네 가지 기준으로 평가됩니다. 품질, 속도, 적합성, 그리고 컨텍스트입니다.
00:02:01그리고 이 항목들이 결합되어 종합 점수가 산출됩니다.
00:02:08하지만 이 기준들이 가중치가 부여되는 방식은 항상 고정되어 있지 않습니다. 예를 들어 대화형 모델은
00:02:14속도를 더 중요하게 여기고, 추론 모델은 품질에 훨씬 더 높은 가중치를 둡니다.
00:02:20따라서 실제 작업 목적에 따라 동일한 모델이라도 순위가 다를 수 있습니다. 그런데 LLM Fit은
00:02:25이러한 속도 수치를 실제로 어떻게 산출할까요? 작동 방식을 보면, 토큰 하나를 생성할 때마다
00:02:31모델 전체의 가중치를 VRAM에서 한 번씩 읽어와야 합니다. 즉 속도는 결국 VRAM이 GPU에
00:02:38데이터를 얼마나 빨리 공급할 수 있느냐에 달려 있습니다. LLM Fit은 사용 중인 특정 그래픽 카드의
00:02:44실제 메모리 대역폭을 식별합니다. 이 수치를 가져와 모델 크기와 비교하여 실제로
00:02:49초당 몇 개의 토큰을 얻을 수 있을지 추정합니다. 이 모든 과정을 세부적으로 조정하고 싶다면
00:02:54직접 설정할 수 있는 고급 설정 패널도 제공됩니다. 이 기능은 GitHub에서 어떤 사용자가
00:03:00특정 모델의 초당 토큰 추정치가 너무 높게 나온다고 지적한 이후에 추가되었습니다. 그리고 만약 대역폭
00:03:06테이블에 없는 다른 GPU를 사용 중인 경우, CUDA, Metal, ROCm 등 백엔드별 상숫값으로 대체됩니다.
00:03:14따라서 추정치가 0으로 나오는 일은 없으며, 다만 정밀도가 약간 떨어질 수 있습니다. 또 한 가지 멋진 점은
00:03:19커뮤니티 리더보드가 있어서 여러분과 동일한 하드웨어를 사용하는 실제 사용자들의 성능 결과를
00:03:24확인할 수 있다는 것입니다. 따라서 이론적인 수치가 아닌 실제 벤치마크 결과와 비교해 볼 수 있습니다.
00:03:31좋습니다, 이 도구 정말 좋아 보이네요. 다양한 기기에서 직접 테스트해보고 싶어요. 왜냐하면
00:03:36구형 기기에서는 과연 어떤 종류의 모델을 실제로 구동할 수 있을지 정말 궁금하기 때문입니다. 먼저
00:03:42이 1세대 라즈베리 파이부터 시작하겠습니다. 이 제품은 2012년식으로 싱글 코어, 700MHz, 512MB RAM 사양입니다.
00:03:51몇 달 전에 제가 여기에 1,900만 개 파라미터 모델을 성공적으로 배포하는 영상을 올린 적이 있죠.
00:03:56자, 그럼 LLM Fit이 이번 테스트에서 비슷한 것을 제안할지 확인해 봅시다. 음, 실제로는 몇 가지 일이 일어났습니다.
00:04:03첫째, 실행은 되었지만 속도가 끔찍할 정도로 느렸습니다. 이 보드는 러스트 기반 AI를
00:04:09편안하게 돌릴 만큼 성능이 받쳐주지 않습니다. 어쨌든 추천 항목을 살펴보면 정말로
00:04:16황당하기 그지없습니다. 우선 무려 4,000억 개의 파라미터를 가진
00:04:23DeepSeek R1을 최고 추천 모델로 꼽았습니다. 디스크 공간만 230기가바이트가 필요하겠네요.
00:04:30다만 초당 토큰 수를 계산할 때는 0.8개에 불과하다고 정직하게 표시해 주네요. 이 모델에 필요한 메모리 비율도
00:04:38정말 제정신이 아닙니다. 앞서 말씀드렸듯이 저는 이 보드에서 Falcon H1 Mini라는 모델을 테스트한 적이 있습니다.
00:04:46그래서 데이터베이스에 그 모델이 있는지 검색해 보았는데 실제로 존재했습니다.
00:04:51하지만 이상하게도 엄청난 크기의 DeepSeek R1에 비해 점수가 겨우 51점밖에 부여되지 않았습니다.
00:04:58그리고 여기가 가장 웃긴 부분입니다. 초당 241개의 토큰에 도달할 수 있다고 나오네요.
00:05:06제 원래 영상에서는 초당 0.3토큰 정도를 기록했었거든요. 그럼 이건 무려 800배 이상 빠른 셈입니다.
00:05:13분명히 무언가 잘못되었습니다. 이렇게 오래된 보드에서는 현실적인 후보군을 계산해내지 못하는 것 같습니다.
00:05:20하지만 당연한 일이죠. 이 앱이 라즈베리 파이에서 실행될 거라고 생각조차 못 했으니까요. 크게 신경 쓰진 않습니다.
00:05:26이제 Luckfox Pico Ultra W로 넘어가겠습니다. 이건 일반적인 의미의 컴퓨터조차 아닙니다.
00:05:34카메라 모듈이나 보안 시스템 등을 위해 만들어진 초소형 임베디드 보드입니다.
00:05:40하지만 리눅스가 구동되죠. 싱글 코어 Cortex A7에 256MB RAM 사양입니다. 이 Luckfox 보드에는
00:05:48특정 리눅스 버전이 사전 설치되어 있으므로, 맥북에서 SSH로 접속하여
00:05:54원격으로 LLM Fit을 실행할 수 있었습니다. 여기서도 라즈베리 파이 보드와 비슷한 결과가 나옵니다.
00:06:01파라미터가 4,000억 개인 동일한 DeepSeek R1 모델을 추천하고 점수도 똑같이 매깁니다.
00:06:08그래서 잘 모르겠네요. 이 앱은 이런 소형 개발 보드를 위한 모델 추천을 계산하는 용도로는 만들어지지 않은 것 같습니다.
00:06:14다음으로 2015년형 13인치 맥북 프로, 8GB DDR3 RAM, 인텔 코어 i5 기기에서 테스트해 보겠습니다.
00:06:23이 기기는 목록 중에서 사람들이 실제 업무를 처리하는 데 사용하는 최초의 진짜 컴퓨터입니다.
00:06:30과연 실행할 만한 가치가 있는 모델을 찾아낼지, 아니면 여전히 막다른 길일지 궁금합니다.
00:06:36예상대로 이 기기부터는 추천 모델 목록이 꽤 쓸만해 보이기 시작합니다.
00:06:42이제 모두 좋다고 표시된 소형 모델들로 가득 찬 목록을 얻게 됩니다. 아주 좋은 신호죠.
00:06:48대부분 8비트로 양자화되어 있으며, 모델에 따라 초당 40에서 170개 사이의 토큰 속도가 예상됩니다.
00:06:55하지만 솔직히 말해서 이 추정치는 너무 후한 것 같습니다. 이렇게 오래된 2015년형 맥북에서
00:07:02Llama 3 같은 모델이 그렇게 높은 토큰 수를 기록할 수 있을지 잘 모르겠습니다.
00:07:09혹시 이런 오래된 맥북에서 Llama 3 같은 모델을 테스트해보신 분이 있다면 아래 댓글로 알려주세요.
00:07:15이 도구에서 할 수 있는 또 다른 유용한 기능은 사용 사례를 필터링하여
00:07:20예를 들어 괜찮은 코딩 모델이 있는지 확인하는 것입니다. 그렇게 필터를 적용해 보면
00:07:27120억 파라미터와 2비트 양자화가 적용된 Qwen 3.6이 최고의 추천으로 나타납니다.
00:07:35초당 2.3토큰이라는 속도가 아주 마음에 들진 않지만, 그런 오래된 노트북에서 120억 파라미터를
00:07:41구동하기 위해 감수해야 하는 대가인 것 같습니다. 다음은 32GB 통합 메모리를 탑재한
00:07:47제 M2 Max 맥북 Pro에서 테스트해 보겠습니다. 이 기기부터는 상황이 훨씬 더 정상적으로 보이기 시작할 겁니다.
00:07:53실제 GPU 코어와 실제 메모리 대역폭을 갖추고 있으며, LLM Fit은 애플 실리콘을 제대로 이해하기 때문입니다.
00:08:00여기서 어떤 모델을 추천하고 속도 추정치가 제가 평소에 얻는 결과와 얼마나 근접할지 확인해보고 싶습니다.
00:08:06제 M2 맥북에서 보듯이 최고의 추천 모델은 DeepSeek R1입니다.
00:08:13다만 이게 어떤 종류의 모델인지 잘 모르겠습니다. DeepSeek R1이라고 되어 있지만 Qwen도 묶여 있거든요.
00:08:18그래서 일종의 공생 모델 같은 것인지 확실하지 않습니다. 하지만 이 도구로 판단해 볼 때
00:08:23제 맥북에서는 이 경우가 최상의 시나리오인 것 같습니다. 하지만 필터를 적용하여
00:08:27최고의 코딩 모델을 구체적으로 살펴보면 Gemma 4 12B 버전이 1위를 차지하는 것을 볼 수 있습니다.
00:08:34저도 이 모델에 대해 최근에 영상을 다룬 적이 있는데 특히 MLX 환경에서 괴물 같은 성능을 보여줬기 때문에
00:08:39이 결과에는 동의합니다. 마지막으로 제 가장 강력한 하이엔드 장비인
00:08:45RTX 5090, 64GB DDR5 RAM, 인텔 코어 울트라 9 285K에서 테스트해 보겠습니다. 이 기기에서는 LLM Fit이
00:08:55고성능 모델들을 추천하기 시작할 것으로 기대됩니다. 과연 어떤 모델까지 돌릴 수 있다고 판단할지 보죠.
00:09:01성능 좋은 제 기기에서는 Qwen 3.8의 다양한 버전에 대한 추천이 많이 나옵니다.
00:09:07이번에는 거의 모든 모델에서 만점을 받고 있는 것을 볼 수 있습니다. 따라서 선택할 수 있는 모델이 매우 많습니다.
00:09:12그리고 여러 Qwen 버전들 사이에서 Gemma 4 12B 버전도 함께 나타납니다.
00:09:18하지만 여기에서도 최고의 코딩 모델이 무엇인지 확인하기 위해 필터를 적용해 보고 싶습니다. 이 필터를 적용해도
00:09:23여전히 여러 Qwen 3 모델들이 나타납니다. 하지만 컨텍스트 크기순으로 정렬해 보면
00:09:30엔비디아가 출시한 Kimi K 2.7D 플래시 버전이 실제로 존재한다는 것을 알 수 있습니다. 정말 흥미롭네요.
00:09:38그리고 이것이야말로 이 특정 작업을 위해 제가 선택할 실제 모델에 더 가까운 것입니다.
00:09:43Qwen을 비하하려는 의도는 아니지만 솔직히 저는 그 모델들의 열렬한 팬은 아닙니다.
00:09:47따라서 제 생각에는 이러한 점들을 바탕으로 Kimi K 2.7이 더 나은 선택이 될 것입니다.
00:09:53자, 이렇게 해서 LLM Fit을 간략하게 살펴보았습니다. 요즘처럼 선택할 수 있는 AI 모델이 너무 많을 때
00:09:58우리는 분석 마비 상태에 빠지기 쉽습니다. 따라서 올바른 AI 모델을 선택하는 작업을
00:10:04조금이나마 더 쉽게 만들어 주는 도구가 존재한다는 것은 반가운 일입니다.
00:10:10여러분은 이 도구에 대해 어떻게 생각하시나요? 써보셨나요? 사용하실 건가요?
00:10:15아래 댓글창에 여러분의 의견을 남겨주세요. 여러분, 이런 기술적인 분석 콘텐츠가
00:10:20마음에 드신다면 영상 아래의 좋아요 버튼을 눌러 알려주세요. 또한 저희
00:10:25채널 구독도 잊지 마세요. BetterStack의 Andrus였으며 다음 영상에서 뵙겠습니다.

핵심 요약

LLM Fit은 로컬 하드웨어 사양과 메모리 대역폭을 분석하여 수백만 개의 AI 모델 중 기기에 맞는 최적의 모델과 속도를 예측해 준다.

하이라이트

  • Hugging Face에 공개적으로 이용 가능한 모델은 3백만 개가 넘는다.

  • LLM Fit은 시스템의 GPU, RAM, CPU를 감지하고 수백 가지 모델 중에서 적합한 모델을 점수화하여 추천한다.

  • 모델의 속도 추정은 VRAM의 메모리 대역폭과 모델 크기를 비교하여 초당 토큰 처리량을 계산한다.

  • 1세대 라즈베리 파이 같은 구형 임베디드 기기에서는 실용적인 후보군을 정확히 계산하지 못한다.

  • 32GB 통합 메모리의 M2 Max 맥북 Pro에서는 애플 실리콘 환경에 맞춰 적절한 모델과 코딩용 최적 모델을 도출한다.

  • RTX 5090 기반의 고성능 하이엔드 장비에서는 Qwen 3 및 Kimi K 2.7D 플래시 등 다양한 고성능 모델들이 추천된다.

타임라인

AI 모델 선택의 어려움과 LLM Fit 소개

  • Hugging Face에 공개된 모델은 3백만 개를 넘는다.
  • 다운로드 전 메모리 부족 오류 여부를 미리 알기 어렵다.
  • LLM Fit은 하드웨어를 확인하여 적합한 모델과 성능을 알려준다.

세상에 존재하는 방대한 AI 모델 수와 양자화 버전 및 파라미터 크기의 다양성으로 인해 발생하는 선택의 어려움을 짚어본다. 전체 파일을 다운로드하기 전에 기기에서 구동 가능한지 확인하는 도구인 LLM Fit의 존재와 기본 목적을 소개한다.

LLM Fit의 작동 원리와 평가 기준

  • LLM Fit은 명령어 하나로 CPU, RAM, 멀티 GPU 구성을 감지한다.
  • 품질, 속도, 적합성, 컨텍스트의 네 가지 기준으로 모델을 평가한다.
  • VRAM 메모리 대역폭과 모델 크기를 비교하여 초당 토큰 처리량을 추정한다.

터미널 도구인 LLM Fit이 시스템 사양을 데이터베이스와 비교하는 방식을 설명한다. 대화형 모델과 추론 모델에 따라 가중치가 달라지며, GPU 메모리 대역폭을 기반으로 실제 초당 토큰 속도를 도출하는 메커니즘을 다룬다.

저사양 임베디드 기기 테스트

  • 1세대 라즈베리 파이에서 실행 시도 시 비현실적인 대형 모델을 추천한다.
  • 초소형 임베디드 보드인 Luckfox Pico Ultra W에서도 유사한 한계를 보인다.
  • 오래된 소형 개발 보드 환경에서는 정상적인 모델 후보군 계산이 어렵다.

2012년식 1세대 라즈베리 파이와 Luckfox Pico Ultra W 보드에 LLM Fit을 적용한 결과를 보여준다. 사양이 극도로 제한된 기기에서는 400억 파라미터의 DeepSeek R1이 최고 추천으로 뜨는 등 현실적이지 않은 수치가 도출된다.

구형 및 고성능 기기 테스트

  • 2015년형 맥북 프로에서는 소형 모델 중심의 실용적인 목록이 나타난다.
  • 32GB M2 Max 맥북 Pro와 RTX 5090 하이엔드 장비에서는 정확도 높은 추천을 제공한다.
  • 필터 기능을 통해 코딩 전용 모델이나 컨텍스트 크기별 최적 모델을 선별할 수 있다.

2015년형 맥북 프로, M2 Max 맥북 프로, RTX 5090 탑재 PC 등 실사용 기기들에서의 테스트 결과를 비교한다. 사양이 올라갈수록 기기 특성에 맞는 정교한 모델과 코딩 특화 모델 추천이 이루어지며 분석 마비 상태를 해소하는 대안을 제시한다.

커뮤니티 글

모든 글 보기