Claude Code를 Ollama와 함께 실행하여 AI 비용 99% 절감하기

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Ollama는 GitHub에서 17만 6천 개 이상의 스타를 받은 헤드리스 LLM 서버로, 오픈 모델을 구동할 수 있게 해줍니다.
00:00:06Claude Code, Codex, 심지어 Open Claude를 포함한 모든 앱이나 에이전트를 통해 오픈 모델을 실행할 수 있습니다.
00:00:12도구를 Ollama에 연결하여 로컬 모델을 관리하거나, Claude Code에서 호스팅된 모델로 트래픽을 라우팅할 수 있죠.
00:00:18예를 들어, 베이스 URL 환경 변수를 Ollama 서버로 바꾸기만 하면 됩니다.
00:00:23이제 모든 것이 이전과 똑같이 작동하지만, 수백 가지 모델에 접근할 수 있게 됩니다.
00:00:28GLM, DeepSeek와 같은 모델은 물론 Gemma, Qwen 같은 로컬 모델까지 4개 이상의 모델을 사용할 수 있습니다.
00:00:34이는 거대한 도약입니다. 좋아하던 도구들을 그대로 사용하면서도 원하는 모든 모델을 사용할 수 있게 되었으니까요.
00:00:38오늘은 Ollama를 테스트해보겠습니다.
00:00:44Claude Code를 통해 오픈 모델을 실행해보고 다른 경쟁 도구들보다 쓸만한지 확인해 보죠.
00:00:50Ollama CLI를 직접 실행하면 Claude Code나 Open Code 같은 다른 CLI 도구를 실행할 수 있는 옵션이 제공되며, 원하는 모델을 선택할 수 있습니다.
00:01:01현재 Open Code 안에 들어와 있는데, Ollama를 통해 Gemma 4를 실행 중입니다.
00:01:07이제 “Better Stack을 구독하고 있나요?”와 같은 질문을 입력할 수 있죠.
00:01:12아니라면 이 영상 아래에서 구독 버튼을 눌러주세요! 굳이 Ollama CLI를 거치지 않아도 됩니다.
00:01:17예를 들어 Claude Code의 경우, 환경 변수를 변경하여 Ollama를 가리키게만 하면 됩니다.
00:01:23베이스 URL과 토큰을 변경하면, 원하는 모델을 직접 가리키는 Claude Code를 실행할 수 있습니다.
00:01:29결과적으로 Claude Code 안에서 이전과 똑같이 사용할 수 있지만,
00:01:34이제 오픈 소스 모델과 함께 실행하고 있는 셈입니다. Ollama로 직접 모델을 실행할 수도 있습니다.
00:01:40멀티모달인 Gemma 4를 실행해서 이미지 안에 무엇이 있는지 물어볼 수도 있고요.
00:01:46Ollama의 환경에 직접 들어가서 Gemma 같은 모델과 대화할 수도 있어 별도의 서드파티 도구는 전혀 필요 없습니다.
00:01:51자, 터미널에서 'ollama'를 입력해 CLI로 들어가 보겠습니다.
00:01:57보시다시피 다양한 에이전트나 환경을 선택할 수 있는 여러 옵션이 있습니다.
00:02:01직접 대화할 수도 있지만, 이번에는 Claude Code로 들어가 보겠습니다.
00:02:05이미 다운로드해 둔 기본 모델이 Gemma 4인 것도 확인할 수 있습니다. 이제 Claude Code 안으로 들어왔습니다.
00:02:11Gemma 4를 사용 중이며 API 사용량 결제 정보가 뜨지만, 실제로는 로컬 모델이라
00:02:17비용이 전혀 들지 않습니다. 그래서 “hello”라고 메시지를 입력해 볼 수 있죠.
00:02:23모델이 응답하면 여전히 Claude Code인 것처럼 생각하겠지만, 실은 Gemma 4 모델이 실행 중인 겁니다.
00:02:28“안녕하세요, 저는 소프트웨어 엔지니어링을 돕는 Claude Code 어시스턴트입니다.”라는 응답을 받았습니다.
00:02:34즉, 이전과 똑같이 Claude Code를 계속 사용하면서도
00:02:39Anthropic의 모델 대신 로컬 오픈 소스 모델을 사용하는 방식으로 속인 셈입니다.
00:02:44이제 ollama.com에서 검색해보면 엄청나게 많은 다른 모델들을 사용할 수 있습니다.
00:02:49Qwen 3.6을 비롯해 정말 많은 옵션이 있죠.
00:02:55Minimax도 있고, DeepSeek 제품군도 있습니다. 즉, 인기 있는 모델은 대부분 사용할 수 있습니다.
00:03:01실행하려면 간단히 이런 명령어를 입력하면 됩니다.
00:03:05ollama run qwen 3.6을 입력하면, 모델이 다운로드되어 있지 않을 경우 다운로드를 시작합니다.
00:03:11다운로드에는 시간이 조금 걸리겠지만, 일단 사용할 수 있게 되면 로컬 머신에서 바로 실행 가능합니다.
00:03:15자, 그럼 이미지 감지 스크립트를 확인해 볼까요? 'ollama run gemma 4'를 입력하고,
00:03:20따옴표 안에 “이 이미지에 뭐가 들어있어?”라고 묻고, 다운로드 폴더에 있는 이미지를 지정합니다.
00:03:25그럼 아주 빠르게 응답을 받을 수 있습니다.
00:03:29분석 결과, 이미지에 고양이가 있다고 하네요. 태비 고양이고요, 포즈와 행동도 설명해 줍니다.
00:03:35고양이가 누워 있다는 정보도 정확합니다. 이게 바로 방금 분석한 이미지입니다.
00:03:41로컬 모델을 실행할 때는 사용 가능한 메모리와 시스템 성능이 매우 중요합니다.
00:03:45VRAM이 24GB 미만이면 4k 컨텍스트, 28~48GB라면 32k 컨텍스트를 사용할 수 있습니다.
00:03:5248GB 이상의 VRAM이 있다면 256k 컨텍스트를 쓸 수 있죠. 최근 Ollama는 큰 업데이트도 진행했습니다.
00:03:59지난 3월, macOS에서 애플 실리콘을 위한 머신러닝 프레임워크인 MLX로 포팅되었습니다.
00:04:06이를 통해 모델이 통합 메모리를 최대한 활용할 수 있게 되었고,
00:04:11GPU 뉴럴 가속기를 활용하여 첫 토큰 생성 시간과 전반적인 생성 속도를 높였습니다. 기본적으로 더 빨라진 것이죠.
00:04:18로컬 머신 외에도 Ollama는 Docker 안에서 실행할 수 있어 로컬 모델에 의존하는 자체 서비스를 운영할 수도 있습니다.
00:04:24문서에는 CPU 전용 혹은 NVIDIA나 AMD GPU를 사용하여 컨테이너 내에서 Ollama를 사용하는 전체 가이드가 포함되어 있습니다.
00:04:30모델을 Docker 내에서 실행하고, curl 요청을 직접 보낼 수도 있습니다.
00:04:37API 레퍼런스에는 호출할 수 있는 다른 여러 엔드포인트도 포함되어 있습니다. 다른 도구들과 Ollama를 비교해 보면,
00:04:44vLLM은 로컬 CLI 도구보다는 서비스로서 모델을 실행하는 데 훨씬 더 적합해 보입니다.
00:04:49최신 서빙 처리량, 효율적인 메모리 관리, 양자화 등 성능 개선 덕분에 서버 배포 시 훨씬 빠릅니다.
00:04:54따라서 호스팅 서비스를 운영 중이라면 vLLM이 더 나은 선택일 수 있습니다.
00:05:00LM Studio는 로컬 워크플로우 측면에서 Ollama와 매우 비슷하며 아름다운 GUI도 제공합니다.
00:05:06하지만 Ollama도 관심이 있다면 사용할 수 있는 공식 GUI를 가지고 있다는 점을 언급하고 싶네요.
00:05:12이 분야에는 물론 다른 도구들도 많이 있습니다.
00:05:17예전에 전체 영상으로 다뤘던 AnythingLLM 같은 것들이 있죠. 도움이 되셨길 바랍니다.
00:05:22Better Stack의 워런이었습니다. 시청해주셔서 감사합니다. 다음 영상에서 뵙겠습니다.

Key Takeaway

Claude Code의 기본 모델을 환경 변수 설정을 통해 로컬 Ollama 서버로 라우팅하면, 기존 워크플로우를 그대로 유지하면서도 오픈 소스 모델을 사용하여 AI API 비용을 99% 절감할 수 있습니다.

Highlights

  • Ollama와 환경 변수 설정을 통해 기존 도구인 Claude Code에서 로컬 LLM을 실행하여 API 비용을 완전히 제거할 수 있습니다.

  • Ollama를 활용하면 Gemma, Qwen, DeepSeek 등 다양한 오픈 소스 모델을 로컬 머신에서 직접 구동할 수 있습니다.

  • 로컬 모델 실행 시 VRAM 용량에 따라 컨텍스트 윈도우 크기가 결정되며, 24GB 미만은 4k, 28-48GB는 32k, 48GB 이상은 256k를 지원합니다.

  • macOS 환경에서 MLX 프레임워크를 도입하여 GPU 뉴럴 가속기를 활용함으로써 모델의 첫 토큰 생성 시간과 전반적인 처리 속도가 향상되었습니다.

  • Ollama는 Docker 컨테이너 내에서 구동 가능하며, 이를 통해 로컬 모델 기반의 자체 서비스를 운영할 수 있습니다.

Timeline

로컬 LLM을 활용한 Claude Code 환경 설정

  • Ollama는 로컬 환경에서 오픈 모델을 구동할 수 있는 헤드리스 LLM 서버입니다.
  • Claude Code의 베이스 URL과 토큰 환경 변수를 변경하여 로컬 Ollama 모델로 트래픽을 라우팅할 수 있습니다.
  • 이 방식을 사용하면 기존 도구의 UI와 기능을 그대로 유지하면서 로컬 모델과 상호작용할 수 있습니다.

Ollama는 수많은 오픈 소스 모델을 관리하는 효율적인 서버 역할을 합니다. Claude Code와 같은 도구에서 환경 변수를 수정하면 추가적인 수정 없이 로컬 머신에서 모델을 실행할 수 있습니다. 멀티모달 모델인 Gemma 4 등을 활용하면 이미지 분석 등 추가적인 작업도 로컬에서 직접 수행 가능합니다.

모델 실행 및 성능 최적화 요건

  • ollama run 명령어를 통해 Qwen, DeepSeek 등 다양한 오픈 모델을 다운로드하고 즉시 실행할 수 있습니다.
  • 모델 실행 성능은 시스템의 가용 메모리와 VRAM 용량에 따라 제한됩니다.
  • macOS 애플 실리콘 환경에서는 MLX 프레임워크를 통해 GPU 가속을 활용하여 응답 속도를 높입니다.

사용자는 CLI를 통해 원하는 모델을 선택하고 실행할 수 있습니다. 로컬 실행 시 VRAM 용량이 컨텍스트 크기를 결정하며, 시스템 성능에 따라 4k에서 최대 256k까지 지원합니다. 애플 실리콘에서의 최적화를 통해 통합 메모리 활용도를 극대화하고 생성 속도를 개선했습니다.

확장 및 경쟁 도구 비교

  • Ollama는 Docker 컨테이너 내에서 실행하여 API 엔드포인트를 통해 서비스 형태로 운영할 수 있습니다.
  • vLLM은 서버 단위의 대규모 배포와 처리량 관리에 더 적합한 성능을 제공합니다.
  • LM Studio는 GUI 기반의 로컬 워크플로우에 특화되어 있으며, Ollama 역시 공식 GUI를 지원합니다.

로컬 인프라 구성 시 도커를 활용하면 외부 서비스 운영이 가능합니다. 서비스 운영 환경에서는 vLLM의 메모리 관리 효율성이 유리할 수 있으나, 일반적인 워크플로우와 편리한 로컬 모델 테스트에는 Ollama가 적합한 선택지입니다.

Community Posts

View all posts