Transcript
00:00:00Ollama는 GitHub에서 17만 6천 개 이상의 스타를 받은 헤드리스 LLM 서버로, 오픈 모델을 구동할 수 있게 해줍니다.
00:00:06Claude Code, Codex, 심지어 Open Claude를 포함한 모든 앱이나 에이전트를 통해 오픈 모델을 실행할 수 있습니다.
00:00:12도구를 Ollama에 연결하여 로컬 모델을 관리하거나, Claude Code에서 호스팅된 모델로 트래픽을 라우팅할 수 있죠.
00:00:18예를 들어, 베이스 URL 환경 변수를 Ollama 서버로 바꾸기만 하면 됩니다.
00:00:23이제 모든 것이 이전과 똑같이 작동하지만, 수백 가지 모델에 접근할 수 있게 됩니다.
00:00:28GLM, DeepSeek와 같은 모델은 물론 Gemma, Qwen 같은 로컬 모델까지 4개 이상의 모델을 사용할 수 있습니다.
00:00:34이는 거대한 도약입니다. 좋아하던 도구들을 그대로 사용하면서도 원하는 모든 모델을 사용할 수 있게 되었으니까요.
00:00:38오늘은 Ollama를 테스트해보겠습니다.
00:00:44Claude Code를 통해 오픈 모델을 실행해보고 다른 경쟁 도구들보다 쓸만한지 확인해 보죠.
00:00:50Ollama CLI를 직접 실행하면 Claude Code나 Open Code 같은 다른 CLI 도구를 실행할 수 있는 옵션이 제공되며, 원하는 모델을 선택할 수 있습니다.
00:01:01현재 Open Code 안에 들어와 있는데, Ollama를 통해 Gemma 4를 실행 중입니다.
00:01:07이제 “Better Stack을 구독하고 있나요?”와 같은 질문을 입력할 수 있죠.
00:01:12아니라면 이 영상 아래에서 구독 버튼을 눌러주세요! 굳이 Ollama CLI를 거치지 않아도 됩니다.
00:01:17예를 들어 Claude Code의 경우, 환경 변수를 변경하여 Ollama를 가리키게만 하면 됩니다.
00:01:23베이스 URL과 토큰을 변경하면, 원하는 모델을 직접 가리키는 Claude Code를 실행할 수 있습니다.
00:01:29결과적으로 Claude Code 안에서 이전과 똑같이 사용할 수 있지만,
00:01:34이제 오픈 소스 모델과 함께 실행하고 있는 셈입니다. Ollama로 직접 모델을 실행할 수도 있습니다.
00:01:40멀티모달인 Gemma 4를 실행해서 이미지 안에 무엇이 있는지 물어볼 수도 있고요.
00:01:46Ollama의 환경에 직접 들어가서 Gemma 같은 모델과 대화할 수도 있어 별도의 서드파티 도구는 전혀 필요 없습니다.
00:01:51자, 터미널에서 'ollama'를 입력해 CLI로 들어가 보겠습니다.
00:01:57보시다시피 다양한 에이전트나 환경을 선택할 수 있는 여러 옵션이 있습니다.
00:02:01직접 대화할 수도 있지만, 이번에는 Claude Code로 들어가 보겠습니다.
00:02:05이미 다운로드해 둔 기본 모델이 Gemma 4인 것도 확인할 수 있습니다. 이제 Claude Code 안으로 들어왔습니다.
00:02:11Gemma 4를 사용 중이며 API 사용량 결제 정보가 뜨지만, 실제로는 로컬 모델이라
00:02:17비용이 전혀 들지 않습니다. 그래서 “hello”라고 메시지를 입력해 볼 수 있죠.
00:02:23모델이 응답하면 여전히 Claude Code인 것처럼 생각하겠지만, 실은 Gemma 4 모델이 실행 중인 겁니다.
00:02:28“안녕하세요, 저는 소프트웨어 엔지니어링을 돕는 Claude Code 어시스턴트입니다.”라는 응답을 받았습니다.
00:02:34즉, 이전과 똑같이 Claude Code를 계속 사용하면서도
00:02:39Anthropic의 모델 대신 로컬 오픈 소스 모델을 사용하는 방식으로 속인 셈입니다.
00:02:44이제 ollama.com에서 검색해보면 엄청나게 많은 다른 모델들을 사용할 수 있습니다.
00:02:49Qwen 3.6을 비롯해 정말 많은 옵션이 있죠.
00:02:55Minimax도 있고, DeepSeek 제품군도 있습니다. 즉, 인기 있는 모델은 대부분 사용할 수 있습니다.
00:03:01실행하려면 간단히 이런 명령어를 입력하면 됩니다.
00:03:05ollama run qwen 3.6을 입력하면, 모델이 다운로드되어 있지 않을 경우 다운로드를 시작합니다.
00:03:11다운로드에는 시간이 조금 걸리겠지만, 일단 사용할 수 있게 되면 로컬 머신에서 바로 실행 가능합니다.
00:03:15자, 그럼 이미지 감지 스크립트를 확인해 볼까요? 'ollama run gemma 4'를 입력하고,
00:03:20따옴표 안에 “이 이미지에 뭐가 들어있어?”라고 묻고, 다운로드 폴더에 있는 이미지를 지정합니다.
00:03:25그럼 아주 빠르게 응답을 받을 수 있습니다.
00:03:29분석 결과, 이미지에 고양이가 있다고 하네요. 태비 고양이고요, 포즈와 행동도 설명해 줍니다.
00:03:35고양이가 누워 있다는 정보도 정확합니다. 이게 바로 방금 분석한 이미지입니다.
00:03:41로컬 모델을 실행할 때는 사용 가능한 메모리와 시스템 성능이 매우 중요합니다.
00:03:45VRAM이 24GB 미만이면 4k 컨텍스트, 28~48GB라면 32k 컨텍스트를 사용할 수 있습니다.
00:03:5248GB 이상의 VRAM이 있다면 256k 컨텍스트를 쓸 수 있죠. 최근 Ollama는 큰 업데이트도 진행했습니다.
00:03:59지난 3월, macOS에서 애플 실리콘을 위한 머신러닝 프레임워크인 MLX로 포팅되었습니다.
00:04:06이를 통해 모델이 통합 메모리를 최대한 활용할 수 있게 되었고,
00:04:11GPU 뉴럴 가속기를 활용하여 첫 토큰 생성 시간과 전반적인 생성 속도를 높였습니다. 기본적으로 더 빨라진 것이죠.
00:04:18로컬 머신 외에도 Ollama는 Docker 안에서 실행할 수 있어 로컬 모델에 의존하는 자체 서비스를 운영할 수도 있습니다.
00:04:24문서에는 CPU 전용 혹은 NVIDIA나 AMD GPU를 사용하여 컨테이너 내에서 Ollama를 사용하는 전체 가이드가 포함되어 있습니다.
00:04:30모델을 Docker 내에서 실행하고, curl 요청을 직접 보낼 수도 있습니다.
00:04:37API 레퍼런스에는 호출할 수 있는 다른 여러 엔드포인트도 포함되어 있습니다. 다른 도구들과 Ollama를 비교해 보면,
00:04:44vLLM은 로컬 CLI 도구보다는 서비스로서 모델을 실행하는 데 훨씬 더 적합해 보입니다.
00:04:49최신 서빙 처리량, 효율적인 메모리 관리, 양자화 등 성능 개선 덕분에 서버 배포 시 훨씬 빠릅니다.
00:04:54따라서 호스팅 서비스를 운영 중이라면 vLLM이 더 나은 선택일 수 있습니다.
00:05:00LM Studio는 로컬 워크플로우 측면에서 Ollama와 매우 비슷하며 아름다운 GUI도 제공합니다.
00:05:06하지만 Ollama도 관심이 있다면 사용할 수 있는 공식 GUI를 가지고 있다는 점을 언급하고 싶네요.
00:05:12이 분야에는 물론 다른 도구들도 많이 있습니다.
00:05:17예전에 전체 영상으로 다뤘던 AnythingLLM 같은 것들이 있죠. 도움이 되셨길 바랍니다.
00:05:22Better Stack의 워런이었습니다. 시청해주셔서 감사합니다. 다음 영상에서 뵙겠습니다.