Claude CodeをOllamaで動かしてAIコストを99%削減する方法

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Ollamaは、GitHubで17万以上のスターを獲得しているヘッドレスLLMサーバーで、オープンモデルを実行できます。
00:00:06Claude CodeやOpenCodeなど、あらゆるアプリやエージェント経由で利用可能です。
00:00:12Ollamaにツールを向ければ、ローカルモデルの管理から、Claude Code内のホスト型モデルへのトラフィック転送まで行えます。
00:00:18例えば、ベースURLの環境変数をOllamaサーバーに向けるだけで設定は完了です。
00:00:23操作感は以前と全く同じですが、何百ものモデルにアクセスできるようになります。
00:00:28QwenやDeepSeekといったモデルや、Gemmaのようなローカルモデルまで、すべて利用可能です。
00:00:34使い慣れたツールをそのまま使いながら、あらゆるモデルを試せるようになるというのは大きなメリットです。
00:00:38今日はOllamaをテストして、オープンモデルをClaude Codeで動かし、他と比べて価値があるか検証します。
00:00:44vLLMやLM Studioといった競合ツールと比較してみましょう。
00:00:50Ollama CLIを起動すると、Claude CodeやOpenCodeなどのCLIツールを起動し、好みのモデルを選択するオプションが表示されます。
00:01:01現在OpenCode内で、Ollama経由でGemma 4を実行しています。
00:01:07ここで「Better Stackに登録していますか?」のように尋ねてみます。
00:01:12もし未登録なら、ぜひ動画の下から登録してください。Ollama CLIを経由する必要さえありません。
00:01:17例えばClaude Codeの場合、環境変数を変更してベースURLをOllamaに向けるだけで利用できます。
00:01:23ベースURLとAPIトークンを変えれば、Claude Codeから直接好きなモデルを呼び出せます。
00:01:29結果として、Claude Codeの操作感はそのままに、オープンソースモデルで実行できるようになりました。
00:01:34Gemma 4のようなモデルをOllamaから直接動かすことも可能です。
00:01:40マルチモーダルモデルであるGemma 4なら、画像の内容を尋ねることもできます。
00:01:46Ollamaのハブに直接入ってGemmaのようなモデルとチャットもできるので、サードパーティツールは一切不要です。
00:01:51ターミナルで「ollama」と入力してCLIに入ります。
00:01:57ここには、利用可能なさまざまなエージェントやハブの選択肢が表示されます。
00:02:01直接チャットもできますが、今回はClaude Codeに入ってみましょう。
00:02:05すでにダウンロード済みのデフォルトモデルであるGemma 4が起動しているのが分かります。
00:02:11「高負荷」と表示され、API利用料についての記述もありますが、ローカルモデルなので費用は一切かかりません。
00:02:17試しに「hello」と送ってみます。
00:02:23モデルの返答を見ると、Claude Codeとして振る舞いながら、裏ではGemma 4が動いていることが分かります。
00:02:28「こんにちは、ソフトウェアエンジニアリングのアシスタント、Claude Codeです」という返答が来ました。
00:02:34つまり、いつものツールを使いながら、裏側をローカルのオープンソースモデルに差し替えることができるのです。
00:02:39Anthropicのモデルの代わりに、ローカルのオープンソースモデルが使われているというわけです。
00:02:44ollama.comで検索すれば、他にも多くのモデルが見つかります。
00:02:49Qwen 3.6など、非常に多くの選択肢があります。
00:02:55MinimaxやDeepSeekファミリーもあります。人気のモデルはほとんど網羅されています。
00:03:01実行するには、「ollama run qwen 3.6」のようにコマンドを入力するだけです。
00:03:05モデルが未ダウンロードなら、ダウンロードが始まります。
00:03:11完了すれば、自分のマシンで即座に実行可能です。
00:03:15先ほどの画像認識を試してみましょう。「ollama run gemma 4」を実行します。
00:03:20引用符の中で「この画像は何?」と問いかけ、ダウンロードフォルダの画像を指定します。
00:03:25驚くほど素早く結果が返ってきました。
00:03:29猫が写っていると解析されました。タビー猫で、横たわっているという説明も正確です。
00:03:35これが検出に使われた画像です。ローカルモデルを動かすにはシステムメモリが重要です。
00:03:41VRAMが24GB未満だとコンテキスト長は4kに制限されます。
00:03:4528GBから48GBあれば32k、それ以上なら256kのコンテキストが使えます。
00:03:52OllamaはmacOS向けに大きなアップデートを行いました。
00:03:593月にAppleシリコンの機械学習フレームワーク「MLX」に対応しました。
00:04:06これによりユニファイドメモリを最大限活用し、GPUのニューラルアクセラレータを利用可能になりました。
00:04:11初回トークン生成や全体の速度が高速化され、非常に快適です。
00:04:18また、Dockerでも実行できるため、サービス化も簡単です。
00:04:24ドキュメントには、CPUのみ、またはNVIDIA/AMD GPU環境でのコンテナ実行ガイドがあります。
00:04:30起動後はcurlコマンドで直接リクエストを送ることも可能です。
00:04:37APIリファレンスには他にも多くのエンドポイントが用意されています。
00:04:44vLLMと比較すると、OllamaはローカルCLIツールとして、vLLMはサービス運用に向いています。
00:04:49vLLMはサーバー展開において、高いスループットと効率的なメモリ管理を実現します。
00:04:54量子化技術なども含め、パフォーマンスが大幅に最適化されています。
00:05:00ホスト型サービスならvLLMが適しています。LM StudioはOllamaに近く、GUIが非常に優秀です。
00:05:06ですが、Ollamaにも公式GUIが存在します。
00:05:12他にもAnythingLLMなど、この分野には様々なツールがあります。
00:05:17これについては以前動画で取り上げました。
00:05:22今回の情報がお役に立てば幸いです。Better Stackのウォーレンでした。ご視聴ありがとうございます。またお会いしましょう。

핵심 요약

Claude CodeのベースURL環境変数をローカルのOllamaサーバーに向けることで、API利用料をかけずに最新のオープンソースモデルを既存の操作感のまま実行できる。

하이라이트

  • Ollamaを活用することで、Claude Codeなどのツールでオープンソースモデルをローカル実行し、API利用コストをほぼゼロに削減できる。

  • Claude Codeの環境変数でベースURLをOllamaサーバーに向けるだけで、既存のツール操作感を維持したままモデルの差し替えが完了する。

  • macOSにおいてAppleシリコンのMLXフレームワークを活用することで、ユニファイドメモリとGPUニューラルアクセラレータによる高速なトークン生成が可能となる。

  • メモリ容量に応じてコンテキスト長が変化し、24GB未満では4k、28GBから48GBで32k、それ以上で256kまで対応する。

  • OllamaはQwen、DeepSeek、Gemma 4などの主要モデルを網羅しており、マルチモーダルモデルによる画像認識にも対応している。

타임라인

OllamaによるAIコスト削減とセットアップ

  • Ollamaは17万以上のGitHubスターを獲得しているヘッドレスLLMサーバーである。
  • 環境変数のベースURLをOllamaに向けるだけで、Claude Code等のCLIツールからローカルモデルを呼び出せる。
  • QwenやDeepSeek、Gemmaなど多様なモデルを使い慣れたツール経由で利用可能である。

Ollamaはローカルモデルの管理からトラフィック転送までを一括で行う。Claude CodeのベースURLとAPIトークンを調整するだけで、追加コストなしにオープンソースモデルへ切り替えられる。操作感はそのまま維持されるため、既存のエンジニアリングワークフローを変更する必要がない。

モデル実行の実践と画像認識

  • Claude Codeの振る舞いを維持したまま、バックエンドをGemma 4等のオープンソースモデルへ差し替えられる。
  • マルチモーダル対応モデルであるGemma 4を使用すれば、画像内容の解析も可能である。
  • ollama runコマンドでモデルをダウンロードし、即座にローカル環境で実行できる。

Claude Codeのターミナルでモデルを切り替え、チャット形式でエンジニアリング支援を受けられる。例えばGemma 4を利用すれば、画像ファイルを指定して内容の解析も行える。サードパーティツールを介さずとも、Ollama CLIを通じて直接モデルと対話が可能である。

ハードウェア性能と最適化

  • VRAM容量はコンテキスト長に直接影響し、最大256kまで拡張可能である。
  • macOS向けにMLXフレームワークへ対応し、Appleシリコンの性能を最大化できる。
  • Dockerコンテナ環境を利用することで、CPUやNVIDIA/AMD GPU環境でのサービス運用も可能である。

ローカル実行においてはシステムメモリとVRAMが重要である。3月よりAppleシリコンのMLXフレームワークへ対応したことで、GPUニューラルアクセラレータを活用しトークン生成速度が大幅に向上した。Dockerでの展開も公式サポートされており、開発・運用双方で利便性が高い。

競合ツールとの比較

  • vLLMは高いスループットと効率的なメモリ管理を実現しており、サーバー展開に適している。
  • LM Studioは優れたGUIを提供するが、Ollamaにも公式GUIが存在する。
  • AnythingLLMなどのツールと組み合わせることで、用途に合わせた最適な環境を構築できる。

ローカルCLIとして最適なOllamaに対し、vLLMは大規模なサービス運用時のパフォーマンスに特化している。LM StudioはGUIが特徴だが、Ollamaのエコシステムも拡張が進んでおり、運用目的に応じたツールの選定が重要である。

커뮤니티 글

모든 글 보기