Transcript
00:00:00Ollamaは、GitHubで17万以上のスターを獲得しているヘッドレスLLMサーバーで、オープンモデルを実行できます。
00:00:06Claude CodeやOpenCodeなど、あらゆるアプリやエージェント経由で利用可能です。
00:00:12Ollamaにツールを向ければ、ローカルモデルの管理から、Claude Code内のホスト型モデルへのトラフィック転送まで行えます。
00:00:18例えば、ベースURLの環境変数をOllamaサーバーに向けるだけで設定は完了です。
00:00:23操作感は以前と全く同じですが、何百ものモデルにアクセスできるようになります。
00:00:28QwenやDeepSeekといったモデルや、Gemmaのようなローカルモデルまで、すべて利用可能です。
00:00:34使い慣れたツールをそのまま使いながら、あらゆるモデルを試せるようになるというのは大きなメリットです。
00:00:38今日はOllamaをテストして、オープンモデルをClaude Codeで動かし、他と比べて価値があるか検証します。
00:00:44vLLMやLM Studioといった競合ツールと比較してみましょう。
00:00:50Ollama CLIを起動すると、Claude CodeやOpenCodeなどのCLIツールを起動し、好みのモデルを選択するオプションが表示されます。
00:01:01現在OpenCode内で、Ollama経由でGemma 4を実行しています。
00:01:07ここで「Better Stackに登録していますか?」のように尋ねてみます。
00:01:12もし未登録なら、ぜひ動画の下から登録してください。Ollama CLIを経由する必要さえありません。
00:01:17例えばClaude Codeの場合、環境変数を変更してベースURLをOllamaに向けるだけで利用できます。
00:01:23ベースURLとAPIトークンを変えれば、Claude Codeから直接好きなモデルを呼び出せます。
00:01:29結果として、Claude Codeの操作感はそのままに、オープンソースモデルで実行できるようになりました。
00:01:34Gemma 4のようなモデルをOllamaから直接動かすことも可能です。
00:01:40マルチモーダルモデルであるGemma 4なら、画像の内容を尋ねることもできます。
00:01:46Ollamaのハブに直接入ってGemmaのようなモデルとチャットもできるので、サードパーティツールは一切不要です。
00:01:51ターミナルで「ollama」と入力してCLIに入ります。
00:01:57ここには、利用可能なさまざまなエージェントやハブの選択肢が表示されます。
00:02:01直接チャットもできますが、今回はClaude Codeに入ってみましょう。
00:02:05すでにダウンロード済みのデフォルトモデルであるGemma 4が起動しているのが分かります。
00:02:11「高負荷」と表示され、API利用料についての記述もありますが、ローカルモデルなので費用は一切かかりません。
00:02:17試しに「hello」と送ってみます。
00:02:23モデルの返答を見ると、Claude Codeとして振る舞いながら、裏ではGemma 4が動いていることが分かります。
00:02:28「こんにちは、ソフトウェアエンジニアリングのアシスタント、Claude Codeです」という返答が来ました。
00:02:34つまり、いつものツールを使いながら、裏側をローカルのオープンソースモデルに差し替えることができるのです。
00:02:39Anthropicのモデルの代わりに、ローカルのオープンソースモデルが使われているというわけです。
00:02:44ollama.comで検索すれば、他にも多くのモデルが見つかります。
00:02:49Qwen 3.6など、非常に多くの選択肢があります。
00:02:55MinimaxやDeepSeekファミリーもあります。人気のモデルはほとんど網羅されています。
00:03:01実行するには、「ollama run qwen 3.6」のようにコマンドを入力するだけです。
00:03:05モデルが未ダウンロードなら、ダウンロードが始まります。
00:03:11完了すれば、自分のマシンで即座に実行可能です。
00:03:15先ほどの画像認識を試してみましょう。「ollama run gemma 4」を実行します。
00:03:20引用符の中で「この画像は何?」と問いかけ、ダウンロードフォルダの画像を指定します。
00:03:25驚くほど素早く結果が返ってきました。
00:03:29猫が写っていると解析されました。タビー猫で、横たわっているという説明も正確です。
00:03:35これが検出に使われた画像です。ローカルモデルを動かすにはシステムメモリが重要です。
00:03:41VRAMが24GB未満だとコンテキスト長は4kに制限されます。
00:03:4528GBから48GBあれば32k、それ以上なら256kのコンテキストが使えます。
00:03:52OllamaはmacOS向けに大きなアップデートを行いました。
00:03:593月にAppleシリコンの機械学習フレームワーク「MLX」に対応しました。
00:04:06これによりユニファイドメモリを最大限活用し、GPUのニューラルアクセラレータを利用可能になりました。
00:04:11初回トークン生成や全体の速度が高速化され、非常に快適です。
00:04:18また、Dockerでも実行できるため、サービス化も簡単です。
00:04:24ドキュメントには、CPUのみ、またはNVIDIA/AMD GPU環境でのコンテナ実行ガイドがあります。
00:04:30起動後はcurlコマンドで直接リクエストを送ることも可能です。
00:04:37APIリファレンスには他にも多くのエンドポイントが用意されています。
00:04:44vLLMと比較すると、OllamaはローカルCLIツールとして、vLLMはサービス運用に向いています。
00:04:49vLLMはサーバー展開において、高いスループットと効率的なメモリ管理を実現します。
00:04:54量子化技術なども含め、パフォーマンスが大幅に最適化されています。
00:05:00ホスト型サービスならvLLMが適しています。LM StudioはOllamaに近く、GUIが非常に優秀です。
00:05:06ですが、Ollamaにも公式GUIが存在します。
00:05:12他にもAnythingLLMなど、この分野には様々なツールがあります。
00:05:17これについては以前動画で取り上げました。
00:05:22今回の情報がお役に立てば幸いです。Better Stackのウォーレンでした。ご視聴ありがとうございます。またお会いしましょう。