使用 Ollama 运行 Claude Code,AI 使用成本降低 99%

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Ollama 是一个拥有超过 17.6 万 GitHub 星标的无头 LLM 服务器,它让你能够运行开源模型
00:00:06通过任何应用或代理,包括 Cline、Codeium 甚至 Open-WebUI,你可以将你的
00:00:12工具指向 Ollama,它甚至能管理本地模型或将流量路由到 Cline 中的托管模型
00:00:18代码示例中,你只需更改基础 URL 环境变量,将其指向你的 Ollama
00:00:23服务器。现在,一切运行方式与之前完全相同,但你已经解锁了数百个模型的使用权限
00:00:28而不仅仅是四个,像 GLM、DeepSeek,甚至是像 Gemma 和 Qwen 这样的本地模型也都
00:00:34全部可用。这是一个巨大的解锁,因为你可以继续以完全相同的方式
00:00:38使用你喜爱的所有工具,但现在你拥有了你能想到的每一个模型的使用权限。今天我们将测试一下 Ollama
00:00:44我们将尝试通过 Cline 运行开源模型,看看它是否比 vLLM 和 LM Studio 等竞品更值得使用
00:00:50当我们直接启动 Ollama CLI 时,它会提供选项来启动其他 CLI 工具,比如 Cline 或 Open-Code,然后能够选择我们偏好的模型。现在我在 Open-
00:01:01Code 中,但我正在通过 Ollama 运行 Gemma 4,现在我可以输入一些内容,比如“你订阅了 Better Stack 吗?”
00:01:07如果答案是否定的,那么为什么不订阅本视频下方的内容呢?我们甚至不需要通过
00:01:12Ollama CLI。以 Cline 为例,你只需更改环境变量,将其指向
00:01:17Ollama,更改基础 URL 和 API Token,现在你就可以直接运行 Cline 并将其指向
00:01:23任何你喜欢的模型。结果就是,现在我在 Cline 内部,我可以像以前一样完全正常地使用它,但
00:01:29现在我正在运行一个开源模型。你甚至可以直接用 Ollama 运行模型,比如运行
00:01:34Gemma 4,这是一个多模态模型。我可以问它一些问题,比如识别图片里的内容,你
00:01:40甚至可以直接进入 Ollama 的外壳与 Gemma 等模型聊天,这样你就不需要任何第三方
00:01:46工具了。好了,我们现在在终端里,我只需输入 “ollama” 进入 CLI
00:01:51你可以看到这里有一堆不同的代理或外壳选项,我们可以进入
00:01:57我们可以直接和它聊天,但在这种情况下,我只是要进入 Cline,你可以看到
00:02:01同样,我默认下载好的模型是 Gemma 4。现在我们进入了 Cline,并且
00:02:05你可以看到我们在使用 Gemma 4。虽然它显示了 API 使用计费,但因为这实际上是
00:02:11一个本地模型,它完全不会产生任何费用。所以我们可以输入一条消息,比如“你好”。一旦模型
00:02:17回复了,你仍然会发现它认为自己还是 Cline,只不过它在运行 Gemma
00:02:234 模型。所以我们得到回复:“你好,我是 Cline,你所有软件工程事务的助手”。所以
00:02:28这意味着你现在只需像以前一样继续使用 Cline,但你以某种方式“欺骗”了它
00:02:34因为你没有使用 Anthropic 的模型,而是在使用一个本地且开源的
00:02:39模型。现在有大量的其他模型可用,你可以在 ollama.com 上看到,搜索
00:02:44我们有许多许多模型的选择,包括像 Qwen 3.6 这样的模型
00:02:49我们有 Minimax,我确定我们有,是的,DeepSeek 系列也在这里。所以基本上任何你
00:02:55想到的流行模型都将可用,要运行它,我们只需输入一个命令,比如
00:03:01“ollama run qwen 3.6”,如果该模型尚未下载,它就会开始下载该模型。所以
00:03:05你需要等待一段时间下载,但一旦可用,你就可以在你的
00:03:11机器上运行它。现在让我们看看那个图像检测脚本,所以我可以说“ollama run gemma 4”
00:03:15然后在引号内说“这张图片里有什么”,然后直接指向一张恰好在我的
00:03:20下载文件夹中的图片。然后很快地,我们就能得到响应,而且
00:03:25它已经分析完毕,说图片里有一只猫,是一只虎斑猫,姿势和动作是
00:03:29猫正在躺着。所有这些都是正确的,这就是它进行检测的那张图片。现在
00:03:35你的可用内存和系统性能在运行本地模型时非常重要。如果你有
00:03:41少于 24GB 的显存,你只能获得 4K 的上下文;28 到 48GB 的显存可以获得 32K 的上下文
00:03:45超过 48GB 的显存则可以获得 256K 的上下文。最近 Ollama 也进行了巨大的更新
00:03:52在 macOS 上运行。早在三月,Ollama 就移植到了用于 Apple Silicon 的 MLX,这是苹果的机器学习
00:03:59框架。这允许模型充分利用你的统一内存,并允许 Ollama
00:04:06利用 GPU 神经网络加速器来加速首字延迟和生成速度,基本上就是
00:04:11更快了。除了你的本地机器,Ollama 也可以在 Docker 内部运行,这样你可以运行自己的服务
00:04:18这些服务依赖于本地模型。文档中包含了一份关于在容器内使用 Ollama 的完整指南,无论是使用
00:04:24仅 CPU 还是配合 NVIDIA 和 AMD GPU。然后你可以在 Docker 内启动模型,甚至可以直接对它进行 curl 请求
00:04:30API 参考文档还包括了你可以调用的其他几个端点。现在,将 Ollama 与
00:04:37其他工具进行比较,vLLM 似乎更适合作为服务运行模型,而不是作为一个本地 CLI 工具
00:04:44而且由于大量性能改进,对于服务器部署来说,它明显更快
00:04:49例如最先进的服务吞吐量、高效的内存管理和量化。所以如果你是
00:04:54在运行托管服务,那么 vLLM 可能是更好的选择。LM Studio 在本地工作流方面
00:05:00更接近 Ollama,并且还带有一个漂亮的图形界面。不过,我要提一下,Ollama 确实有它自己的
00:05:06官方 GUI,如果你对此感兴趣的话。当然,在这个领域还有大量其他工具
00:05:12比如 AnythingLLM,我们已经为此制作了完整的一期视频。总之,希望你觉得本期视频
00:05:17有用。我是来自 Better Stack 的 Warren,感谢观看,我们下次再见。
00:05:22有用。我是来自 Better Stack 的 Warren,感谢观看,我们下次再见。

Key Takeaway

通过将开发工具的 API 基础 URL 指向本地运行的 Ollama 服务器,开发者可以使用各种开源模型实现零成本的 AI 辅助编码。

Highlights

  • Ollama 支持运行包括 Qwen 3.6、DeepSeek 及 Gemma 4 在内的多种开源模型,完全替代付费模型。

  • 将开发工具如 Cline 的基础 URL 指向本地 Ollama 服务器,可实现零成本的 AI 开发体验。

  • 硬件内存决定上下文窗口大小:小于 24GB 显存支持 4K 上下文,28-48GB 支持 32K,超过 48GB 则达到 256K。

  • Apple Silicon Mac 用户通过 MLX 框架运行 Ollama,可利用 GPU 神经网络加速器提升生成速度。

  • Ollama 支持 Docker 容器化部署,适用于仅 CPU 或 NVIDIA/AMD GPU 的各种服务器环境。

Timeline

Ollama 原理与配置方法

  • Ollama 作为无头 LLM 服务器允许开发者通过环境变量将工具流量重定向至本地。
  • 更改 Cline 或 Open-WebUI 的基础 URL 和 API Token 即可接入开源模型。

Ollama 提供了一个本地运行开源模型的接口,支持包括 GLM、DeepSeek 等在内的海量模型。开发者只需修改开发工具的环境变量,将请求指向本地的 Ollama 服务器,即可在保持原有工作流的同时,绕过昂贵的云端 API 使用费。

本地模型执行与功能实测

  • Cline 能够通过本地模型识别并回答技术问题,运行过程不产生任何 API 费用。
  • 命令行界面支持直接进行多模态交互,例如通过 gemma 4 模型识别本地图片内容。

即便开发工具显示 API 计费信息,本地运行模型时实质上并不产生任何费用。通过输入简单的命令如“ollama run qwen 3.6”,系统会自动下载并配置所需模型,用户可以直接在终端内进行文本对话或图像内容识别。

硬件需求与系统集成优化

  • 上下文窗口大小严格取决于显存容量,从 24GB 到 48GB+ 可提供 4K 至 256K 的范围。
  • Apple Silicon 平台的 MLX 框架利用统一内存和 GPU 加速提升生成速度。
  • vLLM 适用于服务器端高吞吐部署,而 Ollama 更侧重于本地 CLI 交互流程。

运行本地模型对显存有明确的性能要求,内存规模直接限定了 AI 处理的长文本能力。针对 macOS 平台,Ollama 移植了 MLX 框架以利用苹果的神经网络引擎。此外,对于生产环境的服务器部署,vLLM 因其更高效的量化和内存管理通常是更佳选择。

Community Posts

View all posts