Transcript
00:00:00Ollama 是一个拥有超过 17.6 万 GitHub 星标的无头 LLM 服务器,它让你能够运行开源模型
00:00:06通过任何应用或代理,包括 Cline、Codeium 甚至 Open-WebUI,你可以将你的
00:00:12工具指向 Ollama,它甚至能管理本地模型或将流量路由到 Cline 中的托管模型
00:00:18代码示例中,你只需更改基础 URL 环境变量,将其指向你的 Ollama
00:00:23服务器。现在,一切运行方式与之前完全相同,但你已经解锁了数百个模型的使用权限
00:00:28而不仅仅是四个,像 GLM、DeepSeek,甚至是像 Gemma 和 Qwen 这样的本地模型也都
00:00:34全部可用。这是一个巨大的解锁,因为你可以继续以完全相同的方式
00:00:38使用你喜爱的所有工具,但现在你拥有了你能想到的每一个模型的使用权限。今天我们将测试一下 Ollama
00:00:44我们将尝试通过 Cline 运行开源模型,看看它是否比 vLLM 和 LM Studio 等竞品更值得使用
00:00:50当我们直接启动 Ollama CLI 时,它会提供选项来启动其他 CLI 工具,比如 Cline 或 Open-Code,然后能够选择我们偏好的模型。现在我在 Open-
00:01:01Code 中,但我正在通过 Ollama 运行 Gemma 4,现在我可以输入一些内容,比如“你订阅了 Better Stack 吗?”
00:01:07如果答案是否定的,那么为什么不订阅本视频下方的内容呢?我们甚至不需要通过
00:01:12Ollama CLI。以 Cline 为例,你只需更改环境变量,将其指向
00:01:17Ollama,更改基础 URL 和 API Token,现在你就可以直接运行 Cline 并将其指向
00:01:23任何你喜欢的模型。结果就是,现在我在 Cline 内部,我可以像以前一样完全正常地使用它,但
00:01:29现在我正在运行一个开源模型。你甚至可以直接用 Ollama 运行模型,比如运行
00:01:34Gemma 4,这是一个多模态模型。我可以问它一些问题,比如识别图片里的内容,你
00:01:40甚至可以直接进入 Ollama 的外壳与 Gemma 等模型聊天,这样你就不需要任何第三方
00:01:46工具了。好了,我们现在在终端里,我只需输入 “ollama” 进入 CLI
00:01:51你可以看到这里有一堆不同的代理或外壳选项,我们可以进入
00:01:57我们可以直接和它聊天,但在这种情况下,我只是要进入 Cline,你可以看到
00:02:01同样,我默认下载好的模型是 Gemma 4。现在我们进入了 Cline,并且
00:02:05你可以看到我们在使用 Gemma 4。虽然它显示了 API 使用计费,但因为这实际上是
00:02:11一个本地模型,它完全不会产生任何费用。所以我们可以输入一条消息,比如“你好”。一旦模型
00:02:17回复了,你仍然会发现它认为自己还是 Cline,只不过它在运行 Gemma
00:02:234 模型。所以我们得到回复:“你好,我是 Cline,你所有软件工程事务的助手”。所以
00:02:28这意味着你现在只需像以前一样继续使用 Cline,但你以某种方式“欺骗”了它
00:02:34因为你没有使用 Anthropic 的模型,而是在使用一个本地且开源的
00:02:39模型。现在有大量的其他模型可用,你可以在 ollama.com 上看到,搜索
00:02:44我们有许多许多模型的选择,包括像 Qwen 3.6 这样的模型
00:02:49我们有 Minimax,我确定我们有,是的,DeepSeek 系列也在这里。所以基本上任何你
00:02:55想到的流行模型都将可用,要运行它,我们只需输入一个命令,比如
00:03:01“ollama run qwen 3.6”,如果该模型尚未下载,它就会开始下载该模型。所以
00:03:05你需要等待一段时间下载,但一旦可用,你就可以在你的
00:03:11机器上运行它。现在让我们看看那个图像检测脚本,所以我可以说“ollama run gemma 4”
00:03:15然后在引号内说“这张图片里有什么”,然后直接指向一张恰好在我的
00:03:20下载文件夹中的图片。然后很快地,我们就能得到响应,而且
00:03:25它已经分析完毕,说图片里有一只猫,是一只虎斑猫,姿势和动作是
00:03:29猫正在躺着。所有这些都是正确的,这就是它进行检测的那张图片。现在
00:03:35你的可用内存和系统性能在运行本地模型时非常重要。如果你有
00:03:41少于 24GB 的显存,你只能获得 4K 的上下文;28 到 48GB 的显存可以获得 32K 的上下文
00:03:45超过 48GB 的显存则可以获得 256K 的上下文。最近 Ollama 也进行了巨大的更新
00:03:52在 macOS 上运行。早在三月,Ollama 就移植到了用于 Apple Silicon 的 MLX,这是苹果的机器学习
00:03:59框架。这允许模型充分利用你的统一内存,并允许 Ollama
00:04:06利用 GPU 神经网络加速器来加速首字延迟和生成速度,基本上就是
00:04:11更快了。除了你的本地机器,Ollama 也可以在 Docker 内部运行,这样你可以运行自己的服务
00:04:18这些服务依赖于本地模型。文档中包含了一份关于在容器内使用 Ollama 的完整指南,无论是使用
00:04:24仅 CPU 还是配合 NVIDIA 和 AMD GPU。然后你可以在 Docker 内启动模型,甚至可以直接对它进行 curl 请求
00:04:30API 参考文档还包括了你可以调用的其他几个端点。现在,将 Ollama 与
00:04:37其他工具进行比较,vLLM 似乎更适合作为服务运行模型,而不是作为一个本地 CLI 工具
00:04:44而且由于大量性能改进,对于服务器部署来说,它明显更快
00:04:49例如最先进的服务吞吐量、高效的内存管理和量化。所以如果你是
00:04:54在运行托管服务,那么 vLLM 可能是更好的选择。LM Studio 在本地工作流方面
00:05:00更接近 Ollama,并且还带有一个漂亮的图形界面。不过,我要提一下,Ollama 确实有它自己的
00:05:06官方 GUI,如果你对此感兴趣的话。当然,在这个领域还有大量其他工具
00:05:12比如 AnythingLLM,我们已经为此制作了完整的一期视频。总之,希望你觉得本期视频
00:05:17有用。我是来自 Better Stack 的 Warren,感谢观看,我们下次再见。
00:05:22有用。我是来自 Better Stack 的 Warren,感谢观看,我们下次再见。