Запускаем Claude Code с Ollama: AI в 99 раз дешевле

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Ollama — это headless-сервер с более чем 176 000 звезд на GitHub, который позволяет запускать открытые модели
00:00:06через любое приложение или агент, включая Claude Code, Codex и даже Open Claude. Вы можете направлять свои
00:00:12запросы к Ollama, которая управляет локальными моделями или перенаправляет трафик к хостинговым моделям в Claude.
00:00:18В Claude Code, например, можно просто изменить переменную окружения базового URL, указав ваш сервер Ollama.
00:00:23Теперь все работает точно так же, как и раньше, но вы получили доступ к сотням
00:00:28моделей вместо четырех. Такие модели, как GLM, DeepSeek и даже локальные Gemma и Qwen, теперь доступны.
00:00:34Это огромный прорыв, ведь вы можете продолжать использовать все привычные инструменты точно
00:00:38таким же образом, получив при этом доступ к любой модели, о которой можно подумать. Сегодня мы протестируем Ollama,
00:00:44попробуем запускать открытые модели через Claude Code и посмотрим, стоит ли использовать ее вместо конкурентов,
00:00:50таких как vLLM и LM Studio. Когда мы запускаем CLI Ollama напрямую, он предлагает опции для запуска других CLI-инструментов,
00:01:01таких как Claude Code или Open Code, позволяя выбрать предпочтительную модель. Сейчас я внутри Open
00:01:07Code, но я запускаю Gemma 4 через Ollama, и теперь могу ввести что-то вроде: “Вы подписаны на Better
00:01:12Stack?” Если ответ “нет”, то почему бы не подписаться под этим видео? Нам даже не обязательно использовать
00:01:17CLI Ollama. С Claude Code, например, можно просто изменить переменные окружения, указав путь к
00:01:23Ollama, изменив базовый URL и API-токены, и теперь можно запускать Claude Code напрямую, используя
00:01:29любую понравившуюся модель. Результат: я внутри Claude Code, могу использовать его так же, как и раньше, но
00:01:34теперь я запускаю его на модели с открытым исходным кодом. Вы даже можете запускать модели прямо через Ollama, например
00:01:40Gemma 4, которая является мультимодальной. Я могу задавать ей вопросы, например, определить, что находится на изображении, и вы
00:01:46даже можете зайти в среду Ollama напрямую, чтобы общаться с моделями вроде Gemma, так что вам не нужны
00:01:51никакие сторонние инструменты. Хорошо, мы в терминале, и я просто введу “ollama”, чтобы войти в CLI,
00:01:57и вы видите, что здесь у нас есть куча вариантов агентов или сред, в которые мы можем войти.
00:02:01Мы могли бы просто пообщаться с ней напрямую, но в данном случае я просто войду в Claude Code, и вы увидите,
00:02:05что моделью по умолчанию, которую я уже скачал, является Gemma 4. Итак, мы внутри Claude Code,
00:02:11и вы видите, что мы используем Gemma 4. Указано “API usage billing”, но поскольку это на самом деле
00:02:17локальная модель, это ничего не будет нам стоить, поэтому мы можем ввести сообщение, например, “Hello”. Как только модель
00:02:23ответит, вы все еще будете видеть, что она думает, что это Claude Code, хотя она все еще запускает модель Gemma
00:02:284. Мы получаем ответ: “Hello, я Claude Code, ваш помощник по всем вопросам разработки ПО”. Так что
00:02:34это означает, что теперь вы можете продолжать использовать Claude Code точно так же, как и раньше, но вы обманули
00:02:39его, потому что вместо моделей Anthropic вы на самом деле используете локальную модель с открытым
00:02:44исходным кодом. Сейчас доступно множество других моделей, вы можете увидеть их на сайте ollama.com. Поиск
00:02:49показывает, что у нас есть варианты множества моделей, включая такие, как Qwen 3.6,
00:02:55есть MiniMax, я уверен, что есть... Да, семейство DeepSeek здесь тоже есть. В общем, любая популярная
00:03:01модель, о которой вы можете подумать, будет доступна, и чтобы запустить ее, мы можем просто ввести команду вроде
00:03:05ollama run qwen 3.6, и если модель еще не скачана, начнется загрузка, поэтому
00:03:11вам придется немного подождать, пока она скачается, но как только она станет доступна, вы сможете запустить ее на своей
00:03:15машине. Теперь давайте проверим скрипт обнаружения изображений, я могу сказать “ollama run gemma 4”
00:03:20и затем в кавычках сказать: “Что внутри этого изображения?”, а затем просто указать путь к изображению, которое
00:03:25просто оказалось в моей папке загрузок, и сразу же, очень быстро, мы получаем ответ,
00:03:29она проанализировала его и говорит, что на изображении кошка, это полосатая кошка, поза и действие:
00:03:35кошка лежит. Все это верно, и это именно то изображение, на котором проводилось обнаружение. Теперь,
00:03:41ваша доступная память и производительность системы действительно имеют значение при запуске локальных моделей. Если у вас
00:03:45менее 24 ГБ видеопамяти, вы получите только 4K контекста, от 28 до 48 ГБ видеопамяти дают 32K контекста,
00:03:52а более 48 ГБ видеопамяти дают 256K контекста. Недавно Ollama также сделала огромные обновления при
00:03:59работе на macOS. В марте Ollama перешла на MLX для Apple Silicon, что является фреймворком машинного
00:04:06обучения от Apple. Это позволяет моделям в полной мере использовать вашу объединенную память и позволяет Ollama
00:04:11задействовать GPU-нейроускорители для ускорения времени получения первого токена и скорости генерации. В общем, это
00:04:18быстрее. Помимо вашей локальной машины, Ollama также может работать внутри Docker, так что вы можете запускать свои собственные сервисы,
00:04:24которые полагаются на локальные модели. Документация включает полное руководство по использованию Ollama внутри контейнера,
00:04:30либо используя только CPU, либо с GPU от NVIDIA и AMD. Затем вы можете запустить модель внутри Docker и даже отправлять curl-запросы
00:04:37напрямую к ней. API-справочник также включает несколько других эндпоинтов, которые можно вызывать. Теперь, сравнивая Ollama с
00:04:44другими инструментами, vLLM кажется гораздо более подходящим для запуска моделей как сервисов, а не как локального CLI-инструмента,
00:04:49и он значительно быстрее для серверных развертываний благодаря целому ряду улучшений производительности,
00:04:54таких как современная пропускная способность, эффективное управление памятью и квантование. Поэтому, если вы
00:05:00запускаете хостинговый сервис, то vLLM может быть лучшим выбором. LM Studio гораздо ближе к Ollama с точки зрения
00:05:06локальных рабочих процессов, а также поставляется с красивым GUI. Однако я бы отметил, что у Ollama есть свой
00:05:12официальный GUI, если это то, что вас интересует. Конечно, в этой области есть куча других инструментов,
00:05:17таких как AnythingLLM, о котором мы сняли целое видео. В остальном, надеюсь, вы нашли это
00:05:22полезным. С вами был Уоррен из Better Stack, спасибо за просмотр, и увидимся в следующий раз.

Key Takeaway

Использование Ollama в связке с Claude Code позволяет бесплатно применять любые локальные модели с открытым исходным кодом вместо платных облачных решений Anthropic.

Highlights

  • Ollama позволяет запускать открытые модели, такие как Gemma, Qwen и DeepSeek, через Claude Code вместо стандартных моделей Anthropic.

  • Изменение базового URL в переменных окружения перенаправляет запросы Claude Code на локальный сервер Ollama.

  • Производительность контекстного окна при работе с локальными моделями зависит от объема видеопамяти: менее 24 ГБ обеспечивают 4K, 28–48 ГБ — 32K, а более 48 ГБ — 256K токенов.

  • Интеграция с MLX для Apple Silicon позволяет Ollama задействовать GPU-нейроускорители macOS для ускорения генерации токенов.

  • vLLM лучше подходит для серверных развертываний с высокой пропускной способностью, тогда как Ollama оптимизирована для локальных рабочих процессов.

  • Локальный запуск моделей исключает расходы на API-биллинг за использование сторонних облачных сервисов.

Timeline

Интеграция Ollama и Claude Code

  • Ollama выступает в роли локального сервера для запуска открытых моделей.
  • Замена базового URL в конфигурации Claude Code перенаправляет трафик на локальные нейросети.

Ollama предоставляет доступ к сотням моделей, таких как GLM, DeepSeek, Gemma и Qwen, которые работают как альтернатива стандартным моделям в Claude Code. Пользователь может настроить переменную окружения базового URL, чтобы CLI-инструменты продолжали работать в привычном режиме, используя локальные ресурсы вместо внешних API.

Мультимодальные возможности и запуск моделей

  • Команда ollama run позволяет быстро скачивать и запускать любые доступные модели.
  • Локальные модели, например Gemma 4, способны выполнять анализ изображений.

Процесс запуска модели требует лишь ввода команды в терминале. Анализ изображений через локальный инстанс Gemma 4 демонстрирует высокую скорость обработки, позволяя быстро определять объекты и их состояние без необходимости обращения к облачным серверам.

Производительность и аппаратные требования

  • Объем доступной видеопамяти напрямую определяет размер поддерживаемого контекстного окна.
  • Интеграция Ollama с фреймворком MLX обеспечивает прирост скорости на чипах Apple Silicon.
  • vLLM предпочтительнее для высоконагруженных серверных сервисов, а Ollama — для персональных задач.

Контекстное окно масштабируется от 4K до 256K токенов в зависимости от объема VRAM (пороги в 24 ГБ и 48 ГБ). Для macOS Ollama использует возможности MLX, что позволяет эффективно задействовать нейроускорители GPU. В серверной среде vLLM обеспечивает более эффективное управление памятью, тогда как Ollama остается удобным инструментом для локальной разработки.

Community Posts

View all posts