Exécutez Claude Code avec Ollama pour une IA 99 % moins chère

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Ollama est un serveur de modèles headless comptant plus de 176 000 étoiles sur GitHub qui vous permet d'exécuter des modèles ouverts
00:00:06via n'importe quelle application ou agent, notamment Claude Code, Codex et même Open Claude. Vous pouvez pointer vos
00:00:12outils vers Ollama, qui gère même les modèles locaux, ou diriger votre trafic vers des modèles hébergés dans Claude
00:00:18Code. Par exemple, vous pouvez simplement changer la variable d'environnement de l'URL de base pour pointer vers votre serveur
00:00:23Ollama. Maintenant, tout fonctionne exactement comme avant, mais vous avez débloqué l'accès à des centaines de
00:00:28modèles au lieu de quatre. Des modèles comme GLM, DeepSeek et même des modèles locaux comme Gemma et Qwen sont tous
00:00:34disponibles. C'est une avancée majeure car vous pouvez continuer à utiliser tous vos outils préférés exactement
00:00:38de la même manière, mais vous avez maintenant accès à tous les modèles imaginables. Aujourd'hui, nous allons tester Ollama,
00:00:44essayer d'exécuter des modèles ouverts via Claude Code et voir s'il vaut mieux l'utiliser que d'autres concurrents
00:00:50comme vLLM et LM Studio. Lorsque nous lançons l'interface CLI d'Ollama directement, elle nous donne des options pour lancer d'autres outils CLI
00:01:01comme Claude Code ou Open Code, puis nous pouvons sélectionner notre modèle préféré. Maintenant, je suis dans Open
00:01:07Code, mais j'exécute Gemma 4 via Ollama et maintenant je peux taper quelque chose comme “es-tu abonné à Better
00:01:12Stack ?” et si la réponse est non, alors pourquoi ne pas vous abonner sous cette vidéo ? Nous n'avons même pas besoin de passer par
00:01:17l'interface CLI d'Ollama du tout avec Claude Code par exemple. Vous pouvez simplement changer les variables d'environnement pour pointer vers
00:01:23Ollama, en modifiant l'URL de base et les jetons, et maintenant vous pouvez lancer Claude Code directement en le pointant vers
00:01:29le modèle de votre choix. Le résultat est que je suis maintenant dans Claude Code, je peux l'utiliser exactement comme avant mais
00:01:34maintenant je l'exécute avec un modèle open source. Vous pouvez même exécuter des modèles directement avec Ollama, comme exécuter
00:01:40Gemma 4 qui est un modèle multimodal. Je peux lui poser des questions pour identifier ce qu'il y a dans une image et vous
00:01:46pouvez même entrer directement dans le système d'Ollama pour discuter avec des modèles comme Gemma sans avoir besoin d'aucun outil
00:01:51tiers. OK, donc nous sommes dans le terminal ici et je vais juste taper “ollama” pour entrer dans l'interface CLI
00:01:57et vous pouvez voir ici que nous avons un tas d'options de différents agents ou interfaces dans lesquels nous pourrions entrer.
00:02:01Nous pourrions simplement discuter directement avec lui, mais dans ce cas, je vais juste entrer dans Claude Code et vous pouvez voir
00:02:05aussi que le modèle par défaut, que j'ai déjà téléchargé, est Gemma 4. Donc maintenant, nous sommes dans Claude Code et
00:02:11vous pouvez voir que nous sommes sur Gemma 4 avec un effort élevé. Il mentionne la facturation de l'utilisation de l'API, mais comme il s'agit en fait
00:02:17d'un modèle local, cela ne nous coûtera absolument rien. Nous pouvons donc taper un message comme “bonjour”. Une fois que le modèle
00:02:23répond, vous pouvez toujours voir qu'il pense toujours qu'il s'agit de Claude Code, alors qu'il exécute toujours le modèle Gemma
00:02:284, donc nous obtenons la réponse : “bonjour, je suis Claude Code, votre assistant pour tout ce qui concerne l'ingénierie logicielle”. Donc
00:02:34cela signifie que vous pouvez maintenant simplement continuer à utiliser Claude Code exactement comme avant, mais vous l'avez piégé
00:02:39d'une certaine manière car au lieu d'utiliser les modèles d'Anthropic, vous utilisez en fait un modèle local et open
00:02:44source. Maintenant, il y a des tonnes d'autres modèles disponibles. Vous pouvez voir ici sur [ollama.com/search](https://www.google.com/search?q=https%3A%2F%2Follama.com%2Fsearch)
00:02:49que nous avons le choix parmi de très nombreux modèles, y compris des choses comme Qwen 3.6.
00:02:55Nous avons MiniMax, je suis sûr que nous avons... oui, la famille DeepSeek est là aussi, donc pratiquement n'importe quel modèle populaire
00:03:01auquel vous pouvez penser sera disponible. Et pour l'exécuter, nous pouvons simplement taper une commande comme
00:03:05ollama run qwen 3.6 et cela commencera à télécharger le modèle s'il n'est pas déjà téléchargé. Donc
00:03:11vous devrez attendre un moment pour qu'il se télécharge, mais une fois disponible, vous pourrez alors l'exécuter sur votre
00:03:15machine. Maintenant, testons ce script de détection d'image. Je peux dire “ollama run gemma 4”
00:03:20et ensuite, entre guillemets, nous disons “qu'y a-t-il dans cette image ?” et nous le pointons vers une image qui
00:03:25se trouve justement dans mon dossier de téléchargements. Immédiatement et très rapidement, en fait, nous obtenons une réponse et
00:03:29il l'a analysée et il dit qu'il y a un chat sur l'image, c'est un chat tigré, la pose et l'action,
00:03:35le chat est allongé. Tout cela est vrai et c'est l'image qu'il a utilisée pour la détection. Maintenant,
00:03:41votre mémoire disponible et les performances du système sont vraiment importantes lors de l'exécution de modèles locaux. Si vous avez
00:03:45moins de 24 Go de VRAM, vous obtiendrez seulement 4K de contexte. 28 à 48 Go de VRAM vous donnent 32K de contexte
00:03:52et plus de 48 Go de VRAM vous donnent 256K de contexte. Récemment, Ollama a également fait d'énormes mises à jour lors de
00:03:59l'exécution sur macOS. En mars dernier, Ollama a été porté sur MLX pour Apple Silicon, qui est le framework d'apprentissage automatique d'Apple.
00:04:06Cela permet aux modèles de tirer pleinement parti de votre mémoire unifiée et permet à Ollama de
00:04:11tirer parti des accélérateurs neuronaux GPU pour accélérer à la fois le temps du premier jeton et la vitesse de génération. En gros, c'est
00:04:18plus rapide. Outre votre machine locale, Ollama peut également fonctionner dans Docker afin que vous puissiez exécuter vos propres services
00:04:24qui reposent sur des modèles locaux. La documentation inclut un guide complet sur l'utilisation d'Ollama dans un conteneur, soit en utilisant
00:04:30uniquement le CPU, soit avec des GPU NVIDIA et AMD. Ensuite, vous pouvez lancer le modèle dans Docker et même faire une requête cURL
00:04:37directement vers celui-ci. La référence API inclut également plusieurs autres points de terminaison que vous pouvez appeler. Maintenant, en comparant Ollama à
00:04:44d'autres outils, vLLM semble bien plus adapté à l'exécution de modèles en tant que services plutôt qu'en tant qu'outil CLI local
00:04:49et est nettement plus rapide pour les déploiements sur serveur grâce à toute une série d'améliorations des performances
00:04:54comme un service à la pointe de la technologie, une gestion efficace de la mémoire et la quantification. Donc, si vous
00:05:00exécutez un service hébergé, alors vLLM pourrait être le meilleur choix. LM Studio est beaucoup plus proche d'Ollama en termes
00:05:06de flux de travail locaux et est également livré avec une belle interface graphique. Cependant, je mentionnerais qu'Ollama possède son propre
00:05:12interface graphique officielle si c'est quelque chose qui vous intéresse. Il existe bien sûr des tonnes d'autres outils dans cet
00:05:17espace, comme AnythingLLM, sur lequel nous avons consacré une vidéo entière ici. Sinon, j'espère que vous avez trouvé ceci
00:05:22utile. J'étais Warren de Better Stack, merci d'avoir regardé et à la prochaine.

Key Takeaway

L'utilisation d'Ollama comme serveur local pour diriger Claude Code vers des modèles open source permet de supprimer les coûts d'API tout en accédant à une vaste bibliothèque de modèles, incluant Gemma et DeepSeek.

Highlights

  • Ollama permet d'exécuter des modèles open source comme Gemma, Qwen et DeepSeek au sein d'agents comme Claude Code en modifiant simplement les variables d'environnement de l'URL de base.

  • L'exécution de modèles en local via Ollama élimine les coûts associés à l'utilisation des API propriétaires.

  • Les performances dépendent de la VRAM disponible : moins de 24 Go limitent le contexte à 4K, tandis que plus de 48 Go permettent d'atteindre 256K de contexte.

  • L'intégration d'Ollama avec le framework MLX d'Apple Silicon optimise l'utilisation de la mémoire unifiée et des accélérateurs neuronaux GPU sur macOS.

  • Ollama fonctionne nativement dans Docker, permettant une gestion simplifiée sur CPU, GPU NVIDIA et GPU AMD.

  • vLLM offre des performances supérieures pour les déploiements de serveurs en tant que service, alors qu'Ollama privilégie les flux de travail locaux.

Timeline

Configuration d'Ollama avec Claude Code

  • La redirection des requêtes Claude Code vers un serveur Ollama s'effectue par la modification des variables d'environnement.
  • Cette méthode débloque l'accès à des centaines de modèles, incluant des variantes locales de Gemma et Qwen.
  • Le fonctionnement de l'agent reste identique, trompant l'interface qui croit interagir avec les modèles Anthropic originaux.

Ollama agit comme un serveur headless permettant aux outils d'ingénierie logicielle d'utiliser des modèles open source plutôt que des modèles propriétaires. En pointant l'URL de base vers l'instance Ollama locale, les utilisateurs conservent leurs flux de travail habituels tout en s'affranchissant des contraintes de facturation.

Exécution de modèles et analyse multimodale

  • L'interface CLI d'Ollama permet de lancer des agents ou de discuter directement avec des modèles comme Gemma 4.
  • Le téléchargement et l'exécution de modèles se font via des commandes simples comme 'ollama run'.
  • Gemma 4 démontre des capacités multimodales, permettant d'analyser des images directement dans le terminal.

L'outil gère nativement le téléchargement des modèles populaires. L'utilisateur peut interroger le système sur le contenu d'une image, comme l'identification et la description d'un chat tigré, en utilisant des commandes intégrées sans recours à des interfaces tiers.

Optimisation matérielle et déploiement

  • La capacité de contexte est proportionnelle à la VRAM, allant de 4K pour moins de 24 Go à 256K pour plus de 48 Go.
  • Le portage sur MLX permet une accélération significative sur les puces Apple Silicon.
  • Docker facilite l'intégration d'Ollama dans des services conteneurisés avec support CPU ou GPU.

La gestion de la mémoire est cruciale pour les performances en local. Si Ollama excelle dans les flux locaux, vLLM reste une alternative préférable pour les besoins de serveurs à haute performance grâce à ses techniques de quantification et de gestion mémoire avancées.

Community Posts

View all posts