스크립트
00:00:00Ollama est un serveur de modèles headless comptant plus de 176 000 étoiles sur GitHub qui vous permet d'exécuter des modèles ouverts
00:00:06via n'importe quelle application ou agent, notamment Claude Code, Codex et même Open Claude. Vous pouvez pointer vos
00:00:12outils vers Ollama, qui gère même les modèles locaux, ou diriger votre trafic vers des modèles hébergés dans Claude
00:00:18Code. Par exemple, vous pouvez simplement changer la variable d'environnement de l'URL de base pour pointer vers votre serveur
00:00:23Ollama. Maintenant, tout fonctionne exactement comme avant, mais vous avez débloqué l'accès à des centaines de
00:00:28modèles au lieu de quatre. Des modèles comme GLM, DeepSeek et même des modèles locaux comme Gemma et Qwen sont tous
00:00:34disponibles. C'est une avancée majeure car vous pouvez continuer à utiliser tous vos outils préférés exactement
00:00:38de la même manière, mais vous avez maintenant accès à tous les modèles imaginables. Aujourd'hui, nous allons tester Ollama,
00:00:44essayer d'exécuter des modèles ouverts via Claude Code et voir s'il vaut mieux l'utiliser que d'autres concurrents
00:00:50comme vLLM et LM Studio. Lorsque nous lançons l'interface CLI d'Ollama directement, elle nous donne des options pour lancer d'autres outils CLI
00:01:01comme Claude Code ou Open Code, puis nous pouvons sélectionner notre modèle préféré. Maintenant, je suis dans Open
00:01:07Code, mais j'exécute Gemma 4 via Ollama et maintenant je peux taper quelque chose comme “es-tu abonné à Better
00:01:12Stack ?” et si la réponse est non, alors pourquoi ne pas vous abonner sous cette vidéo ? Nous n'avons même pas besoin de passer par
00:01:17l'interface CLI d'Ollama du tout avec Claude Code par exemple. Vous pouvez simplement changer les variables d'environnement pour pointer vers
00:01:23Ollama, en modifiant l'URL de base et les jetons, et maintenant vous pouvez lancer Claude Code directement en le pointant vers
00:01:29le modèle de votre choix. Le résultat est que je suis maintenant dans Claude Code, je peux l'utiliser exactement comme avant mais
00:01:34maintenant je l'exécute avec un modèle open source. Vous pouvez même exécuter des modèles directement avec Ollama, comme exécuter
00:01:40Gemma 4 qui est un modèle multimodal. Je peux lui poser des questions pour identifier ce qu'il y a dans une image et vous
00:01:46pouvez même entrer directement dans le système d'Ollama pour discuter avec des modèles comme Gemma sans avoir besoin d'aucun outil
00:01:51tiers. OK, donc nous sommes dans le terminal ici et je vais juste taper “ollama” pour entrer dans l'interface CLI
00:01:57et vous pouvez voir ici que nous avons un tas d'options de différents agents ou interfaces dans lesquels nous pourrions entrer.
00:02:01Nous pourrions simplement discuter directement avec lui, mais dans ce cas, je vais juste entrer dans Claude Code et vous pouvez voir
00:02:05aussi que le modèle par défaut, que j'ai déjà téléchargé, est Gemma 4. Donc maintenant, nous sommes dans Claude Code et
00:02:11vous pouvez voir que nous sommes sur Gemma 4 avec un effort élevé. Il mentionne la facturation de l'utilisation de l'API, mais comme il s'agit en fait
00:02:17d'un modèle local, cela ne nous coûtera absolument rien. Nous pouvons donc taper un message comme “bonjour”. Une fois que le modèle
00:02:23répond, vous pouvez toujours voir qu'il pense toujours qu'il s'agit de Claude Code, alors qu'il exécute toujours le modèle Gemma
00:02:284, donc nous obtenons la réponse : “bonjour, je suis Claude Code, votre assistant pour tout ce qui concerne l'ingénierie logicielle”. Donc
00:02:34cela signifie que vous pouvez maintenant simplement continuer à utiliser Claude Code exactement comme avant, mais vous l'avez piégé
00:02:39d'une certaine manière car au lieu d'utiliser les modèles d'Anthropic, vous utilisez en fait un modèle local et open
00:02:44source. Maintenant, il y a des tonnes d'autres modèles disponibles. Vous pouvez voir ici sur [ollama.com/search](https://www.google.com/search?q=https%3A%2F%2Follama.com%2Fsearch)
00:02:49que nous avons le choix parmi de très nombreux modèles, y compris des choses comme Qwen 3.6.
00:02:55Nous avons MiniMax, je suis sûr que nous avons... oui, la famille DeepSeek est là aussi, donc pratiquement n'importe quel modèle populaire
00:03:01auquel vous pouvez penser sera disponible. Et pour l'exécuter, nous pouvons simplement taper une commande comme
00:03:05ollama run qwen 3.6 et cela commencera à télécharger le modèle s'il n'est pas déjà téléchargé. Donc
00:03:11vous devrez attendre un moment pour qu'il se télécharge, mais une fois disponible, vous pourrez alors l'exécuter sur votre
00:03:15machine. Maintenant, testons ce script de détection d'image. Je peux dire “ollama run gemma 4”
00:03:20et ensuite, entre guillemets, nous disons “qu'y a-t-il dans cette image ?” et nous le pointons vers une image qui
00:03:25se trouve justement dans mon dossier de téléchargements. Immédiatement et très rapidement, en fait, nous obtenons une réponse et
00:03:29il l'a analysée et il dit qu'il y a un chat sur l'image, c'est un chat tigré, la pose et l'action,
00:03:35le chat est allongé. Tout cela est vrai et c'est l'image qu'il a utilisée pour la détection. Maintenant,
00:03:41votre mémoire disponible et les performances du système sont vraiment importantes lors de l'exécution de modèles locaux. Si vous avez
00:03:45moins de 24 Go de VRAM, vous obtiendrez seulement 4K de contexte. 28 à 48 Go de VRAM vous donnent 32K de contexte
00:03:52et plus de 48 Go de VRAM vous donnent 256K de contexte. Récemment, Ollama a également fait d'énormes mises à jour lors de
00:03:59l'exécution sur macOS. En mars dernier, Ollama a été porté sur MLX pour Apple Silicon, qui est le framework d'apprentissage automatique d'Apple.
00:04:06Cela permet aux modèles de tirer pleinement parti de votre mémoire unifiée et permet à Ollama de
00:04:11tirer parti des accélérateurs neuronaux GPU pour accélérer à la fois le temps du premier jeton et la vitesse de génération. En gros, c'est
00:04:18plus rapide. Outre votre machine locale, Ollama peut également fonctionner dans Docker afin que vous puissiez exécuter vos propres services
00:04:24qui reposent sur des modèles locaux. La documentation inclut un guide complet sur l'utilisation d'Ollama dans un conteneur, soit en utilisant
00:04:30uniquement le CPU, soit avec des GPU NVIDIA et AMD. Ensuite, vous pouvez lancer le modèle dans Docker et même faire une requête cURL
00:04:37directement vers celui-ci. La référence API inclut également plusieurs autres points de terminaison que vous pouvez appeler. Maintenant, en comparant Ollama à
00:04:44d'autres outils, vLLM semble bien plus adapté à l'exécution de modèles en tant que services plutôt qu'en tant qu'outil CLI local
00:04:49et est nettement plus rapide pour les déploiements sur serveur grâce à toute une série d'améliorations des performances
00:04:54comme un service à la pointe de la technologie, une gestion efficace de la mémoire et la quantification. Donc, si vous
00:05:00exécutez un service hébergé, alors vLLM pourrait être le meilleur choix. LM Studio est beaucoup plus proche d'Ollama en termes
00:05:06de flux de travail locaux et est également livré avec une belle interface graphique. Cependant, je mentionnerais qu'Ollama possède son propre
00:05:12interface graphique officielle si c'est quelque chose qui vous intéresse. Il existe bien sûr des tonnes d'autres outils dans cet
00:05:17espace, comme AnythingLLM, sur lequel nous avons consacré une vidéo entière ici. Sinon, j'espère que vous avez trouvé ceci
00:05:22utile. J'étais Warren de Better Stack, merci d'avoir regardé et à la prochaine.