Claude Code mit Ollama ausführen und 99% der KI-Kosten sparen

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Ollama ist ein Headless-LLM-Server mit über 176.000 Sternen auf GitHub, mit dem Sie offene Modelle ausführen können
00:00:06über jede App oder jeden Agenten, einschließlich Claude Code, Codex und sogar Open Claude. Sie können Ihre
00:00:12Tools auf Ollama richten, das sogar lokale Modelle verwaltet, oder Ihren Datenverkehr an gehostete Modelle in Claude
00:00:18Code weiterleiten. Sie können zum Beispiel einfach die Umgebungsvariable der Basis-URL ändern, um auf Ihren Ollama-
00:00:23Server zu verweisen. Jetzt funktioniert alles genau wie zuvor, aber Sie haben Zugriff auf Hunderte von
00:00:28Modellen anstelle von nur vier. Modelle wie GLM, DeepSeek und sogar lokale Modelle wie Gemma und Qwen sind alle
00:00:34verfügbar. Dies ist ein enormer Fortschritt, da Sie weiterhin alle Tools nutzen können, die Sie mögen, und zwar genau
00:00:38auf die gleiche Weise, aber jetzt haben Sie Zugriff auf jedes Modell, das Sie sich vorstellen können. Heute testen wir Ollama,
00:00:44wir werden versuchen, offene Modelle über Claude Code auszuführen und sehen, ob es sich gegenüber anderen Wettbewerbern lohnt,
00:00:50wie vLLM und LM Studio. Wenn wir die Ollama-CLI direkt starten, erhalten wir Optionen zum Starten anderer CLI-
00:01:01Tools wie Claude Code oder Open Code und können dann unser bevorzugtes Modell auswählen. Jetzt bin ich in Open
00:01:07Code, aber ich führe Gemma 4 über Ollama aus, und jetzt kann ich etwas tippen wie “Bist du bei Better
00:01:12Stack abonniert?”. Und wenn die Antwort nein lautet, warum abonnieren Sie dann nicht unter diesem Video? Wir müssen gar nicht über die
00:01:17Ollama-CLI gehen. Bei Claude Code können Sie zum Beispiel einfach die Umgebungsvariablen ändern, um auf
00:01:23Ollama zu verweisen, die Basis-URL und die Auth-Token ändern, und jetzt können Sie Claude Code direkt ausführen und auf
00:01:29welches Modell auch immer Sie möchten verweisen. Das Ergebnis ist, dass ich jetzt in Claude Code bin, ich kann es genau wie zuvor nutzen, aber
00:01:34jetzt führe ich es mit einem Open-Source-Modell aus. Sie können sogar Modelle direkt mit Ollama ausführen, wie zum Beispiel
00:01:40Gemma 4, das ein Multi-Modell ist. Ich kann ihm Fragen stellen, wie “Identifiziere, was in diesem Bild ist”, und Sie
00:01:46können sogar direkt in Ollamas Umgebung gehen, um mit Modellen wie Gemma zu chatten, sodass Sie kein Drittanbieter-
00:01:51Tool benötigen. Okay, wir sind hier im Terminal und ich tippe einfach “ollama”, um die CLI zu betreten,
00:01:57und Sie können hier sehen, dass wir eine Reihe von Optionen für verschiedene Agenten oder Umgebungen haben, die wir betreten könnten.
00:02:01Wir könnten einfach direkt damit chatten, aber in diesem Fall gebe ich einfach Claude Code ein, und Sie können auch sehen,
00:02:05dass das Standardmodell, das ich bereits heruntergeladen habe, Gemma 4 ist. Wir sind jetzt also in Claude Code und
00:02:11Sie sehen, wir sind auf Gemma 4. Mit hohem Aufwand steht dort “API-Nutzung Abrechnung”, aber da dies tatsächlich
00:02:17ein lokales Modell ist, kostet es uns überhaupt nichts. Wir können also eine Nachricht wie “Hallo” eingeben. Sobald ein Modell
00:02:23antwortet, können Sie immer noch sehen, dass es immer noch denkt, es sei Claude Code, obwohl es immer noch das Gemma
00:02:284-Modell ausführt. Also erhalten wir die Antwort: “Hallo, ich bin Claude Code, dein Assistent für alle Fragen der Softwareentwicklung”. Das
00:02:34bedeutet, Sie können jetzt einfach Claude Code genauso weiterverwenden wie zuvor, aber Sie haben es gewissermaßen ausgetrickst,
00:02:39denn anstatt Anthropic-Modelle zu verwenden, nutzen Sie tatsächlich ein lokales und Open-
00:02:44Source-Modell. Es gibt jetzt Unmengen anderer verfügbarer Modelle. Sie können hier auf ollama.com suchen.
00:02:49Wir haben die Optionen für sehr, sehr viele Modelle, einschließlich Dingen wie Qwen 3.6.
00:02:55Wir haben Minimax, ich bin sicher, wir haben, ja, die DeepSeek-Familie ist auch hier. Also im Grunde jedes populäre
00:03:01Modell, an das Sie denken können, wird verfügbar sein, und um dies auszuführen, können wir einfach einen Befehl wie
00:03:05“ollama run qwen 3.6” eingeben, und das wird, falls das Modell nicht heruntergeladen ist, beginnen, dieses Modell herunterzuladen. Also
00:03:11müssten Sie eine Weile warten, bis es heruntergeladen ist, aber sobald es verfügbar ist, können Sie es auf Ihrem
00:03:15Computer ausführen. Lassen Sie uns jetzt dieses Bilderkennungsskript ausprobieren, also kann ich sagen: “ollama run gemma 4”
00:03:20und dann in Anführungszeichen sagen: “Was ist in diesem Bild?”, und dann einfach auf ein Bild verweisen, das gerade
00:03:25zufällig in meinem Download-Ordner ist, und sofort, sehr schnell tatsächlich, erhalten wir eine Antwort und
00:03:29es wurde analysiert, und es sagt, dass eine Katze auf dem Bild ist, eine getigerte Katze. Die Pose und die Aktion,
00:03:35die Katze liegt, alles davon ist wahr, und das ist das Bild, gegen das die Erkennung durchgeführt wurde. Jetzt,
00:03:41Ihr verfügbarer Arbeitsspeicher und die Systemleistung sind beim Ausführen lokaler Modelle wirklich wichtig. Wenn Sie
00:03:45weniger als 24 Gigabyte VRAM haben, erhalten Sie nur 4K Kontext, 28 bis 48 GB VRAM bringen Ihnen 32K Kontext,
00:03:52und mehr als 48 GB VRAM bringen Ihnen 256K Kontext. Kürzlich hat Ollama auch riesige Updates vorgenommen, wenn
00:03:59es auf macOS läuft. Im März hat Ollama auf MLX für Apple Silicon portiert, welches Apples Machine-
00:04:06Learning-Framework ist. Dies ermöglicht es Modellen, Ihren Unified Memory voll auszunutzen und erlaubt Ollama, die
00:04:11GPU-Neuronen-Beschleuniger zu nutzen, um sowohl die Zeit bis zum ersten Token als auch die Generierungsgeschwindigkeit zu beschleunigen. Im Grunde ist es
00:04:18schneller. Neben Ihrem lokalen Computer kann Ollama auch in Docker ausgeführt werden, sodass Sie Ihre eigenen Dienste betreiben können,
00:04:24die auf lokalen Modellen basieren. Die Dokumentation enthält eine vollständige Anleitung zur Verwendung von Ollama in einem Container, entweder unter Verwendung
00:04:30nur der CPU oder mit NVIDIA- und AMD-GPUs. Dann können Sie das Modell in Docker starten und sogar Curl-Anfragen
00:04:37direkt an es senden. Die API-Referenz enthält auch verschiedene andere Endpunkte, die Sie aufrufen können. Wenn wir Ollama jetzt mit
00:04:44anderen Tools vergleichen, scheint vLLM weitaus besser geeignet zu sein, um Modelle als Dienste auszuführen, anstatt als lokales CLI-Tool,
00:04:49und ist aufgrund einer ganzen Reihe von Leistungsverbesserungen deutlich schneller für Serverbereitstellungen
00:04:54wie modernster Servierdurchsatz, effizientes Speichermanagement und Quantisierung. Also, wenn Sie
00:05:00einen gehosteten Dienst betreiben, dann ist vLLM vielleicht die bessere Wahl. LM Studio kommt Ollama in Bezug
00:05:06auf lokale Arbeitsabläufe viel näher und wird auch mit einer schönen GUI geliefert. Ich möchte jedoch erwähnen, dass Ollama seine eigene
00:05:12offizielle GUI hat, falls das etwas ist, an dem Sie interessiert sind. Es gibt natürlich jede Menge anderer Tools in diesem
00:05:17Bereich, wie z.B. Everything LLM, über das wir bereits ein ganzes Video gemacht haben. Ansonsten hoffe ich, dass Sie dies
00:05:22nützlich fanden. Ich war Warren von Better Stack, vielen Dank fürs Zuschauen und ich sehe Sie beim nächsten Mal.

핵심 요약

Durch die Umleitung von Claude Code auf lokale Ollama-Instanzen lassen sich Anthropic-API-Kosten vollständig einsparen, während die gewohnte Entwicklungsumgebung erhalten bleibt.

하이라이트

  • Ollama fungiert als Headless-LLM-Server für über 176.000 Sterne auf GitHub, der die Nutzung lokaler Open-Source-Modelle ermöglicht.

  • Durch das Ändern der Basis-URL-Umgebungsvariable lassen sich Tools wie Claude Code direkt mit Ollama verbinden, was API-Kosten eliminiert.

  • Der verfügbare Arbeitsspeicher begrenzt den Kontext: Unter 24 GB VRAM erlauben 4K Kontext, während über 48 GB VRAM 256K Kontext ermöglichen.

  • Die Portierung auf MLX im März erlaubt Ollama die direkte Nutzung von Apples GPU-Neuronen-Beschleunigern auf macOS.

  • Ollama unterstützt eine Vielzahl von Modellen wie Gemma 4, Qwen 3.6 und die DeepSeek-Familie direkt über die Kommandozeile.

타임라인

Grundlagen von Ollama und Claude Code

  • Ollama verwaltet lokale und gehostete Modelle als zentraler Server.
  • Umgebungsvariablen leiten den Datenverkehr von Tools wie Claude Code direkt auf lokale Ollama-Instanzen um.
  • Der Zugriff auf Open-Source-Modelle wie Gemma oder Qwen ersetzt teure kommerzielle API-Aufrufe.

Ollama ermöglicht die Ausführung offener Modelle hinter einer standardisierten Schnittstelle. Entwickler müssen lediglich die Basis-URL und das Auth-Token anpassen, um Claude Code mit lokaler Infrastruktur zu betreiben. Dies bewahrt die gewohnten Arbeitsabläufe bei gleichzeitiger Nutzung hunderter alternativer Modellarchitekturen.

Praktische Anwendung und Modellvielfalt

  • Claude Code erkennt das lokal laufende Modell als Assistenten an.
  • Bilderkennungsmodelle wie Gemma 4 analysieren lokale Dateien ohne Drittanbieter-Cloud-Anbindung.
  • Der Befehl 'ollama run' lädt und startet populäre Modelle wie Qwen 3.6 automatisch.

Die Einbindung von Claude Code mit Ollama täuscht dem Tool eine Standardumgebung vor, während tatsächlich lokale Rechenleistung genutzt wird. Dies ermöglicht die Analyse von Bildern und Texten durch Modelle wie Gemma 4 direkt auf der eigenen Maschine. Die Bibliothek auf ollama.com bietet schnellen Zugriff auf eine breite Palette an Open-Source-Modellen.

Systemanforderungen und Performance

  • Die Kontextlänge skaliert direkt mit dem verfügbaren VRAM von 4K bei 24 GB bis 256K bei 48 GB.
  • Apple Silicon profitiert von der Integration des MLX-Frameworks für schnellere Token-Generierung.
  • vLLM ist für serverbasierte Dienste performanter, während LM Studio eine grafische Benutzeroberfläche für lokale Arbeitsabläufe bietet.

Lokale LLMs sind stark von der Hardware-Ausstattung abhängig. Besonders auf macOS sorgt die Nutzung von Apples Unified Memory für signifikante Geschwindigkeitsvorteile. Während Ollama als CLI-Tool für lokale Workflows glänzt, bieten Alternativen wie vLLM Vorteile bei der Bereitstellung von Modellen als skalierbare Serverdienste.

커뮤니티 글

모든 글 보기