스크립트
00:00:00Ollama ist ein Headless-LLM-Server mit über 176.000 Sternen auf GitHub, mit dem Sie offene Modelle ausführen können
00:00:06über jede App oder jeden Agenten, einschließlich Claude Code, Codex und sogar Open Claude. Sie können Ihre
00:00:12Tools auf Ollama richten, das sogar lokale Modelle verwaltet, oder Ihren Datenverkehr an gehostete Modelle in Claude
00:00:18Code weiterleiten. Sie können zum Beispiel einfach die Umgebungsvariable der Basis-URL ändern, um auf Ihren Ollama-
00:00:23Server zu verweisen. Jetzt funktioniert alles genau wie zuvor, aber Sie haben Zugriff auf Hunderte von
00:00:28Modellen anstelle von nur vier. Modelle wie GLM, DeepSeek und sogar lokale Modelle wie Gemma und Qwen sind alle
00:00:34verfügbar. Dies ist ein enormer Fortschritt, da Sie weiterhin alle Tools nutzen können, die Sie mögen, und zwar genau
00:00:38auf die gleiche Weise, aber jetzt haben Sie Zugriff auf jedes Modell, das Sie sich vorstellen können. Heute testen wir Ollama,
00:00:44wir werden versuchen, offene Modelle über Claude Code auszuführen und sehen, ob es sich gegenüber anderen Wettbewerbern lohnt,
00:00:50wie vLLM und LM Studio. Wenn wir die Ollama-CLI direkt starten, erhalten wir Optionen zum Starten anderer CLI-
00:01:01Tools wie Claude Code oder Open Code und können dann unser bevorzugtes Modell auswählen. Jetzt bin ich in Open
00:01:07Code, aber ich führe Gemma 4 über Ollama aus, und jetzt kann ich etwas tippen wie “Bist du bei Better
00:01:12Stack abonniert?”. Und wenn die Antwort nein lautet, warum abonnieren Sie dann nicht unter diesem Video? Wir müssen gar nicht über die
00:01:17Ollama-CLI gehen. Bei Claude Code können Sie zum Beispiel einfach die Umgebungsvariablen ändern, um auf
00:01:23Ollama zu verweisen, die Basis-URL und die Auth-Token ändern, und jetzt können Sie Claude Code direkt ausführen und auf
00:01:29welches Modell auch immer Sie möchten verweisen. Das Ergebnis ist, dass ich jetzt in Claude Code bin, ich kann es genau wie zuvor nutzen, aber
00:01:34jetzt führe ich es mit einem Open-Source-Modell aus. Sie können sogar Modelle direkt mit Ollama ausführen, wie zum Beispiel
00:01:40Gemma 4, das ein Multi-Modell ist. Ich kann ihm Fragen stellen, wie “Identifiziere, was in diesem Bild ist”, und Sie
00:01:46können sogar direkt in Ollamas Umgebung gehen, um mit Modellen wie Gemma zu chatten, sodass Sie kein Drittanbieter-
00:01:51Tool benötigen. Okay, wir sind hier im Terminal und ich tippe einfach “ollama”, um die CLI zu betreten,
00:01:57und Sie können hier sehen, dass wir eine Reihe von Optionen für verschiedene Agenten oder Umgebungen haben, die wir betreten könnten.
00:02:01Wir könnten einfach direkt damit chatten, aber in diesem Fall gebe ich einfach Claude Code ein, und Sie können auch sehen,
00:02:05dass das Standardmodell, das ich bereits heruntergeladen habe, Gemma 4 ist. Wir sind jetzt also in Claude Code und
00:02:11Sie sehen, wir sind auf Gemma 4. Mit hohem Aufwand steht dort “API-Nutzung Abrechnung”, aber da dies tatsächlich
00:02:17ein lokales Modell ist, kostet es uns überhaupt nichts. Wir können also eine Nachricht wie “Hallo” eingeben. Sobald ein Modell
00:02:23antwortet, können Sie immer noch sehen, dass es immer noch denkt, es sei Claude Code, obwohl es immer noch das Gemma
00:02:284-Modell ausführt. Also erhalten wir die Antwort: “Hallo, ich bin Claude Code, dein Assistent für alle Fragen der Softwareentwicklung”. Das
00:02:34bedeutet, Sie können jetzt einfach Claude Code genauso weiterverwenden wie zuvor, aber Sie haben es gewissermaßen ausgetrickst,
00:02:39denn anstatt Anthropic-Modelle zu verwenden, nutzen Sie tatsächlich ein lokales und Open-
00:02:44Source-Modell. Es gibt jetzt Unmengen anderer verfügbarer Modelle. Sie können hier auf ollama.com suchen.
00:02:49Wir haben die Optionen für sehr, sehr viele Modelle, einschließlich Dingen wie Qwen 3.6.
00:02:55Wir haben Minimax, ich bin sicher, wir haben, ja, die DeepSeek-Familie ist auch hier. Also im Grunde jedes populäre
00:03:01Modell, an das Sie denken können, wird verfügbar sein, und um dies auszuführen, können wir einfach einen Befehl wie
00:03:05“ollama run qwen 3.6” eingeben, und das wird, falls das Modell nicht heruntergeladen ist, beginnen, dieses Modell herunterzuladen. Also
00:03:11müssten Sie eine Weile warten, bis es heruntergeladen ist, aber sobald es verfügbar ist, können Sie es auf Ihrem
00:03:15Computer ausführen. Lassen Sie uns jetzt dieses Bilderkennungsskript ausprobieren, also kann ich sagen: “ollama run gemma 4”
00:03:20und dann in Anführungszeichen sagen: “Was ist in diesem Bild?”, und dann einfach auf ein Bild verweisen, das gerade
00:03:25zufällig in meinem Download-Ordner ist, und sofort, sehr schnell tatsächlich, erhalten wir eine Antwort und
00:03:29es wurde analysiert, und es sagt, dass eine Katze auf dem Bild ist, eine getigerte Katze. Die Pose und die Aktion,
00:03:35die Katze liegt, alles davon ist wahr, und das ist das Bild, gegen das die Erkennung durchgeführt wurde. Jetzt,
00:03:41Ihr verfügbarer Arbeitsspeicher und die Systemleistung sind beim Ausführen lokaler Modelle wirklich wichtig. Wenn Sie
00:03:45weniger als 24 Gigabyte VRAM haben, erhalten Sie nur 4K Kontext, 28 bis 48 GB VRAM bringen Ihnen 32K Kontext,
00:03:52und mehr als 48 GB VRAM bringen Ihnen 256K Kontext. Kürzlich hat Ollama auch riesige Updates vorgenommen, wenn
00:03:59es auf macOS läuft. Im März hat Ollama auf MLX für Apple Silicon portiert, welches Apples Machine-
00:04:06Learning-Framework ist. Dies ermöglicht es Modellen, Ihren Unified Memory voll auszunutzen und erlaubt Ollama, die
00:04:11GPU-Neuronen-Beschleuniger zu nutzen, um sowohl die Zeit bis zum ersten Token als auch die Generierungsgeschwindigkeit zu beschleunigen. Im Grunde ist es
00:04:18schneller. Neben Ihrem lokalen Computer kann Ollama auch in Docker ausgeführt werden, sodass Sie Ihre eigenen Dienste betreiben können,
00:04:24die auf lokalen Modellen basieren. Die Dokumentation enthält eine vollständige Anleitung zur Verwendung von Ollama in einem Container, entweder unter Verwendung
00:04:30nur der CPU oder mit NVIDIA- und AMD-GPUs. Dann können Sie das Modell in Docker starten und sogar Curl-Anfragen
00:04:37direkt an es senden. Die API-Referenz enthält auch verschiedene andere Endpunkte, die Sie aufrufen können. Wenn wir Ollama jetzt mit
00:04:44anderen Tools vergleichen, scheint vLLM weitaus besser geeignet zu sein, um Modelle als Dienste auszuführen, anstatt als lokales CLI-Tool,
00:04:49und ist aufgrund einer ganzen Reihe von Leistungsverbesserungen deutlich schneller für Serverbereitstellungen
00:04:54wie modernster Servierdurchsatz, effizientes Speichermanagement und Quantisierung. Also, wenn Sie
00:05:00einen gehosteten Dienst betreiben, dann ist vLLM vielleicht die bessere Wahl. LM Studio kommt Ollama in Bezug
00:05:06auf lokale Arbeitsabläufe viel näher und wird auch mit einer schönen GUI geliefert. Ich möchte jedoch erwähnen, dass Ollama seine eigene
00:05:12offizielle GUI hat, falls das etwas ist, an dem Sie interessiert sind. Es gibt natürlich jede Menge anderer Tools in diesem
00:05:17Bereich, wie z.B. Everything LLM, über das wir bereits ein ganzes Video gemacht haben. Ansonsten hoffe ich, dass Sie dies
00:05:22nützlich fanden. Ich war Warren von Better Stack, vielen Dank fürs Zuschauen und ich sehe Sie beim nächsten Mal.