99% सस्ते AI के लिए Ollama के साथ Claude Code चलाएं

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Ollama एक हेडलैस LLM सर्वर है जिसके GitHub पर 1,76,000 से अधिक स्टार्स हैं, जो आपको ओपन मॉडल्स चलाने की सुविधा देता है
00:00:06किसी भी ऐप या एजेंट के माध्यम से, जिसमें Claude Code, Codex और यहाँ तक कि Open Claude भी शामिल हैं, आप अपने
00:00:12टूल्स को Ollama की ओर निर्देशित कर सकते हैं, जो स्थानीय मॉडल्स को मैनेज करता है या Claude में होस्ट किए गए मॉडल्स पर ट्रैफिक रूट करता है
00:00:18उदाहरण के लिए, Claude Code में आप बस बेस URL एनवायरनमेंट वेरिएबल को अपने Ollama सर्वर पर पॉइंट करने के लिए बदल सकते हैं
00:00:23अब सब कुछ पहले की तरह ही काम करता है, लेकिन आपने सैकड़ों मॉडल्स तक पहुंच अनलॉक कर ली है
00:00:28चार मॉडल्स के बजाय, GLM, DeepSeek और यहाँ तक कि Gemma और Qwen जैसे स्थानीय मॉडल्स सभी उपलब्ध हैं
00:00:34यह एक बहुत बड़ी उपलब्धि है क्योंकि आप अपने पसंदीदा सभी टूल्स का उपयोग बिल्कुल उसी तरह जारी रख सकते हैं
00:00:38लेकिन अब आपने उन सभी मॉडल्स तक पहुंच बना ली है जिनके बारे में आप सोच सकते हैं, आज हम Ollama का परीक्षण करेंगे
00:00:44हम Claude Code के माध्यम से ओपन मॉडल्स चलाकर देखेंगे कि क्या यह अन्य प्रतिस्पर्धियों की तुलना में उपयोग करने लायक है
00:00:50जैसे कि vLLM और LM Studio, जब हम Ollama CLI को सीधे लॉन्च करते हैं, तो यह हमें अन्य CLI टूल्स लॉन्च करने के विकल्प देता है
00:01:01जैसे कि Claude Code या Open Code, फिर अपने पसंदीदा मॉडल को चुनने में सक्षम होना, अब मैं Open Code के अंदर हूँ
00:01:07लेकिन मैं Ollama के ज़रिए Gemma 4 चला रहा हूँ और अब मैं कुछ ऐसा टाइप कर सकता हूँ कि क्या आप Better Stack को सब्सक्राइब किए हुए हैं
00:01:12और अगर जवाब नहीं है, तो इस वीडियो के नीचे सब्सक्राइब क्यों नहीं करते? हमें Ollama CLI के ज़रिए जाने की भी ज़रूरत नहीं है
00:01:17Claude Code के साथ, उदाहरण के लिए, आप बस एनवायरनमेंट वेरिएबल्स को Ollama की ओर पॉइंट करने के लिए बदल सकते हैं
00:01:23बेस URL और Auth टोकन को बदलकर और अब आप Claude Code को सीधे उस मॉडल पर पॉइंट करके चला सकते हैं
00:01:29जो आप चाहते हैं, परिणाम यह है कि अब मैं Claude Code के अंदर हूँ, मैं इसे बिल्कुल पहले की तरह उपयोग कर सकता हूँ लेकिन
00:01:34अब मैं इसे एक ओपन सोर्स मॉडल के साथ चला रहा हूँ, आप Ollama के साथ सीधे मॉडल्स भी चला सकते हैं जैसे कि
00:01:40Gemma 4 चलाना, जो एक मल्टी-मॉडल है, मैं इससे सवाल पूछ सकता हूँ जैसे कि इमेज के अंदर क्या है, और आप
00:01:46Gemma जैसे मॉडल्स से चैट करने के लिए सीधे Ollama के हार्नेस में भी जा सकते हैं, इसलिए आपको किसी थर्ड
00:01:51पार्टी टूल की बिल्कुल भी ज़रूरत नहीं है, ठीक है तो हम टर्मिनल में हैं और मैं CLI में प्रवेश करने के लिए बस ollama टाइप करूँगा
00:01:57और आप यहाँ देख सकते हैं कि हमारे पास विभिन्न एजेंट्स या हार्नेस के कई विकल्प हैं जिनमें हम प्रवेश कर सकते हैं
00:02:01हम सीधे चैट भी कर सकते हैं, लेकिन इस मामले में मैं बस Claude Code में प्रवेश करूँगा और आप देख सकते हैं
00:02:05यह भी कि डिफ़ॉल्ट मॉडल जिसे मैंने पहले ही डाउनलोड कर लिया है, वह Gemma 4 है, तो अब हम Claude Code के अंदर हैं और
00:02:11आप देख सकते हैं कि हम Gemma 4 पर हैं, इसमें API यूसेज बिलिंग लिखा है, लेकिन क्योंकि यह वास्तव में
00:02:17एक स्थानीय मॉडल है, तो इसमें हमारी कोई लागत नहीं आएगी, इसलिए हम “hello” जैसा मैसेज टाइप कर सकते हैं, तो एक बार जब मॉडल
00:02:23जवाब देता है, तो आप देख सकते हैं कि यह अभी भी सोचता है कि यह Claude Code है, सिवाय इसके कि यह Gemma
00:02:284 मॉडल चला रहा है, इसलिए हमें जवाब मिलता है, “हेलो, मैं Claude Code हूँ, सॉफ्टवेयर इंजीनियरिंग की सभी चीज़ों के लिए आपका असिस्टेंट”, तो
00:02:34इसका मतलब है कि अब आप बस Claude Code का उपयोग बिल्कुल वैसे ही जारी रख सकते हैं जैसे आप पहले करते थे, लेकिन आपने इसे
00:02:39एक तरह से धोखा दिया है क्योंकि एंथ्रोपिक के मॉडल्स का उपयोग करने के बजाय, आप वास्तव में एक स्थानीय और ओपन
00:02:44सोर्स मॉडल का उपयोग कर रहे हैं, अब बहुत सारे अन्य मॉडल्स उपलब्ध हैं, आप यहाँ ollama.com सर्च पर देख सकते हैं
00:02:49हमारे पास Qwen 3.6 जैसी चीज़ों सहित बहुत सारे मॉडल्स के विकल्प हैं
00:02:55हमारे पास Minimax है, मुझे यकीन है कि हाँ, DeepSeek परिवार भी यहाँ है, तो मूल रूप से कोई भी लोकप्रिय
00:03:01मॉडल जिसके बारे में आप सोच सकते हैं वह उपलब्ध होने वाला है और इसे चलाने के लिए हम बस एक कमांड टाइप कर सकते हैं जैसे
00:03:05ollama run qwen 3.6 और फिर अगर मॉडल डाउनलोड नहीं है तो यह उस मॉडल को डाउनलोड करना शुरू कर देगा, इसलिए
00:03:11आपको उसे डाउनलोड करने के लिए थोड़ी देर इंतजार करना होगा, लेकिन एक बार उपलब्ध होने के बाद आप इसे अपनी
00:03:15मशीन पर चला सकते हैं, अब आइए उस इमेज डिटेक्शन स्क्रिप्ट को देखें, तो मैं कह सकता हूँ ollama run gemma 4
00:03:20और फिर कोट्स के अंदर हम कहते हैं “इस इमेज के अंदर क्या है” और फिर इसे बस एक ऐसी इमेज पर पॉइंट करें जो
00:03:25मेरे डाउनलोड्स फोल्डर में है और फिर सीधे, बहुत जल्दी हमें एक जवाब मिलता है और
00:03:29इसने इसका विश्लेषण किया है और यह कहता है कि इमेज में एक बिल्ली है, यह एक टैबी बिल्ली है, मुद्रा और क्रिया
00:03:35बिल्ली लेटी हुई है, यह सब सच है और यह वह इमेज है जिसके खिलाफ इसने डिटेक्शन किया, अब
00:03:41स्थानीय मॉडल्स चलाते समय आपकी उपलब्ध मेमोरी और सिस्टम प्रदर्शन वास्तव में मायने रखता है, यदि आपके पास
00:03:4524 गीगाबाइट से कम VRAM है तो आपको केवल 4k कॉन्टेक्स्ट मिलेगा, 28 से 48 गीग VRAM आपको 32k कॉन्टेक्स्ट देता है
00:03:52और 48 गीग VRAM से अधिक आपको 256k कॉन्टेक्स्ट मिलता है, हाल ही में Ollama ने बड़े अपडेट भी किए हैं जब
00:03:59Mac OS पर चल रहे हों, मार्च में Ollama को Apple सिलिकॉन के लिए MLX पर पोर्ट किया गया, जो Apple का मशीन
00:04:06लर्निंग फ्रेमवर्क है, यह मॉडल्स को आपकी यूनिफाइड मेमोरी का पूरा लाभ उठाने की अनुमति देता है और Ollama को
00:04:11GPU न्यूरल एक्सेलरेटर का लाभ उठाने देता है ताकि फर्स्ट टोकन और जनरेशन की गति दोनों को तेज किया जा सके, मूल रूप से यह
00:04:18तेज़ है, आपकी स्थानीय मशीन के अलावा Ollama Docker के अंदर भी चल सकता है ताकि आप अपनी सेवाएं चला सकें
00:04:24जो स्थानीय मॉडल्स पर निर्भर करती हैं, डॉक्स में कंटेनर के अंदर Ollama का उपयोग करने के लिए एक पूर्ण गाइड शामिल है, या तो
00:04:30केवल CPU या NVIDIA और AMD GPU के साथ, फिर आप Docker के अंदर मॉडल लॉन्च कर सकते हैं और यहाँ तक कि cURL रिक्वेस्ट भी कर सकते हैं
00:04:37सीधे इसे, API रेफरेंस में कई अन्य एंडपॉइंट्स भी शामिल हैं जिन्हें आप कॉल कर सकते हैं, अब Ollama की तुलना में
00:04:44अन्य टूल्स की तुलना में, vLLM स्थानीय CLI टूल के बजाय सेवाओं के रूप में मॉडल्स चलाने के लिए कहीं अधिक उपयुक्त लगता है
00:04:49और प्रदर्शन में सुधारों की पूरी श्रृंखला के कारण सर्वर परिनियोजन के लिए काफी तेज़ है
00:04:54जैसे कि अत्याधुनिक सर्विंग थ्रूपुट, कुशल मेमोरी प्रबंधन और क्वांटाइजेशन, तो यदि आप
00:05:00एक होस्टेड सेवा चला रहे हैं, तो vLLM बेहतर विकल्प हो सकता है, LM Studio स्थानीय वर्कफ़्लो के मामले में Ollama के बहुत करीब है
00:05:06और एक सुंदर GUI के साथ भी आता है, हालाँकि मैं उल्लेख करूँगा कि Ollama का अपना
00:05:12आधिकारिक GUI है यदि आप इसमें रुचि रखते हैं, तो इस क्षेत्र में निश्चित रूप से अन्य टूल्स भी हैं
00:05:17जैसे कि AnythingLLM, जिस पर हमने यहाँ पूरा वीडियो बनाया है, अन्यथा मुझे आशा है कि आपको यह
00:05:22उपयोगी लगा, मैं Better Stack से वॉरेन हूँ, देखने के लिए धन्यवाद और मैं आपसे अगली बार मिलूँगा

핵심 요약

Claude Code के एनवायरनमेंट वेरिएबल्स को Ollama सर्वर पर पॉइंट करके, एंथ्रोपिक के बजाय स्थानीय ओपन-सोर्स मॉडल्स का उपयोग बिना किसी API लागत के किया जा सकता है।

하이라이트

  • Ollama पर बेस URL और Auth टोकन एनवायरनमेंट वेरिएबल्स को कॉन्फ़िगर करके Claude Code को स्थानीय ओपन-सोर्स मॉडल्स पर चलाया जा सकता है।

  • Gemma 4, DeepSeek, Qwen 3.6 और Minimax जैसे कई लोकप्रिय ओपन-सोर्स मॉडल्स Ollama के माध्यम से स्थानीय मशीन पर उपलब्ध हैं।

  • 24GB से कम VRAM पर 4k कॉन्टेक्स्ट मिलता है, जबकि 48GB से अधिक VRAM पर 256k कॉन्टेक्स्ट का उपयोग संभव है।

  • Apple सिलिकॉन पर Ollama का MLX फ्रेमवर्क के साथ एकीकरण यूनिफाइड मेमोरी का लाभ उठाकर टोकन जनरेशन की गति को बढ़ाता है।

  • Ollama का उपयोग Docker कंटेनर्स के अंदर CPU, NVIDIA GPU या AMD GPU के साथ सर्वर-साइड चलाने के लिए किया जा सकता है।

타임라인

Ollama के साथ Claude Code को जोड़ना

  • Claude Code के एनवायरनमेंट वेरिएबल्स बदलकर इसे Ollama सर्वर से जोड़ा जा सकता है।
  • स्थानीय मॉडल्स चलाने से API उपयोग बिलिंग समाप्त हो जाती है।
  • Gemma 4 जैसे मल्टी-मॉडल स्थानीय वातावरण में इमेज डिटेक्शन के कार्य कर सकते हैं।

Ollama एक हेडलैस LLM सर्वर है जो ओपन मॉडल्स को मैनेज करता है। Claude Code में बेस URL और Auth टोकन को Ollama सर्वर की ओर पॉइंट करने से, टूल के इंटरफेस को बदले बिना ओपन-सोर्स मॉडल्स का उपयोग किया जा सकता है। यह सेटअप स्थानीय मशीन पर Gemma 4 जैसे मॉडल्स को चलाने की अनुमति देता है, जो बिल्ली की पहचान करने जैसे इमेज एनालिसिस कार्य करने में सक्षम हैं।

सिस्टम प्रदर्शन और हार्डवेयर आवश्यकताएं

  • उपलब्ध VRAM सीधे मॉडल के कॉन्टेक्स्ट विंडो को निर्धारित करती है।
  • Apple सिलिकॉन पर MLX फ्रेमवर्क का उपयोग करने से प्रदर्शन में सुधार होता है।
  • Ollama CLI के माध्यम से विभिन्न मॉडल्स को कमांड द्वारा आसानी से डाउनलोड और रन किया जा सकता है।

स्थानीय मॉडल्स की क्षमता हार्डवेयर मेमोरी पर निर्भर है। 24GB VRAM से कम पर 4k कॉन्टेक्स्ट, 28-48GB पर 32k, और 48GB से ऊपर 256k कॉन्टेक्स्ट का समर्थन मिलता है। Apple सिलिकॉन पर MLX फ्रेमवर्क का पोर्टिंग GPU न्यूरल एक्सेलरेटर का उपयोग करता है, जिससे फर्स्ट टोकन जनरेशन और कुल प्रोसेसिंग गति तेज हो जाती है।

Docker एकीकरण और अन्य विकल्प

  • Ollama को Docker कंटेनर के अंदर CPU या GPU के साथ चलाया जा सकता है।
  • vLLM सर्वर-साइड परिनियोजन और थ्रूपुट के लिए अधिक कुशल है।
  • LM Studio स्थानीय वर्कफ़्लो के लिए GUI के साथ एक विकल्प प्रदान करता है।

Docker के माध्यम से Ollama को कंटेनरीकृत सेवाओं में शामिल किया जा सकता है, जो cURL रिक्वेस्ट के जरिए API कॉल का समर्थन करता है। व्यावसायिक सर्वर परिनियोजन के लिए vLLM बेहतर थ्रूपुट और मेमोरी प्रबंधन प्रदान करता है, जबकि स्थानीय GUI अनुभव के लिए LM Studio और AnythingLLM जैसे उपकरण मौजूद हैं।

커뮤니티 글

모든 글 보기