99% सस्ते AI के लिए Ollama के साथ Claude Code चलाएं
BBetter Stack
Computing/SoftwareInternet Technology
Transcript
00:00:00Ollama एक हेडलैस LLM सर्वर है जिसके GitHub पर 1,76,000 से अधिक स्टार्स हैं, जो आपको ओपन मॉडल्स चलाने की सुविधा देता है
00:00:06किसी भी ऐप या एजेंट के माध्यम से, जिसमें Claude Code, Codex और यहाँ तक कि Open Claude भी शामिल हैं, आप अपने
00:00:12टूल्स को Ollama की ओर निर्देशित कर सकते हैं, जो स्थानीय मॉडल्स को मैनेज करता है या Claude में होस्ट किए गए मॉडल्स पर ट्रैफिक रूट करता है
00:00:18उदाहरण के लिए, Claude Code में आप बस बेस URL एनवायरनमेंट वेरिएबल को अपने Ollama सर्वर पर पॉइंट करने के लिए बदल सकते हैं
00:00:23अब सब कुछ पहले की तरह ही काम करता है, लेकिन आपने सैकड़ों मॉडल्स तक पहुंच अनलॉक कर ली है
00:00:28चार मॉडल्स के बजाय, GLM, DeepSeek और यहाँ तक कि Gemma और Qwen जैसे स्थानीय मॉडल्स सभी उपलब्ध हैं
00:00:34यह एक बहुत बड़ी उपलब्धि है क्योंकि आप अपने पसंदीदा सभी टूल्स का उपयोग बिल्कुल उसी तरह जारी रख सकते हैं
00:00:38लेकिन अब आपने उन सभी मॉडल्स तक पहुंच बना ली है जिनके बारे में आप सोच सकते हैं, आज हम Ollama का परीक्षण करेंगे
00:00:44हम Claude Code के माध्यम से ओपन मॉडल्स चलाकर देखेंगे कि क्या यह अन्य प्रतिस्पर्धियों की तुलना में उपयोग करने लायक है
00:00:50जैसे कि vLLM और LM Studio, जब हम Ollama CLI को सीधे लॉन्च करते हैं, तो यह हमें अन्य CLI टूल्स लॉन्च करने के विकल्प देता है
00:01:01जैसे कि Claude Code या Open Code, फिर अपने पसंदीदा मॉडल को चुनने में सक्षम होना, अब मैं Open Code के अंदर हूँ
00:01:07लेकिन मैं Ollama के ज़रिए Gemma 4 चला रहा हूँ और अब मैं कुछ ऐसा टाइप कर सकता हूँ कि क्या आप Better Stack को सब्सक्राइब किए हुए हैं
00:01:12और अगर जवाब नहीं है, तो इस वीडियो के नीचे सब्सक्राइब क्यों नहीं करते? हमें Ollama CLI के ज़रिए जाने की भी ज़रूरत नहीं है
00:01:17Claude Code के साथ, उदाहरण के लिए, आप बस एनवायरनमेंट वेरिएबल्स को Ollama की ओर पॉइंट करने के लिए बदल सकते हैं
00:01:23बेस URL और Auth टोकन को बदलकर और अब आप Claude Code को सीधे उस मॉडल पर पॉइंट करके चला सकते हैं
00:01:29जो आप चाहते हैं, परिणाम यह है कि अब मैं Claude Code के अंदर हूँ, मैं इसे बिल्कुल पहले की तरह उपयोग कर सकता हूँ लेकिन
00:01:34अब मैं इसे एक ओपन सोर्स मॉडल के साथ चला रहा हूँ, आप Ollama के साथ सीधे मॉडल्स भी चला सकते हैं जैसे कि
00:01:40Gemma 4 चलाना, जो एक मल्टी-मॉडल है, मैं इससे सवाल पूछ सकता हूँ जैसे कि इमेज के अंदर क्या है, और आप
00:01:46Gemma जैसे मॉडल्स से चैट करने के लिए सीधे Ollama के हार्नेस में भी जा सकते हैं, इसलिए आपको किसी थर्ड
00:01:51पार्टी टूल की बिल्कुल भी ज़रूरत नहीं है, ठीक है तो हम टर्मिनल में हैं और मैं CLI में प्रवेश करने के लिए बस ollama टाइप करूँगा
00:01:57और आप यहाँ देख सकते हैं कि हमारे पास विभिन्न एजेंट्स या हार्नेस के कई विकल्प हैं जिनमें हम प्रवेश कर सकते हैं
00:02:01हम सीधे चैट भी कर सकते हैं, लेकिन इस मामले में मैं बस Claude Code में प्रवेश करूँगा और आप देख सकते हैं
00:02:05यह भी कि डिफ़ॉल्ट मॉडल जिसे मैंने पहले ही डाउनलोड कर लिया है, वह Gemma 4 है, तो अब हम Claude Code के अंदर हैं और
00:02:11आप देख सकते हैं कि हम Gemma 4 पर हैं, इसमें API यूसेज बिलिंग लिखा है, लेकिन क्योंकि यह वास्तव में
00:02:17एक स्थानीय मॉडल है, तो इसमें हमारी कोई लागत नहीं आएगी, इसलिए हम “hello” जैसा मैसेज टाइप कर सकते हैं, तो एक बार जब मॉडल
00:02:23जवाब देता है, तो आप देख सकते हैं कि यह अभी भी सोचता है कि यह Claude Code है, सिवाय इसके कि यह Gemma
00:02:284 मॉडल चला रहा है, इसलिए हमें जवाब मिलता है, “हेलो, मैं Claude Code हूँ, सॉफ्टवेयर इंजीनियरिंग की सभी चीज़ों के लिए आपका असिस्टेंट”, तो
00:02:34इसका मतलब है कि अब आप बस Claude Code का उपयोग बिल्कुल वैसे ही जारी रख सकते हैं जैसे आप पहले करते थे, लेकिन आपने इसे
00:02:39एक तरह से धोखा दिया है क्योंकि एंथ्रोपिक के मॉडल्स का उपयोग करने के बजाय, आप वास्तव में एक स्थानीय और ओपन
00:02:44सोर्स मॉडल का उपयोग कर रहे हैं, अब बहुत सारे अन्य मॉडल्स उपलब्ध हैं, आप यहाँ ollama.com सर्च पर देख सकते हैं
00:02:49हमारे पास Qwen 3.6 जैसी चीज़ों सहित बहुत सारे मॉडल्स के विकल्प हैं
00:02:55हमारे पास Minimax है, मुझे यकीन है कि हाँ, DeepSeek परिवार भी यहाँ है, तो मूल रूप से कोई भी लोकप्रिय
00:03:01मॉडल जिसके बारे में आप सोच सकते हैं वह उपलब्ध होने वाला है और इसे चलाने के लिए हम बस एक कमांड टाइप कर सकते हैं जैसे
00:03:05ollama run qwen 3.6 और फिर अगर मॉडल डाउनलोड नहीं है तो यह उस मॉडल को डाउनलोड करना शुरू कर देगा, इसलिए
00:03:11आपको उसे डाउनलोड करने के लिए थोड़ी देर इंतजार करना होगा, लेकिन एक बार उपलब्ध होने के बाद आप इसे अपनी
00:03:15मशीन पर चला सकते हैं, अब आइए उस इमेज डिटेक्शन स्क्रिप्ट को देखें, तो मैं कह सकता हूँ ollama run gemma 4
00:03:20और फिर कोट्स के अंदर हम कहते हैं “इस इमेज के अंदर क्या है” और फिर इसे बस एक ऐसी इमेज पर पॉइंट करें जो
00:03:25मेरे डाउनलोड्स फोल्डर में है और फिर सीधे, बहुत जल्दी हमें एक जवाब मिलता है और
00:03:29इसने इसका विश्लेषण किया है और यह कहता है कि इमेज में एक बिल्ली है, यह एक टैबी बिल्ली है, मुद्रा और क्रिया
00:03:35बिल्ली लेटी हुई है, यह सब सच है और यह वह इमेज है जिसके खिलाफ इसने डिटेक्शन किया, अब
00:03:41स्थानीय मॉडल्स चलाते समय आपकी उपलब्ध मेमोरी और सिस्टम प्रदर्शन वास्तव में मायने रखता है, यदि आपके पास
00:03:4524 गीगाबाइट से कम VRAM है तो आपको केवल 4k कॉन्टेक्स्ट मिलेगा, 28 से 48 गीग VRAM आपको 32k कॉन्टेक्स्ट देता है
00:03:52और 48 गीग VRAM से अधिक आपको 256k कॉन्टेक्स्ट मिलता है, हाल ही में Ollama ने बड़े अपडेट भी किए हैं जब
00:03:59Mac OS पर चल रहे हों, मार्च में Ollama को Apple सिलिकॉन के लिए MLX पर पोर्ट किया गया, जो Apple का मशीन
00:04:06लर्निंग फ्रेमवर्क है, यह मॉडल्स को आपकी यूनिफाइड मेमोरी का पूरा लाभ उठाने की अनुमति देता है और Ollama को
00:04:11GPU न्यूरल एक्सेलरेटर का लाभ उठाने देता है ताकि फर्स्ट टोकन और जनरेशन की गति दोनों को तेज किया जा सके, मूल रूप से यह
00:04:18तेज़ है, आपकी स्थानीय मशीन के अलावा Ollama Docker के अंदर भी चल सकता है ताकि आप अपनी सेवाएं चला सकें
00:04:24जो स्थानीय मॉडल्स पर निर्भर करती हैं, डॉक्स में कंटेनर के अंदर Ollama का उपयोग करने के लिए एक पूर्ण गाइड शामिल है, या तो
00:04:30केवल CPU या NVIDIA और AMD GPU के साथ, फिर आप Docker के अंदर मॉडल लॉन्च कर सकते हैं और यहाँ तक कि cURL रिक्वेस्ट भी कर सकते हैं
00:04:37सीधे इसे, API रेफरेंस में कई अन्य एंडपॉइंट्स भी शामिल हैं जिन्हें आप कॉल कर सकते हैं, अब Ollama की तुलना में
00:04:44अन्य टूल्स की तुलना में, vLLM स्थानीय CLI टूल के बजाय सेवाओं के रूप में मॉडल्स चलाने के लिए कहीं अधिक उपयुक्त लगता है
00:04:49और प्रदर्शन में सुधारों की पूरी श्रृंखला के कारण सर्वर परिनियोजन के लिए काफी तेज़ है
00:04:54जैसे कि अत्याधुनिक सर्विंग थ्रूपुट, कुशल मेमोरी प्रबंधन और क्वांटाइजेशन, तो यदि आप
00:05:00एक होस्टेड सेवा चला रहे हैं, तो vLLM बेहतर विकल्प हो सकता है, LM Studio स्थानीय वर्कफ़्लो के मामले में Ollama के बहुत करीब है
00:05:06और एक सुंदर GUI के साथ भी आता है, हालाँकि मैं उल्लेख करूँगा कि Ollama का अपना
00:05:12आधिकारिक GUI है यदि आप इसमें रुचि रखते हैं, तो इस क्षेत्र में निश्चित रूप से अन्य टूल्स भी हैं
00:05:17जैसे कि AnythingLLM, जिस पर हमने यहाँ पूरा वीडियो बनाया है, अन्यथा मुझे आशा है कि आपको यह
00:05:22उपयोगी लगा, मैं Better Stack से वॉरेन हूँ, देखने के लिए धन्यवाद और मैं आपसे अगली बार मिलूँगा