27B 모델 को इन-हाउस सर्वर पर कैसे तैनात करें और टोकन लागत को कैसे नियंत्रित करें
सुरक्षा नियमों के कारण बाहरी API का उपयोग न कर पाने की स्थिति में, आपको 27B मॉडल को अपने स्वयं के सर्वर पर होस्ट करना होगा। महंगे H100 खरीदने के लिए बजट अपर्याप्त है, और हर महीने खर्च होने वाली टोकन लागत तेजी से बढ़ रही है। यह लेख ऑन-प्रिमाइसेस वातावरण में हार्डवेयर बजट को 40% से अधिक बचाने और अंतहीन लूप टोकन बर्बादी को रोकने के लिए विशिष्ट व्यावहारिक तरीकों को शामिल करता है।
हार्डवेयर बजट कम करने के लिए मल्टी-GPU कॉन्फ़िगरेशन विधि
OOM (आउट ऑफ मेमोरी) के बिना 27B मॉडल को चलाने के लिए, आपको VRAM आवश्यकताओं की सटीक गणना करनी होगी। एक महंगे NVIDIA H100 80GB को खरीदने के बजाय, 48GB का एकीकृत VRAM बनाने के लिए दो RTX 4090 24GB का उपयोग करें। इस विधि का उपयोग करके, आप प्रारंभिक हार्डवेयर निर्माण लागत को आधे से भी कम कर सकते हैं।
- कुल आवश्यक VRAM 30GB से अधिक न हो, यह जांचने के लिए मॉडल वेट (FP8 के आधार पर लगभग 28GB) और KV कैश (8K संदर्भ के आधार पर 1GB) को जोड़ें।
- NVLink के बिना वातावरण में, vLLM चलाते समय
--tensor-parallel-size 2 विकल्प निर्दिष्ट करें ताकि PCIe बैंडविड्थ के भीतर गणनाओं को वितरित किया जा सके।
- 1000W से अधिक पीक पावर को संभालने के लिए 80 Plus Titanium प्रमाणित पावर सप्लाई का उपयोग करें जो दो RTX 4090 द्वारा उत्पन्न की जाती है, और फ्रंट इंटेक फैन के साथ थर्मल थ्रॉटलिंग को रोकें।
एक महंगे डिवाइस पर टिके रहने की कोई आवश्यकता नहीं है। सस्ते ग्राफिक्स कार्ड को समानांतर में जोड़ना बजट के दबाव में काम करने वाली बुनियादी ढांचा टीमों के लिए एक यथार्थवादी विकल्प है।
अंतहीन लूप टोकन खपत को रोकने के लिए इंजन सेटिंग्स
हाल ही में, जटिल तर्क को संसाधित करते समय 27B मॉडल अक्सर समाप्ति टोकन आउटपुट करने में विफल होते हैं और अधिकतम टोकन संख्या तक एक अंतहीन लूप में चलते हैं। वाणिज्यिक API वातावरण में, यह अकेली घटना मासिक परिचालन लागत को इतना बढ़ा देती है कि इसे संभालना मुश्किल हो जाता है। आप स्थानीय सर्विंग इंजन में केवल मापदंडों को समायोजित करके इस बर्बादी को निश्चित रूप से रोक सकते हैं।
- समान वाक्यों को बार-बार उत्पन्न होने से रोकने के लिए सर्विंग मापदंडों में
repeat_penalty 1.15 और presence_penalty 0.1 सेट करें।
- मॉडल को अपने आप सवाल-जवाब जारी रखने से रोकने के लिए कॉन्फ़िगरेशन फ़ाइल की
stop सरणी में <|im_end|>, <|eot_id|>, और User: जोड़ें।
- मॉडल को कम संभावना वाले टोकन को छूने से रोकने के लिए
temperature 0.2 और min_p 0.05 लागू करें।
इन सेटिंग्स को लागू करने से औसत आउटपुट टोकन संख्या 4,000 से घटकर 800 हो जाती है। बिजली की लागत और उपकरण मूल्यह्रास सहित, प्रति डिवाइस मासिक परिचालन लागत को $290 के आसपास नियंत्रित किया जा सकता है।
एयर-गैप पर्यावरण में वेट डिप्लॉयमेंट और पाइपलाइन प्रबंधन
बाहरी नेटवर्क से पूरी तरह से अलग एयर-गैप पर्यावरण में, वजन को मज़बूती से प्रबंधित करने और परोसने के लिए एक पाइपलाइन आवश्यक है। vLLM का उपयोग करके, आप इन-हाउस आंतरिक नेटवर्क में भी व्यावसायिक सेवाओं के समान गति के साथ API एंडपॉइंट खोल सकते हैं.
- इंटरनेट से जुड़े बैस्टियन होस्ट पर
huggingface-cli के साथ वेट प्राप्त करें और एकल फ़ाइल संरचना में डाउनलोड करने के लिए --local-dir-use-symlinks False विकल्प का उपयोग करें।
- RAG संदर्भ पुनuseability को बढ़ाने और VRAM विखंडन को रोकने के लिए vLLM चलाते समय
--enable-prefix-caching और --gpu-memory-utilization 0.92 लागू करें।
- प्रोमेथियस एंडपॉइंट (
/metrics) की लगातार निगरानी करें और यदि vllm:gpu_cache_usage_factor मीट्रिक 90% से अधिक हो जाती है, तो --max-model-len को तुरंत 16384 से घटाकर 8192 कर दें।
इन-हाउस सुरक्षा नीतियों का पालन करते हुए लागत को नियंत्रित करने का एकमात्र तरीका अंततः इसे स्वयं बनाना और आंकड़ों की निगरानी करना है।