20+ सेटिंग्स जो हर्मेस एजेंट सेटअप की लागत का 80% बचाती हैं

AAI LABS
Computing/SoftwareManagementInternet Technology

Transcript

00:00:00जब से हमारे हाथ में Hermes आया है, हमने इस पर ढेर सारे वर्कफ़्लो बनाए हैं और काफी लंबे समय तक,
00:00:04हमने अपना सब कुछ OpenAI सब्सक्रिप्शन के ज़रिए GPT मॉडल पर चलाया। शुरुआत में यह ठीक काम कर रहा था।
00:00:09लेकिन हमारी पूरी टीम Hermes का इस्तेमाल करती है और हर किसी ने अपने खुद के फ्लो सेट किए हुए हैं और इतने सारे
00:00:14लोगों के एक साथ इस्तेमाल करने से, हम बार-बार उपयोग की सीमाओं (usage limits) से टकरा रहे थे। इससे हमारा काम रुक जाता था।
00:00:18इसलिए हम OpenRouter पर चले गए। इसने हमारी सीमा वाली समस्या को तो हल कर दिया लेकिन एक नई समस्या
00:00:24खड़ी कर दी। OpenRouter हर टोकन के लिए चार्ज करता है और पहली बार हम देख पा रहे थे कि
00:00:29Hermes हमें कितना महंगा पड़ रहा था। यह संख्या हमारी उम्मीद से कहीं ज़्यादा थी और अजीब बात यह थी कि
00:00:34इसका ज़्यादातर हिस्सा हमारे सक्रिय रूप से इस्तेमाल करने से नहीं आ रहा था। ज़्यादातर हिस्सा उन कामों से आ रहा था जो लोगों ने
00:00:39गलत तरीके से सेट किए थे। इसलिए हमने उस बिल को कम करने की ठानी, लेकिन हम आउटपुट की गुणवत्ता से समझौता करने के लिए तैयार नहीं थे।
00:00:44तो हमने सभी सेटिंग्स को बारीकी से देखा और ऐसी सेटिंग्स ढूंढीं जो Hermes की गुणवत्ता को कम किए बिना
00:00:49खर्च को कम कर सकें। और अगर आप यहाँ पहली बार आए हैं, तो हम एक सॉफ़्टवेयर कंपनी हैं और यह हमारा चैनल AI Labs है
00:00:54जहाँ हम आपको दिखाते हैं कि कैसे AI के साथ अपनी प्रक्रियाओं को ऑप्टिमाइज़ करें, ठीक वैसे ही जैसे हमने अपनी की हैं।
00:00:59तो इस वीडियो में, हम उन सभी सेटिंग्स के बारे में बताएंगे जिन्हें हमने बदला, इससे हमारे
00:01:03वर्कफ़्लो में क्या बदलाव आया और इससे हमें वास्तव में कितनी बचत हुई। Hermes पर लागत बचाने के लिए आगे बढ़ने से पहले,
00:01:08हमें पहले यह समझना होगा कि वास्तव में टोकन क्या खा रहा है। Hermes के लिए आप जो भुगतान करते हैं वह इस बात पर निर्भर करता है कि
00:01:12यह कितने टोकन का उपयोग करता है। और टोकन मूल रूप से उन शब्दों के निर्माण खंड हैं जिन्हें मॉडल पढ़ता है और
00:01:17लिखता है। हर मॉडल उन टोकनों पर बनता है जिन्हें आप इनपुट में डालते हैं और जो आपको वापस मिलते हैं। लेकिन इनपुट सिर्फ
00:01:22आपका प्रॉम्प्ट नहीं है। इसमें सिस्टम प्रॉम्प्ट और अब तक की पूरी बातचीत भी शामिल है,
00:01:27साथ ही कुछ अन्य चीजें जो हर संदेश के साथ भेजी जाती हैं। इसमें प्रत्येक स्किल का हेडर शामिल है
00:01:31जिसे आपने जोड़ा है, जो मूल रूप से उसका नाम और विवरण है जो हमेशा लोड होता है, साथ ही वे MCP
00:01:36टूल्स जिन्हें आपने सेट किया है और मेमोरी व यूज़र फ़ाइलें। यह सब आपके इनपुट टोकन में जुड़ जाता है और स्किल्स
00:01:41इसका एक बड़ा हिस्सा हैं। Hermes 90 स्किल्स के साथ पहले से इंस्टॉल आता है और यह संख्या केवल बढ़ती ही जाती है
00:01:46जितना अधिक आप इसका उपयोग करते हैं। ऐसा इसलिए है क्योंकि यह किसी भी वर्कफ़्लो को, जिसे दोबारा इस्तेमाल किया जा सके, एक नई स्किल में बदल देता है। इसलिए उनमें से हर एक
00:01:51आपकी प्रति संदेश लागत में जुड़ जाता है। और यह सिर्फ स्किल हेडर्स ही नहीं हैं। Hermes आपकी बातचीत को स्कैन करता है
00:01:56एक नई स्किल बनाने के अवसरों के लिए और वह भी टोकन खर्च करता है। Hermes में एक खुद को विकसित करने वाली मेमोरी भी है।
00:02:03यह लगातार आपकी बातचीत को खंगालता है ताकि आपके बारे में विशिष्ट विवरण निकाल सके और उन्हें
00:02:07मेमोरी में लिख सके। यह उस मेमोरी को अपने आप अपडेट करता है ताकि यह आपके बारे में संदर्भ (context) रख सके और अपने भविष्य के
00:02:13उत्तरों को तैयार कर सके। और यह सब मुफ्त नहीं है क्योंकि विकसित होती स्किल्स और ऑटो-अपडेटिंग मेमोरी दोनों ही
00:02:19टोकन जला रहे हैं जिसके लिए अंततः आप भुगतान करते हैं। एक और बड़ी बात यह है कि Hermes 24/7 चलता है। यह कोई एजेंट नहीं है
00:02:25जिसे आप एक बार शुरू करते हैं और एक बार चलने देते हैं, जिस तरह हम क्लाउड कोड के साथ करते हैं। आप इसे एक लोकल
00:02:30सर्वर पर चला सकते हैं जैसे कि हमने अपनी टीम के लिए सेटअप किया है, या फिर VPS पर, जो मूल रूप से एक सर्वर है जिसे आप
00:02:35किराए पर लेते हैं और खुद चलाते हैं ताकि आपकी बाकी टीम उस तक पहुंच सके। चूँकि Hermes हमेशा चालू रहता है, बैकग्राउंड में बहुत सारे
00:02:40काम चल रहे होते हैं। अगर आप उन्हें चेक में नहीं रखते हैं तो यही आपके उपयोग को बढ़ाते हैं।
00:02:45उनमें से किसी एक कार्य का एक बार चलना सस्ता होता है, लेकिन जब यह बार-बार दोहराया जाता है या आपके पास बहुत सारे समान
00:02:50काम सेट किए होते हैं, तो लागत बढ़ जाती है। इसके अलावा, आपके द्वारा सेट किए गए MCP टूल्स और हुक भी
00:02:56कॉन्टेक्स्ट विंडो में लोड हो जाते हैं, इसलिए वे भी टोकन खर्च करते हैं। और अगर आप Hermes पर लक्ष्य (goals) चला रहे हैं, तो उसका भी आपको
00:03:01पैसा देना पड़ता है। अच्छी बात यह है कि Hermes आपको इन सब को ट्रैक करने का तरीका देता है। यह हर एक टोकन का
00:03:07उपयोग डेटा रूट फ़ोल्डर में एक डेटाबेस में स्टोर करता है। और आप किसी भी एजेंट से, जिसके साथ आप काम कर रहे हैं, उस
00:03:13डेटाबेस के माध्यम से जाने और आपको एक विस्तृत विवरण (breakdown) देने के लिए कह सकते हैं। एजेंट
00:03:17डेटाबेस में तब तक वापस जा सकता है जब आपने पहली बार Hermes इंस्टॉल किया था। वहाँ से, यह आपको बता सकता है कि आपने कितने सेशन
00:03:22चलाए हैं, आपने कितने टोकन उपयोग किए हैं, और इसकी कुल कितनी लागत आई है। यह आपके खर्चों का विस्तार से विवरण देगा,
00:03:27ताकि आप Claude के साथ बैठकर बेहतर तरीके से बजट प्रबंधित करना सीख सकें। Hermes में एक
00:03:31इनसाइट्स (insights) कमांड भी है जो लगभग वैसा ही काम करती है। यह पिछले 30 दिनों का लागत विवरण देता है,
00:03:36और आपको बताता है कि कौन सा हिस्सा कितना उपयोग कर रहा है और आपने किन टूल्स और स्किल्स का सबसे ज़्यादा उपयोग किया है। यह आपकी
00:03:42गतिविधि के पैटर्न और आपके सबसे लंबे सेशन भी दिखाता है। तो अब आप जानते हैं कि टोकन क्या खा रहा है। चलिए
00:03:47सबसे बड़े कारण से शुरू करते हैं, जो खुद मॉडल है। जिस मॉडल से आपने Hermes को कनेक्ट किया है,
00:03:52वही आपके बिल का अधिकांश हिस्सा है। Hermes आपको बहुत सारे मॉडल देता है जिनसे आप जुड़ सकते हैं, इसलिए यदि आप पहले से
00:03:56सब्सक्रिप्शन के लिए भुगतान करते हैं, जैसे कि हमारे पास कोडेक सब्सक्रिप्शन है, तो आप Hermes को सीधे उसके माध्यम से चला सकते हैं। एक बार
00:04:01जब यह सेटअप हो जाता है, तो आप उस सब्सक्रिप्शन के माध्यम से भुगतान कर रहे होते हैं जो आपके पास पहले से है, ऊपर से कोई अतिरिक्त लागत नहीं लगती।
00:04:06अब आप Anthropic या Gemini के सब्सक्रिप्शन के साथ भी ऐसा ही करना चाह सकते हैं, लेकिन भले ही Hermes
00:04:11उन्हें उपलब्ध के रूप में सूचीबद्ध करता है, वे वास्तव में उपलब्ध नहीं हैं। और आप सीधे Claude code का उपयोग नहीं कर सकते। आपको उसके लिए
00:04:16एक अलग API की आवश्यकता है, क्योंकि वे दोनों इस तरह से अपने सब्सक्रिप्शन का उपयोग करने को अपनी नीति का उल्लंघन मानते हैं।
00:04:21इसलिए फिलहाल, कोडेक सब्सक्रिप्शन आपका सबसे अच्छा विकल्प है। हमने खुद OpenAI
00:04:26सब्सक्रिप्शन पर शुरुआत की थी, लेकिन हम OpenRouter पर स्विच कर गए, क्योंकि यह हमें एक ही API कुंजी के तहत और अधिक
00:04:30मॉडल तक पहुंचने देता है, और यह कंपनी-व्यापी उपयोग के लिए सबसे अच्छा था। इसलिए यदि आप हमारी तरह OpenRouter
00:04:36पर हैं, तो आप Pareto राउटर का उपयोग करके लागत बचा सकते हैं। यह देखता है कि आपके काम को वास्तव में क्या आवश्यकता है
00:04:41और उसे काम के लिए सही मॉडल पर रूट करता है। इसमें 13 मॉडल अलग-अलग स्तरों में विभाजित हैं,
00:04:46सस्ते और बुनियादी से लेकर महंगे और शक्तिशाली तक। प्रदाता के अलावा, आपकी config.yaml फ़ाइल में ऐसी सेटिंग्स हैं
00:04:51जो आपको टोकन बचाने में मदद करती हैं। Hermes बहुत सारे बैकग्राउंड टास्क चलाता है, और डिफ़ॉल्ट रूप से,
00:04:57इनके लिए मॉडल को 'auto' पर सेट किया जाता है। इसका मतलब है कि यह छोटी चीजों के लिए भी आपके मुख्य मॉडल पर वापस चला जाता है।
00:05:02इन्हें 'auxiliary tasks' कहा जाता है, मूल रूप से वे छोटे बैकग्राउंड जॉब्स जिन्हें Hermes चलाता है, और उन्हें
00:05:07उस भारी तर्क (reasoning) की आवश्यकता नहीं होती जिसके लिए आपका मुख्य मॉडल बना है। जैसे कि इमेज पढ़ना, अपनी स्किल्स में
00:05:11खोजना, MCP टूल्स लोड करना, और प्रोफाइल विवरण लिखना, ये सभी कुछ हल्के मॉडल पर ठीक चलते हैं।
00:05:17इसलिए आप उन कार्यों को एक सस्ते मॉडल की ओर निर्देशित कर सकते हैं, और इस तरह आपका मुख्य मॉडल सरल चीजों पर महंगे टोकन नहीं जलाएगा।
00:05:21यही विचार उप-एजेंटों (sub-agents) पर भी लागू होता है जिसे हमने पहले कवर किया है।
00:05:26Hermes कई उप-एजेंटों को जन्म दे सकता है और उन्हें कार्य सौंप सकता है। हर एक अपनी खुद की कॉन्टेक्स्ट विंडो में चलता है और
00:05:32अपने दम पर काम करता है। लेकिन यह टोकन भारी है, क्योंकि हर उप-एजेंट मूल रूप से अपना खुद का सेशन है जो
00:05:38केवल अपने निष्कर्ष वापस रिपोर्ट करता है, इसलिए लागत जल्दी बढ़ जाती है। तो आप उप-एजेंटों के लिए एक सस्ता मॉडल सेट कर सकते हैं और
00:05:43जब भी कोई उप-एजेंट बनाया जाएगा तो आप बचत करेंगे। आप जो भी मॉडल उपयोग करें, एक और चीज़ है जिसे ट्विक करना उचित है,
00:05:48और वह है 'effort level'। यह मूल रूप से यह है कि उत्तर देने से पहले मॉडल कितना सोचता है। यदि आप इसे
00:05:53पूरा 'max' पर सेट कर देते हैं, तो आपको बेहतर आउटपुट तो मिलता है, लेकिन आप अधिक टोकन भी जलाते हैं, इसलिए यह अंत में
00:05:58आपको अधिक महंगा पड़ता है। इसलिए आप प्रयास स्तर को उस कार्य के साथ मैच करना चाहते हैं जिसे आप कर रहे हैं, और जब वह कार्य
00:06:03एक सरल कार्य है जिसमें बहुत अधिक तर्क की आवश्यकता नहीं है, तो आप 'thinking' को पूरी तरह से बंद कर सकते हैं। लेकिन इससे पहले कि हम
00:06:08आगे बढ़ें, हमारे प्रायोजक Luma से एक शब्द सुनते हैं। यदि आप रचनात्मक कार्य करते हैं, तो असली बाधा विचार नहीं है।
00:06:13यह एक प्रोजेक्ट के लिए आठ अलग-अलग AI टूल्स को मैनेज करना और उनका प्रबंधन करते हुए अपना आधा दिन खो देना है।
00:06:19Luma इसे एजेंटिक AI के साथ ठीक करता है। सामान्य AI केवल आपकी सहायता करता है, लेकिन Luma के एजेंट वास्तव में आपके साथ
00:06:24निर्माण करते हैं, और वे भौतिक दुनिया को समझते हैं, कि चीजें कैसे चलती हैं, व्यवहार करती हैं, और अंतरिक्ष में मौजूद होती हैं, न कि सिर्फ
00:06:30पिक्सेल। आप स्वाद और दिशा लाते हैं, और एजेंट पर्दे के पीछे सब कुछ व्यवस्थित करते हैं,
00:06:35पूरे प्रोजेक्ट में संदर्भ बनाए रखते हैं और प्रत्येक चरण के लिए सही मॉडल लाते हैं। पहले
00:06:40विचार से लेकर अंतिम कट तक, एजेंट पूरे प्रोजेक्ट को आगे बढ़ाते रहते हैं, और यह कभी भी एक प्रॉम्प्ट, एक आउटपुट नहीं होता।
00:06:45आप उनके साथ मोड़-दर-मोड़ काम को आकार देते हैं, जैसे-जैसे आप जाते हैं परिष्कृत करते हैं, ताकि आप 10 गुना अधिक विचारों का पता लगा सकें
00:06:51बिना 10 गुना काम के, सबसे अच्छे मॉडलों के साथ सब कुछ एक जगह पर बजाय 10 बिखरे हुए टैब के। Luma के साथ निर्माण करें,
00:06:56नीचे दिए गए लिंक पर जल्दी एक्सेस प्राप्त करें, या स्क्रीन पर QR स्कैन करें। लेकिन मॉडल केवल एक चीज नहीं है
00:07:02जो आपके टोकन चला रही है। कॉन्टेक्स्ट विंडो भी ऐसा करती है। आपका Hermes एजेंट टूल्स और
00:07:07स्किल्स के पूरे सेट के साथ आता है, और आपके द्वारा भेजा गया हर संदेश उस सब को अपने साथ ले जाता है, साथ ही पूरी बातचीत
00:07:12का इतिहास जो आपने अब तक बनाया है। बातचीत जितनी लंबी चलती है, हर टर्न पर भेजने के लिए उतना ही अधिक इतिहास होता है
00:07:16और कॉन्टेक्स्ट विंडो तेजी से बढ़ती रहती है, इसलिए अक्सर 'compress' दबाना एक अच्छी आदत है।
00:07:21वह क्या करता है, अब तक जो कुछ भी हुआ है, उसके सारांश पर आधारित एक नया सेशन शुरू करता है।
00:07:26आप बहुत सारे टोकन बचाते हैं, और मॉडल अभी भी बातचीत का संदर्भ रखता है, बस बहुत ही
00:07:31संक्षिप्त रूप में। डिफ़ॉल्ट रूप से, कम्प्रेशन थ्रेशोल्ड 50% पर सेट होता है, जिसका अर्थ है कि Hermes बातचीत को
00:07:37तब संकुचित करेगा जब कॉन्टेक्स्ट विंडो का आधा हिस्सा भर जाएगा। आप इस मान को समायोजित कर सकते हैं, और अधिकांश
00:07:42मामलों में, इसे निचले स्तर पर रखना बेहतर है। ऐसा करने से उन संदेशों की संख्या कम हो जाती है जिन्हें
00:07:47प्रत्येक टर्न के साथ भेजा जाना चाहिए, जिससे कॉन्टेक्स्ट उपयोग को कुशल रखने और हर संदेश की लागत को कम करने में मदद मिलती है।
00:07:52कम्प्रेस करने के बाद, Hermes थोड़े से टोकन असम्पीडित (uncompressed) छोड़ देता है और उन्हें और अधिक बनाए रखने के लिए जोड़ देता है
00:07:58संदर्भ, और इसे वह 'target ratio' कहता है। आप इसे कम प्रतिशत पर सेट कर सकते हैं ताकि पुरानी बातचीत का कम हिस्सा
00:08:03कॉन्टेक्स्ट विंडो में आगे बढ़े और प्रत्येक टर्न के साथ कम संदेश भेजे जाएं।
00:08:08आप यह भी नियंत्रित कर सकते हैं कि प्रत्येक टूल परिणाम का कितना हिस्सा वास्तव में कॉन्टेक्स्ट में प्रवेश करता है। जब हम
00:08:13OpenAI सब्सक्रिप्शन पर थे, तो हमने उन मानों को उच्च सेट किया था ताकि Hermes विवरण न छोड़े जब टूल आउटपुट
00:08:18कट जाता था, जैसा कि हमने पिछले वीडियो में कवर किया था। लेकिन एक बार जब हम OpenRouter पर चले गए, तो हमें
00:08:23लागत पर अधिक बारीकी से नज़र रखनी पड़ी, इसलिए हमने उन मानों को वापस नीचे कर दिया। यदि आपके पास कोई एक-बार का निर्देश है जिसे
00:08:28आप केवल एक ही सेशन के लिए चाहते हैं, तो उसे Hermes कॉन्टेक्स्ट फ़ाइलों में न लिखें। इसके बजाय, आप एक
00:08:34अस्थायी (ephemeral) सिस्टम प्रॉम्प्ट का उपयोग कर सकते हैं, जो मूल रूप से इसे केवल उस एक सेशन में जोड़ता है और कुछ नहीं। उस तरह,
00:08:39आप कॉन्टेक्स्ट फ़ाइलों में जगह बर्बाद किए बिना निर्देश का उपयोग कर सकते हैं। और यदि आप स्थानीय
00:08:44सिस्टम जैसे कि दूसरा मस्तिष्क (second brain) चला रहे हैं, जैसा कि हमने आपको पहले दिखाया था, तो आप चाहते हैं कि वह जानकारी ठीक से व्यवस्थित हो। उस तरह,
00:08:49एजेंट इसे थोड़ा-थोड़ा करके लोड कर सकता है जैसे उसे ज़रूरत हो, बजाय अतिरिक्त टोकन खींचने के जिनकी उसे ज़रूरत नहीं है।
00:08:54आपके द्वारा बनाई गई फ़ाइलों के अलावा, आप उन फ़ाइलों को भी छोटा कर सकते हैं जिन पर Hermes निर्भर है, जैसे
00:08:59मेमोरी फ़ाइलें और एजेंट फ़ाइलें। ये हर समय आपकी कॉन्टेक्स्ट विंडो में रहती हैं, इसलिए वे जितनी छोटी
00:09:05होंगी, उतना ही कम वे हर संदेश पर मॉडल के सामने रख रही हैं। Hermes आपको
00:09:10इसकी ऑटो-मेमोरी सुविधा को बंद करने की भी अनुमति देता है, जो इसे मेमोरी इकट्ठा करने से रोकता है और मेमोरी फ़ाइलों को
00:09:14आपकी कॉन्टेक्स्ट विंडो में आने से रोकता है। यह आपको पैसे बचाता है, क्योंकि हर संदेश के साथ कम टोकन बाहर जाते हैं।
00:09:20लेकिन ऑटो-मेमोरी को बंद करने का मतलब उन सुविधाओं में से एक को छोड़ना है जो Hermes को पहली जगह में इतना अच्छा बनाता है।
00:09:25इसलिए हमारे अपने वर्कफ़्लो में, हम इसे चालू रखते हैं भले ही यह हमें महंगा पड़ता है। हम चाहते हैं कि यह हमारी कंपनी के बारे में
00:09:30विवरण खींचे और उस संदर्भ को पूरी टीम के साथ साझा करे, क्योंकि हर कोई इसका उपयोग Slack के माध्यम से कर रहा है।
00:09:35जब Hermes कुछ गलत करता है, तो बस उसे फिर से प्रॉम्प्ट न करें। एक संदेश पीछे जाने के लिए 'undo' कमांड का उपयोग करें।
00:09:40यह पूर्ण रिवाइंड नहीं है जो कई संदेशों के माध्यम से वापस चलता है, लेकिन यह
00:09:45आपको सबसे हालिया संदेश को पूर्ववत करने देता है। यह बेहतर चाल है, क्योंकि वहाँ से आप इसे एक नया
00:09:50प्रॉम्प्ट दे सकते हैं जो स्पष्ट करता है कि क्या गलत हुआ और क्या टालना है। और यदि आप अभी तक वीडियो का आनंद ले रहे हैं,
00:09:54तो चैनल को सब्सक्राइब करें और 'hype' बटन दबाएं। समर्थन का यह छोटा सा इशारा हमारे लिए बहुत मायने रखता है।
00:10:00इन सबको ट्रिम करने से आपका उपयोग कम हो जाता है और आपके टूल्स देखने के लिए अगली चीज हैं। हर टूल तक आपके
00:10:05एजेंट की पहुंच है, वह भी हर संदेश के साथ कॉन्टेक्स्ट विंडो के हिस्से के रूप में भेजा जाता है, इसलिए उन टूल्स को काटना फायदेमंद है जिनका आप वास्तव में उपयोग नहीं करते हैं।
00:10:10Hermes 17 से अधिक टूल्स के साथ आता है, और आप उन सभी को Hermes list कमांड से देख सकते हैं।
00:10:15किसी को अक्षम करने के लिए, आप या तो डेस्कटॉप ऐप के माध्यम से जा सकते हैं या उस टूल के नाम के साथ
00:10:20tools disable कमांड चला सकते हैं जिसे आप बंद करना चाहते हैं। उदाहरण के लिए, पूरी टीम के लिए हमने जो AI labs प्रोफाइल सेट किया था,
00:10:26वह कोड बेस पर कोई काम नहीं कर रहा था, इसलिए हमें वहां बिल्कुल भी कोड निष्पादन की आवश्यकता नहीं थी।
00:10:31हम इसके लिए समर्पित एक अलग प्रोफाइल रखते हैं। हमने इसे उन अन्य सभी टूल्स के साथ अक्षम कर दिया जिनका हम
00:10:36उपयोग नहीं कर रहे थे, इसलिए कोई भी बिना कारण कॉन्टेक्स्ट में नहीं बचा था। Hermes बहुत सारी स्किल्स के साथ भी आता है,
00:10:41और उनमें से अधिकांश ऐसी हैं जिनका आप शायद ही कभी उपयोग करेंगे, इसलिए आप हर उस स्किल को बंद कर सकते हैं जिसकी आपको आवश्यकता नहीं है।
00:10:46आपकी स्किल सूची में केवल वही रह जाती हैं जिनका आप वास्तव में उपयोग करते हैं, बजाय एक लंबी सूची के जो बस वहां
00:10:51पड़ी रहती है और कॉन्टेक्स्ट को फुलाती है। आपके MCP सर्वरों के लिए भी यही सच है। हर एक जिसे आप कनेक्ट करते हैं, वह अपने साथ
00:10:56टूल्स का अपना सेट कॉन्टेक्स्ट विंडो में लाता है, इसलिए उन सर्वरों को डिस्कनेक्ट करें जिनका आप वास्तव में उपयोग नहीं कर रहे हैं, और
00:11:01जिन्हें आप रखते हैं, सुनिश्चित करें कि 'tool search' 'auto' पर सेट है। यह Claude में टूल सर्च सुविधा की तरह काम करता है। यह
00:11:06किसी टूल को केवल तब लोड करता है जब वास्तव में इसकी आवश्यकता होती है, बजाय उन सभी को कॉन्टेक्स्ट विंडो में पूरे समय रखने के।
00:11:11यदि आपका 'auto' पर नहीं है, तो इसे बदल दें, ताकि आप टोकन बर्बाद न करें और आप जो खर्च करते हैं उसका अधिकतम लाभ उठा सकें।
00:11:16हार्ड लिमिट्स टोकन उपयोग को कम रखने का एक और तरीका है। वे सीमित करते हैं कि एजेंट कितना
00:11:22कर सकता है इससे पहले कि उसे रुकना पड़े। पहला है मॉडल के 'max tokens' को एक विशिष्ट संख्या पर सेट करना
00:11:27जो नियंत्रित करता है कि यह आउटपुट के रूप में कितने टोकन उत्पन्न कर सकता है। यह आपको आउटपुट लागत पर बचाता है और मॉडल को
00:11:33बड़बड़ाने के बजाय सटीक उत्तरों की ओर धकेलता है। डिफ़ॉल्ट रूप से, एजेंट के अधिकतम टर्न 150 पर सेट होते हैं।
00:11:39इसका मतलब है कि, जब यह किसी कार्य पर काम कर रहा होता है, तो यह सोचने, टूल्स को कॉल करने, परिणामों को पढ़ने के लिए
00:11:46150 टर्न तक ले सकता है, और परिणाम तौलने के बाद यह हो जाता है। समस्या यह है कि जब एजेंट भ्रमित हो जाता है,
00:11:51तो यह उन सभी टर्न को जला सकता है, पूरे कॉन्टेक्स्ट को फिर से भेज सकता है जबकि यह कुछ हल करने की कोशिश कर रहा होता है।
00:11:56तो आप इसे कुछ कम पर गिरा सकते हैं। हमने अपना 60 पर सेट किया है, ताकि एजेंट ऐसी समस्या पर
00:12:01टर्न बर्बाद न करे जिस पर वह अटका हुआ है। एक और सेटिंग है जिसे चालू करना उचित है जो लूपिंग के खिलाफ
00:12:06सुरक्षा करती है। आप 'hard stop' सेटिंग को 'false' से 'true' पर स्विच कर सकते हैं, जो एजेंट को बिना किसी कारण के लूपिंग
00:12:10करने से रोकता है। इसलिए जब यह अटक जाता है और प्रगति नहीं कर रहा होता है, तो 'hard stop' चालू हो जाता है और इसे
00:12:15ग्राइंड करने से पहले रोक देता है। फिर आपके क्रोन जॉब्स (cron jobs) हैं। मूल रूप से वे कार्य जो अपने आप चलते हैं,
00:12:21एक शेड्यूल पर, जिन पर डिफ़ॉल्ट रूप से उनके अधिकतम टर्न पर कोई सीमा सेट नहीं होती है। आप इसे एक विशिष्ट
00:12:26संख्या पर सेट कर सकते हैं, ताकि एक क्रोन जॉब कितने टर्न ले सकता है, इस पर एक कैप हो। यह बैकग्राउंड जॉब्स को टोकन
00:12:31खर्च करने से रोकता है और यह उन्हें हमेशा के लिए लागत खाने से रोकता है। अब Hermes
00:12:36एजेंट के साथ शुरुआत करने के लिए, हमने एक पूरा स्टार्टर पैक तैयार किया है जो AI Labs Pro में उपलब्ध है, जो हमारा समुदाय है।
00:12:41यही वह जगह है जहाँ आपको संसाधन, स्टार्टर पैक, और बहुत कुछ मिलेगा, साथ ही समान विचारधारा वाले लोगों के साथ
00:12:45बातचीत करने की जगह, जिसमें हमारी टीम भी शामिल है। इसलिए यदि आपने हमारे काम में मूल्य पाया है
00:12:50और चैनल का समर्थन करना चाहते हैं, तो यह सबसे अच्छा तरीका है। लिंक विवरण में है।
00:12:54यह हमें इस वीडियो के अंत तक लाता है। यदि आप चैनल का समर्थन करना चाहते हैं और हमें इस तरह के वीडियो
00:12:59बनाते रहने में मदद करना चाहते हैं, तो आप नीचे दिए गए 'super thanks' बटन का उपयोग करके ऐसा कर सकते हैं। हमेशा की तरह, देखने के लिए धन्यवाद
00:13:04और मैं आपसे अगले वीडियो में मिलूंगा।

Key Takeaway

Hermes एजेंट की कॉन्टेक्स्ट विंडो, बैकग्राउंड टास्क और टूल सेटिंग्स को सूक्ष्मता से ऑप्टिमाइज़ करके और अनावश्यक कार्यों को सस्ते मॉडलों पर रूट करके संचालन लागत में 80% तक की बचत संभव है।

Highlights

  • Hermes एजेंट की अनावश्यक बैकग्राउंड टास्क, स्किल्स और मेमोरी सेटिंग्स को ऑप्टिमाइज़ करने से लागत में 80% तक की कमी आती है।

  • मुख्य मॉडल के बजाय सहायक कार्यों (जैसे इमेज रीडिंग और टूल लोडिंग) के लिए सस्ते मॉडल का उपयोग करने से प्रति संदेश लागत घटती है।

  • हर संदेश के साथ पूरी बातचीत का इतिहास भेजने के बजाय, कम्प्रेशन थ्रेशोल्ड को कम रखकर कॉन्टेक्स्ट विंडो के टोकन खर्च को नियंत्रित किया जा सकता है।

  • अनावश्यक टूल्स और स्किल्स को डिसेबल करने और 'tool search' को 'auto' पर सेट करने से टोकन की खपत कम होती है।

  • एजेंट के टर्न लिमिट्स (डिफ़ॉल्ट 150 से घटाकर 60 करना) और हार्ड स्टॉप लागू करने से लूपिंग के कारण होने वाले अनावश्यक खर्च रुक जाते हैं।

Timeline

लागत का विश्लेषण और टोकन खपत के कारण

  • Hermes का उपयोग बढ़ने पर टोकन आधारित लागत में वृद्धि हुई।
  • इन्पुट टोकन में सिस्टम प्रॉम्प्ट, बातचीत का इतिहास, स्किल्स और मेमोरी फाइलें शामिल होती हैं।
  • Hermes लगातार बातचीत स्कैन करके नई स्किल्स और मेमोरी अपडेट करता है, जो टोकन खर्च को बढ़ाते हैं।

टीम द्वारा उपयोग की जाने वाली स्किल्स, मेमोरी फाइलें और MCP टूल्स प्रत्येक संदेश के साथ कॉन्टेक्स्ट विंडो में लोड होते हैं। Hermes का 24/7 सक्रिय रहना और डिफ़ॉल्ट रूप से बैकग्राउंड में चलने वाली प्रक्रियाएं लागत का मुख्य कारण हैं। अंतर्निहित डेटाबेस और इनसाइट्स कमांड का उपयोग करके उपयोगकर्ता अपने टोकन खर्च का विस्तृत विवरण देख सकते हैं।

मॉडल और बैकग्राउंड टास्क ऑप्टिमाइज़ेशन

  • कोडेक सब्सक्रिप्शन का उपयोग करना सीधे API एक्सेस से अधिक किफायती है।
  • Pareto राउटर जटिलता के अनुसार सही मॉडल का चयन करके खर्च कम करता है।
  • Auxiliary tasks (जैसे इमेज प्रोसेसिंग) के लिए मुख्य मॉडल के बजाय सस्ते मॉडल का उपयोग करें।

महंगे मॉडल का उपयोग केवल जटिल तार्किक कार्यों के लिए करना चाहिए। कॉन्फ़िगरेशन फ़ाइलों में सहायक कार्यों को हल्के मॉडलों पर रूट करने से मुख्य मॉडल पर अनावश्यक टोकन खर्च नहीं होते। उप-एजेंटों के लिए भी सस्ता मॉडल सेट करना प्रभावी है।

कॉन्टेक्स्ट विंडो और मेमोरी प्रबंधन

  • कम्प्रेशन थ्रेशोल्ड को कम रखने से हर टर्न पर भेजा जाने वाला इतिहास छोटा रहता है।
  • अस्थायी निर्देश देने के लिए ephemeral सिस्टम प्रॉम्प्ट का उपयोग करना कॉन्टेक्स्ट फाइल को साफ रखता है।
  • ऑटो-मेमोरी को बंद करना टोकन बचाता है लेकिन एजेंट के संदर्भ याद रखने की क्षमता सीमित करता है।

कॉन्टेक्स्ट विंडो जितनी बड़ी होगी, लागत उतनी ही अधिक होगी। बातचीत को संकुचित (compress) करने से सारांश सुरक्षित रहता है और अनावश्यक डेटा हट जाता है। 'undo' कमांड का उपयोग गलत प्रॉम्प्ट्स को सुधारने के लिए करें ताकि दोबारा टोकन खर्च न हों।

टूल्स, स्किल्स और हार्ड लिमिट्स

  • उपयोग न होने वाले टूल्स और स्किल्स को डिसेबल करने से कॉन्टेक्स्ट फुलावट कम होती है।
  • MCP सर्वरों के लिए 'tool search' को 'auto' पर सेट करने से टूल केवल ज़रूरत पड़ने पर ही लोड होते हैं।
  • एजेंट के अधिकतम टर्न लिमिट्स (150 से 60) और हार्ड स्टॉप लगाने से लूपिंग के कारण होने वाला खर्च रुक जाता है।

एजेंट के पास मौजूद अनावश्यक टूल्स कॉन्टेक्स्ट विंडो में टोकन जलाते हैं। टूल लिस्ट कमांड के माध्यम से इन्हें हटाया जा सकता है। इसके अलावा, विशिष्ट टोकन सीमाएं तय करने से एजेंट को लंबे समय तक अटकने या अनावश्यक लूप में फंसने से बचाया जा सकता है।

Community Posts

No posts yet. Be the first to write about this video!

Write about this video