बेंचमार्क स्कोर पर निर्भर रहने वाले तकनीकी प्रबंधकों के लिए
यदि आप एक इंजीनियरिंग मैनेजर हैं, तो आप संभवतः हगिंग फेस लीडरबोर्ड या MMLU स्कोर देखना शुरू करेंगे। चलिए ईमानदार बनते हैं। वे संख्याएँ व्यावहारिक कार्य से पूरी तरह असंबंधित हैं। अकादमिक बेंचमार्क कंपनी के भीतर के जटिल डोमेन ज्ञान या हमारी कंपनी के विशिष्ट टोन और मैनर को बिल्कुल भी प्रतिबिंबित नहीं करते हैं। Scale AI के GSM1K शोध के अनुसार, डेटा संदूषण (data contamination) को हटाने पर मॉडलों की गणितीय तर्क क्षमता में 13% तक की गिरावट आई। सामान्य उद्देश्य वाले सूचकांक केवल यह जांचने का एक साधन हैं कि मॉडल ने डेटा को रटा है या नहीं; वे आपको यह नहीं बताते कि आपका मॉडल आपके प्रोडक्शन वातावरण में कैसे काम करेगा।
इन-हाउस वर्क क्यू-सेट के साथ एक गोल्डन डेटासेट बनाना
बजट बर्बाद न करने के लिए, आपको उन वास्तविक कार्य डेटा के आधार पर मूल्यांकन मानदंड स्थापित करने चाहिए जिन्हें आपकी टीम ने पिछले 3 महीनों में संभाला है।
- टीम के भीतर अक्सर होने वाले 20 कार्यों के उदाहरण चुनें, जैसे ईमेल सारांश, कोड रिफैक्टरिंग, आदि।
- प्रत्येक उदाहरण के लिए, परिष्कृत प्रश्न और आदर्श उत्तरों के जोड़े बनाएं।
- प्रश्नों का 40% सामान्य अनुरोधों, 30% नीति उल्लंघन अनुरोधों और 30% ऐसे एज-केस से तैयार करें जिन्हें मॉडल के लिए गलत समझना आसान हो।
सीनियर डेवलपर द्वारा लिखा गया एक आदर्श उत्तर अपने आप में एक स्पष्ट व्यावसायिक नियम बन जाता है। 20 से शुरू हुआ यह डेटासेट बाद में 150 से अधिक रिग्रेशन टेस्ट सूट में विकसित किया जा सकता है।
LLM को परीक्षक के रूप में उपयोग करने वाली मूल्यांकन स्क्रिप्ट
किसी व्यक्ति के लिए मॉडल के उत्तरों को एक-एक करके पढ़ना और स्कोर करना असंभव है। एक ऐसी पायथन स्क्रिप्ट लिखें जो GPT-4o या Claude 3.5 Sonnet को एक परीक्षक (Judge) के रूप में उपयोग करे।
`python
LLM-as-a-Judge मूल्यांकन उदाहरण
def evaluate_response(question, response):
prompt = f"""
नीचे दिए गए उत्तर को निम्नलिखित 3 मानदंडों के आधार पर 0 से 1 के बीच स्कोर करें:
1. सटीकता: क्या जानकारी तथ्यात्मक है?
2. बाधा अनुपालन: क्या अनुरोधित प्रारूप का पालन किया गया है?
3. टोन मिलान: क्या यह कंपनी के दिशानिर्देशों के अनुरूप है?
प्रश्न: {question}
उत्तर: {response}
"""
# API कॉल और परिणाम रिटर्न
`
पोजीशन बायस (position bias) को रोकने के लिए हर बार प्रश्नों के क्रम को मिलाएं। Shopify ने इस तरह के इंटेलिजेंट इवैल्यूएशन इंफ्रास्ट्रक्चर को इन-हाउस अपनाकर इनबॉक्स परिदृश्यों के सत्यापन की गति में 62% की वृद्धि की है और रिस्पॉन्स कंसिस्टेंसी को 93% से अधिक बनाए रखा है।
CI/CD पाइपलाइन में मूल्यांकन स्वचालन को जोड़ना
हर बार मॉडल बदलते समय गुणवत्ता की मैन्युअल रूप से जांच करना समय की बर्बादी है।
- DeepEval या Promptfoo जैसे उपकरणों का उपयोग करके टेस्ट कोड लिखें।
- इसे GitHub Actions से कनेक्ट करें ताकि PR अपलोड होते ही गोल्डन डेटासेट स्वचालित रूप से चल सके।
- इसे इस तरह सेट करें कि यदि औसत स्कोर 0.85 से नीचे चला जाए, तो बिल्ड विफल (fail) हो जाए।
यदि आप इस रूटीन को अपना लेते हैं, तो आपकी टीम भी मॉडल अपग्रेड के दौरान होने वाले रिग्रेशन टेस्टिंग समय को 80% तक कम कर सकती है, ठीक वैसे ही जैसे Duolingo ने अपने मैन्युअल QA संसाधनों में 70% की कटौती की थी। अब, आप केवल 2 सप्ताह में मॉडल अपनाने की व्यवहार्यता को मात्रात्मक रूप से सत्यापित कर सकते हैं। इससे अधिक समय लेना अक्षम है।