बेंचमार्क स्कोर पर निर्भर रहने वाले तकनीकी प्रबंधकों के लिए
TuBrief 편집팀
2026년 7월 10일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
यदि आप एक इंजीनियरिंग मैनेजर हैं, तो आप संभवतः हगिंग फेस लीडरबोर्ड या MMLU स्कोर देखना शुरू करेंगे। चलिए ईमानदार बनते हैं। वे संख्याएँ व्यावहारिक कार्य से पूरी तरह असंबंधित हैं। अकादमिक बेंचमार्क कंपनी के भीतर के जटिल डोमेन ज्ञान या हमारी कंपनी के विशिष्ट टोन और मैनर को बिल्कुल भी प्रतिबिंबित नहीं करते हैं। Scale AI के GSM1K शोध के अनुसार, डेटा संदूषण (data contamination) को हटाने पर मॉडलों की गणितीय तर्क क्षमता में 13% तक की गिरावट आई। सामान्य उद्देश्य वाले सूचकांक केवल यह जांचने का एक साधन हैं कि मॉडल ने डेटा को रटा है या नहीं; वे आपको यह नहीं बताते कि आपका मॉडल आपके प्रोडक्शन वातावरण में कैसे काम करेगा।
बजट बर्बाद न करने के लिए, आपको उन वास्तविक कार्य डेटा के आधार पर मूल्यांकन मानदंड स्थापित करने चाहिए जिन्हें आपकी टीम ने पिछले 3 महीनों में संभाला है।
सीनियर डेवलपर द्वारा लिखा गया एक आदर्श उत्तर अपने आप में एक स्पष्ट व्यावसायिक नियम बन जाता है। 20 से शुरू हुआ यह डेटासेट बाद में 150 से अधिक रिग्रेशन टेस्ट सूट में विकसित किया जा सकता है।
किसी व्यक्ति के लिए मॉडल के उत्तरों को एक-एक करके पढ़ना और स्कोर करना असंभव है। एक ऐसी पायथन स्क्रिप्ट लिखें जो GPT-4o या Claude 3.5 Sonnet को एक परीक्षक (Judge) के रूप में उपयोग करे।
`python
def evaluate_response(question, response):
prompt = f"""
नीचे दिए गए उत्तर को निम्नलिखित 3 मानदंडों के आधार पर 0 से 1 के बीच स्कोर करें:
1. सटीकता: क्या जानकारी तथ्यात्मक है?
2. बाधा अनुपालन: क्या अनुरोधित प्रारूप का पालन किया गया है?
3. टोन मिलान: क्या यह कंपनी के दिशानिर्देशों के अनुरूप है?
प्रश्न: {question}
उत्तर: {response}
"""
# API कॉल और परिणाम रिटर्न
`
पोजीशन बायस (position bias) को रोकने के लिए हर बार प्रश्नों के क्रम को मिलाएं। Shopify ने इस तरह के इंटेलिजेंट इवैल्यूएशन इंफ्रास्ट्रक्चर को इन-हाउस अपनाकर इनबॉक्स परिदृश्यों के सत्यापन की गति में 62% की वृद्धि की है और रिस्पॉन्स कंसिस्टेंसी को 93% से अधिक बनाए रखा है।
हर बार मॉडल बदलते समय गुणवत्ता की मैन्युअल रूप से जांच करना समय की बर्बादी है।
यदि आप इस रूटीन को अपना लेते हैं, तो आपकी टीम भी मॉडल अपग्रेड के दौरान होने वाले रिग्रेशन टेस्टिंग समय को 80% तक कम कर सकती है, ठीक वैसे ही जैसे Duolingo ने अपने मैन्युअल QA संसाधनों में 70% की कटौती की थी। अब, आप केवल 2 सप्ताह में मॉडल अपनाने की व्यवहार्यता को मात्रात्मक रूप से सत्यापित कर सकते हैं। इससे अधिक समय लेना अक्षम है।