उबर के uReview सिस्टम से सीखे गए multi-agent लागत में कमी और hallucination रोकथाम के तरीके
AST पार्सिंग के साथ LLM कॉल से पहले अनावश्यक कोड स्निपेट को फ़िल्टर करने का तरीका
लेगेसी मोनोलिथ में कच्चे गिट डिफ़ और पूरे सोर्स कोड को सीधे डालने से लागत बहुत बढ़ जाती है। 2025 में उबर द्वारा जारी uReview प्लेटफॉर्म ने हर हफ्ते 6 मोनोरेपो से आने वाले 65,000 बदलावों में से 90 प्रतिशत का स्वचालित विश्लेषण किया। हालांकि, बिना स्पष्ट मॉड्यूल सीमाओं वाले कोडबेस पर बिना शुद्ध किए मॉडल को चलाने से टोकन लागत 6 गुना बढ़ जाती है। ग्लोबल फैक्ट्री क्लास को न समझने वाला मॉडल गलत नल पॉइंटर सत्यापन की मांग करता है और hallucination पैदा करता है। उपयोगी टिप्पणियों के न होने पर डेवलपर्स तुरंत नोटिफिकेशन बंद कर देते हैं और चेतावनी के प्रति असंवेदनशील हो जाते हैं।
पायथन के मानक ast मॉड्यूल का उपयोग करके बदले गए फ़ंक्शन सिग्नेचर और प्रभावित स्थानीय चर को निकालने के लिए एक प्रीप्रोसेसिंग इंजन बनाना होगा। स्थैतिक मेटाडेटा को शुद्ध करने के बाद, बदलाव से जुड़े न होने वाले गैर-कार्यात्मक संशोधनों को हैश तुलना द्वारा हटा दिया जाता है। और बदली गई लाइनों वाले सबसे निचले फ़ंक्शन नोड के सिग्नेचर और वास्तविक संशोधित स्टेटमेंट को रिवर्स-पार्स करके एक हल्का JSON पेलोड बनाया जाता है।
लेगेसी मॉड्यूल के 100 मामलों के साथ बेंचमार्क चलाने पर अंतर स्पष्ट हो जाता है। कच्चे फ़ाइल इंजेक्शन में प्रति PR 42,000 टोकन और 0.273 डॉलर खर्च होते हैं। दूसरी ओर, AST प्रीप्रोसेसिंग JSON कम्प्रेशन का उपयोग करने पर यह प्रति PR 6,100 टोकन और 0.068 डॉलर तक कम हो जाता है। API लागत 47.3 प्रतिशत कम हो जाती है और hallucination से जुड़े गलत पॉजिटिव का अनुपात 9.4 प्रतिशत तक गिर जाता है।
स्टेट मशीन स्कीमा के साथ एजेंटों के बीच अनंत लूप को रोकने का तरीका
सुरक्षा एजेंट और बिजनेस लॉजिक एजेंट को एक इंटरैक्टिव ग्रुप चैट में बांधने से वे एक-दूसरे के आउटपुट का जवाब देते हुए अंतहीन पिंग-पोंग लूप में फंस जाते हैं। सिंगल PR विश्लेषण में दसियों मिनट लगते हैं और API लागत आसमान छूती है। एजेंटों को सीधे संवाद करने की अनुमति नहीं दी जानी चाहिए। Pydantic स्कीमा और LangGraph का लाभ उठाकर एक परिमित स्टेट मशीन फ्रेमवर्क का निर्माण करना होगा।
प्रत्येक विशेषज्ञ एजेंट को केवल केंद्रीय पाइपलाइन स्थिति प्राप्त होती है, और अपने डोमेन नियमों के अनुसार निर्धारित परिणामों को केवल एक निश्चित मॉडल प्रारूप में वापस करता है। Pydantic के साथ एजेंट आउटपुट के पहचानकर्ता, फ़ाइल पथ, गंभीरता और विश्वास स्कोर को अनिवार्य बनाने वाले डेटा क्लास को परिभाषित किया जाता है। जब पुनरावृत्ति की संख्या 2 तक पहुँच जाती है या सभी टिप्पणियों का विश्वास स्कोर 0.85 या उससे अधिक पर अभिसरत होता है, तो स्टेट मशीन को जबरदस्ती रोकने के लिए एक सशर्त एज जोड़ा जाता है।
OpenTelemetry GenAI सिमेंटिक कन्वेंशन मानक के अनुसार, प्रत्येक एजेंट के निष्पादन को एक अद्वितीय स्पैन से लपेटना होगा और टोकन उपयोग को वितरित ट्रेसिंग बैकएंड में छोड़ना होगा। इस संरचना को लागू करने से एजेंट के गलत काम को ठीक करने में लगने वाला टेक लीड का डिबगिंग समय प्रति सप्ताह 6 घंटे से अधिक कम हो जाता है।
व्हाइटलिस्ट सत्यापन स्क्रिप्ट के साथ 70 प्रतिशत डेवलपर स्वीकृति दर प्राप्त करने का तरीका
गूगल के इन-हाउस स्टेटिक एनालिसिस टूल Tricoder के संचालन डेटा के अनुसार, टूल कितना भी सटीक इशारा क्यों न करे, अगर डेवलपर को लगता है कि यह सुधारने लायक नहीं है, तो शत्रुता ही बढ़ती है। 5 प्रतिशत से अधिक प्रभावी गलत पॉजिटिव दर वाले चेकर को तुरंत हटा दिया जाता है। स्वचालित समीक्षा टिप्पणियों में से 67 प्रतिशत से अधिक को स्वीकार करने योग्य बनाने के लिए कम जोखिम वाले मॉड्यूल से शुरू करके क्रमिक रूप से विस्तार करने वाला प्रगतिशील रोलआउट किया जाना चाहिए।
DTO सत्यापन परत और शुद्ध फ़ंक्शन जैसी परतों को चुनकर, जिनमें कोई साइड इफेक्ट नहीं होता, टिप्पणियों को छिपाने वाले शैडो मोड को 3 सप्ताह तक चलाया जाता है। 85 प्रतिशत सटीकता की पुष्टि करने के बाद, 3 डोमेन स्क्वॉड के बैकएंड कोड पर इनलाइन टिप्पणियां खोली जाती हैं और स्वीकृति दर को ट्रैक किया जाता है। साप्ताहिक आधार पर फीडबैक लॉग एकत्र करके, स्वीकृति दर 70 प्रतिशत से कम वाले उच्च-गलत पॉजिटिव नियमों को स्वचालित रूप से व्हाइटलिस्ट से बाहर करने और उन्हें आइसोलेशन सूची में भेजने वाली फीडबैक लूप स्क्रिप्ट चलाई जाती है। इस व्हाइटलिस्ट सत्यापन स्क्रिप्ट को पाइपलाइन में एम्बेड करने से, डेवलपर्स को परेशान करने वाले बेकार नियम जल्दी से फ़िल्टर हो जाते हैं, जिससे टीम के भीतर समीक्षा प्रणाली की स्वीकृति दर 70 प्रतिशत तक पहुँच सकती है।