우버의 uReview 시스템에서 배운 멀티 에이전트 비용 절감과 환각 차단법
TuBrief 편집팀
2026년 9월 8일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
लेगेसी मोनोलिथ में कच्चे गिट डिफ़ और पूरे सोर्स कोड को सीधे डालने से लागत बहुत बढ़ जाती है। 2025 में उबर द्वारा जारी uReview प्लेटफॉर्म ने हर हफ्ते 6 मोनोरेपो से आने वाले 65,000 बदलावों में से 90 प्रतिशत का स्वचालित विश्लेषण किया। हालांकि, बिना स्पष्ट मॉड्यूल सीमाओं वाले कोडबेस पर बिना शुद्ध किए मॉडल को चलाने से टोकन लागत 6 गुना बढ़ जाती है। ग्लोबल फैक्ट्री क्लास को न समझने वाला मॉडल गलत नल पॉइंटर सत्यापन की मांग करता है और hallucination पैदा करता है। उपयोगी टिप्पणियों के न होने पर डेवलपर्स तुरंत नोटिफिकेशन बंद कर देते हैं और चेतावनी के प्रति असंवेदनशील हो जाते हैं।
पायथन के मानक ast मॉड्यूल का उपयोग करके बदले गए फ़ंक्शन सिग्नेचर और प्रभावित स्थानीय चर को निकालने के लिए एक प्रीप्रोसेसिंग इंजन बनाना होगा। स्थैतिक मेटाडेटा को शुद्ध करने के बाद, बदलाव से जुड़े न होने वाले गैर-कार्यात्मक संशोधनों को हैश तुलना द्वारा हटा दिया जाता है। और बदली गई लाइनों वाले सबसे निचले फ़ंक्शन नोड के सिग्नेचर और वास्तविक संशोधित स्टेटमेंट को रिवर्स-पार्स करके एक हल्का JSON पेलोड बनाया जाता है।
लेगेसी मॉड्यूल के 100 मामलों के साथ बेंचमार्क चलाने पर अंतर स्पष्ट हो जाता है। कच्चे फ़ाइल इंजेक्शन में प्रति PR 42,000 टोकन और 0.273 डॉलर खर्च होते हैं। दूसरी ओर, AST प्रीप्रोसेसिंग JSON कम्प्रेशन का उपयोग करने पर यह प्रति PR 6,100 टोकन और 0.068 डॉलर तक कम हो जाता है। API लागत 47.3 प्रतिशत कम हो जाती है और hallucination से जुड़े गलत पॉजिटिव का अनुपात 9.4 प्रतिशत तक गिर जाता है।
सुरक्षा एजेंट और बिजनेस लॉजिक एजेंट को एक इंटरैक्टिव ग्रुप चैट में बांधने से वे एक-दूसरे के आउटपुट का जवाब देते हुए अंतहीन पिंग-पोंग लूप में फंस जाते हैं। सिंगल PR विश्लेषण में दसियों मिनट लगते हैं और API लागत आसमान छूती है। एजेंटों को सीधे संवाद करने की अनुमति नहीं दी जानी चाहिए। Pydantic स्कीमा और LangGraph का लाभ उठाकर एक परिमित स्टेट मशीन फ्रेमवर्क का निर्माण करना होगा।
प्रत्येक विशेषज्ञ एजेंट को केवल केंद्रीय पाइपलाइन स्थिति प्राप्त होती है, और अपने डोमेन नियमों के अनुसार निर्धारित परिणामों को केवल एक निश्चित मॉडल प्रारूप में वापस करता है। Pydantic के साथ एजेंट आउटपुट के पहचानकर्ता, फ़ाइल पथ, गंभीरता और विश्वास स्कोर को अनिवार्य बनाने वाले डेटा क्लास को परिभाषित किया जाता है। जब पुनरावृत्ति की संख्या 2 तक पहुँच जाती है या सभी टिप्पणियों का विश्वास स्कोर 0.85 या उससे अधिक पर अभिसरत होता है, तो स्टेट मशीन को जबरदस्ती रोकने के लिए एक सशर्त एज जोड़ा जाता है।
OpenTelemetry GenAI सिमेंटिक कन्वेंशन मानक के अनुसार, प्रत्येक एजेंट के निष्पादन को एक अद्वितीय स्पैन से लपेटना होगा और टोकन उपयोग को वितरित ट्रेसिंग बैकएंड में छोड़ना होगा। इस संरचना को लागू करने से एजेंट के गलत काम को ठीक करने में लगने वाला टेक लीड का डिबगिंग समय प्रति सप्ताह 6 घंटे से अधिक कम हो जाता है।
गूगल के इन-हाउस स्टेटिक एनालिसिस टूल Tricoder के संचालन डेटा के अनुसार, टूल कितना भी सटीक इशारा क्यों न करे, अगर डेवलपर को लगता है कि यह सुधारने लायक नहीं है, तो शत्रुता ही बढ़ती है। 5 प्रतिशत से अधिक प्रभावी गलत पॉजिटिव दर वाले चेकर को तुरंत हटा दिया जाता है। स्वचालित समीक्षा टिप्पणियों में से 67 प्रतिशत से अधिक को स्वीकार करने योग्य बनाने के लिए कम जोखिम वाले मॉड्यूल से शुरू करके क्रमिक रूप से विस्तार करने वाला प्रगतिशील रोलआउट किया जाना चाहिए।
DTO सत्यापन परत और शुद्ध फ़ंक्शन जैसी परतों को चुनकर, जिनमें कोई साइड इफेक्ट नहीं होता, टिप्पणियों को छिपाने वाले शैडो मोड को 3 सप्ताह तक चलाया जाता है। 85 प्रतिशत सटीकता की पुष्टि करने के बाद, 3 डोमेन स्क्वॉड के बैकएंड कोड पर इनलाइन टिप्पणियां खोली जाती हैं और स्वीकृति दर को ट्रैक किया जाता है। साप्ताहिक आधार पर फीडबैक लॉग एकत्र करके, स्वीकृति दर 70 प्रतिशत से कम वाले उच्च-गलत पॉजिटिव नियमों को स्वचालित रूप से व्हाइटलिस्ट से बाहर करने और उन्हें आइसोलेशन सूची में भेजने वाली फीडबैक लूप स्क्रिप्ट चलाई जाती है। इस व्हाइटलिस्ट सत्यापन स्क्रिप्ट को पाइपलाइन में एम्बेड करने से, डेवलपर्स को परेशान करने वाले बेकार नियम जल्दी से फ़िल्टर हो जाते हैं, जिससे टीम के भीतर समीक्षा प्रणाली की स्वीकृति दर 70 प्रतिशत तक पहुँच सकती है।