डॉक्यूमेंट इंटेलिजेंस पर AI टीमें कैसे काम करती हैं: डेटा इनगेस्शन से लेकर एजेंट्स तक — अदित अब्राहम, रिडक्टो
Transcript
00:00:00नमस्ते, क्या सब मुझे सुन सकते हैं? बढ़िया। हमारे पास यहाँ 20 मिनट का छोटा समय है, इसलिए मैं सीधे
00:00:20मुद्दे पर आना चाहता था। मेरा नाम डिट है, मैं Reducto का सह-संस्थापक और CEO हूँ, और आज हम बात करना चाहते थे
00:00:25असल दुनिया में काम करने वाले एजेंट बनाने के एक बेहद व्यावहारिक, लेकिन शायद कम आकर्षक हिस्से के बारे में, जो कि डेटा है। मुझे यकीन है कि आपने आज डेटा पर कई सारे भाषण देखे होंगे। हमने मुख्य रूप से डेटा के सबसे कठिन स्रोतों के साथ काम करने वाले किसी भी व्यक्ति के लिए इंफ्रास्ट्रक्चर बनाने पर ध्यान केंद्रित किया है, जो अनस्ट्रक्चर्ड इमेज, PDF, स्प्रेडशीट और वह सब कुछ है जिसे इंसान रोज़ाना इस्तेमाल करने के आदी हैं। क्या आपमें से किसी ने पहले से ही Reducto का इस्तेमाल किया है या इसे ट्रॉयल किया है? बढ़िया।
00:00:55शुरुआत करने के लिए शायद यह मददगार संदर्भ होगा कि हम एक एजेंटिक डॉक्यूमेंट प्रोसेसिंग प्लेटफॉर्म हैं। इसलिए हम दुनिया की कई अग्रणी AI टीमों को AI एप्लिकेशन और वर्कफ़्लो दोनों बनाने में मदद करते हैं, यह इस बात पर निर्भर करता है कि वे क्या करना चाह रहे हैं।
00:01:08इसमें कई AI नेटिव शामिल हैं जिन्हें आपने शायद आज देखा होगा। इसमें Harveys, Ligors, Rogos जैसे नाम शामिल हैं, लेकिन दुनिया के कुछ सबसे बड़े एंटरप्राइज भी शामिल हैं। और मुझे लगता है कि हम जिस बारे में बात करने जा रहे हैं, उसके लिए यह महत्वपूर्ण संदर्भ है।
00:01:19हम सबसे बड़ी टेक कंपनियों, वैश्विक वित्तीय संस्थानों, बीमा संगठनों के साथ काम करते हैं, ऐसे लोग जिनके पास दशकों पुराना ऐतिहासिक डेटा है जिसे ऐतिहासिक रूप से किसी डेमो संदर्भ से बाहर इस्तेमाल करना वास्तव में बहुत कठिन रहा है।
00:01:34और इन सभी कंपनियों के ज़रिए, इस मोड़ तक, हमने अपने ग्राहकों के लिए कई अरबों दस्तावेज़ों को प्रोसेस किया है। मैं अंत में उस प्लस सिंबल के साथ थोड़ा आलसी हो गया हूँ, लेकिन संख्या बदलती रहती है, इसलिए हम इसे वहीं रहने देंगे।
00:01:46लेकिन मुख्य बात जो हमने इनमें सीखी है और जिस पर मैं आज ध्यान केंद्रित करना चाहता था, वह वास्तव में Reducto का प्रोडक्ट खुद नहीं है।
00:01:51यह उन बारीकियों के बारे में है जो हमने सीखी हैं, जिन्हें उम्मीद है कि आप वास्तव में घर ले जा सकते हैं और अपने काम में भी लागू कर सकते हैं।
00:01:58और मुझे लगता है कि हमने जो काम किया है और जो सीख हासिल की है, वह AI एप्लिकेशन्स के दायरे के इस व्यापक विषयगत संदर्भ में है जो हाल ही में बहुत बदल गया है।
00:02:07सिर्फ जानकारी संश्लेषित करने वाले प्रोडक्ट्स से लेकर काम करने वाले वास्तविक एजेंट्स तक।
00:02:13और इसके साथ, हमने पाया कि कुछ बातें ऐसी हैं जिन पर बात करना सार्थक है।
00:02:16पहला खुद समस्या को समझना है, वह अड़चन जिसका लोग सामना करते हैं, क्यों विशेष रूप से PDF कठिन हैं, भले ही आपने Twitter पर दो दर्जन अलग-अलग PDF प्रोसेसिंग लॉन्च देखे हों।
00:02:26जहाँ हमें विभिन्न टूल्स के साथ शक्तियाँ और कमजोरियाँ मिलती हैं।
00:02:31हमें लगता है कि पारंपरिक CV बनाम VLM के लिए एक सही समय और स्थान है।
00:02:35और फिर अधिक दिलचस्प बात यह है कि मुझे लगता है कि इस टॉक का उत्तरार्द्ध वास्तव में अगले फ्रंटियर पर केंद्रित होगा।
00:02:40लूप में एजेंट्स होने के परिणामस्वरूप हमने जो संभव होते देखा है।
00:02:43विभिन्न प्रकार के कार्यों के लिए हार्नेस का उपयोग करने में सक्षम होने के परिणामस्वरूप हमने जो बातें पाई हैं।
00:02:47और मूल्यांकन जैसी चीज़ों के बारे में हमारी सीख जैसे ही आप RAG से एजेंट प्रोडक्ट बनाने की ओर बढ़ते हैं।
00:02:53लेकिन मैं पहली बात से शुरुआत करूँगा, जो कुछ ऐसा है जिस पर मुझे लगता है कि बहुत जोर दिया गया है।
00:02:58यदि आप कुछ साल पहले AI Engineer में गए होते, तो हर एक टॉक में जो शब्द आपने सुना होता, वह RAG होता।
00:03:04और हर कोई RAG एप्लिकेशन का कोई न कोई रूप बना रहा था।
00:03:07कुछ समय के लिए, सभी एप्लिकेशन्स वास्तव में सूचना संश्लेषण का ही एक रूप थे, है न?
00:03:12आप किसी संदर्भ से जानकारी निकालते थे, चाहे वह एक सही प्रॉम्प्ट हो या उपयोगकर्ता द्वारा अपलोड की गई कोई फ़ाइल।
00:03:19और आपके पास एक सर्च प्रोडक्ट जैसी कोई चीज़ होती थी।
00:03:22आपके पास एंटरप्राइज़ सर्च होता था।
00:03:23आपके पास एक चैटबॉट होता था जो सामग्री के ऊपर सरल प्रश्न-उत्तर करता था।
00:03:27और बस उतना ही था।
00:03:28लेकिन आज, वह चर्चित शब्द जिसे आपने शायद दसियों बार सुना होगा, वह है एजेंट्स।
00:03:34और आपमें से जो इंजीनियर हैं, उन्होंने कई सारे कार्यों के लिए अपने ज़्यादातर एंड-टू-एंड काम क्लाउड कोड या किसी समान टूल से करवाए होंगे।
00:03:41और उसी तरह का बदलाव हर तरह के ऑफिस संबंधी कामों (व्हाइट-कॉलर वर्क) के लिए शुरू हो रहा है।
00:03:46चाहे आप फ़ाइनेंस में हों, इंश्योरेंस में हों या हेल्थकेयर में, लोग स्वायत्त निर्णय लेना शुरू कर रहे हैं।
00:03:51वे एंड-टू-एंड वर्क प्रोडक्ट्स बनाने की कोशिश कर रहे हैं, न कि केवल एक PDF से सवालों के जवाब देना, बल्कि PDF बनाना और मॉडिफाई करना भी।
00:03:58और यह एक बहुत ही अलग नज़रिया है।
00:04:00जिन टूल्स की आपको ज़रूरत है, जिन समस्याओं का आप सामना करते हैं, वे केवल एक रिट्रीवल प्लेटफॉर्म बनाने के मुकाबले बहुत बदल जाती हैं।
00:04:06और इस सब का सामान्य केंद्र यह है कि जब आपके पास ये मल्टी-स्टेप पाइपलाइन होने लगती हैं, तो यह हल करने के लिए और भी अधिक महत्वपूर्ण समस्या बन जाती है।
00:04:18यदि आप केवल प्रश्न और उत्तर कर रहे हैं, तो केवल उत्तर देने के साथ स्पष्ट रूप से एक जोखिम आता है।
00:04:24लेकिन जब एजेंट्स कई निर्णय ले रहे होते हैं जो फ़ाइलों के किसी स्रोत के दौरान बढ़ते जाते हैं, जब वे डेटा के कई स्रोतों को खींच रहे होते हैं, तो खराब इनपुट का जोखिम आपकी पाइपलाइन में वास्तव में व्यापक हो जाता है।
00:04:36और इसी पर हम ध्यान केंद्रित करते हैं।
00:04:38क्योंकि आखिरकार, असल दुनिया में लैंग्वेज मॉडल टूल्स की बहुत सी वैल्यू केवल उसी संदर्भ में लागू होती है जहाँ आप उस इंटेलिजेंस को लागू करते हैं।
00:04:48इसलिए कई एंटरप्राइज़ के लिए, डेटा अनस्ट्रक्चर्ड, बिखरा हुआ और मल्टीमॉडल होता है।
00:04:53यह इस तरह का साफ़-सुथरा व्यवस्थित रिपोजिटरी नहीं है।
00:04:56आपके पास अलग-अलग टीमें और संगठन हैं जो Google Drive, Box और जहाँ भी आपके पास चीज़ें हो सकती हैं, वहाँ चीज़ें डालते हैं।
00:05:04आपके पास ऐसे डेटा फ़ॉर्मैट होंगे जो बाय डिफ़ॉल्ट अनस्ट्रक्चर्ड हैं।
00:05:07आप जरूरी नहीं कि जानते हों कि आपके सूचना संग्रह (कॉर्पस) में क्या है।
00:05:11और आपके सामने इससे जुड़ी हर तरह की डाउनस्ट्रीम समस्याएँ आएँगी।
00:05:14कुछ समस्याएँ पार्सिंग एक्सट्रैक्शन सटीकता की होंगी और वह निश्चित रूप से मायने रखती हैं।
00:05:18लेकिन यह इस जैसी समस्याओं के बारे में भी होगा कि क्या आप सही संदर्भ रिट्रीव कर रहे हैं।
00:05:22यह इस बारे में होने जा रहा है कि आप वास्तव में उस संदर्भ के साथ कैसे इंटरैक्ट करते हैं और उसमें संशोधन लागू करते हैं।
00:05:27और वह चीज़ जिस पर आपने शायद Reducto और इस क्षेत्र के अन्य लोगों को ज़ोर देते सुना होगा, वह यह है कि PDF आश्चर्यजनक रूप से अभी भी एक बहुत ही कठिन समस्या है।
00:05:36मुझे नहीं पता कि आपमें से कोई Surge को फॉलो करता है या नहीं, जो एक डेटा लैब है जो कई फ़ाउंडेशन मॉडल कंपनियों के साथ काम करती है।
00:05:42उनके पास GDP PDF नाम का यह बहुत बढ़िया बेंचमार्क है जहाँ Fable जैसी मॉडल इंटेलिजेंस का वर्तमान फ्रंटियर भी उनके बेंचमार्क पर लगभग 30% पर है।
00:05:52और यह पूरी तरह से इस विचार पर आधारित है कि क्या हमारे पास मॉडल जाकर वास्तव में उन सामग्रियों से निर्धारण कर सकते हैं जो PDF जैसे दस्तावेज़ों में होंगी।
00:06:01और उनके कठिन होने का कारण (मैं एक सेकंड में उस बेंचमार्क पर वापस आऊँगा) यह है कि मौलिक रूप से फ़ाइल फ़ॉर्मैट के रूप में PDF बहुत पुराने हैं और एक बहुत ही अलग संदर्भ में डिज़ाइन किए गए थे।
00:06:11मैं वास्तव में ऐसे लोगों से मिला हूँ जिन्होंने मेरे जीवित रहने की अवधि से भी अधिक समय तक PDF प्रोसेसिंग पर काम किया है।
00:06:16मैं उन लोगों से मिला हूँ जिन्होंने 1990 के दशक की शुरुआत में PDF प्रिंट करने वाले प्रिंटरों के लिए प्रिंटर ड्राइवरों पर काम किया था।
00:06:21और बात बस यही थी।
00:06:22जैसे आप यह दर्शाने में सक्षम होना चाहते थे कि जब आपने इसे मूल रूप से बनाया था तो दस्तावेज़ों पर क्या सही रूप से मौजूद था और अंत में यह प्रिंट करने योग्य हो।
00:06:30आज के बहुत से विचार उस बारे में नहीं हैं।
00:06:33अंततः, हम जो चाहते हैं वह एक मार्कडाउन रिप्रेजेंटेशन जैसी चीज़ है, कुछ ऐसा जिस पर एजेंट्स प्रभावी ढंग से तर्क (reason) कर सकें।
00:06:39और असल दुनिया में, इंसान विज़ुअली बहुत सारे संदर्भों को एनकोड करते हैं।
00:06:44जैसे एक औसत वित्तीय विश्लेषक जो अपनी IB भूमिका में नया स्नातक है, वह यह सोचकर काम नहीं कर रहा है कि क्या एजेंट्स इस डेक का उपयोग करेंगे।
00:06:54वे इन वास्तव में रचनात्मक स्लाइड्स को बना रहे हैं।
00:06:57मुझे यकीन है कि आपने अंडे देने वाली बत्तख वाली सॉफ्टबैंक की स्लाइड्स देखी होंगी।
00:07:01वे विवरण मायने रखते हैं।
00:07:02सही है ना?
00:07:03जैसे बहुत सा डेटा जिस पर आप विचार करेंगे, वह ऐसी तालिका संरचनाएँ होंगी जिनमें शायद साफ़ ग्रिड लाइनें न हों और मर्ज की गई कोशिकाओं को अलग न किया गया हो।
00:07:10आपके पास लाइन चार्ट और ग्राफ जैसी चीज़ें होंगी।
00:07:12आपके पास ऐसी उलझी हुई लिखावट होगी जिसे एक इंसान के रूप में मैं भी अक्सर पढ़ने में संघर्ष करूँगा।
00:07:17और यदि आप उस तरह के जटिल मामलों से निपट रहे हैं तो आपको इसी तरह की समस्या को हल करने की आवश्यकता है।
00:07:22और हमने 2023 में कंपनी शुरू की क्योंकि हमें लगा कि यहाँ जो संभव था उसमें एक बड़ा बदलाव आया था।
00:07:29कुछ समय के लिए, जब लोग किसी भी प्रकार की PDF प्रोसेसिंग समस्या के बारे में सोचते थे, तो यह NLP पाइपलाइन का ही कोई संशोधित संस्करण होता था।
00:07:37आप एक साधारण OCR पास करते थे और फिर उस टेक्स्ट को पोस्ट-प्रोसेस करने का प्रयास करते थे।
00:07:41और यह तब काम करता था जब आपके पास वास्तव में एक समान लेआउट होते थे।
00:07:44सही है ना?
00:07:45जैसे अगर आप जानते हैं कि एक W2 हमेशा एक W2 की तरह ही दिखेगा, तो वह एक सीमित समस्या क्षेत्र है जिसे आप टेम्पलेट बनाकर हल कर सकते हैं।
00:07:51लेकिन VLMs इसलिए दिलचस्प हैं क्योंकि वे मूल रूप से व्यापक क्षमता वाले होते हैं।
00:07:56पहली बार, आपके पास दस्तावेज़ को इंसान की तरह पढ़ने की अवधारणा मौजूद है।
00:08:01आप इस सोच के साथ काम कर सकते हैं कि हमें हर तरह की जटिल चुनौतियों को हल करना है।
00:08:04और इसलिए हमने पाया कि वे हाथ से लिखे टेक्स्ट जैसी चीजों के लिए बेहतरीन थे, जो पारंपरिक OCR कभी नहीं कर सका।
00:08:12लेकिन दूसरी तरफ, हमें नहीं लगता कि वे हर समस्या का एकमात्र समाधान हैं।
00:08:16और अगर आप इस समस्या को बड़े पैमाने पर हल कर रहे हैं, अगर आपकी कंपनी करोड़ों दस्तावेजों से निपट रही है,
00:08:21तो कई तरह की अन्य बातों का ध्यान रखना पड़ता है, जैसे कि निश्चयात्मकता (determinism)।
00:08:25आप अपनी प्रोसेसिंग की कार्यकुशलता पर बहुत ध्यान देते हैं।
00:08:27और इसलिए हम पाते हैं कि कुछ चीजों के लिए पारंपरिक कंप्यूटर विज़न (CV) अब भी बहुत मजबूत है।
00:08:33और इस बात को तब से काफी अनदेखा किया गया है जब से स्वायत्त वाहनों (autonomous vehicles) पर शोध बेहतर हुआ है।
00:08:37ऑब्जेक्ट डिटेक्शन जैसी तकनीकें एक दशक पहले की तुलना में कहीं अधिक उन्नत हैं।
00:08:42और इसलिए हम पाते हैं कि 100 मिलियन से कम पैरामीटर वाले मॉडल दस्तावेज़ के लेआउट को पहचानने के लिए बेहद प्रभावी हैं।
00:08:48आप बिना किसी बड़े फाउंडेशन मॉडल के भी बहुत आगे तक जा सकते हैं।
00:08:52और ये ऐसे मॉडल हैं जो वास्तव में CPU पर चल सकते हैं।
00:08:54आप इन्हें बड़े पैमाने पर चला सकते हैं।
00:08:55आप यह सुनिश्चित कर सकते हैं कि आप क्षेत्र के स्तर पर समझें कि आपके लिए प्रोसेस करना क्या कठिन है।
00:09:00और VLMs अर्थ विज्ञान (semantics) की इस अवधारणा को लाते हैं।
00:09:03आप अपनी पाइपलाइन में होने वाली गलतियों की पहचान कर सकते हैं और उन्हें सुधार सकते हैं।
00:09:09और अर्थ विज्ञान के इसी विचार पर, जब आप इस समस्या को विभाजित करते हैं और आपको स्पष्ट अंदाजा होता है कि जटिल बातें कहां हैं,
00:09:18यदि आपने अपने पेज पर टेक्स्ट को अलग कर लिया है और आप समझते हैं कि हस्तलेखन कहां है,
00:09:21तो आप प्रक्रिया के बीच में एक एजेंट जैसी अवधारणा को शामिल कर सकते हैं।
00:09:25जबकि अतीत में आपके पास समीक्षा के लिए इंसानों की टीम होती थी जो गलतियों को ठीक करती थी,
00:09:29अब VLMs उस विचार को प्रस्तुत कर सकते हैं जिसे हम एजेंटिक OCR (agentic OCR) कहते हैं।
00:09:33हमारे लिए इसका व्यावहारिक रूप यह है कि अगर आपने कभी सर्फ या कर्जर (Cursor) जैसे टूल का उपयोग किया है जो आपके IDE में तेज़ी से संपादन लागू करता है,
00:09:41तो स्पेक्युलेटिव डिकोडिंग की यह अवधारणा होती है जहाँ आप आउटपुट में टोकन स्तर के संपादन लागू कर रहे होते हैं।
00:09:45आप यहाँ भी ऐसा ही सिद्धांत लागू कर सकते हैं, जो सिर्फ Gemini को OCR भेजना नहीं है,
00:09:51ना ही एक सुंदर प्रॉम्प्ट लिखना और उससे विनम्रतापूर्वक मूल से ज्यादा न भटकने का अनुरोध करना है।
00:09:56क्योंकि हम पाते हैं कि जब आप उस तरह का अगला टोकन पूर्वानुमान करते हैं,
00:09:58तो आप पूरी तरह से नए त्रुटि के मामले जोड़ देते हैं जहाँ वास्तव में बुद्धिमान मॉडल
00:10:02चीजों को दस्तावेज़ के अनुसार सटीक रूप से सुधारना बंद कर देंगे।
00:10:05वे "कुल" (total) शब्द देखेंगे और यदि इंसान ने उस तालिका में कोई गलती की है,
00:10:08तो मॉडल कभी-कभी खुद ही तालिका में मानों को जोड़ना शुरू कर देंगे।
00:10:13आप जो चाहते हैं वह केवल टोकन स्तर के आवश्यक संपादनों को सही करना है।
00:10:16शायद आप किसी डॉट बनाम अल्पविराम, या '0' बनाम 'O' में गलती कर दें,
00:10:19इस तरह के विवरण सचमुच बहुत मायने रखते हैं।
00:10:21और यह सवाल है कि हम वास्तव में उसे कैसे प्रस्तुत करें जो एक इंसान ने देखा होता
00:10:25यदि उन्होंने वह दस्तावेज़ पढ़ा होता।
00:10:27तो हम इसे इस तरह देखते हैं कि एजेंटिक OCR प्रक्रिया में मानव की मौजूदगी जैसा ही है,
00:10:34जहाँ पहला इनपुट CV और VLM पार्स के साथ आगे बढ़ता है,
00:10:39लेकिन फिर आपके पास एक सत्यापन और सुधार परत होती है जो एक उच्च विश्वसनीयता वाले आउटपुट की ओर ले जाती है।
00:10:44लेकिन मैंने पहले उल्लेख किया था कि हम समस्याओं की सीमा को केवल पार्सिंग और निष्कर्षण तक सीमित नहीं मानते हैं।
00:10:50और इसका अधिकांश हिस्सा ऐसा दिखता है कि मुझे लगता है कि अपनी पाइपलाइन के विवरण पर विचार करना महत्वपूर्ण है,
00:10:56भले ही आपके पास डॉक्यूमेंट से मार्कडाउन की बेहतरीन पाइपलाइन हो।
00:10:59और इसका एक बेहतरीन उदाहरण यह है कि यदि आपने किसी भी प्रकार का RAG प्लेटफॉर्म बनाया है,
00:11:04तो संभवतः आपने तालिकाओं (tables) जैसी चीजों पर विचार किया होगा।
00:11:07ऐसी बहुत सी चीजें हैं जिन्हें आप मार्कडाउन जैसी किसी चीज में अच्छी तरह से एनकोड कर सकते हैं।
00:11:13लेकिन इस टेबल जैसी चीज़ों में, जहाँ मर्ज की गई कोशिकाएँ बहुत अर्थ दर्शाती हैं,
00:11:18उस तरह की संरचना को बनाए रखना काफी मायने रखता है।
00:11:20और यह मॉडल की कोई सीमा नहीं है।
00:11:22LLMs उसी टेबल के HTML स्ट्रक्चर को समझने में कमाल के हैं,
00:11:26लेकिन आप बहुत सारे टोकन भी बर्बाद कर रहे हैं, और यह तेजी से महँगा हो जाता है।
00:11:29और जाहिर तौर पर इसके दूसरे पहलू को देखें,
00:11:31तो आप साधारण टेबल्स को HTML में एनकोड नहीं करना चाहेंगे,
00:11:35क्योंकि फिर आपके पास बहुत सारे अनावश्यक HTML टैग्स आ जाते हैं।
00:11:38इसलिए हमने इसे एक तरह की गत्यात्मक (डायनामिक) समस्या के रूप में देखा
00:11:42कि जब आपके पास एक साधारण टेबल हो, तो बहुत बढ़िया, हम मार्कडाउन में उस डेटा का अनुमान लगा सकते हैं।
00:11:47जब आपके पास अधिक जटिल टेबल हो, तो आप HTML जैसी किसी चीज़ का उपयोग कर सकते हैं,
00:11:50लेकिन आपकी पाइपलाइन में केवल लैंग्वेज मॉडल्स ही एकमात्र विचारणीय विषय नहीं होने चाहिए।
00:11:55यदि आप एम्बेडिंग से जुड़ा कुछ भी कर रहे हैं,
00:11:57तो आपको उस संदर्भ को पुनः प्राप्त करने (रिट्रीवल) की द्वितीयक समस्या भी होगी।
00:12:01वही टेबल जो मैंने आपको पहले दिखाई थी,
00:12:03यदि आप उसका HTML रूप देखें, तो वह बहुत ही अस्त-व्यस्त है।
00:12:08उस स्निपेट्स का अधिकांश भाग केवल HTML टैग्स ही हैं।
00:12:11यह बस दस्तावेज़ की संरचना को वर्गीकृत कर रहा है।
00:12:14और दुर्भाग्य की बात यह है कि जहाँ कुछ सामान्य मूल्यांकनों में,
00:12:17आपके पास ऐसी सामग्री हो सकती है जो वास्तव में मॉडल के लिए काम करने की कोशिश कर रही है
00:12:22और सटीक रूप से बताती है कि आप क्या खोज रहे हैं।
00:12:24वास्तविक दुनिया का व्यक्ति टेबल में मानों (मानों की सूची) की गणना नहीं करता है।
00:12:28वे बस पूछते हैं कि समय के साथ राजस्व कैसे बदला?
00:12:30और वे मान लेते हैं कि प्रासंगिक होने पर आप सही टेबल प्राप्त कर लेंगे।
00:12:34और जहाँ लैंग्वेज मॉडल्स उस टेक्स्ट को प्रभावी ढंग से समझ सकते हैं,
00:12:37यदि आप किसी बड़े संग्रह से डेटा निकाल रहे हैं,
00:12:39तो हम पाते हैं कि एम्बेडिंग मॉडल्स को प्राकृतिक भाषा के इंसान के प्रॉम्प्ट
00:12:44और HTML टैग्स व संख्याओं के इस उलझे हुए समूह को आपस में जोड़ने में बहुत कठिनाई होती है।
00:12:47और इसलिए एक बड़ी चीज़ जो आप कर सकते हैं और जिसमें बहुत कम प्रयास लगता है,
00:12:51वह है एक ऐसा प्रतिनिधित्व तैयार करना जो खुद एम्बेडिंग मॉडल के लिए अधिक अनुकूल हो।
00:12:55उसी टेबल को लेकर,
00:12:56आप उस टेबल का एक प्राकृतिक भाषा रूप तैयार करते हैं,
00:12:58ताकि आपको दोनों दुनिया का बेहतरीन फायदा मिल सके।
00:13:00जब आप तर्क करने के लिए इसे मॉडल में पास कर रहे होते हैं,
00:13:02तो आप HTML टेबल रूप का उपयोग कर रहे होते हैं,
00:13:04और जब आप यह सुनिश्चित करने की कोशिश कर रहे होते हैं कि आप सही स्निपेट्स निकालें,
00:13:07तो आप उस प्राकृतिक भाषा वाले ब्लॉक का उपयोग कर रहे होते हैं।
00:13:12इसके अलावा, यह विचार भी है कि करने के लिए बहुत कुछ है जो केवल पार्सिंग और निष्कर्षण नहीं है।
00:13:18और मुझे लगता है कि ऐतिहासिक रूप से उद्योग का बहुत ध्यान पार्सिंग और निष्कर्षण पर रहा है
00:13:22क्योंकि हम सोचते हैं कि वहाँ एक बड़ा सुधार संभव है।
00:13:25और मैंने पहले GDP PDF बेंचमार्क के बारे में बात की थी,
00:13:30जो मुझे लगता है कि इस बात का एक बेहतरीन उदाहरणात्मक नमूना है कि आप क्या देख सकते हैं
00:13:34अपने डेटा पाइपलाइन को सुधारने के परिणाम के रूप में।
00:13:37तो हमने पाया कि यदि आप वही बेंचमार्क लेते हैं
00:13:40जिसका मैंने पहले उल्लेख किया था, दुर्भाग्य से हम फेबल पर इसका परीक्षण नहीं कर सके
00:13:43क्योंकि हमारा एक्सेस बंद कर दिया गया था।
00:13:46लेकिन अगर आप अन्य मॉडलों पर परीक्षण करते हैं और इसे मूल PDF दोनों प्रदान करते हैं
00:13:50और इसके साथ PDF का एक संरचित (स्ट्रक्चर्ड) रूप भी देते हैं,
00:13:52जैसे कि यहाँ पार्स परिणाम, तो सभी मॉडलों में,
00:13:55चाहे वह Gemini हो, Anthropic हो, या OpenAI हो,
00:13:58आप पाते हैं कि केवल बेहतर इनपुट देने से अंतिम LLM का प्रदर्शन वास्तव में सुधर जाता है।
00:14:04और यह इस हद तक है कि GPT 5.5 और Opus जैसे मॉडल
00:14:09वास्तव में बिना किसी अतिरिक्त प्रयास के फेबल जैसी चीज़ों से बेहतर प्रदर्शन करते हैं,
00:14:12न केवल सटीकता के आधार पर, बल्कि बेहतर इनपुट देने के परिणामस्वरूप,
00:14:17मॉडलों को कम रीज़निंग टोकन्स का उपयोग करने की आवश्यकता होती है।
00:14:20उनका ध्यान डेटा को समझने पर कम और वास्तविक आउटपुट पर अधिक होता है।
00:14:24और परिणामस्वरूप, वे अंततः लेटेंसी (विलंबता) को कम करते हैं
00:14:27और अधिक तेज़ी से सही उत्तर तक पहुँचते हैं।
00:14:30लेकिन एक बार जब आपके पास उस प्रकार की पाइपलाइन हो जाती है
00:14:33और आपने अपनी पार्सिंग परत में सब कुछ जांच लिया है,
00:14:37तो बहुत से मानवीय कार्यों के लिए यह आवश्यक होगा
00:14:41कि आपके पास मौजूद सामग्री के दायरे को वास्तव में समझा जाए,
00:14:44इसे उपयुक्त पाइपलाइन पर भेजा जाए और उस समस्या को सुलझाया जाए,
00:14:48या अंत में अपने दस्तावेज़ों को संपादित और संशोधित किया जाए।
00:14:51और इसलिए हमने इसे इस समस्या के रूप में देखने की कोशिश की
00:14:54कि आप यह कैसे सुनिश्चित करते हैं कि लैंग्वेज मॉडल का दस्तावेज़ के साथ हर संपर्क
00:14:57उतना ही प्रभावी हो जितना कि किसी इंसान द्वारा किया गया होता।
00:15:00यदि आप कोई फॉर्म भर रहे हैं, तो आप यह कैसे सुनिश्चित करते हैं कि आपके पास सटीक जानकारी हो
00:15:03कि आप फ़ील्ड कहाँ भरते हैं?
00:15:05और ऑर्केस्ट्रेशन के पक्ष में इसका एक बहुत अच्छा उदाहरण यह है
00:15:08कि मुझे लगता है वर्गीकरण का विभाजन LLM से उसका सर्वश्रेष्ठ काम कराने का
00:15:12एक बहुत ही कम आंका गया तरीका है।
00:15:14जाहिर है, आप बस जितना चाहें उतना संदर्भ डाल सकते हैं।
00:15:17और यदि आप तिनके के ढेर में सुई ढूंढने जैसा कोई परीक्षण कर रहे हैं,
00:15:19तो वह ठीक हो सकता है।
00:15:20लेकिन व्यवहार में, केवल टोकन इकोनॉमिक्स के अलावा भी गुणवत्ता में गिरावट देखी जाती है
00:15:24जो बहुत अधिक जानकारी पास करने के परिणामस्वरूप होती है।
00:15:28और इसके बजाय, हम पाते हैं कि आप इस बात पर विचार करके काफी बढ़त हासिल कर सकते हैं
00:15:33कि सही दस्तावेज़ों को सही प्रकार की पाइपलाइन में
00:15:36कैसे वर्गीकृत किया जाए?
00:15:38और बड़े दस्तावेज़ों के लिए भी, आप यह कैसे सुनिश्चित करते हैं कि आप केवल
00:15:41उन्हीं स्निपेट्स को पास कर रहे हैं जो वास्तव में प्रासंगिक हैं?
00:15:43हम ऐसे उपयोग के मामले देखते हैं जहाँ लोगों के पास कागजी डाक जैसी चीज़ें होती हैं,
00:15:47और कागजी डाक के ये पैकेट सैकड़ों पन्नों लंबे हो सकते हैं।
00:15:50जरूरी नहीं कि आप जानते हों कि इसके अंदर क्या होने वाला है।
00:15:53आपको ऐसी समस्याएँ हो सकती हैं जैसे किसी व्यक्ति ने सामग्री को मिला दिया हो,
00:15:57और मॉडल से उस तरह का काम करवाना उस काम से ध्यान भटकाने जैसा है
00:16:01जिसे आप वास्तव में हासिल करने की कोशिश कर रहे हैं,
00:16:03जो कि कागजी डाक से डेटा निकालना,
00:16:05उस पर विचार करना, या कोई निर्णय लेना हो सकता है।
00:16:10फिर से, मैंने पहले उल्लेख किया था कि दूसरा भाग, मुझे लगता है,
00:16:13एक अधिक रोचक पहलू है, जो यह है कि एक बार जब आपके पास
00:16:16प्रारंभिक वर्गीकरण और विभाजन परत हो जाती है,
00:16:20और आपने छँटाई को समझ लिया है।
00:16:22मुझे लगता है कि जिस चीज़ को लेकर हम एक टीम के रूप में वास्तव में उत्साहित हैं
00:16:26वह यह है कि एजेंट हार्नेस एक बहुत ही रोचक सीमा रेखा रही है
00:16:29उन समस्याओं से आगे बढ़ने के लिए जो पारंपरिक रूप से कठिन और अनसुलझी समस्याएँ हुआ करती थीं।
00:16:34इसका एक अच्छा उदाहरण जिसके बारे में मैं कुछ ही देर में बात करूँगा
00:16:37वह है लाइन चार्ट जैसी चीज़ें।
00:16:39हम दुनिया के कई सबसे बड़े हेज फंडों के साथ काम करते हैं,
00:16:41और लाइन चार्ट जैसी चीज़ें ऐतिहासिक रूप से वास्तव में
00:16:43बहुत कठिन रही हैं क्योंकि एक तो, वे इमेज फॉर्मेट में होती हैं।
00:16:46लेकिन दूसरा, इसमें पिक्सेल स्तर की सूक्ष्मता बहुत अधिक होती है कि अगर आप
00:16:49पारंपरिक विज़न एनकोडर के साथ कुछ भी कर रहे हैं,
00:16:52तो संभावना है कि आप उसे खो देंगे।
00:16:53आपको राजस्व के रुझान का एक अनुमानित प्लॉट तो मिल जाएगा,
00:16:55लेकिन आपको व्यक्तिगत डेटा बिंदु नहीं मिलेंगे।
00:16:57और इसलिए हम इस बात पर विचार कर रहे हैं कि हम एजेंटों को क्षमता कैसे दें
00:17:00ताकि उनके पास उस विशिष्ट प्रकार की समस्या को हल करने के लिए सही उपकरण हों
00:17:04जिसे आप देख रहे हैं।
00:17:05चार्ट निष्कर्षण के मामले में, बाईं ओर का चार्ट एन्कोड करता है
00:17:09डेटा की एक बहुत बड़ी टेबल।
00:17:11यदि आप वास्तव में हर एक पिक्सेल को प्लॉट करने की कोशिश करते,
00:17:14तो यह वास्तव में बहुत कठिन होता।
00:17:16लेकिन किसी मॉडल के लिए बीच की रेखाओं की जटिलताओं का
00:17:19अनुमान लगाना भी कठिन होगा।
00:17:22और ऐसा कोई मॉडल नहीं है जो बिना किसी तैयारी के
00:17:24इसे सिंगल-शॉट समस्या के रूप में कर सके।
00:17:25दाईं ओर जो आप देख रहे हैं वह मार्कडाउन टेबल का एक पुनर्गठन है
00:17:28जिसे हम मूल लाइन चार्ट से जनरेट करने में सक्षम हैं।
00:17:30शुरुआती लाइन चार्ट से जनरेट कर पाए हैं।
00:17:32और यहाँ तक पहुँचने का केवल एक ही तरीका था,
00:17:34कि हमारे पास हर तरह के टूल्स वाला एक एजेंट हो।
00:17:36इसके पास अपना कोड इंटरप्रेटर है।
00:17:37इसके पास अपने जनरेट किए जा रहे चार्ट को विज़ुअलाइज़ करने की क्षमता है।
00:17:40और यह बार-बार प्रक्रिया से गुजर रहा है।
00:17:41यह लाइन चार्ट में बार-बार गलतियों को ढूँढ रहा है,
00:17:45जब तक कि यह अंतिम आउटपुट तक न पहुँच जाए।
00:17:47यह बात स्ट्रक्चर्ड एक्सट्रैक्शन जैसी समस्याओं पर भी लागू होती है,
00:17:51जहाँ कुछ समय से हमारे पास यह
00:17:53डॉक्यूमेंट टू स्ट्रक्चर्ड आउटपुट फीचर मौजूद है।
00:17:55लेकिन आप इसे एक कदम और आगे ले जा सकते हैं
00:17:57इसी तरह के कार्य के लिए एक एजेंट हार्नेस का उपयोग करके।
00:18:00आप एक पैरेंट एजेंट से सब-एजेंट्स के पालन के लिए
00:18:03वैलिडेशन क्राइटेरिया तय करवा सकते हैं।
00:18:05और इसका मतलब है कि अगर आपके पास CBP फॉर्म जैसी कोई चीज़ है
00:18:09जिसमें दसियों हज़ार फ़ील्ड्स हैं,
00:18:11तो यह उस तरह की समस्या है जहाँ आपको अंततः
00:18:13कई ऐसी खामियाँ मिलती हैं जो छिपी हुई होती हैं।
00:18:15जैसे कुछ कंटेंट या रो छूट जाना।
00:18:17और MicroOne ने आज सुबह इस क्षेत्र में
00:18:20एक बहुत अच्छा बेंचमार्क जारी किया है,
00:18:23जहाँ बाज़ार में यह विभाजन दिखता है।
00:18:24मैक्स रीज़निंग वाले फ्रंटियर मॉडल बहुत ही सटीक हैं।
00:18:28यानी अगर उन्होंने किसी रो को एक्सट्रेक्ट किया है,
00:18:30तो संभावना है कि वह गलत या फर्जी रो नहीं है।
00:18:31मतलब उन्होंने उसे बिल्कुल सही एक्सट्रेक्ट किया है।
00:18:33लेकिन वे पूरे बेंचमार्क में कई कंटेंट चुपचाप छोड़ देते हैं।
00:18:37रीकॉल में बहुत ज़्यादा संघर्ष करना पड़ता है।
00:18:39दूसरी तरफ, कई समर्पित डॉक्यूमेंट प्रोसेसिंग सेवाएं
00:18:42सटीकता के मामले में फ्रंटियर मॉडल से पीछे हैं,
00:18:46लेकिन रीकॉल के मामले में उस अंतर को पाट देती हैं।
00:18:48और इसलिए हमेशा इस तरह का समझौता करना पड़ता था।
00:18:51और केवल एजेंट हार्नेस के ज़रिए ही हम इस तरह के कार्य के लिए
00:18:54सटीकता और रीकॉल दोनों का उच्च स्तर
00:18:57हासिल करने में सक्षम हो सके।
00:19:00आखिरी बात, और शायद इस टॉक की सबसे महत्वपूर्ण बात यह है
00:19:04कि दिन के अंत में, आपके सभी फैसलों का आधार
00:19:09मूल्यांकन (evals) ही होना चाहिए।
00:19:10और हम अपने प्रोडक्ट के बारे में जैसा सोचते हैं, यह उसका एक बड़ा हिस्सा रहा है।
00:19:12यह बात उन रेडीमेड डेटासेट्स पर लागू होती है जिन पर आप मूल्यांकन करते हैं,
00:19:16और साथ ही रियल-टाइम प्रोडक्शन मॉनिटरिंग जैसी चीज़ों पर भी।
00:19:19क्योंकि आपका प्रोडक्शन डेटा अलग होगा
00:19:21आपके पास मौजूद किसी भी अन्य टेस्ट सेट से।
00:19:25और मुझे सच में लगता है कि मूल्यांकन को
00:19:28केवल एक ऊपरी स्तर के दृष्टिकोण के रूप में न देखना महत्वपूर्ण है,
00:19:30बल्कि जिन बेहतरीन टीमों के साथ हम काम करते हैं,
00:19:33वे अपने पाइपलाइन के हर चरण का सूक्ष्म स्तर पर मूल्यांकन करती हैं।
00:19:36पहली चीज़ यह हो सकती है कि आप यह सुनिश्चित करना चाहें
00:19:38कि आपकी पाइपलाइन में जाने वाले इनपुट्स बेहतरीन हों।
00:19:40और जाहिर है कि आपको अपनी पार्सिंग पाइपलाइन जैसी चीज़ों को भी इवेल्युएट करना चाहिए।
00:19:43लेकिन एक बहुत ही खराब रिट्रीवल पाइपलाइन के साथ परफेक्ट पार्सिंग भी
00:19:47कोई काम नहीं आएगी, अगर आप सही कॉन्टेक्स्ट पास नहीं कर रहे हैं।
00:19:50और इसलिए यह ज़रूरी है कि आप बारीकियों पर ध्यान दें,
00:19:52जैसे कि आपकी रिट्रीवल पाइपलाइन,
00:19:54पाइपलाइन के अंत में आपकी फॉर्मेटिंग,
00:19:56और आखिरकार सबसे अहम बात यह है कि
00:19:58क्या आप अंतिम एजेंट की परफॉर्मेंस को बेहतर बना पा रहे हैं।
00:20:03मैं अपनी बात इस बात के साथ खत्म करूँगा कि हम किस दिशा में आगे बढ़ रहे हैं
00:20:06और हमने इंडस्ट्री को किस दिशा में जाते देखा है।
00:20:08सबसे पहली और मुख्य बात मुझे यह लगती है कि जैसे-जैसे एजेंट्स और बेहतर होते जा रहे हैं,
00:20:12आप उस तरह की डिटर्मिनिस्टिक पाइपलाइन से हट सकते हैं
00:20:15जो आपके पास कुछ साल पहले हुआ करती थी।
00:20:17हमारे बहुत से ग्राहक असल में अपने एजेंट के लिए एक तरह का फाइल सिस्टम बना देते हैं
00:20:20ताकि वह उसमें नेविगेट कर सके
00:20:22और एजेंट को खुद तय करने देते हैं कि वह किस तरह के टूल्स का इस्तेमाल करना चाहता है।
00:20:25इसलिए हम एक ऐसा CLI बनाते हैं जहाँ एक एंड-टू-एंड पाइपलाइन बनाने के बजाय,
00:20:28जहाँ डॉक्यूमेंट्स हमेशा एक ही विशिष्ट फ्लो का पालन करते हैं,
00:20:32एजेंट खुद तय करेगा कि क्या उसे किसी खास तरह का डॉक्यूमेंट पढ़ने की ज़रूरत है,
00:20:35और वे उसे दो हिस्सों में बाँट देंगे।
00:20:38एक कंटेंट फील्ड है जिसे एजेंट ज़रूरत के मुताबिक पढ़ सकता है,
00:20:41लेकिन दूसरा वह सारा मेटाडेटा है जिसकी आपको ज़रूरत हो सकती है।
00:20:44अगर आप साइटेशन जैसी चीज़ें कर रहे हैं, तो आपको बाउंडिंग बॉक्स चाहिए हो सकते हैं,
00:20:47इत्यादि।
00:20:50मैं एडिटिंग वाले इस हिस्से को छोड़ दूँगा।
00:20:52मुझे लगता है कि यहाँ काफी दिलचस्प काम हो रहा है।
00:20:54हम पहले ही इसका कुछ हिस्सा जारी कर चुके हैं, लेकिन अगले कुछ महीनों में,
00:20:57आप हमें डॉक्यूमेंट जनरेशन जैसी चीज़ों पर और ज़्यादा ध्यान केंद्रित करते हुए देखेंगे।
00:21:01लेकिन आज के रीकैप के लिए—और आपके समय के लिए मैं सच में आभारी हूँ—
00:21:04पहला, मैं अत्यधिक सुझाव दूँगा कि आप पार्सिंग की समस्या को छोटे हिस्सों में बाँटें।
00:21:08जहाँ तक संभव हो, आपको इसे सही काम के लिए सही टूल की तरह सोचना चाहिए
00:21:11ताकि आप सटीकता, लागत और लेटेंसी के उस सही संतुलन को हासिल कर सकें।
00:21:16दूसरा, मुझे लगता है कि एजेंटिक वेरिफिकेशन इंडस्ट्री में पिछले कुछ समय का सबसे बड़ा बदलाव है,
00:21:21और यह सुनिश्चित करने का बहुत अच्छा अवसर है कि आप ऐसी पाइपलाइन्स बना रहे हैं जो प्रोडक्शन में काम करती हैं।
00:21:26तीसरा, मुझे लगता है कि इसमें बहुत कम मेहनत लगती है, लेकिन छोटी-छोटी बारिकियों से बहुत बड़ा सुधार मिल सकता है,
00:21:31जैसे कंज्यूमर के हिसाब से डेटा को फॉर्मेट करना।
00:21:34या इसी तरह, मुझे लगता है कि सिर्फ डेटा प्रोसेसिंग के बारे में ही नहीं,
00:21:39बल्कि डेटा ऑर्केस्ट्रेशन के बारे में सोचना भी बहुत, बहुत ज़रूरी है।
00:21:41इसलिए आपको हमेशा क्लासिफाई और स्प्लिट्स जैसे टूल्स को
00:21:44अपनी पाइपलाइन को बेहतर बनाने के तरीके के रूप में सोचना चाहिए।
00:21:46पांचवाँ, यह सुनिश्चित करें कि आप हर स्टेज पर इवेल्युएट करें।
00:21:49और छठा, इस बारे में सोचें कि आपके लिए अगला मुकाम कैसा दिखता है,
00:21:52क्योंकि मुझे लगता है कि आज के दौर की ज़्यादातर सफल कंपनियाँ उस तरीके से काफी अलग हट चुकी हैं
00:21:56जो हम दो-तीन साल पहले किया करते थे।
00:21:59लेकिन अगर आपके कोई सवाल हैं, तो कृपया किसी भी समय संपर्क करने में संकोच न करें।
00:22:03मेरा ईमेल आईडी बस firstname@reducto.ai है।
00:22:06और अगर हम आपके यूज़ केस के लिए मददगार हो सकते हैं, तो आप हमारी वेबसाइट पर भी संपर्क कर सकते हैं।
00:22:10धन्यवाद।
Community Posts
No posts yet. Be the first to write about this video!
Write about this video