AI एजेंट्स के लिए डॉक्यूमेंट कॉन्टेक्स्ट लेयर का निर्माण — जेरी लियू, लामाइंडेक्स

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00आप जानते हैं, आपके SharePoint के भीतर लगातार अपडेट होना, बस RAG नॉलेज-बेस्ड
00:00:04सर्च के लिए। आप जानते हैं, ऐसे मामलों में, आप जाहिर तौर पर चाहते हैं कि यह बहुत ज्यादा गलत न हो,
00:00:08लेकिन अगर यह थोड़ा गड़बड़ भी हो, तो भी ठीक है, क्योंकि आखिरकार अगर आपके पास
00:00:12एक पर्याप्त रूप से अच्छा एजेंट है, तो वह हमेशा दस्तावेज़ में गहराई से जा सकता है और सही
00:00:16साइटेशन और ग्राउंडिंग के साथ जानकारी को सामने ला सकता है। तो इनके लिए, आप जानते हैं, एक
00:00:20स्केलेबल ऑफ़लाइन इंडेक्सिंग पाइपलाइन बनाने में सक्षम होना जिसमें सबसे अच्छी लागत सीमाएं हों,
00:00:25एक ऐसी चीज़ है जो इष्टतम है। हालांकि, VLM-आधारित दृष्टिकोणों के बारे में एक बात यह है कि,
00:00:31वे आमतौर पर बहुत तेज़ नहीं होते हैं, और मुझे लगता है कि कई बार, अगर आपके पास रियल-टाइम
00:00:36फ़ाइल अपलोड हैं, मान लीजिए कि आप Cloud Cowork का उपयोग कर रहे हैं, आप 1,000 दस्तावेज़ अपलोड करते हैं, और आपको
00:00:41इसे एक मिनट के भीतर प्रोसेस करना है, तो कई VLMs द्वारा इसे बड़े पैमाने पर प्रोसेस कराना बहुत कठिन है
00:00:47लगभग हर एक OCR सेवा के लिए, और सच कहें तो, इसमें हमारी सेवा भी शामिल है। मुझे
00:00:52लगता है कि, सामान्य तौर पर, एक अत्यंत कम-लेटेंसी वाले समाधान की भी आवश्यकता होती है
00:00:57ताकि आप वास्तव में चीज़ों को रियल-टाइम में प्रोसेस कर सकें, भले ही आपके पास गहरी विज़ुअल
00:01:03जांच और विश्लेषण के लिए अधिक गहन VLM-सक्षम प्रोसेसिंग हो। और इसलिए, इसे ही मैं
00:01:08एजेंट लूप में होना कहता हूँ। तो, LlamaParse के अलावा, जो हमारी व्यावसायिक सेवा है
00:01:12दस्तावेज़ प्रोसेसिंग और निष्कर्षण के क्षेत्र में, हमने LightParse नामक यह टूल भी बनाया है।
00:01:17यह आश्चर्यजनक रूप से बहुत-बहुत अच्छा है। मुझे नहीं पता कि आप कुछ ट्विटर थ्रेड्स
00:01:21को फॉलो कर रहे हैं या नहीं, लेकिन यह Rust-आधारित है। यह सबसे तेज़ ओपन सोर्स पार्सर है। यह पूरी तरह से
00:01:27मुफ्त है, और इसमें कोई छिपी हुई शर्तें नहीं हैं। मुझे लगता है कि यह MIT या Apache लाइसेंस के तहत है। और
00:01:33यह मूल रूप से सबसे सटीक मार्कडाउन पार्सर है जो VLM या
00:01:37किसी भी प्रकार के गहरे मॉडल का उपयोग नहीं करता है। और इसलिए, यह काफी अच्छा है क्योंकि आप
00:01:43सहायक एजेंट लूप में इसे डिफ़ॉल्ट रूप से उपयोग कर सकते हैं। मान लीजिए कि आप Cloud Code, Cloud Codework, Codex
00:01:48पर बहुत सारे दस्तावेज़ अपलोड कर रहे हैं। और आप चाहते हैं कि यह एक हज़ार PDFs को अत्यंत
00:01:53तेज़ी से प्रोसेस करे। आप हमेशा ऐसा कर सकते हैं। और फिर, LlamaParse या अन्य अग्रणी
00:01:59मॉडलों जैसे VLM-आधारित पार्सर को एक टूल के रूप में जोड़ सकते हैं। तो ये एजेंट क्या करेंगे कि वे पहले
00:02:04सभी दस्तावेज़ों को जल्दी से स्कैन करेंगे। यानी अत्यंत कुशलता से पूरे संदर्भ
00:02:09को सरसरी तौर पर देखेंगे। और फिर, अगर इसे वास्तव में तालिकाओं और चार्टों वाले
00:02:13पेज में गहराई से जाने की आवश्यकता होती है और मूल्यों को अधिक गहराई से समझने की आवश्यकता होती है, तो यह VLM-आधारित टूल का उपयोग करेगा,
00:02:19धीमी प्रोसेसिंग, यह सुनिश्चित करने के लिए कि यह जानकारी को सही ढंग से पढ़े। यह एक-क्लिक
00:02:22इंस्टॉल करने योग्य स्किल के रूप में उपलब्ध है। यह किसी भी अन्य गहरे VLM-आधारित OCR टूल का
00:02:27पूरक है जिसका आप उपयोग करना चाहते हैं। और हमने इसे यथासंभव तेज़ बनाने और आपके पसंदीदा AI एजेंट
00:02:32में आसानी से प्लग इन करने योग्य बनाने के लिए डिज़ाइन किया है।
00:02:35तो, मैंने इन चीज़ों को बहुत तेज़ी से समझाया है, लेकिन मूल रूप से, आप जानते हैं, हमने
00:02:42पार्सिंग लेयर पर काफी समय बिताया है। दस्तावेज़ निष्कर्षण और खोज के संदर्भ में सिमेंटिक
00:02:47और स्टोरेज लेयर के बारे में अन्य सामान्य घटक भी हैं, और बेशक,
00:02:51दस्तावेज़ वर्कफ़्लो भी। मुझे लगता है कि समय की कमी के कारण, मैं शायद कुछ अनसोचे
00:02:57क्षेत्रों को छोड़ दूंगा, जैसे एजेंट-नेटिव डॉक्यूमेंट फ़ॉर्मेट, हिल-क्लाइम्बिंग एज़ ए सर्विस, और अन्य। लेकिन मैं
00:03:01स्लाइड्स का पूरा सेट ऑनलाइन शेयर कर दूंगा। सिमेंटिक और स्टोरेज लेयर के संदर्भ में, आप जानते हैं,
00:03:06दस्तावेज़ पार्सिंग के अलावा, कई उपयोग मामलों में वास्तव में बड़े पैमाने पर दस्तावेज़ों से संरचनात्मक जानकारी
00:03:12वापस प्राप्त करने की भी आवश्यकता होती है। चाहे आप दस लाख इनवॉइस या खर्च की रिपोर्ट
00:03:16या रसीदें या दावों को प्रोसेस कर रहे हों, आपको यह सुनिश्चित करना होगा कि, आप वास्तव में संरचनात्मक
00:03:21आउटपुट वापस प्राप्त करना चाहते हैं जिसे आप डाउनस्ट्रीम डेटाबेस या सिस्टम में डाल सकें। और इसलिए, इनमें से कई
00:03:26उपयोग मामले मूल रूप से इस बात के इर्द-गिर्द घूमते हैं कि, आप कई कागजी कार्रवाई को स्कैन करने
00:03:31और डेटा प्रविष्टि करने में इंसानों द्वारा किए जाने वाले कार्यों को स्वचालित कैसे करते हैं। चाहे
00:03:36वह, फिर से, इनवॉइस, दावे, अनुबंध, रसीदें या अन्य हों। हमने LlamaParse के भीतर भी ये
00:03:41क्षमताएं बनाई हैं। हमारी कई क्षमताएं वास्तव में कम लागत और अत्यधिक उच्च सटीकता के लिए
00:03:47ट्यून की गई हैं। और आपको हर निकाले गए आउटपुट के लिए मूल दस्तावेज़ तक सटीक साइटेशन
00:03:52वापस मिलते हैं। और, बेशक, आप इसे कॉन्फ़िडेंस स्कोर के साथ बड़े पैमाने पर पाइपलाइन में चला सकते हैं।
00:03:56और यह भी, आप जानते हैं, किसी मूल्य को किसी सॉफ्टवेयर
00:04:02सिस्टम में डालने का फैसला करने से पहले यह चिह्नित करने में सक्षम होना कि हम उसके बारे में आश्वस्त हैं या नहीं।
00:04:06डॉक्यूमेंट सर्च भी है, जो मूल रूप से एक विस्तारित टूलसेट है, जैसा कि मैंने उल्लेख किया है,
00:04:12रिट्रीवल, BM25, grep, वेक्टर सर्च, रीडिंग और स्क्रॉलिंग के आसपास। और इसलिए, ये सभी क्षमताएं
00:04:19हमारे कुछ व्यावसायिक प्लेटफ़ॉर्म के साथ-साथ ओपन सोर्स पेशकशों में भी उपलब्ध हैं। लेकिन मैं यह भी
00:04:23चाहता था कि आज की सामान्य अवधारणाओं की एक तस्वीर पेश की जाए। तो, मैं आगे क्या होने वाला है इसके बारे में इस सेक्शन को छोड़ दूंगा और फिर शायद सीधे अंत तक जाऊंगा। मुझे पता है कि मेरा समय थोड़ा ऊपर हो गया है, इसलिए आज समय निकालने के लिए आप सभी का बहुत-बहुत धन्यवाद। और फिर मुझे बस
00:04:36बस, मैं इस हिस्से तक बहुत जल्दी कैसे पहुँचूँ। अरे हाँ, मैं इस हिस्से को छोड़ने जा रहा हूँ। मैं इसे ऑनलाइन डाल दूंगा। अगर आप लोग रुकना चाहते हैं, तो हमारा बूथ LG 47 पर है। और हम आज एक विशाल पिकलबॉल टूर्नामेंट की मेजबानी कर रहे हैं। तो, आपके समय के लिए धन्यवाद।
00:05:06धन्यवाद।

Key Takeaway

AI एजेंटों के लिए उच्च-गति वाले Rust-आधारित पार्सर (LightParse) और गहन VLM मॉडलों (LlamaParse) को एक साथ मिलाकर एक कुशल, सटीक और स्केलेबल दस्तावेज़ प्रोसेसिंग पाइपलाइन बनाई जा सकती है।

Highlights

  • LightParse टूल Rust पर आधारित एक पूरी तरह मुफ़्त और ओपन सोर्स मार्कडाउन पार्सर है, जो VLM का उपयोग किए बिना सबसे सटीक और तेज़ प्रोसेसिंग प्रदान करता है।

  • रियल-टाइम में 1,000 PDF दस्तावेज़ों को एक मिनट के भीतर प्रोसेस करने के लिए VLM आधारित OCR मॉडल की तुलना में LightParse जैसे कम-लेटेंसी समाधान अधिक उपयुक्त हैं।

  • हाइब्रिड आर्किटेक्चर में पहले पूरे संदर्भ का तेज़ स्कैन होता है और आवश्यकता पड़ने पर ही तालिकाओं व चार्टों के गहन विश्लेषण के लिए VLM मॉडल को टूल की तरह इस्तेमाल किया जाता है।

  • LlamaParse से निष्पादित निष्कर्षण में उच्च सटीकता के साथ-साथ आउटपुट के प्रत्येक मान के लिए मूल दस्तावेज़ का सटीक साइटेशन और कॉन्फ़िडेंस स्कोर मिलता है।

Timeline

रियल-टाइम दस्तावेज़ प्रोसेसिंग और LightParse की भूमिका

  • VLM आधारित मॉडल विज़ुअल जांच में सक्षम हैं लेकिन रियल-टाइम में बड़े पैमाने पर दस्तावेज़ों को प्रोसेस करने के लिए ये बहुत धीमे साबित होते हैं।
  • LightParse बिना VLM के सबसे सटीक मार्कडाउन पार्सिंग प्रदान करने वाला सबसे तेज़ ओपन-सोर्स टूल है।
  • एजेंट लूप में तेज़ पार्सर का डिफ़ॉल्ट उपयोग और VLM का टूल के रूप में उपयोग प्रोसेसिंग गति और सटीकता को संतुलित करता है।

SharePoint या Cloud Cowork जैसे सिस्टम में जब 1,000 फ़ाइलें एक मिनट के भीतर अपलोड होती हैं, तो पारंपरिक VLM और OCR सेवाएं लेटेंसी की समस्या पैदा करती हैं। LightParse एक Rust-आधारित MIT/Apache लाइसेंस वाला मुफ़्त पार्सर है जो बिना किसी गहरे मॉडल के अत्यधिक तेज़ी से दस्तावेज़ों को स्कैन करता है। AI एजेंट पहले इस टूल से पूरे संदर्भ को तेज़ी से पढ़ते हैं और केवल जटिल तालिकाओं या चार्टों को समझने के लिए ही धीमे VLM मॉडलों को कॉल करते हैं।

सिमेंटिक लेयर और संरचित डेटा निष्कर्षण

  • लाखों इनवॉइस, रसीदों और दावों से संरचित डेटा निकालकर सीधे डाउनस्ट्रीम डेटाबेस में भेजा जा सकता है।
  • निष्पादित डेटा प्रविष्टि के साथ मूल दस्तावेज़ का सटीक साइटेशन और कॉन्फ़िडेंस स्कोर प्राप्त होता है।
  • डॉक्यूमेंट खोज क्षमताएं BM25, grep, वेक्टर सर्च और रीडिंग टूल्स का एक विस्तारित सेट प्रदान करती हैं।

कागजी कार्रवाई और डेटा प्रविष्टि के मानवीय कार्यों को स्वचालित करने के लिए संरचनात्मक आउटपुट की आवश्यकता होती है। LlamaParse प्लेटफ़ॉर्म कम लागत में उच्च सटीकता के साथ संरचित डेटा निकालता है। किसी मान को सॉफ़्टवेयर सिस्टम में दर्ज करने से पहले उसकी विश्वसनीयता जांचने के लिए कॉन्फ़िडेंस स्कोर का उपयोग किया जाता है, जिससे व्यावसायिक वर्कफ़्लो पूरी तरह से सटीक और स्वचालित हो जाते हैं।

Community Posts

No posts yet. Be the first to write about this video!

Write about this video