스크립트
00:00:00नमस्ते सभी को। आज आने के लिए धन्यवाद। ऐसी बात पर स्वागत है जो किसी भी चीज़ के बारे में नहीं है। माफ़ कीजिए, एक ऐसी बात पर
00:00:21जो पुनःप्राप्ति (रिट्रीवल) के बारे में है। मेरा नाम युवाल है। मैं AI21 में काम करता हूँ, जो कि मुख्य रूप से एक AI शोध लैब है। और आज,
00:00:29मैं आपसे ऐसी चीज़ के बारे में बात करना चाहता हूँ जिसके बारे में ज़्यादातर लोग बात नहीं करना चाहते, और वह है चंकिंग (खंड करना)।
00:00:37और मैं अंत तक आपको यह समझाने की उम्मीद करता हूँ कि चंकिंग मरी नहीं है और इससे जुड़ा कुछ काम अभी भी है।
00:00:45और सच में, यदि आप X, लिंक्डइन या कहीं भी हैं, तो आपने शायद देखा होगा कि RAG मर चुका है, है ना?
00:00:53मुझे लगता है कि लोगों ने हाल ही में MCP को भी मार डाला। और RAG फिर से मर गया है। ऑर्गेनिक रिट्रीवल अमर रहे,
00:01:00ऑर्गेनिक सर्च। और एक ऐसा समय आ जाता है जब आपको खुद से पूछना पड़ता है कि RAG कितनी बार मर सकता है?
00:01:07है ना? और तब भी जब कोई कहता है कि, खैर, RAG मरा नहीं है, जैसे जेरी, लामा इंडेक्स के सीईओ,
00:01:14उन्हें फिर भी किसी चीज़ को मारना ही पड़ता है। और ज़ाहिर तौर पर, वह चीज़ चंकिंग है। जैसे, इसमें निवेश मत करो।
00:01:23ऐसा मत करो। और यही वह कारण है जिसके चलते लोगों ने कहा कि चंकिंग मर चुकी है, क्योंकि हर कोई अब
00:01:30एजेंटिक सर्च का इस्तेमाल कर रहा है, है ना? आपके पास grep है, ls है, find है। ये सभी बेहतरीन हैं,
00:01:36लेकिन यदि आपके पास बहुत सारा डेटा है और आपके पास विभिन्न प्रकार की क्वेरीज़ हैं, तो ये अभी भी पर्याप्त नहीं हैं।
00:01:46बस एक सेकंड। ठीक है। और मुझे लगता है कि इसका मुख्य कारण यह है कि बहुत से लोग बात करना पसंद नहीं करते
00:01:51चंकिंग के बारे में, वह इसलिए क्योंकि यह मज़ेदार हिस्सा नहीं है, है ना? हर RAG या फ़ाइल सिस्टम में,
00:02:00हमारे पास दो चरण होते हैं। पहला चरण उबाऊ होता है, जैसा कि आप मान सकते हैं। वह जो आप शुरुआत में करते हैं,
00:02:07आपके पास बहुत सारा डेटा होता है। आपको इसे प्रीप्रोसेस करना होता है। आपको चंक के साइज़ का फैसला करना होता है। और फिर आपको
00:02:13सब कुछ एक वेक्टर DB में स्टोर करना होता है। दूसरा हिस्सा रिट्रीवल का हिस्सा है, मूल रूप से वह जो
00:02:20प्रति क्वेरी होता है। यह कुछ ऐसा है जिसे करना बहुत आसान है, है ना? इसे ऑप्टिमाइज़ करना बहुत
00:02:25आसान है। आप अपनी सभी क्वेरीज़ का उपयोग कर सकते हैं और फिर आप अधिकतम K, टॉप K के साथ खेल सकते हैं, माफ़ कीजिए, आप खेल सकते हैं
00:02:32शायद हाइब्रिड सर्च के साथ, इस तरह की चीज़ें। रिट्रीवल ट्यूनिंग करना बहुत ज़्यादा मज़ेदार है, है ना?
00:02:40तो मेरा दावा होगा कि अगर हमें किसी चीज़ को मारना है, अगर किसी चीज़ को मरना ही है, तो वह शायद
00:02:47रिट्रीवल ट्यूनिंग है। और हाँ, एजेंटिक सर्च ने शायद उसे मार डाला है। लेकिन फिर भी, एजेंटिक सर्च, भले ही हम
00:02:55इस तथ्य को स्वीकार कर सकें कि इसने रिट्रीवल ट्यूनिंग को मार दिया है, तब भी यह पर्याप्त अच्छा नहीं है जब आपके पास बहुत सारा
00:03:02डेटा हो। इसमें बहुत सारा पैसा खर्च होता है। मुझे नहीं लगता कि मुझे अब इसके बारे में बताने की ज़रूरत है। टोकन मैक्सिंग
00:03:09ऐसी चीज़ है जिसके बारे में हर कोई बात कर रहा है। और इसके नीचे की बात यह है कि यदि डेटा खुद
00:03:17आपके फ़ोल्डर्स, आपकी डिश्रियों में सही तरीके से व्यवस्थित नहीं है, तो आपको फिर भी कुछ ऐसा मिलता है जो
00:03:25अक्षम (इनएफ़िशिएंट) होता है। तो आइए एक समय के अनुकूल उदाहरण के बारे में सोचने की कोशिश करें, है ना? फ़ीफ़ा विश्व कप अभी चल रहा है। और आइए
00:03:33कल्पना करें कि हमारे पास एक ऐसा डेटासेट है जिसमें सारा फ़ीफ़ा विश्व कप शामिल है। तो हर निर्देशिका, मान लीजिए,
00:03:4098 वाला, 2002 वाला, और इसी तरह आगे भी। लेकिन अगर आपकी क्वेरी यह पूछती है कि किस टीम ने सबसे ज़्यादा विश्व कप
00:03:50जीते, तो आप सिर्फ़ किसी फ़ोल्डर में जाकर उस तक नहीं पहुँच सकते। आपको हर फ़ोल्डर में जाना होगा, यह देखना होगा कि कौन जीता,
00:03:57और फिर इन सबका एकत्रीकरण करना होगा, जो कि बहुत अक्षम है। इसका जवाब तुरंत ब्राजील है, मुझे उम्मीद है, कम से कम
00:04:03उस समय के अनुसार जब यह बातचीत हो रही है। तो रिट्रीवल असल में मरा नहीं है। हम इस व्याख्यान में किसी भी चीज़ को नहीं
00:04:13मार रहे हैं। यह प्लंबिंग में बदल गया है। और मुझे लगता है कि हर कोई जो किसी भी RAG सिस्टम पर काम करता है,
00:04:21वह इस भावना को जानता है। पहले दिन, या पहले सप्ताह, या शायद महीने के पहले दिन भी, यदि आप बहुत徹底 (बारीक) हैं,
00:04:29तो आप किसी तरह के चंक साइज़ को चुन रहे हैं। मान लीजिए 512। और शायद आप कुछ ओवरलैप भी डाल रहे हैं,
00:04:36है ना, 10%, 20%, और इसी तरह, हर चीज़ को इंडेक्स कर रहे हैं, और इसके बारे में सब कुछ भूल रहे हैं। और आप ऐसा कर सकते हैं, है ना,
00:04:43हम निश्चित चंकिंग रणनीतियों के बारे में बहुत बात करते हैं, जहाँ यदि आपका चंक कुछ ऐसा है जो बहुत बड़ा है,
00:04:49है ना, तो आपको पूरी तस्वीर मिल जाती है, जो कि अच्छी बात है, लेकिन आप बहुत सारी बारीकियों को खो रहे हैं। और सभी
00:04:54चंक को सार्थक एम्बेडिंग नहीं मिलेंगी। वहीं अगर आप अपने चंक को बहुत छोटा चुनेंगे,
00:05:00तो बड़ी तस्वीर छूट जाएगी। और सच में, यह उतना कुशल नहीं होगा। तो यह हमें क्या बताता है कि
00:05:07चंकिंग मूल रूप से एक लॉसॉ कंप्रेसन (हानिपूर्ण संपीड़न) है। इससे कोई फर्क नहीं पड़ता कि हम क्या कर रहे हैं, हम कुछ न कुछ खो रहे हैं।
00:05:15और मेरा दावा होगा कि कोई सही चंक साइज़ नहीं है। और आप में से कई लोग जो डेटा पर काम करते हैं, कहेंगे,
00:05:23नहीं, लेकिन हमारे पास यह कॉर्पस है, हमारे पास यह डेटासेट है, और हमने वास्तव में इस्तेमाल किया है और अपने सिस्टम को
00:05:29इस डेटा पर बहुत, बहुत अच्छे से काम करने के लिए ऑप्टिमाइज़ किया है। और हम भी ऐसा ही सोचते थे। हमें इसके साथ बहुत अनुभव था,
00:05:35विभिन्न प्रकार के एजेंटों और प्रणालियों और वर्कफ़्लो के साथ कि आप वास्तव में कर सकते हैं,
00:05:40और, है ना, आप बेंचमार्क के बारे में सोचते हैं कि अपने मॉडल को किसी बेंचमार्क पर ओवरफ़िट करना कितना आसान है।
00:05:48लेकिन RAG के साथ नहीं। यह वहाँ नहीं होता है। और आप वास्तव में इसे प्रति डेटासेट ऑप्टिमाइज़ नहीं कर सकते। और मैं आपको
00:05:54दिखाऊँगा कि यह कैसे सुनिश्चित करें कि यह क्वेरी पर निर्भर है। और मैं इतने विश्वास के साथ कैसे कह सकता हूँ? मैं ऐसी बात का दावा कैसे कर सकता हूँ?
00:06:00क्योंकि हमने प्रयोग किए, और हमने इसका परीक्षण किया, और अब मैं इसे आपके सामने प्रस्तुत करने जा रहा हूँ। तो हमने क्या किया,
00:06:06यह कहने के बजाय कि प्रति डेटा सबसे अच्छा चंक साइज़ क्या है, आइए इसका पता लगाते हैं। आइए वास्तव में एक
00:06:14डेटासेट लें और इस डेटासेट को कई बार डुप्लीकेट करें। इस मामले में, छह बार। हर डुप्लीकेशन में,
00:06:23हर उदाहरण में, चंक का साइज़ अलग है। इसलिए हमारे पास 2,000 के चंक साइज़ वाला एक डेटाबेस है,
00:06:281,000 के चंक साइज़ वाला डेटाबेस, और इसी तरह आगे भी। और हमने इसे कई डेटासेट के साथ किया,
00:06:36तो QMSUM, जो कि एक मीटिंग ट्रांसक्रिप्ट डेटासेट है। नैरेटिव QA, जो उपन्यासों पर
00:06:41प्रश्न-उत्तर है। और सेनफेल्ड डेटासेट, जो किसी भी चीज़ के बारे में एक ट्रिविया है। असल में नहीं। यह सेनफेल्ड के ट्रांसक्रिप्ट
00:06:49के बारे में ट्रिविया प्रश्न हैं। यह एक तरह का ट्रोलिंग डेटासेट है जिसे हमने इन-हाउस बनाया है। हमने इसे
00:06:56प्रकाशित भी किया है अगर अंत में किसी को लिंक चाहिए। और हमने यह देखने के लिए उन सभी पर परीक्षण किया कि क्या होता है।
00:07:03और सबसे पहले, हम बस यह देखना चाहते थे कि हर डेटासेट के लिए, कौन सा चंक साइज़ सबसे अच्छा है। और हम
00:07:10यहाँ जो देख रहे हैं वह सेनफेल्ड डेटासेट का एक उदाहरण है, जहाँ अनिवार्य रूप से दो क्वेरीज़, जो प्रकृति में
00:07:16अलग हैं, उस चंक साइज़ के आधार पर अलग-अलग परिणाम प्राप्त करती हैं। तो पहला प्रश्न, जेरी की पसंदीदा शर्ट का
00:07:24नाम क्या है? आप देख सकते हैं कि यह एक बहुत केंद्रित प्रश्न है, एक बहुत विशिष्ट प्रश्न है।
00:07:28इसका उत्तर शायद बहुत सीमित दायरे में होगा। और यह एक ऐसी चीज़ है जिसमें छोटे चंक साइज़
00:07:33सबसे अच्छा प्रदर्शन करेंगे। और आप रैंक एक बनाम 50 से नीचे की रैंक देख सकते हैं। निश्चित 100 टोकन चंक साइज़
00:07:43से लेकर 100 तक। जबकि ऐसा प्रश्न जैसे, जेरी किसे अपने कट्टर दुश्मन और शुद्ध बुराई के रूप में वर्णित करता है,
00:07:50जिसे मैं सेनफेल्ड का इतना बड़ा प्रशंसक भी नहीं हूँ, और मैं जानता हूँ कि यह न्यूमैन है। लेकिन यदि आप ट्रांसक्रिप्ट
00:07:56को देखें, तो यह ऐसी चीज़ नहीं है जिसे आप इतनी आसानी से पा सकें। और आप देख सकते हैं कि यह वास्तव में बदल जाता है, है ना? यदि आप
00:08:02छोटे चंक साइज़ का उपयोग करते हैं, तो आपको उत्तर नहीं मिलेगा। और हमने वास्तव में क्या किया - इन सभी चीज़ों और इन सभी चीज़ों को चलाने के बाद,
00:08:10हमने गौर किया, हमने कहा, क्या होगा अगर हमारे पास एक ओरेकल (दैवीय ज्ञान देने वाला), या यदि आप चाहें तो एक जिन्न हो,
00:08:19जो हमें बता सके कि हर क्वेरी के लिए, रिट्रीवल करने के लिए सबसे अच्छा चंक साइज़ क्या है। यह अनिवार्य रूप से
00:08:25ओरेकल प्रयोग है। क्षमता देखने के लिए हम यही जानना चाहते थे। यह वह नहीं है - हमारे पास पहले से ही
00:08:33यहाँ एक सिस्टम बनाने की क्षमता है। हम सिर्फ यह देखना चाहते हैं कि हमारे पास यहाँ क्या क्षमता है। और आप जो देख सकते हैं
00:08:38यहाँ, ठीक है, इस ग्राफ में, सभी नीली - सबसे पहले, y-अक्ष रिकॉल है। जितना अधिक हो उतना बेहतर।
00:08:46x-अक्ष पुनःप्राप्त चंक की संख्या है। तो यह k बनाम k पर रिकॉल है। आप सभी नीली रेखाएँ देख सकते हैं, शायद
00:08:52अस्पष्ट, लेकिन उनमें से प्रत्येक एक निश्चित चंक साइज़ के लिए प्रदर्शन है। जबकि नारंगी वाली
00:09:01ओरेकल लाइन है। यह है - हर क्वेरी के लिए, हमने इनमें से सबसे अच्छा वाला चुना। और आप देख सकते हैं कि यह
00:09:09कई डेटासेट में होता है। उनमें से कई में, आप वास्तव में देख सकते हैं कि नीली रेखाएँ एक-दूसरे को
00:09:16 काटती हैं, जिसका अर्थ है कि वास्तव में कई डेटासेट के लिए, कोई भी चंक साइज़ वास्तव में हावी नहीं होता है। और क्या
00:09:24ज़्यादा दिलचस्प है कि इसमें बहुत सारी क्षमता है। वह अंतर, जिसे आप नारंगी रेखा
00:09:30और सभी नीली रेखाओं के बीच देख सकते हैं, बड़ा है। और जब मैं बड़ा कहता हूँ, तो यह लगभग 20 से 40 प्रतिशत है सिर्फ
00:09:38चंकिंग पर रणनीति बनाने से। और बहुत सरल रणनीति, अगर मैं यह कहूँ। और यह है - यह अंतर, यह वही है जो
00:09:47512 या 1,000 या जो भी हो, का चुनाव है, है ना? यह संख्या सिर्फ मनगढ़ंत है। यह वह है जो आपको चुकाना पड़ता है। और मुझे
00:09:56लगता है कि यहाँ समस्या यह है - यह थोड़ा पेचीदा है क्योंकि यह एक तरह की सूचना समस्या की तरह है जो हमारे पास नहीं है
00:10:07वह जानकारी जिसकी हमें हर चरण पर आवश्यकता होती है। और इससे मेरा क्या मतलब है? यदि मैं इंडेक्सिंग वाले हिस्से को देख रहा हूँ,
00:10:12जहाँ मेरा चंक साइज़ पर नियंत्रण होता है, तो मुझे नहीं पता कि क्वेरीज़ क्या होंगी।
00:10:18मैं अनुमान लगा सकता हूँ। मैं शायद आकलन कर सकता हूँ। मैं कोशिश कर सकता हूँ। लेकिन मुझे नहीं पता कि क्वेरीज़ क्या होंगी, इसलिए मैं
00:10:25उसके अनुसार अपने चंक साइज़ को समायोजित नहीं कर सकता। और रिट्रीवल वाले हिस्से में, जहाँ मेरी क्वेरीज़ होती हैं,
00:10:31मैं चंक साइज़ को नियंत्रित नहीं कर सकता, है ना? यह पहले से तय है। और ज़ाहिर है कि मैं शुरुआत से
00:10:37प्रति क्वेरी पूरी प्रक्रिया नहीं करूँगा। इसलिए हमने पिछले कार्यों को देखा, जैसे विशेष रूप से एट्रोपिक,
00:10:47प्रासंगिक पुनःप्राप्ति (कॉन्टेक्स्टुअल रिट्रीवल), जहाँ वे हर चंक को समृद्ध करते हैं, और अन्य जो अनिवार्य रूप से हर चंक की
00:10:54लेटेंट स्पेस को बेहतर बनाने की कोशिश करते हैं। लेकिन यह वह दिशा नहीं है जिस पर हम गए। वे सभी सिर्फ इस मॉडल में रहे
00:11:01कि आइए एक निश्चित चंक साइज़ के साथ काम करें, जबकि हमने एक अलग दृष्टिकोण अपनाया। और हमने कहा, एक के लिए प्रतिबद्ध होने के बजाय
00:11:08हम कई के लिए क्यों न प्रतिबद्ध हों? और हम इसे मल्टी-स्केल इंडेक्सिंग कहते हैं। अनिवार्य रूप से, हम सिर्फ
00:11:16वही कर रहे हैं जो हमने पहले देखा है। तो हम डेटाबेस की जाँच कर रहे हैं। हम इसे डुप्लीकेट करते हैं और इसे कई
00:11:26चंक साइज़ या विंडो साइज़ के साथ चंक करते हैं। और फिर, यह इंडेक्सिंग के समय होता है। और फिर रिट्रीवल के समय,
00:11:34हम उन सभी को क्वेरी कर रहे हैं। इसलिए यदि हमारे पास डेटाबेस के n डुप्लीकेट और विंडो साइज़ थे, तो अब हमें
00:11:43प्रति क्वेरी छह अलग-अलग रिट्रीवल कॉल चलाने होंगे। माफ़ कीजिए, n के रूप में छह। और हम उन्हें कैसे मिलाते हैं? हम ज़ाहिर तौर पर
00:11:52ओरेकल का उपयोग नहीं कर सकते, है ना? ओरेकल कुछ ऐसा है जो हमारे पास केवल क्षमता के लिए है। वास्तविक जीवन में,
00:11:57हम जवाब नहीं जानते। लेकिन हम जो कर सकते हैं वह है किसी तरह का विलय एल्गोरिथ्म खोजना। अब, आप कहेंगे,
00:12:06जब हम इसे इस तरह देखते हैं, तो समस्या क्या हो सकती है? यह तथ्य कि हमारे पास n रैंकिंग है,
00:12:13लेकिन रैंकिंग चंक के लिए हैं। और अलग-अलग साइज़ के चंक वास्तव में तुलनीय नहीं हैं,
00:12:19है ना? इसलिए इसके बजाय, हमने कुछ ऐसा करने का विकल्प चुना जो इन दिनों काफी लोकप्रिय है। और बहुत सारे
00:12:25RAG सिस्टम दरअसल ऐसे काम करते हैं कि सिर्फ एक चंक निकालने के बजाय, जब हमें कोई
00:12:30चंक मिलता है, तो हम पूरा डॉक्यूमेंट ही प्राप्त कर रहे होते हैं, है ना? जैसे-जैसे контекст (संदर्भ) विंडो बढ़ती है,
00:12:35हम ज़्यादा से ज़्यादा संदर्भ देना चाहते हैं। और अब, इस मामले में, हमारे पास एक ही डॉक्यूमेंट्स की n रैकिंग्स होती हैं, क्योंकि
00:12:44वे अब चंक्स नहीं रहे। और इसकी हम तुलना कर सकते हैं। इस स्थिति में, आप रिट्रीवल को असल में
00:12:50सिर्फ वोटिंग मान सकते हैं। ठीक है? तो यह पूरी तरह से रैकिंग नहीं है। हमारे पास कोई एक रैंकिंग नहीं है जिसे हम
00:12:56फिर से रैंक कर रहे हों। हमारे पास प्रासंगिक डॉक्यूमेंट्स की n अलग-अलग रैंक्स होती हैं, और हम उन सबको
00:13:03एक में जोड़ना चाहते हैं। इसीलिए हम RRF यानी रेसिप्रोकल रैंक फ्यूजन का इस्तेमाल कर रहे हैं, जो कि काफी
00:13:11हद तक एक सरल फॉर्मूला है। हमने कई चीज़ें आज़माईं। यह सबसे अच्छा काम कर गया। और जैसा कि आप देख सकते हैं, यह कोई
00:13:17मॉडल नहीं है। यह ऐसा कुछ नहीं है जिसके लिए आपको विशेष रूप से कुछ करना पड़े। जैसे, खासतौर पर, यह सिर्फ एक
00:13:23साधारण स्क्रिप्ट है जिसमें बिल्कुल समय नहीं लगता। और पूरा सिस्टम कुछ इस तरह दिखता है। तो हमारे पास
00:13:32n बार इंडेक्सिंग होती है, फिर हम हर डेटाबेस से हर क्वेरी को खोजते हैं, और उन सबको मिलाने के लिए हम RRF का उपयोग करते हैं।
00:13:40और परिणामों के बारे में आप अंदाज़ा लगा सकते हैं कि वे अच्छे हैं। वरना मैं यहाँ खड़ा होकर
00:13:48इतना ज़्यादा आश्वस्त नहीं होता। ठीक है? लेकिन आप देख सकते हैं, हमने कई डेटासेट्स पर परीक्षण किया, QMSum,
00:13:56Narrative QA, Seinfeld, और साथ ही Finance Bench। हमने इन सबका इस्तेमाल किया, और यह हमारे फिक्स्ड साइज से कहीं बेहतर मेल खाता है।
00:14:05आइए इसे एक ग्राफ़ में देखते हैं। यहाँ देखना थोड़ा मुश्किल है, इसलिए मैं इसे धीरे-धीरे समझाऊंगा। यहाँ हर पंक्ति
00:14:12चंक का आकार है। तो आप 50, 100, और इसी तरह आगे देख सकते हैं। सबसे नीचे वाली पंक्ति हमारा तरीका है। यह वाला,
00:14:21जिसे आप सभी से करते हैं और फिर मिलाते हैं। और हर कॉलम किसी चीज़ पर रिकॉल है। तो रिकॉल 1,
00:14:312, 3, 10 तक। आप यहाँ दो बातें देख सकते हैं, है ना? सबसे पहले तो यह कि
00:14:39रिकॉल चाहे जो हो, हमारा तरीका फिर भी जीतता है, जिसे आप बहुत आसान मान सकते हैं, लेकिन यह तथ्य कि आपको
00:14:46 उन सबको मिलाना होगा, वह इतनी सामान्य बात नहीं है। और साथ ही आप देख सकते हैं कि गुणवत्ता
00:14:53वास्तव में बढ़ती है। वह हीट मैप जहाँ आप देख सकते हैं कि यह बहुत ज़्यादा हरा हो जाता है। और फिर से, यह सिर्फ
00:14:58एक ऐसी चीज़ थी जिसे मैं बड़े पैमाने पर दिखाना चाहता था। यहाँ आप सभी चारों डेटासेट्स देख सकते हैं जहाँ हम हासिल करते हैं
00:15:06बेहतर परिणाम। वास्तव में कई चीज़ों में 20, 30, 40 प्रतिशत तक। साथ ही, ऐसे परिणाम भी हैं
00:15:14जो मैंने यहाँ आपको नहीं दिखाए हैं जो MTab पर हैं। आप हमारे ब्लॉग में देख सकते हैं, मैं बाद में लिंक दे दूंगा, हमें वहाँ भी
00:15:22डेटासेट के आधार पर 10 से 40 प्रतिशत के बीच काफी सुधार मिल रहे हैं।
00:15:30अब, मैं नासमझ नहीं हूँ। मैं यहाँ यह दावा करने नहीं जा रहा हूँ कि इसकी कोई कीमत नहीं है। ज़ाहिर है, इसकी एक कीमत है,
00:15:36है ना? कोई भी चीज़ मुफ़्त नहीं मिलती। हर चीज़ के साथ कुछ न कुछ जुड़ा होता है। और हाँ, इसकी कीमत अतिरिक्त मेमोरी के रूप में चुकानी पड़ती है।
00:15:43इसकी लागत O(1) के 2 से 5 के बीच होती है, है ना? अतिरिक्त मेमोरी का एक कांस्टेंट जिसमें आपको डेटाबेस की
00:15:51वे सभी प्रतियां रखनी होंगी। हालांकि, यदि आप इसके बारे में सोचें, तो लेटेंसी के मामले में यह वास्तव में
00:15:59प्रभावित नहीं करता क्योंकि आप सारा रिट्रीवल का काम समानांतर (parallel) रूप से कर सकते हैं। और साथ ही, RRF वाला हिस्सा बहुत ज़्यादा समय नहीं लेता।
00:16:10मैं कहूँगा कि यह एक बहुत अच्छा रिसर्च प्रोजेक्ट था जो हमने किया और हमें वाकई बहुत शानदार परिणाम मिले।
00:16:16अभी और भी काम करने बाकी हैं, है ना? सुधार करने की गुंजाइश है। भविष्य में करने के लिए और काम हैं। और स्पष्ट रूप से,
00:16:23हम यह समझना चाहते हैं कि हमें कितने चंक साइज़ चाहिए और कौन से वाले, है ना? सच कहें तो 50, 100,
00:16:32200 और इसी तरह के साथ काम करना काफी मनमाने ढंग से था। इसलिए हमें यह पता लगाने की ज़रूरत है कि इसकी गणना कैसे करें और
00:16:40यह कैसे जानें कि आपको बिल्कुल कितनी प्रतियों की आवश्यकता है। साथ ही, RRF से आगे बढ़ें, है ना? हम
00:16:46RRF का उपयोग इसलिए कर रहे हैं क्योंकि हमारे द्वारा इस्तेमाल किए गए तरीकों में से इसने सबसे अच्छा काम किया, लेकिन इसका मतलब यह नहीं है कि
00:16:52कोई बेहतर तरीका नहीं है। और अगर मुझे आपको कोई बात बताकर छोड़ना हो, तो मैं कहूँगा कि एजेंट्स ने
00:16:59रिट्रीवल को खत्म नहीं किया। कुछ नहीं मरा। अरे, यह सिर्फ इन्फ्रास्ट्रक्चर है। और बुरी बात यह है कि यह
00:17:072022 का इन्फ्रास्ट्रक्चर है। और सचमुच सरल तरीकों से, आप अपने RAG सिस्टम या डेटा स्टोर करने से जुड़ी किसी भी चीज़ को
00:17:17और फिर 20 से 40 प्रतिशत तक पुनः प्राप्त कर सकते हैं, वह भी बिना किसी ज़्यादा
00:17:26जटिल चीज़ के। इसलिए यदि आप इसके बारे में अधिक पढ़ना चाहते हैं, तो आप ब्लॉग पढ़ सकते हैं। वहाँ एक उदाहरण कोड
00:17:34और Seinfeld डेटासेट भी है। बस इतना ही। मैं युval हूँ। यहाँ आने के लिए आपका बहुत-बहुत धन्यवाद।
00:17:47मैं आपसे अगली बार मिलता हूँ।
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기