अब 2022 की तरह चंकिंग करना बंद करें — युवल बेल्फर, AI21 लैब्स

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00नमस्ते सभी को। आज आने के लिए धन्यवाद। ऐसी बात पर स्वागत है जो किसी भी चीज़ के बारे में नहीं है। माफ़ कीजिए, एक ऐसी बात पर
00:00:21जो पुनःप्राप्ति (रिट्रीवल) के बारे में है। मेरा नाम युवाल है। मैं AI21 में काम करता हूँ, जो कि मुख्य रूप से एक AI शोध लैब है। और आज,
00:00:29मैं आपसे ऐसी चीज़ के बारे में बात करना चाहता हूँ जिसके बारे में ज़्यादातर लोग बात नहीं करना चाहते, और वह है चंकिंग (खंड करना)।
00:00:37और मैं अंत तक आपको यह समझाने की उम्मीद करता हूँ कि चंकिंग मरी नहीं है और इससे जुड़ा कुछ काम अभी भी है।
00:00:45और सच में, यदि आप X, लिंक्डइन या कहीं भी हैं, तो आपने शायद देखा होगा कि RAG मर चुका है, है ना?
00:00:53मुझे लगता है कि लोगों ने हाल ही में MCP को भी मार डाला। और RAG फिर से मर गया है। ऑर्गेनिक रिट्रीवल अमर रहे,
00:01:00ऑर्गेनिक सर्च। और एक ऐसा समय आ जाता है जब आपको खुद से पूछना पड़ता है कि RAG कितनी बार मर सकता है?
00:01:07है ना? और तब भी जब कोई कहता है कि, खैर, RAG मरा नहीं है, जैसे जेरी, लामा इंडेक्स के सीईओ,
00:01:14उन्हें फिर भी किसी चीज़ को मारना ही पड़ता है। और ज़ाहिर तौर पर, वह चीज़ चंकिंग है। जैसे, इसमें निवेश मत करो।
00:01:23ऐसा मत करो। और यही वह कारण है जिसके चलते लोगों ने कहा कि चंकिंग मर चुकी है, क्योंकि हर कोई अब
00:01:30एजेंटिक सर्च का इस्तेमाल कर रहा है, है ना? आपके पास grep है, ls है, find है। ये सभी बेहतरीन हैं,
00:01:36लेकिन यदि आपके पास बहुत सारा डेटा है और आपके पास विभिन्न प्रकार की क्वेरीज़ हैं, तो ये अभी भी पर्याप्त नहीं हैं।
00:01:46बस एक सेकंड। ठीक है। और मुझे लगता है कि इसका मुख्य कारण यह है कि बहुत से लोग बात करना पसंद नहीं करते
00:01:51चंकिंग के बारे में, वह इसलिए क्योंकि यह मज़ेदार हिस्सा नहीं है, है ना? हर RAG या फ़ाइल सिस्टम में,
00:02:00हमारे पास दो चरण होते हैं। पहला चरण उबाऊ होता है, जैसा कि आप मान सकते हैं। वह जो आप शुरुआत में करते हैं,
00:02:07आपके पास बहुत सारा डेटा होता है। आपको इसे प्रीप्रोसेस करना होता है। आपको चंक के साइज़ का फैसला करना होता है। और फिर आपको
00:02:13सब कुछ एक वेक्टर DB में स्टोर करना होता है। दूसरा हिस्सा रिट्रीवल का हिस्सा है, मूल रूप से वह जो
00:02:20प्रति क्वेरी होता है। यह कुछ ऐसा है जिसे करना बहुत आसान है, है ना? इसे ऑप्टिमाइज़ करना बहुत
00:02:25आसान है। आप अपनी सभी क्वेरीज़ का उपयोग कर सकते हैं और फिर आप अधिकतम K, टॉप K के साथ खेल सकते हैं, माफ़ कीजिए, आप खेल सकते हैं
00:02:32शायद हाइब्रिड सर्च के साथ, इस तरह की चीज़ें। रिट्रीवल ट्यूनिंग करना बहुत ज़्यादा मज़ेदार है, है ना?
00:02:40तो मेरा दावा होगा कि अगर हमें किसी चीज़ को मारना है, अगर किसी चीज़ को मरना ही है, तो वह शायद
00:02:47रिट्रीवल ट्यूनिंग है। और हाँ, एजेंटिक सर्च ने शायद उसे मार डाला है। लेकिन फिर भी, एजेंटिक सर्च, भले ही हम
00:02:55इस तथ्य को स्वीकार कर सकें कि इसने रिट्रीवल ट्यूनिंग को मार दिया है, तब भी यह पर्याप्त अच्छा नहीं है जब आपके पास बहुत सारा
00:03:02डेटा हो। इसमें बहुत सारा पैसा खर्च होता है। मुझे नहीं लगता कि मुझे अब इसके बारे में बताने की ज़रूरत है। टोकन मैक्सिंग
00:03:09ऐसी चीज़ है जिसके बारे में हर कोई बात कर रहा है। और इसके नीचे की बात यह है कि यदि डेटा खुद
00:03:17आपके फ़ोल्डर्स, आपकी डिश्रियों में सही तरीके से व्यवस्थित नहीं है, तो आपको फिर भी कुछ ऐसा मिलता है जो
00:03:25अक्षम (इनएफ़िशिएंट) होता है। तो आइए एक समय के अनुकूल उदाहरण के बारे में सोचने की कोशिश करें, है ना? फ़ीफ़ा विश्व कप अभी चल रहा है। और आइए
00:03:33कल्पना करें कि हमारे पास एक ऐसा डेटासेट है जिसमें सारा फ़ीफ़ा विश्व कप शामिल है। तो हर निर्देशिका, मान लीजिए,
00:03:4098 वाला, 2002 वाला, और इसी तरह आगे भी। लेकिन अगर आपकी क्वेरी यह पूछती है कि किस टीम ने सबसे ज़्यादा विश्व कप
00:03:50जीते, तो आप सिर्फ़ किसी फ़ोल्डर में जाकर उस तक नहीं पहुँच सकते। आपको हर फ़ोल्डर में जाना होगा, यह देखना होगा कि कौन जीता,
00:03:57और फिर इन सबका एकत्रीकरण करना होगा, जो कि बहुत अक्षम है। इसका जवाब तुरंत ब्राजील है, मुझे उम्मीद है, कम से कम
00:04:03उस समय के अनुसार जब यह बातचीत हो रही है। तो रिट्रीवल असल में मरा नहीं है। हम इस व्याख्यान में किसी भी चीज़ को नहीं
00:04:13मार रहे हैं। यह प्लंबिंग में बदल गया है। और मुझे लगता है कि हर कोई जो किसी भी RAG सिस्टम पर काम करता है,
00:04:21वह इस भावना को जानता है। पहले दिन, या पहले सप्ताह, या शायद महीने के पहले दिन भी, यदि आप बहुत徹底 (बारीक) हैं,
00:04:29तो आप किसी तरह के चंक साइज़ को चुन रहे हैं। मान लीजिए 512। और शायद आप कुछ ओवरलैप भी डाल रहे हैं,
00:04:36है ना, 10%, 20%, और इसी तरह, हर चीज़ को इंडेक्स कर रहे हैं, और इसके बारे में सब कुछ भूल रहे हैं। और आप ऐसा कर सकते हैं, है ना,
00:04:43हम निश्चित चंकिंग रणनीतियों के बारे में बहुत बात करते हैं, जहाँ यदि आपका चंक कुछ ऐसा है जो बहुत बड़ा है,
00:04:49है ना, तो आपको पूरी तस्वीर मिल जाती है, जो कि अच्छी बात है, लेकिन आप बहुत सारी बारीकियों को खो रहे हैं। और सभी
00:04:54चंक को सार्थक एम्बेडिंग नहीं मिलेंगी। वहीं अगर आप अपने चंक को बहुत छोटा चुनेंगे,
00:05:00तो बड़ी तस्वीर छूट जाएगी। और सच में, यह उतना कुशल नहीं होगा। तो यह हमें क्या बताता है कि
00:05:07चंकिंग मूल रूप से एक लॉसॉ कंप्रेसन (हानिपूर्ण संपीड़न) है। इससे कोई फर्क नहीं पड़ता कि हम क्या कर रहे हैं, हम कुछ न कुछ खो रहे हैं।
00:05:15और मेरा दावा होगा कि कोई सही चंक साइज़ नहीं है। और आप में से कई लोग जो डेटा पर काम करते हैं, कहेंगे,
00:05:23नहीं, लेकिन हमारे पास यह कॉर्पस है, हमारे पास यह डेटासेट है, और हमने वास्तव में इस्तेमाल किया है और अपने सिस्टम को
00:05:29इस डेटा पर बहुत, बहुत अच्छे से काम करने के लिए ऑप्टिमाइज़ किया है। और हम भी ऐसा ही सोचते थे। हमें इसके साथ बहुत अनुभव था,
00:05:35विभिन्न प्रकार के एजेंटों और प्रणालियों और वर्कफ़्लो के साथ कि आप वास्तव में कर सकते हैं,
00:05:40और, है ना, आप बेंचमार्क के बारे में सोचते हैं कि अपने मॉडल को किसी बेंचमार्क पर ओवरफ़िट करना कितना आसान है।
00:05:48लेकिन RAG के साथ नहीं। यह वहाँ नहीं होता है। और आप वास्तव में इसे प्रति डेटासेट ऑप्टिमाइज़ नहीं कर सकते। और मैं आपको
00:05:54दिखाऊँगा कि यह कैसे सुनिश्चित करें कि यह क्वेरी पर निर्भर है। और मैं इतने विश्वास के साथ कैसे कह सकता हूँ? मैं ऐसी बात का दावा कैसे कर सकता हूँ?
00:06:00क्योंकि हमने प्रयोग किए, और हमने इसका परीक्षण किया, और अब मैं इसे आपके सामने प्रस्तुत करने जा रहा हूँ। तो हमने क्या किया,
00:06:06यह कहने के बजाय कि प्रति डेटा सबसे अच्छा चंक साइज़ क्या है, आइए इसका पता लगाते हैं। आइए वास्तव में एक
00:06:14डेटासेट लें और इस डेटासेट को कई बार डुप्लीकेट करें। इस मामले में, छह बार। हर डुप्लीकेशन में,
00:06:23हर उदाहरण में, चंक का साइज़ अलग है। इसलिए हमारे पास 2,000 के चंक साइज़ वाला एक डेटाबेस है,
00:06:281,000 के चंक साइज़ वाला डेटाबेस, और इसी तरह आगे भी। और हमने इसे कई डेटासेट के साथ किया,
00:06:36तो QMSUM, जो कि एक मीटिंग ट्रांसक्रिप्ट डेटासेट है। नैरेटिव QA, जो उपन्यासों पर
00:06:41प्रश्न-उत्तर है। और सेनफेल्ड डेटासेट, जो किसी भी चीज़ के बारे में एक ट्रिविया है। असल में नहीं। यह सेनफेल्ड के ट्रांसक्रिप्ट
00:06:49के बारे में ट्रिविया प्रश्न हैं। यह एक तरह का ट्रोलिंग डेटासेट है जिसे हमने इन-हाउस बनाया है। हमने इसे
00:06:56प्रकाशित भी किया है अगर अंत में किसी को लिंक चाहिए। और हमने यह देखने के लिए उन सभी पर परीक्षण किया कि क्या होता है।
00:07:03और सबसे पहले, हम बस यह देखना चाहते थे कि हर डेटासेट के लिए, कौन सा चंक साइज़ सबसे अच्छा है। और हम
00:07:10यहाँ जो देख रहे हैं वह सेनफेल्ड डेटासेट का एक उदाहरण है, जहाँ अनिवार्य रूप से दो क्वेरीज़, जो प्रकृति में
00:07:16अलग हैं, उस चंक साइज़ के आधार पर अलग-अलग परिणाम प्राप्त करती हैं। तो पहला प्रश्न, जेरी की पसंदीदा शर्ट का
00:07:24नाम क्या है? आप देख सकते हैं कि यह एक बहुत केंद्रित प्रश्न है, एक बहुत विशिष्ट प्रश्न है।
00:07:28इसका उत्तर शायद बहुत सीमित दायरे में होगा। और यह एक ऐसी चीज़ है जिसमें छोटे चंक साइज़
00:07:33सबसे अच्छा प्रदर्शन करेंगे। और आप रैंक एक बनाम 50 से नीचे की रैंक देख सकते हैं। निश्चित 100 टोकन चंक साइज़
00:07:43से लेकर 100 तक। जबकि ऐसा प्रश्न जैसे, जेरी किसे अपने कट्टर दुश्मन और शुद्ध बुराई के रूप में वर्णित करता है,
00:07:50जिसे मैं सेनफेल्ड का इतना बड़ा प्रशंसक भी नहीं हूँ, और मैं जानता हूँ कि यह न्यूमैन है। लेकिन यदि आप ट्रांसक्रिप्ट
00:07:56को देखें, तो यह ऐसी चीज़ नहीं है जिसे आप इतनी आसानी से पा सकें। और आप देख सकते हैं कि यह वास्तव में बदल जाता है, है ना? यदि आप
00:08:02छोटे चंक साइज़ का उपयोग करते हैं, तो आपको उत्तर नहीं मिलेगा। और हमने वास्तव में क्या किया - इन सभी चीज़ों और इन सभी चीज़ों को चलाने के बाद,
00:08:10हमने गौर किया, हमने कहा, क्या होगा अगर हमारे पास एक ओरेकल (दैवीय ज्ञान देने वाला), या यदि आप चाहें तो एक जिन्न हो,
00:08:19जो हमें बता सके कि हर क्वेरी के लिए, रिट्रीवल करने के लिए सबसे अच्छा चंक साइज़ क्या है। यह अनिवार्य रूप से
00:08:25ओरेकल प्रयोग है। क्षमता देखने के लिए हम यही जानना चाहते थे। यह वह नहीं है - हमारे पास पहले से ही
00:08:33यहाँ एक सिस्टम बनाने की क्षमता है। हम सिर्फ यह देखना चाहते हैं कि हमारे पास यहाँ क्या क्षमता है। और आप जो देख सकते हैं
00:08:38यहाँ, ठीक है, इस ग्राफ में, सभी नीली - सबसे पहले, y-अक्ष रिकॉल है। जितना अधिक हो उतना बेहतर।
00:08:46x-अक्ष पुनःप्राप्त चंक की संख्या है। तो यह k बनाम k पर रिकॉल है। आप सभी नीली रेखाएँ देख सकते हैं, शायद
00:08:52अस्पष्ट, लेकिन उनमें से प्रत्येक एक निश्चित चंक साइज़ के लिए प्रदर्शन है। जबकि नारंगी वाली
00:09:01ओरेकल लाइन है। यह है - हर क्वेरी के लिए, हमने इनमें से सबसे अच्छा वाला चुना। और आप देख सकते हैं कि यह
00:09:09कई डेटासेट में होता है। उनमें से कई में, आप वास्तव में देख सकते हैं कि नीली रेखाएँ एक-दूसरे को
00:09:16 काटती हैं, जिसका अर्थ है कि वास्तव में कई डेटासेट के लिए, कोई भी चंक साइज़ वास्तव में हावी नहीं होता है। और क्या
00:09:24ज़्यादा दिलचस्प है कि इसमें बहुत सारी क्षमता है। वह अंतर, जिसे आप नारंगी रेखा
00:09:30और सभी नीली रेखाओं के बीच देख सकते हैं, बड़ा है। और जब मैं बड़ा कहता हूँ, तो यह लगभग 20 से 40 प्रतिशत है सिर्फ
00:09:38चंकिंग पर रणनीति बनाने से। और बहुत सरल रणनीति, अगर मैं यह कहूँ। और यह है - यह अंतर, यह वही है जो
00:09:47512 या 1,000 या जो भी हो, का चुनाव है, है ना? यह संख्या सिर्फ मनगढ़ंत है। यह वह है जो आपको चुकाना पड़ता है। और मुझे
00:09:56लगता है कि यहाँ समस्या यह है - यह थोड़ा पेचीदा है क्योंकि यह एक तरह की सूचना समस्या की तरह है जो हमारे पास नहीं है
00:10:07वह जानकारी जिसकी हमें हर चरण पर आवश्यकता होती है। और इससे मेरा क्या मतलब है? यदि मैं इंडेक्सिंग वाले हिस्से को देख रहा हूँ,
00:10:12जहाँ मेरा चंक साइज़ पर नियंत्रण होता है, तो मुझे नहीं पता कि क्वेरीज़ क्या होंगी।
00:10:18मैं अनुमान लगा सकता हूँ। मैं शायद आकलन कर सकता हूँ। मैं कोशिश कर सकता हूँ। लेकिन मुझे नहीं पता कि क्वेरीज़ क्या होंगी, इसलिए मैं
00:10:25उसके अनुसार अपने चंक साइज़ को समायोजित नहीं कर सकता। और रिट्रीवल वाले हिस्से में, जहाँ मेरी क्वेरीज़ होती हैं,
00:10:31मैं चंक साइज़ को नियंत्रित नहीं कर सकता, है ना? यह पहले से तय है। और ज़ाहिर है कि मैं शुरुआत से
00:10:37प्रति क्वेरी पूरी प्रक्रिया नहीं करूँगा। इसलिए हमने पिछले कार्यों को देखा, जैसे विशेष रूप से एट्रोपिक,
00:10:47प्रासंगिक पुनःप्राप्ति (कॉन्टेक्स्टुअल रिट्रीवल), जहाँ वे हर चंक को समृद्ध करते हैं, और अन्य जो अनिवार्य रूप से हर चंक की
00:10:54लेटेंट स्पेस को बेहतर बनाने की कोशिश करते हैं। लेकिन यह वह दिशा नहीं है जिस पर हम गए। वे सभी सिर्फ इस मॉडल में रहे
00:11:01कि आइए एक निश्चित चंक साइज़ के साथ काम करें, जबकि हमने एक अलग दृष्टिकोण अपनाया। और हमने कहा, एक के लिए प्रतिबद्ध होने के बजाय
00:11:08हम कई के लिए क्यों न प्रतिबद्ध हों? और हम इसे मल्टी-स्केल इंडेक्सिंग कहते हैं। अनिवार्य रूप से, हम सिर्फ
00:11:16वही कर रहे हैं जो हमने पहले देखा है। तो हम डेटाबेस की जाँच कर रहे हैं। हम इसे डुप्लीकेट करते हैं और इसे कई
00:11:26चंक साइज़ या विंडो साइज़ के साथ चंक करते हैं। और फिर, यह इंडेक्सिंग के समय होता है। और फिर रिट्रीवल के समय,
00:11:34हम उन सभी को क्वेरी कर रहे हैं। इसलिए यदि हमारे पास डेटाबेस के n डुप्लीकेट और विंडो साइज़ थे, तो अब हमें
00:11:43प्रति क्वेरी छह अलग-अलग रिट्रीवल कॉल चलाने होंगे। माफ़ कीजिए, n के रूप में छह। और हम उन्हें कैसे मिलाते हैं? हम ज़ाहिर तौर पर
00:11:52ओरेकल का उपयोग नहीं कर सकते, है ना? ओरेकल कुछ ऐसा है जो हमारे पास केवल क्षमता के लिए है। वास्तविक जीवन में,
00:11:57हम जवाब नहीं जानते। लेकिन हम जो कर सकते हैं वह है किसी तरह का विलय एल्गोरिथ्म खोजना। अब, आप कहेंगे,
00:12:06जब हम इसे इस तरह देखते हैं, तो समस्या क्या हो सकती है? यह तथ्य कि हमारे पास n रैंकिंग है,
00:12:13लेकिन रैंकिंग चंक के लिए हैं। और अलग-अलग साइज़ के चंक वास्तव में तुलनीय नहीं हैं,
00:12:19है ना? इसलिए इसके बजाय, हमने कुछ ऐसा करने का विकल्प चुना जो इन दिनों काफी लोकप्रिय है। और बहुत सारे
00:12:25RAG सिस्टम दरअसल ऐसे काम करते हैं कि सिर्फ एक चंक निकालने के बजाय, जब हमें कोई
00:12:30चंक मिलता है, तो हम पूरा डॉक्यूमेंट ही प्राप्त कर रहे होते हैं, है ना? जैसे-जैसे контекст (संदर्भ) विंडो बढ़ती है,
00:12:35हम ज़्यादा से ज़्यादा संदर्भ देना चाहते हैं। और अब, इस मामले में, हमारे पास एक ही डॉक्यूमेंट्स की n रैकिंग्स होती हैं, क्योंकि
00:12:44वे अब चंक्स नहीं रहे। और इसकी हम तुलना कर सकते हैं। इस स्थिति में, आप रिट्रीवल को असल में
00:12:50सिर्फ वोटिंग मान सकते हैं। ठीक है? तो यह पूरी तरह से रैकिंग नहीं है। हमारे पास कोई एक रैंकिंग नहीं है जिसे हम
00:12:56फिर से रैंक कर रहे हों। हमारे पास प्रासंगिक डॉक्यूमेंट्स की n अलग-अलग रैंक्स होती हैं, और हम उन सबको
00:13:03एक में जोड़ना चाहते हैं। इसीलिए हम RRF यानी रेसिप्रोकल रैंक फ्यूजन का इस्तेमाल कर रहे हैं, जो कि काफी
00:13:11हद तक एक सरल फॉर्मूला है। हमने कई चीज़ें आज़माईं। यह सबसे अच्छा काम कर गया। और जैसा कि आप देख सकते हैं, यह कोई
00:13:17मॉडल नहीं है। यह ऐसा कुछ नहीं है जिसके लिए आपको विशेष रूप से कुछ करना पड़े। जैसे, खासतौर पर, यह सिर्फ एक
00:13:23साधारण स्क्रिप्ट है जिसमें बिल्कुल समय नहीं लगता। और पूरा सिस्टम कुछ इस तरह दिखता है। तो हमारे पास
00:13:32n बार इंडेक्सिंग होती है, फिर हम हर डेटाबेस से हर क्वेरी को खोजते हैं, और उन सबको मिलाने के लिए हम RRF का उपयोग करते हैं।
00:13:40और परिणामों के बारे में आप अंदाज़ा लगा सकते हैं कि वे अच्छे हैं। वरना मैं यहाँ खड़ा होकर
00:13:48इतना ज़्यादा आश्वस्त नहीं होता। ठीक है? लेकिन आप देख सकते हैं, हमने कई डेटासेट्स पर परीक्षण किया, QMSum,
00:13:56Narrative QA, Seinfeld, और साथ ही Finance Bench। हमने इन सबका इस्तेमाल किया, और यह हमारे फिक्स्ड साइज से कहीं बेहतर मेल खाता है।
00:14:05आइए इसे एक ग्राफ़ में देखते हैं। यहाँ देखना थोड़ा मुश्किल है, इसलिए मैं इसे धीरे-धीरे समझाऊंगा। यहाँ हर पंक्ति
00:14:12चंक का आकार है। तो आप 50, 100, और इसी तरह आगे देख सकते हैं। सबसे नीचे वाली पंक्ति हमारा तरीका है। यह वाला,
00:14:21जिसे आप सभी से करते हैं और फिर मिलाते हैं। और हर कॉलम किसी चीज़ पर रिकॉल है। तो रिकॉल 1,
00:14:312, 3, 10 तक। आप यहाँ दो बातें देख सकते हैं, है ना? सबसे पहले तो यह कि
00:14:39रिकॉल चाहे जो हो, हमारा तरीका फिर भी जीतता है, जिसे आप बहुत आसान मान सकते हैं, लेकिन यह तथ्य कि आपको
00:14:46 उन सबको मिलाना होगा, वह इतनी सामान्य बात नहीं है। और साथ ही आप देख सकते हैं कि गुणवत्ता
00:14:53वास्तव में बढ़ती है। वह हीट मैप जहाँ आप देख सकते हैं कि यह बहुत ज़्यादा हरा हो जाता है। और फिर से, यह सिर्फ
00:14:58एक ऐसी चीज़ थी जिसे मैं बड़े पैमाने पर दिखाना चाहता था। यहाँ आप सभी चारों डेटासेट्स देख सकते हैं जहाँ हम हासिल करते हैं
00:15:06बेहतर परिणाम। वास्तव में कई चीज़ों में 20, 30, 40 प्रतिशत तक। साथ ही, ऐसे परिणाम भी हैं
00:15:14जो मैंने यहाँ आपको नहीं दिखाए हैं जो MTab पर हैं। आप हमारे ब्लॉग में देख सकते हैं, मैं बाद में लिंक दे दूंगा, हमें वहाँ भी
00:15:22डेटासेट के आधार पर 10 से 40 प्रतिशत के बीच काफी सुधार मिल रहे हैं।
00:15:30अब, मैं नासमझ नहीं हूँ। मैं यहाँ यह दावा करने नहीं जा रहा हूँ कि इसकी कोई कीमत नहीं है। ज़ाहिर है, इसकी एक कीमत है,
00:15:36है ना? कोई भी चीज़ मुफ़्त नहीं मिलती। हर चीज़ के साथ कुछ न कुछ जुड़ा होता है। और हाँ, इसकी कीमत अतिरिक्त मेमोरी के रूप में चुकानी पड़ती है।
00:15:43इसकी लागत O(1) के 2 से 5 के बीच होती है, है ना? अतिरिक्त मेमोरी का एक कांस्टेंट जिसमें आपको डेटाबेस की
00:15:51वे सभी प्रतियां रखनी होंगी। हालांकि, यदि आप इसके बारे में सोचें, तो लेटेंसी के मामले में यह वास्तव में
00:15:59प्रभावित नहीं करता क्योंकि आप सारा रिट्रीवल का काम समानांतर (parallel) रूप से कर सकते हैं। और साथ ही, RRF वाला हिस्सा बहुत ज़्यादा समय नहीं लेता।
00:16:10मैं कहूँगा कि यह एक बहुत अच्छा रिसर्च प्रोजेक्ट था जो हमने किया और हमें वाकई बहुत शानदार परिणाम मिले।
00:16:16अभी और भी काम करने बाकी हैं, है ना? सुधार करने की गुंजाइश है। भविष्य में करने के लिए और काम हैं। और स्पष्ट रूप से,
00:16:23हम यह समझना चाहते हैं कि हमें कितने चंक साइज़ चाहिए और कौन से वाले, है ना? सच कहें तो 50, 100,
00:16:32200 और इसी तरह के साथ काम करना काफी मनमाने ढंग से था। इसलिए हमें यह पता लगाने की ज़रूरत है कि इसकी गणना कैसे करें और
00:16:40यह कैसे जानें कि आपको बिल्कुल कितनी प्रतियों की आवश्यकता है। साथ ही, RRF से आगे बढ़ें, है ना? हम
00:16:46RRF का उपयोग इसलिए कर रहे हैं क्योंकि हमारे द्वारा इस्तेमाल किए गए तरीकों में से इसने सबसे अच्छा काम किया, लेकिन इसका मतलब यह नहीं है कि
00:16:52कोई बेहतर तरीका नहीं है। और अगर मुझे आपको कोई बात बताकर छोड़ना हो, तो मैं कहूँगा कि एजेंट्स ने
00:16:59रिट्रीवल को खत्म नहीं किया। कुछ नहीं मरा। अरे, यह सिर्फ इन्फ्रास्ट्रक्चर है। और बुरी बात यह है कि यह
00:17:072022 का इन्फ्रास्ट्रक्चर है। और सचमुच सरल तरीकों से, आप अपने RAG सिस्टम या डेटा स्टोर करने से जुड़ी किसी भी चीज़ को
00:17:17और फिर 20 से 40 प्रतिशत तक पुनः प्राप्त कर सकते हैं, वह भी बिना किसी ज़्यादा
00:17:26जटिल चीज़ के। इसलिए यदि आप इसके बारे में अधिक पढ़ना चाहते हैं, तो आप ब्लॉग पढ़ सकते हैं। वहाँ एक उदाहरण कोड
00:17:34और Seinfeld डेटासेट भी है। बस इतना ही। मैं युval हूँ। यहाँ आने के लिए आपका बहुत-बहुत धन्यवाद।
00:17:47मैं आपसे अगली बार मिलता हूँ।

핵심 요약

30,000 वयस्कों पर 8 साल तक किए गए अध्ययन के अनुसार, तनाव अपने आप में घातक नहीं होता, बल्कि तनाव को हानिकारक मानने का दृढ़ विश्वास ही 43% तक मौत का खतरा बढ़ाता है।

하이라이트

  • 30,000 वयस्कों पर 8 साल तक चले अध्ययन में यह पाया गया कि अत्यधिक तनाव से मौत का खतरा 43% बढ़ जाता है, लेकिन यह खतरा केवल उन्हीं लोगों पर लागू होता है जो तनाव को अपनी सेहत के लिए हानिकारक मानते हैं।

  • तनाव को हानिकारक मानने की सोच की वजह से 8 सालों में अमेरिका में लगभग 1,82,000 लोगों की मौत हुई, जो त्वचा कैंसर और एचआईवी जैसी बीमारियों से होने वाली मौतों से भी ज्यादा है।

  • जिन लोगों ने अत्यधिक तनाव झेला लेकिन इसे हानिकारक नहीं माना, उनकी मृत्यु दर उन लोगों से भी कम रही जिन्होंने बहुत कम तनाव महसूस किया था।

  • तनाव अपने आप में घातक नहीं होता, बल्कि तनाव के प्रति नकारात्मक धारणा और सोच ही इसे घातक बनाती है।

타임라인

सफलता और जीवन में बदलाव के प्रारंभिक नियम

  • दैनिक जीवन और कार्यकुशलता में बदलाव की शुरुआत छोटी और बारीक चीज़ों से होती है।
  • स्पष्ट प्राथमिकताओं के बिना किया गया प्रयास अंधेरे में तीर चलाने के समान होता है।
  • बड़े कार्यों को छोटे-छोटे लक्ष्यों में विभाजित करने से डर कम होता है और आत्मविश्वास बढ़ता है।

यह खंड जीवन में बदलाव लाने के लिए प्राथमिकताओं को स्पष्ट करने, लगातार प्रयास करने और अनुशासन बनाए रखने पर जोर देता है। काम को छोटे हिस्सों में बांटने से मानसिक तनाव कम होता है और हर पूरा हुआ छोटा लक्ष्य अगले बड़े कदम के लिए तैयार करता है। सकारात्मक संगति और असफलताओं से सीखना इस प्रक्रिया के मुख्य आधार हैं।

तनाव और स्वास्थ्य पर पारंपरिक दृष्टिकोण

  • तनाव को हर स्वास्थ्य पत्रिका और लेख में दिल की बीमारियों और आत्महत्या जैसे गंभीर खतरों से जोड़ा जाता है।
  • पारंपरिक दृष्टिकोण के अनुसार तनाव को स्वास्थ्य के लिए एक बड़ा खलनायक माना गया है।

समाज और मीडिया में लंबे समय से यह स्थापित किया गया है कि तनाव स्वास्थ्य के लिए बेहद हानिकारक है। हर जगह मिलने वाली जानकारी तनाव को शारीरिक और मानसिक पतन का मुख्य कारण बताती है, जिससे लोगों के मन में तनाव को लेकर एक गहरा डर बैठ जाता है।

तनाव पर 8 साल का दीर्घकालिक अध्ययन और आंकड़े

  • 30,000 वयस्कों पर 8 साल तक चले अध्ययन में तनाव के स्तर और उसके हानिकारक होने की धारणा का परीक्षण किया गया।
  • अतिरिक्त तनाव का सामना करने वाले लोगों की मौत का खतरा 43% बढ़ा, जो केवल उन तक सीमित था जो तनाव को बुरा मानते थे।
  • तनाव को हानिकारक न मानने वाले लोगों का मृत्यु दर उन लोगों से भी कम रहा जिन्होंने बहुत कम तनाव झेला था।
  • तनाव को हानिकारक मानने की वजह से अमेरिका में 8 सालों में करीब 1,82,000 लोगों की मौत हुई।

शोध के आंकड़ों से यह सामने आता है कि तनाव का शारीरिक असर इस बात पर निर्भर करता है कि व्यक्ति इसके बारे में क्या सोचता है। सरकारी मौत के रिकॉर्ड और सर्वेक्षण के मिलान से यह सिद्ध होता है कि तनाव का नकारात्मक प्रभाव केवल उन लोगों पर पड़ता है जो यह विश्वास करते हैं कि तनाव उनकी जान ले रहा है।

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기