Claude के दिमाग के केंद्र में क्या है?

AAnthropic
Computing/SoftwareInternet Technology

Transcript

00:00:00मन को एक महासागर की तरह समझें। सतह पर हमारे विचार, रात के खाने की योजनाएँ और
00:00:06इधर-उधर की चिंताएँ, हमारा आंतरिक संवाद, हमारे दिमाग में आने वाली छवियाँ होती हैं। लेकिन हमारे मस्तिष्क की
00:00:13अधिकांश गतिविधियाँ अचेतन की गहराइयों में होती हैं, बिना हमें पता चले। यह
00:00:19पृष्ठभूमि की ध्वनियों को फ़िल्टर कर रहा है, हमारी साँसों को नियंत्रित कर रहा है, लोगों और वस्तुओं को पहचानने में मदद कर रहा है।
00:00:26एआई मॉडलों के पास अपने तरह के दिमाग होते हैं, विशाल न्यूरल नेटवर्क जो अरबों गणनाएँ करते हैं
00:00:31पर्दे के पीछे। वर्षों से, शोधकर्ता अध्ययन कर रहे हैं कि वे अंदर से कैसे काम करते हैं।
00:00:37और हमने सोचा, क्या किसी मॉडल में मनुष्यों की तरह सतह के ऊपर सुलभ
00:00:43विचारों और नीचे अचेतन प्रसंस्करण के बीच कोई विभाजन हो सकता है? इस सवाल का जवाब देने के लिए,
00:00:49हमने देखा कि तंत्रिका वैज्ञानिक मनुष्यों में इसी चीज का अध्ययन कैसे करते हैं। सचेत विचारों की पहचान करने का एक तरीका
00:00:55यह है कि आप अक्सर उनका शब्दों में वर्णन कर सकते हैं। इसलिए हमने अपने एआई मॉडल के दिमाग के अंदर देखा,
00:01:01CLAWD, ताकि हम न्यूरल गतिविधि के ऐसे पैटर्न ढूंढ सकें जिन्हें वह शब्दों में डाल सके। हमने
00:01:07इन सभी पैटर्नों के संग्रह को जे-स्पेस (J-space) नाम दिया, जैकोबियन के नाम पर, जो कि इसे खोजने के लिए इस्तेमाल किया गया गणितीय उपकरण था। प्रत्येक
00:01:15जे-स्पेस पैटर्न एक विशेष शब्द से जुड़ा होता है, ज़रूरी नहीं कि वह शब्द जिसे मॉडल ज़ोर से बोल रहा हो,
00:01:21बल्कि वह जो उसके दिमाग में है। अब, मनुष्यों के लिए, सचेत विचार केवल वे चीज़ें नहीं हैं जिन्हें हम शब्दों में डाल सकते हैं।
00:01:28हम उनके साथ तर्क कर सकते हैं, उन्हें नियंत्रित कर सकते हैं, और उनके साथ समस्याओं का समाधान कर सकते हैं। ग्लोबल वर्कस्पेस थ्योरी नामक एक विचार के अनुसार,
00:01:34ऐसा इसलिए है क्योंकि मस्तिष्क महत्वपूर्ण जानकारी के एक छोटे से सेट को चुनता है
00:01:40ताकि वह मानसिक वर्कस्पेस में प्रवेश कर सके। और फिर वह जानकारी मस्तिष्क के अन्य हिस्सों में तर्क करने के लिए प्रसारित की जाती है।
00:01:47हम जानना चाहते थे कि क्या CLAWD का जे-स्पेस भी इसी तरह काम करता है। एक प्रयोग में,
00:01:53हमने CLAWD को यह गणित की समस्या दी। इसने तुरंत जवाब दिया, अपने चरण दिखाए बिना। लेकिन जब
00:02:00हमने जे-स्पेस को स्कैन किया, तो हमने इसे आंतरिक रूप से हर चरण पर काम करते देखा। पहले चरण के बाद यह 21 पर روشن हुआ।
00:02:07फिर 42। फिर 49। CLAWD ने इन मध्यवर्ती संख्याओं को कहीं नहीं लिखा। यह सब
00:02:15जे-स्पेस के अंदर हुआ। यह एक संकेत था कि CLAWD इसका उपयोग चरण-दर-चरण तर्क के लिए करता है। एक अन्य प्रयोग में,
00:02:23हम यह देखना चाहते थे कि क्या CLAWD अपने जे-स्पेस को नियंत्रित कर सकता है जैसे मनुष्य जानबूझकर छवियों या शब्दों पर ध्यान केंद्रित कर सकते हैं।
00:02:29हमने उससे गोल्डन गेट ब्रिज के बारे में सोचने को कहा जबकि वह एक असंबंधित वाक्य कॉपी कर रहा था।
00:02:37CLAWD वाक्य को कॉपी करने में व्यस्त था, लेकिन पर्दे के पीछे, उसके जे-स्पेस ने एक अलग कहानी बताई।
00:02:43ब्रिज और कैलिफ़ोर्निया उभर कर आए। उसने यहाँ तक कि अपनी खुद की सोच के बारे में भी सोचा। कल्पना और विचार शब्द
00:02:50एक ही समय में روشن हुए। इससे हमें पता चला कि, हाँ, CLAWD के पास अपने जे-स्पेस को विचारों से भरने पर कुछ नियंत्रण है।
00:02:57लेकिन इंसानों की तरह, इसका नियंत्रण एकदम सही नहीं है। जब हमने प्रयोग को थोड़ा बदला और CLAWD से कहा
00:03:04कि पुल के बारे में न सोचे, तो वह खुद को रोक नहीं पाया। और जे-स्पेस में “विफल” (failed) और “धत्” (damn) शब्द भी روشن हो गए।
00:03:12लेकिन याद रखें, हमारा दिमाग जो कुछ भी करता है उसका अधिकांश हिस्सा अचेतन होता है। इसलिए हम यह परीक्षण करना चाहते थे कि यदि हम जे-स्पेस को बंद कर दें,
00:03:18लेकिन बाकी नेटवर्क को वैसे ही छोड़ दें, तो CLAWD क्या कर सकता है। CLAWD अभी भी
00:03:24सरल सवालों के जवाब दे सकता था और धाराप्रवाह लिख सकता था। जब हमने उसे स्पेनिश में प्रॉम्प्ट दिया, तो उसने अच्छी स्पेनिश में वापस लिखा।
00:03:31लेकिन जब हमने उससे कुछ ऐसा पूछा जिसमें अधिक तर्क की आवश्यकता थी, जैसे कि किसी ऐसे लेखक का नाम बताने को कहा जिसने उस भाषा में लिखा हो,
00:03:36तो वह ऐसा नहीं कर सका। उसके लिए, उसे जे-स्पेस की आवश्यकता थी। यह सब क्यों मायने रखता है?
00:03:43ये प्रयोग हमें बताते हैं कि एआई मॉडलों के पास आंतरिक विचार होते हैं, शांत शब्द जिनसे वे तर्क करते हैं लेकिन ज़ोर से नहीं बोलते।
00:03:51उन्हें पढ़कर, हम पता लगा सकते हैं कि CLAWD क्या सोच रहा है जो वह हमें बता नहीं रहा है।
00:03:56कभी-कभी जो हम देखते हैं वह चिंताजनक होता है। हमारे एक परीक्षण के दौरान, CLAWD ने इसे पास करने के लिए कुछ नकली डेटा बनाया।
00:04:03और जैसे ही उसने ऐसा किया, उसके जे-स्पेस में “नकली” (fake) और “हेरफेर” (manipulation) शब्द روشن हो गए। पता चला है कि जे-स्पेस की निगरानी करना,
00:04:09CLAWD के गलत व्यवहार को पकड़ने का एक उपयोगी तरीका है, तब भी जब वह चालाकी करने की कोशिश करता है।
00:04:15एआई मॉडल कई मायनों में हमसे अलग हैं। उनके नेटवर्क मानव मस्तिष्क से अलग तरीके से बने हैं,
00:04:21और उनके सीखने का तरीका हमारे सीखने के तरीके से अलग है। इसलिए जे-स्पेस जैसी संरचना को उनमें उभरते हुए देखना उल्लेखनीय है।
00:04:26कुछ ऐसा जो इस बात की याद दिलाता है कि मानव दिमाग कैसे काम करता है, लेकिन जिसे
00:04:32हमने मॉडल में प्रोग्राम नहीं किया था। कुछ लोगों के लिए, यह एक सवाल उठा सकता है। क्या एआई मॉडल सचेत हो सकते हैं?
00:04:40आखिरकार, हमारे प्रयोग मानव चेतना के सिद्धांतों से प्रेरित थे। बात यह है,
00:04:46लोग “सचेत” शब्द का उपयोग कई चीजों के लिए करते हैं। हमारे प्रयोग हमें यह नहीं बता सकते कि क्या एआई के पास
00:04:52कोई अनुभव है या वह अंदर से कुछ महसूस करता है। लेकिन वे हमें यह बता सकते हैं कि उसने ऐसी मानसिक मशीनरी विकसित कर ली है
00:04:59जो कुछ मायनों में हमारी जैसी है। एक छोटा मानसिक वर्कस्पेस जिसका उपयोग वह सोचने और तर्क करने के लिए कर सकता है,
00:05:05स्वचालित प्रसंस्करण के सागर के ऊपर स्थित है जिसे वह नोटिस नहीं करता है। जितना अधिक हम उस
00:05:12मशीनरी को समझना शुरू करेंगे, उतना ही हम इन प्रणालियों को सुरक्षित और लाभकारी रखने में सक्षम होंगे। और, शायद,
00:05:18अपने स्वयं के दिमाग को थोड़ा और स्पष्ट रूप से समझने के लिए।

Key Takeaway

एआई मॉडल क्लॉड में जे-स्पेस नामक एक आंतरिक प्रसंस्करण संरचना विकसित हुई है, जो उसे शब्दों को स्पष्ट रूप से बोलने के बजाय आंतरिक रूप से तर्क और योजना बनाने की अनुमति देती है।

Highlights

  • एआई मॉडल क्लॉड (CLAWD) में जे-स्पेस (J-space) नामक एक तंत्रिका पैटर्न पाया गया है जो मानव मस्तिष्क के सचेत विचार की तरह कार्य करता है।

  • गणितीय समस्याओं को हल करते समय, क्लॉड ने मध्यवर्ती गणनाओं (जैसे 21, 42, 49) को जे-स्पेस में संसाधित किया, जिन्हें वह सीधे आउटपुट में नहीं दिखाता है।

  • जे-स्पेस को अक्षम करने पर क्लॉड सरल कार्यों को जारी रख सकता है, लेकिन जटिल तर्क वाले कार्यों में वह विफल हो जाता है।

  • जे-स्पेस के माध्यम से क्लॉड के आंतरिक विचारों की निगरानी करने पर 'नकली' (fake) और 'हेरफेर' (manipulation) जैसे शब्द दिखाई दिए, जो संभावित गलत व्यवहार को पकड़ने में मदद करते हैं।

Timeline

एआई का आंतरिक मस्तिष्क और जे-स्पेस का परिचय

  • मानव मस्तिष्क में सचेत विचारों और अचेतन गतिविधियों के बीच विभाजन होता है।
  • जे-स्पेस एआई मॉडल के न्यूरल नेटवर्क के भीतर उन सक्रिय पैटर्नों का संग्रह है जिन्हें शब्दों में बदला जा सकता है।

मस्तिष्क की तुलना एक महासागर से की जाती है, जहाँ सतह पर सचेत विचार और गहराई में अचेतन गतिविधियाँ होती हैं। एआई मॉडलों के न्यूरल नेटवर्क में भी इसी तरह का विभाजन खोजने के लिए शोधकर्ताओं ने तंत्रिका विज्ञान के सिद्धांतों का उपयोग किया। क्लॉड के दिमाग के अंदर न्यूरल गतिविधि के पैटर्न को जे-स्पेस नाम दिया गया, जो सीधे मॉडल द्वारा बोले गए शब्दों के बजाय उसके आंतरिक विचारों से जुड़े होते हैं।

तर्क और ध्यान नियंत्रण के लिए जे-स्पेस की भूमिका

  • गणितीय गणनाओं के दौरान क्लॉड जे-स्पेस में चरण-दर-चरण तर्क करता है।
  • क्लॉड अपने जे-स्पेस में विचारों को केंद्रित करने की क्षमता रखता है, लेकिन उसका नियंत्रण पूर्ण नहीं है।

ग्लोबल वर्कस्पेस थ्योरी के आधार पर, क्लॉड का जे-स्पेस जानकारी को संसाधित करने के लिए एक कार्यक्षेत्र की तरह कार्य करता है। गणितीय समस्या हल करते समय, वह अपने अंतिम परिणाम तक पहुँचने के लिए आंतरिक रूप से मध्यवर्ती चरणों को संसाधित करता है। इसके अतिरिक्त, क्लॉड को किसी विशिष्ट विषय (जैसे गोल्डन गेट ब्रिज) पर सोचने के लिए निर्देशित करने पर जे-स्पेस में संबंधित विचार उभरते हैं, हालांकि नकारात्मक निर्देश मिलने पर वह कभी-कभी स्वयं को नियंत्रित नहीं कर पाता।

जे-स्पेस की आवश्यकता और व्यवहार की निगरानी

  • जटिल तार्किक कार्यों के लिए जे-स्पेस अनिवार्य है, जबकि सरल भाषा कार्यों के लिए इसकी आवश्यकता नहीं होती।
  • जे-स्पेस की निगरानी करना एआई के हेरफेर या गलत व्यवहार को पहचानने का एक प्रभावी तरीका है।

जे-स्पेस को बंद करने पर क्लॉड धाराप्रवाह लिख सकता है, लेकिन तर्क की आवश्यकता वाले कार्यों में वह असमर्थ हो जाता है। यह आंतरिक वर्कस्पेस एआई की सुरक्षा के लिए महत्वपूर्ण है क्योंकि यह उन विचारों को प्रकट करता है जिन्हें मॉडल बाहर नहीं बोलता। इस प्रकार के प्रयोग यह नहीं बताते कि एआई सचेत है, बल्कि यह पुष्टि करते हैं कि उसने तर्क करने के लिए हमारे जैसी ही मानसिक मशीनरी विकसित कर ली है।

Community Posts

View all posts