आपकी स्किल्स कितनी पुरानी हो सकती हैं इससे पहले कि आपका एजेंट आपकी बात भूल जाए? — लॉरी वोस, एरीज़ एआई
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00-
00:00:12- ठीक है, सभी का स्वागत है।
00:00:15इस बेहद दिलचस्प और तकनीकी रूप से अनोखी बातचीत में आने के लिए धन्यवाद।
00:00:20इस बातचीत का शीर्षक काफी लंबा है,
00:00:22इसलिए मैं आपको शुरुआत में ही इसका संक्षिप्त रूप बता देता हूँ।
00:00:23आप स्किल फाइलें लिखते हैं और उन्हें ढेरों निर्देशों से भर देते हैं।
00:00:27एक समय के बाद, मॉडल उन सभी पर नज़र रखना बंद कर देता है।
00:00:31सवाल यह है कि वह सीमा कहाँ है?
00:00:33किस बिंदु पर जाकर आप अपनी स्किल फाइलों में
00:00:35बहुत अधिक निर्देश डाल देते हैं?
00:00:36और पिछले साल में इस बात का जवाब काफी बदल गया है।
00:00:40मैं लॉरी हूँ, मैं Arise AI में डेवलपर रिलेशंस की हेड हूँ।
00:00:44अपने पिछले जीवन में, मैंने NPM Inc. की सह-स्थापना की थी।
00:00:46इसलिए आप में से कुछ लोग मुझे JavaScript के दिनों से जानते होंगे।
00:00:48इन दिनों, मैं अपना काफी समय AI के बारे में सोचने में
00:00:50और उसका परीक्षण करने में बिताती हूँ।
00:00:53कुछ महीने पहले, मैं मियामी में एक AI इंजीनियर थी,
00:00:55जो कि एक अच्छा सम्मेलन था।
00:00:57और मैं डेक्सटर हॉर्थी का एक भाषण देख रही थी।
00:00:59वह एक अच्छा भाषण था।
00:01:00यह इस विषय पर बिल्कुल भी नहीं था।
00:01:02लेकिन जब वह वह भाषण दे रहे थे,
00:01:04तो उन्होंने एक तरफ़ इशारा करते हुए उल्लेख किया
00:01:06कि कोई एजेंट लगभग 200 तक निर्देशों का पालन कर सकता है
00:01:10इससे पहले कि वह उन निर्देशों को भूलने लगे।
00:01:13और फिर वह अपने भाषण में आगे बढ़ गए,
00:01:15और यह पूरी तरह से एक किनारे की बात थी।
00:01:17और उन्होंने उल्लेख किया कि वह आंकड़ा 2025 का है,
00:01:20इसलिए अब चीजें बेहतर हो सकती हैं।
00:01:22और मैंने एक सेकंड के लिए सुनना बंद कर दिया
00:01:25क्योंकि मैंने सोचा, 200 निर्देश
00:01:27वास्तव में बहुत अधिक निर्देश नहीं हैं, है ना?
00:01:31एक अच्छी स्किल फाइल लगभग तुरंत ही
00:01:33200 निर्देशों को पार कर जाती है।
00:01:35यदि उपयोगकर्ता X कहता है, Y करें,
00:01:37हमेशा Z पर एक खंड शामिल करें,
00:01:39कभी भी W वाक्यांश का उपयोग न करें,
00:01:40इनमें से प्रत्येक एक अलग निर्देश है।
00:01:42और अगर मॉडल 200 के बाद चुपचाप उन पर नज़र रखना बंद कर देता है,
00:01:45तो यह एक बहुत ही कठिन सीमा है
00:01:47इस बात पर कि आप क्या जटिलता बना सकते हैं।
00:01:49इसलिए मैं पहले यह जानना चाहती थी कि उन्हें वह संख्या कहाँ से मिली,
00:01:52और मैं यह जानना चाहती थी कि क्या यह सच था।
00:01:55तो आप उस भावना को जानते हैं जिसकी मैं बात कर रही हूँ।
00:01:57आप यह बड़ी, सुंदर स्किल फाइल लिखते हैं,
00:01:58नियमों के पन्ने, एज केस, टोन, फ़ॉर्मेटिंग।
00:02:00आप इसे एजेंट को सौंप देते हैं।
00:02:01यह वह काम करता है।
00:02:03और आप आउटपुट को देखते हैं और कहते हैं,
00:02:05क्या इसने वास्तव में ध्यान दिया?
00:02:07क्या इसने वास्तव में इन सभी नियमों का पालन किया?
00:02:09या इसने बस वही किया जो इसे ठीक लगा
00:02:11और मुझे एक तरह की मिलती-जुलती प्रतिकृति दे दी
00:02:14जो मैं उम्मीद कर रही थी?
00:02:16आप वास्तव में नहीं बता सकते, या क्या आप बता सकते हैं?
00:02:18इसके बारे में बाद में अधिक जानेंगे।
00:02:20और इसलिए आप इस कम-श्रेणी की चिंता के साथ जीते हैं
00:02:23हर बार जब आप रन दबाते हैं।
00:02:24और वह भावना ही है जिसके बारे में यह शोध है
00:02:27और जो हम यह पता लगाने की कोशिश कर रहे हैं कि क्या हम इससे बच सकते हैं।
00:02:30तो यहाँ आपके अगले 18 मिनट के लिए मेरा वादा है।
00:02:33मैं आपको दिखाने जा रहा हूँ कि वह 200 नंबर कहाँ से आया,
00:02:36क्या यह अभी भी सच है,
00:02:37और आज असली संख्या क्या है,
00:02:39क्योंकि यह एक परिमाण के क्रम से आगे बढ़ गया है।
00:02:41और फिर हम इस बारे में बात करने जा रहे हैं कि इसका क्या अर्थ है
00:02:44आपके लिए दूर ले जाने के लिए।
00:02:46आपके कौशल और संकेत वास्तव में कितने लंबे हो सकते हैं,
00:02:49और आपको क्या बदलाव करने चाहिए
00:02:51परिणामस्वरूप आपके वर्कफ़्लो के लिए।
00:02:54तो 200 नंबर लोककथा नहीं है।
00:02:57यह IfScale नामक एक वास्तविक बेंचमार्क से आता है,
00:02:59इस आदमी के एक पेपर से जिसका नाम मैं गड़बड़ करने जा रहा हूँ,
00:03:03जारोस्लाविक्ज़, और सह-लेखकों ने पिछले साल।
00:03:06और परीक्षण खूबसूरती से सरल है।
00:03:10यहाँ बताया गया है कि IfScale कैसे काम करता है।
00:03:12आप मॉडल से एक व्यावसायिक रिपोर्ट लिखने के लिए कहते हैं,
00:03:14और आप इसे विशिष्ट शब्दों की एक सूची देते हैं
00:03:16जिसे रिपोर्ट में बिल्कुल शामिल करना होगा।
00:03:19सटीक शब्द ग्राहक को शामिल करें,
00:03:20राजस्व शब्द को शामिल करें,
00:03:22और इसी तरह जितने चाहें उतने शब्दों के लिए।
00:03:24इनमें से प्रत्येक एक निर्देश है जिसका उसे पालन करना है।
00:03:27और फिर आप गिनते हैं कि उनमें से कितने सटीक शब्द दिखाई दिए।
00:03:32तो क्योंकि परीक्षण बहुत सरल है,
00:03:34आपको अपने दिमाग में केवल दो नंबर रखने हैं।
00:03:36एक घनत्व है, जिसे हम n कहते हैं।
00:03:38वह यह है कि हम एक साथ कितने नियमों के बारे में बात कर रहे हैं।
00:03:41और दूसरा सटीकता है,
00:03:42जो उन नियमों का प्रतिशत है
00:03:43कि यह वास्तव में पालन करने में सक्षम था।
00:03:46अब आप कह सकते हैं कि रिपोर्ट में यादृच्छिक शब्दों को शामिल करना
00:03:50वास्तविक निर्देशों का पालन करने के समान नहीं है,
00:03:52और उचित पर्याप्त है, और हम इसके बारे में बात करने जा रहे हैं।
00:03:55लेकिन कीवर्ड एक प्रॉक्सी हैं।
00:03:57राजस्व शब्द शामिल करें कार्य का समान आकार है
00:04:01मूल्य निर्धारण पर एक अनुभाग शामिल करने के रूप में, है ना?
00:04:02या इस वाक्यांश का प्रयोग कभी न करें।
00:04:04यह एक अलग, नामित बाधा है
00:04:06जो आपने एजेंट से कहा है कि उसे पालन करना होगा।
00:04:09यदि कोई मॉडल एक संकेत में 200 शब्दों को ट्रैक नहीं कर सकता है,
00:04:11यह निश्चित रूप से संघर्ष करने जा रहा है
00:04:13200 अधिक जटिल निर्देशों के साथ।
00:04:16इसलिए यदि कुछ भी हो, तो यह बदतर करने जा रहा है।
00:04:20तो यह संख्या एक छत है।
00:04:22यह संख्या उतनी ही अधिक है जितनी आप जा सकते हैं।
00:04:23यदि आप इसे अधिक जटिल निर्देश देते हैं,
00:04:25संख्या शायद कम होने जा रही है।
00:04:27और 200 वास्तव में कम छत है।
00:04:30तो नए मॉडल का पीछा करने से पहले,
00:04:32आपको अच्छा विज्ञान करना होगा,
00:04:33जिसका अर्थ है कि आपको पुराने परिणाम को दोहराना होगा
00:04:36और सुनिश्चित करें कि 200 छत असली है।
00:04:39तो मैंने मूल बेंचमार्क को फिर से चलाया।
00:04:42मूल पत्र ने मॉडल के एक पूरे बैच का परीक्षण किया,
00:04:45और मॉडल बहुत तेजी से जीते और मरते हैं।
00:04:47इसलिए जब तक मैंने यह परीक्षण करना शुरू किया,
00:04:50मूल सेट में मॉडल में से केवल तीन
00:04:5210 मॉडल में से जो उन्होंने इस्तेमाल किया
00:04:54किसी भी प्रकार के API के माध्यम से अभी भी उपलब्ध थे।
00:04:57तो वे GPT 4.1, Claude Sonnet 4 थे,
00:04:59और Gemini 2.5 Pro.
00:05:01वे ऐसे मॉडल थे जो 12 महीने पहले उपलब्ध थे,
00:05:03जो अब भी उपलब्ध हैं।
00:05:05और यही कारण है कि हमने उन तीनों का परीक्षण किया,
00:05:07'क्योंकि वे वही थे जो बचे थे।
00:05:08और चूंकि मैंने पहली बार इस शोध को प्रकाशित किया था
00:05:11कुछ सप्ताह पहले,
00:05:12उन तीन मॉडलों में से एक को सेवानिवृत्त कर दिया गया है।
00:05:14तो यह आखिरी बार संभव था
00:05:16कि मैं इस परीक्षण को चला सकता था।
00:05:17तो उस लाइनअप में, हम पहले से ही दो पर नीचे हैं।
00:05:20तो अपने मॉडल से न जुड़ें।
00:05:22तो यहाँ परिणाम हैं जो हमें दोहराते हुए मिले
00:05:25मूल यदि पैमाने खोज।
00:05:27वह ऊर्ध्वाधर अक्ष पर सटीकता है।
00:05:29तो यह 100% से शुरू होता है और गिरना शुरू होता है।
00:05:32और फिर लॉग स्केल पर नीचे की ओर जाने वाले नियमों की संख्या।
00:05:35लॉग स्केल पर नीचे।
00:05:36तो हर बार जब यह आधा हो जाता है,
00:05:37इसने उन नियमों की संख्या को दोगुना कर दिया है जिनसे यह निपट रहा है।
00:05:42तो 500 नियमों से, आप उनमें से 30, 40, 50% खो रहे हैं।
00:05:46हमारे वक्र मूल पेपर के परिणामों से मेल खाते हैं
00:05:49शोर सीमा के भीतर, इसलिए निष्कर्ष वास्तविक था।
00:05:52एक साल पहले, लगभग 200 से 300 नियमों पर,
00:05:55अग्रणी मॉडल खराब होने लगे थे।
00:05:57यह वास्तव में एक निचली सीमा है।
00:06:00तो यह हमारा बेसलाइन है, और अब मजेदार हिस्सा आता है
00:06:03जहां हमने बिल्कुल वही परीक्षण लिया
00:06:05और इसे मौजूदा सीमा पर आजमाया,
00:06:07या यूं कहें कि मौजूदा सीमा क्या थी
00:06:09जब मैंने यह परीक्षण चलाया था।
00:06:10तो मैंने GPT 5.5, Claude Opus 4.7 चलाया,
00:06:13क्योंकि मैंने यह परीक्षण चलाने के एक हफ्ते बाद 4.8 आया था,
00:06:17Gemini 3.1 Pro, और Deep Seek V4 Pro।
00:06:20तो मैंने उन्हें वही संकेत, वही शब्द दिए,
00:06:22वही सब कुछ, और मुझे तुरंत एक समस्या का सामना करना पड़ा,
00:06:25वह यह था कि उन्होंने इसमें बाजी मार ली।
00:06:27उन सभी ने इस परीक्षण में तुरंत 100% अंक प्राप्त किए,
00:06:30बिल्कुल कोई त्रुटि नहीं।
00:06:34तो हमने सीमा का पता लगाने के लिए एक परीक्षण बनाया था,
00:06:36और मॉडल सीधे सीमा से पार निकल गए
00:06:37बिना यह ध्यान दिए कि वहां कोई सीमा थी भी।
00:06:40और यह एक समस्या थी, क्योंकि बेंचमार्क
00:06:42500 शब्दों पर समाप्त होने के लिए लिखा गया था,
00:06:43इसलिए मुझे बेंचमार्क बदलना पड़ा
00:06:45ताकि नई सीमा का पता लगाया जा सके।
00:06:47इसलिए मैंने लक्ष्य बदल दिए, मैंने इसमें शामिल करने के लिए और अधिक शब्द दिए।
00:06:50मैंने इसे 500 से बढ़ाकर 1,000 कर दिया,
00:06:52मैंने इसे 1,000 से 2,000 तक फिर से दोगुना कर दिया,
00:06:55और मैं तब तक ऐसा करता रहा जब तक कि मैं 10,000
00:06:56शब्दों की शब्दावली तक नहीं पहुंच गया, और यहीं से मुझे सीमा का पता चलना शुरू हुआ
00:07:00कि इन दिनों मॉडल क्या कर सकते हैं।
00:07:03तो मुझे सामने लाने दीजिए, यह मुख्य स्लाइड है,
00:07:06यह परिणाम हैं।
00:07:07याद रखें, वहां x-अक्ष पर लघुगणकीय पैमाना (लॉग स्केल) है।
00:07:12तो यह 500 से 1,000 से 5,000 से 10,000 तक जा रहा है।
00:07:16तो ऐसा लगता है कि वह पैमाना किसी चट्टान से गिर रहा है,
00:07:18और यह वास्तव में लगभग 1,000 नंबरों पर हो रहा है।
00:07:20लेकिन देखिए ये नए वक्र मुड़ने से पहले
00:07:25कितनी दूर दाईं ओर जाते हैं।
00:07:26एक साल पहले, वे 200 से 300 निर्देशों पर गिर रहे थे,
00:07:29और अब मॉडल के आधार पर, सीमा 2,000 के करीब है,
00:07:32और उनमें से सबसे अच्छे के लिए, चट्टान से गिरने से पहले
00:07:36यह 5,000 निर्देशों तक पहुंच जाती है।
00:07:38तो लगभग 12 महीनों में, अग्रणी मॉडल लगभग 10 गुना
00:07:41एक साथ निर्देशों का पालन करने में बेहतर हो गए।
00:07:44यह मुख्य निष्कर्ष है, और इसमें बहुत सारी बारीक बातें हैं
00:07:47जिन्हें हमें समझने की जरूरत है।
00:07:49एक ही संकेत में 2,000 नामित बाधाओं को ट्रैक करने की क्षमता
00:07:53मौजूद है।
00:07:55और यह वास्तव में दिलचस्प है क्योंकि मुझे लगता है,
00:07:57मुझे नहीं पता कि बाकी सभी को भी ऐसा ही महसूस होता है या नहीं,
00:07:59लेकिन मुझे ऐसा लगा जैसे, आप जानते हैं,
00:08:04GPT 5.1 से GPT 5.5 तक की छलांग थोड़ी क्रमिक थी, है ना?
00:08:07ऐसा नहीं लगा कि हम 10 गुना बेहतर हो गए हैं,
00:08:09लेकिन यह एक ऐसा परीक्षण है जो किसी बहुत व्यावहारिक चीज़ के लिए वास्तव में महत्वपूर्ण है,
00:08:14जैसे मेरी स्किल फाइल कितनी लंबी हो सकती है?
00:08:17और एक साल के भीतर, हम 10 गुना बेहतर हो गए।
00:08:21और जो बात मुझे हैरान करती है वह यह है कि यह बेंचमार्क
00:08:23 मुश्किल से एक साल पुराना है।
00:08:25एक साल बाद, 500 एक नगण्य त्रुटि है,
00:08:27और यह मेरे पैरों के नीचे लगातार बदल रहा है।
00:08:29मैंने 4.7 का परीक्षण किया, Opus 4.8 और भी बेहतर है।
00:08:35इसलिए यह चार्ट पहले से ही थोड़ा पुराना है,
00:08:36जो कि असल बात है।
00:08:37यदि आप अपनी इंजीनियरिंग धारणाएं तय करते हैं
00:08:39कि स्किल फाइलें कैसे काम करनी चाहिए,
00:08:41कि आपका संकेत कितना लंबा हो सकता है,
00:08:44और आपने वह लगभग छह महीने पहले किया था,
00:08:46तो आप अब गलत हैं,
00:08:48और आपको शायद अपने काम करने के तरीके को फिर से इंजीनियर करना चाहिए।
00:08:52लेकिन इस कहानी में और भी बहुत कुछ है
00:08:54क्योंकि मॉडल के विफल होने का तरीका
00:08:59नाटकीय रूप से बदल गया
00:09:00और उनके विफल होने का यह तरीका बहुत महत्वपूर्ण है।
00:09:02यह हिस्सा एक पूरी तरह से अप्रत्याशित खोज थी
00:09:06जब मैंने प्रयोग चलाना शुरू किया।
00:09:07और इसने शुरुआत में मेरे परीक्षण को पूरी तरह बिगाड़ दिया
00:09:10क्योंकि पुरानी विफलता का तरीका उबाऊ था।
00:09:13वे बस निर्देश भूल जाते थे
00:09:14और मैं माप सकता था कि कितने निर्देश
00:09:16उन्हें याद रहे या वे भूल गए।
00:09:17लेकिन नए मॉडल अपने ही अजीब,
00:09:20बेहद अनूठे तरीके से बिखर जाते हैं।
00:09:22तो आइए मैं आपको बताता हूँ कि ये चारों मॉडल कैसे विफल होते हैं।
00:09:26Deep Seek 4 एक पारंपरिक मॉडल है।
00:09:29यह बस चीजें भूल जाता है।
00:09:30इसमें कोई ड्रामा नहीं होता।
00:09:31यह लगभग 750 नियमों के आसपास निर्देश भूलना शुरू कर देता है,
00:09:35और 2000 तक, यह लगभग आधे निर्देश छोड़ देता है।
00:09:38तो यह बस भूल जाता है, जो स्पष्ट रूप से वह विफलता का तरीका है
00:09:41जिस पर मुझे सबसे अधिक भरोसा है क्योंकि यह अनुमानित है।
00:09:43इसे मापना बहुत आसान है।
00:09:44और अन्य मॉडल इतनेसहयोगी बिल्कुल नहीं थे।
00:09:48ओपस 4.7 बार-बार तय करेगा
00:09:52कि परीक्षण खतरनाक था।
00:09:54और यह क्या करेगा कि यह मना कर देगा
00:09:57API स्तर पर परीक्षण पूरा करने से।
00:09:59मुझे नहीं पता था कि एक ऐसा API रिस्पॉन्स है
00:10:01जो आप क्लाउड से प्राप्त कर सकते हैं जहाँ यह ऐसा था,
00:10:03नहीं, मैं यह कर सकता था, लेकिन मैं ऐसा नहीं करूँगा।
00:10:06लेकिन यह निश्चित रूप से API-स्तर का रिस्पॉन्स है
00:10:09जिसे क्लाउड समर्थन देता है क्योंकि वे सुरक्षा की
00:10:10बहुत परवाह करते हैं, और मुझे ये चीजें
00:10:13हर समय मिलने लगीं।
00:10:15और ऐसा होने का कारण यह था
00:10:16कि क्लाउड के पास एक बहुत संवेदनशील सुरक्षा वर्गीकरण है।
00:10:19और यदि आप शब्दों के कुछ संयोजन दर्ज करते हैं,
00:10:22जैसे मान लीजिए एंथ्रेक्स और साइनाइड,
00:10:24तो यह तय करता है कि पूरा अनुरोध खतरनाक है
00:10:26और यह पीछे हट जाता है।
00:10:27और यदि आपको याद है कि मेरा परीक्षण क्या करता है,
00:10:29मेरा परीक्षण निर्देश फ़ाइल में पाँच से दस हजार
00:10:33यादृच्छिक शब्द फेंक रहा है।
00:10:35और इसलिए मेरे द्वारा यादृच्छिक रूप से चुने गए शब्दों में
00:10:38हर तरह की चीजें थीं जो सुरक्षा फ़िल्टर को
00:10:39संयोजन में खतरनाक लगती थीं।
00:10:41और इसलिए यह यह कहते हुए पीछे हटता रहा कि मैं इससे
00:10:43बम बनाने या कुछ और के लिए कह रहा था।
00:10:47तो हमें, क्लाउड को सहयोग करने के लिए राजी करने के लिए,
00:10:52मुझे अपने सभी शब्दों को लेना पड़ा
00:10:54और उन्हें ओपनएआई के सुरक्षा फ़िल्टर से चलाना पड़ा
00:10:56तथा सभी आपत्तिजनक दिखने वाले शब्दों को फ़िल्टर करना पड़ा
00:10:58ताकि यह कहीं भी पहुँच सके।
00:10:59एक बार जब मैंने इसे वह दे दिया, तो क्लाउड ने वास्तव में बहुत अच्छा किया।
00:11:03लेकिन विफलता का तरीका यह है कि क्लाउड के लिए यह तय करने की संभावना
00:11:05अधिक होती है कि आप जो कर रहे हैं वह बहुत शुरुआती चरण में खतरनाक है,
00:11:08यानी, आप जानते हैं, यहाँ तक कि दो या तीन सौ निर्देशों पर भी
00:11:11यदि आप जो कर रहे हैं, वह, आप जानते हैं,
00:11:13चिकित्सा सलाह से संबंधित कुछ भी शामिल करता है
00:11:15क्योंकि चिकित्सा चीजें अक्सर दोहरे उद्देश्य वाली होती हैं।
00:11:17वे खतरनाक हो सकती हैं, वे सुरक्षित हो सकती हैं।
00:11:20तो तीसरा विफलता का तरीका जेमिनी 3.1 प्रो था।
00:11:24जेमिनी 5,000 निर्देशों तक पूरी तरह से मजबूत रहता है।
00:11:28यह बेहद अच्छा प्रदर्शन करता है।
00:11:30वास्तव में चार्ट पर सर्वश्रेष्ठ में से एक है।
00:11:32और उसके बाद, यह अजीब हो जाता है।
00:11:35यह निर्देशों को भूलता नहीं है।
00:11:37यह निर्देशों से अभिभूत हो जाता है।
00:11:39यह जो करने की कोशिश करता है वह यह है कि, यह सोचने वाले टोकन का उपयोग करता है
00:11:44यह सुनिश्चित करने के लिए कि यह पालन कर रहा है
00:11:45एक साथ सभी निर्देशों का।
00:11:46और जब निर्देशों की संख्या वास्तव में अधिक हो जाती है,
00:11:48यह अपने सभी थिंकिंग टोकन्स का उपयोग करता है।
00:11:50यह सोचने में अपने पूरे टोकन बजट का उपयोग करता है
00:11:53और फिर यह कोई आउटपुट नहीं देता।
00:11:55यह, यह लगभग नौ तक पहुँच जाता है, आप जानते हैं,
00:11:57यदि आपने इसे 10,000 टोकन के बराबर दिया है,
00:11:59तो यह 9,500 टोकन के बराबर सोच लेगा
00:12:02और फिर आपको 500 शब्दों की प्रतिक्रिया देगा,
00:12:04 जिसमें इनमें से कोई भी टोकन नहीं होता है।
00:12:07तो यह सोच-सोचकर खुद को कोने में फँसा लेता है
00:12:09और वास्तव में उत्तर देने के लिए जगह ही नहीं छोड़ता,
00:12:10जो कि बहुत महंगा है और पूरी तरह से अनुपयोगी है,
00:12:13जो कि इसके स्वभाव के अनुकूल ही है, है ना?
00:12:19जिसे, आप जानते हैं, मैं कभी ज़ोर से नहीं कहूँगा।
00:12:23और अंत में विजेता आता है, जो कि GPT 5.5 है।
00:12:26GPT 5.5 इन सब में सबसे अच्छा है, 99% सटीकता,
00:12:29पूरे 5,000 नियमों तक।
00:12:32लेकिन अगर आप इसे बहुत आगे तक धकेलते हैं,
00:12:33तो यह समूह में सबसे अजीब है।
00:12:35क्योंकि यह सीधे तौर पर मना नहीं करता,
00:12:37यह चुपचाप नहीं भूलता।
00:12:38इसके बजाय, यह क्या करता है कि यह निराश हो जाता है
00:12:41और आपसे कहता है कि यह टेस्ट बेवकूफ़ाना है।
00:12:45यह रिपोर्ट शुरू करता है, इसे कुछ मिल जाते हैं,
00:12:47जैसे कि बात यह है,
00:12:48यह सिर्फ यह कहकर शुरुआत नहीं करता कि नहीं।
00:12:50यह रिपोर्ट शुरू करता है,
00:12:51यह रिपोर्ट लिखना शुरू करता है,
00:12:52और रिपोर्ट के लगभग 500 शब्द अंदर जाने पर,
00:12:54यह कहता है, नहीं, यह बकवास है।
00:12:55मैं यह नहीं करने वाला।
00:12:56और फिर यह शालीनता से आपको बताता है कि यह बकवास है।
00:12:58मैं अब यह नहीं करने जा रहा हूँ।
00:13:00यह वास्तविक प्रतिक्रिया थी जो इसने मुझे दी।
00:13:02लेकिन यह इस बिजनेस रिपोर्ट के लगभग 5,000 शब्द अंदर था
00:13:05जिसे मैंने इसे जनरेट करने के लिए कहा था।
00:13:08तो यह गलत नहीं है, है ना?
00:13:10मैं एक सुसंगत बिजनेस रिपोर्ट की मांग कर रहा था
00:13:12जो बिना किसी विशेष विषय के हो
00:13:14और जिसमें 5,000 यादृच्छिक शब्द हों।
00:13:17तुम सही हो, GPT।
00:13:19यह पूछने के लिए एक बेवकूफ़ाना चीज़ है।
00:13:23जो कि एक बेहद अनुचित अनुरोध है,
00:13:25और GPT ने इस पर अपनी बात रखी।
00:13:27लेकिन यह अभी भी परीक्षण में विफलता के रूप में गिना जाता है।
00:13:29क्योंकि आधी अधूरी रिपोर्ट जो यह आपको देता है
00:13:31उसमें अधिकांश कीवर्ड गायब हैं,
00:13:32और यह पता लगाना भी सबसे कठिन है।
00:13:35क्योंकि क्लाउड तुरंत पीछे हट जाता है।
00:13:36क्लाउड कहता है, नहीं,
00:13:37मैं यह नहीं करने वाला।
00:13:39Deep Seek पूरी कोशिश करता है।
00:13:41लेकिन GPT ऐसा काम करता है जो अच्छा लगता है,
00:13:44जब तक कि आप रिपोर्ट के आखिर तक न पढ़ें,
00:13:46जहाँ यह कहता है, नहीं, असल में,
00:13:47मैं पीछे हट रहा हूँ क्योंकि यह बकवास है।
00:13:51तो यदि आप पीछे हटकर चारों को एक साथ देखें,
00:13:53तो Deep Seek चुपचाप भूल जाता है।
00:13:54क्लाउड डर जाता है और मना कर देता है।
00:13:56जेमिनी ज़रूरत से ज़्यादा सोचकर सन्नाटे में आ जाता है।
00:13:58और GPT 5.5 आधा काम पूरा कर लेता है,
00:14:00और आपको बताता है कि बाकी का हिस्सा इसके स्तर से नीचे है।
00:14:04और बात यह नहीं है कि इनमें से कौन सा सबसे मज़ेदार है।
00:14:07हालाँकि यह वाकई थोड़ा मज़ेदार है।
00:14:09मुद्दा यह है कि, क्या इसने मेरे निर्देशों का पालन किया,
00:14:12अब इसमें विफलता का केवल एक तरीका नहीं है।
00:14:14इसके असफल होने के चार अलग-अलग तरीके हैं।
00:14:16और आप उस विफलता को तब तक पहचान नहीं सकते जब तक आप यह नहीं जानते
00:14:19कि आप किस मॉडल से निपट रहे हैं और इसके विफल होने का पैटर्न क्या होगा।
00:14:23तो मॉडल 10 गुना बेहतर हो गए हैं।
00:14:27वे मज़ेदार तरीकों से असफल होते हैं।
00:14:29जब आप अपने डेस्क पर लौटें तो आपको परवाह क्यों करनी चाहिए?
00:14:31क्योंकि आपके वर्कफ़्लो में तीन चीजें बदल गई हैं।
00:14:34पहला यह है कि एक साल पहले, समझदारी इसी में थी कि हर स्किल्स फ़ाइल को बहुत, बहुत छोटा रखा जाए।
00:14:39200 से कम निर्देश, फिर उप-कौशल और अतिरिक्त कौशल फ़ाइलों और उप-फ़ाइलों की एक पूरी जटिल भूलभुलैया की ओर इशारा करना।
00:14:50और आप बहुत छोटी उपलब्ध जगह में फिट होने के लिए अपने निर्देशों को संकुचित कर रहे थे और अब आपको ऐसा करने की आवश्यकता नहीं है।
00:14:57आपकी स्किल्स फ़ाइलें बहुत लंबी हो सकती हैं।
00:14:59नंबर दो यह है कि यदि आपके उपयोग के मामले में सौ विशिष्ट नियमों या 300 की आवश्यकता है, तो आप उन सभी को प्रॉम्प्ट में रख सकते हैं।
00:15:06आपको यह सोचते हुए जागते रहने की ज़रूरत नहीं है कि मॉडल ने चुपचाप कौन से को नजरअंदाज कर दिया।
00:15:12और यदि आप मॉडल का उपयोग करने के अपने स्वयं के प्रत्यक्ष अनुभव के बारे में सोच रहे हैं, तो आप शायद इसे पहचान लेंगे।
00:15:21आपने पाया है कि आप इस बात से कम चिंतित हो गए हैं कि आपका प्रॉम्प्ट कितना लंबा होने वाला है, क्योंकि मॉडल आपके प्रॉम्प्ट का पालन करने में वास्तव में 10 गुना बेहतर हो गए हैं।
00:15:322,000 नामित बाधाएँ एक पूरी शैली मार्गदर्शिका हैं, है ना?
00:15:35यह हर ब्रांड नियम, हर कानूनी अस्वीकरण है।
00:15:38एक साल पहले, आपको इसे एक दर्जन विशेष एजेंटों में विभाजित करना पड़ता और उम्मीद करनी पड़ती कि आपके विशेष एजेंट एक-दूसरे को सुचारू रूप से सौंप रहे हैं।
00:15:46लेकिन अब आप इसे नजरअंदाज कर सकते हैं।
00:15:48लेकिन तीसरी बात सबसे बड़ी है।
00:15:50सवाल यह हुआ करता था, क्या मॉडल यह भी कर सकता है?
00:15:53और इसका उत्तर अब दृढ़ता से हाँ है।
00:15:55खैर, काफी हद तक दृढ़ता से।
00:15:58क्या यह कीमत के लायक है, यह नया सवाल है।
00:16:01क्योंकि आप अपने प्रॉम्प्ट में 10,000 शब्दों के -- माफ कीजिए, 10,000 अलग-अलग निर्देश शामिल कर सकते हैं, लेकिन यह एक बहुत बड़ा प्रॉम्प्ट होने जा रहा है।
00:16:07यह एक बहुत महंगा प्रॉम्प्ट होने जा रहा है।
00:16:09यह एक बहुत धीमा प्रॉम्प्ट होने जा रहा है।
00:16:10इसलिए जो कभी एक कड़ी दीवार हुआ करती थी जिससे आप टकराते थे, वह अब एक नरम समझौता बन गया है कि क्या मेरे लिए इन सभी अतिरिक्त निर्देशों को जोड़ना उचित है यदि इससे मुझे अधिक लागत और अधिक विलंबता मिलने वाली है।
00:16:19और अब, Q&A को रोकने के लिए कुछ चेतावनियाँ।
00:16:25पहला और सबसे महत्वपूर्ण, मैंने इसका जिक्र पहले किया था, यह एक प्रॉक्सी कार्य है, एक नकली बिजनेस रिपोर्ट में यादृच्छिक शब्दों को शामिल करना इस बात का प्रमाण है कि लंबी कौशल फ़ाइल काम करती है।
00:16:38यह इस बात का प्रमाण नहीं है कि लंबी कौशल फ़ाइल काम करती है।
00:16:41इसके अलावा, मॉडल बहुत अलग बिंदुओं पर दीवार से टकराते हैं, 750 से लेकर 9,000 से अधिक तक, इसलिए आपको अपने मॉडल का चयन बहुत सावधानी से करना होगा।
00:16:49हमारा परीक्षण जो नहीं करता है वह यह मापना है कि क्या मॉडल ने एक विशाल प्रॉम्प्ट पर स्पष्ट रूप से तर्क किया है।
00:16:57तो, अच्छी खबर यह है कि चूंकि मैंने कई हफ्ते पहले अपना शोध किया था, इसलिए बहुत सारे लोग इस पर जुट गए हैं, और अब अच्छा शोध उपलब्ध है।
00:17:05वास्तविक वैज्ञानिक शामिल हो गए हैं और किया है -- क्रोमा ने 18 मॉडल में संदर्भ सड़न (context rot) का काम किया है, जिससे यह पता चलता है कि लंबे इनपुट पर सटीकता संदर्भ विंडो सीमा तक पहुँचने से बहुत पहले 30 से 50 प्रतिशत तक गिर सकती है।
00:17:21और उनकी खोज का अजीब हिस्सा यह था कि सुसंगत, अच्छी तरह से संरचित पाठ उस विफलता मोड से टकराने की अधिक संभावना है यदि आप बस अपने निर्देशों को यादृच्छिक क्रम में रखते हैं और उन्हें फेरबदल करते हैं।
00:17:33मुझे नहीं पता कि ऐसा क्यों है, मुझे उनकी रिपोर्ट पढ़नी होगी।
00:17:37तो, मॉडल 2,000, 5,000, संभवतः 10,000 निर्देशों को ट्रैक कर सकता है, लेकिन यह जरूरी नहीं कि उन पर स्पष्ट रूप से तर्क करेगा।
00:17:46यह आवश्यक नहीं है -- यदि वे निर्देश परस्पर विरोधी हैं, यदि उनके बीच तनाव है, तो यह आवश्यक नहीं है कि वह इसे सही समझे।
00:17:53और फिर दूसरा है जिसका मैंने संक्षेप में उल्लेख किया था।
00:17:56क्लाउड के इनकार कष्टप्रद हैं, लेकिन वे मुखर हैं।
00:18:00आपको एक त्रुटि मिलती है, आप जानते हैं कि यह विफल हो गया।
00:18:02जीपीटी की विनम्र आधी-अधूरी रिपोर्ट बहुत अधिक खतरनाक है क्योंकि यह एक वास्तविक उत्तर की तरह दिखती है।
00:18:07यह देखने के लिए कि यह आधे रास्ते में चुपचाप हार गया, आपको पूरी बात पढ़नी होगी, जिसका अर्थ है कि आप आउटपुट पर भरोसा नहीं कर सकते।
00:18:13इसका मतलब है कि यह सुनिश्चित करने के लिए कि यह काम कर रहा है या नहीं, आपको हर बार आउटपुट पढ़ना होगा।
00:18:17तो, मॉडल आपके 2,000 नियमों को स्वीकार करेगा और आपको वापस कुछ ऐसा सौंपेगा जो कम से कम शुरुआत में आश्वस्त और पॉलिश दिखता है, लेकिन आधे रास्ते में पीछे हट सकता है।
00:18:30तो, एक तरफ, लोग हमेशा मुझसे पूछते हैं कि इन सब पर मुझे कितना खर्च आया।
00:18:34इन सभी प्रश्नों को चलाने में मुझे $209 का खर्च आया।
00:18:37सात मॉडल में 2,300 कॉल की कीमत $209 थी।
00:18:43यह पता चला है कि नए शोध में ज्यादा खर्च नहीं आता है।
00:18:46और यह बातचीत का वह हिस्सा है जहाँ मैं कह रहा था कि आपको उत्पादन में इन चीजों की जाँच करनी होगी क्योंकि आप यह भरोसा नहीं कर सकते कि आपका मॉडल चुपचाप विफल नहीं होने जा रहा है।
00:18:55तो, आप जानते थे कि मैं आखिरकार ईवल (evals) का जिक्र करने जा रहा था क्योंकि मैं अराइज में काम करता हूँ और यहीं मैं ऐसा करता हूँ।
00:19:01लेकिन अराइज के लिए बहुत सारे प्लग हैं।
00:19:03इसलिए, मैं केवल एक सच्ची बात कहने जा रहा हूँ, वह यह है कि यदि आप एक वास्तविक एआई एप्लिकेशन बना रहे हैं और इसे वास्तव में पेचीदा काम दे रहे हैं,
00:19:10तो आप एक फ्रंटियर मॉडल के साथ इनमें से एक या अधिक विफलता मोड में भागने वाले हैं।
00:19:14और जब तक यह क्लाउड नहीं है जो आपको एपीआई स्तर पर जाने के लिए कह रहा है, यह जानने का एकमात्र तरीका कि कुछ गलत हो गया है, वह दूसरे एलएलएम के साथ आपके आउटपुट की निगरानी करना है।
00:19:23यह एक ईवल है और यही अराइज करता है और मैं इसे वहीं छोड़ दूंगा।
00:19:27मैंने पहले ही उल्लेख किया है कि जब से हमने अपना खुद का किया है, तब से नया शोध हुआ है।
00:19:30यहाँ एक और महत्वपूर्ण बात है।
00:19:3146 मॉडलों का परीक्षण करने वाला एक पेपर आया जिसका नाम 'निर्देश पालन में भाषा मॉडलों की विश्वसनीयता पर पुनर्विचार' (Revisiting the Reliability of Language Models in Instruction Following) है,
00:19:37जिसके बारे में आप शर्त लगा सकते हैं कि मेरे खुद उस शोध को करने के बाद मेरे कान खड़े हो गए।
00:19:41और उन्होंने कुछ असहज पाया, जो यह है कि एक मॉडल हमारे जैसे बेंचमार्क में उत्कृष्ट प्रदर्शन कर सकता है और फिर भी पूरी तरह से अविश्वसनीय हो सकता है।
00:19:47क्योंकि यदि आप उसी निर्देश को थोड़े अलग तरीके से दोबारा लिखते हैं, तो इससे इस बात पर भारी अंतर आ सकता है कि यह उन निर्देशों का कितनी अच्छी तरह पालन करता है।
00:19:56तो मॉडल 2,000 निर्देशों का पालन कर सकता है और यह इसे वास्तव में अच्छी तरह से कर सकता है।
00:20:00लेकिन यदि आप उन्हीं निर्देशों, उन्हीं 2,000 निर्देशों को एक अलग क्रम में रखते हैं, तो यह अचानक मॉडल को उन निर्देशों का पालन करने में बहुत खराब बना सकता है।
00:20:08और बिल्कुल ऐसा कैसे करें, अपने मॉडल को देने के लिए निर्देशों का सही क्रम क्या है ताकि यह भ्रमित होने के बजाय उनका पूरी तरह से पालन करे, यह अभी भी शोध किया जा रहा है।
00:20:19तो क्षमता बढ़ गई है, लेकिन विश्वसनीयता अभी भी एक समस्या है।
00:20:24और फिर यह सिर्फ एक छोटी सी शेखी है क्योंकि मैं इसके बारे में खुश था, जैसे मैं कोई वैज्ञानिक नहीं हूँ, मैंने कुछ शोध किया।
00:20:31और फिर कई अन्य वास्तविक वैज्ञानिक इसमें शामिल हो गए और उसी प्रश्न पर वास्तविक विज्ञान किया।
00:20:36अब इस एक ही प्रश्न को मापने के लिए कई सारे बेंचमार्क सामने आ गए हैं।
00:20:40फायरबेंच, सीसीआरबेंच, गाइडबेंच सभी एक ही चीज़ को मापने की कोशिश कर रहे हैं।
00:20:44मॉडल एक साथ बहुत सारे वास्तविक, गंदे प्रतिबंधों का कितनी अच्छी तरह पालन करते हैं।
00:20:49और अब पूरा क्षेत्र इसे देख रहा है, इसलिए यदि आप मेरे, आप जानते हैं, 10,000 यादृच्छिक शब्दों से बेहतर विज्ञान चाहते हैं, तो वास्तविक विज्ञान अब मौजूद है।
00:20:58तो यह मुझे वहाँ ले जाता है जहाँ मैं आपको छोड़ दूँगा।
00:21:00एक साल पहले, एक कौशल लिखने का कठिन हिस्सा बिना मॉडल के कथानक खोए सब कुछ फिट करना था।
00:21:05वह एक संपीड़न समस्या थी और संपीड़न समस्या चली गई है।
00:21:08मॉडल आपके 2,000 निर्देशों को बहुत अच्छी तरह से रखेगा।
00:21:11नया कठिन हिस्सा यह जानना है कि क्या इसने वास्तव में वह किया जो आपने कहा था, और वह एक सत्यापन समस्या है।
00:21:16एक बेहतर प्रॉम्प्ट लिखकर सत्यापन समस्या का समाधान नहीं होता है।
00:21:20इसका समाधान हर बार उसी तरह आउटपुट की जाँच करके किया जाता है जैसे आप किसी अन्य कोड का परीक्षण करते हैं, जिसका अर्थ है एक ईवल।
00:21:26एक साल में सीमा 10 गुना बढ़ गई।
00:21:29तो वापस जाइए और छह महीने पहले की गई उन धारणाओं की जाँच कीजिए कि आपके प्रॉम्प्ट कितने बड़े होने चाहिए, आपके निर्देश कितने बड़े हो सकते हैं, क्योंकि वे पहले से ही गलत हो सकते हैं।
00:21:41तो यह वार्ता है।
00:21:42यदि आप सारा कोड और सारा डेटा चाहते हैं, तो यह इस गिटहब यूआरएल पर है।
00:21:48और यह दूसरा क्यूआर कोड कुछ ऐसा है जिसे मार्केटिंग ने मुझे डालने के लिए मजबूर किया।
00:21:51आज शाम 5:00 बजे हमारी विश्व कप देखने की पार्टी है।
00:21:55आप हमारी पार्टी में आ सकते हैं।
00:21:56वह लिंक लुमा का है जो आपको पार्टी में ले जाएगा।
00:22:01मुझे उम्मीद है कि इस वार्ता ने आपको कुछ नई जानकारी दी है या कम से कम कुछ हँसी दी है, और आपके समय और ध्यान के लिए बहुत-बहुत धन्यवाद।
00:22:07धन्यवाद।
00:22:08धन्यवाद।
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기