सब खत्म... GPT 6 एस्ट्रा और फेबल 5.1 की बहस यहीं खत्म हो गई

AAI LABS
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Fable 5.1 और GPT-6 Astra को कुछ ही दिनों के अंतराल पर रिलीज़ किया गया था और दोनों को बेंचमार्क पर वास्तव में
00:00:05बहुत उच्च स्कोर मिले हैं। Astra ने तो AGI टेस्ट में लगभग 100% स्कोर किया, जिसके आस-पास भी कोई मॉडल
00:00:11कभी नहीं आया है। तो उन नंबरों को देखकर आप उम्मीद करेंगे कि जब आप इसे अपना काम देंगे
00:00:16तो यह बहुत अच्छा प्रदर्शन करेगा। लेकिन उन टेस्ट में अच्छा प्रदर्शन करना यह नहीं बताता है कि कोई मॉडल
00:00:20संभाला जाएगा जो आप इसे देते हैं, और हम देखना चाहते थे कि क्या दोनों मॉडल हमारे
00:00:25अपने काम पर उतने ही अच्छे से प्रदर्शन करते हैं। चूंकि हम एक सॉफ्टवेयर कंपनी हैं, इसलिए हमारे पास उन पर टेस्ट करने के लिए पहले से ही प्रोजेक्ट थे इसलिए हमने दोनों
00:00:30मोडलों को उन प्रोजेक्ट्स से काम दिया और जांच की कि उन्होंने क्या पूरा किया। हमने प्रत्येक मॉडल को कई
00:00:35प्रोजेक्ट्स में चलाया और स्कोर किया कि इसने अलग-अलग क्षेत्रों में कितना अच्छा प्रदर्शन किया। हमने निर्णय लेने में मदद के लिए GPT-5.6 का उपयोग किया
00:00:41परिणामों और उनके स्कोर का। इस जज मॉडल को नहीं पता था कि कौन से परिणाम Fable से आए हैं और कौन से
00:00:45Astra से। एक मॉडल को 100 में से 86 का कुल स्कोर मिला जबकि दूसरे को 84 मिला। अब यह लग सकता है
00:00:52एक छोटे अंतर की तरह लेकिन जो मॉडल कुल मिलाकर आगे आया उसने परीक्षण का हर हिस्सा नहीं जीता और
00:00:57दूसरे ने उनमें से कुछ क्षेत्रों में आश्चर्यजनक रूप से अच्छा प्रदर्शन किया। इसलिए हम देखने जा रहे हैं कि प्रत्येक
00:01:02मॉडल ने हमारे परीक्षण में कैसा प्रदर्शन किया और प्रत्येक श्रेणी में कौन सा जीता ताकि आपको पता चले कि वे अंतर
00:01:07आपके द्वारा दिए जाने वाले काम को कैसे प्रभावित करते हैं। इससे पहले कि हम इस बात पर आगे बढ़ें कि प्रत्येक मॉडल ने कैसा प्रदर्शन किया, आइए पहले समीक्षा करें
00:01:12खुद मॉडल। यह अनुभाग केवल उन लोगों के लिए है जो उनके बारे में नहीं जानते हैं इसलिए यदि आप पहले से ही जानते हैं
00:01:17विवरण आप इस अनुभाग को छोड़ सकते हैं और सीधे अगले अनुभाग पर जा सकते हैं। Anthropic ने रिलीज़ किया
00:01:221 सितंबर को Fable 5.1 और इससे पहले कि Anthropic रिलीज़ के उत्साह का पूरा आनंद ले पाता,
00:01:27OpenAI ने Fable के कुछ ही दिनों बाद GPT-6 Astra को लॉन्च कर दिया और लोग वास्तव में दिलचस्प चीजें बना रहे हैं
00:01:33इन मॉडलों के साथ उत्पाद और इन मॉडलों को उनकी क्षमता की सीमाओं तक धकेलना और वास्तव में
00:01:37आश्चर्यजनक परिणाम। जब मूल्य निर्धारण की बात आती है, तो दोनों मॉडल वास्तव में $10 प्रति समान कीमत पर आते हैं।
00:01:43मिलियन इनपुट टोकन और $50 प्रति मिलियन आउटपुट टोकन। लेकिन Fable 5.1 के साथ एक बात है
00:01:49अलग बात यह है कि एंथ्रोपिक ने कैश्ड रीड की कीमत 75% कम कर दी है। जो लोग नहीं जानते
00:01:54कैश्ड रीड्स के बारे में, बातचीत के कुछ हिस्से जिन्हें मॉडल पहले ही पढ़ चुका है, वास्तव में इसके लिए सहेजे जाते हैं।
00:02:00पुनः उपयोग. जब आप एक नया संकेत भेजते हैं, तो उन सहेजे गए भागों का पुन उपयोग किया जाता है बजाय इसके कि मॉडल उन्हें पढ़े
00:02:05शुरुआत से दोबारा और इसे कैश्ड रीड कहा जाता है। ये रीड पहले से ही बातचीत का पुन उपयोग करना सस्ता बनाते हैं
00:02:10लेकिन घटी हुई कीमत के साथ यह और भी सस्ता हो जाता है। लेकिन इसका मतलब यह नहीं है कि Fable एक है
00:02:14कुल मिलाकर उपयोग करने के लिए सस्ता मॉडल क्योंकि कुल बिल कई अन्य कारकों पर भी निर्भर करता है जो हम करेंगे
00:02:19थोड़ी देर में बात करें। अब Fable मॉडल कुछ समय से Claude कोड में हैं लेकिन Fable 5.1 अभी भी नहीं है
00:02:25क्लॉड प्रो प्लान में शामिल है इसलिए प्रो पर आपको उपयोग क्रेडिट के माध्यम से इसके लिए अलग से भुगतान करना होगा। पर
00:02:30मैक्स प्लान्स, Fable 5.1 शामिल है लेकिन Fable मॉडल की अन्य मॉडलों की तुलना में कम सीमा है।
00:02:36दूसरी ओर, OpenAI एस्ट्रा को इस तरह से एक अलग मॉडल के रूप में नहीं मानता है क्योंकि एस्ट्रा इसका हिस्सा है
00:02:41ChatGPT+ और Pro पर सामान्य कोडेक्स सीमाएं हैं और आप Estra पर सभी उपयोग खर्च कर सकते हैं। अब ये
00:02:47मॉडल लंबे कार्यों पर काम करने में वास्तव में सक्षम हैं जिसका अर्थ है कि आप उनसे एक बड़ा निर्माण करने के लिए कह सकते हैं
00:02:52सुविधा प्रदान करें और उन्हें अपने दम पर चरणों के माध्यम से काम करने के लिए छोड़ दें। लेकिन जब आप इन मॉडलों को काम करते हुए छोड़ देते हैं
00:02:57एक लंबे कार्य पर, संदर्भ की मात्रा जो वे पकड़ सकते हैं वह भी मायने रखती है। Fable आपको इसमें दस लाख टोकन देता है
00:03:02Claude code जबकि कोडेक्स में Astra की डिफ़ॉल्ट संदर्भ विंडो केवल 272,000 टोकन है, भले ही Astra के पास एक है
00:03:09अपनी एपीआई के माध्यम से बहुत बड़ी विंडो जो फेबल के मिलियन से भी अधिक है। लेकिन आप नहीं होंगे
00:03:14अभी के लिए कोडेक्स में वह मिल रहा है क्योंकि कोडेक्स एस्ट्रा के लिए भी 272,000 टोकन की संदर्भ विंडो पर डिफ़ॉल्ट है।
00:03:21अब ये मॉडल ऐसे स्तर पर पहुंच गए हैं जहां वे उन्नत शोध कर सकते हैं इसलिए OpenAI और
00:03:26एंथ्रोपिक दोनों ने सुरक्षा गार्डरेल जोड़े हैं जो उनके द्वारा किए जाने वाले कुछ कार्यों को प्रतिबंधित करते हैं।
00:03:31लेकिन वे प्रतिबंध अलग-अलग तरीकों से आपके काम को भी प्रभावित करते हैं क्योंकि प्रत्येक मॉडल अलग तरह से प्रतिक्रिया करता है
00:03:36जब इसकी सुरक्षा प्रणाली यह तय करती है कि आपका अनुरोध स्वीकृत नहीं है। जब एस्ट्रा कार्य के उस भाग तक पहुँच जाता है जो
00:03:41इसके नियमों के विरुद्ध जाता है, यह सीधे तौर पर उस कार्य से इनकार करता है और आपको इसके बारे में बताता है। दूसरी ओर,
00:03:45जब कोई अनुरोध इसके नियमों के विरुद्ध जाता है तो क्लाउड कोड Fable से कमजोर मॉडल पर स्विच हो जाता है। और कई
00:03:51लोगों ने पाया कि क्लाउड कोड बिना उन्हें बताए मॉडल स्विच कर चुका था। इसलिए यदि क्लाउड कोड जारी रहता है
00:03:56उस स्विच के बाद काम कर रहा है, तो जो परिणाम आपको मिल रहा है वह अब Fable से नहीं आ सकता है।
00:04:01अब पहला मीट्रिक जिसे हमने मापा वह गुणवत्ता थी जो यह देखती है कि मॉडल का काम वास्तव में कितना अच्छा है
00:04:06है. इस परीक्षण के लिए, हमने एकाधिक क्लाइंट प्रोजेक्ट का उपयोग किया ताकि हम उनका विवरण प्रकट न कर सकें
00:04:11प्रोजेक्ट्स लेकिन हम यह समझा सकते हैं कि हमने काम का न्याय कैसे किया और मॉडल कहां भिन्न थे। कोड कितना अच्छा था इसके लिए
00:04:16लिखा और व्यवस्थित किया गया, Fable ने Astra के 78 की तुलना में 90 स्कोर किया क्योंकि इसने इसके लिए कोड रखा था
00:04:22ऐप के विभिन्न हिस्सों को अधिक स्पष्ट रूप से अलग किया गया है। इससे मॉडल के लिए ऐप को समझना आसान हो जाता है जब
00:04:27बाद में परिवर्तन करना और Fable हमारे द्वारा परीक्षण किए गए सभी प्रोजेक्ट्स में इस पर एस्ट्रा से आगे था। और के लिए
00:04:32अनुरोधित कार्य का कितना हिस्सा समाप्त हो गया था, Fable ने Astra के 84 की तुलना में 91 स्कोर किया क्योंकि इसने भी ठीक किया
00:04:39ऐसी समस्याएं जिन्हें ठीक करने के लिए हमने विशेष रूप से नहीं कहा था। लेकिन हमने यह भी जांचा कि क्या समाप्त विशेषताएं
00:04:44बिना सुधार के पूछे सही ढंग से काम किया और उस पर एस्ट्रा ने फेबल के 85 की तुलना में 87 स्कोर किया।
00:04:50Astra کی برتری کا کچھ حصہ ایپس کو زیادہ باریک بینی سے جانچنے اور معلوم مسائل میں سے زیادہ کو ٹھیک کرنے سے آیا۔
00:04:55जब Fable ने अपने ऐप्स का परीक्षण किया, तो इसने कुछ ऐसी स्थितियों को छोड़ दिया जहां वे गलत हो सकते थे, इसलिए समाप्त सुविधाएं
00:05:00अभी भी कुछ समस्याएं थीं। जब ऐप का उपयोग करने के अनुभव की बात आई, तो एस्ट्रा ने फेबल के 88 की तुलना में 89 स्कोर किया,
00:05:08क्योंकि इसने पेज के विभिन्न भागों को ऐसी जगहों पर व्यवस्थित किया जिससे उन्हें ढूंढना और उपयोग करना आसान हो गया।
00:05:13इसलिए हमारे द्वारा अभी उल्लेख किए गए सभी परीक्षणों के आधार पर, Fable का समग्र गुणवत्ता स्कोर 88 था जबकि Astra ने 84 स्कोर किया,
00:05:19क्योंकि इसने अधिक संपूर्ण सुविधाएँ बनाईं और इसके काम को बाद में बदलना आसान था। तो गुणवत्ता के मामले में,
00:05:25Fable एक स्पष्ट विजेता है। लेकिन इससे पहले कि हम अगले परीक्षण की ओर बढ़ें, आइए हमारे प्रायोजक द्वारा एक शब्द सुनें,
00:05:30Zapier. आप एक ऐप वाइबकोड करते हैं और यह बहुत अच्छा काम करता है, लेकिन जिस क्षण आप चाहते हैं कि यह वास्तव में टूल से कनेक्ट हो जाए
00:05:35Gmail, Slack, और Notion की तरह, आप हाथ से हर इंटीग्रेशन और OAuth फ़्लो को वायर कर रहे हैं। इससे पहले कि आप जानते हैं
00:05:41आप प्रमाणीकरण कोड में दबे हुए हैं और अचानक एकीकरण पूरा प्रोजेक्ट बन जाता है। वह है जहाँ
00:05:46Zapier SDK आता है। यह एक कोड लाइब्रेरी है जिसे आप सीधे क्लाउड कोड या कर्सर के भीतर अपने प्रोजेक्ट में छोड़ देते हैं,
00:05:52आपको Zapier के 9000+ ऐप इकोसिस्टम तक प्रोग्रामेटिक पहुंच प्रदान करता है। इसलिए प्रत्येक एकीकरण का निर्माण करने के बजाय
00:05:58हाथ से, हमने केवल उन लोगों को बुलाया जिनकी हमें आवश्यकता थी और आगे बढ़ते रहे। कुछ पंक्तियों में, हमारा ऐप ईमेल भेज रहा था
00:06:04और नोशन पेज बना रहे हैं, कोई एपीआई डॉक्टर नहीं और लड़ने के लिए कोई ऑथ नहीं। और जब हमें अपडेट करने की आवश्यकता महसूस हुई
00:06:10Notion में एक कस्टम प्रॉपर्टी जिसमें पहले से बनी हुई कार्रवाई नहीं थी, हमने सीधे इसके माध्यम से कॉल किया
00:06:15SDK. यह वास्तव में आपसे वहीं मिलता है जहाँ आप पहले से काम करते हैं। यदि आप हाथ से एकीकरण को तार-तार करके थक गए हैं,
00:06:20Zapier SDK को आज़माएं। लिंक नीचे डिस्क्रिप्शन में है। अगला मीट्रिक जिसे हमने मापा वह यह था कि कितना अच्छा था
00:06:26मॉडलों ने लंबे समय तक चलने वाले कार्यों को संभाला, जिसका अर्थ है कि उन्होंने अपने दम पर कितना काम पूरा किया
00:06:31जैसे-जैसे वे काम करते थे, हमारा मार्गदर्शन कम होता था। हमने यह भी जांचा कि रास्ते में आने वाली समस्याओं को उन्होंने कितनी अच्छी तरह संभाला।
00:06:36इसके लिए, हमने प्रत्येक मॉडल को निर्माण के लिए एक ऐप विचार दिया और उसके संकेत मार्गदर्शक के अनुसार अनुरोध तैयार किया
00:06:42ताकि उसके पास काम को अच्छे से करने का सबसे अच्छा मौका हो। हमने उन विशिष्ट विवरणों का उल्लेख नहीं किया जो हम चाहते थे
00:06:47और हमने अभी वर्णन किया है कि ऐप को क्या करने की आवश्यकता है। Estra ने लगभग 32 मिनट तक काम किया और Fable ने इसके लिए काम किया
00:06:53लगभग 44 मिनट. Estra को अपना ऐप बनाने और जांचने के दौरान त्रुटियों का सामना करना पड़ा, लेकिन इसने उनके माध्यम से काम किया
00:06:58और बिना किसी समस्या के प्रत्येक समस्या के माध्यम से हमारा मार्गदर्शन करने के लिए ऐप को ठीक करना जारी रखा। Fable भी समाप्त हो गया
00:07:03जल्दी रुके बिना या हमसे यह पूछे बिना कि आगे क्या करना है, इसका ऐप और इसने जो बनाया था उस पर जाँच की।
00:07:09तो दोनों ने काम को आगे बढ़ाया, लेकिन हमने यह देखने के लिए समाप्त ऐप्स की भी समीक्षा की कि उनके पास क्या है
00:07:13हमारे साथ छोड़ दिया. Estra का ऐप बिना किसी अलग लैंडिंग पेज के सीधे लॉगिन पेज पर खुल गया। एक बार जब हम
00:07:18साइन इन किया, लेआउट अच्छी तरह से व्यवस्थित था और ऐप काम कर रहा था, हालांकि इसमें अभी भी परिचित लेआउट थे जो
00:07:24एआई जनित कई ऐप्स में दिखाई देते हैं। लेकिन हमें साइड पैनल से समस्या थी क्योंकि यह स्क्रॉल नहीं हुआ था
00:07:30हमें साइन आउट बटन तक पहुँचाने के लिए पर्याप्त है। हमें उस बटन तक पहुंचने के लिए ज़ूम आउट करना पड़ा, जो था
00:07:35कुछ ऐसा जिसे Estra के अपने चेक ने नहीं पकड़ा था। Fable का ऐप भी सीधे लॉगिन पेज पर खुला, लेकिन इसका
00:07:40डिज़ाइन बहुत अधिक सामान्य महसूस हुआ। सुविधाएँ काम करती थीं, लेकिन सब कुछ इतनी करीब से पैक किया गया था कि
00:07:45ऐप का उपयोग करना मुश्किल था और दोहराए गए ग्रेडिएंट्स ने उस परिचित एआई-जनित रूप को जोड़ दिया। इसने इसके अनुसार समायोजन किया
00:07:51छोटी स्क्रीन, लेकिन फिर भी इसमें उपयोग करने योग्य लेआउट नहीं था, भले ही सुविधाएँ गहराई से थीं। हम
00:07:56इसके अलावा कई अन्य ऐप्स और विशाल सुविधाएँ भी थीं जिनकी योजना बनाई गई थी और इस तरह मॉडल के साथ बनाई गई थी
00:08:01अपने दम पर काम करने के लिए छोड़ दिया। इसलिए लंबे समय तक चलने वाले काम के लिए, Estra ने Fable के 90 की तुलना में 100 में से 93 स्कोर किया।
00:08:08Fable نے اس بات پر زیادہ توجہ مرکوز کی کہ خصوصیات کو کیسے کام کیا جائے، جب تک کہ ہم نے پرامپٹ میں یہ مشخص نہ کیا ہو کہ اسے کرنا چاہیے۔
00:08:13विजुअल्स पर भी फोकस करें। Estra نے اس بات پر توجہ دی کہ ایپس نے کیسے کام کیا اور کیسی نظر آئیں،
00:08:18तो Estra लंबे समय तक चलने वाले कार्यों पर जीतता है। अगला मीट्रिक जिसे हमने देखा वह डिज़ाइन था और कैसे
00:08:23ऐप्स का उपयोग करना आसान था। हमने मॉडल को डिज़ाइन स्कोर करने दिया, लेकिन हम इस पर भरोसा नहीं करना चाहते थे
00:08:28इसका डिजाइन स्वाद अकेला है। इसलिए हमने Fable के परिणामों के लिए एक दर्शक और Astra के लिए एक और दर्शक बनाया, जिससे हमें जाने की अनुमति मिली
00:08:33डिजाइन के माध्यम से खुद को और तुलना करें कि वे उपयोग करने के लिए कैसे थे। हमने दोनों मॉडलों को एक ही डिज़ाइन दिया
00:08:38कार्य, फ़ॉन्ट बेचने वाले व्यवसाय के लिए लैंडिंग पृष्ठ से शुरू होते हैं। Fable کا ورژن بہت مشابہت رکھتا تھا۔
00:08:44ऑपस क्या उत्पादन करता है, रंग और फोंट से लेकर लेआउट तक। इसमें पाठ की वह पट्टी भी थी जो आगे बढ़ रही थी
00:08:50पेज के पार जिसे हम हाल ही में ऑपस डिज़ाइन में देख रहे हैं। लेकिन एक बात Fable ने अलग की
00:08:55ऑपस से डिज़ाइन में अधिक इंटरैक्टिव तत्व जोड़ना था, और इससे ऐप को महसूस हुआ
00:09:00एस्ट्रा के संस्करण में अधिक खुला लेआउट था, जिसमें टेक्स्ट के आकार में स्पष्ट अंतर थे और
00:09:05रंगों की वजह से टेक्स्ट पढ़ना आसान हो गया था। लेकिन इसमें हलचल बहुत कम थी, इसलिए देखने में तो यह
00:09:10अधिक आरामदायक लगा, लेकिन इसने फेबल के डिज़ाइन जैसा अनुभव नहीं दिया। यही कारण है कि फेबल को
00:09:14इंटरैक्शन स्कोर में 94 अंक मिले, जबकि एस्ट्रा को 85 मिले। इसके बाद, हमने प्रत्येक मॉडल से हॉरर गेम
00:09:20लैंडिंग पेज डिज़ाइन करने को कहा। फेबल के डिज़ाइन ने माहौल बनाने के लिए एक एनिमेटेड लाइटहाउस का उपयोग किया।
00:09:25इसने कलाकृति को SVG के रूप में बनाया, जो कोड से खींची गई छवियां हैं, लेकिन फेबल द्वारा चुने गए आकारों और रंगों के कारण
00:09:31डार्क बैकग्राउंड के मुकाबले टेक्स्ट पर्याप्त रूप से उभर कर नहीं आ रहा था। और उसी डिज़ाइन कार्य पर, एस्ट्रा ने
00:09:36कोड से कलाकृति बनाने के बजाय कोडेक में अंतर्निहित इमेज जनरेशन मॉडल का उपयोग करके एक छवि बनाई।
00:09:42इसने गेम के लिए एक टीज़र भी बनाया, भले ही हमने इसके लिए नहीं कहा था। और एस्ट्रा जहां आगे निकल गया,
00:09:47वह इसके फॉन्ट और रंगों का चुनाव था, जिससे डार्क बैकग्राउंड पर टेक्स्ट साफ दिखाई देने लगा।
00:09:52म्यूजिक फेस्टिवल साइट के लिए, फेबल के संस्करण में उन डिज़ाइन विकल्पों में से कई को दोहराया गया जो हम ओपस द्वारा
00:09:57बनाए गए डिज़ाइनों में देखते हैं। लेकिन उन जाने-पहचाने विकल्पों के साथ भी, ऐसा लगा कि फेबल ने साइट को उसकी
00:10:03अपनी शैली देने में अधिक प्रयास किया है। एस्ट्रा ने एक जनरेटेड कॉन्सर्ट फोटोग्राफ का उपयोग किया, लेकिन कुल मिलाकर डिज़ाइन अधिक
00:10:08सामान्य लगा। अंतिम तुलना एक पैरेलल पार्किंग गेम की थी, जहां फेबल का संस्करण वास्तव में बहुत अच्छी तरह से बनाया गया था,
00:10:13और रियर व्यू मिरर ने हमें यह तय करने में मदद की कि कार को अधिक सटीकता से कहाँ ले जाना है। गेम में दो
00:10:18कैमरा व्यू थे, लेकिन दोनों में समस्याएं थीं। क्योंकि एक पार्किंग की जगह का गलत साइड दिखा रहा था,
00:10:23जबकि दूसरा सामने की सड़क का पूरा दृश्य देने के बजाय केवल एक ही तरफ दिखा रहा था। इससे
00:10:27यह देखना कठिन हो गया कि हम कार को कहाँ ले जा रहे हैं, और यदि वे कैमरे के कोण सही होते, तो गेम
00:10:32अधिक यथार्थवादी महसूस होता। एस्ट्रा ने हमें तीन निश्चित दृश्य दिए और साइड पैनल में ड्राइविंग टिप्स जोड़े,
00:10:38जिससे उसका गेम खेलना आसान हो गया। कैमरा व्यू फेबल की तुलना में बहुत बेहतर थे। ये
00:10:42सामान्य परीक्षण थे जहाँ हमने मॉडल को उन डिज़ाइनों के बारे में बहुत कम विवरण दिया जो हम चाहते थे, इसलिए हम यहाँ
00:10:48मॉडल की अपनी पसंद देख रहे थे। दोनों ने उनके अन्य कार्यों में देखे गए डिज़ाइन विकल्पों को दोहराया, लेकिन दोनों ने
00:10:53अच्छे परिणाम दिए। और इस बारे में थोड़ा और विवरण के साथ कि हम ऐप्स को कैसे देखना और महसूस करना चाहते हैं,
00:10:58हम दोनों से अच्छे डिज़ाइन की उम्मीद करते हैं। तो केवल पसंद के मामले में, एस्ट्रा विज़ुअल और उपयोग में जीता, जबकि फेबल
00:11:04एनिमेशन और इंटरएक्टिविटी में जीता। लेकिन इससे पहले कि हम लागत और गति के परीक्षण की ओर बढ़ें, यह बहुत अच्छा होगा यदि आप
00:11:09चैनल को सब्सक्राइब करें और लाइक बटन दबाएं। समर्थन का यह छोटा सा इशारा हमारे लिए बहुत मायने रखता है।
00:11:15अगला मीट्रिक जिसे हमने मापा वह दक्षता (एफिशिएंसी) था, जिसमें काम की लागत, इसमें कितना समय लगा,
00:11:20और इसे पूरा करने के लिए मॉडल ने अपने टूल का कितनी बार उपयोग किया, यह शामिल था। लागत के बारे में जानने योग्य एक बात यह है कि
00:11:25हमने एपीआई का उपयोग नहीं किया, इसलिए ये इस बात के केवल अनुमान हैं कि उपयोग किए गए टोकन के आधार पर
00:11:31यदि हम एपीआई का उपयोग करते तो काम पर कितना खर्च आता। हमने अपने सामान्य सब्सक्रिप्शन पर परीक्षण चलाए। सभी परीक्षण रनों में, फेबल की
00:11:37कुल अनुमानित लागत $49.18 आई, जबकि एस्ट्रा के लिए यह $27.69 थी, इसलिए एस्ट्रा का कुल खर्च लगभग 44% कम था।
00:11:47फेबल ने एस्ट्रा की तुलना में लगभग 3 गुना अधिक आउटपुट टोकन जनरेट किए, बिल्कुल वैसे ही जैसे फेबल के प्रॉम्प्टिंग गाइड में
00:11:52उल्लेख है कि यह अन्य मॉडल की तुलना में अधिक लिखने की प्रवृत्ति रखता है। दोनों मॉडल के लिए उन टोकन की लागत समान थी,
00:11:57इसलिए अधिक लिखना ही फेबल की लागत बढ़ने का कारण था। टूल का उपयोग करने से भी टोकन का उपयोग बढ़ जाता है,
00:12:03क्योंकि मॉडल तय करता है कि कौन सा टूल उपयोग करना है और फिर काम जारी रखने से पहले परिणामों को पढ़ता है। सभी
00:12:09छह रनों में, फ़ेबुल के मुख्य एजेंट ने एस्ट्रा के 287 की तुलना में अपने टूल्स का उपयोग 443 बार किया, इसलिए इससे भी
00:12:17लागत बढ़ गई। लागत के लिए, एस्ट्रा ने फ़ेबुल के 66 की तुलना में 100 में से 80 अंक प्राप्त किए। गति की बात करें तो, एस्ट्रा भी
00:12:23फ़ेबुल के 67 की तुलना में 70 पर आगे था। लंबे समय तक चलने वाले कार्यों में एस्ट्रा के लिए कुल लगभग 62 मिनट लगे,
00:12:30जबकि फ़ेबुल के लिए 73 मिनट लगे। तो लागत, गति और टूल दक्षता के स्कोर में,
00:12:35एस्ट्रा फ़ेबुल से आगे निकल गया। अगला मीट्रिक जो हमने मापा वह था निर्देश पालन,
00:12:40जहाँ हमने जाँच की कि मॉडल निर्माण के दौरान हमारे द्वारा दिए गए निर्देशों का कितनी अच्छी तरह पालन करते हैं,
00:12:44और क्या वे काम जारी रहने पर भी उनका पालन करते रहे। जब हमने एक प्रोजेक्ट पर फ़ेबुल चलाया,
00:12:49तो इसने शुरुआत में यह कहते हुए एक सह-लेखक संदेश जोड़ा कि क्लाउड ने कोड लिखने में मदद की,
00:12:53भले ही हमारे निर्देशों ने स्पष्ट रूप से ऐसा न करने के लिए कहा हो। इसने इस नियम की भी अनदेखी की कि इसे फ़ाइलें कैसे
00:12:58बनाने या बदलने की अनुमति थी। हमने इसे क्लाउड के अपने फ़ाइल संपादन टूल का उपयोग करने के लिए कहा था, ताकि वे परिवर्तन ट्रैक किए जा सकें
00:13:04और पूर्ववत करना आसान हो, लेकिन इसने इसके बजाय कमांड चलाकर दो फ़ाइलें बनाईं। निर्देश पालन के लिए,
00:13:09एस्ट्रा ने फ़ेबुल के 88 की तुलना में 100 में से 96 अंक प्राप्त किए। तो जब निर्देशों का पालन करने की बात आई,
00:13:16तो इन रनों में एस्ट्रा आगे रहा। अगला मीट्रिक जिसे हमने मापा वह समीक्षा गुणवत्ता थी, जहाँ हमने मॉडल को
00:13:21समस्याओं वाला एक प्रोजेक्ट दिया और उनसे उन समस्याओं को खोजने के लिए कहा। हमने सबसे पहले दोनों मॉडल को समीक्षा के लिए
00:13:27समान कोड दिया, जिसमें जानबूझकर चार समस्याएं जोड़ी गई थीं, ताकि हम जान सकें कि उन्हें क्या खोजने की आवश्यकता है। फ़ेबुल ने
00:13:33सभी चार समस्याओं को खोज लिया, और इसने पांच अतिरिक्त समस्याएं भी खोजीं जो हमने नहीं जोड़ी थीं, जिनकी बाद में
00:13:37जांच की गई और पुष्टि की गई। एस्ट्रा ने हमारे द्वारा जोड़ी गई चार समस्याओं में से दो को खोजा, लेकिन फिर भी हमें बताया कि समीक्षा
00:13:42पूरी हो गई है। हमने तीन ऐसे हिस्से भी शामिल किए जो संदिग्ध लग रहे थे, लेकिन वास्तव में सही थे, क्योंकि
00:13:47हम यह देखना चाहते थे कि क्या मॉडल झूठी समस्याओं की रिपोर्ट करता है। किसी ने भी उन्हें बग नहीं माना, इसलिए
00:13:52यहाँ अंतर इस बात में था कि उन्होंने कितना खोजा, और फ़ेबुल ने हमें अधिक गहन समीक्षा दी,
00:13:57लेकिन जब हमने नौ पुष्ट समस्याओं वाले एक बड़े प्रोजेक्ट पर उनका परीक्षण किया, तो एस्ट्रा ने पाँच को ठीक किया, जबकि फ़ेबुल ने
00:14:03केवल चार को खोजा और ठीक किया। तो एस्ट्रा ने अधिक मरम्मत पूरी की, हालांकि दोनों ने कई समस्याओं को
00:14:08अनसुझा छोड़ दिया। समीक्षा गुणवत्ता के लिए, जिसमें वे मरम्मत और मॉडल द्वारा अपने अन्य काम की जाँच करने के तरीके शामिल थे,
00:14:13फ़ेबुल ने एस्ट्रा के 78 की तुलना में 84 अंक प्राप्त किए। तो फ़ेबुल समग्र समीक्षा स्कोर पर आगे रहा,
00:14:19क्योंकि फ़ेबुल ने हमें कुल मिलाकर बेहतर समीक्षा दी। तो इन परिणामों के आधार पर, एस्ट्रा हमारे द्वारा परीक्षण की गई कई श्रेणियों में स्पष्ट विजेता है,
00:14:25लेकिन इसका मतलब यह नहीं है कि फ़ेबुल एक बुरा मॉडल है, क्योंकि इसने वास्तव में सभी कार्यों में अच्छा प्रदर्शन किया,
00:14:30और उनमें से कई में एस्ट्रा से ज्यादा पीछे नहीं था। इसलिए आपको बस उन कार्यों के आधार पर मॉडल चुनने की आवश्यकता है जो आप उन्हें दे रहे हैं।
00:14:35अब इन दोनों मॉडलों को उनकी अधिकतम क्षमता तक धकेलने के लिए, कुछ ऐसी प्रथाएँ हैं जिनका आपको पालन करने की आवश्यकता है।
00:14:40हमने अपने परीक्षण में उनमें से कई का उपयोग किया, और यदि आप उन तक भी पहुँचना चाहते हैं,
00:14:45तो आप उन्हें हमारे समुदाय 'एआई लैब्स प्रो' में प्राप्त कर सकते हैं। इसलिए यदि आपको हमारे काम में मूल्य मिला
00:14:51और आप चैनल का समर्थन करना चाहते हैं, तो ऐसा करने का यह सबसे अच्छा तरीका है। लिंक विवरण में है।
00:14:56यह इस वीडियो के अंत में लाता है। यदि आप चैनल का समर्थन करना चाहते हैं और ऐसे वीडियो बनाने में हमारी मदद करना चाहते हैं,
00:15:01तो आप नीचे दिए गए सुपर थैंक्स बटन का उपयोग करके ऐसा कर सकते हैं। हमेशा की तरह,
00:15:05देखने के लिए धन्यवाद और मैं आपसे अगले वीडियो में मिलूँगा।

핵심 요약

फेबल 5.1 समग्र गुणवत्ता और कोड संरचना में आगे है, जबकि जीपीटी-6 एस्ट्रा लंबे समय तक चलने वाले कार्यों और कम लागत के मामले में बेहतर प्रदर्शन करता है।

하이라이트

  • फेबल 5.1 और जीपीटी-6 एस्ट्रा के परीक्षण में फेबल को कुल 86 और एस्ट्रा को 84 का स्कोर मिला।

  • फेबल 5.1 के लिए एंथ्रोपिक ने कैश्ड रीड की कीमत में 75 प्रतिशत की कटौती की है।

  • फेबल का समग्र गुणवत्ता स्कोर 88 रहा जबकि एस्ट्रा ने गुणवत्ता के मामले में 84 अंक प्राप्त किए।

  • लंबे समय तक चलने वाले कार्यों में एस्ट्रा ने 93 अंक हासिल किए जबकि फेबल को 90 अंक मिले।

  • एस्ट्रा का कुल खर्च फेबल की तुलना में लगभग 44 प्रतिशत कम था।

  • निर्देशों का पालन करने के मामले में एस्ट्रा ने 96 अंक प्राप्त किए जबकि फेबल को 88 अंक मिले।

타임라인

मॉडलों का परिचय और मूल्य निर्धारण

  • फेबल 5.1 और जीपीटी-6 एस्ट्रा दोनों को बेंचमार्क पर उच्च स्कोर मिले हैं।
  • दोनों मॉडलों की कीमत 10 डॉलर प्रति मिलियन इनपुट टोकन और 50 डॉलर प्रति मिलियन आउटपुट टोकन है।
  • फेबल 5.1 में कैश्ड रीड की कीमत 75 प्रतिशत कम कर दी गई है।

इस भाग में फेबल 5.1 और जीपीटी-6 एस्ट्रा की रिलीज और उनकी समान मूल्य निर्धारण रणनीतियों का विश्लेषण किया गया है। एंथ्रोपिक द्वारा कैश्ड रीड की कीमतों में की गई कमी और दोनों मॉडलों की संदर्भ विंडो के अंतर को स्पष्ट किया गया है।

कोड गुणवत्ता और प्रदर्शन परीक्षण

  • फेबल ने कोड की व्यवस्था और स्पष्टता में 90 अंक प्राप्त किए।
  • एस्ट्रा ने यूजर एक्सपीरियंस और ऐप के अनुभव में फेबल को पीछे छोड़ दिया।
  • फेबल का समग्र गुणवत्ता स्कोर 88 रहा जबकि एस्ट्रा का स्कोर 84 दर्ज किया गया।

विभिन्न क्लाइंट प्रोजेक्ट्स पर परीक्षण के दौरान फेबल ने कोड को अधिक स्पष्ट रूप से अलग करने और बेहतर सुविधाएं जोड़ने में बढ़त हासिल की। एस्ट्रा ने ऐप के परीक्षण और ज्ञात समस्याओं को ठीक करने में उच्च सटीकता दिखाई।

लंबे कार्य और लागत दक्षता

  • लंबे समय तक चलने वाले कार्यों में एस्ट्रा ने 93 अंक प्राप्त किए।
  • एस्ट्रा की कुल अनुमानित लागत 27.69 डॉलर रही जो फेबल के 49.18 डॉलर से काफी कम है।
  • निर्देश पालन के मामले में एस्ट्रा ने 96 अंक हासिल किए।

परीक्षण के अंतिम चरणों में एस्ट्रा ने कम लागत और तेज गति के साथ लंबे कार्यों को बेहतर ढंग से संभाला। फेबल ने समीक्षा गुणवत्ता के मामले में बेहतर प्रदर्शन किया, लेकिन एस्ट्रा ने कुल दक्षता और निर्देश पालन में बढ़त बनाई।

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기