ओपस 5 ने फेबल को पछाड़ा... वो भी आधी कीमत पर?

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

Transcript

00:00:00Anthropic ने अभी-अभी Claude Opus 5 रिलीज़ किया है, और यह आधी कीमत में
00:00:04Fable से भी बेहतर हो सकता है। अगर यह सच है, तो यह मेरा नया पसंदीदा मॉडल है, तो चलिए पता लगाते हैं।
00:00:13वे Opus 5 का वर्णन इस तरह कर रहे हैं। Opus 5 एक विचारशील और सक्रिय मॉडल है जो
00:00:18आधी कीमत पर Claude Fable 5 की अग्रणी बुद्धिमत्ता के करीब आता है। कोडिंग और ज्ञान कार्य
00:00:23मूल्यांकन जैसे Frontier Bench और GDP Val पर, Opus 5 नया अत्याधुनिक मॉडल है जो
00:00:28साइबर सुरक्षा कार्यों पर Mythos 5 से पीछे रहता है। Opus 5 को हर दिन उपयोग करने के लिए डिज़ाइन किया गया है, यह अधिक
00:00:33कुशलता से काम करता है, और Claude Max पर नया डिफ़ॉल्ट मॉडल और Claude Pro प्लान पर सबसे मजबूत मॉडल है।
00:00:38इसके बाद, वे बेंचमार्क दिखाते हैं, और यह इनमें से कई में जीत रहा है,
00:00:43इस तथ्य के बावजूद कि Fable 5 यहाँ है, और यह छोटे अंतर से नहीं जीत रहा है। उनके
00:00:47अनुसार, Frontier Bench पर यह Fable 5 से लगभग 10% बेहतर है, लेकिन मेरे लिए सबसे हैरान करने वाला
00:00:52Arc AGI पर इसका स्कोर है। Opus 4.8 ने यहाँ 1.5% स्कोर किया, जबकि Sol ने 7.8% स्कोर किया, जो पिछला उच्चतम
00:01:00स्कोर था, लेकिन Opus 5 ने 30.2% स्कोर किया। इस बेंचमार्क के पीछे की टीम ने दिखाया कि Opus में एक नई
00:01:06क्षमता थी जो उन्होंने पहले किसी अन्य मॉडल में नहीं देखी थी, जहाँ यह उन्नत तार्किक तर्क करने के लिए
00:01:10इन परीक्षणों को बीजीय अंकन (algebraic notation) में बदल देता था। यह वाकई प्रभावित करने वाली बात है।
00:01:15वैसे अगर आप सोच रहे हैं कि Fable यहाँ क्यों नहीं है, तो वह Fable की डेटा प्रतिधारण (data retention)
00:01:19नीति के कारण है। Arc AGI उस बेंचमार्क का कोई भी विवरण Anthropic को लीक करने का जोखिम नहीं उठाना चाहता,
00:01:24लेकिन अच्छी खबर यह है कि Opus 5 में सामान्य पहुंच के लिए डेटा प्रतिधारण आवश्यकताएं नहीं हैं। यह
00:01:29बहुत से लोगों को बहुत खुश करने वाला है। आगे बढ़ते हुए, आइए Artificial Analysis द्वारा
00:01:33तीसरे पक्ष के बेंचमार्क पर एक नज़र डालते हैं। कोडिंग इंडेक्स में, यह दूसरे स्थान पर आता है, GPT 5.6 Sol Extra High से केवल 0.3 अंक से हारता है,
00:01:39लेकिन यह Fable को 1.5 अंक से हराता है, और यह Opus 4.8 से काफी अच्छी बढ़त है।
00:01:45बड़े खिलाड़ियों को टक्कर देने के लिए Kimi K3 की भी यहाँ सराहना करनी होगी। मैंने इसके रिलीज़ होने पर एक वीडियो बनाया था,
00:01:49इसलिए आपको AI और डेवलपर समाचारों से अपडेट रहने के लिए निश्चित रूप से सब्सक्राइब करना चाहिए।
00:01:52अगर हम फिर एजेंटिक इंडेक्स पर नज़र डालें, तो Opus 5 वास्तव में यहाँ बढ़त बना लेता है,
00:01:57यहाँ, फेबल 5 से थोड़ा आगे निकलते हुए और OpenAI के एकमात्र मॉडल को पछाड़ते हुए।
00:02:02यही कहानी है, जहाँ Opus 5 वहाँ भी आगे है। तो प्रदर्शन के मामले में,
00:02:06ऐसा लगता है कि Opus 5 एक बेहद शानदार मॉडल है, और ईमानदारी से कहूँ तो, मुझे काफी हैरानी हुई है। मुझे लगता था कि
00:02:11Fable ही वह मॉडल है जिस पर वे अब ध्यान केंद्रित करने जा रहे हैं, और Opus एक तरह का नया
00:02:15Sonic मॉडल बन जाएगा, लेकिन अब लगता है कि Fable और Opus लगभग बराबरी पर हैं, जब तक कि हम
00:02:19कीमत को शामिल नहीं करते। अगर हम Artificial Analysis पर किसी कार्य को पूरा करने की लागत को देखें, तो Opus
00:02:235 वास्तव में Fable 5 से 72 सेंट सस्ता आता है, और यह
00:02:28Opus 4.8 से केवल थोड़ा सा महंगा है। अब मैं कहूँगा कि अगर आप कीमत के मुकाबले प्रदर्शन के लिए जाना चाहते हैं, तो GPT 5.6 Sol
00:02:33अभी भी यहाँ विजेता होगा, जिसकी लागत Opus 5 की आधी से भी कम है। आप
00:02:37इस चार्ट पर देख सकते हैं जहाँ हरा सबसे आकर्षक वर्ग है, GPT मॉडल ठीक वहीं स्थित हैं,
00:02:42Kimi K3 के साथ, और Anthropic मॉडल का अधिक कीमत वाले हिस्से में
00:02:46अपना एक अलग हिस्सा है। Cursor Bench भी इन सभी बेंचमार्क को दर्शाता है जिन्हें हमने देखा है।
00:02:50यहाँ, Opus 5 Max का स्कोर Fable 5 के लगभग बराबर है, लेकिन Fable की लागत उस कार्य के लिए $17 है,
00:02:56और Opus की लागत $8 है। वैसे, खुद इसकी कीमत Opus 4.8 के समान है, तो यह
00:03:0110 लाख इनपुट टोकन के लिए $5 और 10 लाख आउटपुट टोकन के लिए $25 है, इसलिए यदि आप
00:03:06Opus 4.8 के प्रशंसक हैं, तो मुझे नहीं लगता कि कोई कारण है कि आप इस मॉडल का उपयोग क्यों नहीं करेंगे, और स्वयं Fable 5 का प्रशंसक
00:03:10होने के नाते, मैं निश्चित रूप से अपने सब्सक्रिप्शन और अपने क्रेडिट को बचाने के लिए Opus 5 का बहुत उपयोग करने जा रहा हूँ
00:03:14ताकि वे जल्दी समाप्त न हों। ईमानदारी से, Fable बनाम Opus पर मेरा सबसे अच्छा अनुमान
00:03:18यह है कि यदि आप वास्तव में लंबे समय तक चलने वाली कठिन समस्याओं का समाधान चाहते हैं तो Fable अभी भी शीर्ष मॉडल रहेगा,
00:03:23लेकिन 95% काम के लिए, Opus 5 अब इसकी जगह ले सकता है। लेकिन चलिए अब आगे बढ़ते हैं और वास्तव में
00:03:28कुछ स्थानीय परीक्षणों के साथ इसे एक्शन में देखते हैं। पहला परीक्षण जो मैंने किया वह मॉडल से 3.js का उपयोग करके एक एकल HTML फ़ाइल में
00:03:32एक संपूर्ण Formula 1 रेसिंग गेम बनाने के लिए कहना था। अब, मैं इस बारे में बात करूँगा कि प्रत्येक मॉडल ने कितना समय लिया
00:03:37और अंत में API में इसकी लागत कितनी होगी, लेकिन पहले, आइए
00:03:40बस परिणाम देखें। यह वह परिणाम है जो Opus 5 ने मुझे दिया, और मुझे कहना होगा कि मैं यहाँ के मॉडल से बहुत
00:03:45प्रभावित हूँ। यह स्वयं किसी भी बाहरी संपत्ति (external assets) या ऐसा कुछ भी उपयोग नहीं करता है। यह सब
00:03:50Opus 5 द्वारा किया गया है, और सब कुछ वास्तव में अच्छा लग रहा है। अब, ट्रैक लेआउट वहाँ थोड़ा उल्टा था,
00:03:55लेकिन नियंत्रण सब ठीक है। लैप समय काम करता है, स्थिति काम करती है, क्रम काम करता है,
00:03:59वह सब अच्छा काम करता है। हाँ, हम यहाँ घास के नीचे गाड़ी चला रहे हैं, लेकिन आप देख सकते हैं कि टक्कर (collision) काम करती है,
00:04:03और इस घास के नीचे वास्तव में एक ट्रैक है, इसलिए मैं बहुत आसानी से प्रॉम्प्ट देकर इसे ठीक कर सकता हूँ।
00:04:07और इसके अलावा, बजरी के क्षेत्र (gravel traps) भी बहुत अच्छे से काम करते दिखते हैं। सच में, मुझे Opus 5 से मिले
00:04:12परिणाम से बहुत प्रभाव पड़ा है। मेरी राय में, ये F1 कारें उन सभी में सबसे अच्छी दिखती हैं।
00:04:16हालाँकि, मैं फैसला आप पर छोड़ता हूँ। यह वह परिणाम है जो Fable ने मुझे दिया। मुझे लगता है कि यह भी
00:04:20ट्रैक लेआउट के साथ बहुत अच्छा है, लेकिन कारें Opus 5 से मिली कारों की तुलना में थोड़ी अधिक बुनियादी हैं।
00:04:25मुझे वास्तव में वह कैमरा डगमगाहट (wobble) पसंद है जो हमारे मुड़ने पर होती है, और फिर से, अन्य सभी
00:04:28सुविधायें काम करती हैं, जैसे ट्रैक पोज़िशनिंग, ट्रैक टाइमिंग और वह सब कुछ। तो Fable 5 ने भी
00:04:33बहुत अच्छा काम किया है, लेकिन सच कहूँ तो, मुझे लगता है कि मैं Opus वाले को प्राथमिकता देता हूँ। यह वह परिणाम है
00:04:37जो मुझे GPT 5.6 Soul से मिला, वह भी अधिकतम प्रयास पर। मैं कहूँगा कि इसने मॉडलिंग और
00:04:43कैमरा लुक के साथ अच्छा काम किया है, लेकिन आप देख सकते हैं कि वहाँ कोई ट्रैक नहीं है, और कुछ
00:04:47एसेट उल्टे हैं, और इस ट्रैक के आधे रास्ते के आसपास, ट्रैक टूट भी जाता है। तो यह
00:04:51मेरी राय में, Fable और Opus से बदतर काम किया है। मुझे निश्चित रूप से लगता है कि Opus अभी भी
00:04:56यहाँ जीत रहा है। और अंतिम मॉडल जिसका मैंने परीक्षण किया वह Kimi K3 है, और यह वह परिणाम है जो उन्होंने मुझे दिया,
00:05:01और सच कहूँ तो, एक ओपन-वेट मॉडल के लिए बेहद प्रभावशाली है। इसने काफी अच्छा काम किया है,
00:05:05GPT 5.6 Soul के काफी समान। बैरियर काम करते हैं, ट्रैक काम करता है, बाकी सब कुछ,
00:05:09पोज़िशनिंग, सब कुछ काम कर रहा है। इसने मुझे एक ही बार में एक काफी अच्छा गेम बना कर दिया है। यदि हम उन
00:05:14परीक्षणों की लागत और समय पर नज़र डालें, तो Opus 5 ने वास्तव में F1 गेम को पूरा करने में 46 मिनट और 51 सेकंड
00:05:19का समय लिया, और अगर हम API का उपयोग करते तो इसकी लागत लगभग $12.99 होती। तो मेरे लिए,
00:05:25Opus 5 वास्तव में यहाँ Fable से अधिक महंगा था, और इसमें गहराई से जाने पर पता चला कि ऐसा इसलिए था क्योंकि इसने
00:05:30पाँच गुना अधिक टोकन का उपयोग किया। मैं वास्तव में आशा कर रहा हूँ कि यह एक अपवाद है, क्योंकि अन्य बेंचमार्क समान
00:05:35चीज़ की रिपोर्ट नहीं करते दिखते हैं। मैं यह भी जोड़ूँगा कि मैं Claude कोड उपयोग टूल का उपयोग करके उन Claude मॉडलों की लागत की गणना कर रहा हूँ,
00:05:39इसलिए वहाँ कुछ सटीकता की समस्याएँ हो सकती हैं, क्योंकि जब आप सब्सक्रिप्शन का उपयोग करते हैं तो आपको सटीक कीमत नहीं मिलती है।
00:05:44साथ ही, जैसा कि मैंने पहले कहा था, ये मॉडल अभी भी प्रीमियम हैं, इसलिए यदि आप GPT 5.6 जैसी किसी चीज़ पर आते हैं,
00:05:49तो आपको एक तेज़ और सस्ता मॉडल मिलेगा, लेकिन परिणाम मेरी राय में बदतर थे।
00:05:54आइए एक और परीक्षण का प्रयास करें। इस बार, मैं उनसे एक व्यक्तिगत वित्तीय प्रबंधन डैशबोर्ड (personal finance management dashboard) बनाने के लिए कह रहा हूँ,
00:05:58इसलिए यह फ्रंट एंड और बैक एंड के साथ एक पूर्ण स्टैक एप्लिकेशन होने जा रहा है,
00:06:02और मैं कुछ सुविधाओं को भी सूचीबद्ध करता हूँ जिन्हें वे यहाँ जोड़ सकते हैं। अब, यह वह परिणाम है जो मुझे Opus 5 के साथ वापस मिला,
00:06:06और सच कहूँ तो, मुझे कहना होगा कि मैं काफी प्रभावित हूँ। मुझे यह UI बहुत पसंद है, यह बस एक
00:06:11शैली है जो मुझे व्यक्तिगत रूप से पसंद है। यदि आपको भी पसंद आई तो मुझे टिप्पणियों में बताएं, और सब कुछ
00:06:15पूर्ण रूप से कार्यात्मक है। मैंने परीक्षण किया है कि ये सभी काम करते हैं, और हमारे पास मेरे द्वारा मांगी गई प्रत्येक सुविधा के लिए अलग-अलग पेज हैं,
00:06:20और फिर से, सभी सुविधाएं फ्रंट एंड और बैक एंड के बीच काम कर रही हैं,
00:06:24और मुझे वह UI शैली बहुत पसंद आई जिसके साथ यह गया है। मुझे लगता है कि यह सब में सबसे अच्छा है।
00:06:28जहाँ तक कोड का सवाल है, इसने फ्रंट एंड पर React और React Router का इस्तेमाल किया, जिसका मैं बहुत बड़ा
00:06:33प्रशंसक हूँ, और बैक एंड में, इसे अतिरिक्त अंक भी मिलते हैं क्योंकि इसने एक वास्तविक डेटाबेस का उपयोग किया था। इसने
00:06:37डेटाबेस के लिए यहाँ Node SQLite का उपयोग किया, और वास्तविक सर्वर के लिए इसने Express का उपयोग किया। यह वह परिणाम है
00:06:42जो Fable 5 ने मुझे दिया, और मैं Opus 5 UI का बड़ा प्रशंसक हूँ, लेकिन यह भी बहुत बुरा नहीं है,
00:06:48लेकिन सच कहूँ तो ये चार्ट थोड़े बेकार हैं। यहाँ नीचे वाला काफी अच्छा है, और फिर से,
00:06:53ये सभी सुविधाएँ काम करती हैं। मुझे लगता है कि Opus 5 ने UI में थोड़ी अधिक ऊर्जा लगाई है, और यह
00:06:57निश्चित रूप से उस पक्ष में बेहतर है। कोड में, इसने Opus 5 के समान कुछ किया, जहाँ इसने
00:07:01React का उपयोग किया, लेकिन मैं कहूँगा कि इसने कोई राउटिंग लाइब्रेरी नहीं चुनी। इसने वास्तव में खुद एक छोटी राउटिंग
00:07:05लाइब्रेरी बनाई। मैं संभवतः पसंद करूँगा कि यह React Router जैसी किसी चीज़ पर ही टिका रहे,
00:07:09और फिर डेटाबेस के लिए, इसने वही काम किया जहाँ यह यहाँ Node SQLite का उपयोग कर रहा है, और यह
00:07:13भी Express पर बनाया गया है, इसलिए वहाँ काफी समान बैक एंड है, लेकिन मैं कहूँगा कि Opus ने वास्तव में फ्रंट एंड के लिए बेहतर स्टैक चुना।
00:07:18यह वही है जो GPT 5.6 Sol ने मुझे दिया था, और मुझे कहना होगा कि यह UI डिज़ाइन के मामले में बेहतरीन है।
00:07:22यह निश्चित रूप से Opus से मेल खा रहा है। मुझे लगता है कि यह केवल एक अलग शैली है, इसलिए यह
00:07:26संभवतः व्यक्तिगत पसंद पर निर्भर करेगा, लेकिन मुझे यह वास्तव में पसंद है। इसने
00:07:31पूरे UI को मैप करने का एक अविश्वसनीय काम किया है, और फिर से, सभी सुविधाएँ काम करती हैं, लेकिन इस वाले ने
00:07:35इन व्यक्तिगत सुविधाओं के लिए वास्तव में अलग-अलग पेजों का उपयोग नहीं किया। यह बस पेज के एक अलग
00:07:38हिस्से पर जाता है। इसने उन सभी में से सबसे अनोखा स्टैक भी चुना। यह NextJS के साथ गया जिसमें
00:07:43Drizzle का संयोजन था, जो मुझे डेटाबेस के लिए बहुत पसंद है, और इस तरह की चीज़ के लिए काफी सही दृष्टिकोण है।
00:07:47लेकिन फिर इसने वास्तव में इसे होस्ट करने के लिए Cloudflare और Vinext का भी उपयोग किया, जो मुझे लगता है कि थोड़ा
00:07:52अजीब निर्णय है, क्योंकि जैसा कि आप देख सकते हैं, Vinext बहुत शुरुआती चरण में है, और मुझे नहीं लगता कि इसका
00:07:56अभी तक परीक्षण किया गया है, और वे निश्चित रूप से प्रॉम्प्ट में कुछ ऐसा डाल रहे हैं जो इसे Cloudflare
00:08:00और Vinext का उपयोग करने के लिए मजबूर करता है। और मैंने अपने Kimi K3 वीडियो में यह कहा था, यह शायद इसलिए है क्योंकि उनकी अपनी होस्ट की गई
00:08:04ChatGPT साइटें उसी तरह काम करती हैं। अंत में, अंतिम मॉडल जिसका मैंने परीक्षण किया वह Kimi K3 है, और यह वह परिणाम है जो हमें
00:08:09वापस मिला, और मैं कहूँगा कि इसने बहुत अच्छा काम किया है। यह UI कुछ ऐसा है जो मुझे GPT 5.4 या 5.5 से मिलता,
00:08:14इसलिए मुझे लगता है कि यह UI डिज़ाइन में थोड़ा पीछे है, लेकिन फिर से, सभी सुविधाएँ
00:08:19काम कर रही हैं, और मैं इस UI के बारे में बहुत अधिक शिकायत नहीं कर सकता। यह बिल्कुल वही करता है जो मैंने करने के लिए कहा था।
00:08:24हालाँकि, कोड को मुझसे कुछ घटाव अंक (minus points) मिलते हैं। इसने अपने फ्रंटएंड के लिए React को चुना,
00:08:28और फिर से, इसने Fable की तरह अपनी खुद की राउटिंग लाइब्रेरी बनाई, लेकिन फिर अगर हम सर्वर पर जाते हैं,
00:08:32तो वास्तव में इसके पास केवल एक Express सर्वर है, और इसने Node SQLite का उपयोग करके कोई डेटाबेस नहीं बनाया
00:08:36या ऐसा कुछ भी नहीं किया। इसने वास्तव में जावास्क्रिप्ट का उपयोग करके अपना खुद का डेटाबेस बनाया, इसलिए यह
00:08:40सब कुछ एक JSON फ़ाइल में सहेजता है। यह निश्चित रूप से वह दृष्टिकोण नहीं है जो मैं चाहता था कि यह अपनाए।
00:08:44जहाँ तक उस फाइनेंस टेस्ट पर मॉडलों के समय और मूल्य निर्धारण का सवाल है, Fable सबसे महंगा था,
00:08:48जिसकी लागत $30.79 थी, और इसने 56 मिनट और 55 सेकंड का समय भी लिया, लेकिन फिर से, Opus के साथ, यह Fable के
00:08:55काफी करीब कीमत में लगता है, क्योंकि मुझे इसके लिए $29.82 की लागत आई, और इसने वास्तव में 59 मिनट और 15
00:09:02सेकंड का अधिक समय लिया। GPT मॉडलों की तुलना में कीमत वास्तव में अच्छी है, यह लगभग साढ़े तीन गुना
00:09:07सस्ता है, और मुझे वास्तव में उम्मीद है कि यह प्रतिस्पर्धा उन Anthropic कीमतों को कम करना शुरू कर देगी।
00:09:11तो यह मेरे लिए मिला-जुला अनुभव है। जाहिर है, मैंने केवल एक बार प्रत्येक परीक्षण चलाया, और मैंने केवल दो परीक्षण किए,
00:09:16इसलिए मुझे उम्मीद है कि Artificial Analysis बेंचमार्क अधिक सटीक हैं, जहाँ Opus
00:09:20वास्तव में Fable की कीमत का एक तिहाई है, लेकिन इसका पता लगाने के लिए मुझे निश्चित रूप से इसका थोड़ा और उपयोग करना होगा।
00:09:24शायद यह केवल वह टूल है जिसका उपयोग मैं लागतों को मापने के लिए कर रहा हूँ। Opus के लिए एक और बात
00:09:28यह है कि यह Fable 5 की तुलना में साइबर सुरक्षा कार्य पर थोड़ा कम सख्त है। सुरक्षा उपाय काफी
00:09:33Opus 4.8 के समान हैं, जिसमें साइबर कार्यों की एक सीमित सीमा पर कुछ मजबूत सुरक्षा मानकों का अपवाद शामिल है।
00:09:37जाहिर तौर पर, सुरक्षा उपाय Opus 5 को सोर्स कोड में कमजोरियों को खोजने की अनुमति देंगे,
00:09:42लेकिन यह बाइनरी-आधारित भेद्यता स्कैनिंग (vulnerability scanning), साथ ही पेनेट्रेशन टेस्टिंग और
00:09:46एक्सप्लॉइट जेनरेशन को ब्लॉक कर देगा। उनके परीक्षण में पाया गया कि उनके क्लासिफायर Fable 5 की तुलना में लगभग 85% कम
00:09:51हस्तक्षेप करते हैं। तो यह रहा, मॉडल प्रतिस्पर्धा अभी वास्तव में काफी प्रभावशाली है।
00:09:55हमारे पास GPT 5.6 यह दिखा रहा है कि कीमतें नीचे लाई जा सकती हैं, हमारे पास Kimi जैसे ओपन मॉडल हैं
00:10:00जो बुद्धिमत्ता में बड़े खिलाड़ियों से मेल खाते हैं, और हमारे पास Anthropic है जो लगातार उस
00:10:04बुद्धिमत्ता को आगे से आगे बढ़ा रहा है। आपका पसंदीदा मॉडल कौन सा है, और क्या आपको Opus पसंद आ रहा है?
00:10:09मुझे नीचे कमेंट्स में बताएं, जब आप वहाँ हों तो सब्सक्राइब करें, और हमेशा की तरह, अगले वीडियो में मिलते हैं।

Key Takeaway

Claude Opus 5 Fable 5 के समकक्ष प्रदर्शन और क्षमताएं प्रदान करता है, जबकि Cursor Bench जैसे परीक्षणों में इसकी लागत $17 के मुकाबले मात्र $8 है।

Highlights

  • Claude Opus 5, Frontier Bench पर Fable 5 से लगभग 10% बेहतर प्रदर्शन करता है और Arc AGI पर इसका स्कोर Opus 4.8 के 1.5% से बढ़कर 30.2% हो गया है।

  • Opus 5 जटिल तार्किक परीक्षणों को हल करने के लिए उन्हें बीजीय अंकन (algebraic notation) में बदल देता है।

  • Cursor Bench के अनुसार Fable 5 से $17 की तुलना में Opus 5 Max से एक समान कार्य केवल $8 में पूरा होता है।

  • Opus 5 की डेटा प्रतिधारण (data retention) नीतियां Fable 5 की तरह सख्त नहीं हैं, जिससे Arc AGI जैसे सार्वजनिक बेंचमार्क परीक्षण संभव हो पाते हैं।

  • साइबर सुरक्षा परीक्षणों में Opus 5 के क्लासिफायर Fable 5 की तुलना में 85% कम हस्तक्षेप करते हैं।

Timeline

Opus 5 की घोषणा और प्रमुख बेंचमार्क स्कोर

  • Opus 5, Frontier Bench और GDP Val जैसे कोडिंग एवं ज्ञान कार्य मूल्यांकनों में नया अत्याधुनिक मॉडल है।
  • Arc AGI बेंचमार्क पर Opus 5 का स्कोर 30.2% तक पहुंच गया, जो Opus 4.8 के 1.5% स्कोर से काफी अधिक है।
  • Opus 5 में बिना डेटा प्रतिधारण प्रतिबंधों के व्यापक पहुंच की सुविधा है।

Opus 5 को Claude Max पर डिफ़ॉल्ट मॉडल और Claude Pro प्लान पर मुख्य मॉडल के रूप में पेश किया गया है। Arc AGI परीक्षणों में यह जटिल तार्किक समस्याओं को बीजीय अंकन में बदल देता है। Fable 5 की डेटा प्रतिधारण नीतियों के कारण उसे इस बेंचमार्क में शामिल नहीं किया गया था, जबकि Opus 5 में यह सीमा नहीं है।

थर्ड-पार्टी इंडेक्स और लागत तुलना

  • Artificial Analysis के कोडिंग इंडेक्स में Opus 5 दूसरे स्थान पर है और एजेंटिक इंडेक्स में Fable 5 को पछाड़ देता है।
  • Cursor Bench पर समान कार्य के लिए Fable 5 की $17 लागत के मुकाबले Opus 5 केवल $8 लेता है।
  • 10 लाख इनपुट टोकन के लिए $5 और 10 लाख आउटपुट टोकन के लिए $25 पर इसकी कीमत Opus 4.8 के समान है।

कोडिंग इंडेक्स पर Opus 5 केवल 0.3 अंक से GPT 5.6 Sol Extra High से पीछे रहता है लेकिन Fable 5 से 1.5 अंक आगे है। मूल्य निर्धारण के मामले में GPT 5.6 Sol Opus 5 से आधे से भी कम कीमत पर उपलब्ध है, लेकिन Opus 5 अधिकांश कार्यों में Fable 5 का 95% विकल्प बन सकता है।

3D F1 रेसिंग गेम डेवलपमेंट टेस्ट

  • Three.js के उपयोग से एकल HTML फ़ाइल में F1 रेसिंग गेम बनाने में Opus 5 ने सबसे सटीक 3D मॉडल प्रस्तुत किए।
  • Opus 5 को यह कार्य पूरा करने में 46 मिनट 51 सेकंड लगे और API लागत $12.99 रही।
  • Opus 5 ने Fable 5 की तुलना में 5 गुना अधिक टोकन का उपयोग किया।

बिना किसी बाहरी एसेट के Opus 5 ने कार्यात्मक लैप टाइमिंग, कार कंट्रोल और कोलिजन डिटैक्शन के साथ सबसे विस्तृत 3D मॉडल तैयार किए। Fable 5 ने भी अच्छा परिणाम दिया लेकिन उसके मॉडल बुनियादी थे। GPT 5.6 Sol और Kimi K3 के परिणाम ट्रैक में खराबी और एसेट की समस्याओं के कारण Opus 5 से पीछे रहे।

फुल-स्टैक पर्सनल फाइनेंस डैशबोर्ड टेस्ट

  • फुल-स्टैक फाइनेंस ऐप के लिए Opus 5 ने फ्रंटएंड में React/React Router और बैकएंड में Express/Node SQLite का उपयोग किया।
  • फाइनेंस टेस्ट में Opus 5 की लागत $29.82 (59 मिनट 15 सेकंड) और Fable 5 की लागत $30.79 (56 मिनट 55 सेकंड) आई।
  • Kimi K3 ने असली डेटाबेस के बजाय JSON फ़ाइल में डेटा सहेजा।

Opus 5 ने सभी अनुरोधित सुविधाओं और बेहतर UI डिज़ाइन के साथ एक पूर्ण कार्यात्मक एप्लिकेशन बनाया। Fable 5 ने अपनी खुद की राउटिंग लाइब्रेरी बनाई, जबकि GPT 5.6 Sol ने NextJS और Drizzle का उपयोग किया। इस जटिल कार्य में Opus 5 और Fable 5 की लागत और समय लगभग समान रहे।

साइबर सुरक्षा नीतियां और अंतिम निष्कर्ष

  • Opus 5 सोर्स कोड में कमजोरियों को खोजने की अनुमति देता है लेकिन बाइनरी स्कैनिंग और पेनेट्रेशन टेस्टिंग को ब्लॉक करता है।
  • Opus 5 के सुरक्षा क्लासिफायर Fable 5 की तुलना में 85% कम हस्तक्षेप करते हैं।
  • AI मॉडल बाजार में GPT 5.6 कम कीमतें, Kimi K3 ओपन-वेट विकल्प और Anthropic उच्च बुद्धिमत्ता प्रदान कर रहे हैं।

साइबर सुरक्षा के मामलों में Opus 5 के नियम Opus 4.8 के समान हैं और Fable 5 जितने सख्त नहीं हैं। वर्तमान बाजार में Anthropic बुद्धिमत्ता की सीमाओं को बढ़ा रहा है जबकि अन्य प्रतियोगी कीमतों और उपलब्धता पर प्रतिस्पर्धा कर रहे हैं।

Community Posts

View all posts