ओपस 5 आ गया है और क्या यह फेबल से भी बेहतर है?!

CChase AI
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00तो Claude Opus 5 अभी रिलीज़ हुआ है, और Anthropic का दावा है कि अब हमारे पास एक ऐसा मॉडल है जो
00:00:04आधे खर्च पर Fable 5 के करीब आउटपुट दे रहा है। तो चलिए देखते हैं कि वे हमें क्या दे रहे हैं।
00:00:09चलिए कुछ बेंचमार्क पर नज़र डालते हैं, और शुरुआत में ही काफी चौंकाने वाले आंकड़े दिखते हैं। हम देखते हैं कि
00:00:14यह Fable 5 को हरा देता है और कई टेस्ट में Opus 4.8 से बहुत आगे निकल जाता है, खासकर
00:00:20एजेंटिक टर्मिनल कोडिंग, नॉलेज वर्क, और एजेंटिक सर्च में। इसके अलावा, यह इन कैटेगरी में
00:00:27GPT 5.6 जैसी चीज़ों को भी पछाड़ रहा है। केवल वही क्षेत्र जहाँ Opus 5, Fable 5 से पीछे दिखता है,
00:00:33मल्टीडिसिप्लिनरी रीज़निंग है, वो भी बहुत कम अंतर से। सच तो यह है कि टूल्स का उपयोग करने पर यह उसे भी हरा देता है, साथ ही
00:00:39लीगल और हेल्थ में भी। लेकिन बाकी हर जगह, यह वास्तव में उनके टॉप मॉडल को हरा रहा है। और अगर इन आंकड़ों पर
00:00:46विश्वास किया जाए, तो यह कमाल है। यहाँ लिखा है कि cursor bench 3.2 पर मैक्स एफर्ट में,
00:00:51मॉडल ने Fable 5 के पिक स्कोर का 0.5% के भीतर परफॉर्म किया, वो भी आधी लागत पर। गज़ब है। और आप इसे
00:00:57यहाँ देख सकते हैं। लाल रंग में Opus 5 है, नारंगी में Fable 5, और नीचे नीले रंग में Opus 4.8 है।
00:01:03हाँ, मैक्स टू मैक्स एफर्ट में Fable 5 आगे निकल जाता है, लेकिन ज़्यादातर लोग वास्तव में
00:01:08मैक्स पर काम नहीं करते। वे या तो हाई या एक्स्ट्रा हाई पर काम करते हैं। और जब हम एक्स्ट्रा हाई और हाई को
00:01:13Fable से तुलना करके देखते हैं, तो Opus 5 के साथ लगभग एक जैसा आउटपुट मिलता है, लेकिन फिर से, लगभग
00:01:17आधे खर्च पर। और कुछ अन्य बेंचमार्क में, जैसे कि artificial analysis coding agent index,
00:01:23Opus 5 सीधे तौर पर Fable 5 को हरा रहा है। और ऐसा ही frontier bench के साथ भी है।
00:01:27यह सच में Fable को मात दे रहा है और सस्ता भी है। अब आइए कुछ नॉलेज
00:01:32वर्क और प्रॉब्लम सॉल्विंग टास्क पर नज़र डालते हैं। और फिर से, मुझे लगता है कि जो बात वास्तव में हैरान करने वाली है, वह सिर्फ यह
00:01:37Fable 5 और Opus 5 का मुकाबला नहीं है। यह Opus 4.8 से Opus 5 में हुई छलांग है। यह सब कुछ
00:01:43हर पैमाने पर एक बहुत बड़ी बढ़त दिखाता है। और फिर, अगर यह Sonnet 5
00:01:49जैसी बात होती जहाँ हम इसे पिछले मॉडल से बेहतर करते तो देखते, लेकिन यह बेहद
00:01:53महँगा होता—क्योंकि टास्क के आधार पर देखें तो Sonnet 5 सबसे महँगा मॉडल है—
00:01:57यहाँ ऐसी बात नहीं है। इन दोनों अन्य मॉडलों की तुलना में Opus काफी टोकन-कुशल (token efficient) प्रतीत होता है।
00:02:03और फिर, यह सच में Fable 5 को हरा रहा है, इस बात पर तो मुझे विश्वास ही नहीं हो रहा।
00:02:07एक और दिलचस्प सुधार विजुअल आउटपुट में है। तो यहाँ Opus 5 को कुछ
00:02:13विंड टनल का काम करते हुए देखा जा सकता है। और यहाँ पर, यह 3D इंटरेक्टिव एनिमल सेल
00:02:19आर्टिफैक्ट बना रहा है। अब, Claude की कमियों में से एक यह है कि यह खुद इमेज वगैरह नहीं बना सकता।
00:02:24इसलिए 3D क्रिएटेड SVG, जैसे HTML ग्राफिक्स में इसका बेहतर होना बहुत बड़ी बात है।
00:02:31एक और बड़ा सुधार यह है कि Anthropic का कहना है कि यह अपने काम को वेरीफाई करने
00:02:35और सफल होने तक ध्यानपूर्वक सुधार करने में बहुत मजबूत है। इसका क्या मतलब है? इसका मतलब है जब हम Opus 5
00:02:40का उपयोग लंबे समय वाले एजेंटिक टास्क पर करते हैं—ऐसी चीजें जो केवल एक बार में नहीं होतीं, यह लूप की तरह होती हैं—
00:02:45यह उस ग्राफ इंजीनियरिंग जैसी बात है जिसके बारे में लोग चर्चा कर रहे हैं। ऐसा कुछ भी जिसके लिए
00:02:49Claude को हमारे दिए गए गोल के अनुसार अपने काम को लगातार चेक करने और उसे बार-बार दोहराने की ज़रूरत हो।
00:02:53तो Opus 5 इस मामले में Opus 4.8 से कहीं बेहतर है। और एक दिलचस्प
00:02:58उदाहरण यहाँ है: Opus 5 को एक मशीन पार्ट की ड्राइंग दी गई और उसे 3D free CAD मॉडल के रूप में फिर से बनाने का कोड लिखने को कहा गया।
00:03:03लेकिन मॉडल को वास्तव में ड्राइंग देखने का कोई तरीका नहीं दिया गया था। तो,
00:03:09उसे इस गोल तक पहुँचने के लिए कहा गया था, लेकिन यह नहीं बताया गया था कि इसे कैसे करना है। इसलिए उसने आगे बढ़कर
00:03:14रॉ पिक्सल से ज्योमेट्री निकालने के लिए अपनी कंप्यूटर विजन पाइपलाइन लिखी और फिर पूरे
00:03:19मशीन पार्ट को फिर से तैयार कर दिया। फिर से, लंबे समय वाले काम में कोई मुख्य लक्ष्य दिए जाने पर,
00:03:25Opus 5 उसे पूरा करने में 4.8 की तुलना में बहुत बेहतर है। मिसअलाइन व्यवहार के मामले में,
00:03:29यह इन पिछले सभी मॉडलों से एक कदम आगे है। यहाँ स्कोर जितना कम हो उतना अच्छा है। और हम देखते हैं कि
00:03:35Opus 4.8 से ओपन सोर्स कोड में कमियाँ और एक्सप्लॉइट्स ढूंढने की क्षमता में बहुत बड़ा सुधार हुआ है। अब एक और बढ़िया चीज़ सेफगार्ड्स हैं।
00:03:40यह Fable जैसा मामला नहीं है जहाँ अगर आप साइबर सुरक्षा या बायोलॉज़ी के बारे में कुछ भी कहते हैं,
00:03:45तो वह बंद हो जाएगा। वे गार्डरेल्स Fable 5 की तुलना में Opus 5 के साथ बहुत कम सख्त हैं।
00:03:50हालाँकि इसमें अभी भी कुछ क्लासिफायर्स मौजूद हैं, लेकिन उनका कहना है कि Fable की तुलना में इनके ट्रिगर होने की संभावना
00:03:5685% कम है। अब आखिरी बात, सबसे बड़ी चीज़ कीमत है। जैसा कि मैंने कहा, यह Fable की आधी कीमत पर है।
00:04:01हम प्रति मिलियन इनपुट $5 और प्रति मिलियन आउटपुट $25 देख रहे हैं। और जैसा कि हमने चार्ट में
00:04:07बेंचमार्क से देखा, यह काफी टोकन-एफिशिएंट मॉडल है। इसलिए मैं इसे आज़माने के लिए बहुत उत्सुक हूँ,
00:04:12क्योंकि अगर आंकड़े सच हैं, तो हमारे पास आधी कीमत में लगभग Fable से बेहतर मॉडल आ गया है।

Key Takeaway

Opus 5 Fable 5 से आधी कीमत ($5 in / $25 out per million tokens) पर एजेंटिक कोडिंग, सर्च और नॉलेज वर्क में बेहतर प्रदर्शन प्रदान करता है।

Highlights

  • Opus 5 Fable 5 की तुलना में 50% कम लागत ($5 per million input, $25 per million output tokens) पर समान या बेहतर प्रदर्शन देता है।

  • Cursor Bench 3.2 पर Opus 5 का प्रदर्शन आधी कीमत पर Fable 5 के पिक स्कोर के 0.5% के भीतर पहुँचता है।

  • Opus 5 के सेफगार्ड गार्डरेल्स Fable 5 की तुलना में 85% कम ट्रिगर होते हैं, जिससे साइबर सुरक्षा और बायोलॉजिकल रिसर्च में काम करना आसान होता है।

  • रॉ पिक्सल से सीधे विजन पाइपलाइन बनाकर Machine Part की Drawing से 3D FreeCAD मॉडल तैयार करने की क्षमता एजेंटिक टास्क में सुधार को दर्शाती है।

  • एजेंटिक टर्मिनल कोडिंग, नॉलेज वर्क और एजेंटिक सर्च जैसे मुख्य क्षेत्रों में Opus 5 GPT 5.6 और Fable 5 दोनों को पीछे छोड़ देता है।

Timeline

Opus 5 के शुरुआती बेंचमार्क और Fable 5 से तुलना

  • Opus 5 एजेंटिक टर्मिनल कोडिंग, नॉलेज वर्क और एजेंटिक सर्च में Fable 5 और GPT 5.6 को पीछे छोड़ता है।
  • Cursor Bench 3.2 में हाई और एक्स्ट्रा हाई एफर्ट पर Opus 5 Fable 5 के बराबर आउटपुट आधी लागत पर देता है।

Opus 5 का रिलीज़ मुख्य रूप से लागत-प्रभावी क्षमता पर केंद्रित है। मल्टीडिसिप्लिनरी रीज़निंग जैसे सीमित क्षेत्रों को छोड़कर यह Fable 5 से आगे है। हालांकि मैक्स एफर्ट में Fable 5 थोड़ा आगे रहता है, लेकिन व्यावहारिक उपयोग वाले 'हाई' और 'एक्स्ट्रा हाई' एफर्ट लेवल पर Opus 5 आधी कीमत में वही परिणाम देता है। Artificial Analysis Coding Agent Index और Frontier Bench में भी यह Fable 5 से आगे है।

टोकन दक्षता और विजुअल आउटपुट में प्रगति

  • Opus 4.8 की तुलना में Opus 5 में टोकन दक्षता और वर्क परफॉर्मेंस में भारी बढ़ोतरी हुई है।
  • नैटिव इमेज जनरेशन न होने के बावजूद यह मॉडल 3D इंटरैक्टिव SVG और HTML ग्राफ़िक्स बनाने में सक्षम है।

Sonnet 5 जैसे महंगे मॉडल के विपरीत, Opus 5 काफी टोकन-इफिशिएंट है। यह मॉडल सीधे इमेज तैयार नहीं कर सकता, इसलिए SVG और HTML-आधारित 3D ग्राफ़िक्स बनाने की क्षमता में सुधार किया गया है। उदाहरण के लिए, यह 3D इंटरैक्टिव एनिमल सेल और विंड टनल सिमुलेशन जैसे आर्टिफैक्ट्स सटीक रूप से डिज़ाइन कर सकता है।

एजेंटिक टास्क, सेफगार्ड्स और मूल्य निर्धारण

  • लंबे समय वाले लूप टास्क में स्वयं के काम को वेरीफाई करने की क्षमता इसे अधिक सटीक बनाती है।
  • Fable 5 की तुलना में Opus 5 के गार्डरेल्स ट्रिगर होने की संभावना 85% कम है।
  • इनपुट $5 per million और आउटपुट $25 per million tokens की दर से यह Fable 5 से 50% सस्ता है।

Opus 5 जटिल एजेंटिक टास्क में काम को स्वचालित रूप से चेक और री-इटरेट करता है। उदाहरण के लिए, ड्राइंग का सीधा एक्सेस न होने पर भी यह अपनी कंप्यूटर विजन पाइपलाइन लिखकर रॉ पिक्सल से 3D FreeCAD मॉडल बना लेता है। इसके अलावा, ओपन-सोर्स कोड में खामियां ढूंढने में सुधार हुआ है। साइबर सुरक्षा और बायोलॉजिकल प्रश्नों पर Fable 5 की तरह बहुत अधिक सख्त प्रतिबंध लागू नहीं होते हैं।

Community Posts

View all posts