ओपस 5 आ गया है और क्या यह फेबल से भी बेहतर है?!
CChase AI
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00तो Claude Opus 5 अभी रिलीज़ हुआ है, और Anthropic का दावा है कि अब हमारे पास एक ऐसा मॉडल है जो
00:00:04आधे खर्च पर Fable 5 के करीब आउटपुट दे रहा है। तो चलिए देखते हैं कि वे हमें क्या दे रहे हैं।
00:00:09चलिए कुछ बेंचमार्क पर नज़र डालते हैं, और शुरुआत में ही काफी चौंकाने वाले आंकड़े दिखते हैं। हम देखते हैं कि
00:00:14यह Fable 5 को हरा देता है और कई टेस्ट में Opus 4.8 से बहुत आगे निकल जाता है, खासकर
00:00:20एजेंटिक टर्मिनल कोडिंग, नॉलेज वर्क, और एजेंटिक सर्च में। इसके अलावा, यह इन कैटेगरी में
00:00:27GPT 5.6 जैसी चीज़ों को भी पछाड़ रहा है। केवल वही क्षेत्र जहाँ Opus 5, Fable 5 से पीछे दिखता है,
00:00:33मल्टीडिसिप्लिनरी रीज़निंग है, वो भी बहुत कम अंतर से। सच तो यह है कि टूल्स का उपयोग करने पर यह उसे भी हरा देता है, साथ ही
00:00:39लीगल और हेल्थ में भी। लेकिन बाकी हर जगह, यह वास्तव में उनके टॉप मॉडल को हरा रहा है। और अगर इन आंकड़ों पर
00:00:46विश्वास किया जाए, तो यह कमाल है। यहाँ लिखा है कि cursor bench 3.2 पर मैक्स एफर्ट में,
00:00:51मॉडल ने Fable 5 के पिक स्कोर का 0.5% के भीतर परफॉर्म किया, वो भी आधी लागत पर। गज़ब है। और आप इसे
00:00:57यहाँ देख सकते हैं। लाल रंग में Opus 5 है, नारंगी में Fable 5, और नीचे नीले रंग में Opus 4.8 है।
00:01:03हाँ, मैक्स टू मैक्स एफर्ट में Fable 5 आगे निकल जाता है, लेकिन ज़्यादातर लोग वास्तव में
00:01:08मैक्स पर काम नहीं करते। वे या तो हाई या एक्स्ट्रा हाई पर काम करते हैं। और जब हम एक्स्ट्रा हाई और हाई को
00:01:13Fable से तुलना करके देखते हैं, तो Opus 5 के साथ लगभग एक जैसा आउटपुट मिलता है, लेकिन फिर से, लगभग
00:01:17आधे खर्च पर। और कुछ अन्य बेंचमार्क में, जैसे कि artificial analysis coding agent index,
00:01:23Opus 5 सीधे तौर पर Fable 5 को हरा रहा है। और ऐसा ही frontier bench के साथ भी है।
00:01:27यह सच में Fable को मात दे रहा है और सस्ता भी है। अब आइए कुछ नॉलेज
00:01:32वर्क और प्रॉब्लम सॉल्विंग टास्क पर नज़र डालते हैं। और फिर से, मुझे लगता है कि जो बात वास्तव में हैरान करने वाली है, वह सिर्फ यह
00:01:37Fable 5 और Opus 5 का मुकाबला नहीं है। यह Opus 4.8 से Opus 5 में हुई छलांग है। यह सब कुछ
00:01:43हर पैमाने पर एक बहुत बड़ी बढ़त दिखाता है। और फिर, अगर यह Sonnet 5
00:01:49जैसी बात होती जहाँ हम इसे पिछले मॉडल से बेहतर करते तो देखते, लेकिन यह बेहद
00:01:53महँगा होता—क्योंकि टास्क के आधार पर देखें तो Sonnet 5 सबसे महँगा मॉडल है—
00:01:57यहाँ ऐसी बात नहीं है। इन दोनों अन्य मॉडलों की तुलना में Opus काफी टोकन-कुशल (token efficient) प्रतीत होता है।
00:02:03और फिर, यह सच में Fable 5 को हरा रहा है, इस बात पर तो मुझे विश्वास ही नहीं हो रहा।
00:02:07एक और दिलचस्प सुधार विजुअल आउटपुट में है। तो यहाँ Opus 5 को कुछ
00:02:13विंड टनल का काम करते हुए देखा जा सकता है। और यहाँ पर, यह 3D इंटरेक्टिव एनिमल सेल
00:02:19आर्टिफैक्ट बना रहा है। अब, Claude की कमियों में से एक यह है कि यह खुद इमेज वगैरह नहीं बना सकता।
00:02:24इसलिए 3D क्रिएटेड SVG, जैसे HTML ग्राफिक्स में इसका बेहतर होना बहुत बड़ी बात है।
00:02:31एक और बड़ा सुधार यह है कि Anthropic का कहना है कि यह अपने काम को वेरीफाई करने
00:02:35और सफल होने तक ध्यानपूर्वक सुधार करने में बहुत मजबूत है। इसका क्या मतलब है? इसका मतलब है जब हम Opus 5
00:02:40का उपयोग लंबे समय वाले एजेंटिक टास्क पर करते हैं—ऐसी चीजें जो केवल एक बार में नहीं होतीं, यह लूप की तरह होती हैं—
00:02:45यह उस ग्राफ इंजीनियरिंग जैसी बात है जिसके बारे में लोग चर्चा कर रहे हैं। ऐसा कुछ भी जिसके लिए
00:02:49Claude को हमारे दिए गए गोल के अनुसार अपने काम को लगातार चेक करने और उसे बार-बार दोहराने की ज़रूरत हो।
00:02:53तो Opus 5 इस मामले में Opus 4.8 से कहीं बेहतर है। और एक दिलचस्प
00:02:58उदाहरण यहाँ है: Opus 5 को एक मशीन पार्ट की ड्राइंग दी गई और उसे 3D free CAD मॉडल के रूप में फिर से बनाने का कोड लिखने को कहा गया।
00:03:03लेकिन मॉडल को वास्तव में ड्राइंग देखने का कोई तरीका नहीं दिया गया था। तो,
00:03:09उसे इस गोल तक पहुँचने के लिए कहा गया था, लेकिन यह नहीं बताया गया था कि इसे कैसे करना है। इसलिए उसने आगे बढ़कर
00:03:14रॉ पिक्सल से ज्योमेट्री निकालने के लिए अपनी कंप्यूटर विजन पाइपलाइन लिखी और फिर पूरे
00:03:19मशीन पार्ट को फिर से तैयार कर दिया। फिर से, लंबे समय वाले काम में कोई मुख्य लक्ष्य दिए जाने पर,
00:03:25Opus 5 उसे पूरा करने में 4.8 की तुलना में बहुत बेहतर है। मिसअलाइन व्यवहार के मामले में,
00:03:29यह इन पिछले सभी मॉडलों से एक कदम आगे है। यहाँ स्कोर जितना कम हो उतना अच्छा है। और हम देखते हैं कि
00:03:35Opus 4.8 से ओपन सोर्स कोड में कमियाँ और एक्सप्लॉइट्स ढूंढने की क्षमता में बहुत बड़ा सुधार हुआ है। अब एक और बढ़िया चीज़ सेफगार्ड्स हैं।
00:03:40यह Fable जैसा मामला नहीं है जहाँ अगर आप साइबर सुरक्षा या बायोलॉज़ी के बारे में कुछ भी कहते हैं,
00:03:45तो वह बंद हो जाएगा। वे गार्डरेल्स Fable 5 की तुलना में Opus 5 के साथ बहुत कम सख्त हैं।
00:03:50हालाँकि इसमें अभी भी कुछ क्लासिफायर्स मौजूद हैं, लेकिन उनका कहना है कि Fable की तुलना में इनके ट्रिगर होने की संभावना
00:03:5685% कम है। अब आखिरी बात, सबसे बड़ी चीज़ कीमत है। जैसा कि मैंने कहा, यह Fable की आधी कीमत पर है।
00:04:01हम प्रति मिलियन इनपुट $5 और प्रति मिलियन आउटपुट $25 देख रहे हैं। और जैसा कि हमने चार्ट में
00:04:07बेंचमार्क से देखा, यह काफी टोकन-एफिशिएंट मॉडल है। इसलिए मैं इसे आज़माने के लिए बहुत उत्सुक हूँ,
00:04:12क्योंकि अगर आंकड़े सच हैं, तो हमारे पास आधी कीमत में लगभग Fable से बेहतर मॉडल आ गया है।