Sonnet 5 लाइव है और यह Opus को टक्कर देता है

CChase AI
Computing/SoftwareSmall Business/StartupsManagement

Transcript

00:00:00Anthropic ने अभी-अभी Sonnet 5 जारी किया है, तो आइए इसके बारे में जानने योग्य सभी बातों पर एक नज़र डालते हैं।
00:00:04तो चलिए बेंचमार्क से शुरुआत करते हैं। और याद रखें, Sonnet 5 एक कम शक्तिशाली,
00:00:08Opus और निश्चित रूप से Fable जैसी चीजों की तुलना में कम महंगा मॉडल है। हमारे पास यहाँ कोई अपग्रेड नहीं आया है
00:00:134.6 के बाद से। अब, 5 की तुलना 4.6 से करें, तो हम देखते हैं कि यह एजेंटिक कोडिंग के मामले में एक बड़ी छलांग है,
00:00:21मल्टीडिसिप्लिनरी रीजनिंग, कंप्यूटर उपयोग, और नॉलेज वर्क। तो हर क्षेत्र में सीधा अपग्रेड।
00:00:26अब, जब हम इसकी तुलना Opus 4.8 से करते हैं, तो सवाल यह नहीं है कि क्या यह करीब है? सवाल यह है कि
00:00:32गिरावट कितनी है? और ईमानदारी से कहूँ तो, इतनी ज़्यादा गिरावट नहीं है। वास्तव में, इसमें बेहतर आंकड़े हैं
00:00:39जब हम नॉलेज वर्क देखते हैं, जो काफी आश्चर्यजनक है। कंप्यूटर उपयोग केवल 2% पीछे है, और यह केवल
00:00:44एजेंटिक कोडिंग से 2% पीछे है, और मल्टीडिसिप्लिनरी रीजनिंग पर यह कुछ प्रतिशत अंक ही पीछे है।
00:00:49सबसे बड़ा अंतर यहाँ Sweebench Pro के साथ है जब हम 63 बनाम 69% देखते हैं।
00:00:56लेकिन अरे, Terminal Bench 2.1, 80 बनाम 82। तो यह कोई बड़ा अंतर नहीं है। और यह चर्चा
00:01:03प्रदर्शन के बारे में कीमत के संदर्भ में होनी चाहिए। याद रखें, Fable 5, Mythos 5,
00:01:08हम इनपुट टोकन के लिए $10 देख रहे हैं, जो Opus का दोगुना है। Opus प्रति मिलियन इनपुट टोकन $5 है।
00:01:16और आउटपुट के लिए, यह $25 पर है। तो $5, $25। Sonnet 5 के लिए, हम $2 देख रहे हैं। तो Opus की लागत का केवल 40%
00:01:26इनपुट टोकन में। और आउटपुट के लिए, यह $10 है। तो काफी सस्ता, Opus की आधी से भी कम लागत।
00:01:34फिर भी जब हम आंकड़ों को देखते हैं, तो यह काफी करीब है। तो अगर आप कोई ऐसे व्यक्ति हैं जो
00:01:40AI के साथ आवश्यक अत्याधुनिक कार्य नहीं कर रहे हैं, आप इसे अधिक नियमित कार्यों के लिए कर रहे हैं, और आप
00:01:46अभी भी शक्ति चाहते हैं, तो, Sonnet 5 अब उस कमी को पूरा कर रहा है। अब आइए उन चार्ट्स पर नज़र डालते हैं जो
00:01:51केवल बेंचमार्क से परे हैं। यहाँ हम प्रयास स्तर के अनुसार एजेंटिक खोज प्रदर्शन देख रहे हैं, तुलना कर रहे हैं
00:01:55Opus 4.8 की Sonnet 5 और Sonnet 4.6 से। तो तुरंत, मुझे लगता है कि आप यहाँ देखेंगे, Sonnet 5, बहुत बड़ा अंतर है
00:02:04पास दरों में जैसे-जैसे हम प्रयास स्तरों के बीच चलते हैं। तो लो पर, यह 55% करता है। लेकिन अगर हम देखें
00:02:13Sonnet 4.6 पर लो, Sonnet 4.6 पर लो वास्तव में बेहतर प्रदर्शन करता है। फिर भी लागत के मामले में, यह बहुत कम है।
00:02:19हम मीडियम पर चलते हैं, हमें अनिवार्य रूप से वही प्रदर्शन मिल रहा है जो हमने Sonnet 4.6 के साथ देखा था,
00:02:25लेकिन काफी छूट पर। और केवल जब हम उच्च प्रयास स्तरों पर चलते हैं, तब हम Sonnet 4.6 को पीछे छोड़ना शुरू करते हैं।
00:02:34लेकिन उस बिंदु पर, हमें Sonnet 4.6 से बेहतर प्रदर्शन मिल रहा है, लेकिन ऐसी लागत पर जो
00:02:41Sonnet 4.6 के लिए कम प्रयास स्तर पर रही होगी। तो इस तरह के प्रयास स्तर का अंतर,
00:02:49मुझे लगता है कि यह बहुत महत्वपूर्ण है क्योंकि यह सिर्फ ऐसा नहीं है कि, अरे, Sonnet 5 हर क्षेत्र में बेहतर है, जहाँ 5 पर लो
00:02:53जरूरी नहीं कि 4.6 पर लो से बेहतर हो। Sonnet 5 पर लो का मतलब वास्तव में सिर्फ यह है कि यह बहुत सस्ता होने वाला है।
00:02:59लेकिन उच्च स्तर का प्रदर्शन प्राप्त करने के मामले में, जो हमने अतीत में देखा है,
00:03:03शायद कुछ ऐसा करने की आवश्यकता है जो उच्च श्रेणी में हो। उस ने कहा, जब हम Sonnet 5 के साथ उच्च
00:03:08श्रेणी में होते हैं, तो हम लगभग उतनी ही राशि चुका रहे होते हैं जितनी हम Opus के साथ चुकाते। Opus मीडियम
00:03:14और उच्च पर Sonnet के उच्च पर समान लागत होती है, लेकिन हमें बेहतर पास दर मिल रही है। तो यह
00:03:21इस चर्चा में बहुत सारी बारीकियां लाता है। क्या हमें एजेंटिक सर्च और ऐसी चीजों में Sonnet 5 बनाम Opus 4.5 का उपयोग करने की आवश्यकता है?
00:03:27मुझे लगता है कि यह वास्तव में निर्भर करता है। यदि यह एक अधिक जटिल समस्या है, तो अंत में, Opus 4.8 हो सकता है
00:03:33सस्ता क्योंकि यह बहुत टोकन कुशल है और Sonnet बस काम के लिए सही चीज़ नहीं है।
00:03:38हालाँकि, जब हम ऐसे कार्य कर रहे होते हैं जो इन AI मॉडलों के लिए उतने चुनौतीपूर्ण नहीं होते, तो शायद
00:03:44Opus 4.8 का उपयोग करना बिल्कुल भी समझ में नहीं आता है। तभी हम Sonnet 5 लाते हैं। तो मुझे लगता है कि यह
00:03:49एक दिलचस्प जगह है जहाँ हम अब हैं जहाँ यह एक केस-दर-केस आधार है कि किस मॉडल का
00:03:54आपको उपयोग करना चाहिए। अब, यहाँ एक और दिलचस्प है जब हम एजेंटिक कंप्यूटर उपयोग देखते हैं। अब, हर
00:03:58क्षेत्र में, अधिकांश भाग के लिए, Sonnet 5, Sonnet 4.6 को हरा रहा है और यह काफी कम लागत पर कर रहा है। तो
00:04:05एजेंटिक सर्च, वह निश्चित रूप से मामला नहीं था, लेकिन एजेंटिक कंप्यूटर उपयोग, अचानक,
00:04:09हम हमेशा 4.6 पर Sonnet 5 का उपयोग करेंगे। और फिर, यह इस विचार पर वापस जाता है कि यह अब एक केस-दर-केस
00:04:14आधार है कि आपको किस मॉडल का उपयोग करना चाहिए। हालांकि दिलचस्प बात यह है कि Opus को देखें। Opus उच्च
00:04:20मैक्स Sonnet 5 से बेहतर प्रदर्शन करता है और यह सस्ता है। तो, मेरा मतलब है, आप इन्हें देखते हैं और आप सोचते हैं,
00:04:26वाह, जैसे, Opus वास्तव में जो करता है उसके लिए काफी कुशल है। यह उल्लेख नहीं करना कि यह इन उच्च स्तरों तक
00:04:30पहुंचता है जो Sonnet नहीं पहुंच सकता। तो सोचने वाली बातें, ईमानदारी से, सिर्फ इसलिए कि प्रति मिलियन लागत
00:04:36टोकन Opus के साथ सस्ते हैं, ऐसे कई मामले होंगे जहाँ Opus अभी भी सबसे अच्छा है। अब, मैं चाहता हूँ
00:04:41बिना संरेखित व्यवहार के बारे में बात किए बिना एक एंथ्रोपिक मॉडल रिलीज। हम देख सकते हैं कि यह Sonnet 5 के साथ सुधार है
00:04:45लेकिन अभी भी उस से नीचे है जो हम Opus 4.8 और Mythos प्रीव्यू के साथ उम्मीद करेंगे। और
00:04:50शोषण और इस पूरे साइबर सुरक्षा प्रश्न जो Mythos को काफी हद तक लॉक कर दिया, वह नहीं है
00:04:55एक समस्या या कुछ ऐसी चीज़ जिसके बारे में आपको Sonnet क्लास के साथ चिंता करने की ज़रूरत है। तो कुल मिलाकर, मैं भुगतान नहीं करूँगा
00:04:59इन बेंचमार्क पर बहुत अधिक ध्यान, ईमानदारी से। इस तरह के बेंचमार्क, इस तरह के चार्ट मुझे बहुत
00:05:05अधिक रोक देते हैं क्योंकि सवाल मुझे नहीं लगता कि Sonnet 5 बनाम 4.6 है। हम लगभग हमेशा
00:05:11Sonnet 5 का उपयोग करने जा रहे हैं। यह Sonnet 5 बनाम Opus 4.8 है। और सवाल यह है, क्या Opus वास्तव में सस्ता है? और
00:05:18मैं एंथ्रोपिक द्वारा और अधिक परीक्षण और अधिक चीजें देखना चाहूंगा जो स्पष्ट रूप से बताती हैं, यहाँ प्रकार है
00:05:24उस तरह का सीमांकन कि, ठीक है, Sonnet 5 इस पर ठीक काम कर सकता है और यह Opus की तुलना में सस्ता है बनाम,
00:05:29अरे, यह अब एक अधिक जटिल कार्य है। Opus वास्तव में इसे पूरा करने में Sonnet से अधिक कुशल होने वाला है।
00:05:34तो सोचने वाली बातें, निश्चित रूप से एक अच्छा है। मुझे लगता है कि कुल मिलाकर निचले स्तर के कार्य उस पर एक वरदान होने वाले हैं
00:05:40क्योंकि हम में से जो लोग API टोकन का उपयोग करते हैं, आप जानते हैं,
00:05:46हमारे अनुप्रयोगों या उन चीजों के लिए जो क्लाउड मैक्स प्लान पारिस्थितिकी तंत्र में नहीं हैं, एंथ्रोपिक का उपयोग करना थोड़ा कठिन है।
00:05:51यह इतना महंगा है। और मैं लोगों को लंबे समय से बता रहा हूँ, जैसे, बस OpenAI को देखो,
00:05:55आप जानते हैं, उनके कुछ मिनी मॉडल को देखें क्योंकि वह अक्सर बहुत से लोगों की नौकरियों के लिए पर्याप्त से अधिक होता है।
00:05:59खैर, हमारे पास अब एंथ्रोपिक के साथ एक मध्य-स्तरीय विकल्प है, जो कि अच्छा है।
00:06:05तो यहीं मैं आप लोगों को आज छोड़ दूँगा। यह हर जगह उपलब्ध है। मुझे लगता है
00:06:09यह पता लगाने के लिए बहुत परीक्षण और त्रुटि होने वाली है कि यह कहाँ सबसे अधिक समझ में आता है। तो मुझे बताएं
00:06:13आपने क्या सोचा। अगर आप मेरे क्लाउड कोड मास्टरक्लास पर अपना हाथ डालना चाहते हैं तो चेस AI प्लस को देखना सुनिश्चित करें
00:06:17और मैं आपसे बाद में मिलूँगा।

Key Takeaway

Sonnet 5 एंथ्रोपिक का एक नया किफायती मॉडल है जो Opus 4.8 के करीब प्रदर्शन देता है, जिससे सामान्य कार्यों के लिए उच्च लागत वाले मॉडल का उपयोग करना अब आवश्यक नहीं रहा।

Highlights

  • Sonnet 5 इनपुट टोकन के लिए प्रति मिलियन $2 और आउटपुट के लिए $10 की लागत पर उपलब्ध है, जो Opus 4.8 की तुलना में 50% से भी कम है।

  • नॉलेज वर्क और टर्मिनल बेंच 2.1 जैसे कई बेंचमार्क में Sonnet 5 का प्रदर्शन Opus 4.8 के बहुत करीब है।

  • एजेंटिक कंप्यूटर उपयोग में Sonnet 5 ने Sonnet 4.6 की तुलना में हर क्षेत्र में बेहतर प्रदर्शन किया है।

  • एजेंटिक सर्च के दौरान कम प्रयास स्तर (Low Effort) पर Sonnet 4.6, Sonnet 5 से अधिक कुशल परिणाम देता है।

  • जटिल कार्यों के लिए Opus 4.8 का उपयोग करना अधिक किफायती हो सकता है क्योंकि यह टोकन के मामले में अधिक कुशल है।

Timeline

Sonnet 5 बनाम पिछले मॉडल और बेंचमार्क प्रदर्शन

  • Sonnet 5, Sonnet 4.6 की तुलना में एजेंटिक कोडिंग और रीजनिंग में एक बड़ा सुधार है।
  • Opus 4.8 की तुलना में नॉलेज वर्क में Sonnet 5 के आंकड़े आश्चर्यजनक रूप से बेहतर हैं।
  • Sweebench Pro पर Opus 4.8 के 69% की तुलना में Sonnet 5 का स्कोर 63% है।

यह खंड Sonnet 5 के बेंचमार्क प्रदर्शन का विश्लेषण करता है। हालांकि यह Opus 4.8 से कुछ मामलों में पीछे है, लेकिन यह गिरावट बहुत कम है। विशेष रूप से नॉलेज वर्क और कोडिंग जैसे क्षेत्रों में यह अंतर नगण्य है, जो इसे एक शक्तिशाली विकल्प बनाता है।

लागत विश्लेषण और कार्य-आधारित चयन

  • Sonnet 5 इनपुट लागत Opus 4.8 का 40% और आउटपुट लागत 50% से कम है।
  • एजेंटिक सर्च में उच्च प्रयास स्तरों पर ही Sonnet 5 अपने पिछले संस्करण 4.6 को पीछे छोड़ता है।
  • Opus 4.8 जटिल कार्यों में बेहतर टोकन दक्षता और सफलता दर प्रदान करता है।

लागत और प्रदर्शन के संतुलन पर चर्चा की गई है। कम प्रयास वाले कार्यों के लिए Sonnet 5 बेहद किफायती है, लेकिन जैसे ही कार्य की जटिलता बढ़ती है, Opus 4.8 का उपयोग अधिक तार्किक हो जाता है क्योंकि यह कठिन समस्याओं को कम टोकन खर्च में सुलझाने में सक्षम है।

उपयोग के मामले और भविष्य के परीक्षण

  • एजेंटिक कंप्यूटर उपयोग कार्यों में Sonnet 5 लगातार Sonnet 4.6 से बेहतर प्रदर्शन करता है।
  • सुरक्षा और गैर-संरेखित व्यवहार के मामले में Sonnet 5, Mythos के समान चुनौतियों से मुक्त है।
  • उपयोगकर्ता को विशिष्ट कार्य की जटिलता के आधार पर मॉडल का चयन करना चाहिए।

विभिन्न उपयोग के मामलों पर ध्यान केंद्रित किया गया है। कंप्यूटर उपयोग में Sonnet 5 स्पष्ट विजेता है, लेकिन सामान्यतः मॉडल चयन एक केस-दर-केस प्रक्रिया होनी चाहिए। यह मॉडल उन लोगों के लिए एक वरदान है जो API उपयोग में लागत कम करना चाहते हैं।

Community Posts

View all posts