Sonnet 5 लाइव है और यह Opus को टक्कर देता है

CChase AI
컴퓨터/소프트웨어창업/스타트업경영/리더십

스크립트

00:00:00Anthropic ने अभी-अभी Sonnet 5 जारी किया है, तो आइए इसके बारे में जानने योग्य सभी बातों पर एक नज़र डालते हैं।
00:00:04तो चलिए बेंचमार्क से शुरुआत करते हैं। और याद रखें, Sonnet 5 एक कम शक्तिशाली,
00:00:08Opus और निश्चित रूप से Fable जैसी चीजों की तुलना में कम महंगा मॉडल है। हमारे पास यहाँ कोई अपग्रेड नहीं आया है
00:00:134.6 के बाद से। अब, 5 की तुलना 4.6 से करें, तो हम देखते हैं कि यह एजेंटिक कोडिंग के मामले में एक बड़ी छलांग है,
00:00:21मल्टीडिसिप्लिनरी रीजनिंग, कंप्यूटर उपयोग, और नॉलेज वर्क। तो हर क्षेत्र में सीधा अपग्रेड।
00:00:26अब, जब हम इसकी तुलना Opus 4.8 से करते हैं, तो सवाल यह नहीं है कि क्या यह करीब है? सवाल यह है कि
00:00:32गिरावट कितनी है? और ईमानदारी से कहूँ तो, इतनी ज़्यादा गिरावट नहीं है। वास्तव में, इसमें बेहतर आंकड़े हैं
00:00:39जब हम नॉलेज वर्क देखते हैं, जो काफी आश्चर्यजनक है। कंप्यूटर उपयोग केवल 2% पीछे है, और यह केवल
00:00:44एजेंटिक कोडिंग से 2% पीछे है, और मल्टीडिसिप्लिनरी रीजनिंग पर यह कुछ प्रतिशत अंक ही पीछे है।
00:00:49सबसे बड़ा अंतर यहाँ Sweebench Pro के साथ है जब हम 63 बनाम 69% देखते हैं।
00:00:56लेकिन अरे, Terminal Bench 2.1, 80 बनाम 82। तो यह कोई बड़ा अंतर नहीं है। और यह चर्चा
00:01:03प्रदर्शन के बारे में कीमत के संदर्भ में होनी चाहिए। याद रखें, Fable 5, Mythos 5,
00:01:08हम इनपुट टोकन के लिए $10 देख रहे हैं, जो Opus का दोगुना है। Opus प्रति मिलियन इनपुट टोकन $5 है।
00:01:16और आउटपुट के लिए, यह $25 पर है। तो $5, $25। Sonnet 5 के लिए, हम $2 देख रहे हैं। तो Opus की लागत का केवल 40%
00:01:26इनपुट टोकन में। और आउटपुट के लिए, यह $10 है। तो काफी सस्ता, Opus की आधी से भी कम लागत।
00:01:34फिर भी जब हम आंकड़ों को देखते हैं, तो यह काफी करीब है। तो अगर आप कोई ऐसे व्यक्ति हैं जो
00:01:40AI के साथ आवश्यक अत्याधुनिक कार्य नहीं कर रहे हैं, आप इसे अधिक नियमित कार्यों के लिए कर रहे हैं, और आप
00:01:46अभी भी शक्ति चाहते हैं, तो, Sonnet 5 अब उस कमी को पूरा कर रहा है। अब आइए उन चार्ट्स पर नज़र डालते हैं जो
00:01:51केवल बेंचमार्क से परे हैं। यहाँ हम प्रयास स्तर के अनुसार एजेंटिक खोज प्रदर्शन देख रहे हैं, तुलना कर रहे हैं
00:01:55Opus 4.8 की Sonnet 5 और Sonnet 4.6 से। तो तुरंत, मुझे लगता है कि आप यहाँ देखेंगे, Sonnet 5, बहुत बड़ा अंतर है
00:02:04पास दरों में जैसे-जैसे हम प्रयास स्तरों के बीच चलते हैं। तो लो पर, यह 55% करता है। लेकिन अगर हम देखें
00:02:13Sonnet 4.6 पर लो, Sonnet 4.6 पर लो वास्तव में बेहतर प्रदर्शन करता है। फिर भी लागत के मामले में, यह बहुत कम है।
00:02:19हम मीडियम पर चलते हैं, हमें अनिवार्य रूप से वही प्रदर्शन मिल रहा है जो हमने Sonnet 4.6 के साथ देखा था,
00:02:25लेकिन काफी छूट पर। और केवल जब हम उच्च प्रयास स्तरों पर चलते हैं, तब हम Sonnet 4.6 को पीछे छोड़ना शुरू करते हैं।
00:02:34लेकिन उस बिंदु पर, हमें Sonnet 4.6 से बेहतर प्रदर्शन मिल रहा है, लेकिन ऐसी लागत पर जो
00:02:41Sonnet 4.6 के लिए कम प्रयास स्तर पर रही होगी। तो इस तरह के प्रयास स्तर का अंतर,
00:02:49मुझे लगता है कि यह बहुत महत्वपूर्ण है क्योंकि यह सिर्फ ऐसा नहीं है कि, अरे, Sonnet 5 हर क्षेत्र में बेहतर है, जहाँ 5 पर लो
00:02:53जरूरी नहीं कि 4.6 पर लो से बेहतर हो। Sonnet 5 पर लो का मतलब वास्तव में सिर्फ यह है कि यह बहुत सस्ता होने वाला है।
00:02:59लेकिन उच्च स्तर का प्रदर्शन प्राप्त करने के मामले में, जो हमने अतीत में देखा है,
00:03:03शायद कुछ ऐसा करने की आवश्यकता है जो उच्च श्रेणी में हो। उस ने कहा, जब हम Sonnet 5 के साथ उच्च
00:03:08श्रेणी में होते हैं, तो हम लगभग उतनी ही राशि चुका रहे होते हैं जितनी हम Opus के साथ चुकाते। Opus मीडियम
00:03:14और उच्च पर Sonnet के उच्च पर समान लागत होती है, लेकिन हमें बेहतर पास दर मिल रही है। तो यह
00:03:21इस चर्चा में बहुत सारी बारीकियां लाता है। क्या हमें एजेंटिक सर्च और ऐसी चीजों में Sonnet 5 बनाम Opus 4.5 का उपयोग करने की आवश्यकता है?
00:03:27मुझे लगता है कि यह वास्तव में निर्भर करता है। यदि यह एक अधिक जटिल समस्या है, तो अंत में, Opus 4.8 हो सकता है
00:03:33सस्ता क्योंकि यह बहुत टोकन कुशल है और Sonnet बस काम के लिए सही चीज़ नहीं है।
00:03:38हालाँकि, जब हम ऐसे कार्य कर रहे होते हैं जो इन AI मॉडलों के लिए उतने चुनौतीपूर्ण नहीं होते, तो शायद
00:03:44Opus 4.8 का उपयोग करना बिल्कुल भी समझ में नहीं आता है। तभी हम Sonnet 5 लाते हैं। तो मुझे लगता है कि यह
00:03:49एक दिलचस्प जगह है जहाँ हम अब हैं जहाँ यह एक केस-दर-केस आधार है कि किस मॉडल का
00:03:54आपको उपयोग करना चाहिए। अब, यहाँ एक और दिलचस्प है जब हम एजेंटिक कंप्यूटर उपयोग देखते हैं। अब, हर
00:03:58क्षेत्र में, अधिकांश भाग के लिए, Sonnet 5, Sonnet 4.6 को हरा रहा है और यह काफी कम लागत पर कर रहा है। तो
00:04:05एजेंटिक सर्च, वह निश्चित रूप से मामला नहीं था, लेकिन एजेंटिक कंप्यूटर उपयोग, अचानक,
00:04:09हम हमेशा 4.6 पर Sonnet 5 का उपयोग करेंगे। और फिर, यह इस विचार पर वापस जाता है कि यह अब एक केस-दर-केस
00:04:14आधार है कि आपको किस मॉडल का उपयोग करना चाहिए। हालांकि दिलचस्प बात यह है कि Opus को देखें। Opus उच्च
00:04:20मैक्स Sonnet 5 से बेहतर प्रदर्शन करता है और यह सस्ता है। तो, मेरा मतलब है, आप इन्हें देखते हैं और आप सोचते हैं,
00:04:26वाह, जैसे, Opus वास्तव में जो करता है उसके लिए काफी कुशल है। यह उल्लेख नहीं करना कि यह इन उच्च स्तरों तक
00:04:30पहुंचता है जो Sonnet नहीं पहुंच सकता। तो सोचने वाली बातें, ईमानदारी से, सिर्फ इसलिए कि प्रति मिलियन लागत
00:04:36टोकन Opus के साथ सस्ते हैं, ऐसे कई मामले होंगे जहाँ Opus अभी भी सबसे अच्छा है। अब, मैं चाहता हूँ
00:04:41बिना संरेखित व्यवहार के बारे में बात किए बिना एक एंथ्रोपिक मॉडल रिलीज। हम देख सकते हैं कि यह Sonnet 5 के साथ सुधार है
00:04:45लेकिन अभी भी उस से नीचे है जो हम Opus 4.8 और Mythos प्रीव्यू के साथ उम्मीद करेंगे। और
00:04:50शोषण और इस पूरे साइबर सुरक्षा प्रश्न जो Mythos को काफी हद तक लॉक कर दिया, वह नहीं है
00:04:55एक समस्या या कुछ ऐसी चीज़ जिसके बारे में आपको Sonnet क्लास के साथ चिंता करने की ज़रूरत है। तो कुल मिलाकर, मैं भुगतान नहीं करूँगा
00:04:59इन बेंचमार्क पर बहुत अधिक ध्यान, ईमानदारी से। इस तरह के बेंचमार्क, इस तरह के चार्ट मुझे बहुत
00:05:05अधिक रोक देते हैं क्योंकि सवाल मुझे नहीं लगता कि Sonnet 5 बनाम 4.6 है। हम लगभग हमेशा
00:05:11Sonnet 5 का उपयोग करने जा रहे हैं। यह Sonnet 5 बनाम Opus 4.8 है। और सवाल यह है, क्या Opus वास्तव में सस्ता है? और
00:05:18मैं एंथ्रोपिक द्वारा और अधिक परीक्षण और अधिक चीजें देखना चाहूंगा जो स्पष्ट रूप से बताती हैं, यहाँ प्रकार है
00:05:24उस तरह का सीमांकन कि, ठीक है, Sonnet 5 इस पर ठीक काम कर सकता है और यह Opus की तुलना में सस्ता है बनाम,
00:05:29अरे, यह अब एक अधिक जटिल कार्य है। Opus वास्तव में इसे पूरा करने में Sonnet से अधिक कुशल होने वाला है।
00:05:34तो सोचने वाली बातें, निश्चित रूप से एक अच्छा है। मुझे लगता है कि कुल मिलाकर निचले स्तर के कार्य उस पर एक वरदान होने वाले हैं
00:05:40क्योंकि हम में से जो लोग API टोकन का उपयोग करते हैं, आप जानते हैं,
00:05:46हमारे अनुप्रयोगों या उन चीजों के लिए जो क्लाउड मैक्स प्लान पारिस्थितिकी तंत्र में नहीं हैं, एंथ्रोपिक का उपयोग करना थोड़ा कठिन है।
00:05:51यह इतना महंगा है। और मैं लोगों को लंबे समय से बता रहा हूँ, जैसे, बस OpenAI को देखो,
00:05:55आप जानते हैं, उनके कुछ मिनी मॉडल को देखें क्योंकि वह अक्सर बहुत से लोगों की नौकरियों के लिए पर्याप्त से अधिक होता है।
00:05:59खैर, हमारे पास अब एंथ्रोपिक के साथ एक मध्य-स्तरीय विकल्प है, जो कि अच्छा है।
00:06:05तो यहीं मैं आप लोगों को आज छोड़ दूँगा। यह हर जगह उपलब्ध है। मुझे लगता है
00:06:09यह पता लगाने के लिए बहुत परीक्षण और त्रुटि होने वाली है कि यह कहाँ सबसे अधिक समझ में आता है। तो मुझे बताएं
00:06:13आपने क्या सोचा। अगर आप मेरे क्लाउड कोड मास्टरक्लास पर अपना हाथ डालना चाहते हैं तो चेस AI प्लस को देखना सुनिश्चित करें
00:06:17और मैं आपसे बाद में मिलूँगा।

핵심 요약

Sonnet 5 एंथ्रोपिक का एक नया किफायती मॉडल है जो Opus 4.8 के करीब प्रदर्शन देता है, जिससे सामान्य कार्यों के लिए उच्च लागत वाले मॉडल का उपयोग करना अब आवश्यक नहीं रहा।

하이라이트

  • Sonnet 5 इनपुट टोकन के लिए प्रति मिलियन $2 और आउटपुट के लिए $10 की लागत पर उपलब्ध है, जो Opus 4.8 की तुलना में 50% से भी कम है।

  • नॉलेज वर्क और टर्मिनल बेंच 2.1 जैसे कई बेंचमार्क में Sonnet 5 का प्रदर्शन Opus 4.8 के बहुत करीब है।

  • एजेंटिक कंप्यूटर उपयोग में Sonnet 5 ने Sonnet 4.6 की तुलना में हर क्षेत्र में बेहतर प्रदर्शन किया है।

  • एजेंटिक सर्च के दौरान कम प्रयास स्तर (Low Effort) पर Sonnet 4.6, Sonnet 5 से अधिक कुशल परिणाम देता है।

  • जटिल कार्यों के लिए Opus 4.8 का उपयोग करना अधिक किफायती हो सकता है क्योंकि यह टोकन के मामले में अधिक कुशल है।

타임라인

Sonnet 5 बनाम पिछले मॉडल और बेंचमार्क प्रदर्शन

  • Sonnet 5, Sonnet 4.6 की तुलना में एजेंटिक कोडिंग और रीजनिंग में एक बड़ा सुधार है।
  • Opus 4.8 की तुलना में नॉलेज वर्क में Sonnet 5 के आंकड़े आश्चर्यजनक रूप से बेहतर हैं।
  • Sweebench Pro पर Opus 4.8 के 69% की तुलना में Sonnet 5 का स्कोर 63% है।

यह खंड Sonnet 5 के बेंचमार्क प्रदर्शन का विश्लेषण करता है। हालांकि यह Opus 4.8 से कुछ मामलों में पीछे है, लेकिन यह गिरावट बहुत कम है। विशेष रूप से नॉलेज वर्क और कोडिंग जैसे क्षेत्रों में यह अंतर नगण्य है, जो इसे एक शक्तिशाली विकल्प बनाता है।

लागत विश्लेषण और कार्य-आधारित चयन

  • Sonnet 5 इनपुट लागत Opus 4.8 का 40% और आउटपुट लागत 50% से कम है।
  • एजेंटिक सर्च में उच्च प्रयास स्तरों पर ही Sonnet 5 अपने पिछले संस्करण 4.6 को पीछे छोड़ता है।
  • Opus 4.8 जटिल कार्यों में बेहतर टोकन दक्षता और सफलता दर प्रदान करता है।

लागत और प्रदर्शन के संतुलन पर चर्चा की गई है। कम प्रयास वाले कार्यों के लिए Sonnet 5 बेहद किफायती है, लेकिन जैसे ही कार्य की जटिलता बढ़ती है, Opus 4.8 का उपयोग अधिक तार्किक हो जाता है क्योंकि यह कठिन समस्याओं को कम टोकन खर्च में सुलझाने में सक्षम है।

उपयोग के मामले और भविष्य के परीक्षण

  • एजेंटिक कंप्यूटर उपयोग कार्यों में Sonnet 5 लगातार Sonnet 4.6 से बेहतर प्रदर्शन करता है।
  • सुरक्षा और गैर-संरेखित व्यवहार के मामले में Sonnet 5, Mythos के समान चुनौतियों से मुक्त है।
  • उपयोगकर्ता को विशिष्ट कार्य की जटिलता के आधार पर मॉडल का चयन करना चाहिए।

विभिन्न उपयोग के मामलों पर ध्यान केंद्रित किया गया है। कंप्यूटर उपयोग में Sonnet 5 स्पष्ट विजेता है, लेकिन सामान्यतः मॉडल चयन एक केस-दर-केस प्रक्रिया होनी चाहिए। यह मॉडल उन लोगों के लिए एक वरदान है जो API उपयोग में लागत कम करना चाहते हैं।

커뮤니티 글

모든 글 보기