스크립트
00:00:00Anthropic ने अभी-अभी Sonnet 5 जारी किया है, तो आइए इसके बारे में जानने योग्य सभी बातों पर एक नज़र डालते हैं।
00:00:04तो चलिए बेंचमार्क से शुरुआत करते हैं। और याद रखें, Sonnet 5 एक कम शक्तिशाली,
00:00:08Opus और निश्चित रूप से Fable जैसी चीजों की तुलना में कम महंगा मॉडल है। हमारे पास यहाँ कोई अपग्रेड नहीं आया है
00:00:134.6 के बाद से। अब, 5 की तुलना 4.6 से करें, तो हम देखते हैं कि यह एजेंटिक कोडिंग के मामले में एक बड़ी छलांग है,
00:00:21मल्टीडिसिप्लिनरी रीजनिंग, कंप्यूटर उपयोग, और नॉलेज वर्क। तो हर क्षेत्र में सीधा अपग्रेड।
00:00:26अब, जब हम इसकी तुलना Opus 4.8 से करते हैं, तो सवाल यह नहीं है कि क्या यह करीब है? सवाल यह है कि
00:00:32गिरावट कितनी है? और ईमानदारी से कहूँ तो, इतनी ज़्यादा गिरावट नहीं है। वास्तव में, इसमें बेहतर आंकड़े हैं
00:00:39जब हम नॉलेज वर्क देखते हैं, जो काफी आश्चर्यजनक है। कंप्यूटर उपयोग केवल 2% पीछे है, और यह केवल
00:00:44एजेंटिक कोडिंग से 2% पीछे है, और मल्टीडिसिप्लिनरी रीजनिंग पर यह कुछ प्रतिशत अंक ही पीछे है।
00:00:49सबसे बड़ा अंतर यहाँ Sweebench Pro के साथ है जब हम 63 बनाम 69% देखते हैं।
00:00:56लेकिन अरे, Terminal Bench 2.1, 80 बनाम 82। तो यह कोई बड़ा अंतर नहीं है। और यह चर्चा
00:01:03प्रदर्शन के बारे में कीमत के संदर्भ में होनी चाहिए। याद रखें, Fable 5, Mythos 5,
00:01:08हम इनपुट टोकन के लिए $10 देख रहे हैं, जो Opus का दोगुना है। Opus प्रति मिलियन इनपुट टोकन $5 है।
00:01:16और आउटपुट के लिए, यह $25 पर है। तो $5, $25। Sonnet 5 के लिए, हम $2 देख रहे हैं। तो Opus की लागत का केवल 40%
00:01:26इनपुट टोकन में। और आउटपुट के लिए, यह $10 है। तो काफी सस्ता, Opus की आधी से भी कम लागत।
00:01:34फिर भी जब हम आंकड़ों को देखते हैं, तो यह काफी करीब है। तो अगर आप कोई ऐसे व्यक्ति हैं जो
00:01:40AI के साथ आवश्यक अत्याधुनिक कार्य नहीं कर रहे हैं, आप इसे अधिक नियमित कार्यों के लिए कर रहे हैं, और आप
00:01:46अभी भी शक्ति चाहते हैं, तो, Sonnet 5 अब उस कमी को पूरा कर रहा है। अब आइए उन चार्ट्स पर नज़र डालते हैं जो
00:01:51केवल बेंचमार्क से परे हैं। यहाँ हम प्रयास स्तर के अनुसार एजेंटिक खोज प्रदर्शन देख रहे हैं, तुलना कर रहे हैं
00:01:55Opus 4.8 की Sonnet 5 और Sonnet 4.6 से। तो तुरंत, मुझे लगता है कि आप यहाँ देखेंगे, Sonnet 5, बहुत बड़ा अंतर है
00:02:04पास दरों में जैसे-जैसे हम प्रयास स्तरों के बीच चलते हैं। तो लो पर, यह 55% करता है। लेकिन अगर हम देखें
00:02:13Sonnet 4.6 पर लो, Sonnet 4.6 पर लो वास्तव में बेहतर प्रदर्शन करता है। फिर भी लागत के मामले में, यह बहुत कम है।
00:02:19हम मीडियम पर चलते हैं, हमें अनिवार्य रूप से वही प्रदर्शन मिल रहा है जो हमने Sonnet 4.6 के साथ देखा था,
00:02:25लेकिन काफी छूट पर। और केवल जब हम उच्च प्रयास स्तरों पर चलते हैं, तब हम Sonnet 4.6 को पीछे छोड़ना शुरू करते हैं।
00:02:34लेकिन उस बिंदु पर, हमें Sonnet 4.6 से बेहतर प्रदर्शन मिल रहा है, लेकिन ऐसी लागत पर जो
00:02:41Sonnet 4.6 के लिए कम प्रयास स्तर पर रही होगी। तो इस तरह के प्रयास स्तर का अंतर,
00:02:49मुझे लगता है कि यह बहुत महत्वपूर्ण है क्योंकि यह सिर्फ ऐसा नहीं है कि, अरे, Sonnet 5 हर क्षेत्र में बेहतर है, जहाँ 5 पर लो
00:02:53जरूरी नहीं कि 4.6 पर लो से बेहतर हो। Sonnet 5 पर लो का मतलब वास्तव में सिर्फ यह है कि यह बहुत सस्ता होने वाला है।
00:02:59लेकिन उच्च स्तर का प्रदर्शन प्राप्त करने के मामले में, जो हमने अतीत में देखा है,
00:03:03शायद कुछ ऐसा करने की आवश्यकता है जो उच्च श्रेणी में हो। उस ने कहा, जब हम Sonnet 5 के साथ उच्च
00:03:08श्रेणी में होते हैं, तो हम लगभग उतनी ही राशि चुका रहे होते हैं जितनी हम Opus के साथ चुकाते। Opus मीडियम
00:03:14और उच्च पर Sonnet के उच्च पर समान लागत होती है, लेकिन हमें बेहतर पास दर मिल रही है। तो यह
00:03:21इस चर्चा में बहुत सारी बारीकियां लाता है। क्या हमें एजेंटिक सर्च और ऐसी चीजों में Sonnet 5 बनाम Opus 4.5 का उपयोग करने की आवश्यकता है?
00:03:27मुझे लगता है कि यह वास्तव में निर्भर करता है। यदि यह एक अधिक जटिल समस्या है, तो अंत में, Opus 4.8 हो सकता है
00:03:33सस्ता क्योंकि यह बहुत टोकन कुशल है और Sonnet बस काम के लिए सही चीज़ नहीं है।
00:03:38हालाँकि, जब हम ऐसे कार्य कर रहे होते हैं जो इन AI मॉडलों के लिए उतने चुनौतीपूर्ण नहीं होते, तो शायद
00:03:44Opus 4.8 का उपयोग करना बिल्कुल भी समझ में नहीं आता है। तभी हम Sonnet 5 लाते हैं। तो मुझे लगता है कि यह
00:03:49एक दिलचस्प जगह है जहाँ हम अब हैं जहाँ यह एक केस-दर-केस आधार है कि किस मॉडल का
00:03:54आपको उपयोग करना चाहिए। अब, यहाँ एक और दिलचस्प है जब हम एजेंटिक कंप्यूटर उपयोग देखते हैं। अब, हर
00:03:58क्षेत्र में, अधिकांश भाग के लिए, Sonnet 5, Sonnet 4.6 को हरा रहा है और यह काफी कम लागत पर कर रहा है। तो
00:04:05एजेंटिक सर्च, वह निश्चित रूप से मामला नहीं था, लेकिन एजेंटिक कंप्यूटर उपयोग, अचानक,
00:04:09हम हमेशा 4.6 पर Sonnet 5 का उपयोग करेंगे। और फिर, यह इस विचार पर वापस जाता है कि यह अब एक केस-दर-केस
00:04:14आधार है कि आपको किस मॉडल का उपयोग करना चाहिए। हालांकि दिलचस्प बात यह है कि Opus को देखें। Opus उच्च
00:04:20मैक्स Sonnet 5 से बेहतर प्रदर्शन करता है और यह सस्ता है। तो, मेरा मतलब है, आप इन्हें देखते हैं और आप सोचते हैं,
00:04:26वाह, जैसे, Opus वास्तव में जो करता है उसके लिए काफी कुशल है। यह उल्लेख नहीं करना कि यह इन उच्च स्तरों तक
00:04:30पहुंचता है जो Sonnet नहीं पहुंच सकता। तो सोचने वाली बातें, ईमानदारी से, सिर्फ इसलिए कि प्रति मिलियन लागत
00:04:36टोकन Opus के साथ सस्ते हैं, ऐसे कई मामले होंगे जहाँ Opus अभी भी सबसे अच्छा है। अब, मैं चाहता हूँ
00:04:41बिना संरेखित व्यवहार के बारे में बात किए बिना एक एंथ्रोपिक मॉडल रिलीज। हम देख सकते हैं कि यह Sonnet 5 के साथ सुधार है
00:04:45लेकिन अभी भी उस से नीचे है जो हम Opus 4.8 और Mythos प्रीव्यू के साथ उम्मीद करेंगे। और
00:04:50शोषण और इस पूरे साइबर सुरक्षा प्रश्न जो Mythos को काफी हद तक लॉक कर दिया, वह नहीं है
00:04:55एक समस्या या कुछ ऐसी चीज़ जिसके बारे में आपको Sonnet क्लास के साथ चिंता करने की ज़रूरत है। तो कुल मिलाकर, मैं भुगतान नहीं करूँगा
00:04:59इन बेंचमार्क पर बहुत अधिक ध्यान, ईमानदारी से। इस तरह के बेंचमार्क, इस तरह के चार्ट मुझे बहुत
00:05:05अधिक रोक देते हैं क्योंकि सवाल मुझे नहीं लगता कि Sonnet 5 बनाम 4.6 है। हम लगभग हमेशा
00:05:11Sonnet 5 का उपयोग करने जा रहे हैं। यह Sonnet 5 बनाम Opus 4.8 है। और सवाल यह है, क्या Opus वास्तव में सस्ता है? और
00:05:18मैं एंथ्रोपिक द्वारा और अधिक परीक्षण और अधिक चीजें देखना चाहूंगा जो स्पष्ट रूप से बताती हैं, यहाँ प्रकार है
00:05:24उस तरह का सीमांकन कि, ठीक है, Sonnet 5 इस पर ठीक काम कर सकता है और यह Opus की तुलना में सस्ता है बनाम,
00:05:29अरे, यह अब एक अधिक जटिल कार्य है। Opus वास्तव में इसे पूरा करने में Sonnet से अधिक कुशल होने वाला है।
00:05:34तो सोचने वाली बातें, निश्चित रूप से एक अच्छा है। मुझे लगता है कि कुल मिलाकर निचले स्तर के कार्य उस पर एक वरदान होने वाले हैं
00:05:40क्योंकि हम में से जो लोग API टोकन का उपयोग करते हैं, आप जानते हैं,
00:05:46हमारे अनुप्रयोगों या उन चीजों के लिए जो क्लाउड मैक्स प्लान पारिस्थितिकी तंत्र में नहीं हैं, एंथ्रोपिक का उपयोग करना थोड़ा कठिन है।
00:05:51यह इतना महंगा है। और मैं लोगों को लंबे समय से बता रहा हूँ, जैसे, बस OpenAI को देखो,
00:05:55आप जानते हैं, उनके कुछ मिनी मॉडल को देखें क्योंकि वह अक्सर बहुत से लोगों की नौकरियों के लिए पर्याप्त से अधिक होता है।
00:05:59खैर, हमारे पास अब एंथ्रोपिक के साथ एक मध्य-स्तरीय विकल्प है, जो कि अच्छा है।
00:06:05तो यहीं मैं आप लोगों को आज छोड़ दूँगा। यह हर जगह उपलब्ध है। मुझे लगता है
00:06:09यह पता लगाने के लिए बहुत परीक्षण और त्रुटि होने वाली है कि यह कहाँ सबसे अधिक समझ में आता है। तो मुझे बताएं
00:06:13आपने क्या सोचा। अगर आप मेरे क्लाउड कोड मास्टरक्लास पर अपना हाथ डालना चाहते हैं तो चेस AI प्लस को देखना सुनिश्चित करें
00:06:17और मैं आपसे बाद में मिलूँगा।