스크립트
00:00:00एंथ्रोपिक द्वारा Fable 5.1 जारी करने के ठीक बाद, ओपनएआई ने पलटवार किया और GPT-6 Astra जारी कर दिया।
00:00:07अब आइए GPT-6 Astra के कुछ बेंचमार्क देखकर इसकी शुरुआत करते हैं। और
00:00:10Fable 5.1 के साथ एंथ्रोपिक द्वारा दिखाए गए बेंचमार्क की तुलना में हमें देखने के लिए
00:00:14और अधिक बेंचमार्क देने के लिए ओपनएआई को धन्यवाद। जब कंप्यूटर के उपयोग की बात आती है,
00:00:19तो यह लगभग सभी मोर्चों पर आगे है। Fable 5.1 के मामले में हमारे पास यहाँ
00:00:24ज्यादा डेटा भी नहीं है। जब हम पेशेवर बेंचमार्क को देखते हैं, जैसे BenchCAD और browse comp,
00:00:31तो GPT-6 बेहतरीन प्रदर्शन करता है। यह केवल आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स में नहीं जीतता,
00:00:38जहाँ यह Fable 5.1 के 65.7 की तुलना में 61.2 अंक प्राप्त करता है। अगला,
00:00:43हमारे पास कोडिंग है। और फिर से, लगभग वही कहानी है। यह या तो Fable 5.1 को हरा रहा है या
00:00:49उसके बिल्कुल टक्कर में है। यदि हम विशेष रूप से TerminalBench 4.0 को देखें, तो हम GPT 5.6
00:00:55सोलो से 37.3 से बढ़कर 57.7 तक की एक भारी छलांग देखते हैं। और यदि हम DeepSuite को देखें,
00:01:02जो शायद मेरा पसंदीदा कोडिंग बेंचमार्क है, यह वास्तव में लंबे समय तक चलने वाले एजेंटिक कार्यों पर ध्यान केंद्रित करता है।
00:01:08यह 74.1% स्कोर करता है, जो फिर से वहाँ मौजूद बाकी सभी चीजों से बेहतर है। GPT-6
00:01:13अकादमिक बेंचमार्क के साथ-साथ विज्ञान और स्वास्थ्य वाले बेंचमार्क में भी शानदार प्रदर्शन करता है। और जब हम साइबर सुरक्षा बेंचमार्क पर नजर डालते हैं, तो फिर से, मैं वास्तव में यहाँ 5.6 सोलो पर ध्यान दे रहा हूँ।
00:01:22भारी छलांग, 78.5 से 100%। एक्सप्लॉइट बेंच पर 55.9 से लेकर 88.5% तक और फिर 39% तक। तो यह फाइव सीरीज मॉडल से एक बड़ा बदलाव है।
00:01:27और लंबे संदर्भ के मामले में, GPT-6 भी कमाल करता है। 256 से 512k टोकन से आठ सुई परीक्षण करते समय 100% स्कोर।
00:01:34तो संक्षेप में एक चौथाई से लेकर पूरी तरह से भरे हुए कॉन्टेक्स्ट विंडो तक। और फिर जब उस विंडो में 512,000 टोकन से एक मिलियन टोकन होते हैं,
00:01:41तो यह अभी भी 96.3% स्कोर करता है। इसलिए यदि आप ऐसे व्यक्ति हैं जो हमेशा अपने पसंदीदा AI मॉडल में ढेर सारा संदर्भ डालते रहते हैं,
00:01:46तो GPT-6 उन परिदृश्यों में वास्तव में बहुत अच्छा प्रदर्शन करने वाला है। लेकिन कच्चे बेंचमार्क स्कोर काफी नहीं हैं।
00:01:51हमें यह जानने की जरूरत है कि वास्तव में इन स्कोर को प्राप्त करने में कितना खर्च आता है,
00:01:55क्योंकि Astra का स्कोर दुनिया में सबसे अच्छा हो सकता है, लेकिन अगर इसकी कीमत बाकी सभी चीजों से 10 गुना अधिक है, तो क्या फायदा?
00:01:59अब, GPT मॉडल के लिए सौभाग्य से, ऐतिहासिक रूप से, वे बहुत अधिक टोकन कुशल रहे हैं। इसलिए जब हम यहाँ
00:02:04टर्मिनल बेंच 4.0 स्कोर को देखते हैं, तो हम देखते हैं कि यह बात सही साबित होती है। तो तारों वाले निशान के साथ GPT-6 Astra,
00:02:11सबसे पहली बात जो मैं नोट करना चाहता हूँ वह यह है कि इनमें से कई मॉडलों की तरह, जैसे-जैसे हम प्रयास स्तर की श्रृंखला में ऊपर जाते हैं,
00:02:16हमें दक्षता में थोड़ी गिरावट दिखाई देती है। इसलिए जब मैं निम्न से मध्यम और फिर उच्च पर जाता हूँ, तो मुझे
00:02:23थोड़ी रैखिक लागत वृद्धि पर बेहतर स्कोर मिलना जारी रहता है। लेकिन जैसे ही मैं उच्च से अत्यधिक उच्च और फिर अधिकतम पर जाता हूँ,
00:02:30वास्तव में मुझे अधिक लागत पर खराब स्कोर मिल रहा है। इसलिए $7.21 पर उच्च स्तर पर, मुझे
00:02:3957.9% सटीकता मिल रही है। जब मैं इसकी तुलना यहाँ Fable 5.1 से करता हूँ, और मैं उच्च स्तर पर हूँ, तो मुझे $10.50 पर 49.4%
00:02:49सटीकता मिल रही है। तो यह अधिक महंगा है, और इसका स्कोर इतना अच्छा नहीं है। अब, जब मैं इसे अधिकतम प्रयास 55.8 पर सेट करता हूँ,
00:02:57तो Fable वास्तव में काफी उच्च स्कोर करता है, लेकिन इसके लिए मुझे $19.50 खर्च करने पड़ रहे हैं। तो एक ही स्कोर के लिए,
00:03:06फिर से, लगभग 55%, यह Fable 5 का लगभग $20 है। और GPT-6 Astra के लिए, यह $7.20 है। तो अनिवार्य रूप से एक ही सटीकता के लिए यह अनंत गुना सस्ता है।
00:03:16और जब हम Frontier Code 1.1 को देखते हैं, तो हमें एक समान पैटर्न दिखाई देता है, जहाँ उच्च स्तर पर, हमें समान स्कोर मिल रहे हैं।
00:03:22जब हम GPT-6 की तुलना Fable 5.1 या Fable 5 से करते हैं। इस मामले में, Fable 5 ने वास्तव में यहाँ उच्च स्कोर किया था।
00:03:29लेकिन GPT-6 Astra के साथ टोकन दक्षता के कारण इन क्लाउड मॉडलों को चलाना बहुत अधिक महंगा है।
00:03:34अब, बेंचमार्क से परे कुछ ऐसी कार्यक्षमताएँ हैं जिनका ओपनएआई GPT-6 के संबंध में उल्लेख करता है। पहली यह है कि वे इसे
00:03:39दुनिया का सबसे अच्छा कंप्यूटर उपयोग मॉडल कह रहे हैं। अब, कुछ ऐसे बेंचमार्क हैं जो इस तरह की
00:03:43चीजों का परीक्षण करते हैं, जैसे एजेंट की अंतिम परीक्षा। और जैसा कि हमने अन्य बेंचमार्क के साथ देखा है, यह हमें क्या दिखाता है?
00:03:48यह दिखाता है कि Astra अपनी सटीकता और API लागत दोनों के मामले में कमाल कर रहा है, जिसे कभी भी नजरअंदाज नहीं किया जा सकता है।
00:03:52लेकिन शायद सटीकता से भी अधिक महत्वपूर्ण गति है। कोडेक वास्तव में वास्तव में अच्छा कंप्यूटर उपयोग है,
00:03:57खासकर यदि आप इसका उपयोग आवाज मोड के साथ करते हैं। और Astra को GPT-5.6 की तुलना में 1.9 गुना तेज माना जाता है,
00:04:01जो बहुत बढ़िया है यदि आप ऐसे व्यक्ति हैं जो पिछले एक महीने या इसके आसपास इसका बहुत अधिक उपयोग कर रहे हैं।
00:04:06दूसरी बात जिसका वे उल्लेख करते हैं वह है टेम्प्लेट का पालन करना। इसलिए यदि आप इसे किसी प्रकार का टेम्प्लेट देते हैं,
00:04:11मान लीजिए, स्लाइड डेक का, जैसा कि आप यहाँ बाईं ओर देखते हैं, और आप इससे किसी अन्य विषय के बारे में उसी फैशन में एक और स्लाइड डेक बनाने के लिए कहते हैं,
00:04:15तो आपको कुछ ऐसा मिलता है जैसा हम दाईं ओर देखते हैं, कुछ ऐसा जो शैली का बहुत, बहुत अच्छी तरह से पालन करता है।
00:04:20इसलिए यदि आपके पास किसी प्रकार का टेम्प्लेट है जिसका आप बार-बार उपयोग करते हैं, चाहे वह स्लाइड डेक के लिए हो या वेबसाइटों के लिए,
00:04:25इसे वास्तव में किसी भी प्रकार के आउटपुट के लिए एक डिजाइन प्रणाली के रूप में सोचें, GPT-6 इसके लिए बहुत बढ़िया है।
00:04:31आप इसे एक्सेल दस्तावेजों और सामान्य रूप से दस्तावेज़ स्टाइलिंग के साथ यहाँ फिर से देख सकते हैं।
00:04:35मूल रूप से यहाँ वह संदर्भ छवि थी जो इसे दी गई थी। यहाँ वह है जो हमें पहले मिलता था,
00:04:41और यहाँ वह है जो हमें उस संदर्भ छवि को देखने के बाद दाईं ओर मिलता है।
00:04:46एक अन्य दिलचस्प बात यह पंक्ति है जहाँ वे वेबसाइटों, लाभ, अनुप्रयोगों और प्रतिपादन निर्माण के लिए मजबूत दृश्य निर्णय लाने वाले GPT-6 Asher के बारे में बात करते हैं,
00:04:51यानी वे कह रहे हैं कि GPT-6 का स्वाद बेहतर है।
00:04:55और आपने शायद बार-बार सुना होगा कि एआई का कोई स्वाद नहीं होता है। ठीक है, वे कह रहे हैं कि, अच्छा, GPT-6 का है।
00:05:00अब, आइए ईमानदार रहें, जब एआई और स्वाद की बात आती है तो हमेशा समस्याएँ रहेंगी,
00:05:05क्योंकि यदि आप इसे एक खराब संकेत देते हैं, तो इसमें माध्य के प्रति किसी प्रकार का प्रतिगमन होने वाला है,
00:05:10चाहे कुछ भी हो जाए। और वह माध्य जो भी हो, लोग इसे एआई स्लोप के साथ जोड़ने जा रहे हैं,
00:05:15चाहे यह वास्तव में कितना भी अच्छा क्यों न हो। लेकिन वे यहाँ मूल रूप से अनरियल इंजन वॉकथ्रू जैसे कुछ उदाहरण दिखाते हैं,
00:05:20ब्लेंडर मॉडलिंग, साथ ही यहाँ कुछ स्थिर छवियां। अब, एक बहुत अच्छी बात जो वे Astra के साथ जोड़ रहे हैं,
00:05:25वह यह है कि संदर्भ विंडो भरने पर यह ऑटो कॉम्पैक्शन कैसे करता है, इसमें बदलाव है। अब, आमतौर पर आप अपनी संदर्भ विंडो भरते हैं,
00:05:31यह ऑटो कॉम्पैक्ट होने जा रहा है, यह उस अंतिम सत्र में आपके द्वारा बात की गई हर चीज का सारांश बनाने जा रहा है,
00:05:37और फिर एक नया सत्र शुरू करें। ठीक है, इससे समस्याएँ पैदा होती हैं, कभी-कभी यह विवरण छोड़ देता है।
00:05:41लेकिन अब, Astra केवल एक सारांश होने के बजाय संदर्भ खिड़कियों में नोट्स रखता है।
00:05:46तो एक दस्तावेज़ के बजाय, इसके पास अनिवार्य रूप से इस बारे में अलग-अलग चिपचिपे नोट्स का एक गुच्छा है कि यह क्या महत्वपूर्ण मानता है।
00:05:52और यह किसी भी समय उनका संदर्भ ले सकता है, बजाय इसके कि यह एक तरह का वन शॉट हो जैसे, यहाँ एक सारांश है, आशा है कि यह वह सब कुछ है जिसकी हमें आवश्यकता है।
00:05:57और वास्तव में, पहले के संदर्भ में खिड़कियाँ खोज योग्य बनी रहती हैं।
00:06:01बल्कि यह सिर्फ एक बार का सारांश होता है कि यह लीजिए सारांश, उम्मीद है यही सब चाहिए होगा।
00:06:06और वास्तव में, पिछले कॉन्टेक्स्ट विंडो खोजे जा सकते हैं। तो फिर से, ऐसा नहीं है कि यह
00:06:12लेकिन कुछ हफ्तों में यह डिफ़ॉल्ट बन जाएगा। अब, जब साइबर सुरक्षा की बात आती है,
00:06:16तो Astra इसे उसी तरह से मान रहा है जैसे एंथ्रोपिक Fable का इलाज करता है, जहाँ वे ऐसे हैं,
00:06:20यह मॉडल इतना शक्तिशाली है कि यह बहुत सारे शोषण पैदा कर सकता है। इसलिए यदि इसे लगता है कि आप किसी प्रकार का शोषण पैदा करने की कोशिश कर रहे हैं,
00:06:24तो यह आपको ऐसा करने की अनुमति नहीं दे रहा है। यह पालन नहीं करने जा रहा है,
00:06:28यह आपकी समस्या का उत्तर नहीं देने जा रहा है। 5 श्रृंखला की तुलना में GPT-6 में एक और बढ़िया सुधार
00:06:33कम मतिभ्रम दर है। GPT-5.6 Sol और सामान्य रूप से 5.6 मॉडल वास्तव में अन्य सीमा मॉडल की तुलना में काफी मतिभ्रम करते थे।
00:06:37फिर भी सिर से सिर मिलाकर, हम देखते हैं कि हम 9.4% जैसी किसी चीज से आगे निकल गए हैं।
00:06:42मतिभ्रम दर नीचे से नीचे 2% मतिभ्रम दर तक। क्या Astra उपलब्ध है?
00:06:48खैर, यह संगठनों के एक सीमित सेट के लिए खुला है। और अगले कुछ दिनों में, यह अनिवार्य रूप से सभी के लिए खुल जाएगा।
00:06:54जहाँ तक API का सवाल है, यह डेवलपर्स के लिए उपलब्ध है। और कीमत के संबंध में, फिर से,
00:07:01Fable मूल्य निर्धारण से मेल खाता है। हम प्रति मिलियन इनपुट टोकन $10 और प्रति मिलियन आउटपुट टोकन $50 देख रहे हैं।
00:07:06तो संख्याओं के आधार पर, ओपनएआई हमें एक बहुत ही ठोस मॉडल दे रहा है जो एंथ्रोपिक के सर्वश्रेष्ठ के साथ पूरी तरह से प्रतिस्पर्धा कर सकता है।
00:07:11और वे इसे कम कीमत पर कर रहे हैं। तो
00:07:17मैं इसे आजमाने के लिए बेहद उत्साहित हूँ। मुझे लगता है कि यहाँ सबसे बड़े खिलाड़ियों के बीच प्रतिस्पर्धा होना
00:07:22अंततः हम अंत उपयोगकर्ताओं के लिए बहुत बढ़िया है।
00:07:26मैं इसे आजमाने के लिए बेहद उत्साहित हूँ। मुझे लगता है कि यहाँ सबसे बड़े खिलाड़ियों के बीच प्रतिस्पर्धा
00:07:30आखिरकार हम अंतिम उपयोगकर्ताओं के लिए बहुत अच्छी है।