जीपीटी 6 एस्ट्रा आ गया है (और यह फेबल 5.1 से बेहतर है?)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00एंथ्रोपिक द्वारा Fable 5.1 जारी करने के ठीक बाद, ओपनएआई ने पलटवार किया और GPT-6 Astra जारी कर दिया।
00:00:07अब आइए GPT-6 Astra के कुछ बेंचमार्क देखकर इसकी शुरुआत करते हैं। और
00:00:10Fable 5.1 के साथ एंथ्रोपिक द्वारा दिखाए गए बेंचमार्क की तुलना में हमें देखने के लिए
00:00:14और अधिक बेंचमार्क देने के लिए ओपनएआई को धन्यवाद। जब कंप्यूटर के उपयोग की बात आती है,
00:00:19तो यह लगभग सभी मोर्चों पर आगे है। Fable 5.1 के मामले में हमारे पास यहाँ
00:00:24ज्यादा डेटा भी नहीं है। जब हम पेशेवर बेंचमार्क को देखते हैं, जैसे BenchCAD और browse comp,
00:00:31तो GPT-6 बेहतरीन प्रदर्शन करता है। यह केवल आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स में नहीं जीतता,
00:00:38जहाँ यह Fable 5.1 के 65.7 की तुलना में 61.2 अंक प्राप्त करता है। अगला,
00:00:43हमारे पास कोडिंग है। और फिर से, लगभग वही कहानी है। यह या तो Fable 5.1 को हरा रहा है या
00:00:49उसके बिल्कुल टक्कर में है। यदि हम विशेष रूप से TerminalBench 4.0 को देखें, तो हम GPT 5.6
00:00:55सोलो से 37.3 से बढ़कर 57.7 तक की एक भारी छलांग देखते हैं। और यदि हम DeepSuite को देखें,
00:01:02जो शायद मेरा पसंदीदा कोडिंग बेंचमार्क है, यह वास्तव में लंबे समय तक चलने वाले एजेंटिक कार्यों पर ध्यान केंद्रित करता है।
00:01:08यह 74.1% स्कोर करता है, जो फिर से वहाँ मौजूद बाकी सभी चीजों से बेहतर है। GPT-6
00:01:13अकादमिक बेंचमार्क के साथ-साथ विज्ञान और स्वास्थ्य वाले बेंचमार्क में भी शानदार प्रदर्शन करता है। और जब हम साइबर सुरक्षा बेंचमार्क पर नजर डालते हैं, तो फिर से, मैं वास्तव में यहाँ 5.6 सोलो पर ध्यान दे रहा हूँ।
00:01:22भारी छलांग, 78.5 से 100%। एक्सप्लॉइट बेंच पर 55.9 से लेकर 88.5% तक और फिर 39% तक। तो यह फाइव सीरीज मॉडल से एक बड़ा बदलाव है।
00:01:27और लंबे संदर्भ के मामले में, GPT-6 भी कमाल करता है। 256 से 512k टोकन से आठ सुई परीक्षण करते समय 100% स्कोर।
00:01:34तो संक्षेप में एक चौथाई से लेकर पूरी तरह से भरे हुए कॉन्टेक्स्ट विंडो तक। और फिर जब उस विंडो में 512,000 टोकन से एक मिलियन टोकन होते हैं,
00:01:41तो यह अभी भी 96.3% स्कोर करता है। इसलिए यदि आप ऐसे व्यक्ति हैं जो हमेशा अपने पसंदीदा AI मॉडल में ढेर सारा संदर्भ डालते रहते हैं,
00:01:46तो GPT-6 उन परिदृश्यों में वास्तव में बहुत अच्छा प्रदर्शन करने वाला है। लेकिन कच्चे बेंचमार्क स्कोर काफी नहीं हैं।
00:01:51हमें यह जानने की जरूरत है कि वास्तव में इन स्कोर को प्राप्त करने में कितना खर्च आता है,
00:01:55क्योंकि Astra का स्कोर दुनिया में सबसे अच्छा हो सकता है, लेकिन अगर इसकी कीमत बाकी सभी चीजों से 10 गुना अधिक है, तो क्या फायदा?
00:01:59अब, GPT मॉडल के लिए सौभाग्य से, ऐतिहासिक रूप से, वे बहुत अधिक टोकन कुशल रहे हैं। इसलिए जब हम यहाँ
00:02:04टर्मिनल बेंच 4.0 स्कोर को देखते हैं, तो हम देखते हैं कि यह बात सही साबित होती है। तो तारों वाले निशान के साथ GPT-6 Astra,
00:02:11सबसे पहली बात जो मैं नोट करना चाहता हूँ वह यह है कि इनमें से कई मॉडलों की तरह, जैसे-जैसे हम प्रयास स्तर की श्रृंखला में ऊपर जाते हैं,
00:02:16हमें दक्षता में थोड़ी गिरावट दिखाई देती है। इसलिए जब मैं निम्न से मध्यम और फिर उच्च पर जाता हूँ, तो मुझे
00:02:23थोड़ी रैखिक लागत वृद्धि पर बेहतर स्कोर मिलना जारी रहता है। लेकिन जैसे ही मैं उच्च से अत्यधिक उच्च और फिर अधिकतम पर जाता हूँ,
00:02:30वास्तव में मुझे अधिक लागत पर खराब स्कोर मिल रहा है। इसलिए $7.21 पर उच्च स्तर पर, मुझे
00:02:3957.9% सटीकता मिल रही है। जब मैं इसकी तुलना यहाँ Fable 5.1 से करता हूँ, और मैं उच्च स्तर पर हूँ, तो मुझे $10.50 पर 49.4%
00:02:49सटीकता मिल रही है। तो यह अधिक महंगा है, और इसका स्कोर इतना अच्छा नहीं है। अब, जब मैं इसे अधिकतम प्रयास 55.8 पर सेट करता हूँ,
00:02:57तो Fable वास्तव में काफी उच्च स्कोर करता है, लेकिन इसके लिए मुझे $19.50 खर्च करने पड़ रहे हैं। तो एक ही स्कोर के लिए,
00:03:06फिर से, लगभग 55%, यह Fable 5 का लगभग $20 है। और GPT-6 Astra के लिए, यह $7.20 है। तो अनिवार्य रूप से एक ही सटीकता के लिए यह अनंत गुना सस्ता है।
00:03:16और जब हम Frontier Code 1.1 को देखते हैं, तो हमें एक समान पैटर्न दिखाई देता है, जहाँ उच्च स्तर पर, हमें समान स्कोर मिल रहे हैं।
00:03:22जब हम GPT-6 की तुलना Fable 5.1 या Fable 5 से करते हैं। इस मामले में, Fable 5 ने वास्तव में यहाँ उच्च स्कोर किया था।
00:03:29लेकिन GPT-6 Astra के साथ टोकन दक्षता के कारण इन क्लाउड मॉडलों को चलाना बहुत अधिक महंगा है।
00:03:34अब, बेंचमार्क से परे कुछ ऐसी कार्यक्षमताएँ हैं जिनका ओपनएआई GPT-6 के संबंध में उल्लेख करता है। पहली यह है कि वे इसे
00:03:39दुनिया का सबसे अच्छा कंप्यूटर उपयोग मॉडल कह रहे हैं। अब, कुछ ऐसे बेंचमार्क हैं जो इस तरह की
00:03:43चीजों का परीक्षण करते हैं, जैसे एजेंट की अंतिम परीक्षा। और जैसा कि हमने अन्य बेंचमार्क के साथ देखा है, यह हमें क्या दिखाता है?
00:03:48यह दिखाता है कि Astra अपनी सटीकता और API लागत दोनों के मामले में कमाल कर रहा है, जिसे कभी भी नजरअंदाज नहीं किया जा सकता है।
00:03:52लेकिन शायद सटीकता से भी अधिक महत्वपूर्ण गति है। कोडेक वास्तव में वास्तव में अच्छा कंप्यूटर उपयोग है,
00:03:57खासकर यदि आप इसका उपयोग आवाज मोड के साथ करते हैं। और Astra को GPT-5.6 की तुलना में 1.9 गुना तेज माना जाता है,
00:04:01जो बहुत बढ़िया है यदि आप ऐसे व्यक्ति हैं जो पिछले एक महीने या इसके आसपास इसका बहुत अधिक उपयोग कर रहे हैं।
00:04:06दूसरी बात जिसका वे उल्लेख करते हैं वह है टेम्प्लेट का पालन करना। इसलिए यदि आप इसे किसी प्रकार का टेम्प्लेट देते हैं,
00:04:11मान लीजिए, स्लाइड डेक का, जैसा कि आप यहाँ बाईं ओर देखते हैं, और आप इससे किसी अन्य विषय के बारे में उसी फैशन में एक और स्लाइड डेक बनाने के लिए कहते हैं,
00:04:15तो आपको कुछ ऐसा मिलता है जैसा हम दाईं ओर देखते हैं, कुछ ऐसा जो शैली का बहुत, बहुत अच्छी तरह से पालन करता है।
00:04:20इसलिए यदि आपके पास किसी प्रकार का टेम्प्लेट है जिसका आप बार-बार उपयोग करते हैं, चाहे वह स्लाइड डेक के लिए हो या वेबसाइटों के लिए,
00:04:25इसे वास्तव में किसी भी प्रकार के आउटपुट के लिए एक डिजाइन प्रणाली के रूप में सोचें, GPT-6 इसके लिए बहुत बढ़िया है।
00:04:31आप इसे एक्सेल दस्तावेजों और सामान्य रूप से दस्तावेज़ स्टाइलिंग के साथ यहाँ फिर से देख सकते हैं।
00:04:35मूल रूप से यहाँ वह संदर्भ छवि थी जो इसे दी गई थी। यहाँ वह है जो हमें पहले मिलता था,
00:04:41और यहाँ वह है जो हमें उस संदर्भ छवि को देखने के बाद दाईं ओर मिलता है।
00:04:46एक अन्य दिलचस्प बात यह पंक्ति है जहाँ वे वेबसाइटों, लाभ, अनुप्रयोगों और प्रतिपादन निर्माण के लिए मजबूत दृश्य निर्णय लाने वाले GPT-6 Asher के बारे में बात करते हैं,
00:04:51यानी वे कह रहे हैं कि GPT-6 का स्वाद बेहतर है।
00:04:55और आपने शायद बार-बार सुना होगा कि एआई का कोई स्वाद नहीं होता है। ठीक है, वे कह रहे हैं कि, अच्छा, GPT-6 का है।
00:05:00अब, आइए ईमानदार रहें, जब एआई और स्वाद की बात आती है तो हमेशा समस्याएँ रहेंगी,
00:05:05क्योंकि यदि आप इसे एक खराब संकेत देते हैं, तो इसमें माध्य के प्रति किसी प्रकार का प्रतिगमन होने वाला है,
00:05:10चाहे कुछ भी हो जाए। और वह माध्य जो भी हो, लोग इसे एआई स्लोप के साथ जोड़ने जा रहे हैं,
00:05:15चाहे यह वास्तव में कितना भी अच्छा क्यों न हो। लेकिन वे यहाँ मूल रूप से अनरियल इंजन वॉकथ्रू जैसे कुछ उदाहरण दिखाते हैं,
00:05:20ब्लेंडर मॉडलिंग, साथ ही यहाँ कुछ स्थिर छवियां। अब, एक बहुत अच्छी बात जो वे Astra के साथ जोड़ रहे हैं,
00:05:25वह यह है कि संदर्भ विंडो भरने पर यह ऑटो कॉम्पैक्शन कैसे करता है, इसमें बदलाव है। अब, आमतौर पर आप अपनी संदर्भ विंडो भरते हैं,
00:05:31यह ऑटो कॉम्पैक्ट होने जा रहा है, यह उस अंतिम सत्र में आपके द्वारा बात की गई हर चीज का सारांश बनाने जा रहा है,
00:05:37और फिर एक नया सत्र शुरू करें। ठीक है, इससे समस्याएँ पैदा होती हैं, कभी-कभी यह विवरण छोड़ देता है।
00:05:41लेकिन अब, Astra केवल एक सारांश होने के बजाय संदर्भ खिड़कियों में नोट्स रखता है।
00:05:46तो एक दस्तावेज़ के बजाय, इसके पास अनिवार्य रूप से इस बारे में अलग-अलग चिपचिपे नोट्स का एक गुच्छा है कि यह क्या महत्वपूर्ण मानता है।
00:05:52और यह किसी भी समय उनका संदर्भ ले सकता है, बजाय इसके कि यह एक तरह का वन शॉट हो जैसे, यहाँ एक सारांश है, आशा है कि यह वह सब कुछ है जिसकी हमें आवश्यकता है।
00:05:57और वास्तव में, पहले के संदर्भ में खिड़कियाँ खोज योग्य बनी रहती हैं।
00:06:01बल्कि यह सिर्फ एक बार का सारांश होता है कि यह लीजिए सारांश, उम्मीद है यही सब चाहिए होगा।
00:06:06और वास्तव में, पिछले कॉन्टेक्स्ट विंडो खोजे जा सकते हैं। तो फिर से, ऐसा नहीं है कि यह
00:06:12लेकिन कुछ हफ्तों में यह डिफ़ॉल्ट बन जाएगा। अब, जब साइबर सुरक्षा की बात आती है,
00:06:16तो Astra इसे उसी तरह से मान रहा है जैसे एंथ्रोपिक Fable का इलाज करता है, जहाँ वे ऐसे हैं,
00:06:20यह मॉडल इतना शक्तिशाली है कि यह बहुत सारे शोषण पैदा कर सकता है। इसलिए यदि इसे लगता है कि आप किसी प्रकार का शोषण पैदा करने की कोशिश कर रहे हैं,
00:06:24तो यह आपको ऐसा करने की अनुमति नहीं दे रहा है। यह पालन नहीं करने जा रहा है,
00:06:28यह आपकी समस्या का उत्तर नहीं देने जा रहा है। 5 श्रृंखला की तुलना में GPT-6 में एक और बढ़िया सुधार
00:06:33कम मतिभ्रम दर है। GPT-5.6 Sol और सामान्य रूप से 5.6 मॉडल वास्तव में अन्य सीमा मॉडल की तुलना में काफी मतिभ्रम करते थे।
00:06:37फिर भी सिर से सिर मिलाकर, हम देखते हैं कि हम 9.4% जैसी किसी चीज से आगे निकल गए हैं।
00:06:42मतिभ्रम दर नीचे से नीचे 2% मतिभ्रम दर तक। क्या Astra उपलब्ध है?
00:06:48खैर, यह संगठनों के एक सीमित सेट के लिए खुला है। और अगले कुछ दिनों में, यह अनिवार्य रूप से सभी के लिए खुल जाएगा।
00:06:54जहाँ तक API का सवाल है, यह डेवलपर्स के लिए उपलब्ध है। और कीमत के संबंध में, फिर से,
00:07:01Fable मूल्य निर्धारण से मेल खाता है। हम प्रति मिलियन इनपुट टोकन $10 और प्रति मिलियन आउटपुट टोकन $50 देख रहे हैं।
00:07:06तो संख्याओं के आधार पर, ओपनएआई हमें एक बहुत ही ठोस मॉडल दे रहा है जो एंथ्रोपिक के सर्वश्रेष्ठ के साथ पूरी तरह से प्रतिस्पर्धा कर सकता है।
00:07:11और वे इसे कम कीमत पर कर रहे हैं। तो
00:07:17मैं इसे आजमाने के लिए बेहद उत्साहित हूँ। मुझे लगता है कि यहाँ सबसे बड़े खिलाड़ियों के बीच प्रतिस्पर्धा होना
00:07:22अंततः हम अंत उपयोगकर्ताओं के लिए बहुत बढ़िया है।
00:07:26मैं इसे आजमाने के लिए बेहद उत्साहित हूँ। मुझे लगता है कि यहाँ सबसे बड़े खिलाड़ियों के बीच प्रतिस्पर्धा
00:07:30आखिरकार हम अंतिम उपयोगकर्ताओं के लिए बहुत अच्छी है।

핵심 요약

OpenAI ने GPT-6 Astra को लॉन्च किया है जो अधिकांश बेंचमार्क और लागत दक्षता में Fable 5.1 से बेहतर प्रदर्शन करता है।

하이라이트

  • GPT-6 Astra ने BenchCAD और browse comp जैसे पेशेवर बेंचमार्क में Fable 5.1 को पीछे छोड़ दिया है।

  • TerminalBench 4.0 में GPT-6 Astra ने 57.7% स्कोर प्राप्त किया है, जबकि DeepSuite में यह 74.1% पर पहुँच गया है।

  • साइबर सुरक्षा के एक्सप्लॉइट बेंच पर स्कोर 55.9% से बढ़कर 88.5% हो गया है।

  • GPT-6 Astra की गति GPT-5.6 की तुलना में 1.9 गुना अधिक तेज है।

  • प्रति मिलियन इनपुट टोकन की कीमत $10 और आउटपुट टोकन की कीमत $50 है।

타임라인

बेंचमार्क और प्रदर्शन तुलना

  • GPT-6 Astra ने कंप्यूटर उपयोग और पेशेवर बेंचमार्क में बढ़त बनाई है।
  • कोडिंग बेंचमार्क जैसे DeepSuite में यह 74.1% स्कोर दर्ज करता है।
  • लंबे संदर्भ परीक्षणों में यह 512k से एक मिलियन टोकन तक 96.3% सटीकता बनाए रखता है।

एंथ्रोपिक द्वारा Fable 5.1 जारी करने के बाद OpenAI ने GPT-6 Astra पेश किया है। यह कंप्यूटर उपयोग, कोडिंग और अकादमिक बेंचमार्क में बेहतर परिणाम दिखाता है। विशेष रूप से लंबे संदर्भ और साइबर सुरक्षा परीक्षणों में यह मॉडल पिछले संस्करणों की तुलना में काफी मजबूत साबित हुआ है।

लागत दक्षता और मूल्य निर्धारण

  • उच्च प्रयास स्तर पर GPT-6 Astra कम खर्च में समान सटीकता प्रदान करता है।
  • Fable 5.1 की तुलना में यह मॉडल टोकन दक्षता के मामले में अधिक किफायती है।
  • API मूल्य निर्धारण के तहत इनपुट टोकन $10 प्रति मिलियन और आउटपुट टोकन $50 प्रति मिलियन हैं।

कच्चे बेंचमार्क स्कोर के साथ-साथ टोकन लागत का विश्लेषण महत्वपूर्ण है। उच्च प्रयास स्तर पर Fable 5.1 की तुलना में GPT-6 Astra कम लागत में बेहतर या सामान सटीकता देता है। इससे डेवलपर्स को क्लाउड मॉडल चलाने में वित्तीय लाभ मिलता है।

कार्यक्षमता और नई सुविधाएँ

  • GPT-6 Astra पिछले मॉडल की तुलना में 1.9 गुना तेज गति से काम करता है।
  • संदर्भ विंडो भरने पर यह ऑटो कॉम्पैक्शन के बजाय नोट्स को सुरक्षित रखता है।
  • मतिभ्रम दर घटकर नीचे से नीचे 2% तक पहुँच गई है।

यह मॉडल उत्कृष्ट कंप्यूटर उपयोग और टेम्प्लेट पालन क्षमता प्रदान करता है। संदर्भ विंडो प्रबंधन में सुधार के कारण यह पुराने सत्रों के महत्वपूर्ण बिंदुओं को चिपचिपे नोट्स के रूप में सहेजता है। इसके अलावा, इसकी मतिभ्रम दर में भारी कमी आई है और यह चुनिंदा संगठनों तथा डेवलपर्स के लिए उपलब्ध है।

커뮤니티 글

모든 글 보기