GPT 6 Astra وصل (وهو أفضل من Fable 5.1؟)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00إذن، مباشرة بعد أن أصدرت شركة أنثروبيك نموذج Fable 5.1، ردت OpenAI بإصدار GPT-6 Astra.
00:00:07والآن لنبدأ بالنظر إلى بعض معايير الأداء لنموذج GPT-6 Astra. وتحية لـ
00:00:10OpenAI لمنحنا معايير أكثر بكثير لنظريها مقارنة بما عرضته علينا أنثروبيك مع Fable
00:00:145.1. عندما يتعلق الأمر باستخدام الكمبيوتر، فهو يكتساح المجال تماماً. ليس لدينا حتى الكثير من البيانات
00:00:19هنا عندما يتعلق الأمر بـ Fable 5.1. عندما ننظر إلى المعايير المهنية، أشياء مثل BenchCAD
00:00:24و browse comp. مرة أخرى، يؤدي GPT-6 بشكل مذهل. المكان الوحيد الذي لا يفوز فيه هو
00:00:31مؤشر التحليل الاصطناعي للذكاء، حيث يحصل على 61.2 مقارنة بـ Fable 5.1 الذي حقق 65.7.
00:00:38بعد ذلك، لدينا البرمجة. ومرة أخرى، نفس القصة نوعاً ما. إنه إما يتفوق على Fable 5.1 أو
00:00:43يتعادل معه. إذا نظرت على وجه تحديد إلى TerminalBench 4.0، فنرى قفزة هائلة من GPT 5.6 solo
00:00:49من 37.3 إلى 57.7. وإذا نظرنا إلى DeepSuite، وهو على الأرجح معيار البرمجة المفضل لدي
00:00:55فهو يركز حقاً على مهام الوكلاء طويلة الأمد. يحصل على 74.1%، وهو مرة أخرى,
00:01:02أفضل من أي شيء آخر موجود. كما يسحق GPT-6 المعايير الأكاديمية وكذلك معايير
00:01:08العلوم والصحة. وعندما نلقي نظرة على معايير الأمن السيبراني، مرة أخرى، أنا أهتم حقاً
00:01:13بـ 5.6 solo هنا. قفزات هائلة، من 78.5 إلى 100%. ومن 55.9 وصولاً إلى 88. و 5.5% في اختبار الثغرات
00:01:22ليصل إلى 39%. إذن هذه نقلة نوعية عن نماذج السلسلة خمسة. وفيما يتعلق
00:01:27بالسياق الطويل، يتألق GPT-6 بشكل كبير أيضاً. نسبة نجاح 100% عند إجراء اختبار الإبرة الثمانية من 256 إلى 512 ألف
00:01:34رمز (توكن). أي أساساً ربع إلى نافذة سياق ممتلئة تماماً. وعندما تحتوي تلك النافذة على 512,000
00:01:41رمز وصولاً إلى مليون، فإنه لا يزال يحقق 96.3%. لذا إذا كنت شخصاً يلقي دائماً بالكثير من
00:01:46السياق على نموذج الذكاء الاصطناعي المفضل لديك، فسوف يؤدي GPT-6 بشكل جيد حقاً في تلك السيناريو هات. لكن نتائج
00:01:51المعايير الخام ليست كافية. نحتاج إلى معرفة التكلفة الفعلي لتحقيق هذه النتائج
00:01:55لأن Astra قد يمتلك أفضل نتيجة في العالم، ولكن إذا كان يكلف 10 أضعاف أي شيء آخر، فما الفائدة
00:01:59من ذلك؟ الآن، لحسن الحظ بالنسبة لنماذج GPT، تاريخياً، كانت كفاءتها في استخدام الرموز عالية جداً. لذا عندما ننظر
00:02:04هنا إلى نتيجة terminal bench 4.0، نرى أن ذلك يتحقق نوعاً ما. إذن GPT-6 Astra هنا مع النجوم،
00:02:11أول شيء أود ملاحظته هو أنه مثل العديد من هذه النماذج، نرى نوعاً من الانخفاض في الكفاءة
00:02:16كلما صعدنا إلى أعلى في سلسلة مستوى الجهد. لذا عندما أتحرك من المنخفض إلى المتوسط إلى العالي، أستمر في الحصول على
00:02:23نتائج أفضل بزيادة تكلفة خطية نوعاً ما. ولكن عندما أنتقل من العالي إلى العالي جداً، ثم الحد الأقصى
00:02:30في الواقع، أحصل على نتيجة أسوأ بتكلفة أعلى. لذا عند المستوى العالي مقابل 7.21 دولار، أحصل على
00:02:39دقة بنسبة 57.9%. عندما أقارن هذا بـ Fable 5.1 هنا، وأنا على المستوى العالي، حسنًا، أحصل على دقة بنسبة 49.4%
00:02:49بتكلفة 10.50 دولار. إذن فهو أكثر تكلفة، ولا يحقق نتائج جيدة بنفس القدر. الآن، يحقق Fable نتائج عالية جداً
00:02:57عندما أضعه على أقصى مستوى جهد 55.8، لكنه يكلفني 19.50 دولاراً. لذا مقابل نفس النتيجة،
00:03:06مرة أخرى، حوالي 55%، يكلف الأمر ما يقارب 20 دولاراً لـ Fable 5. وبالنسبة لـ GPT-6 Astra، فهو 7.20 دولار. إذن فهو أرخص بشكل لا يُقارن
00:03:16لنفس الدقة أساساً. وعندما ننظر إلى Frontier Code 1.1، نرى نمطاً مشابهاً،
00:03:22حيث في المستويات العليا، نحصل على نتائج متشابهة. عندما ننظر إلى GPT-6 مقارنة بـ Fable 5.1
00:03:29أو Fable 5. في هذه الحالة، سجل Fable 5 في الواقع نتيجة أعلى هنا. ولكنه أكثر تكلفة بكثير
00:03:34لتشغيل هذه النماذج السحابية نظراً لكفاءة الرموز مع GPT-6 Astra. الآن، هناك القليل من الميزات
00:03:39بخلاف المعايير التي تبرزها OpenAI عندما يتعلق الأمر بـ GPT-6. الأولى هي أنهم يطلقون عليه
00:03:43أفضل نموذج لاستخدام الكمبيوتر في العالم. الآن، هناك عدد قليل من المعايير التي تختبر هذا النوع من
00:03:48الأشياء، مثل اختبار الوكيل الأخير. ومثلما رأينا مع المعايير الأخرى، ماذا يظهر لنا
00:03:52هذا؟ يظهر أن Astra يكتساح الأمر نوعاً ما، سواء من حيث دقته أو تكاليف واجهة برمجة التطبيقات (API)، والتي لا يمكن
00:03:57الاستخفاف بها أبداً. ولكن ربما الأهم من الدقة هو السرعة. في الواقع، يعتبر Codex جيداً جداً في استخدام الكمبيوتر
00:04:01خاصة إذا استخدمته جنباً إلى جنب مع وضع الصوت. ومن المفترض أن يكون Astra
00:04:06أسرع بـ 1.9 مرة من GPT-5.6، وهو أمر رائع إذا كنت شخصاً استخدم ذلك كثيراً
00:04:11خلال الشهر الماضي أو نحو ذلك. الشيء الآخر الذي يبرزونه هو الالتزام بالقوالب. لذا إذا أعطيته
00:04:15نوعاً ما من القوالب لعرض تقديمي مثلاً، كما ترى هنا على اليسار، وطلبت منه
00:04:20إنشاء عرض تقديمي آخر بنفس الطريقة حول موضوع مختلف، حسنًا، ستصل إلى شيء
00:04:25مثل ما نراه على اليمين، شيئاً يلتزم بالأسلوب بشكل جيد جداً. لذا إذا كان لديك نوع ما
00:04:31من القوالب التي تستخدمها مراراً وتكراراً، سواء كان لعروض تقديمية أو مواقع ويب، فكر في الأمر باعتباره
00:04:35نظام تصميم لأي نوع من المخرجات حقاً، وGPT-6 رائع في ذلك. ويمكنك رؤية ذلك مرة أخرى هنا مع
00:04:41مستندات إكسل وتصميم المستندات بشكل عام. هنا كانت أساساً الصورة المرجعية التي أعطيت له.
00:04:46إليك ما سنحصل عليه سابقاً، وإليك ما نحصل عليه على اليمين لاحقاً بعد نظره إلى تلك
00:04:51الصورة المرجعية. الشيء الآخر المثير للاهتمام هو هذا السطر هنا حيث يتحدثون عن GPT-6 Asher
00:04:55وهو يجلب حكماً بصرياً أقوى لمواقع الويب، والألعاب، والتطبيقات، والعرض المبني، أي أنهم
00:05:00يقولون إن GPT-6 يتمتع بذوق أفضل. وربما سمعت مراراً وتكراراً أن الذكاء الاصطناعي ليس لديه ذوق.
00:05:05حسنًا، إنهم يقولون إن GPT-6 لديه ذوق. الآن لنكن صادقين، سيكون هناك دائماً مشكلات عندما يتعلق الأمر
00:05:10بالذكاء الاصطناعي والذوق، لأنه إذا أعطيته أمراً سيئاً، فسوف يحدث نوع من الانحدار
00:05:15نحو المتوسط، بغض النظر عن أي شيء. ومهما كان هذا المتوسط، سيربط الناس ذلك بهراء الذكاء الاصطناعي
00:05:20مهما كان جيداً حقاً. لكنهم يعرضون بعض الأمثلة هنا تشبه أساساً جولة تجول في محرك Unreal
00:05:25قاموا بها، ونمذجة Blender، فضلاً عن بعض الصور الثابتة هنا. الآن، الشيء الرائع حقاً
00:05:31الذي يضيفونه مع Astra هو تغييرات على كيفية إجرائه للضغط التلقائي عندما تمتلئ نافذة السياق. الآن،
00:05:37عادةً عندما تملأ نافذة السياق الخاصة بك، سيتم ضغطها تلقائياً، وسوف تنشئ ملخصاً
00:05:41لكل ما كنت تتحدث عنه في الجلسة الأخيرة، ثم تبدأ جلسة جديدة. حسنًا،
00:05:46هذا يخلق مشكلات، وأحياناً يتجاهل التفاصيل. ولكن الآن، يحتفظ Astra بالملاحظات عبر نوافذ السياق
00:05:52بدلاً من مجرد امتلاك ملخص واحد. لذا بدلاً من مستند واحد، لديه أساساً مجموعة
00:05:57من الملاحظات اللاصقة المختلفة حول ما يعتقد أنه مهم. ويمكنه الرجوع إلى تلك في أي وقت
00:06:01بدلاً من أن يكون الأمر مجرد محاولة لمرة واحدة مثل: إليك ملخص، نأمل أن يكون هذا كل ما نحتاجه.
00:06:06في الواقع، تظل نوافذ السياق السابقة قابلة للبحث. إذن مرة أخرى، ليس الأمر وكأن هذا هو
00:06:12المستند الوحيد لدينا من حيث الملخص. وإذا لم يكن موجوداً هنا، فنحن في ورطة. لم يعد الأمر كذلك
00:06:16بعد الآن. الآن، هذه ميزة تجريبية. لذا سيتعين عليك تمكينها في إعدادات codex
00:06:20ولكنها ستصبح الوضع الافتراضي في غضون بأسابيع قليلة. الآن، عندما يتعلق الأمر بالأمن السيبراني،
00:06:24يتعامل Astra مع هذا بشكل مشابه لكيفية تعامل أنثروبيك مع Fable، حيث يقولون: هذا النموذج قوي جداً
00:06:28لدرجة أنه يمكنه إنشاء الكثير من الثغرات. لذا إذا كان يعتقد أنك تحاول إنشاء نوع ما من الثغرات
00:06:33فلن يسمح لك بذلك ببساطة. لن يلتزم، ولن يجيب على مشكلتك.
00:06:37تحسن كبير آخر في GPT-6 مقارنة بسلسلة 5 وهو انخفاض معدل الهلوسة.
00:06:42GPT-5.6 Sol ونماذج 5.6 بشكل عام كانت تهلوس كثيراً مقارنة
00:06:48بالنماذج الرائدة الأخرى. ومع ذلك، جنباً إلى جنب، نرى أننا انتقلنا من شيء مثل معدل هلوسة بنسبة 9.4%
00:06:54وصولاً إلى معدل هلوسة بنسبة 2%. والآن هل Astra متاح؟ حسنًا،
00:07:01هو مفتوح لمجموعة محدودة من المؤسسات. وفي الأيام القليلة القادمة، سيكون متاحاً أساساً
00:07:06للجميع. أما بالنسبة لواجهة برمجة التطبيقات (API)، فهي متاحة للمطورين. وفيما يتعلق بالسعر، مرة أخرى،
00:07:11يطابق تسعير Fable. نحن ننظر إلى 10 دولارات لكل مليون رمز إدخال و50 دولاراً لكل مليون رمز إخراج.
00:07:17إذن بناءً على الأرقام، تمنحنا OpenAI نموذجاً قوياً للغاية يمكنه المنافسة تماماً
00:07:22مع أفضل ما لدى أنثروبيك. وهم يفعلون ذلك بسعر أقل. لذا
00:07:26أنا متحمس جداً لتجربة هذا. أعتقد أن وجود منافسة بين أكبر اللاعبين هنا
00:07:30هو أمر رائع في النهاية بالنسبة لنا نحن المستخدمين النهائيين.

핵심 요약

يقدم نموذج GPT-6 Astra أداءً متفوقاً في البرمجة واستخدام الكمبيوتر مع تكلفة تشغيل أقل ومعدل هلوسة منخفض يبلغ 2%.

하이라이트

  • يتفوق نموذج GPT-6 Astra على النماذج السابقة في اختبارات البرمجة والأمن السيبراني، مسجلاً 100% في بعض معايير الأمن السيبراني.

  • يحقق نموذج GPT-6 نسبة نجاح 100% في اختبار الإبرة ضمن نافذة سياق تتراوح بين 256 ألف و512 ألف رمز.

  • ينخفض معدل هلوسة النموذج من 9.4% في الإصدارات السابقة إلى 2% في GPT-6 Astra.

  • يبلغ تسعير واجهة برمجة التطبيقات لـ GPT-6 Astra 10 دولارات لكل مليون رمز إدخال و50 دولاراً لكل مليون رمز إخراج.

  • يوفر Astra ميزة الاحتفاظ بالملاحظات عبر نوافذ السياق المتعددة بدلاً من الاعتماد على ملخص أحادي.

타임라인

معايير الأداء والقدرات التقنية

  • يتفوق GPT-6 Astra على النماذج المنافسة في معايير الاستخدام الحاسوبي والمهني.
  • يسجل النموذج قفزة هائلة في معيار TerminalBench 4.0 ليصل إلى 57.7.
  • يحقق نسبة نجاح 100% في اختبار الإبرة لسياق يصل إلى 512 ألف رمز.

يعرض النموذج تفوقاً واضحاً في معايير البرمجة والأمن السيبراني والعلوم. يرتفع الأداء في مهام الوكلاء طويلة الأمد مع معيار DeepSuite ليصل إلى 74.1%. كما يتعامل مع السياقات الطويلة بكفاءة عالية للغاية.

كفاءة التكلفة ومقارنة الأسعار

  • ترتبط كفاءة الرموز بمستوى الجهد المطلوب للنموذج.
  • يحقق GPT-6 Astra دقة أعلى بتكلفة أقل مقارنة بالمنافسين مثل Fable 5.1.
  • تبلغ تكلفة الدقة العالية لـ GPT-6 Astra مبلغ 7.21 دولار مقارنة بـ 10.50 دولار للنماذج الأخرى.

تحلل هذه القسم تكلفة التشغيل الفعلي مقابل النتائج المحققة. يوضح تحليل الأداء أن زيادة مستوى الجهد إلى الحد الأقصى تؤدي أحياناً إلى نتائج أسوأ بتكلفة أعلى، بينما يحافظ Astra على كفاءة ممتازة في التكلفة.

الميزات الجديدة وإدارة السياق

  • يتميز Astra بسرعات أعلى بـ 1.9 مرة مقارنة بالإصدارات السابقة.
  • يحتفظ النموذج بالملاحظات عبر نوافذ السياق بدلاً من الاعتماد على ملخص أحادي.
  • ينخفض معدل الهلوسة إلى 2% مقارنة بـ 9.4% في النماذج السابقة.

تتضمن الميزات الجديدة التزاماً قوياً بالقوالب وتصميم المستندات، وتحسناً في الحكم البصري للتطبيقات والألعاب. كما يتميز النظام بتغييرات جذرية في الضغط التلقائي لنافذة السياق عبر الاحتفاظ بملاحظات متعددة بدلاً من ملخص واحد.

커뮤니티 글

모든 글 보기