스크립트
00:00:00إذن، مباشرة بعد أن أصدرت شركة أنثروبيك نموذج Fable 5.1، ردت OpenAI بإصدار GPT-6 Astra.
00:00:07والآن لنبدأ بالنظر إلى بعض معايير الأداء لنموذج GPT-6 Astra. وتحية لـ
00:00:10OpenAI لمنحنا معايير أكثر بكثير لنظريها مقارنة بما عرضته علينا أنثروبيك مع Fable
00:00:145.1. عندما يتعلق الأمر باستخدام الكمبيوتر، فهو يكتساح المجال تماماً. ليس لدينا حتى الكثير من البيانات
00:00:19هنا عندما يتعلق الأمر بـ Fable 5.1. عندما ننظر إلى المعايير المهنية، أشياء مثل BenchCAD
00:00:24و browse comp. مرة أخرى، يؤدي GPT-6 بشكل مذهل. المكان الوحيد الذي لا يفوز فيه هو
00:00:31مؤشر التحليل الاصطناعي للذكاء، حيث يحصل على 61.2 مقارنة بـ Fable 5.1 الذي حقق 65.7.
00:00:38بعد ذلك، لدينا البرمجة. ومرة أخرى، نفس القصة نوعاً ما. إنه إما يتفوق على Fable 5.1 أو
00:00:43يتعادل معه. إذا نظرت على وجه تحديد إلى TerminalBench 4.0، فنرى قفزة هائلة من GPT 5.6 solo
00:00:49من 37.3 إلى 57.7. وإذا نظرنا إلى DeepSuite، وهو على الأرجح معيار البرمجة المفضل لدي
00:00:55فهو يركز حقاً على مهام الوكلاء طويلة الأمد. يحصل على 74.1%، وهو مرة أخرى,
00:01:02أفضل من أي شيء آخر موجود. كما يسحق GPT-6 المعايير الأكاديمية وكذلك معايير
00:01:08العلوم والصحة. وعندما نلقي نظرة على معايير الأمن السيبراني، مرة أخرى، أنا أهتم حقاً
00:01:13بـ 5.6 solo هنا. قفزات هائلة، من 78.5 إلى 100%. ومن 55.9 وصولاً إلى 88. و 5.5% في اختبار الثغرات
00:01:22ليصل إلى 39%. إذن هذه نقلة نوعية عن نماذج السلسلة خمسة. وفيما يتعلق
00:01:27بالسياق الطويل، يتألق GPT-6 بشكل كبير أيضاً. نسبة نجاح 100% عند إجراء اختبار الإبرة الثمانية من 256 إلى 512 ألف
00:01:34رمز (توكن). أي أساساً ربع إلى نافذة سياق ممتلئة تماماً. وعندما تحتوي تلك النافذة على 512,000
00:01:41رمز وصولاً إلى مليون، فإنه لا يزال يحقق 96.3%. لذا إذا كنت شخصاً يلقي دائماً بالكثير من
00:01:46السياق على نموذج الذكاء الاصطناعي المفضل لديك، فسوف يؤدي GPT-6 بشكل جيد حقاً في تلك السيناريو هات. لكن نتائج
00:01:51المعايير الخام ليست كافية. نحتاج إلى معرفة التكلفة الفعلي لتحقيق هذه النتائج
00:01:55لأن Astra قد يمتلك أفضل نتيجة في العالم، ولكن إذا كان يكلف 10 أضعاف أي شيء آخر، فما الفائدة
00:01:59من ذلك؟ الآن، لحسن الحظ بالنسبة لنماذج GPT، تاريخياً، كانت كفاءتها في استخدام الرموز عالية جداً. لذا عندما ننظر
00:02:04هنا إلى نتيجة terminal bench 4.0، نرى أن ذلك يتحقق نوعاً ما. إذن GPT-6 Astra هنا مع النجوم،
00:02:11أول شيء أود ملاحظته هو أنه مثل العديد من هذه النماذج، نرى نوعاً من الانخفاض في الكفاءة
00:02:16كلما صعدنا إلى أعلى في سلسلة مستوى الجهد. لذا عندما أتحرك من المنخفض إلى المتوسط إلى العالي، أستمر في الحصول على
00:02:23نتائج أفضل بزيادة تكلفة خطية نوعاً ما. ولكن عندما أنتقل من العالي إلى العالي جداً، ثم الحد الأقصى
00:02:30في الواقع، أحصل على نتيجة أسوأ بتكلفة أعلى. لذا عند المستوى العالي مقابل 7.21 دولار، أحصل على
00:02:39دقة بنسبة 57.9%. عندما أقارن هذا بـ Fable 5.1 هنا، وأنا على المستوى العالي، حسنًا، أحصل على دقة بنسبة 49.4%
00:02:49بتكلفة 10.50 دولار. إذن فهو أكثر تكلفة، ولا يحقق نتائج جيدة بنفس القدر. الآن، يحقق Fable نتائج عالية جداً
00:02:57عندما أضعه على أقصى مستوى جهد 55.8، لكنه يكلفني 19.50 دولاراً. لذا مقابل نفس النتيجة،
00:03:06مرة أخرى، حوالي 55%، يكلف الأمر ما يقارب 20 دولاراً لـ Fable 5. وبالنسبة لـ GPT-6 Astra، فهو 7.20 دولار. إذن فهو أرخص بشكل لا يُقارن
00:03:16لنفس الدقة أساساً. وعندما ننظر إلى Frontier Code 1.1، نرى نمطاً مشابهاً،
00:03:22حيث في المستويات العليا، نحصل على نتائج متشابهة. عندما ننظر إلى GPT-6 مقارنة بـ Fable 5.1
00:03:29أو Fable 5. في هذه الحالة، سجل Fable 5 في الواقع نتيجة أعلى هنا. ولكنه أكثر تكلفة بكثير
00:03:34لتشغيل هذه النماذج السحابية نظراً لكفاءة الرموز مع GPT-6 Astra. الآن، هناك القليل من الميزات
00:03:39بخلاف المعايير التي تبرزها OpenAI عندما يتعلق الأمر بـ GPT-6. الأولى هي أنهم يطلقون عليه
00:03:43أفضل نموذج لاستخدام الكمبيوتر في العالم. الآن، هناك عدد قليل من المعايير التي تختبر هذا النوع من
00:03:48الأشياء، مثل اختبار الوكيل الأخير. ومثلما رأينا مع المعايير الأخرى، ماذا يظهر لنا
00:03:52هذا؟ يظهر أن Astra يكتساح الأمر نوعاً ما، سواء من حيث دقته أو تكاليف واجهة برمجة التطبيقات (API)، والتي لا يمكن
00:03:57الاستخفاف بها أبداً. ولكن ربما الأهم من الدقة هو السرعة. في الواقع، يعتبر Codex جيداً جداً في استخدام الكمبيوتر
00:04:01خاصة إذا استخدمته جنباً إلى جنب مع وضع الصوت. ومن المفترض أن يكون Astra
00:04:06أسرع بـ 1.9 مرة من GPT-5.6، وهو أمر رائع إذا كنت شخصاً استخدم ذلك كثيراً
00:04:11خلال الشهر الماضي أو نحو ذلك. الشيء الآخر الذي يبرزونه هو الالتزام بالقوالب. لذا إذا أعطيته
00:04:15نوعاً ما من القوالب لعرض تقديمي مثلاً، كما ترى هنا على اليسار، وطلبت منه
00:04:20إنشاء عرض تقديمي آخر بنفس الطريقة حول موضوع مختلف، حسنًا، ستصل إلى شيء
00:04:25مثل ما نراه على اليمين، شيئاً يلتزم بالأسلوب بشكل جيد جداً. لذا إذا كان لديك نوع ما
00:04:31من القوالب التي تستخدمها مراراً وتكراراً، سواء كان لعروض تقديمية أو مواقع ويب، فكر في الأمر باعتباره
00:04:35نظام تصميم لأي نوع من المخرجات حقاً، وGPT-6 رائع في ذلك. ويمكنك رؤية ذلك مرة أخرى هنا مع
00:04:41مستندات إكسل وتصميم المستندات بشكل عام. هنا كانت أساساً الصورة المرجعية التي أعطيت له.
00:04:46إليك ما سنحصل عليه سابقاً، وإليك ما نحصل عليه على اليمين لاحقاً بعد نظره إلى تلك
00:04:51الصورة المرجعية. الشيء الآخر المثير للاهتمام هو هذا السطر هنا حيث يتحدثون عن GPT-6 Asher
00:04:55وهو يجلب حكماً بصرياً أقوى لمواقع الويب، والألعاب، والتطبيقات، والعرض المبني، أي أنهم
00:05:00يقولون إن GPT-6 يتمتع بذوق أفضل. وربما سمعت مراراً وتكراراً أن الذكاء الاصطناعي ليس لديه ذوق.
00:05:05حسنًا، إنهم يقولون إن GPT-6 لديه ذوق. الآن لنكن صادقين، سيكون هناك دائماً مشكلات عندما يتعلق الأمر
00:05:10بالذكاء الاصطناعي والذوق، لأنه إذا أعطيته أمراً سيئاً، فسوف يحدث نوع من الانحدار
00:05:15نحو المتوسط، بغض النظر عن أي شيء. ومهما كان هذا المتوسط، سيربط الناس ذلك بهراء الذكاء الاصطناعي
00:05:20مهما كان جيداً حقاً. لكنهم يعرضون بعض الأمثلة هنا تشبه أساساً جولة تجول في محرك Unreal
00:05:25قاموا بها، ونمذجة Blender، فضلاً عن بعض الصور الثابتة هنا. الآن، الشيء الرائع حقاً
00:05:31الذي يضيفونه مع Astra هو تغييرات على كيفية إجرائه للضغط التلقائي عندما تمتلئ نافذة السياق. الآن،
00:05:37عادةً عندما تملأ نافذة السياق الخاصة بك، سيتم ضغطها تلقائياً، وسوف تنشئ ملخصاً
00:05:41لكل ما كنت تتحدث عنه في الجلسة الأخيرة، ثم تبدأ جلسة جديدة. حسنًا،
00:05:46هذا يخلق مشكلات، وأحياناً يتجاهل التفاصيل. ولكن الآن، يحتفظ Astra بالملاحظات عبر نوافذ السياق
00:05:52بدلاً من مجرد امتلاك ملخص واحد. لذا بدلاً من مستند واحد، لديه أساساً مجموعة
00:05:57من الملاحظات اللاصقة المختلفة حول ما يعتقد أنه مهم. ويمكنه الرجوع إلى تلك في أي وقت
00:06:01بدلاً من أن يكون الأمر مجرد محاولة لمرة واحدة مثل: إليك ملخص، نأمل أن يكون هذا كل ما نحتاجه.
00:06:06في الواقع، تظل نوافذ السياق السابقة قابلة للبحث. إذن مرة أخرى، ليس الأمر وكأن هذا هو
00:06:12المستند الوحيد لدينا من حيث الملخص. وإذا لم يكن موجوداً هنا، فنحن في ورطة. لم يعد الأمر كذلك
00:06:16بعد الآن. الآن، هذه ميزة تجريبية. لذا سيتعين عليك تمكينها في إعدادات codex
00:06:20ولكنها ستصبح الوضع الافتراضي في غضون بأسابيع قليلة. الآن، عندما يتعلق الأمر بالأمن السيبراني،
00:06:24يتعامل Astra مع هذا بشكل مشابه لكيفية تعامل أنثروبيك مع Fable، حيث يقولون: هذا النموذج قوي جداً
00:06:28لدرجة أنه يمكنه إنشاء الكثير من الثغرات. لذا إذا كان يعتقد أنك تحاول إنشاء نوع ما من الثغرات
00:06:33فلن يسمح لك بذلك ببساطة. لن يلتزم، ولن يجيب على مشكلتك.
00:06:37تحسن كبير آخر في GPT-6 مقارنة بسلسلة 5 وهو انخفاض معدل الهلوسة.
00:06:42GPT-5.6 Sol ونماذج 5.6 بشكل عام كانت تهلوس كثيراً مقارنة
00:06:48بالنماذج الرائدة الأخرى. ومع ذلك، جنباً إلى جنب، نرى أننا انتقلنا من شيء مثل معدل هلوسة بنسبة 9.4%
00:06:54وصولاً إلى معدل هلوسة بنسبة 2%. والآن هل Astra متاح؟ حسنًا،
00:07:01هو مفتوح لمجموعة محدودة من المؤسسات. وفي الأيام القليلة القادمة، سيكون متاحاً أساساً
00:07:06للجميع. أما بالنسبة لواجهة برمجة التطبيقات (API)، فهي متاحة للمطورين. وفيما يتعلق بالسعر، مرة أخرى،
00:07:11يطابق تسعير Fable. نحن ننظر إلى 10 دولارات لكل مليون رمز إدخال و50 دولاراً لكل مليون رمز إخراج.
00:07:17إذن بناءً على الأرقام، تمنحنا OpenAI نموذجاً قوياً للغاية يمكنه المنافسة تماماً
00:07:22مع أفضل ما لدى أنثروبيك. وهم يفعلون ذلك بسعر أقل. لذا
00:07:26أنا متحمس جداً لتجربة هذا. أعتقد أن وجود منافسة بين أكبر اللاعبين هنا
00:07:30هو أمر رائع في النهاية بالنسبة لنا نحن المستخدمين النهائيين.