انتهى الأمر... هذا ما أنهى للتو مناظرة GPT 6 Astra ضد Fable 5.1

AAI LABS
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00تم إصدار Fable 5.1 و GPT-6 Astra بفارق أيام قليلة، وحقق كلاهما درجات
00:00:05عالية جداً في اختبارات الأداء. حتى أن أسترا حقق ما يقرب من 100% في اختبار الذكاء الاصطناعي العام، وهو ما لم تقترب منه أي
00:00:11نموذج من قبل. لذا، بالنظر إلى تلك الأرقام، تتوقع أن أداءه سيكون ممتازاً عندما تكلفه
00:00:16بعملك الخاص. لكن الأداء الجيد في تلك الاختبارات لا يخبرك بمدى قدرة النموذج على التعامل
00:00:20مع العمل الذي تعطيه إياه، وأردنا أن نرى ما إذا كان كلا النموذجين يؤديان بنفس الجودة في
00:00:25عملنا الخاص. بما أننا شركة برمجيات، كان لدينا بالفعل مشاريع لاختبارهما عليها، لذا أعطينا كلا
00:00:30النموذجين أعمالاً من تلك المشاريع وتحققنا مما أنجزاه. قمنا بتشغيل كل نموذج عبر مشاريع متعددة
00:00:35وقيمنا مدى جودة أدائه في مجالات مختلفة. استخدمنا GPT-5.6 للمساعدة في تقييم
00:00:41النتائج ووضع درجات لها. لم يكن هذا النموذج المُقيِّم يعلم أي النتائج جاءت من Fable وأيها جاءت
00:00:45من Astra. حصل أحد النموذجين على درجة إجمالية 86 من أصل 100 بينما حصل الآخر على 84. الآن قد يبدو ذلك
00:00:52فجوة صغيرة، لكن النموذج الذي تقدم بشكل عام لم يفز بكل جزء من الاختبار، و
00:00:57عمل النموذج الآخر بشكل جيد بشكل مدهش في بعض تلك المجالات. لذلك سنستعرض كيف أدى كل
00:01:02نموذج في اختباراتنا وأيهما فاز في كل فئة حتى تعرف كيف تؤثر هذه الاختلافات
00:01:07على العمل الذي تقدمه له. قبل أن ننتقل إلى أداء كل نموذج، دعنا نستعرض أولاً
00:01:12النماذج نفسها. هذا القسم مخصص فقط لأولئك الذين لا يعرفون عنها شيئاً، لذا إذا كنت تعرف بالفعل
00:01:17التفاصيل فيمكنك تخطي هذا القسم والذهاب مباشرة إلى القسم التالي. أصدرت أنثروبيك
00:01:22Fable 5.1 في الأول من سبتمبر، وحتى قبل أن تستمتع أنثروبيك تماماً بضجة الإطلاق،
00:01:27أطلقت OpenAI نموذج GPT-6 Astra بعد أيام قليلة من Fable، وكان الناس يبنون منتجات مثيرة للاهتمام حقاً
00:01:33باستخدام هذه الننماذج ودفع هذه الننماذج إلى حدود قدراتها والحصول على نتائج مدهشة حقاً.
00:01:37وعندما يتعلق الأمر بالأسعار، فإن كلا النموذجين لهما نفس السعر البالغ 10 دولارات لكل
00:01:43مليون رمز إدخال و50 دولاراً لكل مليون رمز إخراج. ولكن مع Fable 5.1 هناك شيء واحد
00:01:49مختلف وهو أن أنثروبيك خفضت سعر القراءات المخزنة مؤقتاً بنسبة 75%. بالنسبة لأولئك الذين لا يعرفون
00:01:54شيئاً عن القراءات المخزنة مؤقتاً، فإن أجزاء المحادثة التي قرأها النموذج بالفعل يتم حفظها لإعادة
00:02:00استخدامها. عندما ترسل موجهات جديدة، يتم إعادة استخدام تلك الأجزاء المحفوظة بدلاً من أن يقرأها النموذج
00:02:05مرة أخرى من الصفر، وهذا ما يُسمى بالقراءة المخزنة مؤقتاً. تجعل هذه القراءات إعادة استخدام المحادثة أرخص بالفعل،
00:02:10ولكن مع انخفاض السعر تصبح أرخص بكثير. لكن هذا لا يعني أن Fable هو نموذج
00:02:14أرخص للاستخدام بشكل عام لأن الفاتورة الإجمالية تعتمد أيضاً على عوامل أخرى كثيرة، والتي سنناقشها
00:02:19قريباً. الآن كانت نماذج Fable موجودة في Claude code لفترة من الوقت، ولكن Fable 5.1 لا يزال غير
00:02:25مشمولاً في خطة Claude Pro، لذا في Pro يتعين عليك الدفع مقابل ذلك بشكل منفصل من خلال أرصدة الاستخدام. وفي
00:02:30خطط Max، يتم تضمين Fable 5.1 ولكن نماذج Fable لها حد أقصى أقل من بقية الننماذج.
00:02:36من ناحية أخرى، لا تتعامل OpenAI مع Astra كنموذج منفصل بهذه الطريقة لأن Astra جزء من
00:02:41حدود codex العادية على ChatGPT+ و Pro ويمكنك إنفاق كل الاستخدام على Astra. والآن هذه
00:02:47النماذج قادرة حقاً على العمل في مهام طويلة، مما يعني أنه يمكنك فقط أن تطلب منها بناء ميزة كبيرة
00:02:52وتتركها تعمل من خلال الخطوات بمفردها. ولكن عندما تترك هذه الننماذج تعمل
00:02:57في مهمة طويلة، فإن مقدار السياق الذي يمكنها الاحتفاظ به يهم أيضاً. يمنحك Fable مليون رمز في
00:03:02Claude code بينما نافذة السياق الافتراضية لـ Astra في Codex هي فقط 272,000 رمز على الرغم من أن Astra لديه
00:03:09نافذة أكبر بكثير من خلال واجهة برمجة التطبيقات الخاصة به والتي هي أعلى حتى من مليون رمز لـ Fable. لكنك لن
00:03:14تحصل على ذلك في Codex في الوقت الحالي لأن Codex يفترض افتراضياً نافذة سياق بحجم 272,000 رمز حتى بالنسبة لـ Astra.
00:03:21والآن وصلت هذه الننماذج إلى مستوى يمكنها من خلاله إجراء بحث متقدم، لذلك أضافت OpenAI
00:03:26وأنثروبيك حواجز أمان تقيد بعض الأعمال المسموح لها القيام بها.
00:03:31ولكن هذه القيود تؤثر أيضاً على عملك بطرق مختلفة لأن كل نموذج يتفاعل بشكل مختلف
00:03:36عندما تقرر نظامه الأمني أن طلبك غير مسموح به. عندما يصل Astra إلى جزء من المهمة يتعارض
00:03:41مع قواعده، فانه يرفض تلك المهمة صراحة ويخبرك بذلك. من ناحية أخرى،
00:03:45يتحول Claude code من Fable إلى نموذج أضعف عندما يتعارض الطلب مع قواعده. ووجد العديد
00:03:51من الناس أن Claude code قد قام بتغيير الننماذج دون علمهم. لذا إذا استمر Claude code
00:03:56في العمل بعد هذا التبديل، فقد لا تكون النتيجة التي تحصل عليها قادمة من Fable بعد الآن.
00:04:01الآن المقياس الأول الذي قسناه هو الجودة والذي يوضح مدى جودة عمل النموذج فعلياً.
00:04:06لهذا الاختبار، استخدمنا مشاريع عملاء متعددة لذا لا يمكننا الكشف عن تفاصيل تلك
00:04:11المشاريع ولكن يمكننا شرح كيف قيّمنا العمل وحيث اختلفت الننماذج. أما عن مدى جودة كتابة التعليمات البرمجية
00:04:16وتنظيمها، فقد حصل Fable على 90 مقارنة بـ 78 لـ Astra لأنه حافظ على فصل التعليمات البرمجية للأجزاء
00:04:22المختلفة من التطبيق بشكل أكثر وضوحاً. هذا يسهل على النموذج فهم التطبيق عند
00:04:27إجراء التغييرات لاحقاً، وكان Fable متقدماً على Astra في هذا عبر جميع المشاريع التي اختبارناها. وأما
00:04:32عن مقدار العمل المطلوب الذي تم إنجازه، فقد حصل Fable على 91 مقارنة بـ 84 لـ Astra لأنه قام أيضاً بإصلاح
00:04:39المشكلات التي لم نطلب منه تحديداً إصلاحها. ولكننا تحققنا أيضاً مما إذا كانت الميزات المكتملة
00:04:44تعمل بشكل صحيح دون أن نطلب إصلاحات، وحصل Astra على 87 مقارنة بـ 85 لـ Fable في ذلك.
00:04:50جاء جزء من تقدم Astra من فحص التطبيقات بشكل أكثر شمولاً وإصلاح المزيد من المشاكل المعروفة.
00:04:55عندما اختبر Fable تطبيقاته، فاتته بعض المواقف التي يمكن أن تسوء فيها الأمور، لذا فإن الميزات المكتملة
00:05:00كانت لا تزال تحتوي على بعض المشاكل. وعندما يتعلق الأمر بتجربة استخدام التطبيق، حصل Astra على 89 مقارنة بـ 88 لـ Fable،
00:05:08لأنه رتب أجزاء الصفحة المختلفة في أماكن جعلت العثور عليها واستخدامها أسهل.
00:05:13لذا بناءً على جميع الاختبارات التي ذكرناها للتو، كانت درجة جودة Fable الإجمالية 88 بينما حصل Astra على 84،
00:05:19لأنه بني ميزات أكثر اكتمالاً وكان عمله أسهل للتغيير لاحقاً. إذن من حيث الجودة،
00:05:25فإن Fable هو الفائز الواضح. ولكن قبل أن ننتقل إلى الاختبار التالي، دعنا نلقي كلمة من الراعي،
00:05:30Zapier. تقوم ببرمجة تطبيق ويعمل بشكل رائع، ولكن اللحظة التي تريد فيها توصيله بالفعل بأدوات
00:05:35مثل Gmail و Slack و Notion، تجد نفسك تربط كل تكامل وتدفق OAuth يدوياً. وقبل أن تدرك
00:05:41ذلك، ستكون غارقاً في رمز المصادقة وفجأة تصبح عمليات التكامل هي المشروع بأكمله. وهنا يأتي دور
00:05:46Zapier SDK. إنه مكتبة رموز تضعها في مشروعك داخل cloud code أو cursor،
00:05:52مما يتيح لك الوصول البرمجي إلى نظام Zapier البيئي الذي يضم أكثر من 9000 تطبيق. لذا بدلاً من بناء كل تكامل
00:05:58يدوياً، قمنا فقط باستدعاء التطبيقات التي نحتاجها واستمررنا في المضي قدماً. في بضع أسطر، كان تطبيقنا يرسل رسائل بريد إلكتروني
00:06:04ويقوم بإنشاء صفحات Notion بدون وثائق API ودون الحاجة لمصارعة المصادقة. وعندما احتجنا إلى تحديث
00:06:10خاصية مخصصة في Notion لم تكن تحتوي على إجراء مسبق الصنع، قمنا باستدعائها مباشرة عبر
00:06:15SDK. إنها تلبي احتياجاتك حقاً أينما كنت تعمل بالفعل. إذا كنت متعباً من ربط عمليات التكامل يدوياً،
00:06:20جرب Zapier SDK. الرابط موجود في الوصف أدناه. المقياس التالي الذي قسناه هو مدى تعامل الننماذج
00:06:26مع المهام طويلة الأجل، مما يعني مقدار العمل الذي أنجزوه بمفردهم مع القليل
00:06:31من التوجيه منا أثناء عملهم. تحققنا أيضاً من مدى تعاملهم مع المشاكل التي ظهرت على طول الطريق.
00:06:36لهذا، أعطينا كل نموذج فكرة تطبيق لبنائها وصغنا الطلب وفقاً لدليل التوجيه الخاص به
00:06:42بحيث تتاح له أفضل فرصة للقيام بالعمل بشكل جيد. لم نذكر التفاصيل المحددة التي أردناها
00:06:47ووصفنا فقط ما يحتاج التطبيق إلى القيام به. عمل Astra لمدة 32 دقيقة تقريباً وعمل Fable
00:06:53لمدة 44 دقيقة تقريباً. واجه Astra أخطاء أثناء بناء وفحص تطبيقه، لكنه عمل من خلالها
00:06:58واستمر في إصلاح التطبيق دون أن نضطر إلى توجيهه خلال كل مشكلة. كما أنهى Fable
00:07:03تطبيقه دون التوقف مبكراً أو سؤالنا عما يجب فعله بعد ذلك، وأجرى فحوصات على ما بناءه.
00:07:09لذا فقد أنجز كلاهما العمل، لكننا استعرضنا أيضاً التطبيقات النهائية لنرى ما تركوه
00:07:13لنا. افتتح تطبيق Astra مباشرة على صفحة تسجيل الدخول دون صفحة هبوط منفصلة. بمجرد تسجيل الدخول،
00:07:18كان التخطيط منظماً بشكل جيد وعمل التطبيق، رغم أنه كان لا يزال يحتوي على التخطيطات المألوفة التي
00:07:24تظهر في الكثير من التطبيقات التي تم إنشاؤها بواسطة الذكاء الاصطناعي. لكننا واجهنا مشكلة في اللوحة الجانبية لعدم قدرتها على التمرير
00:07:30بما يكفي للسماح لنا بالوصول إلى زر تسجيل الخروج. اضطرنا للتصغير للوصول إلى هذا الزر، وهو أمر
00:07:35لم ترصده فحوصات Astra الخاصة. افتتح تطبيق Fable أيضاً مباشرة على صفحة تسجيل الدخول، لكن تصميمه
00:07:40بدا أكثر عمومية بكثير. عملت الميزات، ولكن كان كل شيء متراكماً بالقرب من بعضه لدرجة
00:07:45أن التطبيق كان صعب الاستخدام وأضافت التدرجات المتكررة إلى المظهر المألوف الناتج عن الذكاء الاصطناعي. لقد تكيف مع
00:07:51الشاشات الأصغر، لكنه ظل يفتقر إلى تخطيط قابل للاستخدام، على الرغم من أن الميزات كانت متعمقة. لقد
00:07:56كان لدينا أيضاً العديد من التطبيقات الأخرى والميزات الضخمة المخطط لها والمبنية بهذه الطريقة مع ترك الننماذج
00:08:01تعمل بمفردها. لذا بالنسبة للعمل طويل الأجل، حصل Astra على 93 من أصل 100 مقارنة بـ 90 لـ Fable.
00:08:08ركز Fable بشكل أكبر على جعل الميزات تعمل، ما لم نحدد في الموجه أنه ينبغي عليه
00:08:13التركيز على الجوانب المرئية أيضاً. اهتم Astra بكيفية عمل التطبيقات ومظهرها معاً،
00:08:18لذا يفوز Astra في المهام طويلة الأجل. المقياس التالي الذي نظرنا إليه هو التصميم ومدى
00:08:23سهولة استخدام التطبيقات. لقد سمحنا للنموذج بتقييم التصميمات، لكننا لم نرغب في الاعتماد على
00:08:28ذوقه التصميمي وحده. لذلك قمنا ببناء عارض لنتائج Fable وآخر لـ Astra، مما سمح لنا بتصفح
00:08:33التصميمات بأنفسنا ومقارنة شكلها من حيث الاستخدام. أعطينا كلا النموذجين نفس المهام التصميمية،
00:08:38بدءاً من صفحة هبوط لشركة تبيع الخطوط. بدا إصدار Fable مشابهاً جداً لما
00:08:44تميل Opus إلى إنتاجه، من الألوان والخطوط إلى التخطيط. حتى أنه احتوى على شريط النص المتحرك
00:08:50عبر الصفحة والذي كنا نراه في تصميمات Opus مؤخراً. لكن شيئاً واحداً فعله Fable بشكل مختلف
00:08:55عن Opus هو إضافة عناصر تفاعلية أكثر بكثير طوال التصميم، مما جعل التطبيق يبدو
00:09:00أما نسخة أسترا فكانت تتميز بتخطيط أكثر اتساعاً، مع فروق أوضح في أحجام النصوص و
00:09:05الألوان التي جعلت قراءة النصوص أسهل. ولكن كانت هناك حركات أقل بكثير، لذا فحين بدا الأمر أكثر
00:09:10راحة للعين، فإنه لم يقدم نفس التجربة التي توفرها تصميمات فيبل. ولهذا السبب حصدت فيبل
00:09:1494 نقطة في درجات التفاعل، بينما حصلت أسترا على 85. بعد ذلك، طلبنا من كل نموذج تصميم صفحة هبوط
00:09:20لعبة رعب. استخدم تصميم فيبل منارة متحركة لخلق الأجواء. وقد تم إنشاء
00:09:25الرسومات كملفات SVG، وهي صور مرسومة بالبرمجة، لكن النص لم يكن بارزاً بما يكفي ضد الخلفية الداكنة
00:09:31بسبب الأحجام والألوان التي اختارتها فيبل. وفي نفس مهمة التصميم، استخدمت أسترا
00:09:36نموذج توليد الصور المدمج في كودكس لتوليد صورة بدلاً من إنشاء الرسومات بالبرمجة.
00:09:42كما أنشأت عرضاً تشويقياً للعبة على الرغم من أننا لم نطلب ذلك. وحيث تفوقت أسترا
00:09:47كان في اختيارها للخطوط والألوان، مما جعل النص بارزاً ضد الخلفية الداكنة.
00:09:52بالنسبة لموقع مهرجان الموسيقى، كررت نسخة فيبل الكثير من خيارات التصميم التي نراها في التصميمات التي صنعتها
00:09:57أوبوس. ولكن حتى مع تلك الخيارات المألوفة، بدا الأمر وكأن فيبل بذلت جهداً أكبر لإعطاء
00:10:03الموقع أسلوبها الخاص. استخدمت أسترا صورة حفلة موسيقية مولدة، لكن التصميم العام بدا أكثر
00:10:08عمومية. المقارنة الأخيرة كانت لعبة ركن السيارات الموازية، حيث كانت نسخة فيبل مصنوعة بشكل جيد حقاً،
00:10:13وساعدتنا مرآة الرؤية الخلفية على تقدير مكان تحريك السيارة بدقة أكبر. كانت للعبة زاويتان
00:10:18للكاميرا، لكن كلتيهما كانت تعاني من مشاكل. نظراً لأن إحداهما أظهرت الجانب الخطأ من مساحة وقوف السيارات،
00:10:23بينما أظهرت الأخرى جانباً واحداً فقط بدلاً من إعطائنا رؤية كاملة للطريق أمامنا. وقد جعل ذلك
00:10:27من الصعب رؤية المكان الذي نحرك فيه السيارة، ولو كانت زوايا الكاميرا تلك صحيحة، لكانت اللعبة
00:10:32أكثر واقعية. منحتنا أسترا ثلاثة مناظر ثابتة وأضافت نصائح القيادة في اللوحة الجانبية،
00:10:38مما جعل لعبتها أسهل. وكانت مناظر الكاميرا أفضل بكثير من تلك التي قدمتها فيبل. كانت هذه
00:10:42اختبارات عامة قدمنا فيها للنماذج تفاصيل قليلة جداً حول التصميمات التي نريدها، لذلك كنا نشهد
00:10:48ذوق النموذج نفسه هنا. كلاهما كرر خيارات تصميم رأيناها في أعمالهما الأخرى، لكن كلاهما أنتج
00:10:53نتائج جيدة. ومع مزيد من التفاصيل حول كيف نريد أن تبدو التطبيقات وتشعر بها،
00:10:58نتوقع أن يصمم كلاهما بشكل جيد. إذن بناءً على الذوق وحده، فازت أسترا في المرئيات وسهولة الاستخدام، بينما فازت فيبل في
00:11:04الرسوم المتحركة والتفاعل. ولكن قبل أن ننتقل إلى اختبار التكلفة والسرعة، سيكون من الرائع لو
00:11:09اشتركت في القناة وضغطت على زر الإعجاب. هذا اللفظ البسيط من الدعم يقطع شوطاً طويلاً بالنسبة لنا.
00:11:15المقياس التالي الذي قسناه هو الكفاءة، والتي غطت تكلفة العمل، والوقت الذي استغرقه،
00:11:20وعدد المرات التي استخدم فيها النموذج أدواته لإنجازه. أحد الأمور التي يجب معرفتها حول التكاليف هو أننا
00:11:25لم نستخدم واجهة برمجة التطبيقات (API)، لذا فهذه مجرد تقديرات لمقدار تكلفة العمل إذا استخدمنا الواجهة
00:11:31بناءً على الرموز المستخدمة. لقد أجرنا الاختبارات على اشتراكنا المعتاد. عبر جميع تشغيلات الاختبار، بلغ
00:11:37إجمالي التكلفة المقدرة لـ فيبل 49.18 دولاراً، مقارنة بـ 27.69 دولاراً لـ أسترا، لذا كان إجمالي أسترا أقل بنوالي 44%.
00:11:47أنتجت فيبل ما يقرب من 3 أضعاف رموز الإخراج التي أنتجتها أسترا، تماماً مثل كيفية ذكر دليل توجيه
00:11:52فيبل أنها تميل إلى كتابة أكثر من النماذج الأخرى. كان للنموذجين نفس التكلفة لتلك
00:11:57الرموز، لذا فإن الكتابة أكثر هي ما زاد من تكلفة فيبل. كما أن استخدام الأدوات يزيد من استهلاك الرموز،
00:12:03لأن النمذجة تقرر الأداة المناسبة للاستخدام ثم تقرأ النتائج قبل مواصلة العمل. وعبر جميع
00:12:09التجارب الست، استخدم الوكيل الرئيسي لـ Fable أدواته 443 مرة مقارنة بـ 287 مرة لـ Astra، وهو ما زاد أيضاً من
00:12:17التكلفة. وفي معيار التكلفة، سجلت Astra 80 من أصل 100 مقارنة بـ 66 لـ Fable. أما بالنسبة للسرعة، فقد تقدمت Astra أيضاً
00:12:23بـ 70 مقابل 67 لـ Fable. استغرقت المهام طويلة الأمد حوالي 62 دقيقة في المجمل بالنسبة لـ Astra،
00:12:30مقارنة بـ 73 دقيقة لـ Fable. إذن، عبر درجات التكلفة، والسرعة، وكفاءة الأدوات،
00:12:35تفوقت Astra على Fable. المقياس التالي الذي قسناه كان مدى اتباع التعليمات،
00:12:40حيث تحققنا من مدى دقة اتباع النماذج للتعليمات التي قدمناها أثناء البناء،
00:12:44وما إذا كانت مستمرة في اتباعها مع تقدم العمل. عندما شغلنا Fable على أحد المشاريع،
00:12:49أضافت في البداية رسالة تأليف مشترك تفيد بأن Claude ساعد في كتابة الكود،
00:12:53على الرغم من أن تعليماتنا نصت صراحة على عدم القيام بذلك. كما تجاهلت قاعدة تتعلق بالطريقة المسموحة لها
00:12:58بإنشاء أو تعديل الملفات. لقد أخبرناها باستخدام أدوات تحرير الملفات الخاصة بـ Claude، بحيث تكون تلك التغييرات متتبعة
00:13:04 ويسهل التراجع عنها، لكنها أنشأت ملفين عبر تشغيل الأوامر بدلاً من ذلك. وفي معيار اتباع التعليمات،
00:13:09سجلت Astra 96 من أصل 100 مقارنة بـ 88 لـ Fable. إذن، عندما يتعلق الأمر باتباع التعليمات،
00:13:16فقد تفوق أداء Astra في هذه الاختبارات. المقياس التالي الذي قسناه كان جودة المراجعة، حيث منحنا النماذج
00:13:21مشروعاً يحتوي على مشكلات وطلبنا منها العثور على تلك المشكلات. قمنا أولاً بمنح كلا النموذجين
00:13:27نفس الكود لمراجعته، مع إدراج أربع مشكلات عمداً، لكي نعرف ما تحتاج النماذج للعثور عليه. وجدت Fable
00:13:33جميع المشكلات الأربع، كما وجدت خمس مشكلات إضافية لم نقم بإضافتها، والتي تم
00:13:37فحصها والتحقق منها بعد ذلك. وجدت Astra مشكلتين من أصل الأربع التي أضفناها، لكنها ظلت تخبرنا بأن المراجعة
00:13:42قد اكتملت. تضمنا أيضاً ثلاثة أجزاء بدت مشبوهة، لكنها كانت صحيحة في الواقع، لأننا
00:13:47أردنا معرفة ما إذا كان النموذج سيبلغ عن مشكلات وهمية. لم يتعامل أي منهما مع تلك الأجزاء كأخطاء، لذا فإن
00:13:52الفرق هنا كان في حجم ما عثرت عليه النماذج، وقد قدمت لنا Fable المراجعة الأكثر شمولاً،
00:13:57ولكن عندما اختبرناهما على مشروع أكبر به تسع مشكلات مؤكدة، قامت Astra بإصلاح خمس مشكلات، بينما قامت Fable
00:14:03بالعثور على وإصلاح أربع فقط. لذا أكملت Astra عمليات إصلاح أكثر، على الرغم من أن كليهما ترك عدة مشكلات
00:14:08دون إصلاح. وبالنسبة لجودة المراجعة، والتي تضمنت تلك الإصلاحات وكيفية تدقيق النماذج لأعمالها الأخرى،
00:14:13سجلت Fable 84 مقارنة بـ 78 لـ Astra. لذا تفوقت Fable في النتيجة الإجمالية للمراجعة،
00:14:19لأن Fable قدمت لنا مراجعة أقوى بشكل عام. بناءً على هذه النتائج، تُعد Astra الفائز الأوضح عبر
00:14:25فئات متعددة اختبارناها، لكن هذا لا يعني أن Fable نموذج سيء، فقد أبدت أداءً جيداً
00:14:30عبر المهام، ولم تكن متأخرة كثيراً عن Astra في عدة فئات. لذا عليك فقط اختيار النموذج
00:14:35بناءً على المهام التي تسندها إليه. ولإيصال هذين النموذجين إلى أقصى قدراتهما، هناك
00:14:40ممارسات معينة يجب عليك اتباعها. لقد استخدمنا الكثير منها في اختباراتنا، وإذا كنت تريد الوصول
00:14:45إليها أيضاً، فيمكنك الحصول عليها في AI Labs Pro، وهو مجتمعنا الخاص. لذا إن وجدتم قيمة فيما
00:14:51نقدمه وتترغبون في دعم القناة، فهذه هي الطريقة الأفضل للقيام بذلك. تجدون الرابط في الوصف.
00:14:56وهذا يوصلنا إلى نهاية هذا الفيديو. إذا كنتم ترغبون في دعم القناة ومساعدتنا في الاستمرار بإنشاء
00:15:01فيديوهات كهذه، فيمكنكم فعل ذلك باستخدام زر الشكر المتوفر في الأسفل. وكالعادة،
00:15:05شكراً للمتابعة وأراكم في الفيديو القادم.

핵심 요약

حقق نموذج GPT-6 Astra تفوقاً إجمالياً واضحاً عبر فئات التكلفة والسرعة واتباع التعليمات بدرجة إجمالية بلغت 86 مقابل 84 لـ Fable 5.1، رغم تفوق الأخير في جودة البرمجة الأساسية والتفاعل.

하이라이트

  • حقحقة نموذج Fable 5.1 درجة إجمالية بلغت 88 مقابل 84 لنموذج GPT-6 Astra في اختبارات جودة البرمجة وتنظيم التعليمات البرمجية.

  • سجل نموذج Astra تكلفة أقل بنحو 44% مقارنة بـ Fable عبر جميع تشغيلات الاختبار، وبلغت التكلفة الإجمالية لـ Fable مبلغ 49.18 دولاراً مقابل 27.69 دولاراً لـ Astra.

  • تفوق نموذج Astra في المهام طويلة الأجل مسجلاً 93 نقطة مقابل 90 نقطة لـ Fable، حيث عمل Astra لمدة 32 دقيقة بينما استغرق Fable 44 دقيقة.

  • حصل Fable على 94 نقطة في درجات التفاعل والرسوم المتحركة متجاوزاً Astra الذي سجل 85 نقطة في الجانب البصري وتجربة المستخدم.

  • تفوق Astra في مدى اتباع التعليمات مسجلاً 96 نقطة مقابل 88 نقطة لـ Fable الذي تجاهل أحياناً بعض القواعد الخاصة بإنشاء أو تعديل الملفات.

타임라인

مقارنة أداء النماذج ومنهجية الاختبار

  • أصدرت أنثروبيك نموذج Fable 5.1 وأطلقت OpenAI نموذج GPT-6 Astra بفارق أيام قليلة.
  • تم تشغيل كلا النموذجين عبر مشاريع برمجية متعددة وتقييم نتائجهما باستخدام نموذج مقيم مجهول المصدر.
  • حصل أحد النموذجين على درجة إجمالية 86 والآخر على 84 في التقييم العام.

حققت النماذج درجات عالية في اختبارات الأداء القياسية، لكن تقييمها الحقيقي تطلب اختبارها على مشاريع برمجية عملية خاصة بشركة برمجيات. استخدم المقيم GPT-5.6 لتقييم النتائج دون معرفة مصدرها لضمان الحيادية والموضوعية في رصد الفروق الفردية.

خصائص نماذج Fable 5.1 و Astra والأسعار

  • يبلغ سعر كلا النموذجين 10 دولارات لكل مليون رمز إدخال و50 دولاراً لكل مليون رمز إخراج.
  • خفضت أنثروبيك سعر القراءات المخزنة مؤقتاً بنسبة 75% مع إطلاق Fable 5.1.
  • يمنح Fable نافذة سياق بحجم مليون رمز في بيئة Claude code بينما يبلغ الافتراضي لـ Astra في Codex نحو 272,000 رمز.

تختلف سياسات الاستخدام والحدود القصوى بين المنصتين بشكل ملحوظ عند التعامل مع مهام التطوير الطويلة. يرفض Astra المهام المخالفة لقواعده صراحة بينما يتحول Claude code المرتبط بـ Fable تلقائياً إلى نموذج أضعف عند حدوث تعارض.

نتائج قياس جودة التعليمات البرمجية والعمل

  • حصل Fable على 90 نقطة في جودة التنظيم البرمجي مقارنة بـ 78 نقطة لـ Astra بفضل فصل الملفات بوضوح.
  • سجل Fable 91 نقطة في حجم العمل المنجز لإصلاح المشكلات غير المطلوبة مقابل 84 لـ Astra.
  • بلغت درجة جودة Fable الإجمالية 88 بينما حصل Astra على 84.

أظهر الفحص العملي تفوق Fable في الحفاظ على تنظيم التطبيق وتسهيل إجراء التعديلات اللاحقة عليه. بالمقابل، فحص Astra التطبيقات بشكل أكثر شمولاً لمعالجة بعض المشاكل الكامنة وتحسين تجربة استخدام الصفحة.

أداء النماذج في المهام طويلة الأجل

  • استغرق Astra نحو 32 دقيقة لإنجاز مهمة بناء التطبيق بينما استغرق Fable حوالي 44 دقيقة.
  • سجل Astra 93 نقطة في المهام طويلة الأجل مقارنة بـ 90 نقطة لـ Fable.
  • اهتم Astra بمظهر التطبيق ووظائفه معاً بينما ركز Fable على تشغيل الميزات الأساسية.

أثبت كلا النموذجين قدرتهما على إنجاز المهام الكبيرة بمفردهما دون توجيه مستمر، حيث واجه Astra أخطاء برمجية وتجاوزها بنجاح. أظهرت التطبيقات النهائية فروقاً طفيفة في التخطيط وسهولة الوصول إلى عناصر الواجهة.

تقييم التصميم والتفاعل والجماليات

  • حصد Fable 94 نقطة في درجات التفاعل والعناصر الحركية مقابل 85 نقطة لـ Astra.
  • تميزت تصاميم Astra باتساع التخطيط ووضوح أحجام النصوص وسهولة القراءة.
  • استخدمت Astra نموذج توليد الصور المدمج في كودكس لإنشاء رسومات مخصصة للعبة الرعب.

خضعت النماذج لاختبارات تصميمية شملت صفحات هبوط متعددة ولعبة ركن سيارات. تفوق Astra في سهولة الاستخدام البصري ووضوح النصوص، بينما تفوق Fable في إضافة العناصر التفاعلية والحركات الديناميكية داخل الواجهات.

معايير الكفاءة والتكلفة والسرعة

  • بلغت التكلفة الإجمالية المقدرة لـ Fable مبلغ 49.18 دولاراً مقارنة بـ 27.69 دولاراً لـ Astra.
  • أنتج Fable نحو ثلاثة أضعاف رموز الإخراج واستخدم أدواته 443 مرة مقابل 287 مرة لـ Astra.
  • سجلت Astra 80 نقطة في التكلفة و70 نقطة في السرعة متفوقة على Fable.

أثمر ميل Fable لكتابة نصوص أكثر واستخدام الأدوات بتكرار أعلى عن زيادة ملحوظة في التكلفة والوقت المستغرق. تفوق Astra بوضوح في مؤشرات الكفاءة الاقتصادية وسرعة إنجاز المهام.

اتباع التعليمات وجودة المراجعة البرمجية

  • سجلت Astra 96 نقطة في اتباع التعليمات مقارنة بـ 88 نقطة لـ Fable.
  • أضاف Fable رسالة تأليف مشترك وتجاهل أحياناً أدوات تحرير الملفات المحددة.
  • حصلت Fable على 84 نقطة في جودة المراجعة مقابل 78 لـ Astra بفضل شمولية اكتشاف الأخطاء.

التزم Astra بالتعليمات والقيود المفروضة بدقة أكبر ودون مخالفات تذكر مقارنة بـ Fable. وفي المقابل، تفوق Fable في اكتشاف عدد أكبر من الأخطاء والمشكلات خلال عمليات مراجعة الأكواد البرمجية المقدمة.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기