스크립트
00:00:00تم إصدار Fable 5.1 و GPT-6 Astra بفارق أيام قليلة، وحقق كلاهما درجات
00:00:05عالية جداً في اختبارات الأداء. حتى أن أسترا حقق ما يقرب من 100% في اختبار الذكاء الاصطناعي العام، وهو ما لم تقترب منه أي
00:00:11نموذج من قبل. لذا، بالنظر إلى تلك الأرقام، تتوقع أن أداءه سيكون ممتازاً عندما تكلفه
00:00:16بعملك الخاص. لكن الأداء الجيد في تلك الاختبارات لا يخبرك بمدى قدرة النموذج على التعامل
00:00:20مع العمل الذي تعطيه إياه، وأردنا أن نرى ما إذا كان كلا النموذجين يؤديان بنفس الجودة في
00:00:25عملنا الخاص. بما أننا شركة برمجيات، كان لدينا بالفعل مشاريع لاختبارهما عليها، لذا أعطينا كلا
00:00:30النموذجين أعمالاً من تلك المشاريع وتحققنا مما أنجزاه. قمنا بتشغيل كل نموذج عبر مشاريع متعددة
00:00:35وقيمنا مدى جودة أدائه في مجالات مختلفة. استخدمنا GPT-5.6 للمساعدة في تقييم
00:00:41النتائج ووضع درجات لها. لم يكن هذا النموذج المُقيِّم يعلم أي النتائج جاءت من Fable وأيها جاءت
00:00:45من Astra. حصل أحد النموذجين على درجة إجمالية 86 من أصل 100 بينما حصل الآخر على 84. الآن قد يبدو ذلك
00:00:52فجوة صغيرة، لكن النموذج الذي تقدم بشكل عام لم يفز بكل جزء من الاختبار، و
00:00:57عمل النموذج الآخر بشكل جيد بشكل مدهش في بعض تلك المجالات. لذلك سنستعرض كيف أدى كل
00:01:02نموذج في اختباراتنا وأيهما فاز في كل فئة حتى تعرف كيف تؤثر هذه الاختلافات
00:01:07على العمل الذي تقدمه له. قبل أن ننتقل إلى أداء كل نموذج، دعنا نستعرض أولاً
00:01:12النماذج نفسها. هذا القسم مخصص فقط لأولئك الذين لا يعرفون عنها شيئاً، لذا إذا كنت تعرف بالفعل
00:01:17التفاصيل فيمكنك تخطي هذا القسم والذهاب مباشرة إلى القسم التالي. أصدرت أنثروبيك
00:01:22Fable 5.1 في الأول من سبتمبر، وحتى قبل أن تستمتع أنثروبيك تماماً بضجة الإطلاق،
00:01:27أطلقت OpenAI نموذج GPT-6 Astra بعد أيام قليلة من Fable، وكان الناس يبنون منتجات مثيرة للاهتمام حقاً
00:01:33باستخدام هذه الننماذج ودفع هذه الننماذج إلى حدود قدراتها والحصول على نتائج مدهشة حقاً.
00:01:37وعندما يتعلق الأمر بالأسعار، فإن كلا النموذجين لهما نفس السعر البالغ 10 دولارات لكل
00:01:43مليون رمز إدخال و50 دولاراً لكل مليون رمز إخراج. ولكن مع Fable 5.1 هناك شيء واحد
00:01:49مختلف وهو أن أنثروبيك خفضت سعر القراءات المخزنة مؤقتاً بنسبة 75%. بالنسبة لأولئك الذين لا يعرفون
00:01:54شيئاً عن القراءات المخزنة مؤقتاً، فإن أجزاء المحادثة التي قرأها النموذج بالفعل يتم حفظها لإعادة
00:02:00استخدامها. عندما ترسل موجهات جديدة، يتم إعادة استخدام تلك الأجزاء المحفوظة بدلاً من أن يقرأها النموذج
00:02:05مرة أخرى من الصفر، وهذا ما يُسمى بالقراءة المخزنة مؤقتاً. تجعل هذه القراءات إعادة استخدام المحادثة أرخص بالفعل،
00:02:10ولكن مع انخفاض السعر تصبح أرخص بكثير. لكن هذا لا يعني أن Fable هو نموذج
00:02:14أرخص للاستخدام بشكل عام لأن الفاتورة الإجمالية تعتمد أيضاً على عوامل أخرى كثيرة، والتي سنناقشها
00:02:19قريباً. الآن كانت نماذج Fable موجودة في Claude code لفترة من الوقت، ولكن Fable 5.1 لا يزال غير
00:02:25مشمولاً في خطة Claude Pro، لذا في Pro يتعين عليك الدفع مقابل ذلك بشكل منفصل من خلال أرصدة الاستخدام. وفي
00:02:30خطط Max، يتم تضمين Fable 5.1 ولكن نماذج Fable لها حد أقصى أقل من بقية الننماذج.
00:02:36من ناحية أخرى، لا تتعامل OpenAI مع Astra كنموذج منفصل بهذه الطريقة لأن Astra جزء من
00:02:41حدود codex العادية على ChatGPT+ و Pro ويمكنك إنفاق كل الاستخدام على Astra. والآن هذه
00:02:47النماذج قادرة حقاً على العمل في مهام طويلة، مما يعني أنه يمكنك فقط أن تطلب منها بناء ميزة كبيرة
00:02:52وتتركها تعمل من خلال الخطوات بمفردها. ولكن عندما تترك هذه الننماذج تعمل
00:02:57في مهمة طويلة، فإن مقدار السياق الذي يمكنها الاحتفاظ به يهم أيضاً. يمنحك Fable مليون رمز في
00:03:02Claude code بينما نافذة السياق الافتراضية لـ Astra في Codex هي فقط 272,000 رمز على الرغم من أن Astra لديه
00:03:09نافذة أكبر بكثير من خلال واجهة برمجة التطبيقات الخاصة به والتي هي أعلى حتى من مليون رمز لـ Fable. لكنك لن
00:03:14تحصل على ذلك في Codex في الوقت الحالي لأن Codex يفترض افتراضياً نافذة سياق بحجم 272,000 رمز حتى بالنسبة لـ Astra.
00:03:21والآن وصلت هذه الننماذج إلى مستوى يمكنها من خلاله إجراء بحث متقدم، لذلك أضافت OpenAI
00:03:26وأنثروبيك حواجز أمان تقيد بعض الأعمال المسموح لها القيام بها.
00:03:31ولكن هذه القيود تؤثر أيضاً على عملك بطرق مختلفة لأن كل نموذج يتفاعل بشكل مختلف
00:03:36عندما تقرر نظامه الأمني أن طلبك غير مسموح به. عندما يصل Astra إلى جزء من المهمة يتعارض
00:03:41مع قواعده، فانه يرفض تلك المهمة صراحة ويخبرك بذلك. من ناحية أخرى،
00:03:45يتحول Claude code من Fable إلى نموذج أضعف عندما يتعارض الطلب مع قواعده. ووجد العديد
00:03:51من الناس أن Claude code قد قام بتغيير الننماذج دون علمهم. لذا إذا استمر Claude code
00:03:56في العمل بعد هذا التبديل، فقد لا تكون النتيجة التي تحصل عليها قادمة من Fable بعد الآن.
00:04:01الآن المقياس الأول الذي قسناه هو الجودة والذي يوضح مدى جودة عمل النموذج فعلياً.
00:04:06لهذا الاختبار، استخدمنا مشاريع عملاء متعددة لذا لا يمكننا الكشف عن تفاصيل تلك
00:04:11المشاريع ولكن يمكننا شرح كيف قيّمنا العمل وحيث اختلفت الننماذج. أما عن مدى جودة كتابة التعليمات البرمجية
00:04:16وتنظيمها، فقد حصل Fable على 90 مقارنة بـ 78 لـ Astra لأنه حافظ على فصل التعليمات البرمجية للأجزاء
00:04:22المختلفة من التطبيق بشكل أكثر وضوحاً. هذا يسهل على النموذج فهم التطبيق عند
00:04:27إجراء التغييرات لاحقاً، وكان Fable متقدماً على Astra في هذا عبر جميع المشاريع التي اختبارناها. وأما
00:04:32عن مقدار العمل المطلوب الذي تم إنجازه، فقد حصل Fable على 91 مقارنة بـ 84 لـ Astra لأنه قام أيضاً بإصلاح
00:04:39المشكلات التي لم نطلب منه تحديداً إصلاحها. ولكننا تحققنا أيضاً مما إذا كانت الميزات المكتملة
00:04:44تعمل بشكل صحيح دون أن نطلب إصلاحات، وحصل Astra على 87 مقارنة بـ 85 لـ Fable في ذلك.
00:04:50جاء جزء من تقدم Astra من فحص التطبيقات بشكل أكثر شمولاً وإصلاح المزيد من المشاكل المعروفة.
00:04:55عندما اختبر Fable تطبيقاته، فاتته بعض المواقف التي يمكن أن تسوء فيها الأمور، لذا فإن الميزات المكتملة
00:05:00كانت لا تزال تحتوي على بعض المشاكل. وعندما يتعلق الأمر بتجربة استخدام التطبيق، حصل Astra على 89 مقارنة بـ 88 لـ Fable،
00:05:08لأنه رتب أجزاء الصفحة المختلفة في أماكن جعلت العثور عليها واستخدامها أسهل.
00:05:13لذا بناءً على جميع الاختبارات التي ذكرناها للتو، كانت درجة جودة Fable الإجمالية 88 بينما حصل Astra على 84،
00:05:19لأنه بني ميزات أكثر اكتمالاً وكان عمله أسهل للتغيير لاحقاً. إذن من حيث الجودة،
00:05:25فإن Fable هو الفائز الواضح. ولكن قبل أن ننتقل إلى الاختبار التالي، دعنا نلقي كلمة من الراعي،
00:05:30Zapier. تقوم ببرمجة تطبيق ويعمل بشكل رائع، ولكن اللحظة التي تريد فيها توصيله بالفعل بأدوات
00:05:35مثل Gmail و Slack و Notion، تجد نفسك تربط كل تكامل وتدفق OAuth يدوياً. وقبل أن تدرك
00:05:41ذلك، ستكون غارقاً في رمز المصادقة وفجأة تصبح عمليات التكامل هي المشروع بأكمله. وهنا يأتي دور
00:05:46Zapier SDK. إنه مكتبة رموز تضعها في مشروعك داخل cloud code أو cursor،
00:05:52مما يتيح لك الوصول البرمجي إلى نظام Zapier البيئي الذي يضم أكثر من 9000 تطبيق. لذا بدلاً من بناء كل تكامل
00:05:58يدوياً، قمنا فقط باستدعاء التطبيقات التي نحتاجها واستمررنا في المضي قدماً. في بضع أسطر، كان تطبيقنا يرسل رسائل بريد إلكتروني
00:06:04ويقوم بإنشاء صفحات Notion بدون وثائق API ودون الحاجة لمصارعة المصادقة. وعندما احتجنا إلى تحديث
00:06:10خاصية مخصصة في Notion لم تكن تحتوي على إجراء مسبق الصنع، قمنا باستدعائها مباشرة عبر
00:06:15SDK. إنها تلبي احتياجاتك حقاً أينما كنت تعمل بالفعل. إذا كنت متعباً من ربط عمليات التكامل يدوياً،
00:06:20جرب Zapier SDK. الرابط موجود في الوصف أدناه. المقياس التالي الذي قسناه هو مدى تعامل الننماذج
00:06:26مع المهام طويلة الأجل، مما يعني مقدار العمل الذي أنجزوه بمفردهم مع القليل
00:06:31من التوجيه منا أثناء عملهم. تحققنا أيضاً من مدى تعاملهم مع المشاكل التي ظهرت على طول الطريق.
00:06:36لهذا، أعطينا كل نموذج فكرة تطبيق لبنائها وصغنا الطلب وفقاً لدليل التوجيه الخاص به
00:06:42بحيث تتاح له أفضل فرصة للقيام بالعمل بشكل جيد. لم نذكر التفاصيل المحددة التي أردناها
00:06:47ووصفنا فقط ما يحتاج التطبيق إلى القيام به. عمل Astra لمدة 32 دقيقة تقريباً وعمل Fable
00:06:53لمدة 44 دقيقة تقريباً. واجه Astra أخطاء أثناء بناء وفحص تطبيقه، لكنه عمل من خلالها
00:06:58واستمر في إصلاح التطبيق دون أن نضطر إلى توجيهه خلال كل مشكلة. كما أنهى Fable
00:07:03تطبيقه دون التوقف مبكراً أو سؤالنا عما يجب فعله بعد ذلك، وأجرى فحوصات على ما بناءه.
00:07:09لذا فقد أنجز كلاهما العمل، لكننا استعرضنا أيضاً التطبيقات النهائية لنرى ما تركوه
00:07:13لنا. افتتح تطبيق Astra مباشرة على صفحة تسجيل الدخول دون صفحة هبوط منفصلة. بمجرد تسجيل الدخول،
00:07:18كان التخطيط منظماً بشكل جيد وعمل التطبيق، رغم أنه كان لا يزال يحتوي على التخطيطات المألوفة التي
00:07:24تظهر في الكثير من التطبيقات التي تم إنشاؤها بواسطة الذكاء الاصطناعي. لكننا واجهنا مشكلة في اللوحة الجانبية لعدم قدرتها على التمرير
00:07:30بما يكفي للسماح لنا بالوصول إلى زر تسجيل الخروج. اضطرنا للتصغير للوصول إلى هذا الزر، وهو أمر
00:07:35لم ترصده فحوصات Astra الخاصة. افتتح تطبيق Fable أيضاً مباشرة على صفحة تسجيل الدخول، لكن تصميمه
00:07:40بدا أكثر عمومية بكثير. عملت الميزات، ولكن كان كل شيء متراكماً بالقرب من بعضه لدرجة
00:07:45أن التطبيق كان صعب الاستخدام وأضافت التدرجات المتكررة إلى المظهر المألوف الناتج عن الذكاء الاصطناعي. لقد تكيف مع
00:07:51الشاشات الأصغر، لكنه ظل يفتقر إلى تخطيط قابل للاستخدام، على الرغم من أن الميزات كانت متعمقة. لقد
00:07:56كان لدينا أيضاً العديد من التطبيقات الأخرى والميزات الضخمة المخطط لها والمبنية بهذه الطريقة مع ترك الننماذج
00:08:01تعمل بمفردها. لذا بالنسبة للعمل طويل الأجل، حصل Astra على 93 من أصل 100 مقارنة بـ 90 لـ Fable.
00:08:08ركز Fable بشكل أكبر على جعل الميزات تعمل، ما لم نحدد في الموجه أنه ينبغي عليه
00:08:13التركيز على الجوانب المرئية أيضاً. اهتم Astra بكيفية عمل التطبيقات ومظهرها معاً،
00:08:18لذا يفوز Astra في المهام طويلة الأجل. المقياس التالي الذي نظرنا إليه هو التصميم ومدى
00:08:23سهولة استخدام التطبيقات. لقد سمحنا للنموذج بتقييم التصميمات، لكننا لم نرغب في الاعتماد على
00:08:28ذوقه التصميمي وحده. لذلك قمنا ببناء عارض لنتائج Fable وآخر لـ Astra، مما سمح لنا بتصفح
00:08:33التصميمات بأنفسنا ومقارنة شكلها من حيث الاستخدام. أعطينا كلا النموذجين نفس المهام التصميمية،
00:08:38بدءاً من صفحة هبوط لشركة تبيع الخطوط. بدا إصدار Fable مشابهاً جداً لما
00:08:44تميل Opus إلى إنتاجه، من الألوان والخطوط إلى التخطيط. حتى أنه احتوى على شريط النص المتحرك
00:08:50عبر الصفحة والذي كنا نراه في تصميمات Opus مؤخراً. لكن شيئاً واحداً فعله Fable بشكل مختلف
00:08:55عن Opus هو إضافة عناصر تفاعلية أكثر بكثير طوال التصميم، مما جعل التطبيق يبدو
00:09:00أما نسخة أسترا فكانت تتميز بتخطيط أكثر اتساعاً، مع فروق أوضح في أحجام النصوص و
00:09:05الألوان التي جعلت قراءة النصوص أسهل. ولكن كانت هناك حركات أقل بكثير، لذا فحين بدا الأمر أكثر
00:09:10راحة للعين، فإنه لم يقدم نفس التجربة التي توفرها تصميمات فيبل. ولهذا السبب حصدت فيبل
00:09:1494 نقطة في درجات التفاعل، بينما حصلت أسترا على 85. بعد ذلك، طلبنا من كل نموذج تصميم صفحة هبوط
00:09:20لعبة رعب. استخدم تصميم فيبل منارة متحركة لخلق الأجواء. وقد تم إنشاء
00:09:25الرسومات كملفات SVG، وهي صور مرسومة بالبرمجة، لكن النص لم يكن بارزاً بما يكفي ضد الخلفية الداكنة
00:09:31بسبب الأحجام والألوان التي اختارتها فيبل. وفي نفس مهمة التصميم، استخدمت أسترا
00:09:36نموذج توليد الصور المدمج في كودكس لتوليد صورة بدلاً من إنشاء الرسومات بالبرمجة.
00:09:42كما أنشأت عرضاً تشويقياً للعبة على الرغم من أننا لم نطلب ذلك. وحيث تفوقت أسترا
00:09:47كان في اختيارها للخطوط والألوان، مما جعل النص بارزاً ضد الخلفية الداكنة.
00:09:52بالنسبة لموقع مهرجان الموسيقى، كررت نسخة فيبل الكثير من خيارات التصميم التي نراها في التصميمات التي صنعتها
00:09:57أوبوس. ولكن حتى مع تلك الخيارات المألوفة، بدا الأمر وكأن فيبل بذلت جهداً أكبر لإعطاء
00:10:03الموقع أسلوبها الخاص. استخدمت أسترا صورة حفلة موسيقية مولدة، لكن التصميم العام بدا أكثر
00:10:08عمومية. المقارنة الأخيرة كانت لعبة ركن السيارات الموازية، حيث كانت نسخة فيبل مصنوعة بشكل جيد حقاً،
00:10:13وساعدتنا مرآة الرؤية الخلفية على تقدير مكان تحريك السيارة بدقة أكبر. كانت للعبة زاويتان
00:10:18للكاميرا، لكن كلتيهما كانت تعاني من مشاكل. نظراً لأن إحداهما أظهرت الجانب الخطأ من مساحة وقوف السيارات،
00:10:23بينما أظهرت الأخرى جانباً واحداً فقط بدلاً من إعطائنا رؤية كاملة للطريق أمامنا. وقد جعل ذلك
00:10:27من الصعب رؤية المكان الذي نحرك فيه السيارة، ولو كانت زوايا الكاميرا تلك صحيحة، لكانت اللعبة
00:10:32أكثر واقعية. منحتنا أسترا ثلاثة مناظر ثابتة وأضافت نصائح القيادة في اللوحة الجانبية،
00:10:38مما جعل لعبتها أسهل. وكانت مناظر الكاميرا أفضل بكثير من تلك التي قدمتها فيبل. كانت هذه
00:10:42اختبارات عامة قدمنا فيها للنماذج تفاصيل قليلة جداً حول التصميمات التي نريدها، لذلك كنا نشهد
00:10:48ذوق النموذج نفسه هنا. كلاهما كرر خيارات تصميم رأيناها في أعمالهما الأخرى، لكن كلاهما أنتج
00:10:53نتائج جيدة. ومع مزيد من التفاصيل حول كيف نريد أن تبدو التطبيقات وتشعر بها،
00:10:58نتوقع أن يصمم كلاهما بشكل جيد. إذن بناءً على الذوق وحده، فازت أسترا في المرئيات وسهولة الاستخدام، بينما فازت فيبل في
00:11:04الرسوم المتحركة والتفاعل. ولكن قبل أن ننتقل إلى اختبار التكلفة والسرعة، سيكون من الرائع لو
00:11:09اشتركت في القناة وضغطت على زر الإعجاب. هذا اللفظ البسيط من الدعم يقطع شوطاً طويلاً بالنسبة لنا.
00:11:15المقياس التالي الذي قسناه هو الكفاءة، والتي غطت تكلفة العمل، والوقت الذي استغرقه،
00:11:20وعدد المرات التي استخدم فيها النموذج أدواته لإنجازه. أحد الأمور التي يجب معرفتها حول التكاليف هو أننا
00:11:25لم نستخدم واجهة برمجة التطبيقات (API)، لذا فهذه مجرد تقديرات لمقدار تكلفة العمل إذا استخدمنا الواجهة
00:11:31بناءً على الرموز المستخدمة. لقد أجرنا الاختبارات على اشتراكنا المعتاد. عبر جميع تشغيلات الاختبار، بلغ
00:11:37إجمالي التكلفة المقدرة لـ فيبل 49.18 دولاراً، مقارنة بـ 27.69 دولاراً لـ أسترا، لذا كان إجمالي أسترا أقل بنوالي 44%.
00:11:47أنتجت فيبل ما يقرب من 3 أضعاف رموز الإخراج التي أنتجتها أسترا، تماماً مثل كيفية ذكر دليل توجيه
00:11:52فيبل أنها تميل إلى كتابة أكثر من النماذج الأخرى. كان للنموذجين نفس التكلفة لتلك
00:11:57الرموز، لذا فإن الكتابة أكثر هي ما زاد من تكلفة فيبل. كما أن استخدام الأدوات يزيد من استهلاك الرموز،
00:12:03لأن النمذجة تقرر الأداة المناسبة للاستخدام ثم تقرأ النتائج قبل مواصلة العمل. وعبر جميع
00:12:09التجارب الست، استخدم الوكيل الرئيسي لـ Fable أدواته 443 مرة مقارنة بـ 287 مرة لـ Astra، وهو ما زاد أيضاً من
00:12:17التكلفة. وفي معيار التكلفة، سجلت Astra 80 من أصل 100 مقارنة بـ 66 لـ Fable. أما بالنسبة للسرعة، فقد تقدمت Astra أيضاً
00:12:23بـ 70 مقابل 67 لـ Fable. استغرقت المهام طويلة الأمد حوالي 62 دقيقة في المجمل بالنسبة لـ Astra،
00:12:30مقارنة بـ 73 دقيقة لـ Fable. إذن، عبر درجات التكلفة، والسرعة، وكفاءة الأدوات،
00:12:35تفوقت Astra على Fable. المقياس التالي الذي قسناه كان مدى اتباع التعليمات،
00:12:40حيث تحققنا من مدى دقة اتباع النماذج للتعليمات التي قدمناها أثناء البناء،
00:12:44وما إذا كانت مستمرة في اتباعها مع تقدم العمل. عندما شغلنا Fable على أحد المشاريع،
00:12:49أضافت في البداية رسالة تأليف مشترك تفيد بأن Claude ساعد في كتابة الكود،
00:12:53على الرغم من أن تعليماتنا نصت صراحة على عدم القيام بذلك. كما تجاهلت قاعدة تتعلق بالطريقة المسموحة لها
00:12:58بإنشاء أو تعديل الملفات. لقد أخبرناها باستخدام أدوات تحرير الملفات الخاصة بـ Claude، بحيث تكون تلك التغييرات متتبعة
00:13:04 ويسهل التراجع عنها، لكنها أنشأت ملفين عبر تشغيل الأوامر بدلاً من ذلك. وفي معيار اتباع التعليمات،
00:13:09سجلت Astra 96 من أصل 100 مقارنة بـ 88 لـ Fable. إذن، عندما يتعلق الأمر باتباع التعليمات،
00:13:16فقد تفوق أداء Astra في هذه الاختبارات. المقياس التالي الذي قسناه كان جودة المراجعة، حيث منحنا النماذج
00:13:21مشروعاً يحتوي على مشكلات وطلبنا منها العثور على تلك المشكلات. قمنا أولاً بمنح كلا النموذجين
00:13:27نفس الكود لمراجعته، مع إدراج أربع مشكلات عمداً، لكي نعرف ما تحتاج النماذج للعثور عليه. وجدت Fable
00:13:33جميع المشكلات الأربع، كما وجدت خمس مشكلات إضافية لم نقم بإضافتها، والتي تم
00:13:37فحصها والتحقق منها بعد ذلك. وجدت Astra مشكلتين من أصل الأربع التي أضفناها، لكنها ظلت تخبرنا بأن المراجعة
00:13:42قد اكتملت. تضمنا أيضاً ثلاثة أجزاء بدت مشبوهة، لكنها كانت صحيحة في الواقع، لأننا
00:13:47أردنا معرفة ما إذا كان النموذج سيبلغ عن مشكلات وهمية. لم يتعامل أي منهما مع تلك الأجزاء كأخطاء، لذا فإن
00:13:52الفرق هنا كان في حجم ما عثرت عليه النماذج، وقد قدمت لنا Fable المراجعة الأكثر شمولاً،
00:13:57ولكن عندما اختبرناهما على مشروع أكبر به تسع مشكلات مؤكدة، قامت Astra بإصلاح خمس مشكلات، بينما قامت Fable
00:14:03بالعثور على وإصلاح أربع فقط. لذا أكملت Astra عمليات إصلاح أكثر، على الرغم من أن كليهما ترك عدة مشكلات
00:14:08دون إصلاح. وبالنسبة لجودة المراجعة، والتي تضمنت تلك الإصلاحات وكيفية تدقيق النماذج لأعمالها الأخرى،
00:14:13سجلت Fable 84 مقارنة بـ 78 لـ Astra. لذا تفوقت Fable في النتيجة الإجمالية للمراجعة،
00:14:19لأن Fable قدمت لنا مراجعة أقوى بشكل عام. بناءً على هذه النتائج، تُعد Astra الفائز الأوضح عبر
00:14:25فئات متعددة اختبارناها، لكن هذا لا يعني أن Fable نموذج سيء، فقد أبدت أداءً جيداً
00:14:30عبر المهام، ولم تكن متأخرة كثيراً عن Astra في عدة فئات. لذا عليك فقط اختيار النموذج
00:14:35بناءً على المهام التي تسندها إليه. ولإيصال هذين النموذجين إلى أقصى قدراتهما، هناك
00:14:40ممارسات معينة يجب عليك اتباعها. لقد استخدمنا الكثير منها في اختباراتنا، وإذا كنت تريد الوصول
00:14:45إليها أيضاً، فيمكنك الحصول عليها في AI Labs Pro، وهو مجتمعنا الخاص. لذا إن وجدتم قيمة فيما
00:14:51نقدمه وتترغبون في دعم القناة، فهذه هي الطريقة الأفضل للقيام بذلك. تجدون الرابط في الوصف.
00:14:56وهذا يوصلنا إلى نهاية هذا الفيديو. إذا كنتم ترغبون في دعم القناة ومساعدتنا في الاستمرار بإنشاء
00:15:01فيديوهات كهذه، فيمكنكم فعل ذلك باستخدام زر الشكر المتوفر في الأسفل. وكالعادة،
00:15:05شكراً للمتابعة وأراكم في الفيديو القادم.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기