Transcript
00:00:00لقد صدر Claude Opus 5 للتو، وتزعم Anthropic أن لدينا الآن نموذجًا يقترب
00:00:04من مخرجات Fable 5 بنصف التكلفة. فلنلقِ نظرة على ما يقدمونه لنا.
00:00:09دعونا نستعرض بعض أداء الاختبارات المرجعية، ونرى فورًا أرقامًا مذهلة. نلاحظ أنه
00:00:14يتفوق على Fable 5 ويسحق Opus 4.8 تمامًا في عدد من هذه الاختبارات، وتحديدًا
00:00:20البرمجة التفاعلية عبر الطرفية، والعمل المعرفي، والبحث الوكيلي. كما يتفوق على نماذج مثل GPT 5.6
00:00:27في هذه الفئات أيضًا. المجالات الوحيدة التي نرى فيها أداء Opus 5 أقل من Fable 5 هي
00:00:33التفكير متعدد التخصصات، بفارق بسيط جدًا. بل إنه يتفوق عليه عند استخدام الأدوات، وكذلك في
00:00:39المجالات القانونية والصحية. لكنه يتفوق على نموذجهم الأفضل في باقي المجالات. وإذا كانت هذه الأرقام
00:00:46صحيحة، فهذا أمر جنوني. يُذكر هنا أنه في اختبار cursor bench 3.2 بأقصى جهد، حقق النموذج
00:00:51نتيجة بفارق 0.5% فقط عن أعلى نتيجة لـ Fable 5، ولكن بنصف التكلفة لكل مهمة. أمر مذهل! ويمكنكم رؤية ذلك
00:00:57هنا تمامًا. لدينا Opus 5 باللون الأحمر، ثم Fable 5 باللون البرتقالي، وهنا بالأسفل باللون الأزرق يوجد Opus 4.8.
00:01:03نعم، عند أقصى جهد، يتقدم Fable 5 قليلًا، لكن معظم الناس لا يعملون في الواقع
00:01:08عند حد أقصى جهد، بل يعملون عند المستوى العالي أو العالي جدًا. وعندما ننظر إلى المستويين العالي والعالي جدًا
00:01:13مقارنة بـ Fable، فنحن نحصل تقريبًا على نفس المخرجات مع Opus 5، ولكن مجددًا بنحو
00:01:17نصف التكلفة. وفي بعض الاختبارات المرجعية الأخرى، مثل مؤشر وكيل البرمجة للتحليل الاصطناعي،
00:01:23يتفوق Opus 5 بشكل مباشر على Fable 5. ونفس الأمر مع اختبار frontier bench. إنه
00:01:27يتفوق بالفعل على Fable وهو أقل تكلفة. والآن فلنلقِ نظرة على بعض مهام
00:01:32العمل المعرفي وحل المشكلات. ومجددًا، أعتقد أن ما يدعو للذهول حقًا ليس مجرد هذه
00:01:37المقارنة بين Fable 5 وOpus 5، بل القفزة من Opus 4.8 إلى Opus 5. جميع هذه الاختبارات
00:01:43شهدت قفزة هائلة جدًا للأمام. ومجددًا، لو كان الأمر شبيها بـ Sonnet
00:01:495 حيث رأيناه يؤدي بشكل أفضل من النموذج السابق ولكن بتكلفة باهظة للغاية
00:01:53لان Sonnet 5 هو النموذج الأغلى على الإطلاق عند تفكيك التكلفة بحسب
00:01:57حسب المهمة. ليس هذا هو الحال هنا. يبدو أن Opus شديد الكفاءة في استهلاك الرموز مقارنة بهذين
00:02:03النموذجين الآخرين. ومجددًا، حقيقة أنه يتفوق بالفعل على Fable 5 أمر لا أستطيع
00:02:07تجاوزه حقًا. هناك تحسن آخر مثير للاهتمام وهو المخرجات البصرية. إليكم نظرة على Opus 5 وهو يقوم
00:02:13ببعض أعمال نفق الرياح. وهنا نراه يبني نموذجًا تفاعليًا ثلاثي الأبعاد لخلية حيوانية
00:02:19كتطبيق مصغر. إحدى السلبيات في Claude أنه لا يستطيع إنشاء صوره الخاصة، لذا فإن
00:02:24قدرته على الأداء بشكل أفضل مع رسومات SVG ثلاثية الأبعاد التي تشبه رسومات HTML تُعد إنجازًا كبيرًا.
00:02:31تحسن كبير آخر هو ما ذكرته Anthropic بأن النموذج أصبح أstrong بكثير في التحقق من عمله
00:02:35والتكرار بعناية حتى ينحج. ماذا يعني هذا؟ يعني هذا عندما نستخدم Opus 5
00:02:40في المهام الوكيلية طويلة المدى، التي لا تُنجز بضربة واحدة، بل تكون عبارة عن حلقات تكرارية،
00:02:45وهذا يشبه مفهوم هندسة المخططات الذي يتحدث عنه الناس. أي شيء يتطلب من
00:02:49Claude التحقق من عمله مقابل هدف محدد نعطيه إياه ومواصلة تكرار ذلك مرارًا
00:02:53وتكرارًا. حسنا، Opus 5 أفضل بكثير من Opus 4.8 في هذا الجانب. وهناك مثال
00:02:58مثير للاهتمام هنا، حيث أُعطي Opus 5 رسمًا لقطعة آلة وطُلِب منه كتابة كود لإعادة بنائها كنموذج
00:03:03ثلاثي الأبعاد في FreeCAD. لكن لم تُعط للنموذج أي وسيلة لعرض الرسم بالفعل. لذا،
00:03:09طُلِب منه الوصول إلى هذا الهدف دون تحديد طريقة القيام بذلك. فقام بابتكار
00:03:14وكتابة خط معالجة لرؤية الحاسوب لاستخراج الهندسة من البكسلات الخام ثم أعاد بناء
00:03:19قطعة الآلة بالكامل. مجددًا، أي شيء طويل المدى ولديه هدف موجه يسعى للوصول إليه،
00:03:25فإن Opus 5 أفضل بكثير من 4.8 في إنجازه بالفعل. ومن حيث السلوك غير المتوافق،
00:03:29فهو يتفوق أيضًا على كل هذه النماذج السابقة. الأقل هنا هو الأفضل. ونلاحظ زيادة كبيرة في قدرته
00:03:35مقارنة بـ Opus 4.8 في العثور على الثغرات الاستغلالية في الأكواد مفتوحة المصدر. والشيء الرائع الآخر هو
00:03:40ضوابط الأمان. هذا ليس سيناريو كـ Fable حيث إذا ذكرت أي شيء يتعلق بالأمن السيبراني أو علم الأحياء،
00:03:45سيتم إيقافه. قيود الأمان هذه أقل صرامة بكثير في Opus 5 مقارنة بـ Fable 5.
00:03:50ورغم أنه ما تزال هناك بعض أدوات التصنيف، إلا أنهم يقولون إن احتمال تفعيلها أقل بنسبة 85%
00:03:56مقارنة بـ Fable. وأخيرًا، نقطة التحول الكبرى هي التكلفة. كما قلت، هذا بنصف سعر Fable.
00:04:01نحن نتحدث عن 5 دولارات لكل مليون رمز دخل و25 لكل مليون رمز خرج. وكما رأينا من الاختبارات المرجعية
00:04:07في المخططات، يُعد هذا النموذج كفء نسبيًا في استخدام الرموز. لذا أنا متحمس جدًا لتجربته
00:04:12لأنه إذا كانت الأرقام صحيحة، فلدينا تقريبًا نموذج أفضل من Fable بنصف التكلفة.