أوبوس 5 وصل وهل هو أفضل من فيبل؟!‏

CChase AI
컴퓨터/소프트웨어경제 뉴스AI/미래기술

Transcript

00:00:00لقد صدر Claude Opus 5 للتو، وتزعم Anthropic أن لدينا الآن نموذجًا يقترب
00:00:04من مخرجات Fable 5 بنصف التكلفة. فلنلقِ نظرة على ما يقدمونه لنا.
00:00:09دعونا نستعرض بعض أداء الاختبارات المرجعية، ونرى فورًا أرقامًا مذهلة. نلاحظ أنه
00:00:14يتفوق على Fable 5 ويسحق Opus 4.8 تمامًا في عدد من هذه الاختبارات، وتحديدًا
00:00:20البرمجة التفاعلية عبر الطرفية، والعمل المعرفي، والبحث الوكيلي. كما يتفوق على نماذج مثل GPT 5.6
00:00:27في هذه الفئات أيضًا. المجالات الوحيدة التي نرى فيها أداء Opus 5 أقل من Fable 5 هي
00:00:33التفكير متعدد التخصصات، بفارق بسيط جدًا. بل إنه يتفوق عليه عند استخدام الأدوات، وكذلك في
00:00:39المجالات القانونية والصحية. لكنه يتفوق على نموذجهم الأفضل في باقي المجالات. وإذا كانت هذه الأرقام
00:00:46صحيحة، فهذا أمر جنوني. يُذكر هنا أنه في اختبار cursor bench 3.2 بأقصى جهد، حقق النموذج
00:00:51نتيجة بفارق 0.5% فقط عن أعلى نتيجة لـ Fable 5، ولكن بنصف التكلفة لكل مهمة. أمر مذهل! ويمكنكم رؤية ذلك
00:00:57هنا تمامًا. لدينا Opus 5 باللون الأحمر، ثم Fable 5 باللون البرتقالي، وهنا بالأسفل باللون الأزرق يوجد Opus 4.8.
00:01:03نعم، عند أقصى جهد، يتقدم Fable 5 قليلًا، لكن معظم الناس لا يعملون في الواقع
00:01:08عند حد أقصى جهد، بل يعملون عند المستوى العالي أو العالي جدًا. وعندما ننظر إلى المستويين العالي والعالي جدًا
00:01:13مقارنة بـ Fable، فنحن نحصل تقريبًا على نفس المخرجات مع Opus 5، ولكن مجددًا بنحو
00:01:17نصف التكلفة. وفي بعض الاختبارات المرجعية الأخرى، مثل مؤشر وكيل البرمجة للتحليل الاصطناعي،
00:01:23يتفوق Opus 5 بشكل مباشر على Fable 5. ونفس الأمر مع اختبار frontier bench. إنه
00:01:27يتفوق بالفعل على Fable وهو أقل تكلفة. والآن فلنلقِ نظرة على بعض مهام
00:01:32العمل المعرفي وحل المشكلات. ومجددًا، أعتقد أن ما يدعو للذهول حقًا ليس مجرد هذه
00:01:37المقارنة بين Fable 5 وOpus 5، بل القفزة من Opus 4.8 إلى Opus 5. جميع هذه الاختبارات
00:01:43شهدت قفزة هائلة جدًا للأمام. ومجددًا، لو كان الأمر شبيها بـ Sonnet
00:01:495 حيث رأيناه يؤدي بشكل أفضل من النموذج السابق ولكن بتكلفة باهظة للغاية
00:01:53لان Sonnet 5 هو النموذج الأغلى على الإطلاق عند تفكيك التكلفة بحسب
00:01:57حسب المهمة. ليس هذا هو الحال هنا. يبدو أن Opus شديد الكفاءة في استهلاك الرموز مقارنة بهذين
00:02:03النموذجين الآخرين. ومجددًا، حقيقة أنه يتفوق بالفعل على Fable 5 أمر لا أستطيع
00:02:07تجاوزه حقًا. هناك تحسن آخر مثير للاهتمام وهو المخرجات البصرية. إليكم نظرة على Opus 5 وهو يقوم
00:02:13ببعض أعمال نفق الرياح. وهنا نراه يبني نموذجًا تفاعليًا ثلاثي الأبعاد لخلية حيوانية
00:02:19كتطبيق مصغر. إحدى السلبيات في Claude أنه لا يستطيع إنشاء صوره الخاصة، لذا فإن
00:02:24قدرته على الأداء بشكل أفضل مع رسومات SVG ثلاثية الأبعاد التي تشبه رسومات HTML تُعد إنجازًا كبيرًا.
00:02:31تحسن كبير آخر هو ما ذكرته Anthropic بأن النموذج أصبح أstrong بكثير في التحقق من عمله
00:02:35والتكرار بعناية حتى ينحج. ماذا يعني هذا؟ يعني هذا عندما نستخدم Opus 5
00:02:40في المهام الوكيلية طويلة المدى، التي لا تُنجز بضربة واحدة، بل تكون عبارة عن حلقات تكرارية،
00:02:45وهذا يشبه مفهوم هندسة المخططات الذي يتحدث عنه الناس. أي شيء يتطلب من
00:02:49Claude التحقق من عمله مقابل هدف محدد نعطيه إياه ومواصلة تكرار ذلك مرارًا
00:02:53وتكرارًا. حسنا، Opus 5 أفضل بكثير من Opus 4.8 في هذا الجانب. وهناك مثال
00:02:58مثير للاهتمام هنا، حيث أُعطي Opus 5 رسمًا لقطعة آلة وطُلِب منه كتابة كود لإعادة بنائها كنموذج
00:03:03ثلاثي الأبعاد في FreeCAD. لكن لم تُعط للنموذج أي وسيلة لعرض الرسم بالفعل. لذا،
00:03:09طُلِب منه الوصول إلى هذا الهدف دون تحديد طريقة القيام بذلك. فقام بابتكار
00:03:14وكتابة خط معالجة لرؤية الحاسوب لاستخراج الهندسة من البكسلات الخام ثم أعاد بناء
00:03:19قطعة الآلة بالكامل. مجددًا، أي شيء طويل المدى ولديه هدف موجه يسعى للوصول إليه،
00:03:25فإن Opus 5 أفضل بكثير من 4.8 في إنجازه بالفعل. ومن حيث السلوك غير المتوافق،
00:03:29فهو يتفوق أيضًا على كل هذه النماذج السابقة. الأقل هنا هو الأفضل. ونلاحظ زيادة كبيرة في قدرته
00:03:35مقارنة بـ Opus 4.8 في العثور على الثغرات الاستغلالية في الأكواد مفتوحة المصدر. والشيء الرائع الآخر هو
00:03:40ضوابط الأمان. هذا ليس سيناريو كـ Fable حيث إذا ذكرت أي شيء يتعلق بالأمن السيبراني أو علم الأحياء،
00:03:45سيتم إيقافه. قيود الأمان هذه أقل صرامة بكثير في Opus 5 مقارنة بـ Fable 5.
00:03:50ورغم أنه ما تزال هناك بعض أدوات التصنيف، إلا أنهم يقولون إن احتمال تفعيلها أقل بنسبة 85%
00:03:56مقارنة بـ Fable. وأخيرًا، نقطة التحول الكبرى هي التكلفة. كما قلت، هذا بنصف سعر Fable.
00:04:01نحن نتحدث عن 5 دولارات لكل مليون رمز دخل و25 لكل مليون رمز خرج. وكما رأينا من الاختبارات المرجعية
00:04:07في المخططات، يُعد هذا النموذج كفء نسبيًا في استخدام الرموز. لذا أنا متحمس جدًا لتجربته
00:04:12لأنه إذا كانت الأرقام صحيحة، فلدينا تقريبًا نموذج أفضل من Fable بنصف التكلفة.

Key Takeaway

يوفر نموذج Claude Opus 5 أداءً يتفوق على Fable 5 في البرمجة والمهام الوكيلية بنصف التكلفة البالغة 5 دولارات لرموز الدخل و25 دولارًا لرموز الخرج لكل مليون رمز.

Highlights

  • يقدم Claude Opus 5 أداءً يتفوق على Fable 5 وOpus 4.8 وGPT 5.6 في مجالات البرمجة التفاعلية والعمل المعرفي والبحث الوكيلي بنصف التكلفة.

  • ينخفض احتمال تفعيل أدوات تصنيف الأمان القسرية في Opus 5 بنسبة 85% مقارنة بـ Fable 5 مما يمنحه قيودًا أقل صرامة.

  • تصل تكلفة استخدام Opus 5 إلى 5 دولارات لكل مليون رمز دخل و25 دولارًا لكل مليون رمز خرج.

  • حقق النموذج في اختبار cursor bench 3.2 بأقصى جهد نتيجة بفارق 0.5% فقط عن أعلى نتيجة لـ Fable 5.

  • ابتكر النموذج خط معالجة لرؤية الحاسوب واستخرج الهندسة من البكسلات الخام لإعادة بناء قطعة آلة في FreeCAD دون تزويده بوسيلة لعرض الرسم.

Timeline

مقارنة الأداء بين Opus 5 وFable 5 في الاختبارات المرجعية

  • يتفوق Opus 5 على Fable 5 وOpus 4.8 وGPT 5.6 في البرمجة التفاعلية والعمل المعرفي والبحث الوكيلي.
  • تتراجع نتائج Opus 5 أمام Fable 5 بفارق بسيط في التفكير متعدد التخصصات فقط.
  • يحقق Opus 5 ناتجًا مقاربا لـ Fable 5 في المستويين العالي والعالي جدا بنصف التكلفة.

تظهر نتائج الاختبارات المرجعية تفوق Opus 5 في استخدام الأدوات والمجالات القانونية والصحية. يسجل النموذج نتيجة بفارق 0.5% فقط عن Fable 5 في اختبار cursor bench 3.2 عند أقصى جهد. كما يتقدم Opus 5 على Fable 5 مباشرة في مؤشر وكيل البرمجة للتحليل الاصطناعي واختبار frontier bench.

الكفاءة في استهلاك الرموز والتحسينات البصرية

  • شهد Opus 5 قفزة أداء كبرى مقارنة بـ Opus 4.8 مع الحفاظ على كفاءة استهلاك الرموز.
  • ينتج Opus 5 رسومات SVG ثلاثية الأبعاد تفاعلية تشبه تطبيقات HTML المصغرة.

تعد قفزة الأداء بين Opus 4.8 وOpus 5 استثنائية نظرًا لأن Opus 5 يستهلك الرموز بكفاءة عالية على عكس Sonnet 5 الذي ارتفعت تكلفته بالنسبة للمهمة. أظهر النموذج قدرة على بناء نموذج تفاعلي ثلاثي الأبعاد لخلية حيوانية وإجراء محاكاة لنفق الرياح. تعوض هذه القدرة في التعامل مع SVG قيود Claude في إنشاء الصور المباشرة.

المهام الوكيلية طويلة المدى وضوابط الأمان والتكلفة

  • يتميز Opus 5 بقدرة عالية على التحقق من عمله والتكرار الذاتي في المهام الوكيلية طويلة المدى.
  • تقل احتمالية تفعيل أدوات تصنيف الأمان في Opus 5 بنسبة 85% مقارنة بـ Fable 5.
  • تبلغ تسعيرة Opus 5 نحو 5 دولارات لكل مليون رمز دخل و25 دولارًا لكل مليون رمز خرج.

نجح Opus 5 في كتابة خط معالجة لرؤية الحاسوب لاستخراج بيانات هندسية من بكسلات خام وتصميم قطعة آلة ثلاثية الأبعاد في FreeCAD تلقائيًا. يتفوق النموذج على النسخ السابقة في تقليل السلوك غير المتوافق واكتشاف ثغرات الأكواد مفتوحة المصدر. توفر قيود الأمان المرنة وصولاً أسهل لمهام الأمن السيبراني وعلم الأحياء دون إيقاف العملية بنصف سعر Fable.

Community Posts

View all posts