Opus 5 يتغلب على Fable... وبنصف السعر؟

BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00أصدرت شركة Anthropic للتو نموذج Claude Opus 5، وقد يكون بالفعل أفضل من Fable
00:00:04مع أن سعره يعادل النصف فقط. إذا كان هذا صحيحًا، فهو نموذجي المفضل الجديد، لنكتشف ذلك.
00:00:13إليكم كيف يصفون Opus 5. إنه نموذج واعي ومبادِر يقترب
00:00:18من ذكاء Claude Fable 5 الفائق بنصف السعر. في البرمجة والمهام المعرفية
00:00:23وفقًا لتقييمات مثل Frontier Bench وGDP Val، يُعد Opus 5 المستوى الأحدث والأعلى، لكنه يظل
00:00:28متخلفًا عن Mythos 5 في مهام الأمن السيبراني. صُمم Opus 5 للاستخدام اليومي، وهو يعمل
00:00:33بكفاءة أكبر من النماذج الأخرى، وهو النموذج الافتراضي الجديد في Claude Max وأقوى نموذج
00:00:38في خطط Claude Pro. بعد ذلك، يستعرضون نتائج الاختبارات القياسية، وهو يتفوق في كثير منها
00:00:43رغم وجود Fable 5، والتفوق ليس بفارق ضئيل حتى. وفقًا
00:00:47لبياناتهم، فهو أفضل بنسبة 10% تقريبًا في Frontier Bench من Fable 5، لكن النتيجة الأكثر إذهالاً بالنسبة لي
00:00:52هي درجته في Arc AGI. حقق Opus 4.8 نسبة 1.5% هنا، بينما حقق Sol نسبة 7.8% وكان الرقم القياسي
00:01:00السابق، لكن Opus 5 حقق 30.2%. أظهر الفريق المسؤول عن هذا الاختبار القياسي أن لدى Opus قدرة
00:01:06جديدة لم يروها من قبل في أي نموذج آخر، حيث يحول هذه الاختبارات إلى
00:01:10تدوين جبري لإجراء استدلال منطقي متقدم. هذا أمر مثير للإعجاب حقًا.
00:01:15إذا كنت تتساءل عن سبب غياب Fable عن هذه القائمة، فذلك بسبب سياسة حفظ البيانات
00:01:19الخاصة بـ Fable. لا يريد فريق Arc AGI المخاطرة بتسريب تفاصيل هذا الاختبار القياسي إلى Anthropic، لكن
00:01:24الخبر السار هو أن Opus 5 لا يخضع لمتطلبات حفظ البيانات للاستخدام العام. هذا الأمر
00:01:29سيسعد الكثير من الناس جداً. بالانتقال إلى موضوع آخر، لنلقِ نظرة على اختبارات الطرف الثالث من
00:01:33Artificial Analysis. في مؤشر البرمجة، يأتي في المرتبة الثانية بفارق 0.3 نقطة فقط عن GPT 5.6 Sol Extra High
00:01:39لكنه يتفوق على Fable بـ 1.5 نقطة، ويمثل قفزة ممتازة مقارنة بـ Opus 4.8.
00:01:45تحية خاصة لـ Kimi K3 هنا بالمناسبة لتمكنه من منافسة الكبار. لقد أعددت فيديو عنه
00:01:49عند إطلاقه، لذا ينبغي لك الاشتراك لمتابعة أحدث أخبار الذكاء الاصطناعي
00:01:52والمطورين. وإذا نظرنا إلى مؤشر الوكلاء الذكيين (Agentic Index)، فإن Opus 5 يتصدر القائمة
00:01:57هنا، متفوقًا بفارق بسيط عن Fable 5 ومتغلبًا على نموذج sol من OpenAI. وتتكرر
00:02:02في مؤشر الذكاء، حيث يتفوق Opus 5 هناك أيضًا. إذن من ناحية الأداء
00:02:06يبدو أن Opus 5 نموذج ممتاز للغاية، وبصراحة، أنا متفاجئ جدًا. كنت أظن
00:02:11أن Fable هو التركيز الأساسي لهم الآن، وأن Opus سيصبح شبيهًا بنموذج
00:02:15Sonic الجديد، لكن يبدو الآن أن Fable وOpus متقاربان للغاية، حتى نأخذ
00:02:19التسعير في الحسبان. إذا نظرنا إلى تكلفة إكمال المهمة على Artificial Analysis، فإن Opus 5
00:02:23أرخص بـ 72 سنتًا من Fable 5، وأغلى بقليل فقط من
00:02:28Opus 4.8. أما إذا كنت تبحث عن الأداء مقابل السعر، فإن GPT 5.6 Sol
00:02:33لا يزال الفائز هنا، حيث يكلف نصف سعر Opus 5 تقريبًا. يمكنك أن ترى
00:02:37في هذا المخطط حيث الربع الأخضر هو الأكثر جاذبية، تقع نماذج GPT فيه تقريبًا،
00:02:42إلى جانب Kimi K3، بينما تملك نماذج Anthropic قسمها الخاص في الفئة الأعلى سعرًا.
00:02:46كما يعكس Cursor Bench جميع هذه الاختبارات القياسية التي اطلعنا عليها. هنا،
00:02:50حقق Opus 5 Max تقريبًا نفس درجة Fable 5، لكن Fable يكلف 17 دولارًا لتلك
00:02:56المهمة، بينما يكلف Opus 8 دولارات. السعر نفسه بالمناسبة هو نفس سعر Opus 4.8، أي
00:03:015 دولارات لكل مليون رمز مدخلات، و25 دولارًا لكل مليون رمز مخرجات، لذا إن كنت من معجبي
00:03:06Opus 4.8، فلا أرى أي سبب يمنعك من استخدام هذا النموذج، وبصفتي معجبًا
00:03:10بـ Fable 5، سأستخدم Opus 5 كثيرًا بالتأكيد لتوفير اشتراكي
00:03:14ورصيدي حتى لا ينفدا سريعًا. بصراحة، تخميني الأفضل بشأن Fable مقابل Opus
00:03:18هو أن Fable سيظل النموذج الأفضل إذا كنت تريد حل مشاكل صعبة وطويلة المدى،
00:03:23لكن لـ 95% من الأعمال، يمكن لـ Opus 5 أن يحل محله. لننتقل الآن ونشاهده
00:03:28في العمل عبر بعض الاختبارات المحلية. كان الاختبار الأول هو طلب إنشاء
00:03:32لعبة سباق فورمولا 1 كاملة في ملف HTML واحد باستخدام Three.js. سأتحدث عن الوقت الذي استغرقه
00:03:37كل نموذج والتكلفة في واجهة البرمجة (API) في النهاية، لكن أولاً دعونا
00:03:40نرى النتائج. هذه هي النتيجة التي أعطاني إياها Opus 5، ويجب أن أقول إنني منبهر
00:03:45جداً بالنماذج هنا. لم يستخدم أي عناصر خارجية أو ما شابه بنفسه. كل هذا
00:03:50تم بواسطة Opus 5، وكل شيء يبدو ممتازًا. تصميم المسار كان مقلوبًا نوعًا ما هناك،
00:03:55لكن نظام التحكم جيد كليًا. أوقات اللفات تعمل، وتحديد المواقع والترتيب يعملان،
00:03:59كل ذلك يعمل ببراعة. نعم، نحن نقود تحت العشب هنا، لكن يمكنك رؤية نظام التصادم يعمل،
00:04:03وهناك مسار بالفعل أسفل هذا العشب، لذا يمكنني تعديل ذلك بسهولة عبر الأوامر.
00:04:07كما أن مصائد الحصى تعمل بشكل رائع أيضًا. بصراحة، أنا منبهر جدًا بالنتيجة
00:04:12التي حصلنا عليها من Opus 5 هنا. سيارات الفورمولا 1 هذه تبدو الأفضل من بين الجميع في رأيي.
00:04:16سأترك لك القرار على أي حال. هذه هي النتيجة التي أعطاني إياها Fable. أعتقد أنها ممتازة
00:04:20أيضًا من حيث تصميم المسار، لكن السيارات أبسط قليلاً مما حصلنا عليه من Opus 5.
00:04:25أعجبتني حقًا اهتزازات الكاميرا عند انعطاف السيارة، ومرة أخرى، جميع
00:04:28الميزات الأخرى تعمل مثل تحديد الموقع والتوقيت. إذن فقد قام Fable 5
00:04:33بعمل رائع أيضًا، لكنني أُفضل نتيجة Opus بصراحة. وهذه هي النتيجة
00:04:37التي حصلت عليها من GPT 5.6 Soul بأقصى جهد. أستطيع القول إنه قدم عملاً جيدًا في
00:04:43النمذجة وزاوية الكاميرا، لكن كما ترى لا يوجد مسار، وهناك بعض
00:04:47العناصر المقلوبة، وفي منتصف الطريق يتنقطع المسار. لذا فقد قدم أداءً
00:04:51أسوأ في رأيي مقارنة بـ Fable وOpus. وأعتقد جازمًا أن Opus لا يزال
00:04:56المتفوق هنا. آخر نموذج اختبرته هو Kimi K3، وهذه هي النتيجة التي قدمها،
00:05:01وهي مبهرة للغاية لنموذج مفتوح الأوزان. لقد أدى عملاً جيداً جداً،
00:05:05ومشابهاً لـ GPT 5.6 Soul. الحواجز والمسار وكل شيء يعمل،
00:05:09تحديد المواقع، كل شيء يعمل. لقد بنى لعبة جميلة من محاولة واحدة. وإذا ألقينا
00:05:14نظرة على تكلفة وأوقات تلك الجولات، فإن Opus 5 استغرق 46 دقيقة و51 ثانية
00:05:19لإنهاء لعبة F1، وكانت تكلفته ستبلغ 12.99 دولاراً عبر الـ API. بالنسبة لي،
00:05:25كان Opus 5 أغلى من Fable هنا، وبتدقيق الأمر تبين أنه استخدم
00:05:30خمسة أضعاف عدد الرموز. آمل حقاً أن تكون هذه حالة استثنائية، فالاختبارات الأخرى لم
00:05:35تشر إلى الأمر نفسه. أود الإشارة إلى أنني أحسب تكلفة نماذج Claude عبر أداة استخدام Claude Code،
00:05:39لذا قد تكون هناك بعض الأخطاء في الدقة، حيث لا تحصل على السعر الدقيق عند
00:05:44استخدام الاشتراك. وكما قلت سابقًا، هذه النماذج لا تزال فائقة، لذا إذا انتقلت
00:05:49إلى نموذج مثل GPT 5.6، فستحصل على نموذج أسرع وأرخص، لكن النتائج كانت
00:05:54أسوأ في رأيي. لنجرب اختبارًا آخر. هذه المرة طلبت منهم إنشاء لوحة تحكم
00:05:58لإدارة المالية الشخصية، لتكون تطبيقًا كاملاً (Full Stack) بواجهة أمامية وخلفية،
00:06:02كما حددت بعض الميزات لإضافتها. وهذه هي النتيجة التي حصلت عليها
00:06:06مع Opus 5، ويجب أن أقول إنني منبهر حقًا. أعجبتني الواجهة، فهو
00:06:11الأسلوب الذي أفضله شخصيًا. أخبروني في التعليقات إذا أعجبكم أيضًا، وكل شيء
00:06:15يعمل بشكل كامل. لقد اختبرت جميع الميزات وهي تعمل، وهناك صفحات منفصلة لكل
00:06:20ميزة طلبتها، والربط متكامل بين الواجهة الأمامية
00:06:24والخلفية. لقد أحببت تصميم الواجهة الذي اختاره بجدية، وأعتقد أنه الأفضل
00:06:28من بينها جميعًا. بالنسبة للكود، استخدم React وReact Router في الواجهة الأمامية وهو ما
00:06:33أفضله جدًا، وفي الواجهة الخلفية حصل على نقاط إضافية لاستخدامه قاعدة بيانات حقيقية.
00:06:37استخدم Node SQLite لقاعدة البيانات، واستخدم Express للخادم. وهذه هي النتيجة
00:06:42التي أعطاني إياها Fable 5. أنا أُفضل واجهة Opus 5، لكن هذه ليست سيئة أيضًا،
00:06:48على الرغم من أن هذه المخططات عديمة الفائدة نوعًا ما بصراحة. هذا المخطط السفلي جميل، ومجددًا
00:06:53كل الميزات تعمل. أعتقد فقط أن Opus 5 بذل جهدًا أكبر في الواجهة، وهو
00:06:57بالتأكيد أفضل في هذا الجانب. في البرمجة، قام بشيء مشابه لـ Opus 5 واستخدم
00:07:01React، لكني أشير إلى أنه لم يحدد مكتبة توجيه (Routing)، بل قام ببناء مكتبة توجيه
00:07:05صغيرة بنفسه. كنت لأفضل لو التزم بـ React Router مثلاً،
00:07:09وفيم يتعلق بقاعدة البيانات، استخدم Node SQLite أيضاً، والبرنامج
00:07:13مبني على Express، لذا فالواجهة الخلفية متشابهة جدًا، لكن Opus اختار
00:07:18البيئة البرمجية (Stack) الأفضل للواجهة الأمامية. هذا ما قدمه GPT 5.6 Sol، ويجب القول إنه ينافس
00:07:22في تصميم الواجهة، حيث يضاهي Opus تمامًا. إنه أسلوب مختلف والمسألة تعود
00:07:26للتفضيل الشخصي، لكني أحببته حقًا. لقد قام بعمل
00:07:31مذهل في تخطيط الواجهة، وكل الميزات تعمل، لكن هذا النموذج
00:07:35لم يستعرض الميزات في صفحات منفصلة، بل يكتفي بالانتقال إلى أجزاء مختلفة
00:07:38من الصفحة نفسها. كما اختار البيئة الأكثر تميزاً بين الجميع، حيث استخدم NextJS مع
00:07:43Drizzle لقاعدة البيانات وهو نهج ممتاز لمثل هذا المشروع.
00:07:47لكنه استخدم أيضًا Cloudflare وVinext لاستضافته، وهو قرار غريب نوعًا ما
00:07:52لأن Vinext في مراحله الأولى ولم يتم اختباره بشكل كافٍ، ويبدو أنهم يدرجون
00:07:56تعليمات في الأوامر لإجباره على استخدام Cloudflare وVinext.
00:08:00وكما قلت في فيديو Kimi K3، ربما لأن هذه هي طريقة عمل مواقع ChatGPT
00:08:04المستضافة. أخيرًا، النموذج الأخير الذي اختبرته هو Kimi K3، وهذه هي النتيجة
00:08:09التي حصلنا عليها، وقد أدى عملًا جيدًا جدًا. الواجهة تشبه ما كنت أحصل عليه
00:08:14من GPT 5.4 أو 5.5، لذا أرى أنه متأخر قليلاً في تصميم الواجهة، لكن جميع الميزات
00:08:19تعمل، ولا يمكنني التذمر من الواجهة. إنها تؤدي المطلوب تمامًا.
00:08:24لكن الكود يفقد بعض النقاط. لقد اختار React للواجهة الأمامية،
00:08:28وبنى مكتبة توجيه خاصة به كما فعل Fable، وعند الانتقال إلى الخادم،
00:08:32نجد خادم Express فقط، دون إنشاء أي قاعدة بيانات باستخدام Node SQLite
00:08:36أو غيرها، بل أنشأ قاعدة بياناته باستخدام JavaScript عبر حفظ البيانات
00:08:40في ملف JSON. هذا النهج ليس ما أفضله على الإطلاق.
00:08:44بالنسبة للوقت والتكلفة في اختبار التطبيق المالي، كان Fable الأغلى
00:08:48بتكلفة 30.79 دولارًا، واستغرق 56 دقيقة و55 ثانية، ولكن مع Opus يبدو السعر
00:08:55قريبًا جدًا من Fable، حيث كلفني 29.82 دولارًا، واستغرق وقتًا أطول بـ 59 دقيقة و15
00:09:02ثانية. أسعار نماذج GPT ممتازة جدًا بالمقارنة، فهي أرخص بثلاث مرات
00:09:07ونصف تقريبًا، وآمل أن تؤدي هذه المنافسة إلى تخفيض أسعار Anthropic.
00:09:11النتائج متباينة بالنسبة لي. لقد أجريت كل اختبار مرة واحدة فقط وقمت باختبارين فقط،
00:09:16لذا آمل أن تكون اختبارات Artificial Analysis أكثر دقة، والتي تشير إلى أن Opus
00:09:20يعادل ثلث سعر Fable، وسيتعين علي استخدامه أكثر للتأكد من ذلك.
00:09:24ربما تعود المشكلة للأداة التي استخدمتها لقياس التكاليف. ميزة أخرى لصالح Opus
00:09:28هي أنه أقل صرامة في مهام الأمن السيبراني مقارنة بـ Fable 5. الضمانات تشبه
00:09:33Opus 4.8، مع حماية أشد في نطاق ضيق من المهام السيبرانية.
00:09:37يبدو أن القيود تسمح لـ Opus 5 باكتشاف الثغرات في الكود المصدري،
00:09:42لكنها تحظر فحص الثغرات القائم على الملفات الثنائية، واختبارات الاختراق
00:09:46وإنشاء الثغرات. أظهرت اختباراتهم أن أدوات الحماية تتدخل بنسبة أقل بـ 85%
00:09:51مقارنة بـ Fable 5. إذن، المنافسة بين النماذج مثيرة للإعجاب حقًا
00:09:55في الوقت الحالي. لدينا GPT 5.6 الذي يثبت إمكانية تخفيض الأسعار، ونماذج مفتوحة مثل Kimi
00:10:00تنافس النماذج الكبرى في الذكاء، وشركة Anthropic تدفع بمستوى
00:10:04الذكاء إلى آفاق أبعد باستمرار. ما هو نموذجك المفضل، وهل أعجبك Opus؟
00:10:09أخبرني في التعليقات أدناه، ولا تنسَ الاشتراك، وإلى اللقاء في الفيديو القادم.

Key Takeaway

يقدم نموذج Claude Opus 5 أداءً متفوقاً في البرمجة والمهام المعرفية يضاهي وينافس Fable 5 مع خفض التكلفة إلى النصف والحد من القيود البرمجية بنسبة 85%.

Highlights

  • حقّق نموذج Claude Opus 5 نسبة 30.2% في اختبار Arc AGI مقارنة بنسبة 1.5% للنسخة السابقة Opus 4.8 عبر تحويل الاختبارات إلى تدوين جبري لإجراء استدلال منطقي متقدم.

  • يتفوّق Opus 5 على Fable 5 في مؤشر البرمجة بمقدار 1.5 نقطة على منصة Artificial Analysis وبسعر يصل إلى نصف التكلفة في مهام مثل Cursor Bench.

  • تقلّ تدخلات أدوات الحماية والقيود الأمنية في Opus 5 بنسبة 85% مقارنة بـ Fable 5 مما يتيح له اكتشاف ثغرات الكود المصدري بسهولة أكبر.

  • تكلفة الرموز في Opus 5 هي 5 دولارات لكل مليون رمز مدخلات و25 دولاراً لكل مليون رمز مخرجات، وهي نفس تسعيرة Opus 4.8.

  • نجح Opus 5 في بناء تطبيق كامل لإدارة المالية الشخصية باستخدام React وExpress وNode SQLite مع ربط تام وقواعد بيانات حقيقية.

Timeline

مواصفات Claude Opus 5 ونتائج الاختبارات القياسية

  • يقدّم Opus 5 مستويات ذكاء تقترب من Fable 5 بنصف السعر كنموذج افتراضي جديد لخطط Claude Pro وMax.
  • سجّل النموذج قفزة نوعية في اختبار Arc AGI بجمعه 30.2% مقابل 7.8% للرقم القياسي السابق.
  • يحول Opus 5 مسائل Arc AGI إلى تدوين جبري لإجراء استدلال منطقي معقد لم يظهر في النماذج السابقة.

يتميز النموذج بقدرات موجهة للاستخدام اليومي والمهام المعرفية والبرمجة وفق تقييمات Frontier Bench وGDP Val. وتتيح سياسة الاستخدام العام لـ Opus 5 عدم إخضاعه لمتطلبات حفظ البيانات الصارمة المطبقة على Fable 5، مما يسمح باختباره بحرية أكبر في تقييمات مثل Arc AGI.

مقارنة الأداء والتسعير مقابل النماذج المنافسة

  • يتصدر Opus 5 مؤشر الوكلاء الذكيين (Agentic Index) ويتخلف بفارق 0.3 نقطة فقط عن GPT 5.6 Sol في مؤشر البرمجة.
  • تبلغ تكلفة Opus 5 نحو 5 دولارات لمليون رمز مدخلات و25 دولاراً لمليون رمز مخرجات.
  • تكلفة إنجاز المهمة على Cursor Bench تنخفض من 17 دولاراً مع Fable 5 إلى 8 دولارات مع Opus 5 Max.

تُظهر بيانات Artificial Analysis أن Opus 5 يقدم كفاءة عالية مقابل السعر مقارنة بـ Fable 5، رغم استمرار GPT 5.6 Sol في الاستحواذ على فئة الأداء الأرخص. يستطيع Opus 5 استبدال Fable 5 في 95% من المهام اليومية مع الاحتفاظ بـ Fable للمشاكل المعقدة طويلة المدى.

اختبار محاكاة سباق فورمولا 1 باستخدام Three.js

  • أنشأ Opus 5 لعبة F1 كاملة في ملف HTML واحد باستخدام عناصر مصممة ذاتياً بنجاح.
  • استغرق بناء اللعبة بواسطة Opus 5 زهاء 46 دقيقة و51 ثانية بتكلفة 12.99 دولاراً عبر API.
  • استهلك Opus 5 خمسة أضعاف عدد الرموز مقارنة بـ Fable 5 في هذا الاختبار المحدد.

نجح Opus 5 في تقديم مجسمات سيارات ونظام تصادم وتوقيت لفات متفوق على باقي النماذج دون استخدام مكتبات خارجية. وعلى الرغم من جودة النتيجة البصرية والبرمجية، أدى الاستهلاك العالي للرموز إلى رفع تكلفة التشغيل عبر واجهة البرمجة مقارنة بـ Fable 5 وGPT 5.6 Sol.

بناء تطبيق مالية شخصية full-stack

  • أنشأ Opus 5 تطبيقاً مالياً متكاملاً يعتمد على React Router وExpress وقاعدة بيانات Node SQLite.
  • بلغت تكلفة بناء التطبيق عبر Opus 5 نحو 29.82 دولاراً خلال 59 دقيقة و15 ثانية.
  • تغلب Opus 5 على Fable 5 وKimi K3 في هيكلة البيئة البرمجية وفصل الصفحات.

قدّم Opus 5 أفضل تصميم واجهة مستخدم مع ربط حقيقي بين الواجهة الأمامية والخلفية وقواعد البيانات. في المقابل، لجأ Fable 5 وKimi K3 إلى حلول برمجية مخصصة مثل بناء مكتبات توجيه ذاتية أو تخزين البيانات في ملفات JSON بدلاً من قواعد البيانات الفعلية.

قيود الأمن السيبراني والمؤشرات العامة

  • تنخفض تدخلات حظر الأمان في Opus 5 بنسبة 85% مقارنة بـ Fable 5.
  • يسمح النموذج باكتشاف ثغرات الكود المصدري مع حظر الفحص القائم على الملفات الثنائية.
  • تتزايد المنافسة بين النماذج التجارية والمفتوحة المصدر لتوفير ذكاء أعلى بتكلفة أقل.

تتجه الضمانات الأمنية في Opus 5 لتكون مشابهة لـ Opus 4.8 مع التركيز على نطاق ضيق من المخاطر السيبرانية. يتيح هذا النهج للمطورين إجراء فحص واستكشاف للثغرات البرمجية في الكود المصدري بحرية أكبر دون الاصطدام بملفات الحظر المتكررة.

Community Posts

View all posts