Opus 5 يتغلب على Fable... وبنصف السعر؟
BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00أصدرت شركة Anthropic للتو نموذج Claude Opus 5، وقد يكون بالفعل أفضل من Fable
00:00:04مع أن سعره يعادل النصف فقط. إذا كان هذا صحيحًا، فهو نموذجي المفضل الجديد، لنكتشف ذلك.
00:00:13إليكم كيف يصفون Opus 5. إنه نموذج واعي ومبادِر يقترب
00:00:18من ذكاء Claude Fable 5 الفائق بنصف السعر. في البرمجة والمهام المعرفية
00:00:23وفقًا لتقييمات مثل Frontier Bench وGDP Val، يُعد Opus 5 المستوى الأحدث والأعلى، لكنه يظل
00:00:28متخلفًا عن Mythos 5 في مهام الأمن السيبراني. صُمم Opus 5 للاستخدام اليومي، وهو يعمل
00:00:33بكفاءة أكبر من النماذج الأخرى، وهو النموذج الافتراضي الجديد في Claude Max وأقوى نموذج
00:00:38في خطط Claude Pro. بعد ذلك، يستعرضون نتائج الاختبارات القياسية، وهو يتفوق في كثير منها
00:00:43رغم وجود Fable 5، والتفوق ليس بفارق ضئيل حتى. وفقًا
00:00:47لبياناتهم، فهو أفضل بنسبة 10% تقريبًا في Frontier Bench من Fable 5، لكن النتيجة الأكثر إذهالاً بالنسبة لي
00:00:52هي درجته في Arc AGI. حقق Opus 4.8 نسبة 1.5% هنا، بينما حقق Sol نسبة 7.8% وكان الرقم القياسي
00:01:00السابق، لكن Opus 5 حقق 30.2%. أظهر الفريق المسؤول عن هذا الاختبار القياسي أن لدى Opus قدرة
00:01:06جديدة لم يروها من قبل في أي نموذج آخر، حيث يحول هذه الاختبارات إلى
00:01:10تدوين جبري لإجراء استدلال منطقي متقدم. هذا أمر مثير للإعجاب حقًا.
00:01:15إذا كنت تتساءل عن سبب غياب Fable عن هذه القائمة، فذلك بسبب سياسة حفظ البيانات
00:01:19الخاصة بـ Fable. لا يريد فريق Arc AGI المخاطرة بتسريب تفاصيل هذا الاختبار القياسي إلى Anthropic، لكن
00:01:24الخبر السار هو أن Opus 5 لا يخضع لمتطلبات حفظ البيانات للاستخدام العام. هذا الأمر
00:01:29سيسعد الكثير من الناس جداً. بالانتقال إلى موضوع آخر، لنلقِ نظرة على اختبارات الطرف الثالث من
00:01:33Artificial Analysis. في مؤشر البرمجة، يأتي في المرتبة الثانية بفارق 0.3 نقطة فقط عن GPT 5.6 Sol Extra High
00:01:39لكنه يتفوق على Fable بـ 1.5 نقطة، ويمثل قفزة ممتازة مقارنة بـ Opus 4.8.
00:01:45تحية خاصة لـ Kimi K3 هنا بالمناسبة لتمكنه من منافسة الكبار. لقد أعددت فيديو عنه
00:01:49عند إطلاقه، لذا ينبغي لك الاشتراك لمتابعة أحدث أخبار الذكاء الاصطناعي
00:01:52والمطورين. وإذا نظرنا إلى مؤشر الوكلاء الذكيين (Agentic Index)، فإن Opus 5 يتصدر القائمة
00:01:57هنا، متفوقًا بفارق بسيط عن Fable 5 ومتغلبًا على نموذج sol من OpenAI. وتتكرر
00:02:02في مؤشر الذكاء، حيث يتفوق Opus 5 هناك أيضًا. إذن من ناحية الأداء
00:02:06يبدو أن Opus 5 نموذج ممتاز للغاية، وبصراحة، أنا متفاجئ جدًا. كنت أظن
00:02:11أن Fable هو التركيز الأساسي لهم الآن، وأن Opus سيصبح شبيهًا بنموذج
00:02:15Sonic الجديد، لكن يبدو الآن أن Fable وOpus متقاربان للغاية، حتى نأخذ
00:02:19التسعير في الحسبان. إذا نظرنا إلى تكلفة إكمال المهمة على Artificial Analysis، فإن Opus 5
00:02:23أرخص بـ 72 سنتًا من Fable 5، وأغلى بقليل فقط من
00:02:28Opus 4.8. أما إذا كنت تبحث عن الأداء مقابل السعر، فإن GPT 5.6 Sol
00:02:33لا يزال الفائز هنا، حيث يكلف نصف سعر Opus 5 تقريبًا. يمكنك أن ترى
00:02:37في هذا المخطط حيث الربع الأخضر هو الأكثر جاذبية، تقع نماذج GPT فيه تقريبًا،
00:02:42إلى جانب Kimi K3، بينما تملك نماذج Anthropic قسمها الخاص في الفئة الأعلى سعرًا.
00:02:46كما يعكس Cursor Bench جميع هذه الاختبارات القياسية التي اطلعنا عليها. هنا،
00:02:50حقق Opus 5 Max تقريبًا نفس درجة Fable 5، لكن Fable يكلف 17 دولارًا لتلك
00:02:56المهمة، بينما يكلف Opus 8 دولارات. السعر نفسه بالمناسبة هو نفس سعر Opus 4.8، أي
00:03:015 دولارات لكل مليون رمز مدخلات، و25 دولارًا لكل مليون رمز مخرجات، لذا إن كنت من معجبي
00:03:06Opus 4.8، فلا أرى أي سبب يمنعك من استخدام هذا النموذج، وبصفتي معجبًا
00:03:10بـ Fable 5، سأستخدم Opus 5 كثيرًا بالتأكيد لتوفير اشتراكي
00:03:14ورصيدي حتى لا ينفدا سريعًا. بصراحة، تخميني الأفضل بشأن Fable مقابل Opus
00:03:18هو أن Fable سيظل النموذج الأفضل إذا كنت تريد حل مشاكل صعبة وطويلة المدى،
00:03:23لكن لـ 95% من الأعمال، يمكن لـ Opus 5 أن يحل محله. لننتقل الآن ونشاهده
00:03:28في العمل عبر بعض الاختبارات المحلية. كان الاختبار الأول هو طلب إنشاء
00:03:32لعبة سباق فورمولا 1 كاملة في ملف HTML واحد باستخدام Three.js. سأتحدث عن الوقت الذي استغرقه
00:03:37كل نموذج والتكلفة في واجهة البرمجة (API) في النهاية، لكن أولاً دعونا
00:03:40نرى النتائج. هذه هي النتيجة التي أعطاني إياها Opus 5، ويجب أن أقول إنني منبهر
00:03:45جداً بالنماذج هنا. لم يستخدم أي عناصر خارجية أو ما شابه بنفسه. كل هذا
00:03:50تم بواسطة Opus 5، وكل شيء يبدو ممتازًا. تصميم المسار كان مقلوبًا نوعًا ما هناك،
00:03:55لكن نظام التحكم جيد كليًا. أوقات اللفات تعمل، وتحديد المواقع والترتيب يعملان،
00:03:59كل ذلك يعمل ببراعة. نعم، نحن نقود تحت العشب هنا، لكن يمكنك رؤية نظام التصادم يعمل،
00:04:03وهناك مسار بالفعل أسفل هذا العشب، لذا يمكنني تعديل ذلك بسهولة عبر الأوامر.
00:04:07كما أن مصائد الحصى تعمل بشكل رائع أيضًا. بصراحة، أنا منبهر جدًا بالنتيجة
00:04:12التي حصلنا عليها من Opus 5 هنا. سيارات الفورمولا 1 هذه تبدو الأفضل من بين الجميع في رأيي.
00:04:16سأترك لك القرار على أي حال. هذه هي النتيجة التي أعطاني إياها Fable. أعتقد أنها ممتازة
00:04:20أيضًا من حيث تصميم المسار، لكن السيارات أبسط قليلاً مما حصلنا عليه من Opus 5.
00:04:25أعجبتني حقًا اهتزازات الكاميرا عند انعطاف السيارة، ومرة أخرى، جميع
00:04:28الميزات الأخرى تعمل مثل تحديد الموقع والتوقيت. إذن فقد قام Fable 5
00:04:33بعمل رائع أيضًا، لكنني أُفضل نتيجة Opus بصراحة. وهذه هي النتيجة
00:04:37التي حصلت عليها من GPT 5.6 Soul بأقصى جهد. أستطيع القول إنه قدم عملاً جيدًا في
00:04:43النمذجة وزاوية الكاميرا، لكن كما ترى لا يوجد مسار، وهناك بعض
00:04:47العناصر المقلوبة، وفي منتصف الطريق يتنقطع المسار. لذا فقد قدم أداءً
00:04:51أسوأ في رأيي مقارنة بـ Fable وOpus. وأعتقد جازمًا أن Opus لا يزال
00:04:56المتفوق هنا. آخر نموذج اختبرته هو Kimi K3، وهذه هي النتيجة التي قدمها،
00:05:01وهي مبهرة للغاية لنموذج مفتوح الأوزان. لقد أدى عملاً جيداً جداً،
00:05:05ومشابهاً لـ GPT 5.6 Soul. الحواجز والمسار وكل شيء يعمل،
00:05:09تحديد المواقع، كل شيء يعمل. لقد بنى لعبة جميلة من محاولة واحدة. وإذا ألقينا
00:05:14نظرة على تكلفة وأوقات تلك الجولات، فإن Opus 5 استغرق 46 دقيقة و51 ثانية
00:05:19لإنهاء لعبة F1، وكانت تكلفته ستبلغ 12.99 دولاراً عبر الـ API. بالنسبة لي،
00:05:25كان Opus 5 أغلى من Fable هنا، وبتدقيق الأمر تبين أنه استخدم
00:05:30خمسة أضعاف عدد الرموز. آمل حقاً أن تكون هذه حالة استثنائية، فالاختبارات الأخرى لم
00:05:35تشر إلى الأمر نفسه. أود الإشارة إلى أنني أحسب تكلفة نماذج Claude عبر أداة استخدام Claude Code،
00:05:39لذا قد تكون هناك بعض الأخطاء في الدقة، حيث لا تحصل على السعر الدقيق عند
00:05:44استخدام الاشتراك. وكما قلت سابقًا، هذه النماذج لا تزال فائقة، لذا إذا انتقلت
00:05:49إلى نموذج مثل GPT 5.6، فستحصل على نموذج أسرع وأرخص، لكن النتائج كانت
00:05:54أسوأ في رأيي. لنجرب اختبارًا آخر. هذه المرة طلبت منهم إنشاء لوحة تحكم
00:05:58لإدارة المالية الشخصية، لتكون تطبيقًا كاملاً (Full Stack) بواجهة أمامية وخلفية،
00:06:02كما حددت بعض الميزات لإضافتها. وهذه هي النتيجة التي حصلت عليها
00:06:06مع Opus 5، ويجب أن أقول إنني منبهر حقًا. أعجبتني الواجهة، فهو
00:06:11الأسلوب الذي أفضله شخصيًا. أخبروني في التعليقات إذا أعجبكم أيضًا، وكل شيء
00:06:15يعمل بشكل كامل. لقد اختبرت جميع الميزات وهي تعمل، وهناك صفحات منفصلة لكل
00:06:20ميزة طلبتها، والربط متكامل بين الواجهة الأمامية
00:06:24والخلفية. لقد أحببت تصميم الواجهة الذي اختاره بجدية، وأعتقد أنه الأفضل
00:06:28من بينها جميعًا. بالنسبة للكود، استخدم React وReact Router في الواجهة الأمامية وهو ما
00:06:33أفضله جدًا، وفي الواجهة الخلفية حصل على نقاط إضافية لاستخدامه قاعدة بيانات حقيقية.
00:06:37استخدم Node SQLite لقاعدة البيانات، واستخدم Express للخادم. وهذه هي النتيجة
00:06:42التي أعطاني إياها Fable 5. أنا أُفضل واجهة Opus 5، لكن هذه ليست سيئة أيضًا،
00:06:48على الرغم من أن هذه المخططات عديمة الفائدة نوعًا ما بصراحة. هذا المخطط السفلي جميل، ومجددًا
00:06:53كل الميزات تعمل. أعتقد فقط أن Opus 5 بذل جهدًا أكبر في الواجهة، وهو
00:06:57بالتأكيد أفضل في هذا الجانب. في البرمجة، قام بشيء مشابه لـ Opus 5 واستخدم
00:07:01React، لكني أشير إلى أنه لم يحدد مكتبة توجيه (Routing)، بل قام ببناء مكتبة توجيه
00:07:05صغيرة بنفسه. كنت لأفضل لو التزم بـ React Router مثلاً،
00:07:09وفيم يتعلق بقاعدة البيانات، استخدم Node SQLite أيضاً، والبرنامج
00:07:13مبني على Express، لذا فالواجهة الخلفية متشابهة جدًا، لكن Opus اختار
00:07:18البيئة البرمجية (Stack) الأفضل للواجهة الأمامية. هذا ما قدمه GPT 5.6 Sol، ويجب القول إنه ينافس
00:07:22في تصميم الواجهة، حيث يضاهي Opus تمامًا. إنه أسلوب مختلف والمسألة تعود
00:07:26للتفضيل الشخصي، لكني أحببته حقًا. لقد قام بعمل
00:07:31مذهل في تخطيط الواجهة، وكل الميزات تعمل، لكن هذا النموذج
00:07:35لم يستعرض الميزات في صفحات منفصلة، بل يكتفي بالانتقال إلى أجزاء مختلفة
00:07:38من الصفحة نفسها. كما اختار البيئة الأكثر تميزاً بين الجميع، حيث استخدم NextJS مع
00:07:43Drizzle لقاعدة البيانات وهو نهج ممتاز لمثل هذا المشروع.
00:07:47لكنه استخدم أيضًا Cloudflare وVinext لاستضافته، وهو قرار غريب نوعًا ما
00:07:52لأن Vinext في مراحله الأولى ولم يتم اختباره بشكل كافٍ، ويبدو أنهم يدرجون
00:07:56تعليمات في الأوامر لإجباره على استخدام Cloudflare وVinext.
00:08:00وكما قلت في فيديو Kimi K3، ربما لأن هذه هي طريقة عمل مواقع ChatGPT
00:08:04المستضافة. أخيرًا، النموذج الأخير الذي اختبرته هو Kimi K3، وهذه هي النتيجة
00:08:09التي حصلنا عليها، وقد أدى عملًا جيدًا جدًا. الواجهة تشبه ما كنت أحصل عليه
00:08:14من GPT 5.4 أو 5.5، لذا أرى أنه متأخر قليلاً في تصميم الواجهة، لكن جميع الميزات
00:08:19تعمل، ولا يمكنني التذمر من الواجهة. إنها تؤدي المطلوب تمامًا.
00:08:24لكن الكود يفقد بعض النقاط. لقد اختار React للواجهة الأمامية،
00:08:28وبنى مكتبة توجيه خاصة به كما فعل Fable، وعند الانتقال إلى الخادم،
00:08:32نجد خادم Express فقط، دون إنشاء أي قاعدة بيانات باستخدام Node SQLite
00:08:36أو غيرها، بل أنشأ قاعدة بياناته باستخدام JavaScript عبر حفظ البيانات
00:08:40في ملف JSON. هذا النهج ليس ما أفضله على الإطلاق.
00:08:44بالنسبة للوقت والتكلفة في اختبار التطبيق المالي، كان Fable الأغلى
00:08:48بتكلفة 30.79 دولارًا، واستغرق 56 دقيقة و55 ثانية، ولكن مع Opus يبدو السعر
00:08:55قريبًا جدًا من Fable، حيث كلفني 29.82 دولارًا، واستغرق وقتًا أطول بـ 59 دقيقة و15
00:09:02ثانية. أسعار نماذج GPT ممتازة جدًا بالمقارنة، فهي أرخص بثلاث مرات
00:09:07ونصف تقريبًا، وآمل أن تؤدي هذه المنافسة إلى تخفيض أسعار Anthropic.
00:09:11النتائج متباينة بالنسبة لي. لقد أجريت كل اختبار مرة واحدة فقط وقمت باختبارين فقط،
00:09:16لذا آمل أن تكون اختبارات Artificial Analysis أكثر دقة، والتي تشير إلى أن Opus
00:09:20يعادل ثلث سعر Fable، وسيتعين علي استخدامه أكثر للتأكد من ذلك.
00:09:24ربما تعود المشكلة للأداة التي استخدمتها لقياس التكاليف. ميزة أخرى لصالح Opus
00:09:28هي أنه أقل صرامة في مهام الأمن السيبراني مقارنة بـ Fable 5. الضمانات تشبه
00:09:33Opus 4.8، مع حماية أشد في نطاق ضيق من المهام السيبرانية.
00:09:37يبدو أن القيود تسمح لـ Opus 5 باكتشاف الثغرات في الكود المصدري،
00:09:42لكنها تحظر فحص الثغرات القائم على الملفات الثنائية، واختبارات الاختراق
00:09:46وإنشاء الثغرات. أظهرت اختباراتهم أن أدوات الحماية تتدخل بنسبة أقل بـ 85%
00:09:51مقارنة بـ Fable 5. إذن، المنافسة بين النماذج مثيرة للإعجاب حقًا
00:09:55في الوقت الحالي. لدينا GPT 5.6 الذي يثبت إمكانية تخفيض الأسعار، ونماذج مفتوحة مثل Kimi
00:10:00تنافس النماذج الكبرى في الذكاء، وشركة Anthropic تدفع بمستوى
00:10:04الذكاء إلى آفاق أبعد باستمرار. ما هو نموذجك المفضل، وهل أعجبك Opus؟
00:10:09أخبرني في التعليقات أدناه، ولا تنسَ الاشتراك، وإلى اللقاء في الفيديو القادم.