سونيت 5 متاح الآن وينافس أوبوس

CChase AI
컴퓨터/소프트웨어창업/스타트업경영/리더십

스크립트

00:00:00أصدرت Anthropic للتو نموذج Sonnet 5، لذا دعونا نستعرض كل ما تحتاج لمعرفته حوله.
00:00:04لنبدأ بالنتائج المعيارية (Benchmarks). وتذكر أن Sonnet 5 نموذج أقل قوة،
00:00:08وأقل تكلفة من نماذج مثل Opus وبالتأكيد Fable. لم نحصل على ترقية هنا
00:00:13منذ الإصدار 4.6. الآن، عند مقارنة 5 بـ 4.6، نرى قفزة هائلة في مجال البرمجة الوكيلة (Agentic coding)،
00:00:21والتفكير متعدد التخصصات، واستخدام الحاسوب، وأعمال المعرفة. إذًا هو ترقية شاملة في
00:00:26كل الجوانب. الآن، عند مقارنته بنموذج Opus 4.8، السؤال ليس هل هو قريب منه؟ بل ما هو حجم
00:00:32التراجع الذي نلحظه؟ وبصراحة، ليس تراجعاً كبيراً. في الواقع، إنه يحقق أرقاماً أفضل
00:00:39في أعمال المعرفة، وهو أمر مذهل نوعاً ما. يتأخر فقط بنسبة 2% في استخدام الحاسوب، وبنسبة
00:00:442% في البرمجة الوكيلة، وبنسبة ضئيلة جداً في مجال التفكير
00:00:49متعدد التخصصات. أكبر فجوة تظهر هنا في اختبار Sweebench Pro بنسبة 63% مقابل 69%.
00:00:56لكن مهلاً، في Terminal Bench 2.1، النتيجة 80 مقابل 82. لذا لا توجد فجوة كبيرة. وهذا النقاش
00:01:03حول الأداء يجب أن يتم في سياق التسعير. تذكر، Fable 5، وMythos 5،
00:01:08نتحدث عن 10 دولارات لكل مليون رمز (token) إدخال، وهو ضعف سعر Opus. سعر Opus هو 5 دولارات لكل مليون رمز إدخال.
00:01:16وبالنسبة للمخرجات، التكلفة 25 دولاراً. إذًا 5 دولارات و25 دولاراً. بالنسبة لـ Sonnet 5، نتحدث عن 2 دولار، أي 40% فقط من تكلفة
00:01:26Opus في رموز الإدخال. وبالنسبة للمخرجات، التكلفة 10 دولارات. إذًا هو أرخص بكثير، أقل من نصف تكلفة
00:01:34Opus. ومع ذلك، عندما ننظر إلى الأرقام، فهي متقاربة جداً. لذا فهذه أخبار رائعة لمن
00:01:40لا يقوم بمهام بالغة التعقيد باستخدام الذكاء الاصطناعي، بل بمهام روتينية،
00:01:46ويحتاج إلى القوة، حسنًا، Sonnet 5 يسد هذه الفجوة الآن. لنلقِ نظرة على هذه الرسوم البيانية التي
00:01:51تتجاوز مجرد المعايير. هنا ننظر إلى أداء البحث الوكيل حسب مستوى الجهد، ونقارن
00:01:55Opus 4.8 بـ Sonnet 5 وSonnet 4.6. لاحظ فوراً، أعتقد أنك ستلاحظ في Sonnet 5 وجود فجوة كبيرة
00:02:04في معدلات النجاح عند الانتقال بين مستويات الجهد. ففي المستوى المنخفض، يحقق 55%. لكن إذا نظرنا إلى
00:02:13المستوى المنخفض في Sonnet 4.6، نجد أن أداء Sonnet 4.6 أفضل. ومع ذلك، من حيث التكلفة، فهو أقل بكثير.
00:02:19ننتقل إلى المستوى المتوسط، فنحصل تقريبًا على نفس الأداء الذي رأيناه مع Sonnet 4.6،
00:02:25ولكن بخصم كبير. ولا نبدأ في تجاوز أداء
00:02:34Sonnet 4.6 إلا عند الانتقال إلى مستويات الجهد العالي. ولكن عند تلك النقطة، نحصل على أداء أفضل من Sonnet 4.6، لكن بتكلفة
00:02:41كانت ستكون في مستوى الجهد المنخفض لـ Sonnet 4.6. لذا فإن هذا النوع من التمييز في مستوى الجهد،
00:02:49أعتقد أنه مهم جداً لأنه ليس مجرد قول أن Sonnet 5 أفضل في كل شيء، حيث المستوى المنخفض
00:02:53في النموذج 5 ليس بالضرورة أفضل من المنخفض في 4.6. المستوى المنخفض في Sonnet 5 يعني فقط أنه سيكون رخيصاً جداً.
00:02:59ولكن من حيث الحصول على مستوى أداء أعلى، مما رأيناه في الماضي،
00:03:03ربما تحتاج للقيام بشيء في النطاق العالي. ومع ذلك، عندما نكون في النطاق
00:03:08العالي مع Sonnet 5، فإننا ندفع تقريباً نفس المبلغ الذي ندفعه مع Opus. Opus في المستويين المتوسط
00:03:14والعالي يكلف نفس تكلفة Sonnet في المستوى العالي، لكننا نحصل على معدل نجاح أفضل. لذا فإن هذا يضفي
00:03:21الكثير من الدقة على هذا النقاش. هل نحتاج لاستخدام Sonnet 5 مقابل Opus 4.8 وأشياء مثل
00:03:27البحث الوكيل؟ أعتقد أن الأمر يعتمد حقاً. إذا كانت مشكلة أكثر تعقيداً، في النهاية، قد يكون Opus 4.8
00:03:33أرخص لأنه فعال جداً في استخدام الرموز (tokens) وSonnet ليس النموذج المناسب للمهمة.
00:03:38ومع ذلك، عندما نقوم بمهام ليست صعبة بالنسبة لنماذج الذكاء الاصطناعي هذه، فربما
00:03:44لا يكون من المنطقي استخدام Opus 4.8 على الإطلاق. عندها نستخدم Sonnet 5. لذا أعتقد أن هذا
00:03:49مكان مثير للاهتمام نعيشه الآن، حيث أصبح اختيار النموذج الذي يجب أن تستخدمه حالة بحالة.
00:03:54الآن، إليك حالة أخرى مثيرة للاهتمام عندما نرى استخدام الحاسوب الوكيل. الآن، في معظم
00:03:58الجوانب، Sonnet 5 يتفوق على Sonnet 4.6 وهو يفعل ذلك بتكلفة منخفضة جداً. لذا
00:04:05بالنسبة للبحث الوكيل، بالتأكيد لم يكن الأمر كذلك، لكن بالنسبة لاستخدام الحاسوب الوكيل، فجأة،
00:04:09سنستخدم دائماً Sonnet 5 بدلاً من 4.6. ومرة أخرى، يعود هذا إلى فكرة أن اختيار النموذج
00:04:14الذي يجب استخدامه أصبح حالة بحالة. ومن المثير للاهتمام، انظر إلى Opus. Opus في المستوى العالي يؤدي
00:04:20أفضل من أقصى أداء لـ Sonnet 5 وهو أرخص. لذا، أعني أنك تنظر إلى هذه الأشياء وتتساءل،
00:04:26واو، Opus في الواقع فعال جداً فيما يفعله. ناهيك عن أنه يصل إلى هذه المستويات العالية
00:04:30التي لا تستطيع Sonnet الوصول إليها. لذا، هناك أمور يجب التفكير فيها، وبصراحة، لمجرد أن التكلفة لكل مليون
00:04:36رمز أرخص مع Opus، ستكون هناك حالات كثيرة حيث يظل Opus هو الأفضل. الآن، أريد أن أتحدث عن
00:04:41إصدار نموذج Anthropic دون الحديث عن السلوك غير المحاذى. يمكننا رؤية تحسن
00:04:45مع Sonnet 5، ولكن لا يزال أقل مما نتوقعه مع Opus 4.8 ونموذج Mythos التجريبي. وفيما يتعلق بـ
00:04:50الثغرات ومسألة الأمن السيبراني التي تسببت في حظر Mythos تقريباً، فهذه ليست
00:04:55مشكلة أو شيئاً يدعو للقلق مع فئة Sonnet. لذا بشكل عام، لن أهتم كثيراً
00:04:59بهذه المعايير، بصراحة. هذه الأنواع من المعايير، وهذه الرسوم البيانية تجعلني
00:05:05أتردد أكثر لأن السؤال لا أعتقد أنه Sonnet 5 مقابل 4.6. سنستخدم دائماً
00:05:11Sonnet 5. السؤال هو Sonnet 5 مقابل Opus 4.8. والسؤال هو هل Opus في الواقع أرخص؟ و
00:05:18أود أن أرى المزيد من الاختبارات والمزيد من الأشياء من Anthropic التي توضح ذلك الخط الفاصل بين
00:05:24حسنًا، Sonnet 5 يمكنه القيام بعمل جيد في هذا الأمر وهو أرخص من
00:05:29Opus مقابل، مهلاً، هذه الآن مهمة أكثر تعقيداً. سيكون Opus في الواقع أكثر كفاءة من
00:05:34Sonnet في إكمالها. لذا، أمور يجب التفكير فيها، بالتأكيد إضافة جيدة. أعتقد بشكل عام أن المهام ذات المستوى المنخفض
00:05:40باستخدام Sonnet ستكون ميزة كبيرة لأن أولئك منا الذين يستخدمون رموز API، كما تعلمون،
00:05:46لتطبيقاتنا أو أشياء ليست في نظام Claude Max Plan، من الصعب نوعاً ما استخدام
00:05:51Anthropic. إنه باهظ الثمن للغاية. ولقد كنت أخبر الناس لفترة طويلة، ابحثوا فقط
00:05:55عن OpenAI، انظروا إلى بعض نماذجهم الصغيرة لأن ذلك غالباً ما يكون أكثر من كافٍ لوظائف
00:05:59كثير من الناس. حسنًا، لدينا الآن خيار متوسط المستوى مع Anthropic، وهو أمر جيد
00:06:05أن يكون متاحاً. لذا سأترككم عند هذا الحد اليوم. هذا متاح في كل مكان. أعتقد
00:06:09سيكون هناك الكثير من التجربة والخطأ لمعرفة أين يكون هذا أكثر منطقية. لذا أخبروني
00:06:13برأيكم. تأكدوا من التحقق من Chase AI Plus إذا كنتم ترغبون في الحصول على Claude
00:06:17Code Masterclass، وسأراكم لاحقاً.

핵심 요약

يوفر نموذج Sonnet 5 ترقية شاملة في الأداء مع تكلفة تبلغ 40% من تكلفة Opus، مما يجعله الخيار الأنسب للمهام الروتينية ومتوسطة التعقيد، بينما يظل Opus الخيار الأكثر كفاءة للمهام عالية التعقيد.

하이라이트

  • نموذج Sonnet 5 يتفوق على الإصدار 4.6 في البرمجة الوكيلة، والتفكير متعدد التخصصات، واستخدام الحاسوب، وأعمال المعرفة.

  • يبلغ سعر Sonnet 5 دولارين لكل مليون رمز إدخال، وهو ما يعادل 40% فقط من تكلفة نموذج Opus.

  • في اختبار Sweebench Pro، يحقق Sonnet 5 نسبة نجاح 63% مقارنة بـ 69% لنموذج Opus 4.8.

  • يظل نموذج Opus 4.8 أكثر كفاءة من حيث التكلفة والأداء في المهام المعقدة التي تتطلب مستويات جهد عالية.

  • يتفوق Sonnet 5 على الإصدار 4.6 بشكل دائم ومستمر في مهام استخدام الحاسوب الوكيل.

  • يعد Sonnet 5 خياراً تنافسياً للمهام الروتينية التي لا تتطلب تعقيد نموذج Opus، مع ميزة التكلفة المنخفضة.

타임라인

أداء ومعايير Sonnet 5

  • يقدم Sonnet 5 قفزة في الأداء مقارنة بـ 4.6 في البرمجة الوكيلة والتفكير متعدد التخصصات.
  • تتراوح الفجوة في الأداء بين Sonnet 5 وOpus 4.8 بين 2% إلى 6% في معظم الاختبارات المعيارية.

يمثل Sonnet 5 تحسيناً ملحوظاً في كل جوانب عمل النموذج مقارنة بالإصدار 4.6. عند مقارنته بـ Opus 4.8، لا يشكل التراجع في الأداء فجوة كبيرة، حيث يحقق Sonnet 5 أرقاماً متقاربة جداً في أعمال المعرفة وTerminal Bench 2.1.

تحليل التكلفة مقابل الفائدة

  • يبلغ سعر Sonnet 5 دولارين لكل مليون رمز إدخال، بينما يبلغ سعر Opus 5 دولارات.
  • تمثل تكلفة مخرجات Sonnet 5 مبلغ 10 دولارات، وهو أقل من نصف تكلفة مخرجات Opus البالغة 25 دولاراً.

يغير التسعير المعادلة في اختيار النموذج. Sonnet 5 يوفر بديلاً أرخص بكثير لـ Opus مع الحفاظ على أداء قريب جداً، مما يجعله مناسباً للمهام الروتينية التي تتطلب قدرة ذكاء اصطناعي دون الحاجة للتعقيد القصوى.

مستويات الجهد وتخصيص المهام

  • يظهر Sonnet 5 تمايزاً حاداً في الأداء بناءً على مستويات الجهد، حيث يتفوق على 4.6 فقط في المستويات العالية.
  • يظل Opus 4.8 أكثر كفاءة في التكلفة عند تنفيذ المهام عالية التعقيد بفضل جودة مخرجاته ومعدل نجاحه الأعلى.

يعتمد اختيار النموذج على حالة الاستخدام المحددة. في مهام استخدام الحاسوب، يتفوق Sonnet 5 على 4.6 بوضوح، ولكن في المهام الأكثر تعقيداً، يظل Opus الخيار الذي يضمن معدلات نجاح أفضل مقابل تكلفة عادلة بالنظر إلى فعالية الرموز المستخدمة.

الأمان والتوافر

  • لا يعاني Sonnet 5 من مشاكل الأمن السيبراني التي واجهها نموذج Mythos.
  • يتوفر Sonnet 5 الآن كمستوى متوسط متاح للمستخدمين الذين يجدون تكلفة واجهة برمجة التطبيقات الخاصة بـ Anthropic مرتفعة سابقاً.

يعد توفر Sonnet 5 إضافة مهمة لمستخدمي واجهات برمجة التطبيقات، حيث يوفر خياراً وسطاً يتفوق على النماذج الصغيرة من المنافسين. هذا التوافر يشجع على إجراء اختبارات مستمرة لتحديد النموذج الأمثل لكل مهمة محددة.

커뮤니티 글

모든 글 보기