كلود سونيت 5 مخيب للآمال... (لكن فابل عادت!)

BBetter Stack
컴퓨터/소프트웨어경제 뉴스AI/미래기술

스크립트

00:00:00أطلقت شركة Anthropic نموذج Claude Sonnet 5 الأسبوع الماضي وكان مخيباً للآمال، لكن على الأقل عاد Fable 5،
00:00:04ربما تم تقليص قدراته، وأوه، قد يحتوي Claude Code على كود يشبه برامج التجسس لاكتشاف
00:00:09الاستخدام من الصين. لنبدأ. سأبدأ بـ Sonnet 5. هذا هو أول تحديث لـ Sonnet منذ أربعة
00:00:18أشهر ونصف، وتقول Anthropic إنه صُمم ليكون أكثر نماذج Sonnet تفاعلية (agentic) حتى الآن،
00:00:22بأداء قريب من Opus 4.8، ولكن بأسعار أقل. التسعير موضوع مثير للاهتمام حقاً مع
00:00:28هذا النموذج، لذا سنعود إليه. أولاً، لنلقِ نظرة على المقاييس
00:00:31التي توفرها Anthropic. إنه يتفوق على سابقه في كل هذه، ويقترب من Opus في بعضها
00:00:35مثل Terminal Bench و Computer Use، حتى أنه يتفوق على Opus قليلاً في العمل المعرفي. أفضل النظر
00:00:40إلى مقاييس الجهات الخارجية، وتلك التي أثق بها هي من Artificial Analysis، وفي مؤشر
00:00:44البرمجة، يأتي خلف Opus ببضع نقاط، لكنه متقدم قليلاً جداً على GPT 5.4. لقد حقق قفزة
00:00:50وهو نفس الأمر بالنسبة لمؤشر الذكاء أيضاً، حيث يقع في المرتبة بين GPT 5.5 و GPT 5.4
00:00:56بين GPT 5.5 و GPT 5.4، ولكن المثير للاهتمام، في المؤشر التفاعلي (agentic index)، تفوق في الواقع على GPT 5.5.
00:01:03لذا عندما قالوا في تلك المدونة إنهم بذلوا الكثير من العمل في قدراته التفاعلية،
00:01:06يبدو أن ذلك أتى ثماره هنا. من المقاييس إذن، يبدو نموذجاً كفؤاً جداً،
00:01:10وهو بالتأكيد خطوة للأمام من Sonnet 4.6، ولكن دعونا الآن نتحدث عن عنصر التسعير ذلك.
00:01:14بالنسبة لتسعير واجهة البرمجة (API)، فهم يقدمون سعراً مخفضاً قدره 2 دولار لكل مليون رمز (token) إدخال،
00:01:18و 10 دولارات لكل مليون رمز إخراج، وذلك حتى 31 أغسطس. ثم سيعود إلى نفس
00:01:23السعر مثل نماذج Sonnet الأخرى، والذي كان 3 دولارات لكل مليون رمز إدخال و 15 دولاراً لكل مليون رمز
00:01:28إخراج. هذا يضعه في مستوى Gemini 3.5 Flash و GPT 5.6 Terra، إذا حصلنا على إمكانية الوصول إلى ذلك،
00:01:34وكما قالوا، فهو أرخص من Opus 4.8. المشكلة هي، في الواقع، أن هذا ليس
00:01:39صحيحاً على الإطلاق. هذا النموذج يستهلك رموزاً (tokens) بكثرة. إنه يستخدم حوالي 69,000 رمز لتنفيذ مهمة واحدة في
00:01:45Artificial Analysis Intelligence Index، مما يجعله أكثر من Sonnet 4.6 و Opus 4.8 و Fable 5 و GPT 5.4
00:01:52و 5.5. إذا نظرت إليه في هذا المربع هنا، حيث اللون الأخضر هو المكان المناسب، فهو بعيد قدر
00:01:57الإمكان عن هذه النماذج. هذا بالطبع له تأثير مضاعف على التكلفة الفعلية للمهمة،
00:02:02ووجدت Artificial Analysis أن Sonnet 5 أصبح أكثر تكلفة من Opus 4.8 لكل مهمة،
00:02:07ولا يتفوق عليه سوى Fable. بالإضافة إلى ذلك، إذا أخذت نموذجاً مثل GPT 5.5، والذي يعمل بشكل أفضل في معظم
00:02:12المقاييس، فهو نصف سعر Sonnet 5. تجدر الإشارة هنا إلى أن Artificial Analysis
00:02:16تستخدم في الواقع السعر القياسي للنموذج وليس المخفض، لذا سأكون فضولياً جداً
00:02:20لمعرفة ما إذا كانت Anthropic ستحاول إصلاح ذلك ربما عن طريق تمديد هذا الخصم أو ترك ذلك
00:02:25كسعر دائم. والأسوأ من التكلفة لكل مهمة، وجدت Artificial Analysis في الواقع لتشغيل
00:02:29مجموعة اختباراتهم الكاملة أن Sonnet 5 تكلف أكثر من Fable 5. مثل، ماذا حدث هنا؟ حتى في
00:02:34Cursor Bench، إذا نظرت إلى Sonnet 5 High، فهي بنفس سعر Opus 4.8 تقريباً لنفس
00:02:39النتيجة، ومع ارتفاع مستويات الجهد، يسجل Sonnet 5 Max نتائج أسوأ من Opus 4.8 Extra High بينما
00:02:44تكلف أكثر. يبدو حقاً أنهم بحاجة إلى تحديث أو إصلاح شيء ما هنا، وإلا فأنا لا أرى
00:02:48أين يتناسب هذا النموذج. إنه ليس نموذجاً سيئاً من حيث القدرات بأي حال من الأحوال، فقط من الناحية الاقتصادية، ولقد
00:02:54كنت من كبار المعجبين بنماذج Sonnet. أعتقد أنها كانت أول النماذج التي استخدمها الكثير منا يومياً،
00:02:58ولكن خلال الأشهر القليلة الماضية كنت أستخدم دائماً Opus 4.8، ولم يغير أي من هذا رأيي.
00:03:02خاصة مع عودة Fable، سيكون Fable للمهام الصعبة،
00:03:05و Opus 4.8 للاستخدام اليومي، و Sonnet لا شيء. بالحديث عن Fable 5، قيود التصدير
00:03:11تم رفعها، وعاد الآن للجميع، بغض النظر عن جنسيتك، لكن للأسف
00:03:15كان لديك أسبوع لاستخدامه ضمن حدود خطتك، أو على الأقل 50% من حدود خطتك، وبعد 7 يوليو
00:03:20سيكون متاحاً فقط عبر أرصدة الاستخدام. كانت هناك بعض النقاط المثيرة للاهتمام في تلك المدونة حول
00:03:24الحظر الأولي. لقد جاء في الواقع من محاولة كسر حماية (jailbreak) من باحث في أمازون تمكن من
00:03:29حثه على العثور على ثغرات أمنية، وفي حالة واحدة أظهر كيفية استغلال إحداها،
00:03:33ولكن عند البحث في هذا الأمر، وجدت Anthropic أن الكثير من النماذج مثل Claude Opus 4.8،
00:03:37و GPT 5.5، و Kimi K 2.7 يمكنها تحديد نفس الثغرة الأمنية التي حددها Fable 5 في ذلك التقرير،
00:03:43وعندما تعلق الأمر بعرض توضيحي لكيفية استغلال الثغرة الوحيدة،
00:03:47كان بإمكان كل نموذج تم اختباره القيام بذلك، بما في ذلك Claude Haiku 4.5 و Sonnet 4.6 و Opus 4.6
00:03:52و 4.7 و 4.8 و GPT 5.4 و 5.5 و Kimi K 2.7. لذا يبدو لي أن الحظر كان غير مجدٍ
00:03:58إذن، وكل ما حققته هو أن Anthropic جعلت الآن إجراءات الحماية هذه أكثر
00:04:02صرامة على Fable، مما يجعل الكثير من الطلبات العادية يتم حظرها، وفي تغريدة إعلانهم
00:04:06قالوا في الواقع إن المهام الروتينية مثل تصحيح الأخطاء والبرمجة ستعود إلى Opus 4.8،
00:04:11لكن موظفاً في Anthropic صحح هذا لاحقاً قائلاً إنه يجب أن يكون عدداً صغيراً منها فقط.
00:04:14لكن يبدو أن ذلك أثر على بعض المقاييس أكثر من غيرها، مع ادعاءات بأنه قد تم تقليص قدرات Fable.
00:04:18بشكل أساسي إنه يعود إلى Opus 4.8 أكثر، لذا فهو يؤدي بشكل أسوأ بكثير في هذه
00:04:23المقاييس. حول موضوع مشابه لقيود التصدير والحظر، لاحظ بعض الناس أن Claude
00:04:27Code يحتوي الآن على بعض المحاولات لأخذ بصمات الأصابع بطريقة خفية جداً، من خلال تعديل
00:04:32سلسلة تاريخ مطالبات النظام. هذه تدوينة رائعة تتعمق في كل التفاصيل، وسأترك هذا الرابط
00:04:35بالأسفل، ولكن الخلاصة هي أن هناك وظيفة في Claude Code تتحقق مما إذا كانت منطقتك الزمنية في
00:04:40الصين. إذا كانت كذلك، ستتغير سلسلة التاريخ من استخدام الواصلات إلى استخدام الشرطات المائلة. ثم ستتحقق أيضاً
00:04:44مما إذا كان رابط URL المستند إلى API يطابق هذه القائمة، أو إذا كان اسم المضيف يحتوي على كلمات رئيسية لمعامل الذكاء الاصطناعي
00:04:49مثل DeepSeq أو Minimax أو ZAI، وإذا كان الأمر كذلك، فسيتم تغيير الفاصلة العليا في كلمة “اليوم” إلى
00:04:55حرف Unicode مختلف يبدو مطابقاً تماماً. إنها تقنية ذكية جداً تسمى إخفاء المعلومات (steganography)،
00:05:00ومعظمكم لن يتأثر بهذا. إنها مخصصة بشكل أساسي لمحاولة اكتشاف موزعي API
00:05:03وغير المصرح لهم باستخدام بوابات Claude Code وهجمات استخلاص النماذج. ليس لدي حقاً أي
00:05:08مشكلة في محاولتهم القيام بذلك، أفضل فقط أن يكونوا أكثر صدقاً بشأن الأشياء الموجودة
00:05:12في Claude Code، وألا يحاولوا إخفاءها بهذه الطريقة. هل تعتقد أن هذه مشكلة؟ وما رأيك
00:05:16بـ Sonnet 5 وعودة Fable؟ أخبروني في التعليقات بالأسفل، أو هل أنتم مشتركين،
00:05:20وكما دائماً، أراكم في المرة القادمة.

핵심 요약

على الرغم من تفوق Claude Sonnet 5 في القدرات التفاعلية، إلا أن تكلفته الاقتصادية المرتفعة ومعدل استهلاكه للرموز يجعل استخدامه أقل جدوى مقارنة بـ Opus 4.8 أو النماذج المنافسة.

하이라이트

  • يستهلك نموذج Claude Sonnet 5 حوالي 69,000 رمز إدخال لكل مهمة، مما يجعله أكثر تكلفة في التشغيل من نموذج Opus 4.8.

  • تفوقت القدرات التفاعلية لنموذج Sonnet 5 على نموذج GPT 5.5 في مؤشر الأداء التفاعلي (agentic index).

  • يصل سعر استخدام واجهة البرمجة لنموذج Sonnet 5 إلى 2 دولار لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج حتى 31 أغسطس.

  • أظهرت تقنيات التحليل أن معظم نماذج الذكاء الاصطناعي، بما فيها Haiku 4.5 وGPT 5.4، قادرة على تحديد الثغرات الأمنية التي أدت سابقاً لحظر نموذج Fable 5.

  • يستخدم Claude Code تقنية إخفاء المعلومات (steganography) لتعديل تنسيق التاريخ وسلاسل النصوص لاكتشاف موزعي واجهات البرمجة غير المصرح لهم، خاصة في الصين.

타임라인

تقييم أداء وقدرات Claude Sonnet 5

  • يعد Sonnet 5 أول تحديث لسلسلة Sonnet خلال أربعة أشهر ونصف.
  • يتجاوز النموذج أداء الإصدار السابق في جميع المقاييس التقنية.
  • يتفوق Sonnet 5 على GPT 5.5 في مؤشر القدرات التفاعلية (agentic index).

صمم النموذج ليكون الأكثر تفاعلية بين نماذج Sonnet، مع أداء مقارب لـ Opus 4.8. تُشير مقاييس الجهات الخارجية إلى تحسن ملحوظ في مجالات البرمجة والعمل المعرفي، مما يجعله خطوة تطويرية واضحة مقارنة بـ Sonnet 4.6.

الجدوى الاقتصادية ومقارنة التكاليف

  • ترتفع تكلفة المهمة الواحدة في Sonnet 5 عن Opus 4.8 بسبب الاستهلاك العالي للرموز.
  • يبلغ سعر الاستخدام المخفض 2 دولار للإدخال و10 دولارات للإخراج حتى نهاية أغسطس.
  • تتجاوز تكلفة تشغيل اختبارات كاملة على Sonnet 5 تكلفة Fable 5.

يستهلك النموذج 69,000 رمز للمهمة الواحدة، وهو رقم يفوق بقية النماذج المنافسة. أدى هذا الاستهلاك المفرط إلى جعل التكلفة الفعلية أعلى من Opus 4.8، كما أن كفاءته الاقتصادية تقل عن GPT 5.5 الذي يعمل بنصف السعر في معظم المقاييس.

تطورات نموذج Fable 5 وقيود الاستخدام

  • رُفعت قيود التصدير عن Fable 5 وأصبح متاحاً لجميع المستخدمين.
  • أثبتت الاختبارات أن قدرة اكتشاف الثغرات ليست حكراً على Fable 5، بل تتوفر في معظم النماذج الحالية.
  • أدت إجراءات الحماية الصارمة إلى تقليص قدرات النموذج وتوجيه المهام الروتينية لـ Opus 4.8.

جاء الحظر الأولي نتيجة اكتشاف باحث في أمازون لثغرة أمنية، لكن تبين أن النماذج الأخرى مثل Opus 4.8 وGPT 5.5 تملك نفس القدرات. أدى تفعيل حماية أكثر صرامة إلى انخفاض أداء Fable 5 في المقاييس نتيجة الاعتماد المتزايد على Opus 4.8.

تقنيات اكتشاف الاستخدام في Claude Code

  • يستخدم Claude Code تقنية إخفاء المعلومات لتعديل بيانات النظام.
  • تستهدف هذه التقنية كشف مستخدمي واجهة البرمجة غير المصرح بهم من الصين.
  • تعتمد الآلية على تغيير تنسيقات التاريخ والرموز البرمجية لاكتشاف الهجمات.

يعدل البرنامج سلاسل تاريخ النظام بناءً على الموقع الجغرافي أو نوع رابط API المستخدم. يتم تغيير الفاصلة العليا إلى حرف Unicode مختلف كعلامة استدلالية، وهو إجراء يهدف إلى حماية نموذج العمل من هجمات استخلاص النماذج وموزعي الواجهات غير القانونيين.

커뮤니티 글

모든 글 보기