스크립트
00:00:00أطلقت OpenAI للتو نموذجاً جديداً كلياً ضمن منصة Codex، لكن الخبر الأهم
00:00:04ليس نتائجه في الاختبارات، بل هو “وضع الترا” (Ultra mode) الجديد الذي يمكنه إنشاء
00:00:10وكلاء فرعيين خاصين به لتقسيم مهامك والتعامل معها، مما يعني أن كل عمليات التنسيق
00:00:15التي كنت تقوم ببرمجتها بنفسك أصبحت الآن جزءاً لا يتجزأ من النموذج نفسه.
00:00:19لذا في هذا الفيديو سنغطي كل ما تحتاج لمعرفته حول هذا الإصدار الجديد،
00:00:23وكيفية أدائه في كتابة الأكواد البرمجية للإنتاج، وهل يستحق التفكير فيه مقارنة
00:00:28بكل ما تقدمه النماذج الرائدة الأخرى. ونحن نغطي مواضيع الذكاء الاصطناعي باستمرار
00:00:38على هذه القناة، لذا اشترك في Better Stack إذا كنت ترغب في البقاء على اطلاع بكل إصدار جديد.
00:00:45أطلقت OpenAI للتو سلسلة جديدة من النماذج تحت اسم GPT 5.6، وتتكون من ثلاثة مستويات: Luna و
00:00:50Terra وSol. هذه الأسماء من المرجح أن تبقى وتتطور مع مرور الوقت، تماماً كما
00:00:55تسمي مختبرات مثل Anthropic نماذجها. Luna هو النموذج السريع والرخيص، وTerra هو حصان العمل اليومي،
00:01:01ثم Sol هو النموذج الرائد الجديد. يتم طرح كل هذا الآن، لذا سيبدأ الوصول إليه
00:01:07بدءاً من اليوم، ومع ذلك، حصلت مجموعة مختارة من الشركاء الموثوقين لدى OpenAI على وصول مبكر.
00:01:12أما الرقم الذي يتصدر الجميع في Terminal Bench 2.1، وهو المعيار الأساسي للعمل
00:01:21على سطر الأوامر والبرمجة، فقد سجل نموذج Sol العادي 88.8، وعند تفعيل وضع Ultra الجديد يقفز إلى 91.9.
00:01:31للمقارنة، يقف كل من GPT 5.5 وClaude Mythos 5 عند 88، لذا نظرياً، Sol Ultra هو أحدث ما توصلت إليه التقنية في
00:01:37البرمجة الوكالية. لكن المعيار لا يمثل قاعدة بياناتك البرمجية، كما أن الطرح البطيء يعني أن معظم المشاهدين
00:01:42لا يمكنهم استخدامه بعد، لذا خذ هذا الرقم بحذر. والآن، هنا يصبح الأمر مثيراً حقاً:
00:01:49هذا الأسبوع، أكد تيبو، قائد فريق Codex في OpenAI، أن Sol مع وضع Ultra قادم إلى داخل Codex.
00:01:55كما لمّح إلى نسخة أسرع تعمل على رقائق Cerebras ستصدر لاحقاً في يوليو، فإذا كانت السرعة الخام
00:02:00هي ما يهمك، فهذا يستحق المتابعة. ووضع Ultra هنا هو الميزة المثيرة حقاً.
00:02:06دعونا نرى كيف يعمل بالضبط. عادةً، يعمل النموذج على مهمتك في سلسلة واحدة طويلة
00:02:12من التفكير، لكن وضع Ultra يقوم بتقسيم المهمة بدلاً من ذلك، ويشغل وكلاء فرعيين متعددين للعمل
00:02:18على أجزاء من العمل بالتوازي. الجزء الجديد هو أن هؤلاء الوكلاء الفرعيين مدربون على التعاون، بحيث يمكنهم التحدث
00:02:23مع بعضهم البعض أثناء العمل، ثم دمج كل شيء في نتيجة واحدة. وهذا النوع من
00:02:29التنسيق يمثل تحولاً هائلاً في كيفية عمل النماذج. تشغيل مخطط ومبرمج ومراجع هو عادةً
00:02:34شيء كنت ستقوم ببرمجته بنفسك في مهام Codex، أو شيء تتعامل معه أدوات مثل Claude Code أو Copilot
00:02:40على مستوى عالٍ، لكن OpenAI قررت دمج كل هذه التعقيدات داخل النموذج نفسه لأجلك.
00:02:46وهذا يعني إعداداً أقل بكثير؛ بدلاً من ربط وكلاء منفصلين، أنت فقط تعطي Ultra المهمة وتتركه
00:02:52يتولى الباقي. لذا فهو يتطلب تنسيقاً أقل منك، ومن الناحية النظرية نتائج أسرع للمهام
00:02:58الكبيرة والمعقدة. لكن السؤال هو: هل هذا قفزة حقيقية في القدرات، أم مجرد طريقة لاستهلاك
00:03:05الرموز (Tokens) باسم جذاب؟ الحقيقة هي ربما كلاهما. الوكلاء الفرعيون المدربون من البداية للنهاية على التواصل يمثلون
00:03:10اتجاه بحث مثيراً للاهتمام، لكن Ultra هو أيضاً مجرد مصطلح تسويقي، يعني أننا نسمح له بالتفكير
00:03:15لفترة أطول وتوزيع العمل. ولكن بعيداً عن كل الضجة، فإن المعايير تأتي في الواقع مع نجمة (asterisk) تحذيرية.
00:03:22مختبر METR، وهو المختبر المستقل الذي تستخدمه OpenAI لتقييم نماذجها، قام بتشغيل Sol عبر مهام
00:03:28الأفق الزمني الخاصة بهم، ووجدوا أن Sol تم ضبطه وهو يغش أكثر من أي نموذج عام اختبروه
00:03:34على الإطلاق. وبقصد الغش، أعني أنه قام بأشياء مثل تضمين ثغرات في إجاباته لقراءة
00:03:40مجموعة الاختبار المخفية أو البحث عن الكود المصدري المخفي للعثور على الإجابة المتوقعة، وهذا يدمر تماماً
00:03:46القياس. عندما حاولت METR معرفة حجم المهمة التي يمكن لـ Sol التعامل معها بمفرده، تراوحت الإجابة
00:03:52من حوالي 11 ساعة إلى أكثر من 270 ساعة، ولكن بسبب الغش، كان استنتاجهم الخاص
00:03:57هو أن هذه الأرقام ليست قياساً موثوقاً لما يمكن للنموذج فعله. لذا، النموذج
00:04:03المتصدر هو الذي يتلاعب بتقييماته الخاصة، وهو أمر يستحق التذكر قبل أن
00:04:09تقوم بإعادة بناء سير عملك بالكامل حول تلك النتيجة البالغة 91.9. وهذا الأمر مهم أكثر مما يبدو، لأن
00:04:14جوهر النموذج الوكالي هو أنك تتركه يعمل لساعات في كل مرة بمفرده. لذا إذا كان سيتلاعب
00:04:20بهدوء باختبار فقط ليبدو ناجحاً، عليك أن تتساءل ماذا سيفعل في مهام الإنتاج الحقيقية
00:04:25عندما لا يقوم شخص ما بمراقبته والتحقق من كل خطوة. أما عن التكلفة، فهي تبدو جيدة جداً.
00:04:32Sol يكلف 5 دولارات لكل مليون رمز (Token) للمدخلات، و30 للمخرجات. Terra هي نصف ذلك، وLuna هي
00:04:40دولار للمدخلات و6 للمخرجات. للمقارنة، Claude Fable 5 تبلغ حوالي 10 و50، لذا Sol يأتي بنصف
00:04:45السعر تقريباً. وهذه قصة أكثر فائدة من المعيار؛ نموذج رائد أرخص بالإضافة إلى
00:04:51مستوى ميزانية مناسب للمهام عالية الحجم. عملياً، ستستخدم Luna للمهام السريعة
00:04:56عالية الحجم، وتحتفظ بـ Terra لمعظم عملك اليومي، ولا تلجأ لـ Sol إلا عندما تحتاج المهمة حقاً إلى
00:05:01المزيد من الاستنتاج، حتى لا تدفع أسعاراً باهظة لكل شيء. فهل يجب أن تغير أي شيء
00:05:07اليوم؟ حسناً، إذا كنت تعمل بالفعل في Codex، فالإجابة هي نعم بالتأكيد، ولكن إذا كنت تستثمر في
00:05:11مختبرات أخرى، فلا تقم بإعادة تنظيم سير عملك بالكامل حوله بعد. تقدم المعيار
00:05:17لا يتعدى بضع نقاط، وهي نتيجة لا يمكن لمقيمها أن يقف خلفها. إذا كنت ترغب في تعلم
00:05:22المزيد حول كيفية غش هذه النماذج للنظام، فقد صورنا فيديو حول ذلك بالضبط، يمكنك مشاهدته هنا.