ما المدة التي يمكن أن تظل فيها مهاراتك صالحة قبل أن ينسى وكيلك ما أخبرته به؟ — لوري فوس، أريز إي آي
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00-
00:00:12أهلاً بالجميع، كيف حالكم؟
00:00:15شكراً لحضوركم هذه المحاضرة المهووسة الممتعة.
00:00:20هذه المحاضرة لها عنوان طويل حقاً،
00:00:22لذا دعوني أقدم لكم النسخة المختصرة مقدماً.
00:00:23أنت تكتب ملفات المهارات وتملؤها بالعديد من التعليمات.
00:00:27في مرحلة ما، يتوقف النموذج عن تتبع كل تلك التعليمات.
00:00:31السؤال هو، أين تقع تلك النقطة؟
00:00:33عند أي نقطة تضع عدد كبيراً جداً من التعليمات
00:00:35في ملفات المهارات الخاصة بك؟
00:00:36وقد تغيرت الإجابة كثيراً في العام الماضي.
00:00:40أنا لوري، رئيسة علاقات المطورين في شركة Arise AI.
00:00:44في حياة سابقة، شاركت في تأسيس شركة NPM.
00:00:46لذا قد يعرفني بعضكم من أيام جافا سكريبت.
00:00:48في هذه الأيام، أمضي الكثير من الوقت في التفكير في الذكاء الاصطناعي
00:00:50وكيفية اختباره.
00:00:53قبل بضعة أشهر، كنت في مؤتمر للذكاء الاصطناعي في ميامي،
00:00:55وكان مؤتمراً جيداً حقاً.
00:00:57وكنت أستمع إلى محاضرة ألقاها دكسستر هورثي.
00:00:59لقد كانت محاضرة جيدة.
00:01:00لم تكن تتعلق بهذا الموضوع على الإطلاق.
00:01:02ولكن بينما كان يلقي تلك المحاضرة،
00:01:04ذكر، على سبيل الاستطراد،
00:01:06أن الوكيل يمكنه تتبع ما يصل إلى 200 تعليمة تقريباً
00:01:10قبل أن يبدأ في نسيان تلك التعليمات.
00:01:13ثم انتقل إلى نقطة أخرى في محاضرته،
00:01:15وكانت مجرد ملاحظة عابرة.
00:01:17وقد ذكر أن هذا الرقم يعود لعام 2025،
00:01:20لذا قد تكون الأمور أفضل الآن.
00:01:22وتوقفت عن الاستماع لفترة قصيرة
00:01:25لأنني فكرت: 200 تعليمة
00:01:27ليست بالكثير من التعليمات على الإطلاق، أليس كذلك؟
00:01:31أي ملف مهارات لائق يتجاوز 200 تعليمة
00:01:33تقريباً على الفور.
00:01:35إذا قال المستخدم س، نفذ ص،
00:01:37قم دائماً تضمين قسم عن ع،
00:01:39لا تستخدم أبداً عبارة ل،
00:01:40كل واحدة من هذه تعتبر تعليمة مستقلة.
00:01:42وإذا توقف النموذج بهدوء عن تتبعها بعد تجاوز 200،
00:01:45فهذا يعد سقفاً صارماً للغاية
00:01:47يحد من تعقيد ما يمكنك بناؤه.
00:01:49لذا أردت أن أعرف من أين حصل على هذا الرقم أولاً،
00:01:52وأردت أن أتأكد مما إذا كان صحيحاً.
00:01:55لذا أنتم تعلمون الشعور الذي أتحدث عنه.
00:01:57أنت تكتب ملف مهارات كبير ورائع،
00:01:58يحتوي على صفحات من القواعد، الحالات الاستثنائية، النبرة، والتنسيق.
00:02:00ثم تسلمه للوكيل.
00:02:01وهو يقوم بالمهمة.
00:02:03ثم تنظر إلى النتيجة وتقول،
00:02:05هل انتبه حقاً للتفاصيل؟
00:02:07هل اتبع فعلاً كل هذه القواعد؟
00:02:09أم أنه قام بما بدا له مناسباً فحسب
00:02:11وأعطاني محاكاة تقريبية
00:02:14لما كنت أتوقعه؟
00:02:16لا يمكنك الجزم بذلك حقاً، أم يمكنك؟
00:02:18المزيد عن ذلك لاحقاً.
00:02:20وهكذا تعيش مع حالة من القلق الخفيف المستمر
00:02:23في كل مرة تضغط فيها على زر التشغيل.
00:02:24وهذا الشعور هو ما يدور حوله هذا البحث
00:02:27وما نحاول معرفة ما إذا كان بإمكاننا تجنبه.
00:02:30إذن إليكم وعدي لكم خلال الـ 18 دقيقة القادمة.
00:02:33سأريكم مصدر رقم 200 هذا،
00:02:36وما إذا كان لا يزال صحيحاً،
00:02:37وما هو الرقم الحقيقي اليوم،
00:02:39لأنه تغير بمقدار مرتبة عظيمة من الحجم.
00:02:41ثم سنتحدث عما تعنيه هذه النتيجة
00:02:44بالنسبة لكم لتستفيدوا منها.
00:02:46ما هو الطول الحقيقي الذي يمكن أن تكون عليه مهاراتك وموجهاتك،
00:02:49وما هي التغييرات التي يجب عليك إجراؤها
00:02:51على سير عملك نتيجة لذلك.
00:02:54إذن، رقم 200 ليس مجرد أسطورة شعبية.
00:02:57فهو مستمد من معيار حقيقي يسمى IfScale،
00:02:59من بحث قدمه هذا الشخص الذي سأخطئ حتماً في نطق اسمه،
00:03:03جاروسلافيتش، ومؤلفون مشاركون العام الماضي.
00:03:06والاختبار بسيط بشكل جميل.
00:03:10إليك كيف يعمل اختبار IfScale.
00:03:12تطلب من النموذج كتابة تقرير تجاري،
00:03:14وتزوده بقائمة من الكلمات المحددة
00:03:16التي يجب تضمينها بدقة في التقرير.
00:03:19تضمين كلمة عميل بالضبط،
00:03:20تضمين كلمة إيرادات بالضبط،
00:03:22وهكذا دواليك لأكبر عدد تريده من الكلمات.
00:03:24كل واحدة من هذه تعتبر تعليمة يجب عليه اتباعها.
00:03:27ثم تحصي عدد تلك الكلمات المحددة التي ظهرت فعلاً.
00:03:32ولأن الاختبار بسيط جداً،
00:03:34عليك فقط الاحتفاظ برقمين في ذهنك.
00:03:36الأول هو الكثافة، والتي نرمز لها بـ n.
00:03:38وهي عدد القواعد التي نتحدث عنها في وقت واحد.
00:03:41والثاني هو الدقة،
00:03:42وهي النسبة المئوية لتلك القواعد
00:03:43التي تمكن من اتباعها بالفعل.
00:03:46الآن قد تقول إن تضمين كلمات عشوائية في تقرير
00:03:50ليس كاتباع تعليمات حقيقية،
00:03:52وهذا اعتراض وجيه، وسنتحدث عن ذلك.
00:03:55لكن الكلمات المفتاحية هي بمثابة مؤشر بديل.
00:03:57تضمين كلمة إيرادات له نفس شكل وطبيعة مهمة
00:04:01تتمثل في تضمين قسم عن التسعير، أليس كذلك؟
00:04:02أو عدم استخدام هذه العبارة أبداً.
00:04:04إنه قيد مستقل ومحدد
00:04:06طلبت من الوكيل أن يلتزم به.
00:04:09إذا لم يستطع النموذج تتبع 200 كلمة في موجه واحد،
00:04:11فسوف يعاني بالتأكيد
00:04:13مع 200 تعليمة أكثر تعقيداً.
00:04:16لذا إن لم يكن أسوأ، فلن يكون أفضل حالاً.
00:04:20إذن هذا الرقم يمثل السقف الأقصى.
00:04:22هذا الرقم هو أقصى ما يمكنك الوصول إليه.
00:04:23إذا أعطيته تعليمات أكثر تعقيداً،
00:04:25فمن المحتمل أن ينخفض هذا الرقم.
00:04:27و200 هو سقف منخفض للغاية.
00:04:30لذا قبل السعي وراء نماذج جديدة،
00:04:32عليك أن تقوم بعمل علمي صحيح،
00:04:33مما يعني أنه يجب عليك تكرار النتيجة القديمة
00:04:36والتأكد من أن سقف 200 هو أمر حقيقي.
00:04:39لذلك قمت بإعادة تشغيل الاختبار الأصلي.
00:04:42اختبر البحث الأصلي مجموعة كاملة من النماذج،
00:04:45والنماذج تولد وتتقادم بسرعة فائقة.
00:04:47لذا بحلول الوقت الذي فرغت فيه لإجراء هذا الاختبار،
00:04:50كانت ثلاثة فقط من النماذج ضمن المجموعة الأصلية
00:04:52التي تضم 10 نماذج استخدموها
00:04:54لا تزال متاحة عبر أي نوع من واجهات برمجة التطبيقات.
00:04:57وهي GPT 4.1، وClaude Sonnet 4،
00:04:59وGemini 2.5 Pro.
00:05:01تلك كانت نماذج متاحة قبل 12 شهراً،
00:05:03وما زالت متاحة حتى الآن.
00:05:05ولهذا السبب اختبرنا تلك النماذج الثلاثة،
00:05:07لأنها كانت كل ما تبقى.
00:05:08ومنذ أن نشرت هذا البحث لأول مرة
00:05:11قبل بضعة أسابيع،
00:05:12تم إحالة أحد هذه النماذج الثلاثة إلى التقاعد.
00:05:14لذا كانت هذه آخر فرصة ممكنة
00:05:16يمكنني خلالها إجراء هذا الاختبار.
00:05:17إذن من تلك التشكيلة، تقلص العدد إلى نموذجارين فقط.
00:05:20لذا لا تتعلقوا بنماذجكم كثيراً.
00:05:22وها هي النتائج التي حصلنا عليها عند محاكاة
00:05:25نتيجة اختبار IfScale الأصلي.
00:05:27حيث تمثل الدقة المحور الرأسي.
00:05:29لذا فهي تبدأ من 100% وتبدأ بالتراجع.
00:05:32بينما يرتفع عدد القواعد على طول المحور الأفقي السفلي
00:05:35بمقياس لوغاريتمي.
00:05:36لذا في كل مرة يتحرك فيها المنتصف أفقياً،
00:05:37يكون قد ضاعف عدد القواعد التي يتعامل معها.
00:05:42لذا عند الوصول إلى 500 قاعدة، تفقد 30، أو 40، أو 50% منها.
00:05:46تطابقت منحنياتنا مع النتائج الواردة في الورقة الأصلية
00:05:49ضمن حدود التشويش، لذا كانت النتيجة حقيقية.
00:05:52قبل عام، وعند عدد يتراوح بين 200 إلى 300 قاعدة،
00:05:55بدأت النماذج الرائدة في الانهيار.
00:05:57هذا سقف منخفض حقاً.
00:06:00إذن هذا هو خط الأساس لدينا، والآن يأتي الجزء الممتع
00:06:03حيث أخذنا نفس الاختبار تماماً
00:06:05وطبقناه على المستوى الرائد الحالي،
00:06:07أو بالأحرى، ما كان يمثله المستوى الرائد الحالي
00:06:09عندما أجريت هذا الاختبار.
00:06:10لذلك شغلت نموذج GPT 5.5، وClaude Opus 4.7،
00:06:13لأن الإصدار 4.8 صدر بعد أسبوع من إجراء هذا الاختبار،
00:06:17وGemini 3.1 Pro، وDeep Seek V4 Pro.
00:06:20لذلك أعطيتها نفس الأمر، ونفس الكلمات،
00:06:22وكل شيء نفسه، وواجهت مشكلة على الفور،
00:06:25وهي أنها اجتازت الاختبار بامتياز.
00:06:27لقد حصلت جميعها على نتيجة 100% فوراً في هذا الاختبار،
00:06:30دون أي أخطاء على الإطلاق.
00:06:34لذا كنا قد صممنا اختباراً لإيجاد السقف،
00:06:36فاجتازت النماذج السقف مباشرة
00:06:37دون أن تلاحظ وجود هذا السقف من الأساس.
00:06:40وتلك كانت مشكلة، لأن معيار القياس
00:06:42صُمم ليصل إلى أقصى حد عند 500 كلمة،
00:06:43لذا كان عليّ تغيير معيار القياس
00:06:45لكي أتمكن من العثور على السقف الجديد.
00:06:47لذلك غيرت قواعد اللعبة، ومنحتها المزيد من الكلمات لتضمينها.
00:06:50ضاعفت العدد من 500 إلى 1000،
00:06:52وضاعفته مرة أخرى من 1000 إلى 2000،
00:06:55واستمررت في فعل ذلك حتى وصلت إلى مفردات
00:06:56بمقياس 10,000 كلمة، وهناك بدأت أجد سقف
00:07:00ما يمكن أن تحققه النماذج هذه الأيام.
00:07:03دعوني أعرض، هذه هي الشريحة الأهم،
00:07:06هذه هي النتائج.
00:07:07تذكروا، المحور الأفقي هنا يعتمد على مقياس لوغاريتمي.
00:07:12إذن فهو ينتقل من 500 إلى 1000 إلى 5000 إلى 10000.
00:07:16يبدو وكأن هذا المقياس يسقط من قمة جرف،
00:07:18ولكنه يحدث فعلياً عبر حوالي 1000 رقم.
00:07:20ولكن انظروا إلى مدى امتداد هذه المنحنيات الجديدة نحو اليمين
00:07:25قبل أن تبدأ بالانحناء.
00:07:26قبل عام، كانت تنهار عند 200 إلى 300 تعليمة،
00:07:29والآن، اعتماداً على النموذج، أصبح الحد يقارب 2000،
00:07:32وبالنسبة لأفضلها، فهو يصل إلى 5000 تعليمة
00:07:36قبل أن تبدأ بالسقوط من فوق الجرف.
00:07:38إذن في غضون 12 شهراً تقريباً، أصبحت النماذج الرائدة أفضل
00:07:41بحوالي 10 مرات في اتباع التعليمات في نفس الوقت.
00:07:44هذه هي النتيجة الرئيسية، وهناك الكثير من الدقائق والتفاصيل
00:07:47التي نحتاج إلى خوض غمارها.
00:07:49القدرة على تتبع 2000 قيد مسجّل في موجه واحد أصبحت موجودة.
00:07:53وهي متوفرة.
00:07:55وهذا أمر مثير حقاً لأني أعتقد،
00:07:57لا أعرف إذا كان الجميع يشعرون بهذه الطريقة،
00:07:59ولكن بدا لي وكأن القفزات من، كما تعلمون،
00:08:04GPT 5.1 إلى GPT 5.5 كانت تدريجية نوعاً ما، أليس كذلك؟
00:08:07لم نكن نشعر بأننا تحسنا بمقدار 10 أضعاف،
00:08:09ولكن هذا اختبار يهم حقاً جانباً عملياً للغاية،
00:08:14مثل كم يجب أن يبلغ طول ملف المهارات الخاص بي؟
00:08:17وفي غضون عام واحد، تحسنا بمقدار 10 أضعاف.
00:08:21وما يثير دهشتي هو أن معيار القياس هذا
00:08:23لم يمر على إطلاقه سوى عام بالكاد.
00:08:25بعد عام، أصبح الرقم 500 مجرد خطأ تقريبي،
00:08:27وهذا الأمر يستمر في التغير تحت قدمي.
00:08:29لقد اختبرت النسخة 4.7، وOpus 4.8 أفضل حتى.
00:08:35لذا فإن هذا الرسم البياني قديم بعض الشيء بالفعل،
00:08:36وهذا هو جوهر الأمر برمته.
00:08:37إذا وضعت افتراضاتك الهندسية
00:08:39حول كيف يجب أن تعمل ملفات المهارات،
00:08:41وحول طول الموجه الذي يمكنك استخدامه،
00:08:44وقمت بذلك منذ أكثر من ستة أشهر تقريباً،
00:08:46فأنت غير مصيب الآن،
00:08:48ويتعين عليك على الأرجح إعادة هندسة طريقة عملك.
00:08:52ولكن هناك المزيد في هذه القصة
00:08:54لأن الطريقة التي فشلت بها النماذج
00:08:59تغيرت بشكل دراماتيكي،
00:09:00والطريقة التي فشلت بها مهمة للغاية.
00:09:02هذا الجزء كان نتيجة غير متوقعة تماماً
00:09:06عندما بدأت في إجراء التجربة.
00:09:07وقد أربك ذلك اختباري تماماً في البداية
00:09:10لأن نمط الفشل القديم كان مُملاً.
00:09:13كانوا ينسون التعليمات فقط
00:09:14ويمكنني قياس عدد التعليمات
00:09:16التي تذكريوها أو نسوها.
00:09:17لكن النماذج الجديدة تنهار بطريقتها الغريبة
00:09:20والتي تعبر عن هويتها تماماً.
00:09:22دعوني إذن أطلعكم على كيفية فشل هذه النماذج الأربعة.
00:09:26نموذج Deep Seek 4 هو نموذج تقليدي.
00:09:29إنه ينسى الأمور ببساطة.
00:09:30ليس هناك أي دراما.
00:09:31يبدأ في نسيان التعليمات عند حوالي 750 قاعدة،
00:09:35وعند الوصول إلى 2000، يفقد ما يقرب من نصفها.
00:09:38لذا فهو ينسى فحسب، وهو بصراحة نمط الفشل
00:09:41الذي أثق به أكثر لأنه قابل للتنبؤ.
00:09:43وهو سهل القياس للغاية.
00:09:44أما النماذج الأخرى فلم تكن متعاونة إلى هذا الحد بتاتاً.
00:09:48كان نموذج Opus 4.7 يقرر مراراً وتكراراً
00:09:52أن الاختبار كان خطيراً.
00:09:54وما كان يفعله هو أنه كان يرفض
00:09:57على مستوى واجهة برمجة التطبيقات (API) إتمام الاختبار.
00:09:59لمكن أكن أعلم أن هناك رد واجهة برمجة تطبيقات
00:10:01يمكنك الحصول عليها من Claude وكأنها تقول:
00:10:03لا، يمكنني فعل هذا، لكني لن أفعله.
00:10:06ولكن هذه بالتأكيد استجابة على مستوى واجهة برمجة التطبيقات
00:10:09يدعمها Claude لأنهم يهنؤون كثيراً
00:10:10بموضوع الأمان، وبدأت أتلقى تلك الاستجابات
00:10:13طوال الوقت.
00:10:15والسبب وراء حدوث ذلك
00:10:16هو أن Claude يمتلك مصنف أمان شديد الحساسية.
00:10:19وإذا أدخلت مجموعات معينة من الكلمات،
00:10:22مثل الجمرة الخبيثة والسيانيد على سبيل المثال،
00:10:24فإنه يقرر أن الطلب بأكمله خطير
00:10:26ويتراجع عنه.
00:10:27وإذا تذكرتم ما يفعله اختباري،
00:10:29فإن اختباري يلقي بخمسة إلى عشرة آلاف كلمة عشوائية
00:10:33داخل ملف تعليمات.
00:10:35وبالتالي فإن كلماتي المختارة عشوائياً تحتوي على
00:10:38كل أنواع الأشياء التي بدت خطيرة
00:10:39عند دمجها في نظر مرشح الأمان.
00:10:41ولذلك استمر في التراجع قاصداً أنني أطلب منه
00:10:43صنع قنبلة أو ما شابه.
00:10:47لذا كان علينا، لكي نجعل Claude يتعاون،
00:10:52أن أستخرج جميع كلماتي
00:10:54وأمررها عبر مرشح الأمان التابع لشركة OpenAI
00:10:56لتصفية جميع الكلمات ذات المظهر المشبوه
00:10:58لكي يتمكن من الوصول إلى أي مكان.
00:10:59بمجرد أن قدمت له ذلك، أدى Claude بشكل جيد حقاً.
00:11:03ولكن نمط الفشل هو أن Claude أكثر عرضة
00:11:05للقرار بأن ما تفعله خطير في وقت مبكر جداً
00:11:08عند، كما تعلمون، حتى مئتين أو ثلاثمائة تعليمة
00:11:11إذا كان ما تفعله، كما تعلمون،
00:11:13يحتوي على أي شيء يتعلق بالنصائح الطبية
00:11:15لأن الأمور الطبية غالباً ما تكون مزدوجة الغرض.
00:11:17يمكن أن تكون خطيرة، ويمكن أن تكون آمنة.
00:11:20إذن نموذج الفشل الثالث كان Gemini 3.1 Pro.
00:11:24يعد نموذج Gemini صلباً كالصخر طوال الطريق وصولاً إلى 5000 تعليمة.
00:11:28إنه يؤدي بشكل ممتاز للغاية.
00:11:30إنه حقاً أحد الأفضل على الرسم البياني.
00:11:32وبعد ذلك الحد، تبدأ الأمور تصبح غريبة.
00:11:35إنه لا ينسى التعليمات.
00:11:37إنه يصاب بالإرهاق بسبب التعليمات.
00:11:39ما يحاول فعله هو أنه، يستخدم الرموز التفكيرية
00:11:44للتأكد من أنه يتبع
00:11:45جميع التعليمات في نفس الوقت.
00:11:46وعندما يصبح عدد التعليمات كبيراً حقاً،
00:11:48فإنه يستهلك كل رموز التفكير الخاصة به.
00:11:50إنه يستخدم ميزانية الرموز بأكملها في التفكير
00:11:53ثم لا يقدم أي مخرجات.
00:11:55إنه يصل إلى حوالي تسعة، كما تعلم،
00:11:57إذا أعطيته ما يعادل 10,000 رمز،
00:11:59سيستهلك ما يعادل 9,500 رمز من التفكير
00:12:02ثم يعطيك استجابة من 500 كلمة،
00:12:04والتي لا تحتوي على أي من الرموز المطلوبة.
00:12:07إذن فهو يفكر حتى يضع نفسه في زاوية ضيقة
00:12:09وينفد منه المجال للإجابة الفعلية،
00:12:10وهو أمر مكلف للغاية وغير مفيد على الإطلاق،
00:12:13وهذا يشبه طابعه المعتاد، أليس كذلك؟
00:12:19وهو أمر، كما تعلم، لن أقوله بصوت عالٍ أبدًا.
00:12:23وأخيرًا يأتي الفائز، وهو نموذج GPT 5.5.
00:12:26يُعد GPT 5.5 الأفضل بين المجموعة، بدقة تبلغ 99%،
00:12:29وصولاً إلى 5,000 قاعدة.
00:12:32ولكن إذا دفعت الأمور إلى أبعد من ذلك،
00:12:33فهو بفارق كبير الأكثر غرابة في المجموعة.
00:12:35لأنه لا يرفض الطلب صراحة،
00:12:37ولا ينسى بصمت.
00:12:38بدلاً من ذلك، ما يفعله هو أنه يشعر بالإحباط
00:12:41ويخبرك بأن هذا الاختبار غبي.
00:12:45إنه يبدأ التقرير، ويجتاز بضع،
00:12:47مثل هذه هي المشكلة،
00:12:48إنه لا يبدأ بقول لا فورًا.
00:12:50إنه يبدأ التقرير،
00:12:51يبدأ في كتابة التقرير،
00:12:52وحوالي 500 كلمة داخل التقرير،
00:12:54يقول لك: لا، هذا أمر سخيف.
00:12:55لن أقوم بذلك.
00:12:56ثم يخبرك بأدب أن هذا أمر سخيف.
00:12:58لن أستمر في فعل هذا بعد الآن.
00:13:00تلك هي الاستجابة الفعلية التي قدمها لي.
00:13:02ولكن حدث ذلك بعد نحو 5,000 كلمة من تقرير الأعمال هذا
00:13:05الذي طلبت منه توليده.
00:13:08إذن فهو ليس مخطئًا، أليس كذلك؟
00:13:10كنت أطلب تقرير أعمال مترابطًا
00:13:12دون موضوع محدد
00:13:14يحتوي على 5,000 كلمة عشوائية.
00:13:17أنت محق يا جي بي تي.
00:13:19هذا طلب سخيف حقًا.
00:13:23وهو طلب غير معقول البتة،
00:13:25وقد أشار نموذج GPT إلى ذلك.
00:13:27ولكنه لا يزال يُحتسب فشلاً في الاختبار.
00:13:29لأن التقرير نصف المنتهي الذي يقدمه لك
00:13:31تفتقر معظم الكلمات المفتاحية فيه،
00:13:32وهو أيضًا الأصعب من حيث الاكتشاف.
00:13:35لأن كلود ينسحب فورًا.
00:13:36كلود يقول: لا،
00:13:37لن أقوم بهذا.
00:13:39Deep Seek يبذل قصارى جهده.
00:13:41لكن GPT يؤدي ما يبدو وكأنه عمل جيد،
00:13:44ما لم تقرأ التقرير حتى نهايته تماماً،
00:13:46حيث يقول، لا، في الواقع،
00:13:47سأنسحب لأن هذا سخيف.
00:13:51لذا، إذا تراجعت خطوة للوراء ونظرت إلى الأربعة معاً،
00:13:53Deep Seek ينسى بهدوء.
00:13:54وكلود يشعر بالخوف ويرفض.
00:13:56وجيمني يفرط في التفكير حتى يصمت تمامًا.
00:13:58ونموذج GPT 5.5 ينهي نصف المهمة،
00:14:00ويخبرك أن الباقي أقل من مستواه.
00:14:04والغرض ليس تحديد أي منها هو الأكثر إمتاعًا.
00:14:07على الرغم من أنه أمر مضحك حقًا بعض الشيء.
00:14:09المغزى هو أن سؤال: هل أتبع تعليماتي؟
00:14:12لم يعد له نمط فشل واحد فقط.
00:14:14بل له أربع طرق مختلفة للفشل.
00:14:16ولا يمكنك اكتشاف هذا الفشل إلا إذا كنت تعرف
00:14:19النموذج الذي تتعامل معه وما سيكون عليه نمط فشله.
00:14:23إذن، أصبحت النماذج أفضل بمقدار 10 أضعاف.
00:14:27وهي تفشل بطرق طريفة.
00:14:29فلماذا يجب أن يهمك الأمر عندما تعود إلى مكتبك؟
00:14:31لأن ثلاثة أمور قد تغيرت في سير عملك.
00:14:34الأول هو أنه قبل عام، كانت الخطوة الذكية هي الحفاظ على كل ملف مهارات قصيرًا جدًا.
00:14:39أقل من 200 تعليمة، ثم التوجيه إلى مهارات فرعية ومتاهة بيزنطية كاملة من ملفات المهارات الإضافية والملفات الفرعية وما شابه ذلك.
00:14:50وكنت تضغط تعليماتك لتناسب مساحة متاحة صغيرة جدًا ولست بحاجة إلى فعل ذلك بعد الآن.
00:14:57يمكن أن تكون ملفات مهاراتك طويلة جداً.
00:14:59النقطة الثانية هي أنه إذا كانت حالتك الاستخدام تحتاج إلى مئة قاعدة محددة أو ثلاثمائة، فيمكنك وضعها كلها في الموجه مباشرةً.
00:15:06ليس عليك أن تظل مستيقظاً تتساءل عن أي منها تجاهله النموذج بصمت.
00:15:12وإذا كنت تفكر في تجربتك الخاصة في استخدام النماذج، فمن المحتمل أنك تدرك هذا.
00:15:21لقد اكتشفت أنك أصبحت أقل قلقًا بشأن مدى طول موجهك، لأن النماذج أصبحت حقًا أفضل بعشرة أضعاف في اتباع موجّهاتك.
00:15:322000 قيد مُسمَّى هو دليل أسلوب كامل، أليس كذلك؟
00:15:35إنه كل قاعدة للعلامة التجارية، وكل إخلاء مسئولية قانوني.
00:15:38قبل عام، كان عليك تقسيم ذلك عبر عشرات الوكلاء المتخصصين وتأمل أن يسلم وكلاؤك المتخصصون المهام لبعضهم البعض بشكل نظيف.
00:15:46ولكن يمكنك الآن تجاهل ذلك.
00:15:48ولكن الأمر الثالث هو الأهم.
00:15:50كان السؤال سابقًا: هل يستطيع النموذج القيام بذلك من الأساس؟
00:15:53والإجابة الآن هي بنعم بشكل قاطع.
00:15:55حسنًا، بشكل قاطع إلى حد ما.
00:15:58السؤال الجديد هو: هل يستحق الأمر التكلفة؟
00:16:01لأنه يمكنك تضمين 10,000 كلمة من - عذرًا، 10,000 تعليمة مختلفة في موجهك، لكنه سيكون موجهاً هائلاً.
00:16:07سيكون موجهاً باهظ الثمن للغاية.
00:16:09سيكون موجهاً بطيئاً للغاية.
00:16:10لذا فإن ما كان يوماً جداراً صلباً تصطدم به أصبح الآن مقايضة مرنة تتمثل في: هل يستحق الأمر مني إضافة كل هذه التعليمات الإضافية إذا كان ذلك سيمنحني تكلفة أعلى وتأخيراً أكبر؟
00:16:19والآن، بعض التحفظات لقطع الطريق على الأسئلة والأجوبة.
00:16:25أولاً والأهم، ذكرت هذا سابقاً، هذه مهمة بديلة، وتضمين كلمات عشوائية في تقرير أعمال زائف هو دليل على أن ملف المهارات الطويل يعمل.
00:16:38وهو ليس نفس إثبات أن ملف المهارات الطويل يعمل بكفاءة مطلقة.
00:16:41أيضًا، تصطدم النماذج بالجدار عند نقاط متباينة للغاية، في أي مكان من 750 إلى أكثر من 9000، لذا عليك اختيار نموذجك بعناية فائقة.
00:16:49ما لا يفعله اختبارنا هو قياس ما إذا كان النموذج قد استنتج بوضوح عبر موجه عملاق.
00:16:57إذن، الخبر السار هو أنه منذ أن أجريت بحثي قبل عدة أسابيع، انضم عدد كبير من الناس إلى هذا المجال، وهناك الآن أبحاث جيدة.
00:17:05لقد شارك علماء حقيقيون وقاموا بعمل -- قامت شركة Chroma بعمل متعلق بتعفن السياق عبر 18 نموذجاً، مما يوضح أن الدقة على المدخلات الطويلة يمكن أن تنخفض بنسبة 30 إلى 50 بالمائة قبل وقت طويل من وصولك إلى حد نافذة السياق.
00:17:21والجزء الغريب في ما توصلوا إليه هو أن النص المترابط وجيد التنظيم أكثر عرضة للوصول إلى نمط الفشل هذا مقارنة بما لو وضعت تعليماتك بترتيب عشوائي وخلطتها.
00:17:33لا أعرف لماذا الأمر كذلك، سيتعين علي قراءة تقريرهم.
00:17:37إذن، يمكن للنموذج تتبع 2000، 5000، وربما 10000 تعليمة، لكنه لن يستنتج بالضرورة بوضوح من خلالها.
00:17:46لن يكون بالضرورة -- إذا تعارضت تلك التعليمات، إذا كان هناك توتر بينها، فلن يفهم ذلك بالضرورة بشكل صحيح.
00:17:53وهناك النقطة الأخرى التي ذكرتها باختصار.
00:17:56رفض كلود مزعج، لكنه واضح.
00:18:00تحصل على خطأ، وتعلم أنه فشل.
00:18:02تقرير GPT المهذب شبه المنتهي هو أكثر خطورة بكثير لأنه يبدو وكأنه إجابة حقيقية.
00:18:07عليك قراءة التقرير بأكمله لتلاحظ أنه استسلم بهدوء في منتصف الطريق، مما يعني أنه لا يمكنك الوثوق بالنتيجة.
00:18:13وهذا يعني أنه يجب عليك قراءة المخرجات في كل مرة للتأكد مما إذا كانت تعمل أم لا.
00:18:17إذن، سيقبل النموذج قواعدك الـ 2000 وسيسلمك شيئًا يبدو، على الأقل في البداية، واثقاً ومصقولاً، ولكنه قد ينسحب في منتصف الطريق.
00:18:30إذن، كأمر جانبي، يسألني الناس دائماً عن التكلفة التي تكبدتها لكل هذا.
00:18:34لقد كلفني تشغيل كل هذه الاستعلامات 209 دولارات.
00:18:372300 استدعاء عبر سبعة نماذج بلغت تكلفتها 209 دولارات.
00:18:43يتضح أن البحث الجديد لا يكلف الكثير.
00:18:46وهذا هو الجزء من المحادثة حيث كنت أقول إنه يجب عليك التحقق من هذه الأمور في الإنتاج لأنه لا يمكنك الوثوق في أن نموذجك لن يفشل بصمت.
00:18:55إذن، كنت تعلم أنني سأذكر عمليات التقييم في النهاية لأنني أعمل في Arise وهنا أقوم بذلك.
00:19:01ولكن هناك الكثير من الإعلانات لشركة Arise.
00:19:03لذا، سأقول شيئًا واحدًا صحيحًا فقط، وهو أنه إذا كنت تبني تطبيق ذكاء اصطناعي حقيقي وكنت تمنحه مهام صعبة حقًا،
00:19:10فسوف تواجه واحدة أو أكثر من أنماط الفشل هذه مع نموذج رائد.
00:19:14وما لم يكن كلود يخبرك فقط بالذهاب إلى الجحيم على مستوى واجهة برمجة التطبيقات، فإن الطريقة الوحيدة لمعرفة أن شيئًا ما قد سار بشكل خاطئ هي مراقبة مخرجاتك باستخدام نموذج لغوي كبير آخر.
00:19:23هذا هو التقييم وهذا ما تفعله Arise وسأكتفي بذلك.
00:19:27لقد ذكرت بالفعل أن هناك بحثًا جديدًا منذ أن قمنا ببحثنا الخاص.
00:19:30إليك مهمة أخرى هامة.
00:19:31صدرت ورقة بحثية تختبر 46 نموذجاً بعنوان إعادة زيارة موثوقية النماذج اللغوية في اتباع التعليمات،
00:19:37والتي يمكنك الجزم بأنها جعلتني أصغي إلي3ا باهتمام بعد أن أجريت ذلك البحث بنفسي.
00:19:41وقد وجدوا شيئًا مزعجًا، وهو أن النموذج يمكن أن يتفوق في معيار مثل معيارنا ومع ذلك يظل غير موثوق به بشدة.
00:19:47لأنه إذا أعدت صياغة نفس التعليمة بطريقة مختلفة قليلاً، يمكن أن يحدث ذلك فرقًا جذريًا في مدى إتقانه لاتباع تلك التعليمات.
00:19:56لذا يمكن للنموذج اتباع 2000 تعليمة ويمكنه القيام بذلك بشكل جيد حقًا.
00:20:00ولكن إذا وضعت نفس التعليمات، نفس الـ 2000 تعليمة بترتيب مختلف، فيمكن أن يؤدي ذلك فجأة إلى جعل النموذج أسوأ بكثير في اتباع تلك التعليمات.
00:20:08وكيفية فعل ذلك بالضبط، وما هو الترتيب الصحيح للتعليمات لإعطائها لنموذجك بحيث يتبعها تمامًا بدلاً من الارتباك، هو أمر لا يزال قيد البحث.
00:20:19إذن ارتفعت السعة، لكن الموثوقية لا تزال تشكل مشكلة.
00:20:24وهذا مجرد تباهٍ بسيط لأنني كنت سعيداً به، فأنا لست عالماً، لقد قمت ببعض الأبحاث.
00:20:31ثم انضم عدد كبير من العلماء الحقيقيين الآخرين وأجروا علما حقيقياً حول نفس السؤال.
00:20:36هناك الآن مجموعة كاملة من المعايير التي ظهرت لقياس هذا السؤال ذاته.
00:20:40Firebench و CCRbench و Guidebench تحاول جميعها قياس نفس الشيء.
00:20:44مدى جودة اتباع النماذج للعديد من القيود الحقيقية والفوضوية دفعة واحدة.
00:20:49والآن ينظر المجال بأكمله إلى هذا الأمر، لذا إذا كنت تريد علماً أفضل من كلماتي العشوائية الـ 10,000، فإن العلم الحقيقي موجود الآن.
00:20:58إذن هذا يقودني إلى حيث سأترككم.
00:21:00قبل عام، كان الجزء الصعب في كتابة المهارة هو ملء كل شيء دون أن يفقد النموذج تركيزه.
00:21:05كانت تلك مشكلة ضغط، وقد زالت مشكلة الضغط.
00:21:08سيحتفظ النموذج بتعليماتك البالغ عددها 2000 على ما يرام.
00:21:11الجزء الصعب الجديد هو معرفة ما إذا كان قد فعل حقًا ما قلت، وتلك هي مشكلة التحقق.
00:21:16لا يتم حل مشكلة التحقق بكتابة موجه أفضل.
00:21:20يتم حلها عن طريق التحقق من المخرجات في كل مرة بالطريقة التي تختبر بها أي كود آخر، وهذا يعني إجراء التقييم (Eval).
00:21:26تحرك السقف بمقدار 10 أضعاف في عام واحد.
00:21:29لذا عد وتحقق من افتراضاتك التي وضعناها قبل ستة أشهر حول حجم موجّهاتك، ومدى كبر حجم تعليماتك، لأنها قد تكون خاطئة بالفعل.
00:21:41إذن هذه هي المحادثة.
00:21:42إذا كنت تريد كل الكود وكل البيانات، فهي موجودة على عنوان GitHub هذا.
00:21:48وهذا رمز الاستجابة السريعة الآخر هو شيء جعلني التسويق أقوم بإدراجه.
00:21:51لدينا حفلة لمشاهدة كأس العالم الليلة الساعة 5:00 مساءً.
00:21:55يمكنك القدوم إلى حفلتنا.
00:21:56هذا الرابط يقودك إلى تطبيق Luma الذي سيدخلك إلى الحفلة.
00:22:01آمل أن تكون هذه المحادثة قد زودتك بمعلومات جديدة أو على الأقل ببعض الضحكات، وشكرًا جزيلاً على وقتكم وانتباهكم.
00:22:07شكراً لك.
00:22:08شكراً لك.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video