هذا النموذج مفتوح المصدر يحل أكبر عيوب الذكاء الاصطناعي (ThinkingCap)
BBetter Stack
Computing/SoftwareSmall Business/Startups
Transcript
00:00:00هذا هو نفس السؤال الذي وجه إلى نفس النموذج الأساسي.
00:00:03راقب عدادات الرموز هنا.
00:00:05أحدهما يقضي وقتاً طويلاً في التفكير بشأن السؤال،
00:00:09بينما الآخر قد أكمل المهمة بالفعل.
00:00:12وإذا تحققنا من كلا الناتجين، فإن إجابة السؤال هي نفسها أساساً.
00:00:16لكن النموذج الذي على اليمين أهدر رموزاً أكثر بكثير للوصول إلى نفس النتيجة.
00:00:21وهذا أمر رائع حقاً، لأن الاختلاف الوحيد بين هذين النموذجين
00:00:24هو أن النموذج الذي على اليسار يشغل خاصية “ثينكينغ كاب”،
00:00:27وهي نسخة مخصصة ومعدلة بدقة من نفس النموذج،
00:00:31والتي تهدف إلى ضمان حصولك على نفس الجودة في المخرجات
00:00:34مع التضحية برمز أقل والوصول إلى إجابتك بشكل أسرع مرتين.
00:00:39لذا في فيديو اليوم، سنلقي نظرة على “ثينكينغ كاب”،
00:00:42ونرى كيف تعمل، ومن ثم سنقوم بتجربتها بأنفسنا
00:00:45لنرى ما إذا كانت هذه حقاً مقاربة مبتكرة لضبط نماذج الذكاء الاصطناعي.
00:00:50سيكون الأمر ممتعاً للغاية، لذا دعونا نغوص فيه.
00:00:57قبل أن نتحدث عن “ثينكينغ كاب”، دعونا نعيد عقارب الساعة قليلاً لنرى كيف وصلنا إلى هنا بالفعل.
00:01:03أول نموذج متاح على نطاق واسع على الإطلاق، جي بي تي-3، تم إطلاقه في عام 2020،
00:01:09وبحلول أواخر عام 2022،
00:01:11وضع شات جي بي تي نموذج جي بي تي 3.5 أمام عامة الناس للمرة الأولى.
00:01:17وهناك بدأت علاقة معظم الناس بالذكاء الاصطناعي بالفعل.
00:01:21تلاه نموذج جي بي تي-4 في عام 2023، والذي كان قفزة أخرى في القدرات،
00:01:25لكنه ظل يحمل نفس الفكرة الأساسية.
00:01:28توقع الرمز التالي والاجابة فوراً.
00:01:31ولكن بعد ذلك، في سبتمبر 2024، أطلقت أوبن إيه آي نموذج أو1،
00:01:37وكان هذا أول نموذج يستخدم وضع التفكير قبل الإجابة.
00:01:42لذا بدلاً من إطلاق الاستجابة فوراً،
00:01:45قضى وقتاً ورموزاً إضافية في التفكير الاستدلالي في المشكلة أولاً.
00:01:49لقد أدى هذا التحول المعماري الواحد إلى إطلاق عصر نماذج الاستدلال.
00:01:54تلاه نموذج ديب سيك آر1 بعد بضعة أشهر
00:01:56وجلب نفس الفكرة إلى عالم المصدر المفتوح.
00:02:00وبسرعة كبيرة،
00:02:01أصبح الاستدلال هو الشيء الذي كانت تقدمه كل شركة كبرى لصناعة نماذج الذكاء الاصطناعي.
00:02:05ولكن الآن، بعد مرور أكثر بقليل من عام،
00:02:08بدأنا نشهد ظهور الاتجاه المعاكس.
00:02:11نماذج تم ضبطها بدقة خصيصاً للتفكير بشكل أقل وليس أكثر.
00:02:15بطريقة ما، نحن نعود إلى الأساسيات،
00:02:17ولكن مع دمج كل ما تعلمناه من عصر الاستدلال.
00:02:21ولكن إليكم الأمر.
00:02:22ذلك التحول نحو المزيد من التفكير حل مشكلة وخلق أخرى بهدوء.
00:02:28لم يعلم أحد هذه النماذج متى تتوقف عن التفكير فعلياً.
00:02:31إذا طلبت من نموذج استدلال شيئاً بسيطاً حقاً،
00:02:34فإنه سيظل يستهلك آلاف الرموز،
00:02:37مستنتجاً أشياء اكتشفها بالفعل قبل ثلاث جمل،
00:02:41أو يعيد صياغة نفس النقطة بكلمات مختلفة قليلاً،
00:02:44أو في أسوأ السيناريوهات، سيبدأ في الدخول في حلقات مفرغة.
00:02:48وأنا أعني ذلك بالمعنى الحرفي تقريبا.
00:02:50دعوني أريكم واحدة من أكثر الأمثلة سخافة التي واجهتها.
00:02:54هذا هو نموذج ستيپ 3.5 فلاش.
00:02:56وعندما كنت أختبر نموذج الاستدلال هذا،
00:02:58أرسلت له كلمة واحدة فقط، وهي مرحباً.
00:03:01وانظروا ما يفعله بها.
00:03:03إنه يقضي عدة فقرات في النقاش حول ما إذا كان مطلوباً منه تقديم نفسه باسم نموذجه الدقيق،
00:03:09وما إذا كان استخدام الاسم الدقيق دائماً عند تقديم نفسك يعني أنه يجب عليه تقديم نفسه في كل مرة أو فقط عندما يختار ذلك.
00:03:19ثم يزن ما إذا كان ذكر تاريخ اليوم أمراً ذا صلة.
00:03:22وفي النهاية، بعد كل ذلك، يستقر على رد كان أي منا سيقوم بكتابته في غضون ثانتين تقريبا.
00:03:28مرحباً، أنا نموذج ستيپ 3.5 فلاش.
00:03:31كيف يمكنني مساعدتك اليوم؟
00:03:33إذن هذا ليس استدلالاً حقاً.
00:03:35هذا نموذج تم تدريبه على التفكير، لكنه لم يُدرب أبداً على معرفة متى ينتهي التفكير.
00:03:41الآن، شركة “بوتل كاب إيه آي” هي شركة ناشئة أوروبية تركز بشكل خاص على جعل الاستدلال أكثر كفاءة.
00:03:47وما فعلته مع “ثينكينغ كاب” هو أمر ذكي حقاً بصراحة.
00:03:51لذا فقد أخذوا نموذج كوين 3.6، نسخة 27 مليار معامل،
00:03:55ولم يكونوا يحاولون جعله أكثر ذكاءً ولم يكونوا يعلمونه مهارات جديدة أو يغيرون شخصيته أو يمسون سلوكه المتعلق بالسلامة أيضاً.
00:04:04الشيء الوحيد الذي أرادوا تغييره هو مقدار قوة الحوسبة التي يستهلكها للوصول إلى إجابة كان قادراً بالفعل على تقديمها.
00:04:11وهذا يبدو بسيطاً، لكنه في الواقع أقدم مما يبدو.
00:04:15لذا فإن الطريقة الكسولة لجعل النموذج أسرع هي مجرد قطع تفكيره مبكراً.
00:04:20إجْباره على التوقف بعد قدر معين من الرموز، وسواء انتهى فعلياً أم لا.
00:04:25هذا سيقلل بالتأكيد من عدد الرموز.
00:04:27ولكنه سيعمل أيضاً على جعل النموذج مخطئاً بشكل أكبر لأنه يحتاج حقاً إلى تلك الخطوات الإضافية في بعض الأحيان.
00:04:34لذا فإن التحدي الهندسي الحقيقي هنا ليس جعله أقصر.
00:04:38بل جعله أقصر دون جعله أغبى سراً.
00:04:42وهذه هي الطريقة التي فعلوا بها ذلك بالفعل.
00:04:44بدءاً من نقطة فحص نموذج كوين 3.6، ذي 27 مليار معامل أساسي،
00:04:48قاموا بتدريبه على مجموعة مختارة بعناية من المشكلات التي تمتد عبر مجالات ومستويات صعوبة متعددة.
00:04:55وبدلاً من مكافأة النموذج على الحصول على الإجابة الصحيحة،
00:04:58فقد قاموا بمكافأته على الحصول على الإجابة الصحيحة بكفاءة.
00:05:02لأنه إذا تم مكافأة النموذج فقط على الدقة، فإن الإسهاب لا يكلف شيئاً.
00:05:08ليس هناك أي حافز للتوقف عن التفكير مبكراً.
00:05:10ولكن من خلال مكافأة الكفاءة بوضوح إلى جانب الدقة،
00:05:14يتعلم النموذج كيفية التعرف على متى يكون لديه ما يكفي للالتزام بإجابة.
00:05:19لذا ونتيجة لذلك، حصلوا على نموذج يتصرف بشكل مطابقة تقريباً للنموذج الأصلي.
00:05:23الآن دعونا ننظر إلى الأرقام لأن هذا هو المكان الذي يصبح فيه الأمر مثيراً للاهتمام.
00:05:27عبر 12 معياراً خارج النطاق، مما يعني مشكلات لم تكن جزءاً من بيانات التدريب،
00:05:33خفضت “ثينكينغ كاب” رموز تفكيرها بمتوسط قدره 45.8%.
00:05:37ولم تتغير الدقة بالكاد.
00:05:40لقد تغيرت بأقل من نقطة مئوية واحدة في المتوسط.
00:05:43وفي المعايير التي كانت جزءاً من نطاق التدريب،
00:05:46كان تقليل الرموز أكبر، حيث بلغ حوالي 58%.
00:05:49وعلى معيار جي إس إم 8كي على وجه تحديد، ارتفعت الدقة بالفعل من 93.3% إلى 96.5%.
00:05:58وقد تتبعوا أيضاً شيئاً يسمى معدل التكرار الحلقي.
00:06:00كم مرة يعلق النموذج في إعادة صياغة نفس الاستدلال مراراً وتكراراً دون تقارب،
00:06:06مثلما رأينا للتو في مثال نموذج ستيپ 3.5 فلاش.
00:06:10وانخفض ذلك أيضاً في معظم المعايير،
00:06:12مما يخبرنا بأن الكثير من الاستدلال الإضافي الذي كانت تقوم به هذه النماذج لم يكن مثمراً حقاً.
00:06:18لقد كان مجرد ضجيج بدا وكأنه جهد.
00:06:21حسناً، الأرقام على الورق شيء، ولكن دعونا نختبرها بأنفسنا بالفعل.
00:06:26لذا أنا أشغل هذا الاختبار على جهاز مزود ببطاقة آر تي إكس 5090 مع ذاكرة وصول عشوائي بحجم 64 جيجابايت.
00:06:32وسأطرح على كلا النموذجين نفس السؤال.
00:06:35ما هو أصغر عدد صحيح موجب ن بحيث يحتوي مضروب ن على 100 صفرا ختاميا بالضبط؟
00:06:42وللوصول إلى إجابة هذا السؤال، يجب عليه استخدام صيغة ليجندر،
00:06:47والتي ستؤدي في هذه الحالة لهذا السؤال المحدد إلى إجابة قدرها 405.
00:06:51هناك إجابة صحيحة واحدة فقط.
00:06:53ليس هناك حل وسط.
00:06:55لذا إذا حصلنا على 405، فنحن نعلم إذن أن النموذج قد أجاب بشكل صحيح.
00:07:00حسناً، أولاً دعونا نشغل نموذج كوين 3.6 القياسي المكمم بـ 27 مليار معامل
00:07:05ونرى كيف يؤدي.
00:07:07وكما ترون منذ البداية، فإن سرعة الرموز ليست سيئة إلى هذا الحد.
00:07:12فهي تسجل متوسطاً يبلغ حوالي 60 رمزا في الثانية.
00:07:14ولكن انظروا إلى حجم التفكير الذي يقوم به هذا النموذج.
00:07:17إنه أمر سخيف للغاية.
00:07:20لقد تجاوزنا دقيقة بكثير الآن، وما زال ينتج الرموز فقط في جزء الاستدلال.
00:07:26كان علي تسريع العرض التمهيدي هنا لأن الوقت الإجمالي تجاوز دقيقتين.
00:07:30ولكن مع ذلك، في النهاية، حصلنا على النتيجة الصحيحة، وهي 405، وهو أمر جيد.
00:07:37ولكن انظر إلى الوقت الإجمالي المنقضي.
00:07:39إنه 140 ثانية.
00:07:41وانظر إلى استهلاك الرموز.
00:07:43تم إنفاق أكثر من 7000 رمز فقط على الاستدلال وحده، ولم يتم إنفاق سوى 900 رمز فقط في طباعة الإجابة.
00:07:52لذا فإن هذا المثال يوضح بوضوح كيف يفكر نموذج كوين بشكل مبالغ فيه وسخيف في كل طلب.
00:07:59والآن دعونا ننتقل إلى نسخة “ثينكينغ كاب” من نفس النموذج.
00:08:02وللتسجيل، نحن نستخدم نفس نموذج 27 مليار معامل مع نفس التكميم.
00:08:08وكما ترون هنا، لقد مرت 20 ثانية، وقد انتهينا بالفعل من الاستدلال.
00:08:13وبعد 9 ثوانٍ فقط، نحصل على الإجابة، والتي هي في هذه الحالة صحيحة أيضاً، 405.
00:08:19وانظر كم هو فارق شاسع.
00:08:21لم نكتفِ بإنفاق أقل من 2000 رمز في المجموع، تم تخصيص 1100 منها فقط للاستدلال،
00:08:30بل حصلنا أيضاً على سرعة رموز في الثانية أسرع قليلاً بلغت 62 رمزا في الثانية.
00:08:36لذا في كل مقياس، يتفوق هذا النموذج كلياً على نموذج كوين 3.6 الأساسي.
00:08:42إنه أسرع، وأكثر كفاءة، ويكلف رموزاً أقل، ويمنحك نفس الإجابة الصحيحة.
00:08:48لذا فهذا تحسن مثير للإعجاب للغاية.
00:08:51وهذه تفصيلة من تقريرهم يجب أن أذكرها، لأنها حادثة طريفة حقاً.
00:08:57كان هدفهم الأصلي هو تقليص أثر التفكير فقط، وهذا هو جزء الاستدلال،
00:09:02مع الحفاظ على الإجابة النهائية بنفس طولها السابق تماماً.
00:09:06لكن كان لديهم خطأ برمجي.
00:09:07طبق التقصير عن طريق الخطأ على الإجابة النهائية أيضاً، وليس فقط على التفكير.
00:09:12لذا فقد أصلحوا الخطأ، ولكن على ما يبدو، فضّل الجميع داخلياً الإصدار الذي يحتوي على الخطأ.
00:09:18لذا فإن نظريتهم هي أن البشر يتعبون من كتابة إجابات طويلة، لذا فإننا نضغط ما نقوله بشكل طبيعي.
00:09:25وهذه النماذج لم تكن تمتلك هذا النوع من الإرهاق المدمج فيها حتى الآن.
00:09:29لذا فقد انتهى بهم الأمر بشحن الإصدار المعيب والموجز على أي حال، وترك الإصدار الصحيح تقنياً لإصدار مستقبلي.
00:09:37إذن ها قد حصلتم عليها أيها الأصدقاء.
00:09:38تلك هي “ثينكينغ كاب” باختصار.
00:09:40أعتقد أن الاستنتاج الكبير من كل هذا هو أننا اعتقدنا دائماً أنه كلما فكرت النماذج أكثر، زاد ذكاؤها.
00:09:48في حين أثبتت “ثينكينغ كاب” للتو أن الأمر ليس بالضرورة كذلك.
00:09:53بمجرد أن تتدرب فعلياً ضد ذلك، يمكنك الحصول على نفس جودة المخرجات بجزء بسيط من التكلفة، دون التخلي عن أي شيء تقريبا.
00:10:01إذا كنت تريد تجربة النموذج بنفسك، فهو متاح مجاناً على هوغين فيس بموجب ترخيص أباتشي 2.0.
00:10:08وأريد أن أسمع منكم أيها الأصدقاء.
00:10:10ما رأيكم في هذه المقاربة الجديدة؟
00:10:12هل ترون أي سلبيات أو إيجابيات لهذه التقنية؟
00:10:15أخبرونا في قسم التعليقات أدناه.
00:10:17وأيتها الأصدقاء، إذا كنتم تحبون هذه الأنواع من التحليلات التقنية، فيرجى إعلامي عن طريق الضغط على زر الإعجاب أسفل الفيديو.
00:10:23وأيضاً، لا تنسوا الاشتراك في قناتنا.
00:10:26كان معكم أندريس من بيتستاك، وسأراكم في الفيديوهات القادمة.