هذا النموذج مفتوح المصدر يحل أكبر عيوب الذكاء الاصطناعي (ThinkingCap)

BBetter Stack
Computing/SoftwareSmall Business/Startups

Transcript

00:00:00هذا هو نفس السؤال الذي وجه إلى نفس النموذج الأساسي.
00:00:03راقب عدادات الرموز هنا.
00:00:05أحدهما يقضي وقتاً طويلاً في التفكير بشأن السؤال،
00:00:09بينما الآخر قد أكمل المهمة بالفعل.
00:00:12وإذا تحققنا من كلا الناتجين، فإن إجابة السؤال هي نفسها أساساً.
00:00:16لكن النموذج الذي على اليمين أهدر رموزاً أكثر بكثير للوصول إلى نفس النتيجة.
00:00:21وهذا أمر رائع حقاً، لأن الاختلاف الوحيد بين هذين النموذجين
00:00:24هو أن النموذج الذي على اليسار يشغل خاصية “ثينكينغ كاب”،
00:00:27وهي نسخة مخصصة ومعدلة بدقة من نفس النموذج،
00:00:31والتي تهدف إلى ضمان حصولك على نفس الجودة في المخرجات
00:00:34مع التضحية برمز أقل والوصول إلى إجابتك بشكل أسرع مرتين.
00:00:39لذا في فيديو اليوم، سنلقي نظرة على “ثينكينغ كاب”،
00:00:42ونرى كيف تعمل، ومن ثم سنقوم بتجربتها بأنفسنا
00:00:45لنرى ما إذا كانت هذه حقاً مقاربة مبتكرة لضبط نماذج الذكاء الاصطناعي.
00:00:50سيكون الأمر ممتعاً للغاية، لذا دعونا نغوص فيه.
00:00:57قبل أن نتحدث عن “ثينكينغ كاب”، دعونا نعيد عقارب الساعة قليلاً لنرى كيف وصلنا إلى هنا بالفعل.
00:01:03أول نموذج متاح على نطاق واسع على الإطلاق، جي بي تي-3، تم إطلاقه في عام 2020،
00:01:09وبحلول أواخر عام 2022،
00:01:11وضع شات جي بي تي نموذج جي بي تي 3.5 أمام عامة الناس للمرة الأولى.
00:01:17وهناك بدأت علاقة معظم الناس بالذكاء الاصطناعي بالفعل.
00:01:21تلاه نموذج جي بي تي-4 في عام 2023، والذي كان قفزة أخرى في القدرات،
00:01:25لكنه ظل يحمل نفس الفكرة الأساسية.
00:01:28توقع الرمز التالي والاجابة فوراً.
00:01:31ولكن بعد ذلك، في سبتمبر 2024، أطلقت أوبن إيه آي نموذج أو1،
00:01:37وكان هذا أول نموذج يستخدم وضع التفكير قبل الإجابة.
00:01:42لذا بدلاً من إطلاق الاستجابة فوراً،
00:01:45قضى وقتاً ورموزاً إضافية في التفكير الاستدلالي في المشكلة أولاً.
00:01:49لقد أدى هذا التحول المعماري الواحد إلى إطلاق عصر نماذج الاستدلال.
00:01:54تلاه نموذج ديب سيك آر1 بعد بضعة أشهر
00:01:56وجلب نفس الفكرة إلى عالم المصدر المفتوح.
00:02:00وبسرعة كبيرة،
00:02:01أصبح الاستدلال هو الشيء الذي كانت تقدمه كل شركة كبرى لصناعة نماذج الذكاء الاصطناعي.
00:02:05ولكن الآن، بعد مرور أكثر بقليل من عام،
00:02:08بدأنا نشهد ظهور الاتجاه المعاكس.
00:02:11نماذج تم ضبطها بدقة خصيصاً للتفكير بشكل أقل وليس أكثر.
00:02:15بطريقة ما، نحن نعود إلى الأساسيات،
00:02:17ولكن مع دمج كل ما تعلمناه من عصر الاستدلال.
00:02:21ولكن إليكم الأمر.
00:02:22ذلك التحول نحو المزيد من التفكير حل مشكلة وخلق أخرى بهدوء.
00:02:28لم يعلم أحد هذه النماذج متى تتوقف عن التفكير فعلياً.
00:02:31إذا طلبت من نموذج استدلال شيئاً بسيطاً حقاً،
00:02:34فإنه سيظل يستهلك آلاف الرموز،
00:02:37مستنتجاً أشياء اكتشفها بالفعل قبل ثلاث جمل،
00:02:41أو يعيد صياغة نفس النقطة بكلمات مختلفة قليلاً،
00:02:44أو في أسوأ السيناريوهات، سيبدأ في الدخول في حلقات مفرغة.
00:02:48وأنا أعني ذلك بالمعنى الحرفي تقريبا.
00:02:50دعوني أريكم واحدة من أكثر الأمثلة سخافة التي واجهتها.
00:02:54هذا هو نموذج ستيپ 3.5 فلاش.
00:02:56وعندما كنت أختبر نموذج الاستدلال هذا،
00:02:58أرسلت له كلمة واحدة فقط، وهي مرحباً.
00:03:01وانظروا ما يفعله بها.
00:03:03إنه يقضي عدة فقرات في النقاش حول ما إذا كان مطلوباً منه تقديم نفسه باسم نموذجه الدقيق،
00:03:09وما إذا كان استخدام الاسم الدقيق دائماً عند تقديم نفسك يعني أنه يجب عليه تقديم نفسه في كل مرة أو فقط عندما يختار ذلك.
00:03:19ثم يزن ما إذا كان ذكر تاريخ اليوم أمراً ذا صلة.
00:03:22وفي النهاية، بعد كل ذلك، يستقر على رد كان أي منا سيقوم بكتابته في غضون ثانتين تقريبا.
00:03:28مرحباً، أنا نموذج ستيپ 3.5 فلاش.
00:03:31كيف يمكنني مساعدتك اليوم؟
00:03:33إذن هذا ليس استدلالاً حقاً.
00:03:35هذا نموذج تم تدريبه على التفكير، لكنه لم يُدرب أبداً على معرفة متى ينتهي التفكير.
00:03:41الآن، شركة “بوتل كاب إيه آي” هي شركة ناشئة أوروبية تركز بشكل خاص على جعل الاستدلال أكثر كفاءة.
00:03:47وما فعلته مع “ثينكينغ كاب” هو أمر ذكي حقاً بصراحة.
00:03:51لذا فقد أخذوا نموذج كوين 3.6، نسخة 27 مليار معامل،
00:03:55ولم يكونوا يحاولون جعله أكثر ذكاءً ولم يكونوا يعلمونه مهارات جديدة أو يغيرون شخصيته أو يمسون سلوكه المتعلق بالسلامة أيضاً.
00:04:04الشيء الوحيد الذي أرادوا تغييره هو مقدار قوة الحوسبة التي يستهلكها للوصول إلى إجابة كان قادراً بالفعل على تقديمها.
00:04:11وهذا يبدو بسيطاً، لكنه في الواقع أقدم مما يبدو.
00:04:15لذا فإن الطريقة الكسولة لجعل النموذج أسرع هي مجرد قطع تفكيره مبكراً.
00:04:20إجْباره على التوقف بعد قدر معين من الرموز، وسواء انتهى فعلياً أم لا.
00:04:25هذا سيقلل بالتأكيد من عدد الرموز.
00:04:27ولكنه سيعمل أيضاً على جعل النموذج مخطئاً بشكل أكبر لأنه يحتاج حقاً إلى تلك الخطوات الإضافية في بعض الأحيان.
00:04:34لذا فإن التحدي الهندسي الحقيقي هنا ليس جعله أقصر.
00:04:38بل جعله أقصر دون جعله أغبى سراً.
00:04:42وهذه هي الطريقة التي فعلوا بها ذلك بالفعل.
00:04:44بدءاً من نقطة فحص نموذج كوين 3.6، ذي 27 مليار معامل أساسي،
00:04:48قاموا بتدريبه على مجموعة مختارة بعناية من المشكلات التي تمتد عبر مجالات ومستويات صعوبة متعددة.
00:04:55وبدلاً من مكافأة النموذج على الحصول على الإجابة الصحيحة،
00:04:58فقد قاموا بمكافأته على الحصول على الإجابة الصحيحة بكفاءة.
00:05:02لأنه إذا تم مكافأة النموذج فقط على الدقة، فإن الإسهاب لا يكلف شيئاً.
00:05:08ليس هناك أي حافز للتوقف عن التفكير مبكراً.
00:05:10ولكن من خلال مكافأة الكفاءة بوضوح إلى جانب الدقة،
00:05:14يتعلم النموذج كيفية التعرف على متى يكون لديه ما يكفي للالتزام بإجابة.
00:05:19لذا ونتيجة لذلك، حصلوا على نموذج يتصرف بشكل مطابقة تقريباً للنموذج الأصلي.
00:05:23الآن دعونا ننظر إلى الأرقام لأن هذا هو المكان الذي يصبح فيه الأمر مثيراً للاهتمام.
00:05:27عبر 12 معياراً خارج النطاق، مما يعني مشكلات لم تكن جزءاً من بيانات التدريب،
00:05:33خفضت “ثينكينغ كاب” رموز تفكيرها بمتوسط قدره 45.8%.
00:05:37ولم تتغير الدقة بالكاد.
00:05:40لقد تغيرت بأقل من نقطة مئوية واحدة في المتوسط.
00:05:43وفي المعايير التي كانت جزءاً من نطاق التدريب،
00:05:46كان تقليل الرموز أكبر، حيث بلغ حوالي 58%.
00:05:49وعلى معيار جي إس إم 8كي على وجه تحديد، ارتفعت الدقة بالفعل من 93.3% إلى 96.5%.
00:05:58وقد تتبعوا أيضاً شيئاً يسمى معدل التكرار الحلقي.
00:06:00كم مرة يعلق النموذج في إعادة صياغة نفس الاستدلال مراراً وتكراراً دون تقارب،
00:06:06مثلما رأينا للتو في مثال نموذج ستيپ 3.5 فلاش.
00:06:10وانخفض ذلك أيضاً في معظم المعايير،
00:06:12مما يخبرنا بأن الكثير من الاستدلال الإضافي الذي كانت تقوم به هذه النماذج لم يكن مثمراً حقاً.
00:06:18لقد كان مجرد ضجيج بدا وكأنه جهد.
00:06:21حسناً، الأرقام على الورق شيء، ولكن دعونا نختبرها بأنفسنا بالفعل.
00:06:26لذا أنا أشغل هذا الاختبار على جهاز مزود ببطاقة آر تي إكس 5090 مع ذاكرة وصول عشوائي بحجم 64 جيجابايت.
00:06:32وسأطرح على كلا النموذجين نفس السؤال.
00:06:35ما هو أصغر عدد صحيح موجب ن بحيث يحتوي مضروب ن على 100 صفرا ختاميا بالضبط؟
00:06:42وللوصول إلى إجابة هذا السؤال، يجب عليه استخدام صيغة ليجندر،
00:06:47والتي ستؤدي في هذه الحالة لهذا السؤال المحدد إلى إجابة قدرها 405.
00:06:51هناك إجابة صحيحة واحدة فقط.
00:06:53ليس هناك حل وسط.
00:06:55لذا إذا حصلنا على 405، فنحن نعلم إذن أن النموذج قد أجاب بشكل صحيح.
00:07:00حسناً، أولاً دعونا نشغل نموذج كوين 3.6 القياسي المكمم بـ 27 مليار معامل
00:07:05ونرى كيف يؤدي.
00:07:07وكما ترون منذ البداية، فإن سرعة الرموز ليست سيئة إلى هذا الحد.
00:07:12فهي تسجل متوسطاً يبلغ حوالي 60 رمزا في الثانية.
00:07:14ولكن انظروا إلى حجم التفكير الذي يقوم به هذا النموذج.
00:07:17إنه أمر سخيف للغاية.
00:07:20لقد تجاوزنا دقيقة بكثير الآن، وما زال ينتج الرموز فقط في جزء الاستدلال.
00:07:26كان علي تسريع العرض التمهيدي هنا لأن الوقت الإجمالي تجاوز دقيقتين.
00:07:30ولكن مع ذلك، في النهاية، حصلنا على النتيجة الصحيحة، وهي 405، وهو أمر جيد.
00:07:37ولكن انظر إلى الوقت الإجمالي المنقضي.
00:07:39إنه 140 ثانية.
00:07:41وانظر إلى استهلاك الرموز.
00:07:43تم إنفاق أكثر من 7000 رمز فقط على الاستدلال وحده، ولم يتم إنفاق سوى 900 رمز فقط في طباعة الإجابة.
00:07:52لذا فإن هذا المثال يوضح بوضوح كيف يفكر نموذج كوين بشكل مبالغ فيه وسخيف في كل طلب.
00:07:59والآن دعونا ننتقل إلى نسخة “ثينكينغ كاب” من نفس النموذج.
00:08:02وللتسجيل، نحن نستخدم نفس نموذج 27 مليار معامل مع نفس التكميم.
00:08:08وكما ترون هنا، لقد مرت 20 ثانية، وقد انتهينا بالفعل من الاستدلال.
00:08:13وبعد 9 ثوانٍ فقط، نحصل على الإجابة، والتي هي في هذه الحالة صحيحة أيضاً، 405.
00:08:19وانظر كم هو فارق شاسع.
00:08:21لم نكتفِ بإنفاق أقل من 2000 رمز في المجموع، تم تخصيص 1100 منها فقط للاستدلال،
00:08:30بل حصلنا أيضاً على سرعة رموز في الثانية أسرع قليلاً بلغت 62 رمزا في الثانية.
00:08:36لذا في كل مقياس، يتفوق هذا النموذج كلياً على نموذج كوين 3.6 الأساسي.
00:08:42إنه أسرع، وأكثر كفاءة، ويكلف رموزاً أقل، ويمنحك نفس الإجابة الصحيحة.
00:08:48لذا فهذا تحسن مثير للإعجاب للغاية.
00:08:51وهذه تفصيلة من تقريرهم يجب أن أذكرها، لأنها حادثة طريفة حقاً.
00:08:57كان هدفهم الأصلي هو تقليص أثر التفكير فقط، وهذا هو جزء الاستدلال،
00:09:02مع الحفاظ على الإجابة النهائية بنفس طولها السابق تماماً.
00:09:06لكن كان لديهم خطأ برمجي.
00:09:07طبق التقصير عن طريق الخطأ على الإجابة النهائية أيضاً، وليس فقط على التفكير.
00:09:12لذا فقد أصلحوا الخطأ، ولكن على ما يبدو، فضّل الجميع داخلياً الإصدار الذي يحتوي على الخطأ.
00:09:18لذا فإن نظريتهم هي أن البشر يتعبون من كتابة إجابات طويلة، لذا فإننا نضغط ما نقوله بشكل طبيعي.
00:09:25وهذه النماذج لم تكن تمتلك هذا النوع من الإرهاق المدمج فيها حتى الآن.
00:09:29لذا فقد انتهى بهم الأمر بشحن الإصدار المعيب والموجز على أي حال، وترك الإصدار الصحيح تقنياً لإصدار مستقبلي.
00:09:37إذن ها قد حصلتم عليها أيها الأصدقاء.
00:09:38تلك هي “ثينكينغ كاب” باختصار.
00:09:40أعتقد أن الاستنتاج الكبير من كل هذا هو أننا اعتقدنا دائماً أنه كلما فكرت النماذج أكثر، زاد ذكاؤها.
00:09:48في حين أثبتت “ثينكينغ كاب” للتو أن الأمر ليس بالضرورة كذلك.
00:09:53بمجرد أن تتدرب فعلياً ضد ذلك، يمكنك الحصول على نفس جودة المخرجات بجزء بسيط من التكلفة، دون التخلي عن أي شيء تقريبا.
00:10:01إذا كنت تريد تجربة النموذج بنفسك، فهو متاح مجاناً على هوغين فيس بموجب ترخيص أباتشي 2.0.
00:10:08وأريد أن أسمع منكم أيها الأصدقاء.
00:10:10ما رأيكم في هذه المقاربة الجديدة؟
00:10:12هل ترون أي سلبيات أو إيجابيات لهذه التقنية؟
00:10:15أخبرونا في قسم التعليقات أدناه.
00:10:17وأيتها الأصدقاء، إذا كنتم تحبون هذه الأنواع من التحليلات التقنية، فيرجى إعلامي عن طريق الضغط على زر الإعجاب أسفل الفيديو.
00:10:23وأيضاً، لا تنسوا الاشتراك في قناتنا.
00:10:26كان معكم أندريس من بيتستاك، وسأراكم في الفيديوهات القادمة.

Key Takeaway

يحقق نموذج ثينكينغ كاب نفس جودة مخرجات النماذج الأساسية مع تقليص رموز الاستدلال وخفض الوقت إلى النصف من خلال مكافأة الكفاءة أثناء التدريب.

Highlights

  • يقلل نموذج ثينكينغ كاب من رموز التفكير بنسبة تصل إلى 45.8% عبر 12 معياراً خارج النطاق مع تغيير في الدقة بأقل من نقطة مئوية واحدة.

  • يعتمد النموذج على نسخة كوين 3.6 بـ 27 مليار معامل، مع ضبط دقيق لمكافأة الكفاءة بجانب الدقة.

  • انخفضت رموز التفكير بنسبة تقارب 58% في المعايير داخل نطاق التدريب.

  • ارتفعت الدقة على معيار جي إس إم 8كي من 93.3% إلى 96.5% بفضل النموذج المعدل.

  • أتم نموذج ثينكينغ كاب الإجابة في 29 ثانية واستهلك أقل من 2000 رمز إجمالي، مقارنة بـ 140 ثانية وأكثر من 7000 رمز للنموذج القياسي في مسألة حسابية.

Timeline

ظهور عصر نماذج الاستدلال وتحدياتها

  • أطلق نموذج أو1 من أوبن إيه آي في سبتمبر 2024 حقبة نماذج الاستدلال التي تقضي وقتاً في التفكير قبل الإجابة.
  • أدت هذه النماذج إلى زيادة استهلاك الرموز والدخول في حلقات مفرغة دون معرفة متى تتوقف عن التفكير.
  • يستهلك نموذج ستيپ 3.5 فلاش آلاف الرموز لمجرد الإجابة بكلمة مرحباً عبر نقاشات مطولة حول الهوية والتاريخ.

تطور استخدام الذكاء الاصطناعي من مجرد توقع الرمز التالي فوراً إلى التفكير الاستدلالي المسبق بدءاً من عام 2024. ورغم أن هذا التحول زاد من قدرات النماذج، إلا أنه تسبب في مشكلة خفية تتمثل في عدم قدرة النماذج على معرفة متى ينتهي التفكير المفيد. يظهر هذا بوضوح في الطلبات البسيطة التي تؤدي إلى تكرار نفس النقاط والدخول في حلقات استدلالية مفرغة تستهلك وقتاً ورموزاً بلا طائل.

آلية عمل ثينكينغ كاب وكفاءة التدريب

  • طورت شركة بوتل كاب إيه آي نموذج ثينكينغ كاب باستخدام نموذج كوين 3.6 بـ 27 مليار معامل.
  • تم تدريب النموذج على مكافأة الكفاءة بجانب الدقة لتجنب الإسهاب غير المبرر.
  • انخفضت رموز التفكير بمتوسط 45.8% عبر المعايير الخارجية مع الحفاظ على الدقة ضمن أقل من نقطة مئوية واحدة.

تركز شركة بوتل كاب إيه آي على جعل الاستدلال أكثر كفاءة عبر تعديل نموذج كوين 3.6 دون تغييره جذرياً. بدلاً من إجبار النموذج على التوقف مبكراً بشكل عشوائي مما يضر بالدقة، اعتمدت طريقة تدريب تمنح مكافأة للحصول على النتيجة بكفاءة عالية. أدى هذا النهج إلى تقليل الضجيج الاستدلالي والتفكير الزائد الذي لا يقدم قيمة حقيقية للمخرجات.

التجربة العملية ومقارنة الأداء

  • استغرق نموذج كوين القياسي 140 ثانية وأكثر من 7000 رمز استدلال للإجابة على مسألة حسابية.
  • أتم نموذج ثينكينغ كاب نفس المسألة في 29 ثانية وبإجمالي رموز أقل من 2000 رمز مع إعطاء الإجابة الصحيحة 405.
  • يتوفر النموذج مجاناً على هوغين فيس تحت ترخيص أباتشي 2.0.

أثبت الاختبار العملي على جهاز مزود ببطاقة آر تي إكس 5090 تفوق نموذج ثينكينغ كاب الواضح على النموذج القياسي في مسألة حسابية تتطلب صيغة ليجندر. بينما استغرق النموذج القياسي وقتاً طويلاً ورموزاً هائلة في التفكير المبالغ فيه، وصل الإصدار المعدل إلى النتيجة الصحيحة في وقت قياسي وبكفاءة عالية. يغير هذا النتائج الاعتقاد السائد بأن زيادة التفكير تعني بالضرورة ذكاءً أكبر، وهو متاح للاستخدام المجاني.

Community Posts

View all posts