스크립트
00:00:00أطلقت شركة Thinking Machines الناشئة بقيمة 12 مليار دولار والتي أسستها ميرة موريتي، المديرة التقنية السابقة لـ OpenAI،
00:00:05أول نموذج لها على الإطلاق. يضم النموذج 975 مليار معامل، وهو مرخص برخصة Apache 2.0، ووزناته متاحة
00:00:12على منصة Hugging Face ليقوم أي شخص بتنزيلها. ورغم أنه لا ينافس المختبرات الرائدة
00:00:17مثل Anthropic، إلا أن هدفه الأساسي هو التخصيص والضبط الدقيق خصيصاً من خلال منصتها الخاصة،
00:00:22Tinker. لذا إذا كنت بحاجة إلى نموذج مدرب على مهمة محددة للغاية،
00:00:25فقد يكون هذا هو بالضبط ما تبحث عنه. سنتناول اليوم سبب رغبتك في استخدام
00:00:29هذا النموذج تحديداً وجميع الأسباب التي تدفعك للقيام بالإضافة والتعديل الدقيق. وهناك طريقة
00:00:35مثيرة للاهتمام للغاية يتعامل بها هذا النموذج مع الصوت والصورة، والتي لم أره من قبل. لذا ابقَ
00:00:40م معنا لنغطي ذلك أيضاً في هذا الفيديو. ونحن نناقش مواضيع الذكاء الاصطناعي باستمرار على
00:00:44هذه القناة. لذا إذا كنت تريد البقاء على اطلاع دائم، فاشترك في BetterStack.
00:00:52تكون شركة Thinking Machines واضحة جداً بشأن حقيقة أن نموذجها الجديد ليس بقوة
00:00:57أي نموذج عام في السوق تقريباً. وهم يقولون هذا في منشور الإطلاق الخاص بهم. لذا فهم يديرون
00:01:01التوقعات ويمكنك أن ترى السبب في نتائج الاختبارات القياسية. في اتباع التعليمات، يتفوق على GLM 5.2،
00:01:07بنتيجة 79.8 مقابل 73.3. ولكن في اختبارات الطرفية (Terminal bench)، حيث تذهب الوكلاء لتنفيذ العمل بالفعل، يتم هزيمته بشدة
00:01:14بنتيجة 63.8 مقابل 82.7. لذا فهو جيد في اتباع الأوامر، ولكنه أضعف بكثير في إنجاز الأمور بمفرده.
00:01:21ومع ذلك، فهو نقطة بداية رائعة إذا كانت نيتك هي إجراء الضبط الدقيق. وتحت الغطاء، إنه نموذج مزيج من الخبراء (MoE).
00:01:27لذا فهناك 975 مليار معامل في المجموع، ولكن كل طبقة تحتفظ بـ 256 خبيراً فريداً وكل رمز (token)
00:01:35يتم إرساله إلى ستة منهم فقط، مما يعني أن حوالي 41 مليار معامل فقط هي التي تقوم بأي عمل في أي
00:01:41وقت محدد. وهو أيضاً متعدد الوسائط. لذا فإن الصور والنصوص والصوت كلها تدخل إليه. والطريقة التي يقوم بها بذلك مختلفة تماماً
00:01:47عن أي نموذج قد رأيته من قبل. عادةً، عندما يتعامل النموذج مع الصوت، على سبيل المثال،
00:01:52يكون هناك نموذج كلام منفصل أمام نموذج اللغة يقوم بنسخ النص ومن ثم
00:01:56تمرير هذا النص المكتوب إلى نموذج اللغة. ويمكن أن تعمل الصور بالطريقة نفسها. فمشفر الرؤية ينظر إلى
00:02:02الصورة ثم ينشئ وصفاً لها وبعد ذلك يمرر ذلك إلى نموذج اللغة.
00:02:07وبالطبع، يعني القيام بذلك أنه سيكون هناك شكل من أشكال فقدان البيانات على طول الطريق.
00:02:11لا يفعل نموذج Inkling أي من ذلك. فالصوت يدخل مباشرة كمخطط طيفي (spectrogram)، حيث يتم تقطيع ترددات الصوت الخام
00:02:16إلى أقسام. وتدخل الصور أيضاً كأجزاء بحجم 40 في 40 بكسل. وكلاهما يوضع مباشرة في
00:02:23نفس المساحة التي تعيش فيها الرموز النصية ويقوم النموذج بمعالجتها جميعاً معاً. لذا لا يوجد شيء
00:02:28يتم ضغطه وتحويله إلى نص. لذا نظرياً، يجب أن تحصل على فقدان وضغط أقل بكثير للبيانات عند معالجة
00:02:35أشياء مثل الصوت والمرئيات تحديداً باستخدام نموذج Inkling. وفي الواقع، مقارنة بمعظم
00:02:40النماذج العامة التي لا تدعم الصوت الخام على الإطلاق، يبرز نموذج Inkling بوضوح. والآن، سواء كان
00:02:46عليك إجراء الضبط الدقيق أم لا، فهذا يعتمد على أهدافك المحددة. والقاعدة العامة هي بشكل عام أن
00:02:50الضبط الدقيق يعلم النموذج كيفية الإجابة، وليس ما يجب أن يعرفه. على سبيل المثال، نبرة الصوت أو المخرجات
00:02:57الهيكلية الصارمة حيث سيكون هناك حاجة لآلاف الأمثلة في السياق لتوجيه مخرجات النموذج
00:03:02لأن تمرير آلاف الأمثلة عبر موجه (prompt) سيكون أمراً غير عملي. وأيضاً التكلفة وتقليل التأخير الزمني (latency)
00:03:08حيث أن أداء مهمة ضيقة باستخدام نموذج عام سيكون أكثر تكلفة بكثير
00:03:13من إجراء الضبط الدقيق لنموذج أصغر. باختصار، إذا كان هناك أي موقف تحتاج فيه إلى آلاف
00:03:18الأمثلة للحصول على مخرجات لائقة، فيمكن أن يستفيد ذلك من الضبط الدقيق. ولكن إذا كنت تريد من النموذج أن يعرف
00:03:23أشياء لا يعرفها، فلا تقم بإجراء الضبط الدقيق. وهناك في الواقع ورقة بحثية استشهد بها كثيراً تقارن الاسترجاع
00:03:28بالضبط الدقيق، وفاز الاسترجاع باستمرار. وإذا كنت تريد تفكيرًا أفضل، فإن الضبط الدقيق يمكن أن
00:03:34يجعله أسوأ في الواقع لأنه يضعف سلسلة أفكار النموذج. والمثير للاهتمام أن النماذج الأصغر
00:03:40هي الأكثر تضرراً. ولكن بالنسبة للمهام الضيقة بالتحديد، يمكن أن تكون نتائج الضبط الدقيق رائعة. وإذا أخذنا
00:03:46شركة Harvey التي تبني أدوات الذكاء الاصطناعي لشركات المحاماة، فقد قاموا بتدريب نموذج صغير لاستخراج الاستشهادات من المستندات القانونية.
00:03:52وقاموا بتقييم مقياس F1 الخاص به، وهو مقياس يُستخدم لتقييم أداء نموذج التصنيف. وقد أدى الضبط الدقيق
00:03:58إلى نقلهم من 0.56 إلى 0.68. وفي مواجهة مباشرة ضد GPT 4.0، فاز النموذج الأصغر أو تعادل في 93% من المرات.
00:04:07وعمل بشكل أسرع أيضاً. حتى أن شركة Thinking Machines تعرض عرضاً توضيحياً يجبر نموذج Inkling على عدم استخدام
00:04:12حرف E أبداً، حيث يمكنك حرفياً توجيهه لضبط نفسه تلقائياً عبر منصة Tinker. ثم يمضي قدماً و
00:04:18ينشئ مجموعة بيانات التدريب ويمكنه تشغيل عملية الضبط الدقيق الكاملة بشكل تلقائي تماماً. و
00:04:24نتيجة لذلك هي نموذج يعاني من رهاب حرف E الشديد ومع ذلك تظل الاستجابات منطقية بطريقة ما.
00:04:29لكنك لا تقوم بإعادة تدريب النموذج بأكمله هنا. أنت تستخدم في الواقع شيئاً يسمى LoRa،
00:04:32وهو اختصار للتكيف منخفض الرتبة (Low-Rank Adaptation). فبدلاً من تدريب النموذج بأكمله، تقوم تقنية LoRa بتجميد الوزن الأصلي
00:04:38وتحقن مصفوفات أصغر وخفيفة الوزن التقاط البيانات الجديدة والمحددة. يوفر هذا مزايا
00:04:44التكلفة والسرعة لمرحلة ما بعد التدريب مقارنة بضبط نموذج كامل، والذي من المرجح أن يكون
00:04:49أمراً غير عملي. والآن تدعم منصة Tinker بالفعل مجموعة من النماذج المفتوحة مثل Quen وKimi وDeepsea ونموذج NemoTron من Nvidia
00:04:55و GPT OSS من OpenAI. ويعد Inkling أحد النماذج الأكثر تكلفة، فلماذا تتردد حتى في استخدامه؟
00:05:02حسناً، هناك سببان وقد غطيناهما قليلاً بالفعل. السبب الأول هو الصوت. من بين كل
00:05:06نموذج على المنصة، يعد Inkling هو الوحيد الذي يقبل الصوت على الإطلاق. العديد منها يتعامل مع الصور،
00:05:11فإن Kimi ومعظم نماذج Quen تتعامل مع الرؤية بشكل جيد، ولكن ليس أي منها يتعامل فعلياً مع
00:05:16الصوت الخام. وقد طرحوا أيضاً ثلاث وصفات تعليمية لتتماشى معه، مثل التعرف على الكلام
00:05:20وتصنيف أسلوب التحدث. لذا يمكن للنموذج أن يخبرك كيف قيل شيء ما، وليس فقط ما تم
00:05:26قوله. وهناك أيضاً مثال طبي مدرب على الوصفات الطبية الاملاءية، ليعلمه أسماء الأدوية التي
00:05:31قد تشوهها النماذج الأخرى بخلاف ذلك. والثاني هو جهد التفكير. يتيح لك Inkling تحديد مدى صعوبة
00:05:36تفمك للنموذج كرقوم من صفر إلى واحد. تمنحك معظم النماذج مفتاح تبديل لإعدادين أو ثلاثة. يمنحك نموذج GPT OSS
00:05:42مستويات منخفضة ومتوسطة وعالية على سبيل المثال، لكن Inkling يمنحك شريط تمرير كاملاً. لذا فإن السؤال الكبير
00:05:47هو، هل يجب عليك استخدامه حقاً؟ حسناً، إذا كنت تريد تشغيل النموذج كما هو، فربما لا يكون
00:05:52هذا هو النموذج المناسب. وهم صريحون بشأن ذلك بأنفسهم. ولكن إذا كانت لديك مهمة ضيقة وعالية الحجم
00:05:56مع بعض بيانات التسميات الحقيقية وطريقة لتقييم المخرجات، فإن إجراء الضبط الدقيق لنموذج مفتوح صغير يعد واحداً من
00:06:02أكثر الأمور التي تحظى بتقدير أقل والتي يمكنك القيام بها الآن. ومع منصات مثل Tinker، أصبح الأمر أسهل بكثير.
00:06:07 وما إذا كان Inkling هو النموذج الذي تحاول استخدامه يعتمد حقاً على ما تقوم بتغذيته به.
00:06:11إذا كان الصوت قادماً، فإن Inkling يعد خياراً قوياً ولا يوجد أي شيء آخر على Tinker يأخذ حتى الصوت الخام
00:06:16في الوقت الحالي. وإذا كنت تبحث عن أفضل نموذج عام مفتوح حالياً، فقد قمنا للتو بعمل
00:06:21فيديو عن Kimi K3 يمكنك مشاهدته هنا، وقد حقق ذلك بعض النتائج المذهلة. ولكن بخلاف ذلك،
00:06:26شكراً للمشاهدة. لقد كنت معكم وارن من BetterStack وأراكم في الفيديو القادم.