Inkling: هذا النموذج مفتوح الأوزان يرغب في الضبط الدقيق

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00أطلقت شركة Thinking Machines الناشئة بقيمة 12 مليار دولار والتي أسستها ميرة موريتي، المديرة التقنية السابقة لـ OpenAI،
00:00:05أول نموذج لها على الإطلاق. يضم النموذج 975 مليار معامل، وهو مرخص برخصة Apache 2.0، ووزناته متاحة
00:00:12على منصة Hugging Face ليقوم أي شخص بتنزيلها. ورغم أنه لا ينافس المختبرات الرائدة
00:00:17مثل Anthropic، إلا أن هدفه الأساسي هو التخصيص والضبط الدقيق خصيصاً من خلال منصتها الخاصة،
00:00:22Tinker. لذا إذا كنت بحاجة إلى نموذج مدرب على مهمة محددة للغاية،
00:00:25فقد يكون هذا هو بالضبط ما تبحث عنه. سنتناول اليوم سبب رغبتك في استخدام
00:00:29هذا النموذج تحديداً وجميع الأسباب التي تدفعك للقيام بالإضافة والتعديل الدقيق. وهناك طريقة
00:00:35مثيرة للاهتمام للغاية يتعامل بها هذا النموذج مع الصوت والصورة، والتي لم أره من قبل. لذا ابقَ
00:00:40م معنا لنغطي ذلك أيضاً في هذا الفيديو. ونحن نناقش مواضيع الذكاء الاصطناعي باستمرار على
00:00:44هذه القناة. لذا إذا كنت تريد البقاء على اطلاع دائم، فاشترك في BetterStack.
00:00:52تكون شركة Thinking Machines واضحة جداً بشأن حقيقة أن نموذجها الجديد ليس بقوة
00:00:57أي نموذج عام في السوق تقريباً. وهم يقولون هذا في منشور الإطلاق الخاص بهم. لذا فهم يديرون
00:01:01التوقعات ويمكنك أن ترى السبب في نتائج الاختبارات القياسية. في اتباع التعليمات، يتفوق على GLM 5.2،
00:01:07بنتيجة 79.8 مقابل 73.3. ولكن في اختبارات الطرفية (Terminal bench)، حيث تذهب الوكلاء لتنفيذ العمل بالفعل، يتم هزيمته بشدة
00:01:14بنتيجة 63.8 مقابل 82.7. لذا فهو جيد في اتباع الأوامر، ولكنه أضعف بكثير في إنجاز الأمور بمفرده.
00:01:21ومع ذلك، فهو نقطة بداية رائعة إذا كانت نيتك هي إجراء الضبط الدقيق. وتحت الغطاء، إنه نموذج مزيج من الخبراء (MoE).
00:01:27لذا فهناك 975 مليار معامل في المجموع، ولكن كل طبقة تحتفظ بـ 256 خبيراً فريداً وكل رمز (token)
00:01:35يتم إرساله إلى ستة منهم فقط، مما يعني أن حوالي 41 مليار معامل فقط هي التي تقوم بأي عمل في أي
00:01:41وقت محدد. وهو أيضاً متعدد الوسائط. لذا فإن الصور والنصوص والصوت كلها تدخل إليه. والطريقة التي يقوم بها بذلك مختلفة تماماً
00:01:47عن أي نموذج قد رأيته من قبل. عادةً، عندما يتعامل النموذج مع الصوت، على سبيل المثال،
00:01:52يكون هناك نموذج كلام منفصل أمام نموذج اللغة يقوم بنسخ النص ومن ثم
00:01:56تمرير هذا النص المكتوب إلى نموذج اللغة. ويمكن أن تعمل الصور بالطريقة نفسها. فمشفر الرؤية ينظر إلى
00:02:02الصورة ثم ينشئ وصفاً لها وبعد ذلك يمرر ذلك إلى نموذج اللغة.
00:02:07وبالطبع، يعني القيام بذلك أنه سيكون هناك شكل من أشكال فقدان البيانات على طول الطريق.
00:02:11لا يفعل نموذج Inkling أي من ذلك. فالصوت يدخل مباشرة كمخطط طيفي (spectrogram)، حيث يتم تقطيع ترددات الصوت الخام
00:02:16إلى أقسام. وتدخل الصور أيضاً كأجزاء بحجم 40 في 40 بكسل. وكلاهما يوضع مباشرة في
00:02:23نفس المساحة التي تعيش فيها الرموز النصية ويقوم النموذج بمعالجتها جميعاً معاً. لذا لا يوجد شيء
00:02:28يتم ضغطه وتحويله إلى نص. لذا نظرياً، يجب أن تحصل على فقدان وضغط أقل بكثير للبيانات عند معالجة
00:02:35أشياء مثل الصوت والمرئيات تحديداً باستخدام نموذج Inkling. وفي الواقع، مقارنة بمعظم
00:02:40النماذج العامة التي لا تدعم الصوت الخام على الإطلاق، يبرز نموذج Inkling بوضوح. والآن، سواء كان
00:02:46عليك إجراء الضبط الدقيق أم لا، فهذا يعتمد على أهدافك المحددة. والقاعدة العامة هي بشكل عام أن
00:02:50الضبط الدقيق يعلم النموذج كيفية الإجابة، وليس ما يجب أن يعرفه. على سبيل المثال، نبرة الصوت أو المخرجات
00:02:57الهيكلية الصارمة حيث سيكون هناك حاجة لآلاف الأمثلة في السياق لتوجيه مخرجات النموذج
00:03:02لأن تمرير آلاف الأمثلة عبر موجه (prompt) سيكون أمراً غير عملي. وأيضاً التكلفة وتقليل التأخير الزمني (latency)
00:03:08حيث أن أداء مهمة ضيقة باستخدام نموذج عام سيكون أكثر تكلفة بكثير
00:03:13من إجراء الضبط الدقيق لنموذج أصغر. باختصار، إذا كان هناك أي موقف تحتاج فيه إلى آلاف
00:03:18الأمثلة للحصول على مخرجات لائقة، فيمكن أن يستفيد ذلك من الضبط الدقيق. ولكن إذا كنت تريد من النموذج أن يعرف
00:03:23أشياء لا يعرفها، فلا تقم بإجراء الضبط الدقيق. وهناك في الواقع ورقة بحثية استشهد بها كثيراً تقارن الاسترجاع
00:03:28بالضبط الدقيق، وفاز الاسترجاع باستمرار. وإذا كنت تريد تفكيرًا أفضل، فإن الضبط الدقيق يمكن أن
00:03:34يجعله أسوأ في الواقع لأنه يضعف سلسلة أفكار النموذج. والمثير للاهتمام أن النماذج الأصغر
00:03:40هي الأكثر تضرراً. ولكن بالنسبة للمهام الضيقة بالتحديد، يمكن أن تكون نتائج الضبط الدقيق رائعة. وإذا أخذنا
00:03:46شركة Harvey التي تبني أدوات الذكاء الاصطناعي لشركات المحاماة، فقد قاموا بتدريب نموذج صغير لاستخراج الاستشهادات من المستندات القانونية.
00:03:52وقاموا بتقييم مقياس F1 الخاص به، وهو مقياس يُستخدم لتقييم أداء نموذج التصنيف. وقد أدى الضبط الدقيق
00:03:58إلى نقلهم من 0.56 إلى 0.68. وفي مواجهة مباشرة ضد GPT 4.0، فاز النموذج الأصغر أو تعادل في 93% من المرات.
00:04:07وعمل بشكل أسرع أيضاً. حتى أن شركة Thinking Machines تعرض عرضاً توضيحياً يجبر نموذج Inkling على عدم استخدام
00:04:12حرف E أبداً، حيث يمكنك حرفياً توجيهه لضبط نفسه تلقائياً عبر منصة Tinker. ثم يمضي قدماً و
00:04:18ينشئ مجموعة بيانات التدريب ويمكنه تشغيل عملية الضبط الدقيق الكاملة بشكل تلقائي تماماً. و
00:04:24نتيجة لذلك هي نموذج يعاني من رهاب حرف E الشديد ومع ذلك تظل الاستجابات منطقية بطريقة ما.
00:04:29لكنك لا تقوم بإعادة تدريب النموذج بأكمله هنا. أنت تستخدم في الواقع شيئاً يسمى LoRa،
00:04:32وهو اختصار للتكيف منخفض الرتبة (Low-Rank Adaptation). فبدلاً من تدريب النموذج بأكمله، تقوم تقنية LoRa بتجميد الوزن الأصلي
00:04:38وتحقن مصفوفات أصغر وخفيفة الوزن التقاط البيانات الجديدة والمحددة. يوفر هذا مزايا
00:04:44التكلفة والسرعة لمرحلة ما بعد التدريب مقارنة بضبط نموذج كامل، والذي من المرجح أن يكون
00:04:49أمراً غير عملي. والآن تدعم منصة Tinker بالفعل مجموعة من النماذج المفتوحة مثل Quen وKimi وDeepsea ونموذج NemoTron من Nvidia
00:04:55و GPT OSS من OpenAI. ويعد Inkling أحد النماذج الأكثر تكلفة، فلماذا تتردد حتى في استخدامه؟
00:05:02حسناً، هناك سببان وقد غطيناهما قليلاً بالفعل. السبب الأول هو الصوت. من بين كل
00:05:06نموذج على المنصة، يعد Inkling هو الوحيد الذي يقبل الصوت على الإطلاق. العديد منها يتعامل مع الصور،
00:05:11فإن Kimi ومعظم نماذج Quen تتعامل مع الرؤية بشكل جيد، ولكن ليس أي منها يتعامل فعلياً مع
00:05:16الصوت الخام. وقد طرحوا أيضاً ثلاث وصفات تعليمية لتتماشى معه، مثل التعرف على الكلام
00:05:20وتصنيف أسلوب التحدث. لذا يمكن للنموذج أن يخبرك كيف قيل شيء ما، وليس فقط ما تم
00:05:26قوله. وهناك أيضاً مثال طبي مدرب على الوصفات الطبية الاملاءية، ليعلمه أسماء الأدوية التي
00:05:31قد تشوهها النماذج الأخرى بخلاف ذلك. والثاني هو جهد التفكير. يتيح لك Inkling تحديد مدى صعوبة
00:05:36تفمك للنموذج كرقوم من صفر إلى واحد. تمنحك معظم النماذج مفتاح تبديل لإعدادين أو ثلاثة. يمنحك نموذج GPT OSS
00:05:42مستويات منخفضة ومتوسطة وعالية على سبيل المثال، لكن Inkling يمنحك شريط تمرير كاملاً. لذا فإن السؤال الكبير
00:05:47هو، هل يجب عليك استخدامه حقاً؟ حسناً، إذا كنت تريد تشغيل النموذج كما هو، فربما لا يكون
00:05:52هذا هو النموذج المناسب. وهم صريحون بشأن ذلك بأنفسهم. ولكن إذا كانت لديك مهمة ضيقة وعالية الحجم
00:05:56مع بعض بيانات التسميات الحقيقية وطريقة لتقييم المخرجات، فإن إجراء الضبط الدقيق لنموذج مفتوح صغير يعد واحداً من
00:06:02أكثر الأمور التي تحظى بتقدير أقل والتي يمكنك القيام بها الآن. ومع منصات مثل Tinker، أصبح الأمر أسهل بكثير.
00:06:07 وما إذا كان Inkling هو النموذج الذي تحاول استخدامه يعتمد حقاً على ما تقوم بتغذيته به.
00:06:11إذا كان الصوت قادماً، فإن Inkling يعد خياراً قوياً ولا يوجد أي شيء آخر على Tinker يأخذ حتى الصوت الخام
00:06:16في الوقت الحالي. وإذا كنت تبحث عن أفضل نموذج عام مفتوح حالياً، فقد قمنا للتو بعمل
00:06:21فيديو عن Kimi K3 يمكنك مشاهدته هنا، وقد حقق ذلك بعض النتائج المذهلة. ولكن بخلاف ذلك،
00:06:26شكراً للمشاهدة. لقد كنت معكم وارن من BetterStack وأراكم في الفيديو القادم.

핵심 요약

يمثل نموذج Inkling المفتوح خياراً مناسباً للضبط الدقيق والتعامل المباشر مع الصوت الخام والصصور رغم تفوق النماذج العامة في المهام المستقلة.

하이라이트

  • أطلقت شركة Thinking Machines نموذج Inkling المكون من 975 مليار معامل برخصة Apache 2.0 على منصة Hugging Face.

  • يحقق نموذج Inkling نتيجة 79.8 في اتباع التعليمات مقارنة بنتيجة 63.8 في اختبارات الوكلاء الطرفية.

  • يعالج نموذج Inkling الصوت الخام مباشرة كمخطط طيفي والصور كأجزاء بحجم 40 في 40 بكسل بدون ضغط مسبق إلى نص.

  • أدى الضبط الدقيق باستخدام LoRa لنموذج شركة Harvey إلى رفع مقياس F1 من 0.56 إلى 0.68 ومطابقة أداء GPT-4.0 في 93% من الحالات.

  • تدعم منصة Tinker مجموعة من النماذج المفتوحة مثل Quen وKimi وDeepsea ونموذج NemoTron وGPT OSS.

타임라인

إطلاق نموذج Inkling ومواصفاته التقنية الأساسية

  • أطلقت شركة Thinking Machines أول نموذج لها المسمى Inkling بـ 975 مليار معامل.
  • يتفوق النموذج في اتباع التعليمات بنتيجة 79.8 بينما يسجل أداء أضعف في اختبارات الوكلاء الطرفية بنتيجة 63.8.

أسست ميرة موريتي المديرة التقنية السابقة لـ OpenAI شركة Thinking Machines بقيمة 12 مليار دولار. يوفر النموذج وزناته على منصة Hugging Face برخصة Apache 2.0 بهدف التخصيص والضبط الدقيق عبر منصة Tinker. يدير المطورون التوقعات بشأن قوة النموذج العامة مقارنة بالمختبرات الرائدة.

البنية التقنية ومعالجة الوسائط المتعددة

  • يعتمد نموذج Inkling على بنية مزيج الخبراء (MoE) مع استخدام 41 مليار معامل فعال فقط لكل رمزة.
  • يعالج النموذج الصوت الخام كمخطط طيفي والصور كأجزاء بحجم 40 في 40 بكسل دون تحويلها المسبق إلى نص.

تتجنب هذه البنية الفقد الناتج عن استخدام نماذج كلام أو مشفرات رؤية منفصلة تسبق نموذج اللغة. يتم إرسال كل رمز إلى ستة خبراء من أصل 256 خبيراً فريداً في كل طبقة. تضمن هذه الطريقة معالجة البيانات المرئية والصوتية ضمن نفس مساحة الرموز النصية.

استراتيجيات الضبط الدقيق ونتائج التطبيق

  • يحدد الضبط الدقيق أسلوب الإجابة والهيكل الصارم بدلاً من إضافة معرفة جديدة للنموذج.
  • أدى الضبط الدقيق لنموذج قانوني لشركة Harvey إلى رفع مقياس F1 إلى 0.68 وتحقيق التمادل مع GPT-4.0 بنسبة 93%.

يعتبر الضبط الدقيق مفيداً للمهام الضيقة التي تتطلب آلاف الأمثلة في السياق. تؤدي تقنية LoRa إلى خفض التكاليف وزيادة السرعة عبر تجميد الأوزان الأصلية وحقن مصفوفات صغيرة. توفر منصة Tinker أدوات لإجراء الضبط الدقيق التلقائي وتوليد بيانات التدريب.

ميزات منصة Tinker وخيارات الاستخدام

  • يعد Inkling النموذج الوحيد على منصة Tinker الذي يقبل الصوت الخام مباشرة.
  • يتيح نموذج Inkling شريط تمرير كامل لضبط جهد التفكير من صفر إلى واحد.

تدعم منصة Tinker نماذج متعددة مثل Quen وKimi وDeepsea وNemoTron. يوفر Inkling وصفات تعليمية لتصنيف أسلوب التحدث والتعرف على الكلام والوصفات الطبية. يعتبر النموذج خياراً قوياً للمهام الضيقة ذات البيانات الدقيقة والصوت الخام.

커뮤니티 글

모든 글 보기