مشكلة في المهارة: توقف عن نشر نماذج الرؤية واللغة، واستخدمها مع المهارات — ميرفي نويان، هجينغ فيس
AAI Engineer
Computing/SoftwareSmall Business/Startups
Transcript
00:00:00أهلاً بكم في هذه المحادثة حول مشكلة المهارة. في الواقع، لم تعد هذه مشكلة مهارة بعد الآن. بحلول نهاية
00:00:22هذه المحادثة، ستكونون قادرين على بناء الكثير باستخدام نماذج الرؤية إذا لم تكونوا تفعلون ذلك بالفعل.
00:00:27نبذة قصيرة عني، أنا ميرفي. أعمل في مجال الرؤية الحاسوبية منذ أيام نماذج LLaVA القديمة، وأركز مؤخراً على الوكلاء والأجهزة المدمجة لأنني مبهورة بها ولأنني أحب نماذج الرؤية واللغة لدرجة أنني ألّفت كتاباً عنها، لكنني لم أعد أريد من المطورين استخدام نماذج الرؤية واللغة بشكل مباشر بعد الآن، وأريد من كل مطور أن يبدأ
00:00:54ببناء تطبيقات رؤية حاسوبية متكاملة من البداية إلى النهاية، وتوفر لكم هذه المحادثة أساساً جيداً للقيام بذلك. والسلوك الشائع الذي ألاحظه لدى المطورين هو محاولتهم استخدام نماذج الرؤية واللغة لكل شيء، لكنكم لن تحصلوا أبداً على أداء في الوقت الفعلي. وعندما أقول “الوقت الفعلي”، أعني مثلاً أن لديكم محمصة خبز
00:01:18وتحصلون منها على 30 إلى 40 إطاراً في الثانية، سواء كنتم تبنون تصنيف الصور أو تجزئة العناصر أو غير ذلك.
00:01:28كما أنها ليست قوية جداً من حيث الدقة مقارنة بما إذا قمتم بتدريب نموذج مثل RF-DETR الذي تحدث عنه جوزيف في الكلمة الأولى،
00:01:39فهو سيتفوق دائماً على نموذج الرؤية واللغة الخاص بكم، وسأثبت ذلك اليوم.
00:01:47وعلى الجانب الأيمن، يمكنك رؤيتي وأنا أعمل على بعض المهام باستخدام RF-DETR.
00:01:52وأمر آخر هو أنهم لا يقرؤون التراخيص؛ فالجميع يسألونني دائماً عن YOLO عندما أنشر أي شيء عن اكتشاف العناصر. YOLO نموذج جيد، لكن ترخيصه GPL 3.0 على ما أعتقد.
00:02:07وأستطيع أن أقسم أن هناك بعض المطورين الذين ينشرونه بالفعل دون أن يعلموا
00:02:12أنه يتعين عليهم الدفع مقابله. لذا، أريد منكم الانتقال إلى استخدام نماذج ترخيص Apache 2.0 اليوم.
00:02:23ولهذا الغرض، قمت ببناء مشروع يدعى Vibe Vision، وهو مستوحى نوعاً ما من منشور مازيار.
00:02:30ما يفعله أساساً هو إعطاء نموذج SAM 3.1 كأداة ليستدعيها Gemma 4، وأجد هذا أمراً
00:02:39مثيراً للإعجاب حقاً. واليوم قمت ببناء مجموعة أدوات تتيح لكم القيام بذلك مع المزيد من الخيارات.
00:02:49لذا أرخص أفكاري هنا؛ أولاً، تحتوي مجموعة الأدوات هذه على نماذجي المفضلة كأدوات،
00:02:57بحيث يمكنك تقديمها لوكيلك البرمجي، لأن وكيل البرمجة الخاص بك يفتقر نوعاً ما لخبرة مهندس الرؤية الحاسوبية.
00:03:03وعندما أستخلص الخبرة، أتحقق دائماً مما يلي عندما أختار نموذجاً: أولاً، التراخيص هي الأولوية الكبرى بالنسبة لي،
00:03:09فيجب أن تكون Apache 2.0 أو MIT أو ترخيصاً غير تجاري. ثانياً، يجب أن يكون الأداء بمستوى ممتاز
00:03:16بناءً على الحجم أو الخيارات المعمارية، لذا أتحقق من اختبارات القياس كلما صدر نموذج جديد من مؤتمر للرؤية الحاسوبية.
00:03:24وثالثاً، الانطباع العام بالطبع. وتتضمن مجموعة الأدوات هذه جزءاً ثانياً وهو يشبه
00:03:31جزء التدريب التجريبي، وهو الجزء الأكثر إثارة، لذا سأبدأ به أولاً. أضع نفسي في
00:03:41مكان المطور لبناء تطبيق رؤية حاسوبية؛ إذا كان لدي صور معنونة، فالأمر سهل ويمكنني تدريب النموذج مباشرة،
00:03:47أو يمكنني تقديم بعض الدروس التعليمية لوكيل الرؤية الحاسوبية للقيام بذلك، فالكل متوفر لكوننا
00:03:55بنينا محولات لذلك. ولكن إذا كان لدي صور فقط، فيجب علي وضع التسميات التوضيحية ثم تقييمها
00:04:02ثم تدريب النموذج. ولكن كيف يمكنك القيام بذلك على نطاق واسع؟ يمكنك استخدام نموذج
00:04:11رؤية ولغة كمُعَنْوِن، ونموذج رؤية ولغة كَمُحَكِّم، ثم تدريب ما تريد. ولكن كيف
00:04:17يبدو خط المعالجة هذا؟ لقد قمت ببنائه وهو يحتوي على نموذج رؤية ولغة للتعنيين، ونموذج آخر للتحكيم،
00:04:24ثم التدريب. إنها مهمة طويلة المدى نوعاً ما بالنسبة لوكلاء البرمجة، وتدعم العديد من البنى التحتية،
00:04:35حيث يمكنك تشغيلها محلياً أو عن بُعد. وهي تعمل أساساً على البنية التحتية لـ Hugging Face،
00:04:42ولدينا مهام تتيح لك إجراء معالجة دفعية لمرة واحدة أو التدريب.
00:04:48كما لدينا نظام توجيه لا خادمي يسمى مزودي الاستدلال، حيث يمكنك استخدام عدة
00:04:54مزودين، ولدينا أيضاً حاويات لتخزين البيانات الوسيطة فوق مستودعات البيانات
00:05:00ومستودعات النماذج وما إلى ذلك. ولكن ما الذي يتيح هذا العمل؟ أولاً، نموذجي المفضَّل RF-DETR،
00:05:07تحديداً تجزئة RF-DETR التي أعمل عليها حالياً. لدينا وكلاء أفضل للمهام طويلة المدى
00:05:17التي تتطلب الإشراف المستمر على عملية التعنون وعملية التدريب وما إلى ذلك.
00:05:24كما تتيح النماذج الأصغر حجماً والأكثر قدرة تعنون البيانات بتكلفة منخفضة جداً، ومع
00:05:32المحولات قمنا بإعادة صياغة v5، لذا أصبحت تعمل بشكل أفضل لنماذج الرؤية في الوقت الحالي.
00:05:40وهكذا يبدو خط المعالجة عملياً: أولاً، أقوم بتعنون مجموعة البيانات، حيث آخذ مجموعة صور
00:05:47وأعنونها باستخدام Qwen 3.5 9B، ثم أُمِرِّر مجموعة البيانات المعنونة
00:05:54إلى مُحَكِّمَيْن؛ الأول هو Gemma 4 E4B بمسؤولية محكِّم 8B، والثاني هو
00:06:02LFM 2.5 VL بحجم 2B تقريباً. لقد اطلعت على الأبحاث وتبين أنه من الأفضل
00:06:10استخدام مجموعة من المحكِّمين الأصغر حجماً، ثم دمج قراراتهم. راجعت للأبحاث
00:06:18المتعلقة بذلك، ومعظم الناس يطلبون من نموذج الرؤية أو اللغوي تعيين درجة تقييم، لكن هذه الدرجات
00:06:26لا تعمل مطلقاً، خاصة إذا كانت النماذج المُحَكِّمَة بأحجام مختلفة. ثم أُمِرِّرها
00:06:34لتدريب RF-DETR المتوسط أو الكبير. لقد تحدثت مع فريق Roboflow وشجعوني على
00:06:40استخدامه، وهو يعمل حقاً وسأعرض لكم ذلك قريباً جداً. ولكن كيف يعمل؟
00:06:47تأخذ المستودع ثم تطلب منه ببساطة تدريب النموذج على مجموعة البيانات هذه
00:06:55الموجودة على Hub، وسيبدأ بالعمل. إذا كانت مجموعة البيانات تحتوي على تسميات، يمكنك البدء
00:07:04بالتدريب مباشرة، أما إذا لم تكن كذلك، فيمكنك البدء بوضع التسميات التوضيحية. الحيلة التي استخدمتها
00:07:11هي تمرير المربعات المحيطة المدمجة على الصور إلى المحكّم؛ تقنياً يخرج Qwen
00:07:19المربعات المحيطة كرموز، لكنني لا أمررها بتلك الطريقة بل أدمج المربعات فوق الصورة
00:07:27مع التسميات وأوصافها، وأقول للمحكّم: “إذا كان هذا الوصف يحتوي على مربع محدد
00:07:33عليه، فأخبرني إن كنت توافق أم لا”. ثم أقوم بدمج قرارات المحكّمين
00:07:40بناءً على الحد الأدنى من التوافق وليس الإجماع الكامل، وسأوضح سبب اعتمادي لهذه الطريقة.
00:07:49كما أن أوصاف التسميات هذه يتم إنشاؤها بوساطة وكلاء البرمجة وتوافق عليها أنت كبشر.
00:07:56والنماذج التي استخدمتها في خط المعالجة هذا مرخصة تحت Apache 2.0، باستثناء
00:08:03نموذج LFM الذي يملك ترخيصاً يتطلب الدفع إذا تجاوزت إيراداتك حداً معيناً،
00:08:10ولكن يمكنك استخدامه باطمئنان، فهو واسع النطاق. وبالنسبة لوكلاء البرمجة الذين
00:08:19يشرفون على خط المعالجة هذا، فقد بنيته في البداية مع Opus 4.8 ثم شغلت مسار العمل مع GLM 5.2
00:08:26الذي يؤدي عملاً جيداً في المهام طويلة المدى بصراحة. وبالنسبة للبنية التحتية، أنا أعمل في Hugging Face
00:08:35ولدي الكثير من رصيد الحوسبة، كما أنني قليلة الصبر بطبعي، لذا استخدمت قدرات عتادية
00:08:42كبيرة للتجارب، لكنني قمت بقياس الأداء، ويكلف الأمر إجمالاً نحو 3 إلى 4 دولار فقط
00:08:50إذا أردت تشغيل خط المعالجة بالكامل لتدريب النماذج، وهو أمر مذهل للغاية. في البداية لـ Qwen 3.5 استخدمت
00:08:58الخدمات اللاخادمية لأنها مريحة ورخيصة جداً، فاستخدمت DeepInfra
00:09:05وهي زهيدة الثمن للغاية. وإذا أردت تنفيذ معالجة دفعية، فمن الأفضل إجراء المهام عبر المزودين،
00:09:12وبالنسبة للتحكيم استخدمت مهام Hugging Face الزهيدة، وللتدريب استخدمت بطاقة L4
00:09:19ولكن النموذج صغير جداً مثل RF-DETR، ويمكنك استخدام أي شيء آخر أو القيام بذلك
00:09:27محلياً إذا أردت، فأنا غير صبورة فقط وأريد حجم دفعة كبيراً. ولقد اختبرت ذلك في مشكلتين:
00:09:33الأولى كشف لافتات المرور، والثانية تحليل المستندات. بالنسبة لعلامات المرور،
00:09:42كانت التسميات متوفرة لدي، لذا قارنت الأداء بالبيانات الحقيقية للتأكد من كفاءة خط المعالجة،
00:09:48أما بالنسبة لتحليل المستندات، فلم أتمكن من ذلك لأنني استخدمت مجموعة بيانات DocVQA،
00:09:54وكان الهدف استخراج الصور والجداول والتوقيعات وغيرها،
00:10:02وهي مهمة جديدة وأردت معرفة ما إذا كان RF-DETR قادراً على تعلمها. النتيجة الأولى: إنه يعمل نجاح!
00:10:08لدينا دقة متوسطة جيدة تتجاوز 50، وقد قارنتها بـ...
00:10:19لدي مجموعة اختبار أخذتها ومررتها عبر Qwen ثم قارنتها بالتسميات التوضيحية المستنتجة
00:10:29وبالتسميات الحقيقية لمجموعة الاختبار تلك. هناك فجوة بسيطة لكنها متوقعة
00:10:35لأنه تعلّم من Qwen، وقيمة ROC-AUC ممتازة أيضاً بصراحة بالنسبة لمثل
00:10:42هذه الحالة. وبالنسبة لتحليل المستندات، فقد أظهر قدرة على التعميم وهو أمر مذهل بالنسبة لي.
00:10:50هنا في مخرجات النموذج المدرب، يمكنك رؤية أنه اكتشف التوقيع بينما أغفله
00:10:58توصيف Qwen لمجموعة الاختبار تلك، لذا أود القول إن النموذج يتعمم بشكل ممتاز أيضاً.
00:11:06ونحن ندين بهذا لمدى جودة RF-DETR كعمود فقري للنظام. وهتا يمكنكم أيضاً رؤية كيف
00:11:12يلتقط الصور تقنياً بدقة متناهية. وأثناء بناء هذا المشروع، لاحظت في الواقع
00:11:21أنني أفتقر للخبرة في البناء باستخدام وكلاء الرؤية، لذا لدي مجموعة من النتائج حول هذا الموضوع.
00:11:30أولاً، هناك عدم توازن كبير في التحكيم؛ فبناءً على المشكلة، يميل LFM إلى الرفض
00:11:37كثيراً، ولهذا السبب لم أستطع الاستناد للإجماع، لأنني لو استبعدت كل ما اتفق عليه
00:11:44كلا من LFM و Gemma لإزالته، لبقي لدي عدد قليل جداً من الأمثلة، مما سيؤدي
00:11:50إلى قدرة ضعيفة جداً على التعميم. لذا ما فعلته هو أنه إذا وافق أحدهما، فسوف أأخذ
00:11:58ذلك المثال، وقد عمل ذلك بشكل جيد بالفعل. ولكن إذا كانت لديك مجموعة بيانات ضخمة وتهتم
00:12:04بنسبة الاستدعاء، أنصحك بالأخذ بالإجماع أو الملاحظة المباشرة. أما بالنسبة لتحليل المستندات، فالفرق
00:12:09ليس كبيراً جداً. ثانياً، توليد الأوامر صلب بعض الشيء، وهذا هو الجزء الوحيد الذي يتعين عليك
00:12:17فيه كإنسان الموافقة؛ فالنموذج يولد الأوامر للمحكّم،
00:12:28ثم تقول “حسناً، أوافق على هذا” لأنه لا بد لك من إلقاء نظرة على مجموعة بياناتك،
00:12:35ولا مفر من ذلك. ثالثاً، وهذا أمر مثير للاهتمام للغاية، لأن وكيل البرمجة
00:12:42الخاص بك -مهما بلغت جودته مثل Opus 4.8 الرائع في البرمجة-
00:12:52يفتقر للخبرة كمهندس رؤية حاسوبية، كما يفتقر للمنطق البديهي؛ على سبيل المثال،
00:12:59كان يقوم بقلب إشارات المرور أفقياً أو يحدث تشويشاً على إشارات الإضاءة،
00:13:06مما قد يفسد بياناتك ويخربها حتماً. لذا أصلحت هذا لاحقاً ويمكنك تحديد
00:13:14ما إذا كنت تريد زيادة البيانات أم لا، ووكيل البرمجة سيعينك في ذلك.
00:13:21وأخيراً، الجزء الثاني من مجموعة الأدوات هذه هو النماذج المفضلة لدي كأدوات.
00:13:30وأخيرًا، الجزء الثاني من هذه الأدوات هو النماذج المفضل لدي كأدوات
00:13:35يغطي هذا المستودع نماذجي المفضلة من تقدير العمق إلى التجزئة الصفرية
00:13:42وهذا مدعوم جزئيًا أولاً باختبارات Hugging Face القياسية التي أطلقناها منذ بضعة أشهر
00:13:48لدينا لوحة صدارة للاختبارات القياسية، وهناك
00:13:55تجد النماذج المفتوحة بالإضافة إلى نتائج تقييمها، ويمكنك المقارنة بين نماذج مختلفة بمقاسات مختلفة
00:14:02أحافظ على تحديثها باستمرار، ولكنها مدعومة أيضًا جزئيًا بشغفي بقراءة
00:14:13أوراق مؤتمرات الرؤية الحاسوبية، ولذا أود أن أشيد بهذا النموذج لأن
00:14:20الكثير من الناس لا يعرفون عنه، فبعض النماذج لا يمكنها إجراء تجزئة مرجعية مفتوحة
00:14:26مثل أن تقول “قسّم هذه السيارة الحمراء” وستفعل، ولكن إن قلت “السيارة الحمراء بجانب
00:14:33السيارة البرتقالية التي بجوار السيارة الزرقاء”، فلن تفعل ذلك، ولكن Falcon Perception وهو
00:14:39نموذج من TII يمكنه فعل ذلك، بحجم 600 مليون معامِل فقط وترخيص Apache 2.0
00:14:47لذا يقوم هذا النموذج بالتجزئة الصفرية من أجلي
00:14:51وهذه قائمة غير حصرية، فلتقدير الوضعيات لدينا عائلة Sapiens
00:14:58للمهام المتمركزة حول العنصر البشري مثل تحديد النقاط الرئيسية للجسم وتقدير
00:15:04العمق البشري وغير ذلك. وللكشف الصفري لدي Moondream 3 و MM Grounding DINO الذي
00:15:13يعد نموذجًا بترخيص Apache 2.0 وهو ممتاز وصغير جدًا مقارنة بـ Moondream، وقد وفرت لك
00:15:20نماذج متعددة بمقاسات مختلفة لتختار منها حسب العتاد لديك، فإن كنت تريد
00:15:25السرعة اختر البديل الأصغر، وللتعرف الضوئي على الحروف أخذتها من اختبارات olmOCR
00:15:34بمقاسات مختلفة، ولتقدير العمق اكتشفت أن النموذج الكبير يخضع
00:15:40لترخيص غير تجاري بينما بقية النماذج تجارية ويمكنك استخدامها، فهذا النموذج مثلًا
00:15:45يحمل ترخيص Apache 2.0 ويأتي بدعم Supervision و Tracker، وكلاهما
00:15:51مكتبتان من Roboflow تتيحان لك تتبع العناصر وصناديق الإحاطة وغيرها
00:16:00وبالنسبة للخطط المستقبلية، قد أسمعكم تقولون إن هذا لن يعمل في
00:16:06حالات الاستخدام الصناعي لأنها تحتوي على أجزاء مختلفة يصعب وصفها
00:16:13فاللغة الطبيعية ليست مدخلاً مناسبًا لها، لذا أرى أن الكشف الموجه بالصور
00:16:21قد يساعد، فإن لم تكن تعرف الكشف الموجه بالصور، فهو يعتمد على صورة مرجعية
00:16:27مثل صورة “Huggy” هنا على سبيل المثال، ثم تطلب من النموذج الكشف عن هذا العنصر
00:16:36في جميع الصور الأخرى، وأشعر أن هذا قد يساعد في التطبيقات الصناعية حيث
00:16:41لا يمكنك وصف الأشياء بلغة طبيعية، كما أريد تجربة دمج تقاطع المجموعات
00:16:52أو ما شابه، حيث تكون لديك صناديق محددة وصناديق المحكّم، فتطلب من المحكّم
00:17:00توليد صندوق ثم تحسب تقاطع المجموعات بدلاً من طلبه قبول الصندوق أو رفضه
00:17:06وأعمل حاليًا على دعم التجزئة. شكراً لاستماعكم، وإذا
00:17:14أردتم لمعرفة المزيد لدي مستودع صغير للرؤية الحاسوبية يحتوي على كل ما يتعلق
00:17:20ضبط النماذج والتكميم والنماذج متعددة الوسائط وكل ما يخص الرؤية، بالإضافة إلى
00:17:27أدلة مهام Transformers التي نحدثها باستمرار وتحوي دروسًا كثيرة، ولدينا أيضًا مهارات Hugging Face
00:17:36التي تحتوي على مهارات خاصة بالرؤية الحاسوبية بالإضافة إلى مهارات البنية التحتية لتتمكن من
00:17:43التدريب بأمر واحد، وهذا حسابي على تويتر والمستودع موجود على GitHub
00:17:51باسم mervenoyan vision intern. أظن أن لدي وقتًا لسؤال واحد، شكراً جزيلاً لكم
00:18:04نعم، يسأل عما إذا كانت لدي خطط لتدريب نماذج VLMs نفسها، كنوع من تحسين الذات
00:18:16سيكون ذلك مشوقًا جدًا، ولكن أريد أولاً حل مشكلة تدريب المطورين
00:18:22لنماذج مخصصة لمهام معينة ونشرها على الأجهزة الطرفية، ثم قد يأتي ذلك لاحقًا، ربما سؤال آخر؟ نعم
00:18:34ليس تمامًا، لا أعتقد ذلك، لقد استخدمت فقط لأنني أردت أن يمتلك وكيل البرمجة
00:18:44السياق الكامل لإنشاء التوجيه، ربما سؤال أخير؟ حسناً، شكراً جزيلاً لكم
00:19:04إذاً
Community Posts
No posts yet. Be the first to write about this video!
Write about this video