من النماذج البصرية اللغوية ونماذج الإجراءات إلى الوكلاء المجسّدين — أرمن أجاجانيان، Perceptron AI

AAI Engineer
컴퓨터/소프트웨어

스크립트

00:00:00مرحباً، أظن أننا جاهزون للبدء. أنا آرمين، الشريك المؤسس والرئيس التنفيذي لشركة Perceptron.
00:00:20سنتطرق قليلاً إلى طبيعة عملنا، لكن ما أريد مناقشته اليوم بشكل أساسي هو
00:00:25توجهنا البحثي الذي يسعى للابتعاد عن التمييز بين نماذج VLM ونماذج VLA
00:00:32ونماذج العالم، أو أياً كان المسمى، والانتقال إلى ما نسميه النماذج التأسيسية المجسدة.
00:00:42تحديداً ما نفعله في Perceptron، وهو بمثابة هدفنا الأسمى، هو بناء
00:00:48أسس للذكاء الاصطناعي المادي تمنحنا القدرة على الإدراك والفهم والتفاعل
00:00:53مع العالم المادي في الوقت الفعلي. ورسالتنا الأساسية هي التجسير بين
00:00:58العالمين المادي والرقيمي. وهذا يعني جوهرياً أن هدفنا يتلخص في تواجدنا أينما وجد جهاز
00:01:07أو أداة أو روبوت أو كاميرا أو مستشعر، لتزويدها بالذكاء.
00:01:14وعندما نتحدث تحديداً عن هذا النموذج القائم على القدرة على الإدراك والاستنتاج
00:01:19واتخاذ الإجراءات، فإننا نعتبره نوعاً من التوحيد للنمذجة متعددة الوسائط التقليدية.
00:01:25لقد عملت في FAIR لمدة ست سنوات، وكان هدفي هناك هو محاولة اكتشاف كيفية
00:01:31توسيع وصافات النماذج متعددة الوسائط. ومن أولى الأشياء التي بدأنا العمل عليها،
00:01:37ونشرنا عنها الكثير، مفهوم “الدمج المبكر”. وهو فكرة إدخال
00:01:41كل هذه الوسائط في أبكر مرحلة ممكنة. والتعقيد الحقيقي يكمن في تحديد
00:01:47الطريقة الصحيحة لتمثيل جميع الوسائط المختلفة بشكل مناسب، سواء في المدخلات أو
00:01:52في المخرجات التي تريد تمثيلها بنهج شامل. وبذلك أصبحت نماذج VLM هي
00:01:58الخيار البارز، فعندما أتحدث عن النماذج متعددة الوسائط، فربما تفكر في نماذج VLM. وهي القدرة على استقبال
00:02:03صور أو فيديو وبعض النصوص، وإخراج نص في النهاية. وهناك تنوعات في هذا المجال.
00:02:09فهناك نماذج مثل نماذج الاستنتاج المجسد (ER) القادرة على إخراج
00:02:15نقاط ربط مرجعية، وإجراء الفهم أو الاستنتاج المكاني بشكل أفضل قليلاً.
00:02:20ثم لدينا نماذج مثل VLA التي توسّع نطاق المخرجات لتتجاوز النص وتصل إلى
00:02:25الإجراءات. وهذه بالطبع استمر بناؤها تقليدياً على هياكل VLM القياسية،
00:02:30رغم وجود بعض الجهود للابتعاد عن
00:02:35نماذج VLM والانتقال إلى نماذج العالم أو نماذج إجراءات العالم، وإن لم يثمر ذلك عن شيء
00:02:39ملموس بعد. ثم نصل إلى أنواع أكثر إثارة للاهتمام وتعقيداً من النماذج
00:02:46متعددة الوسائط، مثل نماذج العالم، حيث تقوم أساساً بإخراج فيديو بناءً على مدخلات، وتكون هذه المدخلات
00:02:51إما صوراً أو فيديو، أو في الواقع صوراً وفيديو وإجراءات. والنقطة الأخيرة التي سأتحدث
00:02:57عنها هي شيء حديث نسميه نماذج العالم الدلالية، وهي لا تخرج شيئاً في الواقع،
00:03:02لكنها تتعلم نوعاً من التمثيل المفيد مستقبلاً. وما نعتبره
00:03:08نموذجاً تأسيسياً مجسداً هو في الواقع إطار يسمح لك بالقيام بالإدراك القياسي،
00:03:13والاستنتاج المجسد، والهدف الأسمى المتمثل في التحكم، كل ذلك داخل نموذج واحد.
00:03:20أي القدرة على الاستنتاج عبر وسائط حسية مختلفة في المدخلات، والقدرة على القيام
00:03:25بمعظم ما ذكرته في المخرجات، كلياً ضمن نموذج موحد واحد.
00:03:31وسأتحدث سريعاً عن تحديين، وهما تحديان بحثيان أسسيان
00:03:35نواجههما، وسأتطرق إلى كيفية تعامل شركتنا معهما،
00:03:40وما يفعله الآخرون في هذا المجال أيضاً.
00:03:43أول شيء هو التفكير فقط في محاولة نمذجة شيء مثل الفيديو،
00:03:48ساعة واحدة من الفيديو مثلاً. اعتماداً على التمثيل، قد ينتهي بك الأمر مع نحو
00:03:52مليون رمز بصري مدخل. والحقيقة هي أنه لا توجد بيانات مرجعية حقيقية
00:03:57يمكنك استخدامها بفعالية، أليس كذلك؟ يمكنك القيام بأشياء، وقد فعل الناس ذلك بالطبع،
00:04:02مثل استخراج النصوص التفريغية، أو التنبؤ بها من الفيديو، أو ربما وضع علامات
00:04:08توضيحية اصطناعية على بعض الإطارات، وطرح أسئلة. وتبين أن هذا هدر هائل للجهد،
00:04:13أليس كذلك؟ فإذا فكرت فيما يدخل إلى نموذجك، فستجد أن لديك مليون رمز يدخل،
00:04:16وأنت تحسب دالة الخسارة أساساً على شيء مثل 0.2 بالمئة فقط من إجمالي الرموز
00:04:22المدخلة. وهذا أمر إشكالي جداً من الناحية الأساسية. والحقيقة هي أن أي طريقة
00:04:27تحاول بها إصلاح ذلك تتسبب أساساً في إدخال إشارة تدريب خاطئة.
00:04:31فإما أن تكون الإشارة شحيحة جداً، أو اصطناعية جداً، أو غير مميزة. لذا فإن المحاولات
00:04:37التي تتجاوز مجرد الإثراء الاصطناعي كانت: لنقم بالتنبؤ بكل بكسل. وصحيح أن
00:04:42هذه إشارة كثيفة جداً، لكنها في الواقع تخصص الانتباه بشكل سيئ للغاية. فمثلاً،
00:04:47أنت تقارن وتُعامل بكسل الخلفية بنفس درجة الأهمية التي تُعامل بها
00:04:51طرف القابض، أو نقاط التلامس، أو أخطاء محددة، أو الفيزياء.
00:04:56ولذلك فإن ما نفعله في Perceptron، وهو جزء من ملكيتنا الفكرية الأساسية،
00:05:01هو التفكير في الشكل الذي يبدو عليه هدف الإدراك الطبيعي. وتحديداً، كيف يمكنني
00:05:06التنبؤ بالمدركات التي نعتقد أنها ستكون مهمة في المستقبل بطريقة تلقائية جداً؟ فعلى سبيل
00:05:11المثال، قد تقوم ببرمجة شيء ثابتاً مثل: إذا كان لديك ذراع روبوتية، يتضح أن طرف القابضين
00:05:16هو مدرك مفيد جداً يمكنك التنبؤ به في المستقبل. وقد بدأ الباحثون
00:05:20في القيام بذلك، مثل فريق MOMO Act في AI2. وهناك نماذج VLA أخرى قامت بذلك
00:05:26أيضاً. لكن هذا يظل مدركاً مبرمجاً بشكل ثابت. فالسؤال هو، هل يمكنك إيجاد طريقة
00:05:30تلقائية تمكّن النموذج دلالياً من تعلم هذا الهدف الفريد جداً؟ والحقيقة هي أننا
00:05:37توصلنا إلى طريقة. لن نكشف عن تفاصيلها هنا، لكن هذا مجرد تلميح إلى
00:05:41نهجنا في معالجة مشكلة الشح. أما المشكلة الأساسية الثانية التي نوليها الكثير من الاهتمام
00:05:49فهي تضخم السياق. فإذا كان لديك كاميرات تعمل باستمرار، وروبوتات لا تنتظر
00:05:54أو تتوقف بالضرورة، فأنت تضطر أساساً للاستنتاج عبر كمية كبيرة جداً من الرموز. وفي حين
00:06:01أن النص كثيف نسبياً، فإن الفيديو شحيح نسبياً. والسؤال هو، هل هناك إنجازات معمارية
00:06:08تتيح لك التعامل مع هذه المشكلة بشكل أصلي، بدلاً من مجرد محاولة
00:06:13إصلاح هذا عدم التوازن على مستوى اصطناعي؟
00:06:20هناك بضعة أشياء يمكنك القيام بها. أحد المبادئ الأساسية الأولى هو ضرورة
00:06:25البدء في تدريب الوسائط المختلفة بشكل مختلف تماماً. فلا يمكنك معاملة الرموز النصية
00:06:31مثل رموز الصور أو رموز الصوت أو الفيديو. لذا فإن أحد الأمور التي يمكنك البدء في التفكير
00:06:36بها هو التركيز على الضغط المكاني أو ضغط الرموز. ويقوم البعض بأساليب في غاية
00:06:41البساطة، ونحن أنفسنا بدأنا بها وكانت مجدية. يمكنك البدء في التفكير
00:06:44في حساب متوسط التمثيلات القائمة على الأجزاء عبر فيديو أو صورة. ويمكنك البدء في تحقيق
00:06:51معدلات ضغط مثيرة للاهتمام تصل إلى 10 أضعاف. لكن هذا يظل حلولاً مؤقتة نسبياً، ولا توجد
00:06:57أساليب معمارية مستخدمة بفعالية لحل هذه المشكلة. لذا ما قمنا به في
00:07:04الأشهر القليلة الماضية هو نشر ما نعتبره نهجنا للتعامل مع درجات الشح
00:07:10المختلفة، وهو ببساطة ترك النموذج يحدد الرموز التي ينبغي النظر إليها والرموز التي
00:07:14ينبغي التغاضي عنها. وبناءً على ذلك، نشرنا ورقتنا البحثية حول “خليط الخبراء الشحيح للبيانات”، والتي تتيح لك
00:07:19القيام بذلك عملياً. فهي تمكن النموذج — وتحديداً الموجه داخل النموذج — من
00:07:24التنبؤ بالرمز الذي يجب إدخاله والرمز الذي يجب تخطيه، وتسمح لنا بالقيام بذلك
00:07:30شبه مجاناً عبر جميع الطبقات المختلفة. وتبين أنه إذا تركت النموذج يتعلم تلقائياً،
00:07:36ودون البرمجة الثابتة لافتراضات معمارية معقدة، فإن النموذج يتعلم بالفعل.
00:07:43فعندما تقوم بتصور الحسابات الشحيحة للبيانات التي تستخدمها نماذجنا، سترى في الواقع أن
00:07:49النماذج تتعلم ذاتياً التركيز على المعلومات ذات الكثافة العالية جداً أو المعلومات المرتبطة بالمهمة.
00:07:56ففي أعلى اليمين، يمكنك ملاحظة أن النموذج يقرر التركيز على الرسم البياني،
00:08:00والذي ستسلط الضوء عليه إنساناً أيضاً، لأنه على الأرجح العنصر الأكثر أهمية في
00:08:05الشكل. وتبين أن التخصيص المعتمد على المهمة يحدث أيضاً.
00:08:13فإذا نظرت إلى أسفل اليسار، وطرحت سؤالاً عاماً جداً،
00:08:18فسوف ترى بياناً للانتباه ممتداً عبر الصورة بأكملها. فالنموذج
00:08:22لا يعرف الطريقة المناسبة لتخصيص الحوسبة. وفي الوقت نفسه، إذا طلبت منه القيام بشيء
00:08:27مثل تقسيم جميع الفواكه، فستلاحظ أنه يخصص المزيد من الرموز لما
00:08:31يعتبره رموز فواكه. وهذه خدعة ذكية ولطيفة جداً نستخدمها وقد نشرنا عنها،
00:08:36وبدأ الآخرون في استخدامها، وتتمثل في تضمين افتراضات مسبقة داخل المعمارية تكون مفيدة
00:08:43للتعامل مع التفاوت في شح الوسائط، دون أن تكون صارمة لدرجة تمنع النماذج
00:08:49من التعلم ذاتياً. ولما جمعنا كل هذا معاً، ولعلك رأيتم
00:08:57الإطلاق، أطلقنا نموذجنا الذي اعتبرناه أول نموذج
00:09:03تأسيسي مجسد قبل بضعة أسابيع. وهذا النموذج يقف على أعتاب المنافسة مقارنة بنموذج Gemini
00:09:093.1 Pro، بل إنه يتفوق على Gemini Embodied Reasoning، وأرخص بكثير بنحو 15 مرة.
00:09:15وهو مدرب أساساً على مجموعة بيانات بحجم بيتابايت واحد جمعناها من كل مجال
00:09:20تقريباً، بدءاً من بيانات الإنترنت وصولاً إلى وصفات التدريب المتوسط المخصصة أو أنابيب البيانات الاصطناعية.
00:09:28لدينا هذا البيتابايت من البيانات المتنوعة بين النصوص والصور ومقاطع الفيديو والمسارات، وهذه المسارات
00:09:34قد تكون عامة جداً، كمسارات استخدام سطح المكتب أو مسارات لعب ألعاب الفيديو.
00:09:41واتضح أنه بمجرد البدء في القيام بهذه الأمور، تبدأ خصائص مثيرة جداً للاهتمام بالبروز.
00:09:46وأهم خاصية لاحظناها، والتي تبدو بديهية عند النظر إليها بأثر رجعي،
00:09:50هو أنك تبدأ في رؤية مهام الرؤية الحاسوبية الكلاسيكية كمهام وكيل ذكي. وفي هذه
00:09:57الحالة، أعدنا صياغة عملية الاكتشاف كمهام وكيل ذكي. نموذجنا يمكنه، كما تعلمون،
00:10:02كتابة الأكواد، وطلب التكبير في أجزاء محددة، وتغيير التباين. ويمكنكم
00:10:09أن تروا هنا أن هذه مشكلة صعبة للغاية. أعتقد أن هناك مجتمعًا كاملًا على Reddit لهذه
00:10:14المشكلات التي تحاول العثور على أهداف صعبة جدًا في الصور. ونماذجنا تقوم بذلك
00:10:19بشكل ممتاز للغاية، ولكنها تفعل ذلك بمنظور وكيل ذكي. هذا ليس مجرد، كما تعلمون، حدد هذا
00:10:24المربع الكلاسيكي، بل إن النموذج يقرر بنفسه أنه بحاجة لتقسيم الصورة إلى أجزاء، وتعديل
00:10:28التباين. يقترح مربعًا هنا، ونرى أنه يزيد التباين ليعثر على الطائر.
00:10:36مجددًا، هذا أمر صعب للغاية حتى بالنسبة للإنسان، رغم أن البشر بارعون جدًا في المهام الإدراكية،
00:10:42فهذه مهمة شاقة نسبيًا. وكل هذا يتأتى من وجود
00:10:46نماذج مجسدة أصليًا تفهم بالفعل كيفية التعامل مع وسائط متعددة مختلفة.
00:10:51وبناءً على ذلك، كيف يرتبط هذا بالتوجّه العام للذكاء الاصطناعي الفيزيائي في مجال الروبوتات؟
00:10:57لقد استعرت هذه الشريحة من فريق GDM. وما بدأنا نلاحظه في الأنظمة
00:11:04الذكية للروبوتات هو الفصل بين ما نسميه نماذج الاستدلال المجسد أو
00:11:11المنسقين، ونماذج السياسة اللمسية. يمكنك التفكير في المشكلات على النحو التالي،
00:11:17إذا كنت أعد القهوة واستغرق الأمر ثلاث دقائق، فهناك خيار أن أحاول
00:11:21إجبار نموذج VLA بأكمله على فهم كيفية أداء هذه المهمة الفردية، أو يمكنني
00:11:26استخدام نموذج منسق يقسم هذه المهام إلى مهام فرعية، وتعمل فوقه سياسة
00:11:31تحكم لمسي. وهناك طيف كامل يمتد بين نموذج VLA بالكامل وصولًا إلى
00:11:36هذا النوع من الأنظمة الذكية. لكن النقطة الرئيسية التي أحاول إبرازها هي أن
00:11:41الاستدلال المجسد يمثل مشكلة معقدة ومثيرة جدًا لم تُحل بعد.
00:11:46ورغم ذلك، تواصل نماذجنا أداءها الرائد في الاستدلال المجسد.
00:11:50وبسبب هذا التفوق، بدأنا نرى أمورًا مذهلة لم نشهدها من قبل.
00:11:55إليكم مثالًا عمليًا على إجراء عملية تسمية بيانات روبوتية معقدة جدًا غير
00:11:59ذاتية، ويمكنكم رؤية النموذج وهو يتنقل بين أجزاء
00:12:04الفيديو، ويقص المقاطع، ويتأكد مما إذا كانت
00:12:09التسميات التوضيحية صحيحة عبر التحقق الذاتي. ونستطيع فعل ذلك لأن نماذج AR السريعة
00:12:15أرخص بكثير من أي شيء آخر متاح. إذا حاولت القيام بذلك باستخدام Gemini،
00:12:20فإن هذا الفيديو سيكلفك بضعة دولارات، بينما يكلفنا بضعة سنتات فقط.
00:12:24وكل هذه النتائج تنبع من امتلاك قدرات الاستدلال المجسد الرائدة هذه،
00:12:29والتي لم نكن نراها سابقًا في النماذج الأخرى.
00:12:37حسناً، سأشارككم الآن أكبر إنجاز بحثي حققناه، وأعتقد أننا
00:12:41سنكشف المزيد عنه في الأسابيع القادمة عبر منصة X. أحد اكتشافاتنا المهمة هو
00:12:48التوصل لقوانين توسيع جديدة للنماذج التاسيسية المجسدة. هذه نماذج يمكنك
00:12:53من خلالها الجمع بين التدريب القائم على التحكم، والتدريب على مسارات الحركة، والتدريب الإدراكي،
00:12:59والتدريب على الاستدلال المجسد. بمجرد اكتشاف الطريقة الصحيحة لدمج كل هذا
00:13:03واستخدام الأهداف المناسبة، ستظهر لك أدوات توجيه هامة للغاية لم
00:13:08تكن قادرًا على رؤيتها من قبل.
00:13:11الأداة العملية التي سأتحدث عنها هي القدرة على المقايضة بين بيانات
00:13:19التدريب المسبق للفيديو العام وبيانات التشغيل عن بعد. وكما نعلم، بيانات التشغيل عن بعد مكلفة للغاية،
00:13:25حيث تصل إلى 100 دولار لكل ساعة بيانات. ومقابل 100 دولار، يمكنني جمع بيانات تدريب مسبق للفيديو أكبر بكثير.
00:13:32وما يظهره هذا الرسم البياني هو أنك إذا اقتصرت على تدريب نماذج VLA وسياسات مجردة، فهذا هو
00:13:39النطاق المتاح لك. لا تزال هناك قوانين توسيع تطبق، فتستفيد من زيادة
00:13:43بيانات التشغيل عن بعد، ولكن الفوائد ليست كبيرة مقارنة بما تحققه عند تدريب
00:13:48هذه النماذج التأسيسية المجسدة الموحدة. وهذا ما يمثله النصف السفلي من الرسم البياني.
00:13:55والميزة الرائعة التي نحصل عليها هي إمكانية الاستغناء عن 10 أضعاف من بيانات التشغيل عن بعد
00:14:03مقابل استخدام 10 أضعاف من بيانات التدريب المسبق للفيديو. وحتى الآن، ينطبق هذا المبدأ على حجم القدرات
00:14:09الحوسبية بشركتنا. وسنواصل اختبار حدود إمكانيات هذه النماذج التأسيسية
00:14:16المجسدة. إليكم بعض الفيديوهات لسياسة نأمل أن نجعل أحد
00:14:28نماذجها الأصغر مفتوح المصدر خلال أسبوعين. كل هذا يعمل بشكل أصلي داخل نموذج واحد
00:14:33قادر على القيام بالاستدلال المجسد لفهم المهمة. في الواقع، إنه
00:14:38يخرج رموز تحكم. تلاحظون بعض الاهتزاز، ولكن لا بأس، فنحن نأمل
00:14:43معالجة ذلك عند التوسع. ويمكنكم رؤية مهام معقدة جدًا كان من الصعب للغاية
00:14:48على نماذج VLA المجردة القيام بها سابقًا. بالنظر إلى الفيديو على اليمين، تتطلب
00:14:54المهمة من النموذج قراءة عنوان الكتاب، واستحضار المعرفة بنوع هذا الكتاب،
00:14:58ثم تصنيفه ووضعه في الصندوق المناسب. هذه مهمة متعددة الخطوات تجمع
00:15:04بين الإدراك والتحكم، ويصعب جدًا تنفيذها باستخدام نموذج تحكم مباشر لا يدرك
00:15:09المهام الإدراكية المختلفة التي يحتاجها لإنجاز العمل.
00:15:23أجل، هذا رائع حقًا. كما أنه يعمل بأسلوب التعلم الصفري بشكل جيد دون تدريب إضافي. متحمسون لإتاحته
00:15:28للجميع خلال أسبوعين، في شهر يوليو.
00:15:33سأترك بضع دقائق للأسئلة العامة، وإن كنتم مهتمين، يسعدني التواصل معكم.
00:15:41من الأمور المميزة بشركتنا أننا نمنح عددًا محددًا من الشركاء إمكانية الوصول إلى أوزان Mark 1.
00:15:47ونتيح الوصول لأوزان نماذجنا التأسيسية المجسدة الأكبر. تواصلوا معي عبر البريد أو الرسائل على X.
00:15:58والآن، أفتح المجال للأسئلة في الدقائق المتبقية.
00:16:02شكراً لكم.
00:16:03شكراً لكم.
00:16:05شكراً لكم.
00:16:05شكراً لكم.
00:16:09شكراً لكم.
00:16:11شكراً لكم.
00:16:13شكراً لكم.
00:16:24السؤال هو: كيف استطعتم إتقان الاستيعاب الزمني وبهذه الدقة؟
00:16:31سؤال جيد. للبدء بصراحة، الأمر لم يُتقن كليًا بعد، ولا يزال هناك عمل كبير للوصول لمرحلة النشر الموثوق.
00:16:37النقطة الجوهرية هي: كيف تتعامل مع إدارة السياق؟ فالسياق المتاح لديك محدود نسبيًا، فالنماذج هنا تملك سياقًا بمليون رمز، وهو ما يستوعب فيديو بمعدل أطر عالٍ بسهولة.
00:17:06وهنا تبدأ في التفكير: هل هناك أساليب مبتكرة يمكن تطبيقها؟ سأعطيكم مثالًا، كنا نعتمد هذا الأسلوب سابقًا وتجاوزناه، مثل التفريق بين الأطر الرئيسية والأطر التفاضلية.
00:17:19كيف يمكنني إدارة السياق بالتوازن بينهما؟ ثم تفكر أثناء التدريب المسبق في كيفية استيعاب العناصر المفيدة لمهام الروبوتات بشكل أصلي.
00:17:32على سبيل المثال، مسألة أساسية كانت تواجه فيها نماذج Gemini صعوبة، رغم تحسن الحديثة منها، وهي تحديد الجهات.
00:17:40فعلى سبيل المثال، يصعب جدًا تحديد الاتجاهات مثل اليسار واليمين عند الجمع من الإنترنت، إذ لا يحدد أحد بالضرورة أن هذا المجسم يقع إلى يسار ذاك المجسم أو أسفله.
00:17:51لذا، التركيز المبكر على توزيع البيانات يمنح هذه القدرة سريعًا. كما أن الاستدلال المجسد كان محط تركيزنا الأساسي، ولهذا تجاوزنا Gemini ER بحوسبة أقل.
00:18:07نعم، أظهرت نماذج VLA أداءً عاليًا في المتانة، إذ لو أخذت أحد النماذج الصينية مثلاً،
00:18:35وحاولت ضبطها الدقيق لسياسة محددة، فمجرد تغيير خلفية الطاولة سيعطل عمل السياسة.
00:18:47المثير للاهتمام أن النمذجة المشتركة للإدراك والتحكم تجعلك أكثر مقاومة لهذه الأخطاء، أو للتغيرات البسيطة في الإضاءة.
00:18:56ونرى هذا يتجلى في الاستقرار تجاه تغيير الخلفيات، وهو ما تفتقده النماذج التقليدية.
00:19:03ومع ذلك، لن أبالغ في الادعاء، فالأمر لا يزال معقدًا نسبيًا.
00:19:07لو وجّهت ضوء كشاف مباشر على إحدى أذرع الروبوت، فغالباً لن يعمل.
00:19:12لكن النمذجة المزدوجة لهذه العناصر تساعد بقدر كبير.
00:19:16نقوم أيضًا ببيانات تعزيز أثناء التدريب، كالمحاكاة الوهمية لتوقف إحدى كاميرات الذراع عن العمل،
00:19:27أو محاكاة دخول أشعة الشمس من اتجاه معين،
00:19:31ونفعل ذلك خلال التدريب لتعزيز المتانة والاعتمادية.
00:19:35لكن المزايا الكبرى تأتي من تبني نموذج الدمج المبكر والانتقال به إلى مجال الروبوتات.
00:19:43ممتاز.
00:19:44.
00:19:50أوه، قواعد المعرفة؟
00:19:52إنها مفيدة لإنشاء التسميات التوضيحية للصور والفيديوهات، وتعمل بشكل جيد.
00:19:57نعمل مع شركاء الروبوتات لإجراء شرح وتوصيف غير ذاتي معقد كهذا.
00:20:02الأمر لا يتعلق ببناء هستولوجيا، بل بالقدرة على استخراج بيانات مهيكلة وعميقة،
00:20:07وهو ما تبرع فيه نماذجنا للغاية.
00:20:10نعم.
00:20:11على فكرة، كل ما عرضته هنا متوفر عبر واجهات برمجة عامة لل تجربة.
00:20:15واختبارات القياس متاحة للجميع.
00:20:17أعتقد أن وقتي قد انتهى.
00:20:19إنهم يطلبون مني التوقف، لذا يمكنني النقاش مع من يرغب في الخارج.
00:20:22شكراً لكم جميعاً.
00:20:27شكراً لكم.

핵심 요약

تبني النماذج التأسيسية المجسدة يدمج الإدراك والتحكم في إطار موحد يقلل تكلفة الاستدلال 15 مرة.

하이라이트

  • تنتقل شركة Perceptron من النماذج التقليدية إلى النماذج التأسيسية المجسدة التي توحد الإدراك والتحكم في نموذج واحد.

  • يتفوق نموذج الاستدلال المجسد الخاص بالشركة على Gemini ER ويكون أرخص بنحو 15 مرة.

  • يعتمد النموذج على مجموعة بيانات بحجم بيتابايت واحد تتضمن النصوص والصور ومقاطع الفيديو والمسارات.

  • تتيح ورقة خليط الخبراء الشحيح للبيانات للنموذج التنبؤ بالرمز الذي يجب إدخاله وتخطي الرموز غير المهمة.

  • يؤدي الدمج المسبق للفيديو العام إلى الاستغناء عن 10 أضعاف من بيانات التشغيل عن بعد.

타임라인

التحول نحو النماذج التأسيسية المجسدة

  • تهدف شركة Perceptron إلى بناء أسس للذكاء الاصطناعي المادي في الوقت الفعلي.
  • تتطور النماذج المتعددة الوسائط من نماذج VLM التقليدية إلى نماذج العالم والتحكم.

يسعى التوجه البحثي للابتعاد عن التمييز بين نماذج VLM وVLA ونماذج العالم والانتقال إلى النماذج التأسيسية المجسدة. يهدف هذا الإطار إلى تزويد أي جهاز أو روبوت بالقدرة على الإدراك والاستنتاج واتخاذ الإجراءات ضمن نموذج موحد واحد.

معالجة شح البيانات وتضخم السياق

  • تمثل معالجة المليون رمز بصري دون بيانات مرجعية حقيقية تحدياً أساسياً.
  • تتيح تقنية خليط الخبراء الشحيح للبيانات للنموذج تحديد الرموز المهمة وتخطي الباقي.

يتسبب التنبؤ بكل بكسل في تخصيص سيء للانتباه، بينما تعالج أوراق Perceptron البحثية هذه المشكلة عبر ترك النموذج يتعلم تلقائياً التركيز على المعلومات عالية الكثافة. تظهر النتائج قدرة النموذج على تخصيص الحوسبة بناءً على المهام المطلوبة مثل تقسيم الفواكه.

الأداء وقوانين التوسيع الجديدة

  • يتفوق نموذج Perceptron على Gemini ER ويوفر تكلفة أقل بـ 15 مرة.
  • تتيح قوانين التوسيع الجديدة الاستغناء عن 10 أضعاف من بيانات التشغيل عن بعد مقابل بيانات الفيديو.

يعتمد النموذج على بيتابايت واحد من البيانات المتنوعة ويعيد صياغة مهام الرؤية الحاسوبية كمهام وكيل ذكي. تظهر الاختبارات قدرة النماذج على تنفيذ مهام معقدة متعددة الخطوات تجمع بين الإدراك والتحكم بكفاءة عالية وبأسلوب التعلم الصفري.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기