من النماذج البصرية اللغوية ونماذج الإجراءات إلى الوكلاء المجسّدين — أرمن أجاجانيان، Perceptron AI
AAI Engineer
컴퓨터/소프트웨어
스크립트
00:00:00مرحباً، أظن أننا جاهزون للبدء. أنا آرمين، الشريك المؤسس والرئيس التنفيذي لشركة Perceptron.
00:00:20سنتطرق قليلاً إلى طبيعة عملنا، لكن ما أريد مناقشته اليوم بشكل أساسي هو
00:00:25توجهنا البحثي الذي يسعى للابتعاد عن التمييز بين نماذج VLM ونماذج VLA
00:00:32ونماذج العالم، أو أياً كان المسمى، والانتقال إلى ما نسميه النماذج التأسيسية المجسدة.
00:00:42تحديداً ما نفعله في Perceptron، وهو بمثابة هدفنا الأسمى، هو بناء
00:00:48أسس للذكاء الاصطناعي المادي تمنحنا القدرة على الإدراك والفهم والتفاعل
00:00:53مع العالم المادي في الوقت الفعلي. ورسالتنا الأساسية هي التجسير بين
00:00:58العالمين المادي والرقيمي. وهذا يعني جوهرياً أن هدفنا يتلخص في تواجدنا أينما وجد جهاز
00:01:07أو أداة أو روبوت أو كاميرا أو مستشعر، لتزويدها بالذكاء.
00:01:14وعندما نتحدث تحديداً عن هذا النموذج القائم على القدرة على الإدراك والاستنتاج
00:01:19واتخاذ الإجراءات، فإننا نعتبره نوعاً من التوحيد للنمذجة متعددة الوسائط التقليدية.
00:01:25لقد عملت في FAIR لمدة ست سنوات، وكان هدفي هناك هو محاولة اكتشاف كيفية
00:01:31توسيع وصافات النماذج متعددة الوسائط. ومن أولى الأشياء التي بدأنا العمل عليها،
00:01:37ونشرنا عنها الكثير، مفهوم “الدمج المبكر”. وهو فكرة إدخال
00:01:41كل هذه الوسائط في أبكر مرحلة ممكنة. والتعقيد الحقيقي يكمن في تحديد
00:01:47الطريقة الصحيحة لتمثيل جميع الوسائط المختلفة بشكل مناسب، سواء في المدخلات أو
00:01:52في المخرجات التي تريد تمثيلها بنهج شامل. وبذلك أصبحت نماذج VLM هي
00:01:58الخيار البارز، فعندما أتحدث عن النماذج متعددة الوسائط، فربما تفكر في نماذج VLM. وهي القدرة على استقبال
00:02:03صور أو فيديو وبعض النصوص، وإخراج نص في النهاية. وهناك تنوعات في هذا المجال.
00:02:09فهناك نماذج مثل نماذج الاستنتاج المجسد (ER) القادرة على إخراج
00:02:15نقاط ربط مرجعية، وإجراء الفهم أو الاستنتاج المكاني بشكل أفضل قليلاً.
00:02:20ثم لدينا نماذج مثل VLA التي توسّع نطاق المخرجات لتتجاوز النص وتصل إلى
00:02:25الإجراءات. وهذه بالطبع استمر بناؤها تقليدياً على هياكل VLM القياسية،
00:02:30رغم وجود بعض الجهود للابتعاد عن
00:02:35نماذج VLM والانتقال إلى نماذج العالم أو نماذج إجراءات العالم، وإن لم يثمر ذلك عن شيء
00:02:39ملموس بعد. ثم نصل إلى أنواع أكثر إثارة للاهتمام وتعقيداً من النماذج
00:02:46متعددة الوسائط، مثل نماذج العالم، حيث تقوم أساساً بإخراج فيديو بناءً على مدخلات، وتكون هذه المدخلات
00:02:51إما صوراً أو فيديو، أو في الواقع صوراً وفيديو وإجراءات. والنقطة الأخيرة التي سأتحدث
00:02:57عنها هي شيء حديث نسميه نماذج العالم الدلالية، وهي لا تخرج شيئاً في الواقع،
00:03:02لكنها تتعلم نوعاً من التمثيل المفيد مستقبلاً. وما نعتبره
00:03:08نموذجاً تأسيسياً مجسداً هو في الواقع إطار يسمح لك بالقيام بالإدراك القياسي،
00:03:13والاستنتاج المجسد، والهدف الأسمى المتمثل في التحكم، كل ذلك داخل نموذج واحد.
00:03:20أي القدرة على الاستنتاج عبر وسائط حسية مختلفة في المدخلات، والقدرة على القيام
00:03:25بمعظم ما ذكرته في المخرجات، كلياً ضمن نموذج موحد واحد.
00:03:31وسأتحدث سريعاً عن تحديين، وهما تحديان بحثيان أسسيان
00:03:35نواجههما، وسأتطرق إلى كيفية تعامل شركتنا معهما،
00:03:40وما يفعله الآخرون في هذا المجال أيضاً.
00:03:43أول شيء هو التفكير فقط في محاولة نمذجة شيء مثل الفيديو،
00:03:48ساعة واحدة من الفيديو مثلاً. اعتماداً على التمثيل، قد ينتهي بك الأمر مع نحو
00:03:52مليون رمز بصري مدخل. والحقيقة هي أنه لا توجد بيانات مرجعية حقيقية
00:03:57يمكنك استخدامها بفعالية، أليس كذلك؟ يمكنك القيام بأشياء، وقد فعل الناس ذلك بالطبع،
00:04:02مثل استخراج النصوص التفريغية، أو التنبؤ بها من الفيديو، أو ربما وضع علامات
00:04:08توضيحية اصطناعية على بعض الإطارات، وطرح أسئلة. وتبين أن هذا هدر هائل للجهد،
00:04:13أليس كذلك؟ فإذا فكرت فيما يدخل إلى نموذجك، فستجد أن لديك مليون رمز يدخل،
00:04:16وأنت تحسب دالة الخسارة أساساً على شيء مثل 0.2 بالمئة فقط من إجمالي الرموز
00:04:22المدخلة. وهذا أمر إشكالي جداً من الناحية الأساسية. والحقيقة هي أن أي طريقة
00:04:27تحاول بها إصلاح ذلك تتسبب أساساً في إدخال إشارة تدريب خاطئة.
00:04:31فإما أن تكون الإشارة شحيحة جداً، أو اصطناعية جداً، أو غير مميزة. لذا فإن المحاولات
00:04:37التي تتجاوز مجرد الإثراء الاصطناعي كانت: لنقم بالتنبؤ بكل بكسل. وصحيح أن
00:04:42هذه إشارة كثيفة جداً، لكنها في الواقع تخصص الانتباه بشكل سيئ للغاية. فمثلاً،
00:04:47أنت تقارن وتُعامل بكسل الخلفية بنفس درجة الأهمية التي تُعامل بها
00:04:51طرف القابض، أو نقاط التلامس، أو أخطاء محددة، أو الفيزياء.
00:04:56ولذلك فإن ما نفعله في Perceptron، وهو جزء من ملكيتنا الفكرية الأساسية،
00:05:01هو التفكير في الشكل الذي يبدو عليه هدف الإدراك الطبيعي. وتحديداً، كيف يمكنني
00:05:06التنبؤ بالمدركات التي نعتقد أنها ستكون مهمة في المستقبل بطريقة تلقائية جداً؟ فعلى سبيل
00:05:11المثال، قد تقوم ببرمجة شيء ثابتاً مثل: إذا كان لديك ذراع روبوتية، يتضح أن طرف القابضين
00:05:16هو مدرك مفيد جداً يمكنك التنبؤ به في المستقبل. وقد بدأ الباحثون
00:05:20في القيام بذلك، مثل فريق MOMO Act في AI2. وهناك نماذج VLA أخرى قامت بذلك
00:05:26أيضاً. لكن هذا يظل مدركاً مبرمجاً بشكل ثابت. فالسؤال هو، هل يمكنك إيجاد طريقة
00:05:30تلقائية تمكّن النموذج دلالياً من تعلم هذا الهدف الفريد جداً؟ والحقيقة هي أننا
00:05:37توصلنا إلى طريقة. لن نكشف عن تفاصيلها هنا، لكن هذا مجرد تلميح إلى
00:05:41نهجنا في معالجة مشكلة الشح. أما المشكلة الأساسية الثانية التي نوليها الكثير من الاهتمام
00:05:49فهي تضخم السياق. فإذا كان لديك كاميرات تعمل باستمرار، وروبوتات لا تنتظر
00:05:54أو تتوقف بالضرورة، فأنت تضطر أساساً للاستنتاج عبر كمية كبيرة جداً من الرموز. وفي حين
00:06:01أن النص كثيف نسبياً، فإن الفيديو شحيح نسبياً. والسؤال هو، هل هناك إنجازات معمارية
00:06:08تتيح لك التعامل مع هذه المشكلة بشكل أصلي، بدلاً من مجرد محاولة
00:06:13إصلاح هذا عدم التوازن على مستوى اصطناعي؟
00:06:20هناك بضعة أشياء يمكنك القيام بها. أحد المبادئ الأساسية الأولى هو ضرورة
00:06:25البدء في تدريب الوسائط المختلفة بشكل مختلف تماماً. فلا يمكنك معاملة الرموز النصية
00:06:31مثل رموز الصور أو رموز الصوت أو الفيديو. لذا فإن أحد الأمور التي يمكنك البدء في التفكير
00:06:36بها هو التركيز على الضغط المكاني أو ضغط الرموز. ويقوم البعض بأساليب في غاية
00:06:41البساطة، ونحن أنفسنا بدأنا بها وكانت مجدية. يمكنك البدء في التفكير
00:06:44في حساب متوسط التمثيلات القائمة على الأجزاء عبر فيديو أو صورة. ويمكنك البدء في تحقيق
00:06:51معدلات ضغط مثيرة للاهتمام تصل إلى 10 أضعاف. لكن هذا يظل حلولاً مؤقتة نسبياً، ولا توجد
00:06:57أساليب معمارية مستخدمة بفعالية لحل هذه المشكلة. لذا ما قمنا به في
00:07:04الأشهر القليلة الماضية هو نشر ما نعتبره نهجنا للتعامل مع درجات الشح
00:07:10المختلفة، وهو ببساطة ترك النموذج يحدد الرموز التي ينبغي النظر إليها والرموز التي
00:07:14ينبغي التغاضي عنها. وبناءً على ذلك، نشرنا ورقتنا البحثية حول “خليط الخبراء الشحيح للبيانات”، والتي تتيح لك
00:07:19القيام بذلك عملياً. فهي تمكن النموذج — وتحديداً الموجه داخل النموذج — من
00:07:24التنبؤ بالرمز الذي يجب إدخاله والرمز الذي يجب تخطيه، وتسمح لنا بالقيام بذلك
00:07:30شبه مجاناً عبر جميع الطبقات المختلفة. وتبين أنه إذا تركت النموذج يتعلم تلقائياً،
00:07:36ودون البرمجة الثابتة لافتراضات معمارية معقدة، فإن النموذج يتعلم بالفعل.
00:07:43فعندما تقوم بتصور الحسابات الشحيحة للبيانات التي تستخدمها نماذجنا، سترى في الواقع أن
00:07:49النماذج تتعلم ذاتياً التركيز على المعلومات ذات الكثافة العالية جداً أو المعلومات المرتبطة بالمهمة.
00:07:56ففي أعلى اليمين، يمكنك ملاحظة أن النموذج يقرر التركيز على الرسم البياني،
00:08:00والذي ستسلط الضوء عليه إنساناً أيضاً، لأنه على الأرجح العنصر الأكثر أهمية في
00:08:05الشكل. وتبين أن التخصيص المعتمد على المهمة يحدث أيضاً.
00:08:13فإذا نظرت إلى أسفل اليسار، وطرحت سؤالاً عاماً جداً،
00:08:18فسوف ترى بياناً للانتباه ممتداً عبر الصورة بأكملها. فالنموذج
00:08:22لا يعرف الطريقة المناسبة لتخصيص الحوسبة. وفي الوقت نفسه، إذا طلبت منه القيام بشيء
00:08:27مثل تقسيم جميع الفواكه، فستلاحظ أنه يخصص المزيد من الرموز لما
00:08:31يعتبره رموز فواكه. وهذه خدعة ذكية ولطيفة جداً نستخدمها وقد نشرنا عنها،
00:08:36وبدأ الآخرون في استخدامها، وتتمثل في تضمين افتراضات مسبقة داخل المعمارية تكون مفيدة
00:08:43للتعامل مع التفاوت في شح الوسائط، دون أن تكون صارمة لدرجة تمنع النماذج
00:08:49من التعلم ذاتياً. ولما جمعنا كل هذا معاً، ولعلك رأيتم
00:08:57الإطلاق، أطلقنا نموذجنا الذي اعتبرناه أول نموذج
00:09:03تأسيسي مجسد قبل بضعة أسابيع. وهذا النموذج يقف على أعتاب المنافسة مقارنة بنموذج Gemini
00:09:093.1 Pro، بل إنه يتفوق على Gemini Embodied Reasoning، وأرخص بكثير بنحو 15 مرة.
00:09:15وهو مدرب أساساً على مجموعة بيانات بحجم بيتابايت واحد جمعناها من كل مجال
00:09:20تقريباً، بدءاً من بيانات الإنترنت وصولاً إلى وصفات التدريب المتوسط المخصصة أو أنابيب البيانات الاصطناعية.
00:09:28لدينا هذا البيتابايت من البيانات المتنوعة بين النصوص والصور ومقاطع الفيديو والمسارات، وهذه المسارات
00:09:34قد تكون عامة جداً، كمسارات استخدام سطح المكتب أو مسارات لعب ألعاب الفيديو.
00:09:41واتضح أنه بمجرد البدء في القيام بهذه الأمور، تبدأ خصائص مثيرة جداً للاهتمام بالبروز.
00:09:46وأهم خاصية لاحظناها، والتي تبدو بديهية عند النظر إليها بأثر رجعي،
00:09:50هو أنك تبدأ في رؤية مهام الرؤية الحاسوبية الكلاسيكية كمهام وكيل ذكي. وفي هذه
00:09:57الحالة، أعدنا صياغة عملية الاكتشاف كمهام وكيل ذكي. نموذجنا يمكنه، كما تعلمون،
00:10:02كتابة الأكواد، وطلب التكبير في أجزاء محددة، وتغيير التباين. ويمكنكم
00:10:09أن تروا هنا أن هذه مشكلة صعبة للغاية. أعتقد أن هناك مجتمعًا كاملًا على Reddit لهذه
00:10:14المشكلات التي تحاول العثور على أهداف صعبة جدًا في الصور. ونماذجنا تقوم بذلك
00:10:19بشكل ممتاز للغاية، ولكنها تفعل ذلك بمنظور وكيل ذكي. هذا ليس مجرد، كما تعلمون، حدد هذا
00:10:24المربع الكلاسيكي، بل إن النموذج يقرر بنفسه أنه بحاجة لتقسيم الصورة إلى أجزاء، وتعديل
00:10:28التباين. يقترح مربعًا هنا، ونرى أنه يزيد التباين ليعثر على الطائر.
00:10:36مجددًا، هذا أمر صعب للغاية حتى بالنسبة للإنسان، رغم أن البشر بارعون جدًا في المهام الإدراكية،
00:10:42فهذه مهمة شاقة نسبيًا. وكل هذا يتأتى من وجود
00:10:46نماذج مجسدة أصليًا تفهم بالفعل كيفية التعامل مع وسائط متعددة مختلفة.
00:10:51وبناءً على ذلك، كيف يرتبط هذا بالتوجّه العام للذكاء الاصطناعي الفيزيائي في مجال الروبوتات؟
00:10:57لقد استعرت هذه الشريحة من فريق GDM. وما بدأنا نلاحظه في الأنظمة
00:11:04الذكية للروبوتات هو الفصل بين ما نسميه نماذج الاستدلال المجسد أو
00:11:11المنسقين، ونماذج السياسة اللمسية. يمكنك التفكير في المشكلات على النحو التالي،
00:11:17إذا كنت أعد القهوة واستغرق الأمر ثلاث دقائق، فهناك خيار أن أحاول
00:11:21إجبار نموذج VLA بأكمله على فهم كيفية أداء هذه المهمة الفردية، أو يمكنني
00:11:26استخدام نموذج منسق يقسم هذه المهام إلى مهام فرعية، وتعمل فوقه سياسة
00:11:31تحكم لمسي. وهناك طيف كامل يمتد بين نموذج VLA بالكامل وصولًا إلى
00:11:36هذا النوع من الأنظمة الذكية. لكن النقطة الرئيسية التي أحاول إبرازها هي أن
00:11:41الاستدلال المجسد يمثل مشكلة معقدة ومثيرة جدًا لم تُحل بعد.
00:11:46ورغم ذلك، تواصل نماذجنا أداءها الرائد في الاستدلال المجسد.
00:11:50وبسبب هذا التفوق، بدأنا نرى أمورًا مذهلة لم نشهدها من قبل.
00:11:55إليكم مثالًا عمليًا على إجراء عملية تسمية بيانات روبوتية معقدة جدًا غير
00:11:59ذاتية، ويمكنكم رؤية النموذج وهو يتنقل بين أجزاء
00:12:04الفيديو، ويقص المقاطع، ويتأكد مما إذا كانت
00:12:09التسميات التوضيحية صحيحة عبر التحقق الذاتي. ونستطيع فعل ذلك لأن نماذج AR السريعة
00:12:15أرخص بكثير من أي شيء آخر متاح. إذا حاولت القيام بذلك باستخدام Gemini،
00:12:20فإن هذا الفيديو سيكلفك بضعة دولارات، بينما يكلفنا بضعة سنتات فقط.
00:12:24وكل هذه النتائج تنبع من امتلاك قدرات الاستدلال المجسد الرائدة هذه،
00:12:29والتي لم نكن نراها سابقًا في النماذج الأخرى.
00:12:37حسناً، سأشارككم الآن أكبر إنجاز بحثي حققناه، وأعتقد أننا
00:12:41سنكشف المزيد عنه في الأسابيع القادمة عبر منصة X. أحد اكتشافاتنا المهمة هو
00:12:48التوصل لقوانين توسيع جديدة للنماذج التاسيسية المجسدة. هذه نماذج يمكنك
00:12:53من خلالها الجمع بين التدريب القائم على التحكم، والتدريب على مسارات الحركة، والتدريب الإدراكي،
00:12:59والتدريب على الاستدلال المجسد. بمجرد اكتشاف الطريقة الصحيحة لدمج كل هذا
00:13:03واستخدام الأهداف المناسبة، ستظهر لك أدوات توجيه هامة للغاية لم
00:13:08تكن قادرًا على رؤيتها من قبل.
00:13:11الأداة العملية التي سأتحدث عنها هي القدرة على المقايضة بين بيانات
00:13:19التدريب المسبق للفيديو العام وبيانات التشغيل عن بعد. وكما نعلم، بيانات التشغيل عن بعد مكلفة للغاية،
00:13:25حيث تصل إلى 100 دولار لكل ساعة بيانات. ومقابل 100 دولار، يمكنني جمع بيانات تدريب مسبق للفيديو أكبر بكثير.
00:13:32وما يظهره هذا الرسم البياني هو أنك إذا اقتصرت على تدريب نماذج VLA وسياسات مجردة، فهذا هو
00:13:39النطاق المتاح لك. لا تزال هناك قوانين توسيع تطبق، فتستفيد من زيادة
00:13:43بيانات التشغيل عن بعد، ولكن الفوائد ليست كبيرة مقارنة بما تحققه عند تدريب
00:13:48هذه النماذج التأسيسية المجسدة الموحدة. وهذا ما يمثله النصف السفلي من الرسم البياني.
00:13:55والميزة الرائعة التي نحصل عليها هي إمكانية الاستغناء عن 10 أضعاف من بيانات التشغيل عن بعد
00:14:03مقابل استخدام 10 أضعاف من بيانات التدريب المسبق للفيديو. وحتى الآن، ينطبق هذا المبدأ على حجم القدرات
00:14:09الحوسبية بشركتنا. وسنواصل اختبار حدود إمكانيات هذه النماذج التأسيسية
00:14:16المجسدة. إليكم بعض الفيديوهات لسياسة نأمل أن نجعل أحد
00:14:28نماذجها الأصغر مفتوح المصدر خلال أسبوعين. كل هذا يعمل بشكل أصلي داخل نموذج واحد
00:14:33قادر على القيام بالاستدلال المجسد لفهم المهمة. في الواقع، إنه
00:14:38يخرج رموز تحكم. تلاحظون بعض الاهتزاز، ولكن لا بأس، فنحن نأمل
00:14:43معالجة ذلك عند التوسع. ويمكنكم رؤية مهام معقدة جدًا كان من الصعب للغاية
00:14:48على نماذج VLA المجردة القيام بها سابقًا. بالنظر إلى الفيديو على اليمين، تتطلب
00:14:54المهمة من النموذج قراءة عنوان الكتاب، واستحضار المعرفة بنوع هذا الكتاب،
00:14:58ثم تصنيفه ووضعه في الصندوق المناسب. هذه مهمة متعددة الخطوات تجمع
00:15:04بين الإدراك والتحكم، ويصعب جدًا تنفيذها باستخدام نموذج تحكم مباشر لا يدرك
00:15:09المهام الإدراكية المختلفة التي يحتاجها لإنجاز العمل.
00:15:23أجل، هذا رائع حقًا. كما أنه يعمل بأسلوب التعلم الصفري بشكل جيد دون تدريب إضافي. متحمسون لإتاحته
00:15:28للجميع خلال أسبوعين، في شهر يوليو.
00:15:33سأترك بضع دقائق للأسئلة العامة، وإن كنتم مهتمين، يسعدني التواصل معكم.
00:15:41من الأمور المميزة بشركتنا أننا نمنح عددًا محددًا من الشركاء إمكانية الوصول إلى أوزان Mark 1.
00:15:47ونتيح الوصول لأوزان نماذجنا التأسيسية المجسدة الأكبر. تواصلوا معي عبر البريد أو الرسائل على X.
00:15:58والآن، أفتح المجال للأسئلة في الدقائق المتبقية.
00:16:02شكراً لكم.
00:16:03شكراً لكم.
00:16:05شكراً لكم.
00:16:05شكراً لكم.
00:16:09شكراً لكم.
00:16:11شكراً لكم.
00:16:13شكراً لكم.
00:16:24السؤال هو: كيف استطعتم إتقان الاستيعاب الزمني وبهذه الدقة؟
00:16:31سؤال جيد. للبدء بصراحة، الأمر لم يُتقن كليًا بعد، ولا يزال هناك عمل كبير للوصول لمرحلة النشر الموثوق.
00:16:37النقطة الجوهرية هي: كيف تتعامل مع إدارة السياق؟ فالسياق المتاح لديك محدود نسبيًا، فالنماذج هنا تملك سياقًا بمليون رمز، وهو ما يستوعب فيديو بمعدل أطر عالٍ بسهولة.
00:17:06وهنا تبدأ في التفكير: هل هناك أساليب مبتكرة يمكن تطبيقها؟ سأعطيكم مثالًا، كنا نعتمد هذا الأسلوب سابقًا وتجاوزناه، مثل التفريق بين الأطر الرئيسية والأطر التفاضلية.
00:17:19كيف يمكنني إدارة السياق بالتوازن بينهما؟ ثم تفكر أثناء التدريب المسبق في كيفية استيعاب العناصر المفيدة لمهام الروبوتات بشكل أصلي.
00:17:32على سبيل المثال، مسألة أساسية كانت تواجه فيها نماذج Gemini صعوبة، رغم تحسن الحديثة منها، وهي تحديد الجهات.
00:17:40فعلى سبيل المثال، يصعب جدًا تحديد الاتجاهات مثل اليسار واليمين عند الجمع من الإنترنت، إذ لا يحدد أحد بالضرورة أن هذا المجسم يقع إلى يسار ذاك المجسم أو أسفله.
00:17:51لذا، التركيز المبكر على توزيع البيانات يمنح هذه القدرة سريعًا. كما أن الاستدلال المجسد كان محط تركيزنا الأساسي، ولهذا تجاوزنا Gemini ER بحوسبة أقل.
00:18:07نعم، أظهرت نماذج VLA أداءً عاليًا في المتانة، إذ لو أخذت أحد النماذج الصينية مثلاً،
00:18:35وحاولت ضبطها الدقيق لسياسة محددة، فمجرد تغيير خلفية الطاولة سيعطل عمل السياسة.
00:18:47المثير للاهتمام أن النمذجة المشتركة للإدراك والتحكم تجعلك أكثر مقاومة لهذه الأخطاء، أو للتغيرات البسيطة في الإضاءة.
00:18:56ونرى هذا يتجلى في الاستقرار تجاه تغيير الخلفيات، وهو ما تفتقده النماذج التقليدية.
00:19:03ومع ذلك، لن أبالغ في الادعاء، فالأمر لا يزال معقدًا نسبيًا.
00:19:07لو وجّهت ضوء كشاف مباشر على إحدى أذرع الروبوت، فغالباً لن يعمل.
00:19:12لكن النمذجة المزدوجة لهذه العناصر تساعد بقدر كبير.
00:19:16نقوم أيضًا ببيانات تعزيز أثناء التدريب، كالمحاكاة الوهمية لتوقف إحدى كاميرات الذراع عن العمل،
00:19:27أو محاكاة دخول أشعة الشمس من اتجاه معين،
00:19:31ونفعل ذلك خلال التدريب لتعزيز المتانة والاعتمادية.
00:19:35لكن المزايا الكبرى تأتي من تبني نموذج الدمج المبكر والانتقال به إلى مجال الروبوتات.
00:19:43ممتاز.
00:19:44.
00:19:50أوه، قواعد المعرفة؟
00:19:52إنها مفيدة لإنشاء التسميات التوضيحية للصور والفيديوهات، وتعمل بشكل جيد.
00:19:57نعمل مع شركاء الروبوتات لإجراء شرح وتوصيف غير ذاتي معقد كهذا.
00:20:02الأمر لا يتعلق ببناء هستولوجيا، بل بالقدرة على استخراج بيانات مهيكلة وعميقة،
00:20:07وهو ما تبرع فيه نماذجنا للغاية.
00:20:10نعم.
00:20:11على فكرة، كل ما عرضته هنا متوفر عبر واجهات برمجة عامة لل تجربة.
00:20:15واختبارات القياس متاحة للجميع.
00:20:17أعتقد أن وقتي قد انتهى.
00:20:19إنهم يطلبون مني التوقف، لذا يمكنني النقاش مع من يرغب في الخارج.
00:20:22شكراً لكم جميعاً.
00:20:27شكراً لكم.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기