لماذا تحتاج وكلاء الذكاء الاصطناعي إلى سياق بحجم مليون رمز — توماس وولف وأوليف سونغ، ميني ماكس

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00ينضم إلينا على المسرح الشريك المؤسس ورئيس قسم العلوم في شركة Hugging Face، توماس وولف.
00:00:30مرحباً بالجميع. مرحباً أليف. من الرائع وجودك على المسرح. شكراً لاستضافتي. لذا أتقدّم إليكم اليوم بشيء رائع، لأنكم للتو رأيتم نموذج GLM، وهو يحتل المرتبة الثانية حالياً في التحليل الاصطناعي. أستبعد ذلك لعدم تمكن أحد من استخدامه. والآن لدينا المرتبة الرابعة. لذا، سيكون لديكم أساساً جميع النماذج الكبرى، وتحديداً أفضل نموذج مفتوح المصدر على التوالي.
00:00:57نحن محظوظون جداً بوجود أليف، التي تمتلك مسيرة مذهلة حقاً في الحياة. فقد جاءت إلى الولايات المتحدة، وتحديداً إلى بنسلفانيا، وكانت تدرس للحصول على درجة الدكتوراه في جامعة نيويورك في مختبر يان لوكون، حيث عملت على تقنية JPA. لكننا قررنا ألا نتحدث عن JPA اليوم، أليس كذلك؟ هذا موضوع لوقت آخر. وبعد ذلك، بدلاً من الانضمام إلى Hugging Face، التي كانت في نيويورك أيضاً في ذلك الوقت، قررت الانضمام إلى شركة Minimax.
00:01:26لذا، بالنسبة لأولئك الذين قد لا يعرفون جميع مختبرات النماذج اللغوية حول العالم - ولكم عذركم في ذلك لأنني أعتقد أن هناك نحو 64 مختبراً من هذا النوع الآن - تُعد Minimax واحدة من أبرز ما نطلق عليه “تنانين الذكاء الاصطناعي” في الصين. فهذه هي النماذج الجديدة، وهناك نموذج DeepSeek المعروف جيداً الآن، ومونشوت (Moonshot) الذي يطور نموذج Kimi، وZee، ونموذج GLM الذي رأيتموه للتو.
00:01:51إذن، هذا هو النموذج الجديد، والآن لدينا Minimax. جميعها ممتازة للغاية، وتتمتع بفرق موهوبة تتنافس بقوة على المركز الأول.
00:01:58لذا، كان الإصدار الأحدث من Minimax هو M3، في وقت مبكر من شهر يونيو الماضي، والذي كان النموذج الأبرز في ذلك الوقت، وأفضل نموذج مفتوح المصدر.
00:02:08إنه أمر مثير للإعجاب حقاً. هناك الكثير من الجوانب المثيرة للاهتمام في هذا النموذج، لذا سنغوص فيها سريعاً، ثم نتحدث قليلاً عن ما يميز Minimax وما يجعلها رائعة.
00:02:20نعم. إذن ربما يا أليف، كبداية، هل يمكنك أن تعطينا نظرتك حول نموذج M3، وما الذي يعجبك فيه، وكيف كان إطلاقه؟
00:02:32نعم، لقد أطلقنا نموذج M3 في وقتEarlier من هذا الشهر، وهو نموذج أصغر حجماً يضم حوالي 400 مليار معلمة إجمالية، و20 مليار معلمة نشطة.
00:02:45لكنه يتمتع بقدرات فائقة سواء من حيث أداء البرمجة أو في فهم الرؤية البصرية.
00:02:52وهذا ما لا تملكه عادةً نماذج المصدر المفتوح؛ إذ لا يقتصر التعامل على البرمجة فحسب، بل يستطيع النموذج أيضاً فهم مقاطع الفيديو والصور، ويتمتع بسياق طويل جداً يبلغ مليون رمز.
00:03:09وذلك بفضل بنيتنا الجديدة التي تسمى MSA، أو الانتباه المتفرق لشركة Minimax (Minimax Sparse Attention). لقد جمعنا هذه الجوانب الثلاثة معاً لأننا نعلم أنها ستكون بالغة الأهمية في تطبيقات الذكاء الاصطناعي المستقبلية، مثل قدرات البرمجة،
00:03:26والقدرات العاملة (agentic)، والسياق الأطول، والفهم متعدد الوسائط. نعم، أعتقد أن هذا سيكون مثيراً للاهتمام حقاً في النموذج.
00:03:35نعم، هناك الكثير لنستكشفه في هذا النموذج، وأعتقد أنه لا يزال نموذج المصدر المفتوح الوحيد ضمن أفضل خمسة نماذج الذي يعد متعدداً بالفعل، لذا علينا مناقشة ذلك.
00:03:45لكن ربما نبدأ بالحديث عن السياق الطويل، نظراً لأنه كان الأول حقاً الذي يوفر سياقاً طويلاً حقيقياً بمليون رمز، وهو فعال حقاً.
00:03:54ولديكم أيضاً انتباه مينيماكس المتناثر، وهي إحدى التقنيات لجعل ذلك فعالاً، والتي قمتم بنشرها ومشاركتها بشكل مكثف أيضاً،
00:04:04فهل يمكنك التحدث قليلاً عن هذا، وربما كيف سار المشروع من جهة الانتباه، وكيفية تحقيق هذا السياق الطويل؟
00:04:11نعم، أود أن أقول إن قصة السياق الطويل تعود إلى كل من Minimax M1 و Minimax 01، حيث كان النموذج في الواقع قادراً على التعامل مع مهام ذات سياق يبلغ 10 ملايين رمز.
00:04:25عشرة ملايين. عشرة ملايين، نعم. ولكن لم يكن نموذجاً وكيلًا، أليس كذلك؟ بل كان مجرد إفراغ كتاب مثلاً، ليكون قادراً على تقديم مراجعات حوله، وما شابه ذلك.
00:04:37لذا ما أدركناه هو أن السياق الأطول يتيح في الواقع الكثير من القدرات، خاصة عند التفاعل مع المستخدمين.
00:04:47والآن عندما يتفاعل الوكيل مع البيئة بأكملها ويحصل على جميع استجابات الأدوات، ويجري جولات متعددة، فإن السياق الأقصر لن يكون كافياً لتنفيذ المهام المعقدة.
00:05:03لذا بالنسبة لهذا الإصدار، قلنا، أوه، يجب أن نستعيد سياقنا الأطول.
00:05:09ولذا ما سعينا وراءه كان من خلال انتباه مينيماكس المتناثر الخاص بنا، والذي كما تعلمون، كان البنية القابلة للتوسعة وذات التصميم البسيط.
00:05:23لذا أود أن أقول من مستوى أعلى، أليس كذلك؟ إنه يحتوي على فرع فهرس، كما تعلمون، يختار على مستوى أعلى ما هو الأهم في السياق.
00:05:36وبعد ذلك لدينا فرع انتباه متناثر يقوم بحسابات - بإجراء الحسابات على الكتل المحددة لتنفيذ المهام بالفعل.
00:05:44وهكذا، صممنا حقاً بنية أنيقة تتيح لنا توسيع نطاق الطول ومن ثم توسيع حجم النموذج في المستقبل بناءً على ذلك.
00:05:57هذا رائع جداً. يعجبني كيف أنه بالنسبة لأولئك الذين عملوا في هذا المجال لفترة طويلة نسبياً، فقد شهدنا الكثير من الأبحاث حول الانتباه، أليس كذلك؟
00:06:03هذا التعقيد من مرتبة تربيعية (N-square)، وهناك الكثير من تقنيات الانتباه الخطي.
00:06:06نعم.
00:06:06ثم بطريقة ما اختفى كل هذا في مرحلة ما.
00:06:09عندما ظهر Flash Attention، اكتشفنا أننا بحاجة فقط إلى نواة (kernel) أكثر كفاءة.
00:06:13والآن يعجبني كيف نعود للتفكير من المبادئ الأولى: ما هو الانتباه؟
00:06:18كيف يمكننا جعل ذلك أكثر كفاءة؟
00:06:20إذن، مليون رمز يعد أمراً جنونياً، أليس كذلك؟ كان نموذج GPT-2 يقتصر على 1024 رمزاً، وكان الجميع يقولون: “أوه، هذا كبير جداً. لن نحتاج أبداً إلى أكثر من ذلك”.
00:06:28إلى أين ترى أن هذا يتجه في المستقبل؟ جيف دين كان يحدثني في اليوم الآخر عن نظام انتباه بمليون مليون (تريليون) رمز.
00:06:35هل تعتقد أنه يجب أن نتجه نحو نظام انتباه بتريليون رمز؟
00:06:38هذا بالتأكيد شيء يمكننا استكشافه، أعني الأطوال الفائقة للسياق، بكل تأكيد.
00:06:45هذا أمر مثير للغاية للاستكشاف، وهو شيء يتطلب تصميمه المعماري، إلى جانب الأجهزة، الكثير من الأبحاث.
00:06:54نعم.
00:06:55هل تعتقد أن هناك الكثير من المكاسب السهلة المتاحة بعد؟
00:06:57لذا رأينا اليوم أن OpenAI تقلل حقاً - أعني أننا لا نعرف كيف بالضبط كشركة - ولكنها تقلل فاتورة الاستدلال بمقدار النصف، على الأرجح من خلال اعتماد معالجة أكثر كفاءة لآليات الانتباه.
00:07:08هل تعتقد أنه لا تزال هناك مكاسب سهلة كثيرة يمكن تحقيقها فيما يتعلق بطريقة معالجة ذلك؟
00:07:14إذن، أحد الأمور المثيرة للاهتمام حقاً بشأن M3 هو مدى انخفاض تكلفته، ويرجع ذلك جزئياً إلى آلية الانتباه المتفرق هذه، أو جزئياً لأنه نموذج صغير، ولكنه أيضاً فعال للغاية.
00:07:22صحيح.
00:07:23هل تعتقد أننا نستطيع الذهاب إلى أبعد من ذلك بكثير؟
00:07:25ربما كيف اخترعتم نظام الانتباه المتفرق من MinMax؟
00:07:29هل كان وكيل ذكاء اصطناعي هو من توصل إلى الفكرة؟
00:07:31أم كان إنساناً هو من ابتكرها؟
00:07:33حدثنا قليلاً عن هذا الأمر.
00:07:35نعم.
00:07:36نعتقد حقاً أن هناك الكثير من العمل الذي يمكن إنجازه في مجال هندسة النماذج وتحسين الاستدلال لكي تصبح النماذج أكثر كفاءة، لا سيما إذا كانت هناك مهام حساسة للغاية للوقت، ولكنها تتطلب قدرات فائقة القوة، أليس كذلك؟
00:07:52وبالنسبة لتلك الأنواع من المهام، فإننا نرغب حقاً في أن يكون النموذج فعالاً.
00:07:56ومن الذي توصل إلى هذه الفكرة؟
00:07:59في الواقع، أعتقد أن متدرباً من فريقنا عمل على ذلك.
00:08:02حقاً؟
00:08:03ليس موظفاً بعد بل متدرب.
00:08:04هذا لا يحدث عادةً في الكثير من المختبرات، لأنني أعتقد أنه في بعض المختبرات لا يمتلك المتدربون إمكانية الوصول إلى البيانات والعمل وما إلى ذلك.
00:08:15لكننا نعم، نحن منفتحون على أي شخص يرغب في المساهمة في نموذجنا.
00:08:20لذا فقد تم تصميم البنية في الواقع بواسطة متدرب.
00:08:23هذا جيد جداً.
00:08:24لا تزال هناك فرص للمتدربين هنا إذن.
00:08:26أخبار سارة.
00:08:27تلك أيضاً نقطة انتقال جيدة للحديث عن كيف تعمل MinMax من الداخل.
00:08:32كنا نناقش قبل صعودنا إلى المسرح كيف أن بإمكان أي شخص اقتراح مشروع.
00:08:37هل يمكنك أن تخبرنا قليلاً عن كيف تتم تنظيماتكم، وكيف تجرون الأبحاث؟
00:08:41أعتقد أن هذا يختلف تماماً حتى عن الدراسة في المدرسة أو حتى عن الشركات التقنية السابقة،
00:08:49الشركات التقنية الأقدم.
00:08:51الأمر مختلف تماماً.
00:08:53ما نحرص على توفيره هو أساس وبنية تحتية جيدة لكي يتمكن أي شخص من التجريب والتفاعل مع النموذج،
00:09:04والتفكير فيما يمكنه تحسينه في النموذج.
00:09:07وبعد إطلاق النماذج، عندما يصبحون متفرغين، يمكنهم اللعب بالنموذج وتجربته.
00:09:13ويمكنهم التفكير في عمليات التقييم الخاصة بهم.
00:09:15ويمكنهم اكتشاف نقاط الضعف الخاصة بهم واقتراح ما يريدون تحسينه في النموذج.
00:09:21وبعد ذلك، فإن الأشخاص الآخرين المهتمين بذلك سيقترحون الانضمام إلى المشروع.
00:09:26وسيعملون عليه لمدة أسبوعين أو حتى بضعة أشهر.
00:09:29وع عندما يكتمل العمل، يتم دمج النتيجة النهائية في نموذجنا.
00:09:33حيث نستخدم ذلك في تدريبنا النهائي ويتم طرحه للمستخدمين.
00:09:39مثير للاهتمام.
00:09:39إذن يمكن أن يكون لديكم أشخاص يعملون لفترة طويلة جداً على مشروع ما.
00:09:42عندما تقول بضع أشهر، يمكن أن يكون ذلك بمثابة استكشاف عميق حقاً لما هو ممكن.
00:09:46نعم.
00:09:47ويمكنني القول، على سبيل المثال، أن هندسة البنية قد تتطلب وقتاً أطول للتحقيق والبحث،
00:09:53والتجريب، وحتى إعادة إجراء عمليات التقييم لمرحلة التدريب الأساسي (pre-training).
00:09:57نعم.
00:09:58لذا قد يتطلب الأمر وقتاً أطول.
00:10:00هذا لطيف حقاً.
00:10:01نعم.
00:10:02وأعلم أنكم مهتمون جداً أيضاً بموضوع التقييم.
00:10:03أوافقك الرأي.
00:10:04يمكننا الحديث عن ذلك.
00:10:05أحد الأمور التي ربما تتعلق بذلك هي هذه الميزة الفريدة التي يمتلكها نموذج M3 وفريقكم فيما يتعلق
00:10:11بالتعددية الوسائط (multi-modality).
00:10:12لذا لا يقتصر الأمر على النصوص فحسب، بل يمكن لهذا النموذج أيضاً فهم الصور ومقاطع الفيديو.
00:10:16وحسب ما فهمت - ولكن يرجى توضيح الأمر بشكل أفضل - عندما نقرأ بطاقة النموذج (model card) على Hugging Face،
00:10:21يُذكر أن النموذج تم تدريبه منذ الخطوة الأولى كنموذج متعدد الوسائط، وليس فقط كمستخدم أحادي
00:10:26في مرحلة لاحقة، أليس كذلك؟
00:10:27نعم.
00:10:28هل يمكنك أن تخبرنا قليلاً عن ذلك ولماذا تعتقد أنه مهم، ولماذا
00:10:33تقومون بالبدء من الخطوة الأولى في التدريب متعدد الوسائط وليس في تدريب آخر؟
00:10:37نحن نسمي ذلك “تعددية الوسائط الأصيلة” (native multi-modality).
00:10:41لذا من المعتاد نوعاً ما لدى مختبرات النماذج تدريب النماذج متعددة الوسائط، فلنقل قدرات فهم الرؤية البصرية،
00:10:50بعد الانتهاء من مرحلة التدريب الأساسي للنصوص.
00:10:54حيث يقومون بوضع محولات (adapters) ثم تدريب ذلك الجزء.
00:10:57لكن ما وجدناه هو أن ذلك سيضر في الواقع بأداء النصوص.
00:11:02ولن يتقارب أداء فهم الرؤية بشكل جيد لأن النموذج يميل نوعاً ما
00:11:08نحو فهم النصوص.
00:11:11وهو ليس الأسلوب الأمثل، كما أنه ليس الأكثر قابلية للتطوير والتوسع.
00:11:17إذا فكرت في الامر، فنحن نريد توسيع نطاق البيانات، أليس كذلك؟
00:11:20وكذلك نقوم بذلك، فبعض المختبرات تدرب هذه القدرة بدءاً من منتصف مرحلة التدريب الأساسي.
00:11:27على سبيل المثال، التدريب الأساسي المستمر.
00:11:29لكن ما وجدناه هو أن هذا سيكون حساساً للغاية لوصفة العمل (recipe).
00:11:35وستكون وصفة التدريب مختلفة بالنسبة للبنى المختلفة، والخلطات المختلفة للبيانات،
00:11:41ومعدلات التعلم المختلفة.
00:11:43من الصعب التحكم في ذلك، ومن الصعب توسيع نطاق نتائج التجارب والاستنتاجات لتناسب نموذجاً أكبر.
00:11:52ولذلك، ما فكرنا فيه هو: لماذا لا نبدأ التدريب منذ الخطوة الأولى مباشرة؟
00:11:54هذا يبدو هو النهج الأكثر طبيعية.
00:12:01ونحن نعلم أن العديد من المختبرات تواجه مشاكل عند القيام بذلك.
00:12:03حيث ينهار النموذج بعد بضع خطوات من التدريب، سواء في فهم النصوص أو الرؤية البصرية.
00:12:07لكننا تمكنا من حل هذه المشكلة.
00:12:15لقد قمنا بالكثير من العمل على البنية التحتية وعلى البيانات التي ندرب النماذج عليها فعلياً.
00:12:18على سبيل المثال، نستخدم بيانات متداخلة (interleaved data)، وهي ما نسميه البيانات المتداخلة.
00:12:26وهي في الواقع بيانات طبيعية، لكننا نحافظ على الصور ومقاطع الفيديو ضمنها بدلاً من حجبها.
00:12:30ونقوم بعمليات تنظيف وحجب جيدة جداً على البيانات.
00:12:38ونقوم بعمل تنظيف وحجب جيدين جداً للبيانات.
00:12:42ونقوم بعمل نمذجة مكافآت جيدة جداً بحيث ندربه من الخطوة الأولى ويتوسع بشكل كبير.
00:12:50نعم، فهو لا ينهار.
00:12:52هذا مثير للإعجاب حقاً.
00:12:53مثير للإعجاب.
00:12:54هل ينبغي أن نتوقع نموذجاً أكبر بكثير في المستقبل؟
00:12:57إذن هذا النموذج لا يزال صغيراً إلى حد ما، أليس كذلك؟
00:12:59يحتوي على 428 مليار معامل، و23 مليار معامل نشط.
00:13:04حسناً، هل تعتقد أنكم ستتجاوزون حاجز التريليون؟
00:13:08بالتأكيد.
00:13:09نعم، بالتأكيد في المستقبل.
00:13:12هناك العديد من المهام التي لن يكون النموذج قادراً على أدوائها بشكل جيد جداً باستخدام معاملات أقل.
00:13:21نحن بالتأكيد سنكون أكثر طموحاً من هذا.
00:13:25هذا رائع.
00:13:26نتطلع إلى ذلك.
00:13:27وهناك شيء آخر مثير للاهتمام أجده دائماً جذاباً بشأن Minimax وهو كيف أن لديكم أيضاً هذه المجموعة الكاملة من التطبيقات والمنتجات، أليس كذلك؟
00:13:36لذا أتذكر بالفعل، بدأت Minimax في إتاحة الأشياء كصدر مفتوح على منصة Hugging Face في شهر يناير من العام الماضي.
00:13:43إذن كان ذلك قبل 18 شهراً.
00:13:45وكنا نتدردش قليلاً مع الفريق لنفهم ما كنتم تفعلونه.
00:13:48وأتذكر، لذا كنتم تحظون بالفعل باستخدام هائل على بعض هذه التطبيقات.
00:13:54هل يمكنك أن تخبرنا قليلاً كيف بدأ هذا الأمر؟
00:13:57إذن هل كان الأمر أساساً أنكم امتلكتم الكثير من التطبيقات ثم فكرتم، لدينا كل هذه البيانات.
00:14:02لماذا لا نتدرب على نموذج؟
00:14:03ثم قاموا بتشكيل فريق بحثي.
00:14:05كيف كانت القصة هناك؟
00:14:07قصتنا هي النموذج منذ اليوم الأول.
00:14:11لذا أعتقد أن نموذج الوسائط المتعددة، النموذج الذي يمكنه فهم جميع الرؤى وإخراج جميع الوسائط،
00:14:19كان أول شيء خطط له رئيسنا التنفيذي في اليوم الأول، حتى قبل أن تبدأ الشركة أساساً.
00:14:25لذا كان هذا حلم الذكاء الاصطناعي العام.
00:14:27أعتقد أن ذلك كان مبكراً جداً، حتى قبل ظهور ChatGPT.
00:14:30واو.
00:14:31نعم.
00:14:32ومن ثم كانت التطبيقات شيئاً يأتي مع ذلك.
00:14:35لأن لديك بعض قدرات النماذج، فأنت تريد أن يختبرها الناس بشكل جيد.
00:14:40ليس كل شخص يمكنه استخدامه عبر واجهة برمجة التطبيقات (API)، أليس كذلك؟
00:14:43لا يمكننا أن نتوقع من الجميع تجربته عبر واجهة برمجة التطبيقات.
00:14:46لذا نحتاج إلى تفاعل جيد للمستخدم، واجهات جيدة، تطبيقات جيدة، سيناريوهات جيدة يمكن للناس من خلالها تجربة النموذج.
00:14:57أعتقد في الواقع أن تلك التطبيقات غطت أكثر من 300 مليون شخص حول حوالي 200 دولة عالمياً.
00:15:06وأعتقد أكثر من مليون شركة أيضاً.
00:15:09نعم.
00:15:10كان هذا مذهلاً عندما سمعت عن الحجم.
00:15:12ونحن غالباً لا ندرك حجم هذا النوع من الاستخدام بالفعل.
00:15:17وهذا يقودني نوعاً ما إلى السؤال حول نموذج أعمال المصدر المفتوح وكل ذلك، وهو السؤال القائم دائماً، وهو أنه في الوقت الحالي من الجيد جعل النموذج مفتوح المصدر، ولكن يجب أن يكون لديك أيضاً بعض مصادر الإيرادات، أليس كذلك؟
00:15:33ولذلك أعتقد أن M3 هو شيء قررتم، على سبيل المثال، إنجازه مجاناً.
00:15:38وأعتقد أنه رائع للعالم.
00:15:41كيف ترى هذا؟
00:15:42هل لديك أيضاً بعض النماذج المحددة التي تستخدمها للتطبيق؟
00:15:45هل تفكر، هل تعتقد في المستقبل أنك ستستمر - ربما يصعب الجزم بذلك بالتأكيد - ولكن هل تعتقد أنك ستستمر في إتاحة النماذج كمصدر مفتوح؟
00:15:52كيف هي الثقافة حول المصدر المفتوح الآن؟
00:15:55شخصياً، وأيضاً بالنسبة لفريق أبحاث النماذج، نأمل دائماً في جعل النماذج مفتوحة المصدر.
00:16:01هذه هي خطتنا لأننا نرى حقاً كيف يمكن لمجتمع المصدر المفتوح معاً أن يساعد في بناء النموذج بشكل أفضل.
00:16:09على سبيل المثال، نتلقى الكثير من التعليقات حول أداء النموذج من المجتمع الرائع ونتلقى طلبات سحب (PRs) على أي شيء نقوم بفتحه، أليس كذلك؟
00:16:20وهذه قيمة جداً وتأتي في إصداراتنا اللاحقة.
00:16:24لذا فإن جعل المصدر مفتوحاً أمر رائع بالتأكيد.
00:16:27هذا رائع.
00:16:28وفي الواقع، هل لديك أي طلب للجمهور، الأشخاص الذين يستخدمون M3 أو Minimax؟
00:16:33هل هناك شيء تود حقاً أن يرسلوه إليك مرة أخرى كتعليقات؟
00:16:37هل، على سبيل المثال، تقرأ عندما يحاول الناس تعديل النماذج أو العبث بها، تعرف، التعديلات؟
00:16:43أو ما هو أفضل شيء تعتقد أنه يمكنك أخذه من المجتمع لنماذج المستقبل، على سبيل المثال؟
00:16:51أود أن أقول أياً كانت المشكلات التي يواجهها الناس، خاصة مع الوسائط المتعددة، أليس كذلك؟
00:16:57هذه هي المرة الأولى التي ندمج فيها معاً.
00:16:59نحن بالتأكيد نصبح أكثر طموحاً بشأن ذلك في المستقبل.
00:17:03قد يكون له بعض العيوب الآن، لكننا نتحسن في ذلك.
00:17:06لذا بغض النظر عن تلك التعليقات بأن النموذج لا يؤدي بشكل جيد، فسوف نقوم بالتأكيد بتحسين ذلك في الإصدارات المستقبلية.
00:17:13وأيضاً بغض النظر عن الميزات التي يريدها الناس.
00:17:17قل، كما تعلم، على سبيل المثال، جهد التفكير، أليس كذلك؟
00:17:21بعض الناس يطلبون ذلك.
00:17:23مثل، يمكن للجميع أن يطلبوا وسنحاول تحقيق ذلك في النماذج المستقبلية.
00:17:28نعم.
00:17:29هل ترى الكثير من المستخدمين الآن بالفعل في الوسائط المتعددة من حيث وكلاء البرمجة؟
00:17:33أشعر أنه لم يتم استكشافه إلا قليلاً.
00:17:37إنه كذلك.
00:17:38إنه كذلك.
00:17:39ولكنه يمكن في الواقع أن يفتح الكثير من القدرات والكثير من تطبيقات الوكلاء.
00:17:47قل على سبيل المثال، تريد من النموذج أن يقرأ عروض بوربوينت التقديمية، أليس كذلك؟
00:17:51أو لقراءة بعض التقارير غير المنظمة بشكل كبير.
00:17:55وتريد منه أن يفهم فيديو طويلاً جداً.
00:17:58قل أنك قمت بعمل فيديو تشغيل طويل ثم تريد من النموذج أن يتصرف باستخدام بعض الأدوات بعد فهمه.
00:18:07وهو يفتح مجموعة واسعة من حالات استخدام الوكلاء.
00:18:12إذن هل يمكن للوكيل أن يشاهد أحياناً درس الفيديو التعليمي الخاص بي على يوتيوب ويفهم كيفية استخدام أدوات البرمجة الخاصة بي، وكيف أصفها؟
00:18:18هل هو شيء من هذا القبيل؟
00:18:19ها؟
00:18:20هل يمكن للوكيل أخيراً مشاهدة الدروس التعليمية على يوتيوب وفهم الأشياء منها؟
00:18:24نعم.
00:18:25نعم.
00:18:26أعتقد ذلك.
00:18:27هل تستخدم الكثير من أدوات برمجة الوكلاء داخلياً؟
00:18:30هل هو مثل، أعني البرمجة بالتأكيد، ولكن مثل، هل هو أيضاً بالفعل من حيث البحث؟
00:18:34هل هو مؤتمت؟
00:18:35نعم.
00:18:36جزءياً؟
00:18:37أو لا؟
00:18:38كيف يعمل هذا؟
00:18:39نعم.
00:18:40لدينا أحزمتنا البحثية الخاصة.
00:18:42نحن نبني أحزمتنا البحثية الخاصة التي تؤتمت سير عملنا.
00:18:46أود أن أقول إن الكثير من تدفقات عملنا مؤتمتة.
00:18:49يمكنك أن ترى كيف أن أحدث النماذج الحدودية تسعى جميعها إلى تحسين النواة الخالية من القدرات، أليس كذلك؟
00:18:57مثل، دع النموذج يضع نموذجاً للنماذج الأخرى.
00:19:00دع النموذج يبني البيانات، والبيانات التلقائية، وما إلى ذلك.
00:19:05يمكنك أن ترى كيف أن المزيد والمزيد من النماذج قادرة على فعل تلك الأشياء، بما في ذلك M3.
00:19:10في الواقع، كنا جيدين حقاً في تلك الحالات، والآفاق الأطول ومنظمات النواة.
00:19:16ولذلك يمكننا استخدام قدرة النموذج، وربطها معاً، والمساعدة في روتيننا اليومي،
00:19:24وجعل تكراراتنا أسرع.
00:19:26هل تقوم M3 ببناء M4 بالفعل؟
00:19:30بناء M3.1.
00:19:31M3.1؟
00:19:32نعم.
00:19:33حسناً.
00:19:34ليس الوظيفة بعد.
00:19:35بالفعل.
00:19:36أود حقاً أن أختتم بما تجده مثيراً في الشهر القادم.
00:19:41ما رأيك؟
00:19:42قد يكون الأمر أسهل من حيث الميزة أو الأشياء التي تريد أن تبدو وكأنها تحدث في الذكاء الاصطناعي، أو بشكل عام أكثر
00:19:49من حيث أي شيء هو حقاً في صدارة عقلك، أود أن أقول، سيحدث.
00:19:54الكثير من الأشياء مثيرة للغاية.
00:19:58لكن ما أجده مؤخراً الأكثر إثارة هو الوكلاء المتعددون الذين أعتقد أن الكثير من
00:20:04تطبيقات الذكاء الاصطناعي تستخدم توجيه النماذج، والوكلاء المتعددين، وهو ما يفتح قدرات أكبر،
00:20:11ومهام أكثر تعقيداً.
00:20:13وأيضاً، يخبرنا بما تكون النماذج قادرة عليه وما لا تكون قادرة عليه.
00:20:19ويمكنك، كما تعلم، أن تفعل الكثير من الأشياء بذلك.
00:20:22إنه أمر مثير للغاية.
00:20:24شكراً جزيلاً، ألايف.
00:20:25يسعدنا وجودك.
00:20:26شكراً لاستضافتي.
00:20:27شكراً للجميع.
00:20:28شكراً للجميع.
00:20:29شكراً للجميع.
00:20:29شكراً لك.
00:20:29شكراً للجميع.

핵심 요약

يجمع نموذج M3 من شركة Minimax بين 400 مليار معامل وسياق طويل يبلغ مليون رمز عبر بنية الانتباه المتفرق المعالجة للوسائط المتعددة منذ الخطوة الأولى.

하이라이트

  • يضم نموذج M3 نحو 400 مليار معلمة إجمالية و20 مليار معلمة نشطة مع قدرات متقدمة في البرمجة وفهم الرؤية البصرية.

  • يعتمد نموذج M3 على بنية الانتباه المتفرق Minimax Sparse Attention لدعم سياق طويل يبلغ مليون رمز بفاعلية عالية.

  • تم تصميم بنية الانتباه المتفرق الخاصة بالنموذج بواسطة متدرب في الفريق وليس بواسطة موظف دائم.

  • تعتمد شركة Minimax مبدأ تعددية الوسائط الأصيلة، حيث يتم تدريب النماذج كمتعددة الوسائط منذ الخطوة الأولى لعملية التدريب الأساسي.

  • غطت تطبيقات شركة Minimax أكثر من 300 مليون مستخدم في نحو 200 دولة ونحو مليون شركة عالمياً.

타임라인

إطلاق نموذج M3 وقدراته التقنية

  • يحتوي نموذج M3 على 400 مليار معامل إجمالي و20 مليار معامل نشط.
  • يدعم النموذج قدرات فائقة في البرمجة وفهم مقاطع الفيديو والصور.
  • يتيح النموذج فهماً لسياق طويل يبلغ مليون رمز بفضل بنية MSA.

يمثل نموذج M3 الإصدار الأحدث من شركة Minimax والذي تم إطلاقه في شهر يونيو. يجمع النموذج بين القدرة على البرمجة والفهم البصرية وسياق بمليون رمز، مما يجعله نموذج المصدر المفتوح الوحيد ضمن أفضل خمسة نماذج الذي يتسم بتعددية الوسائط الفعلية.

آلية الانتباه المتفرق والسياق الطويل

  • يستند السياق الطويل إلى قدرة سابقة لمعالجة 10 ملايين رمز في الإصدارات السابقة.
  • تستخدم بنية الانتباه المتفرق فرع فهرس لاختيار الأهم وفرع انتباه لتنفيذ الحسابات.
  • ابتكر هذه البنية أحد المتدربين في فريق البحث وليس موظفاً دائماً.

تتطلب تفاعلات وكلاء الذكاء الاصطناعي مع البيئات المختلفة وسجود الأدوات سياقاً أطول بكثير من المعتاد. صممت شركة Minimax نظام الانتباه المتفرق MSA ليجمع بين البساطة وقابلية التوسعة، وقد تم إنجاز هذا التصميم بجهد من أحد المتدربين في الفريق.

بيئة العمل والثقافة البحثية في Minimax

  • تعتمد الشركة على توفير بنية تحتية تتيح لأي شخص تجريب الأفكار وتطويرها.
  • يقترح الأفراد مشروعاتهم الخاصة ويعملون عليها لفترات تتراوح بين أسبوعين وبضعة أشهر.
  • يتم دمج النتائج الناجحة في النموذج النهائي المستخدم للتدريب.

تنظم شركة Minimax أبحاثها بطريقة مرنة تسمح للمهندسين والمتدربين باقتراح تحسينات واكتشاف نقاط الضعف. يعمل الأفراد في مجموعات صغيرة على مشروعات بحثية تدمج لاحقاً في نموذج التدريب النهائي.

تعددية الوسائط الأصيلة وتدريب النماذج

  • تعتمد الشركة نهج تعددية الوسائط الأصيلة منذ الخطوة الأولى للتدريب الأساسي.
  • يتجنب هذا النهج استخدام المحولات اللاحقة التي تضر بأداء النصوص.
  • تستخدم الشركة بيانات متداخلة ومطهرة بعناية لمنع الانهيار أثناء التدريب.

بدلاً من تدريب الرؤية البصرية بعد الانتهاء من النصوص، تبدأ Minimax تدريب الوسائط المتعددة من الخطوة الأولى. يعتمد هذا النهج على بيانات متداخلة وتنظيف دقيق لضمان عدم انهيار النموذج وتوسع نطاقه بفعالية.

التطبيقات والآفاق المستقبلية للوكلاء

  • خدمت تطبيقات الشركة أكثر من 300 مليون مستخدم في 200 دولة ومليون شركة.
  • تدعم النماذج المتعددة الوسائط حالات استخدام جديدة مثل قراءة التقارير ومقاطع الفيديو الطويلة.
  • تركز التطورات المستقبلية على استخدام وكلاء متعددين لإنجاز مهام أكثر تعقيداً.

بدأت قصة Minimax بهدف تحقيق الذكاء الاصطناعي العام منذ اليوم الأول بالتوازي مع إطلاق التطبيقات. تتيح النماذج الحالية قدرات متقدمة للوكلاء في معالجة الفيديو والمستندات غير المنظمة، بينما تتجه الأبحاث المستقبلية نحو أنظمة الوكلاء المتعددين.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기