ما الجديد في هندسة الاستنتاج البرمجي؟ — فيليب كيلي، باسينتن
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00أنا هنا لأتحدث عما هو جديد في هندسة الاستنتاج، مرحبًا أنا فيليب، وأنا هنا لأنني
00:00:19ألّفتُ كتابًا. هذه سنتي الثالثة في المعرض العالمي لمهندسي الذكاء الاصطناعي، وهذا هو مؤتمري
00:00:24المفضل في العالم أجمع. إنه الحدث الأبرز في أجندتي كل عام. لقد كانت
00:00:29بدايتي الحقيقية كمتحدث وكمهندس هنا في عام 2024، وعدتُ في عام 2025 وقدمتُ الكثير من الأشياء،
00:00:36وها أنا هنا مجددًا. أعشق هذا المكان وأنا ممتن جدًا للمنظمين لاستضافتي دائمًا. لقد ألّفتُ هذا
00:00:44الكتاب بعنوان "هندسة الاستنتاج"، وقمنا بنشره منذ ثلاثة أو أربعة أشهر، وقد أذهلتني حقًا
00:00:49ردود الأفعال. لقد حققنا أكثر من... قمت بنشره في 23 فبراير، وحتى هذه اللحظة
00:00:57وزّعنا أكثر من 11,000 نسخة ورقية، ونقترب من 30,000 نسخة رقمية، و24 مليون
00:01:04شخص حول العالم، أو 24 مليون حساب على تويتر — وسنرى كم عدد الأشخاص الحقيقيين خلف ذلك —
00:01:09قد شاهدوا محتوى متعلقًا بهندسة الاستنتاج. ومع كل هذا الترحيب الرائع، كان هناك
00:01:17سؤال واحد يطرحه عليّ الناس باستمرار: لماذا قد تفعل هذا بحق السماء؟ أعني لماذا
00:01:23قد تؤلف كتابًا عن مجال يتغير بهذه السرعة؟ حسنًا، أنا أعتقد أن العديد من
00:01:29مبادئ هندسة الاستنتاج قد أصبحت راسخة تمامًا في هذه المرحلة، وهناك الكثير مما يمكننا
00:01:34تعلمه وتكراره عبر أجيال متتالية من النماذج. لكنني هنا اليوم لأتحدث عن
00:01:42ما هو جديد في هندسة الاستنتاج. الملحق العلمي العلني الأول الذي يضم كافة المعلومات الجديدة منذ صدور الكتاب.
00:01:48سنراجع مبادئ هندسة الاستنتاج قليلًا، ثم سنتحدث
00:01:54عن كل ما حدث منذ 23 فبراير 2026 في عالم الاستنتاج. سنتحدث
00:02:00عما حدث لتقنية TurboQuant، وعن ضغط الـ KV، وسنقضي الكثير من
00:02:05الوقت في الحديث عن dFlash وبعض التطورات المثيرة في فك الترميز التخميني، ثم سأقوم
00:02:12ببعض التكهنات والتوقعات لمستقبل الاستنتاج في الفترة القادمة
00:02:17وعن الأمور التي أتحمس للتحدث عنها في المرة القادمة التي ترونني فيها هنا.
00:02:23رائع، لنبدأ إذن. أحد الأمور التي لاحظتها الآن من خلال
00:02:30محادثات لا حصر لها مع الأشخاص حول الاستنتاج، هو وجود مجموعة من المبادئ المشتركة. وأحد
00:02:38أبرز هذه المبادئ ناقشته في بودكاست منذ أيام مع سارة حول الاستنتاج،
00:02:44حيث تبين وجود نوعين رئيسيين من هندسة الاستنتاج: هناك الاستنتاج المحلي
00:02:48حيث تتمثل الاستراتيجية الأساسية في مجرد تشغيله على أي عتاد متاح لديك عبر
00:02:56ضغط النموذج بالتقطير أو التكميم أو التقليم بأي طريقة ممكنة، وتوزيعه على أي
00:03:02معالجات رسومية تملكها في منزلك. أولاً تجعله يعمل، ثم تحاول جعله أقل غباءً عبر إصلاح
00:03:09أي مشاكل كارثية تسبب بها كل هذا الضغط، ومحاولة
00:03:15إعادته لمستوى الذكاء الأساسي أثناء التشغيل بحجم دفعة يساوي 1. ثم هناك عالمي أنا،
00:03:20وهو عالم مراكز البيانات وحجم الدفعات الكبيرة، حيث الهدف هو تشغيله منذ اليوم الأول،
00:03:27بناء بيئة vLLM وتشغيلها، ثم جعلها أقل بطئًا عبر تقنيات مثل التوجيه المعتمد على KV والتخمين
00:03:33وفصل المكونات. وأعتقد أن بين هذين العالمين الكثير مما يمكننا تعلمه من بعضنا البعض.
00:03:40سأركز في هذا العرض على التطورات في هندسة الاستنتاج الخاصة بمراكز البيانات لأن
00:03:46هذا هو مجالي، لكن هناك أيضًا تطورات رائعة جدًا في العالم المحلي.
00:03:52في كتاب "هندسة الاستنتاج" أفترض عمومًا أن أوزان النموذج هي منتج نهائي،
00:03:58وأعتقد أن مرحلة التسليم من التدريب إلى الاستنتاج مهمة جدًا ويجب مراعاتها، وهي طريقة جيدة
00:04:03لتحديد معالم هذا المجال. ومع ذلك، ما لاحظته مؤخرًا بشكل متزايد هو أن العديد
00:04:10من تحسينات الاستنتاج تأتي من عملية تدريب مخصصة له، وبالتالي فإن الحدود بين التدريب
00:04:17والاستنتاج أصبحت ضبابية أكثر فأكثر، وهناك أمر مثير للاهتمام ينبغي تذكره.
00:04:22فنحن نشهد حلقة حيث تحصل على استنتاج أسرع مما يمنحك بيانات أكثر لتدريب
00:04:28نموذج أفضل، والذي بدور يمنحك استنتاجًا أسرع وبيانات أكثر، وتستمر في هذه الحلقة
00:04:33حتى تصبح ثريًا للغاية. إذن في مجال التدريب المخصص للاستنتاج، لدينا مجموعة من
00:04:39التقنيات الجديدة لنناقشها عبر ما أحب تسميته "الثلاثة الكبار". سنتحدث عن
00:04:45جديد التكميم، وجديد التخزين المؤقت وتحديدًا آلية ذاكرة التخزين المؤقت KV، وبعض
00:04:52الأخبار في التخمين. ورغم وجود الكثير من الأمور الأخرى في عالم الاستنتاج
00:04:57بما في ذلك بعض الأشياء التي سأتحدث عنها في النهاية، فعندما يتعلق الأمر بالعمل اليومي والعملي
00:05:02لتسريع نموذج معين، تكون هذه التقنيات الثلاث هي ما يلجأ إليه المهندسون عادةً.
00:05:09أول شيء، قمت بنشر كتابي في فبراير، وكنت أشعر بشعور رائع وأقول لنفسي: "يا للياروعة!
00:05:16كل ما تحتاج معرفته عن الاستنتاج في مكان واحد". ثم ظهرت بعض الأخبار الجديدة في
00:05:23عالم التكميم. وكمراجعة سريعة، التكميم هو استخدام تنسيق أرقام أصغر وأقل دقة
00:05:32لتوفير النطاق الترددي والحوسبة، وتحسين زمن التوليد للرمز الأول وسرعة التوليد. وهو غالبًا ما يكون
00:05:39مرتبطًا بالعتاد، ويوفر في التكاليف لكنه قد يقلل جودة النموذج قليلاً.
00:05:45وبالمناسبة، إذا أردتم سماع رأيي المفصل في التكميم، فقد ألقيت كلمة في مؤتمر AI Engineer
00:05:51في ميامي الشهر الماضي حول كيف أن التكميم ليس بالضرورة سيئًا كما يبدو، وأن هناك
00:05:57العديد من الأشياء التي يمكنك القيام بها للحفاظ على الجودة خلال هذه العملية. لذلك كنت راضيًا عن تناولي
00:06:04لموضوع التكميم، ثم شاهد 20 مليون شخص تقنية TurboQuant، والتي تسببت في هبوط أسهم الذاكرة
00:06:12لفترة وجيزة لأن الجميع ظنوا أن استخدام الذاكرة سيكون أكثر كفاءة بكثير
00:06:16الآن ولن نعد بحاجة إلى المزيد من ذاكرة الـ Flash، وهو ما كان خطأً. لكن على أي حال، كان هذا نهجًا
00:06:23جديدًا في التكميم انتشر في مارس من هذا العام، يعتمد على الإحداثيات القطبية
00:06:29للتكميم ويسمح بتكميم ذاكرة KV التخزينية إلى 4 بت فقط. وكان الأمر رائداً جداً، وقلت لنفسي:
00:06:36"يا إلهي، لقد أغفلتُ هذا الموضوع بأكمله! كيف سيبدو المشهد الآن؟"
00:06:43قام فريقنا بإجراء الكثير من الأبحاث حول هذا الموضوع. تحية خاصة لعلي،
00:06:50المتدرب من جامعة ووترلو على تويتر، وهو من فريق أداء النماذج لدينا — ولا أعلم إن كان لا يزال متدربًا في الواقع —
00:06:57لكنه من ووترلو على أي حال. لقد كتب مقالاً رائعًا عن الرياضيات خلف TurboQuant.
00:07:04والفائدة الأساسية التي تحصل عليها من TurboQuant هي تمثيل ذاكرة KV التخزينية بأربعة
00:07:09بتات بدلاً من ثمانية، فتُوفّر نصف المساحة ونصف نطاق التردد وتضاعف فعليًا
00:07:14سرعة نقل ذاكرة KV داخل ذاكرة النظام. ولكن العيب كبير جدًا
00:07:21في TurboQuant؛ إذ يتبين أنك بحاجة إلى عمليات حسابية إضافية في التمرير الأمامي
00:07:25لمراعاة ذلك أثناء فك الترميز، مما يقلل عدد الرموز في الثانية بأكثر من النصف، وهذه مقايضة غير مقبولة
00:07:32لكثير من حالات الاستخدام الفعلي. لذا ألقينا نظرة جادة على TurboQuant ولكننا لا نستخدمها
00:07:38في أحمال العمل الحقيقية، وما زلنا نعتمد تكميم NVFP4 التقليدي.
00:07:44ومع ذلك، فهي تقنية ممتازة للاستنتاج المحلي. فإذا كنت تشغل نموذجًا،
00:07:51خاصة نماذج اللغات ذات السياق الطويل، على جهازك الشخصي أو على معالجات في قبو منزلك،
00:07:58فإن حجم الذاكرة لديك محدود جدًا وهو العائق الأول. وبالتالي، أي شيء يمكنه تفريغ الذاكرة
00:08:04من ذاكرة KV التخزينية ويسمح لك بمعالجة تسلسلات أطول سيكون قيمًا للغاية،
00:08:09وستكون الحوسبة الإضافية في التمرير الأمامي عيبًا أقل تأثيرًا.
00:08:16لذا تبقى TurboQuant ورقة بحثية ممتازة وتقنية رائعة للغاية، لكنها لم تكن
00:08:22قابلة للتطبيق في عالم استنتاج مراكز البيانات كما بدت في البداية. وبدلاً من ذلك، نركز
00:08:28على NVFP4 مع التركيز على تكميم الأوزان بدلاً من ذاكرة KV، وإبذال قصارى جهدنا
00:08:36لمعالجة الحواف الحادة في الأوزان المكممة، والتأكد من عدم تفريغ التوزيعات الاحتمالية
00:08:41لذاكرة KV نفسها، والتركيز بدلاً من ذلك على التوجيه المعتمد على KV، وتفريغ KV، ومشاركة KV
00:08:49باستخدام NCCL وNVIDIA Dynamo وأدوات أخرى لنقل ذاكرة KV عبر
00:08:55النظام وتفريغها محتملًا إلى الذاكرة العادية للمعالج وغيرها، بدلاً من محاولة استخدام TurboQuant
00:09:04لضغطها. ونركز أيضًا على التكميم عبر الوسائط المتعددة، مثل
00:09:11التفكير في كيفية تطبيق ميزات NVFP4 ليس فقط على النماذج اللغوية بل أيضًا على نماذج الصور
00:09:17والفيديو. علي كتب الكثير من التغريدات الرائعة عن ذلك على تويتر وأنصحكم بالاطلاع عليها.
00:09:23مع ذلك، تظل ذاكرة KV مهمة جدًا، ولنتحدث عنها وعن ضغط KV.
00:09:29مراجعة سريعة أخرى: في ذاكرة KV، إذا أدخلت الموجه نفسه بنفس البادئة، يمكنك إعادة استخدام
00:09:35الرموز التي حُسبت في مرحلة التعبئة الأولية سابقًا، مما يجعل نظامك أسرع وأكثر كفاءة.
00:09:42بشكل عام، ذاكرة KV هي ذاكرة غير مبددة للمعلومات. وهناك مصادر قليلة فقط للذاكرة غير المبددة
00:09:48عندما نفكر في نظام الاستنتاج لدينا: محتوى الموجه، السياق، وذاكرة KV
00:09:55وهي تتزايد خطيًا مع كمية البيانات التي تدخلها. وإذا فكرت في
00:09:59أطوال تسلسل تصل لمليون رمز، فإن ذلك يصبح ضخمًا حقًا. لذا يفكر الكثيرون في
00:10:05كيفية ضغط الذاكرة والسياق. فمنصات الوكلاء تضغط السياق، واسترجاع RAG،
00:10:11وكل هذه التقنيات التي تحدثنا عنها لسنوات هي نوع من ضغط السياق
00:10:17الأكبر إلى شيء يمكنك إعطاؤه للنموذج أو كتابته في ملفات. كل هذه الأمور
00:10:22تتزايد بنسبة أقل من الخطية مقارنة بكمية البيانات لديك. لكن ماذا لو كان هناك حل وسط؟ ماذا لو كان هناك
00:10:28أسلوب يتيح لك ضغط قدر كبير من البيانات التي تتذكرها مع الاحتفاظ المكتمل تقريبًا
00:10:34بالمعلومات؟ لدينا طرق عديدة للتفكير فيما ينبغي الاحتفاظ به
00:10:41في الذاكرة المؤقتة. أظهرت أساليب الضغط الحديثة أنه يمكننا استبدال الذاكرة المؤقتة بأخرى أقصر بكثير.
00:10:47قصيرة جدًا، ولدينا أوراق بحثية مثل "مطابقة الانتباه" (Attention Matching) وCartridges التي قدمت نتائج واعدة جدًا
00:10:53هنا بنسب ضغط عالية، لكن كلاهما يعمل في وقت الاستنتاج. ومرة أخرى، إحدى التقنيات
00:11:00التي أريد التحدث عنها أو أحد الموضوعات الرئيسة التي أريد تناولها هي التدريب من أجل الاستنتاج. لذا في هذه الحالة،
00:11:05أود تقديم شيء يُدعى STILL من فريق أبحاث Base 10، حيث يتم تركيب وبناء التجميع
00:11:12فوق الذاكرة المؤقتة، إذ نحتفظ بتمثيل مُتعلَّم للمعلومات بدلاً من الاحتفاظ بالمعلومات
00:11:17مباشرةً أو مجموعة فرعية حتمية منها، ويتم توزيع تكلفتها عبر التدريب. لذا فإن تشارلي وموديث من
00:11:25فريق ما بعد التدريب لدينا قدما عرضًا توضيحيًا رائعًا للغاية في حدث Coda Compile مؤخرًا، وهو متاح على يوتيوب.
00:11:31أشجعكم على إلقاء نظرة عليه إذا كنتم مهتمين بالتعرف على ضغط الذاكرة المؤقتة (KV compaction).
00:11:37للأسف لا أملك الوقت الكافي ولا عبقرية الشرح لشرح كل شيء هنا، لكن العبقرية أو الآلية الأساسية
00:11:46هي أن STILL يعمل كاختناق إدراكي (Perceiver bottleneck) يأخذ مجموعة ثابتة من متجهات الاستعلام المتعلمة ويجري انتباهاً متقاطعاً
00:11:53مع ذاكرة KV المؤقتة الكاملة وينتج مجموعة من المفاتيح والقيم المضغوطة في التمريرة الأمامية الواحدة.
00:11:59هذا يخلق ذاكرة مضغوطة وسريعة وقابلة للتفاضل يمكن للنموذج اللغوي الكبير الانتباه إليها كما لو كانت سياقًا حقيقيًا.
00:12:05لذا إذا كنتم مهتمين بضغط الذاكرة المؤقتة KV، فاطلعوا بالتأكيد على عمل تشارلي وموديث.
00:12:09لقد كان التعلم عنه أمرًا رائعًا بحق. إذن هاتان تقنيتان من التقنيات التي تحدثنا عنها،
00:12:16تحدثنا عن التكميم وتحدثنا عن التخزين المؤقت، والتقنية الأخيرة هي التكهن (Speculation)، وقد كان هناك الكثير من التغيير
00:12:21هنا. كمراجعة، في فك الترميز التكهني (Speculative decoding) سنستخدم رمزية مسودة وسنتحقق منها
00:12:29أثناء التمريرة الأمامية، وسنستخدم ذلك لتوليد أكثر من رمز واحد في كل تمريرة أمامية.
00:12:34هذا يساعد كثيرًا في زيادة عدد الرمزيات في الثانية، وهو تحسين بلا أي فقدان للمعلومات، وهو أمر ممتاز لأننا
00:12:40لا نضطر للقلق بشأن الجودة على الإطلاق. الآن في تاريخ التكهن، بدأنا
00:12:46بفك الترميز التكهني، وكل هذه الأساليب موجودة في الكتاب، حيث يتوفر لديك SpecDec إذ تستخدم نموذجًا صغيرًا من
00:12:52العائلة نفسها لتوليد رمزيات المسودة، وتبين أن النماذج الصغيرة ليست ممتازة جدًا في توليد رمزيات المسودة،
00:12:58إنها مجرد نماذج صغيرة جيدة. لذا ابتكرنا في المجال الصناعي مجموعة من الطرق الجديدة مثل Medusa حيث
00:13:04ربما تضيف فقط رؤوس فك ترميز للنموذج، وصولًا إلى Eagle 3 الذي كان ينص على: ماذا لو
00:13:09بدلًا من استخدام نموذج ضئيل من العائلة نفسها، نُدرّب نموذجًا بمليار معامل على
00:13:15الحالات الخفية للنموذج المستهدف لتوليد رمزيات المسودة؟ وقد عمل ذلك بالفعل بشكل ممتاز، ولهذا
00:13:21حتى شهر فبراير من العام الماضي أو فبراير من هذا العام تقريبًا، كان Eagle 3 هو أفضل طريقة في
00:13:27مجال التكهن. أما الآن لدينا DFlash، وDFlash أفضل بكثير؛ إنه انتشار للتكهن (Diffusion for speculation)، حيث ينشئ DFlash
00:13:36سلسلة من رمزيات المسودة بدلاً من رمز واحد. فالنموذج عبارة عن نموذج انتشار لغوي، مما
00:13:43يعني أنه يخلق تسلسلًا كاملًا من الرمزيات بالطريقة نفسها التي ينشئ بها توليد الفيديو أو الصور
00:13:49تسلسلًا من الإطارات أو البكسلات ويتكرر عليها، بدلاً من إجراء توليد تراجعي تلقائي للرمزيات.
00:13:55قد تكون نماذج DFlash أبطأ مرتين أو أربع مرات في التشغيل، لكنها ستتنبأ بـ 8
00:14:01أو 16 رمزية دفعة واحدة في تلك النافذة، بينما يقدم Eagle رمزية واحدة فقط في كل مرة. لذا فإن تمريرة أماميّة
00:14:08واحدة من DFlash أسرع من مرحلة المسودة الكاملة لـ Eagle وتتنبأ بالمزيد من الرمزيات. وهذه الرمزيات قادرة
00:14:14على تبادل الانتباه المتقاطع مع بعضها البعض، وتحقق عمومًا معدل قبول أعلى، لأن معدل القبول في التكهن
00:14:21هو كل شيء. لذا في بيئة العمل الحقيقية، نرى تحسنًا بأكثر من 3 أضعاف بفضل DFlash، وهذا مقاس باستعمال
00:14:30وحدة B200 واحدة ونموذج Qwen38B، ويمكننا رؤية ذلك مقابل Eagle حيث توجد زيادة جوهرية في الرمزيات، سواء في
00:14:40معدل قبول الرمزيات أو في الرمزيات لكل ثانية. وتدرب نماذج DFlash هذه باستخدام قناع انتباه لـ
00:14:47الصياغة ثنائية الاتجاه، حيث يوفر النموذج المستهدف السياق، وداخل كل كتلة
00:14:54سيكون لدينا مجموعة فرعية من الرمزيات النظيفة التي يتم أخذ عينات منها، وسيفرض قناع الانتباه
00:14:59الاتساق السببي، ولكنه سيظل يسمح بانتباه ثنائي الاتجاه، بينما في
00:15:06النموذج التراجعي التلقائي التقليدي تنظر فقط إلى الرمزيات في اتجاه واحد. ولهذا السبب نحن قادرون على
00:15:13الاستفادة من هذه المعمارية القائمة على الانتشار. ثم فكرت أنني قد
00:15:19انتهيت، ولكن قبل بضعة أيام ظهر DSpark. الآن لدينا DFlash يعمل في بيئة الإنتاج الفعلية،
00:15:25بينما DSpark بحث جديد، لذا في الأساس يمكنني فقط القول بخصوصه: "إنه موجود وهو رائع ونحن
00:15:31ندرسه". الفرق بينه وبين DFlash أنه ما زال يحتوي على نموذج الانتشار ذلك، ولكنه يقرنه أيضًا
00:15:38بنموذج تسلسلي، والفكرة هي أننا سنحسّن معدلات القبول عن طريق جعل هذين
00:15:45النموذجين يعملان معًا، بدلاً من وجود المُتكهِّن التكراري فحسب، أو مُتكهِّن
00:15:51الانتشار فقط، أو المُتكهِّن التراجعي التلقائي فقط. لذا فإن DSpark مثير جدًا للاهتمام، لكن ليس لدينا أي
00:15:57نتائج إنتاجية تخصه لمشاركتها بعد، وآمل أن نتوصل إليها في المرة القادمة.
00:16:03ما نملك نتائج إنتاجية بشأنه هو إعادة تدريب المُتكهِّن بشكل مستمر. وهنا عدنا
00:16:09إلى DFlash مرة أخرى، والفكرة هي أن فك الترميز التكهني يعتمد اعتمادًا كبيرًا على
00:16:15المحتوى الفعلي للموجهات والاستجابات التي تتعامل معها في نظامك، ولهذا السبب إذا كنت
00:16:21تعيد التدريب باستمرار على تلك الموجهات والاستجابات في نظامك الفعلي المباشر، يمكنك رؤية تحسن بنسبة 20% إلى ضعفين
00:16:29في معدلات قبول الرمزيات لديك. هذا في الواقع صعب التنفيذ للغاية؛ فهو يتطلب قدرًا كبيرًا من
00:16:36التخزين، وعليك التأكد من امتلاكك للإذن لاستخدام البيانات التي تعالجها
00:16:40بهذه الطريقة، كما يتطلب كمية هائلة من القوة الحوسبية وعليك نقل كل هذه المعلومات. وإذا
00:16:46غيرت النموذج الأساسي، فيجب عليك تغيير نموذج المتكهن أيضًا. لكن عندما أتطلع نحو المستقبل،
00:16:51أعتقد بحق أن التكهن المستمر للأنظمة الضخمة جدًا سيكون تحسينًا يستحق
00:16:58العناء. ما الخطوة التالية في الاستنتاج؟ ما يلي هو رأي شخصي وتكهنات
00:17:06ومعلومات عامة، ولو كنت أعرف أي شيء من المقرر صدوره حقًا لما كنت قادرة على
00:17:11الحديث عنه. لذا هذا مجرد انطباعي عما أعتقد أنه سيحدث. لقد عاصرت
00:17:17ثلاث دورات للعتاد؛ مع إطلاق Ampere، وإطلاق Hopper، وإطلاق Blackwell، والأمر يستغرق دائمًا
00:17:23وقتًا بدءًا من شحن هذه الشرائح حتى تركيبها في مراكز البيانات وصولاً إلى تمكن
00:17:30حزمة البرمجيات بأكملها من الاستفادة الفعلية من قدراتها. لكن بعض الأشياء التي أنا
00:17:36تحمست لها تتضمن Rubin، حيث يبدو أن أداء NVFP4 سيكون ممتازًا،
00:17:44لذا كلما استطعنا اقتباس تقنيات من الاستنتاج المحلي واكتساب ثقة كبيرة في تشغيل
00:17:49النماذج بتنسيق بيانات NVFP4 هذا، كلما زادت قدرتنا على الاستفادة من الأداء
00:17:54المذهل لأنظمة Rubin القادمة. وأعتقد أن الفصل (Disaggregation) والتواصل على مستوى
00:18:00النظام بأسره سيكونان ذوي أهمية متزايدة، فنحن نرى مكاسب أولية ممتازة حقًا من فصل
00:18:05المعالج عن الذاكرة (PD disaggregation)، كما أن القدرة على نقل المعلومات مثل بيانات ذاكرة KV المؤقتة عبر النظام ستكون
00:18:12ذات أهمية متزايدة. وكما ذكرت، فإن موضوع التدريب من أجل الاستنتاج سيكون
00:18:17أمرًا يستمر في ترك تأثير كبير في هذا المجال مستقبلاً. لذا شكراً جزيلاً لكم جميعاً
00:18:25لحضور هذه المحادثة، أنا متواجدة على تويتر ولينكد إن، وأوزع كتباً مجانية.
00:18:32يمكنكم تنزيل نسخة PDF عبر رمز QR أو الحضور معي إلى جناح Base 10 للحصول على نسختكم المجانية من
00:18:37كتاب هندسة الاستنتاج (Inference Engineering). لدينا كمية كبيرة هناك، ربما تكفي الجميع، وإن لم تكفِ فسنطلب من
00:18:43كارير جلب المزيد من المكتب. لذا سأكون بالأسفل في جناح Base 10. شكراً جزيلاً لكم
00:18:48جميعاً وأتمنى لكم يوماً رائعاً.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video