ما الجديد في هندسة الاستنتاج البرمجي؟ — فيليب كيلي، باسينتن

AAI Engineer
Computing/SoftwareInternet Technology

Transcript

00:00:00أنا هنا لأتحدث عما هو جديد في هندسة الاستنتاج، مرحبًا أنا فيليب، وأنا هنا لأنني
00:00:19ألّفتُ كتابًا. هذه سنتي الثالثة في المعرض العالمي لمهندسي الذكاء الاصطناعي، وهذا هو مؤتمري
00:00:24المفضل في العالم أجمع. إنه الحدث الأبرز في أجندتي كل عام. لقد كانت
00:00:29بدايتي الحقيقية كمتحدث وكمهندس هنا في عام 2024، وعدتُ في عام 2025 وقدمتُ الكثير من الأشياء،
00:00:36وها أنا هنا مجددًا. أعشق هذا المكان وأنا ممتن جدًا للمنظمين لاستضافتي دائمًا. لقد ألّفتُ هذا
00:00:44الكتاب بعنوان "هندسة الاستنتاج"، وقمنا بنشره منذ ثلاثة أو أربعة أشهر، وقد أذهلتني حقًا
00:00:49ردود الأفعال. لقد حققنا أكثر من... قمت بنشره في 23 فبراير، وحتى هذه اللحظة
00:00:57وزّعنا أكثر من 11,000 نسخة ورقية، ونقترب من 30,000 نسخة رقمية، و24 مليون
00:01:04شخص حول العالم، أو 24 مليون حساب على تويتر — وسنرى كم عدد الأشخاص الحقيقيين خلف ذلك —
00:01:09قد شاهدوا محتوى متعلقًا بهندسة الاستنتاج. ومع كل هذا الترحيب الرائع، كان هناك
00:01:17سؤال واحد يطرحه عليّ الناس باستمرار: لماذا قد تفعل هذا بحق السماء؟ أعني لماذا
00:01:23قد تؤلف كتابًا عن مجال يتغير بهذه السرعة؟ حسنًا، أنا أعتقد أن العديد من
00:01:29مبادئ هندسة الاستنتاج قد أصبحت راسخة تمامًا في هذه المرحلة، وهناك الكثير مما يمكننا
00:01:34تعلمه وتكراره عبر أجيال متتالية من النماذج. لكنني هنا اليوم لأتحدث عن
00:01:42ما هو جديد في هندسة الاستنتاج. الملحق العلمي العلني الأول الذي يضم كافة المعلومات الجديدة منذ صدور الكتاب.
00:01:48سنراجع مبادئ هندسة الاستنتاج قليلًا، ثم سنتحدث
00:01:54عن كل ما حدث منذ 23 فبراير 2026 في عالم الاستنتاج. سنتحدث
00:02:00عما حدث لتقنية TurboQuant، وعن ضغط الـ KV، وسنقضي الكثير من
00:02:05الوقت في الحديث عن dFlash وبعض التطورات المثيرة في فك الترميز التخميني، ثم سأقوم
00:02:12ببعض التكهنات والتوقعات لمستقبل الاستنتاج في الفترة القادمة
00:02:17وعن الأمور التي أتحمس للتحدث عنها في المرة القادمة التي ترونني فيها هنا.
00:02:23رائع، لنبدأ إذن. أحد الأمور التي لاحظتها الآن من خلال
00:02:30محادثات لا حصر لها مع الأشخاص حول الاستنتاج، هو وجود مجموعة من المبادئ المشتركة. وأحد
00:02:38أبرز هذه المبادئ ناقشته في بودكاست منذ أيام مع سارة حول الاستنتاج،
00:02:44حيث تبين وجود نوعين رئيسيين من هندسة الاستنتاج: هناك الاستنتاج المحلي
00:02:48حيث تتمثل الاستراتيجية الأساسية في مجرد تشغيله على أي عتاد متاح لديك عبر
00:02:56ضغط النموذج بالتقطير أو التكميم أو التقليم بأي طريقة ممكنة، وتوزيعه على أي
00:03:02معالجات رسومية تملكها في منزلك. أولاً تجعله يعمل، ثم تحاول جعله أقل غباءً عبر إصلاح
00:03:09أي مشاكل كارثية تسبب بها كل هذا الضغط، ومحاولة
00:03:15إعادته لمستوى الذكاء الأساسي أثناء التشغيل بحجم دفعة يساوي 1. ثم هناك عالمي أنا،
00:03:20وهو عالم مراكز البيانات وحجم الدفعات الكبيرة، حيث الهدف هو تشغيله منذ اليوم الأول،
00:03:27بناء بيئة vLLM وتشغيلها، ثم جعلها أقل بطئًا عبر تقنيات مثل التوجيه المعتمد على KV والتخمين
00:03:33وفصل المكونات. وأعتقد أن بين هذين العالمين الكثير مما يمكننا تعلمه من بعضنا البعض.
00:03:40سأركز في هذا العرض على التطورات في هندسة الاستنتاج الخاصة بمراكز البيانات لأن
00:03:46هذا هو مجالي، لكن هناك أيضًا تطورات رائعة جدًا في العالم المحلي.
00:03:52في كتاب "هندسة الاستنتاج" أفترض عمومًا أن أوزان النموذج هي منتج نهائي،
00:03:58وأعتقد أن مرحلة التسليم من التدريب إلى الاستنتاج مهمة جدًا ويجب مراعاتها، وهي طريقة جيدة
00:04:03لتحديد معالم هذا المجال. ومع ذلك، ما لاحظته مؤخرًا بشكل متزايد هو أن العديد
00:04:10من تحسينات الاستنتاج تأتي من عملية تدريب مخصصة له، وبالتالي فإن الحدود بين التدريب
00:04:17والاستنتاج أصبحت ضبابية أكثر فأكثر، وهناك أمر مثير للاهتمام ينبغي تذكره.
00:04:22فنحن نشهد حلقة حيث تحصل على استنتاج أسرع مما يمنحك بيانات أكثر لتدريب
00:04:28نموذج أفضل، والذي بدور يمنحك استنتاجًا أسرع وبيانات أكثر، وتستمر في هذه الحلقة
00:04:33حتى تصبح ثريًا للغاية. إذن في مجال التدريب المخصص للاستنتاج، لدينا مجموعة من
00:04:39التقنيات الجديدة لنناقشها عبر ما أحب تسميته "الثلاثة الكبار". سنتحدث عن
00:04:45جديد التكميم، وجديد التخزين المؤقت وتحديدًا آلية ذاكرة التخزين المؤقت KV، وبعض
00:04:52الأخبار في التخمين. ورغم وجود الكثير من الأمور الأخرى في عالم الاستنتاج
00:04:57بما في ذلك بعض الأشياء التي سأتحدث عنها في النهاية، فعندما يتعلق الأمر بالعمل اليومي والعملي
00:05:02لتسريع نموذج معين، تكون هذه التقنيات الثلاث هي ما يلجأ إليه المهندسون عادةً.
00:05:09أول شيء، قمت بنشر كتابي في فبراير، وكنت أشعر بشعور رائع وأقول لنفسي: "يا للياروعة!
00:05:16كل ما تحتاج معرفته عن الاستنتاج في مكان واحد". ثم ظهرت بعض الأخبار الجديدة في
00:05:23عالم التكميم. وكمراجعة سريعة، التكميم هو استخدام تنسيق أرقام أصغر وأقل دقة
00:05:32لتوفير النطاق الترددي والحوسبة، وتحسين زمن التوليد للرمز الأول وسرعة التوليد. وهو غالبًا ما يكون
00:05:39مرتبطًا بالعتاد، ويوفر في التكاليف لكنه قد يقلل جودة النموذج قليلاً.
00:05:45وبالمناسبة، إذا أردتم سماع رأيي المفصل في التكميم، فقد ألقيت كلمة في مؤتمر AI Engineer
00:05:51في ميامي الشهر الماضي حول كيف أن التكميم ليس بالضرورة سيئًا كما يبدو، وأن هناك
00:05:57العديد من الأشياء التي يمكنك القيام بها للحفاظ على الجودة خلال هذه العملية. لذلك كنت راضيًا عن تناولي
00:06:04لموضوع التكميم، ثم شاهد 20 مليون شخص تقنية TurboQuant، والتي تسببت في هبوط أسهم الذاكرة
00:06:12لفترة وجيزة لأن الجميع ظنوا أن استخدام الذاكرة سيكون أكثر كفاءة بكثير
00:06:16الآن ولن نعد بحاجة إلى المزيد من ذاكرة الـ Flash، وهو ما كان خطأً. لكن على أي حال، كان هذا نهجًا
00:06:23جديدًا في التكميم انتشر في مارس من هذا العام، يعتمد على الإحداثيات القطبية
00:06:29للتكميم ويسمح بتكميم ذاكرة KV التخزينية إلى 4 بت فقط. وكان الأمر رائداً جداً، وقلت لنفسي:
00:06:36"يا إلهي، لقد أغفلتُ هذا الموضوع بأكمله! كيف سيبدو المشهد الآن؟"
00:06:43قام فريقنا بإجراء الكثير من الأبحاث حول هذا الموضوع. تحية خاصة لعلي،
00:06:50المتدرب من جامعة ووترلو على تويتر، وهو من فريق أداء النماذج لدينا — ولا أعلم إن كان لا يزال متدربًا في الواقع —
00:06:57لكنه من ووترلو على أي حال. لقد كتب مقالاً رائعًا عن الرياضيات خلف TurboQuant.
00:07:04والفائدة الأساسية التي تحصل عليها من TurboQuant هي تمثيل ذاكرة KV التخزينية بأربعة
00:07:09بتات بدلاً من ثمانية، فتُوفّر نصف المساحة ونصف نطاق التردد وتضاعف فعليًا
00:07:14سرعة نقل ذاكرة KV داخل ذاكرة النظام. ولكن العيب كبير جدًا
00:07:21في TurboQuant؛ إذ يتبين أنك بحاجة إلى عمليات حسابية إضافية في التمرير الأمامي
00:07:25لمراعاة ذلك أثناء فك الترميز، مما يقلل عدد الرموز في الثانية بأكثر من النصف، وهذه مقايضة غير مقبولة
00:07:32لكثير من حالات الاستخدام الفعلي. لذا ألقينا نظرة جادة على TurboQuant ولكننا لا نستخدمها
00:07:38في أحمال العمل الحقيقية، وما زلنا نعتمد تكميم NVFP4 التقليدي.
00:07:44ومع ذلك، فهي تقنية ممتازة للاستنتاج المحلي. فإذا كنت تشغل نموذجًا،
00:07:51خاصة نماذج اللغات ذات السياق الطويل، على جهازك الشخصي أو على معالجات في قبو منزلك،
00:07:58فإن حجم الذاكرة لديك محدود جدًا وهو العائق الأول. وبالتالي، أي شيء يمكنه تفريغ الذاكرة
00:08:04من ذاكرة KV التخزينية ويسمح لك بمعالجة تسلسلات أطول سيكون قيمًا للغاية،
00:08:09وستكون الحوسبة الإضافية في التمرير الأمامي عيبًا أقل تأثيرًا.
00:08:16لذا تبقى TurboQuant ورقة بحثية ممتازة وتقنية رائعة للغاية، لكنها لم تكن
00:08:22قابلة للتطبيق في عالم استنتاج مراكز البيانات كما بدت في البداية. وبدلاً من ذلك، نركز
00:08:28على NVFP4 مع التركيز على تكميم الأوزان بدلاً من ذاكرة KV، وإبذال قصارى جهدنا
00:08:36لمعالجة الحواف الحادة في الأوزان المكممة، والتأكد من عدم تفريغ التوزيعات الاحتمالية
00:08:41لذاكرة KV نفسها، والتركيز بدلاً من ذلك على التوجيه المعتمد على KV، وتفريغ KV، ومشاركة KV
00:08:49باستخدام NCCL وNVIDIA Dynamo وأدوات أخرى لنقل ذاكرة KV عبر
00:08:55النظام وتفريغها محتملًا إلى الذاكرة العادية للمعالج وغيرها، بدلاً من محاولة استخدام TurboQuant
00:09:04لضغطها. ونركز أيضًا على التكميم عبر الوسائط المتعددة، مثل
00:09:11التفكير في كيفية تطبيق ميزات NVFP4 ليس فقط على النماذج اللغوية بل أيضًا على نماذج الصور
00:09:17والفيديو. علي كتب الكثير من التغريدات الرائعة عن ذلك على تويتر وأنصحكم بالاطلاع عليها.
00:09:23مع ذلك، تظل ذاكرة KV مهمة جدًا، ولنتحدث عنها وعن ضغط KV.
00:09:29مراجعة سريعة أخرى: في ذاكرة KV، إذا أدخلت الموجه نفسه بنفس البادئة، يمكنك إعادة استخدام
00:09:35الرموز التي حُسبت في مرحلة التعبئة الأولية سابقًا، مما يجعل نظامك أسرع وأكثر كفاءة.
00:09:42بشكل عام، ذاكرة KV هي ذاكرة غير مبددة للمعلومات. وهناك مصادر قليلة فقط للذاكرة غير المبددة
00:09:48عندما نفكر في نظام الاستنتاج لدينا: محتوى الموجه، السياق، وذاكرة KV
00:09:55وهي تتزايد خطيًا مع كمية البيانات التي تدخلها. وإذا فكرت في
00:09:59أطوال تسلسل تصل لمليون رمز، فإن ذلك يصبح ضخمًا حقًا. لذا يفكر الكثيرون في
00:10:05كيفية ضغط الذاكرة والسياق. فمنصات الوكلاء تضغط السياق، واسترجاع RAG،
00:10:11وكل هذه التقنيات التي تحدثنا عنها لسنوات هي نوع من ضغط السياق
00:10:17الأكبر إلى شيء يمكنك إعطاؤه للنموذج أو كتابته في ملفات. كل هذه الأمور
00:10:22تتزايد بنسبة أقل من الخطية مقارنة بكمية البيانات لديك. لكن ماذا لو كان هناك حل وسط؟ ماذا لو كان هناك
00:10:28أسلوب يتيح لك ضغط قدر كبير من البيانات التي تتذكرها مع الاحتفاظ المكتمل تقريبًا
00:10:34بالمعلومات؟ لدينا طرق عديدة للتفكير فيما ينبغي الاحتفاظ به
00:10:41في الذاكرة المؤقتة. أظهرت أساليب الضغط الحديثة أنه يمكننا استبدال الذاكرة المؤقتة بأخرى أقصر بكثير.
00:10:47قصيرة جدًا، ولدينا أوراق بحثية مثل "مطابقة الانتباه" (Attention Matching) وCartridges التي قدمت نتائج واعدة جدًا
00:10:53هنا بنسب ضغط عالية، لكن كلاهما يعمل في وقت الاستنتاج. ومرة أخرى، إحدى التقنيات
00:11:00التي أريد التحدث عنها أو أحد الموضوعات الرئيسة التي أريد تناولها هي التدريب من أجل الاستنتاج. لذا في هذه الحالة،
00:11:05أود تقديم شيء يُدعى STILL من فريق أبحاث Base 10، حيث يتم تركيب وبناء التجميع
00:11:12فوق الذاكرة المؤقتة، إذ نحتفظ بتمثيل مُتعلَّم للمعلومات بدلاً من الاحتفاظ بالمعلومات
00:11:17مباشرةً أو مجموعة فرعية حتمية منها، ويتم توزيع تكلفتها عبر التدريب. لذا فإن تشارلي وموديث من
00:11:25فريق ما بعد التدريب لدينا قدما عرضًا توضيحيًا رائعًا للغاية في حدث Coda Compile مؤخرًا، وهو متاح على يوتيوب.
00:11:31أشجعكم على إلقاء نظرة عليه إذا كنتم مهتمين بالتعرف على ضغط الذاكرة المؤقتة (KV compaction).
00:11:37للأسف لا أملك الوقت الكافي ولا عبقرية الشرح لشرح كل شيء هنا، لكن العبقرية أو الآلية الأساسية
00:11:46هي أن STILL يعمل كاختناق إدراكي (Perceiver bottleneck) يأخذ مجموعة ثابتة من متجهات الاستعلام المتعلمة ويجري انتباهاً متقاطعاً
00:11:53مع ذاكرة KV المؤقتة الكاملة وينتج مجموعة من المفاتيح والقيم المضغوطة في التمريرة الأمامية الواحدة.
00:11:59هذا يخلق ذاكرة مضغوطة وسريعة وقابلة للتفاضل يمكن للنموذج اللغوي الكبير الانتباه إليها كما لو كانت سياقًا حقيقيًا.
00:12:05لذا إذا كنتم مهتمين بضغط الذاكرة المؤقتة KV، فاطلعوا بالتأكيد على عمل تشارلي وموديث.
00:12:09لقد كان التعلم عنه أمرًا رائعًا بحق. إذن هاتان تقنيتان من التقنيات التي تحدثنا عنها،
00:12:16تحدثنا عن التكميم وتحدثنا عن التخزين المؤقت، والتقنية الأخيرة هي التكهن (Speculation)، وقد كان هناك الكثير من التغيير
00:12:21هنا. كمراجعة، في فك الترميز التكهني (Speculative decoding) سنستخدم رمزية مسودة وسنتحقق منها
00:12:29أثناء التمريرة الأمامية، وسنستخدم ذلك لتوليد أكثر من رمز واحد في كل تمريرة أمامية.
00:12:34هذا يساعد كثيرًا في زيادة عدد الرمزيات في الثانية، وهو تحسين بلا أي فقدان للمعلومات، وهو أمر ممتاز لأننا
00:12:40لا نضطر للقلق بشأن الجودة على الإطلاق. الآن في تاريخ التكهن، بدأنا
00:12:46بفك الترميز التكهني، وكل هذه الأساليب موجودة في الكتاب، حيث يتوفر لديك SpecDec إذ تستخدم نموذجًا صغيرًا من
00:12:52العائلة نفسها لتوليد رمزيات المسودة، وتبين أن النماذج الصغيرة ليست ممتازة جدًا في توليد رمزيات المسودة،
00:12:58إنها مجرد نماذج صغيرة جيدة. لذا ابتكرنا في المجال الصناعي مجموعة من الطرق الجديدة مثل Medusa حيث
00:13:04ربما تضيف فقط رؤوس فك ترميز للنموذج، وصولًا إلى Eagle 3 الذي كان ينص على: ماذا لو
00:13:09بدلًا من استخدام نموذج ضئيل من العائلة نفسها، نُدرّب نموذجًا بمليار معامل على
00:13:15الحالات الخفية للنموذج المستهدف لتوليد رمزيات المسودة؟ وقد عمل ذلك بالفعل بشكل ممتاز، ولهذا
00:13:21حتى شهر فبراير من العام الماضي أو فبراير من هذا العام تقريبًا، كان Eagle 3 هو أفضل طريقة في
00:13:27مجال التكهن. أما الآن لدينا DFlash، وDFlash أفضل بكثير؛ إنه انتشار للتكهن (Diffusion for speculation)، حيث ينشئ DFlash
00:13:36سلسلة من رمزيات المسودة بدلاً من رمز واحد. فالنموذج عبارة عن نموذج انتشار لغوي، مما
00:13:43يعني أنه يخلق تسلسلًا كاملًا من الرمزيات بالطريقة نفسها التي ينشئ بها توليد الفيديو أو الصور
00:13:49تسلسلًا من الإطارات أو البكسلات ويتكرر عليها، بدلاً من إجراء توليد تراجعي تلقائي للرمزيات.
00:13:55قد تكون نماذج DFlash أبطأ مرتين أو أربع مرات في التشغيل، لكنها ستتنبأ بـ 8
00:14:01أو 16 رمزية دفعة واحدة في تلك النافذة، بينما يقدم Eagle رمزية واحدة فقط في كل مرة. لذا فإن تمريرة أماميّة
00:14:08واحدة من DFlash أسرع من مرحلة المسودة الكاملة لـ Eagle وتتنبأ بالمزيد من الرمزيات. وهذه الرمزيات قادرة
00:14:14على تبادل الانتباه المتقاطع مع بعضها البعض، وتحقق عمومًا معدل قبول أعلى، لأن معدل القبول في التكهن
00:14:21هو كل شيء. لذا في بيئة العمل الحقيقية، نرى تحسنًا بأكثر من 3 أضعاف بفضل DFlash، وهذا مقاس باستعمال
00:14:30وحدة B200 واحدة ونموذج Qwen38B، ويمكننا رؤية ذلك مقابل Eagle حيث توجد زيادة جوهرية في الرمزيات، سواء في
00:14:40معدل قبول الرمزيات أو في الرمزيات لكل ثانية. وتدرب نماذج DFlash هذه باستخدام قناع انتباه لـ
00:14:47الصياغة ثنائية الاتجاه، حيث يوفر النموذج المستهدف السياق، وداخل كل كتلة
00:14:54سيكون لدينا مجموعة فرعية من الرمزيات النظيفة التي يتم أخذ عينات منها، وسيفرض قناع الانتباه
00:14:59الاتساق السببي، ولكنه سيظل يسمح بانتباه ثنائي الاتجاه، بينما في
00:15:06النموذج التراجعي التلقائي التقليدي تنظر فقط إلى الرمزيات في اتجاه واحد. ولهذا السبب نحن قادرون على
00:15:13الاستفادة من هذه المعمارية القائمة على الانتشار. ثم فكرت أنني قد
00:15:19انتهيت، ولكن قبل بضعة أيام ظهر DSpark. الآن لدينا DFlash يعمل في بيئة الإنتاج الفعلية،
00:15:25بينما DSpark بحث جديد، لذا في الأساس يمكنني فقط القول بخصوصه: "إنه موجود وهو رائع ونحن
00:15:31ندرسه". الفرق بينه وبين DFlash أنه ما زال يحتوي على نموذج الانتشار ذلك، ولكنه يقرنه أيضًا
00:15:38بنموذج تسلسلي، والفكرة هي أننا سنحسّن معدلات القبول عن طريق جعل هذين
00:15:45النموذجين يعملان معًا، بدلاً من وجود المُتكهِّن التكراري فحسب، أو مُتكهِّن
00:15:51الانتشار فقط، أو المُتكهِّن التراجعي التلقائي فقط. لذا فإن DSpark مثير جدًا للاهتمام، لكن ليس لدينا أي
00:15:57نتائج إنتاجية تخصه لمشاركتها بعد، وآمل أن نتوصل إليها في المرة القادمة.
00:16:03ما نملك نتائج إنتاجية بشأنه هو إعادة تدريب المُتكهِّن بشكل مستمر. وهنا عدنا
00:16:09إلى DFlash مرة أخرى، والفكرة هي أن فك الترميز التكهني يعتمد اعتمادًا كبيرًا على
00:16:15المحتوى الفعلي للموجهات والاستجابات التي تتعامل معها في نظامك، ولهذا السبب إذا كنت
00:16:21تعيد التدريب باستمرار على تلك الموجهات والاستجابات في نظامك الفعلي المباشر، يمكنك رؤية تحسن بنسبة 20% إلى ضعفين
00:16:29في معدلات قبول الرمزيات لديك. هذا في الواقع صعب التنفيذ للغاية؛ فهو يتطلب قدرًا كبيرًا من
00:16:36التخزين، وعليك التأكد من امتلاكك للإذن لاستخدام البيانات التي تعالجها
00:16:40بهذه الطريقة، كما يتطلب كمية هائلة من القوة الحوسبية وعليك نقل كل هذه المعلومات. وإذا
00:16:46غيرت النموذج الأساسي، فيجب عليك تغيير نموذج المتكهن أيضًا. لكن عندما أتطلع نحو المستقبل،
00:16:51أعتقد بحق أن التكهن المستمر للأنظمة الضخمة جدًا سيكون تحسينًا يستحق
00:16:58العناء. ما الخطوة التالية في الاستنتاج؟ ما يلي هو رأي شخصي وتكهنات
00:17:06ومعلومات عامة، ولو كنت أعرف أي شيء من المقرر صدوره حقًا لما كنت قادرة على
00:17:11الحديث عنه. لذا هذا مجرد انطباعي عما أعتقد أنه سيحدث. لقد عاصرت
00:17:17ثلاث دورات للعتاد؛ مع إطلاق Ampere، وإطلاق Hopper، وإطلاق Blackwell، والأمر يستغرق دائمًا
00:17:23وقتًا بدءًا من شحن هذه الشرائح حتى تركيبها في مراكز البيانات وصولاً إلى تمكن
00:17:30حزمة البرمجيات بأكملها من الاستفادة الفعلية من قدراتها. لكن بعض الأشياء التي أنا
00:17:36تحمست لها تتضمن Rubin، حيث يبدو أن أداء NVFP4 سيكون ممتازًا،
00:17:44لذا كلما استطعنا اقتباس تقنيات من الاستنتاج المحلي واكتساب ثقة كبيرة في تشغيل
00:17:49النماذج بتنسيق بيانات NVFP4 هذا، كلما زادت قدرتنا على الاستفادة من الأداء
00:17:54المذهل لأنظمة Rubin القادمة. وأعتقد أن الفصل (Disaggregation) والتواصل على مستوى
00:18:00النظام بأسره سيكونان ذوي أهمية متزايدة، فنحن نرى مكاسب أولية ممتازة حقًا من فصل
00:18:05المعالج عن الذاكرة (PD disaggregation)، كما أن القدرة على نقل المعلومات مثل بيانات ذاكرة KV المؤقتة عبر النظام ستكون
00:18:12ذات أهمية متزايدة. وكما ذكرت، فإن موضوع التدريب من أجل الاستنتاج سيكون
00:18:17أمرًا يستمر في ترك تأثير كبير في هذا المجال مستقبلاً. لذا شكراً جزيلاً لكم جميعاً
00:18:25لحضور هذه المحادثة، أنا متواجدة على تويتر ولينكد إن، وأوزع كتباً مجانية.
00:18:32يمكنكم تنزيل نسخة PDF عبر رمز QR أو الحضور معي إلى جناح Base 10 للحصول على نسختكم المجانية من
00:18:37كتاب هندسة الاستنتاج (Inference Engineering). لدينا كمية كبيرة هناك، ربما تكفي الجميع، وإن لم تكفِ فسنطلب من
00:18:43كارير جلب المزيد من المكتب. لذا سأكون بالأسفل في جناح Base 10. شكراً جزيلاً لكم
00:18:48جميعاً وأتمنى لكم يوماً رائعاً.

Key Takeaway

تتحول هندسة الاستنتاج لمراكز البيانات نحو تقنيات التدريب المخصص للاستنتاج، حيث تتصدر نماذج الانتشار مثل DFlash وضغط الذاكرة عبر STILL تحسين السرعة والكفاءة مقارنة بالأساليب التراجعية التقليدية.

Highlights

  • تجاوز توزيع كتاب هندسة الاستنتاج 11,000 نسخة ورقية ونحو 30,000 نسخة رقمية منذ نشره في 23 فبراير 2026.

  • تقنية TurboQuant تُمكّن من تكميم ذاكرة KV التخزينية إلى 4 بتات وتوفر نصف المساحة والنطاق الترددي، لكنها تُقلل الرموز الموّلدة في الثانية بأكثر من النصف بسبب الحسابات الإضافية.

  • تعتمد تقنية DFlash على نموذج انتشار لغوي يتنبأ بـ 8 أو 16 رمزية دفعة واحدة، مما يحقق تحسنًا يتجاوز 3 أضعاف في أداء الاستنتاج مقارنة بطريقة Eagle 3.

  • إعادة التدريب المستمر لنموذج المتكهن على الموجهات الاستجابات الفعلية للنظام ترفع معدلات قبول الرموز بنسبة تتراوح بين 20% و200%.

Timeline

مقدمة ومبادئ هندسة الاستنتاج

  • تتوزع هندسة الاستنتاج بين مسار محلي يهدف للتشغيل على العتاد المتاح، ومسار مراكز البيانات الذي يركز على أحجام الدفعات الكبيرة والسرعة.
  • تتلاشى الحدود الفاصلة بين مرحلتي التدريب والاستنتاج مع اعتماد التقنيات الحديثة على التدريب المخصص لتسريع الاستنتاج.
  • تتركز المعالجة العملية لتسريع النماذج في ثلاثة محاور رئيسية: التكميم، والتخزين المؤقت، والتخمين.

يركز الاستنتاج المحلي على تقليل حجم النموذج عبر التكميم والتقليم ليعمل على أجهزة ذات موارد محدودة بحجم دفعة يساوي 1. في المقابل، يعتمد استنتاج مراكز البيانات على بيئات مثل vLLM لتقليل البطء باستخدام التوجيه المعتمد على ذاكرة KV والتخمين وفصل المكونات. تخلق سرعة الاستنتاج حلقة تغذية راجعة توفر بيانات أكثر لتدريب نماذج أفضل بشكل مستمر.

تطورات التكميم وتقنية TurboQuant

  • تتيح تقنية TurboQuant ضغط ذاكرة KV إلى 4 بت باستعمال الإحداثيات القطبية لتوفير الذاكرة في الأنظمة المحلية.
  • تُبطئ الحوسبة الإضافية في التمرير الأمامي لتقنية TurboQuant عملية فك الترميز، مما يجعلها غير مناسبة لأحمال العمل المباشرة في مراكز البيانات.
  • يظل معيار NVFP4 مع التركيز على تكميم الأوزان الخيار الأفضل لتطبيقات مراكز البيانات والنماذج متعددة الوسائط.

تستهدف TurboQuant معالجة قيود الذاكرة في الأجهزة الشخصية والنماذج ذات السياق الطويل حيث تكون سعة الذاكرة هي العائق الرئيسي. تؤدي العمليات الحسابية الإضافية المطلوبة لتعديل التمرير الأمامي أثناء فك الترميز إلى خفض عدد الرموز المولدة في الثانية لأكثر من النصف. تستمر مراكز البيانات في اعتماد NVFP4 وتفريغ ذاكرة KV ونقلها باستخدام أدوات مثل NVIDIA Dynamo وNCCL.

ضغط ذاكرة KV وآلية STILL

  • تتزايد ذاكرة KV خطيًا مع طول السياق المدخل لتصل إلى أحجام ضخمة عند التعامل مع ملايين الرموز.
  • تستبدل تقنية STILL التمثيل المباشر للمعلومات بتمثيل مُتعلَّم ومضغوط عبر آلية اختناق إدراكي.
  • تنتج طريقة STILL مفاتيح وقيم مضغوطة قابلة للتفاضل في تمريرة أمامية واحدة.

تختلف تقنيات مثل Attention Matching وCartridges بكونها تعمل أثناء وقت الاستنتاج فقط، بينما تنقل تقنية STILL التكلفة الحسابية إلى مرحلة التدريب. يعمل الاختناق الإدراكي في STILL عبر أخذ متجهات استعلام متعلمة وإجراء انتباه متقاطع مع ذاكرة KV الكاملة. ينتج عن ذلك ذاكرة سريعة ومضغوطة يستطيع النموذج اللغوي الانتباه إليها كسياق حقيقي.

ابتكارات فك الترميز التكهني من Eagle إلى DFlash

  • تجاوزت تقنية DFlash القائمة على الانتشار حدود أسلوب Eagle 3 في توليد رمزيات المسودة.
  • تستعمل DFlash نموذج انتشار لغوي يتنبأ بسلسلة كاملة من 8 أو 16 رمزية في تمريرة واحدة بدلاً من التوليد التراجعي الفردي.
  • يحقق DFlash تسريعًا يتجاوز 3 أضعاف في بيئات الإنتاج على معالجات B200 ونماذج Qwen38B.

تعتمد DFlash على قناع انتباه ذي صياغة ثنائية الاتجاه يتيح للرمزيات تبادل الانتباه المتقاطع فيما بينها مع الحفاظ على الاتساق السببي. تتفوق التمريرة الواحدة في DFlash على مرحلة المسودة الكاملة لنظام Eagle وتوفر معدلات قبول أعلى للرموز. يدمج بحث DSpark الجديد بين نموذج الانتشار ونموذج تسلسلي لرفع معدلات القبول بشكل أكبر، بينما يرفع التدريب المستمر للمتكهن معدل القبول بنسبة تصل إلى ضعفين.

توقعات مستقبليّة لهندسة الاستنتاج والعتاد

  • يتطلب استغلال القدرات الكاملة للشرائح الجديدة مثل Rubin وقتًا لتكيف الحزمة البرمجية الكاملة مع العتاد.
  • يزيد الاعتماد على فصل المعالج عن الذاكرة والتواصل على مستوى النظام لتسهيل نقل بيانات KV.
  • تُسهم التطورات في صيغة NVFP4 والتدريب المخصص للاستنتاج في تشكيل الجيل القادم من معمارية الأنظمة.

تأخذ الاستفادة الملموسة من الأجيال الجديدة للشرائح وقتًا يبدأ من الشحن والتركيب حتى استيعاب البرمجيات لإمكانيات العتاد. يتيح نقل تقنيات NVFP4 من الاستنتاج المحلي إلى مراكز البيانات استغلال أداء معالجات Rubin المرتقبة. يظل فصل المعالجة عن الذاكرة ونقل البيانات عبر كامل أجزاء النظام العائق الأهم للارتقاء بكفاءة الاستنتاج.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video