Expert Parallelism
تعرف على كيفية توزيع التوازي الخبير لنماذج خليط الخبراء عبر وحدات معالجة الرسومات (GPUs)، مما يقلل من متطلبات الذاكرة مع موازنة التوجيه والاتصال والأداء.
التوازي الخبير هو تقنية الحوسبة الموزعة التي تضع خبراء مختلفين من نموذج مزيج الخبراء على وحدات معالجة رسومية أو مسرعات مختلفة. بدلاً من تخزين كل جهاز لكل خبير، يحتفظ كل جهاز بمجموعة فرعية. يقوم موجه متعلم بإرسال كل رمز إدخال إلى الخبراء المختارين، مما يُمكّن النماذج الكبيرة جداً من زيادة سعة المعلمات دون تنشيط كل معلمة لكل إدخال.
تنطبق التقنية بشكل خاص على هندسات مزيج الخبراء، وليس الشبكات العصبية الكثيفة العادية. وغالباً ما تُستخدم عند تدريب أو تقديم النماذج اللغوية الكبيرة ونماذج اللغة والرؤية التي تستهلك طبقات خبرائها ذاكرة كبيرة جداً على جهاز واحد.
كيف يعمل التوازي الخبير#
تحتوي طبقة مزيج الخبراء على عدة شبكات خبيرة، وعادةً ما تكون شبكات عصبية تغذية أمامية، بالإضافة إلى موجه. لكل رمز، ينتج الموجه درجات ويختار عدداً صغيراً من الخبراء، والذي يُعرف غالباً بالتوجيه العلوي-k.
في طبقة مكونة من ثمانية خبراء موزعة عبر أربعة وحدات معالجة رسومية، على سبيل المثال، قد يخزن كل وحدة معالجة رسومية خبيرين. تتبع المعالجة بعد ذلك أربع خطوط رئيسية:
- يختار الموجه الخبراء لكل رمز.
- يتم تبادل الرموز بين وحدات المعالجة الرسومية بحيث تصل إلى الأجهزة التي تحوي هؤلاء الخبراء.
- يعالج كل خبير رموزه المخصصة محلياً.
- تعود النتائج إلى مواقع الرموز الأصلية وتستمر عبر النموذج.
يعتمد هذا التبادل عادةً على الاتصال الشامل بين الجميع، وهي عملية جماعية موصوفة في توثيق العمليات الجماعية لـ NVIDIA NCCL. يوضح دليل توازي جسر NVIDIA Megatron كيف يحدد عدد الخبراء وحجم التوازي الخبير عدد الخبراء الموضوعين على كل وحدة معالجة رسومية.
يوفر التوازي الخبير ذاكرة لكل جهاز لأن أوزان الخبراء مقسمة. ومع ذلك، فهو لا يلغي تكاليف الحوسبة أو الاتصال: فقد تعبر الرموز حدود الجهاز أو عقدة الشبكة عند كل طبقة مزيج الخبراء.
التوازي الخبير مقابل التقنيات ذات الصلة#
التوازي الخبير هو شكل من أشكال التدريب الموزع، لكنه يقسم النموذج بشكل مختلف عن الاستراتيجيات الأخرى:
- توازي البيانات: يخزن كل جهاز نسخة نموذج كاملة ويعالج دفعة مختلفة. تتم مزامنة التدرجات بين النسخ المتطابقة، كما هو موضح في نظرة عامة على التدريب الموزع في PyTorch. يكون هذا فعالاً عندما يتناسب النموذج الكامل مع كل جهاز.
- توازي التنسور: يتم تقسيم مصفوفات الأوزان الفردية والعمليات الرياضية داخل الطبقة عبر الأجهزة. بدلاً من ذلك، يعين التوازي الخبير خبراء كاملين للأجهزة.
- توازي خط الأنابيب: تعمل مجموعات الطبقات المتتالية على أجهزة مختلفة، مع تدفق الدفعات الدقيقة عبرها كمراحل خط أنابيب.
- توازي السياق: يتم تقسيم تسلسلات الإدخال الطويلة عبر الأجهزة لتقليل متطلبات ذاكرة التنشيط.
- توازي تنسور الخبراء: يتم توزيع الخبراء عبر الأجهزة، ويتم تجزئة كل خبير فردي أيضاً ك تنسور. يمكن لهذا النهج الهجين أن يتسع لخبراء أكبر ولكنه يفرض اتصالات إضافية.
هذه النهج متكاملة. قد تجمع أنظمة مزيج الخبراء الكبيرة بين التوازي الخبير والبيانات والتنسور وخط الأنابيب والسياق وفقاً لحجم النموذج وتوبولوجيا الأجهزة.
التطبيقات الواقعية#
المساعدون متعددوا اللغات واسعو النطاق: قد يحتوي نموذج لغة مزيج الخبراء على العديد من شبكات الخبراء مع تنشيط عدد قليل فقط لكل رمز. يوزع التوازي الخبير تلك الشبكات عبر مجموعة خدمة، مما يسمح للنظام بالحفاظ على سعة نموذج عالية دون تحميل كل خبير على كل وحدة معالجة رسومية. تدعم بيئات التشغيل الإنتاجية مثل نشر توازي الخبراء في vLLM وتوازي الخبراء في TensorRT-LLM هذا النوع من تخطيط الاستدلال.
تحليل المحتوى متعدد الوسائط: يمكن لنموذج مزيج الخبراء الكبير الذي يعالج رقع الصور ورموز النص توجيه المدخلات عبر خبراء مختارين موزعين عبر مسرعات متعددة. يمكن أن يدعم هذا فهم المستندات، والإجابة على الأسئلة المرئية، وغيرها من خدمات الذكاء الاصطناعي متعدد الوسائط مع الحفاظ على إمكانية إدارة ذاكرة الخبراء لكل جهاز. ينطبق نفس المبدأ على محولات الرؤية الكبيرة متناثرة النطاق، على الرغم من أن معظم نماذج الرؤية المضغوطة في الوقت الفعلي لا تتطلب ذلك.
الفوائد، والاختناقات، والإرشادات العملية#
يوفر التوازي الخبير ثلاث مزايا رئيسية: تقليل ذاكرة أوزان الخبراء لكل وحدة معالجة رسومية، ودعم النماذج ذات السعة الكلية الأكبر، والحوسبة المتناثرة الفعالة عندما يتنشيط عدد قليل فقط من الخبراء لكل رمز. يوضح دليل توازي الخبراء في Amazon SageMaker كيف يتحكم بدرجة توازي الخبراء في التوزيع عبر المجموعة.
تتمثل التحديات الرئيسية في عدم اتزان الحمل. إذا أرسل الموجه رموزاً كثيرة جداً إلى خبير واحد، تصبح وحدة المعالجة الرسومية الخاصة بهذا الخبير متخلفة بينما ينتظر الآخرون. تشمل العواقب انخفاض الإنتاجية، وعدم استقرار زمن الوصول، وإمكانية إسقاط الرموز عند محدودية سعة الخبراء. يجب على المهندسين مراقبة الرموز لكل خبير، وتوازن التوجيه، ووقت الاتصال، واستخدام الذاكرة، وزمن الوصول من البداية إلى النهاية. يمكن للوصلات البينية عالية النطاق والتداخل بين الاتصال والحوسبة تقليل عبء النقل.
التوازي الخبير غير ضروري عند استخدام نموذج كثيف مثل Ultralytics YOLO26. يستخدم تدريب Ultralytics YOLO متعدد وحدات المعالجة الرسومية توازي البيانات الموزع بدلاً من ذلك:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Two-GPU YOLO training uses data parallelism, not expert parallelism.
results = model.train(
data="coco8.yaml",
epochs=10,
imgsz=640,
device=[0, 1],
)يكرر سير العمل هذا YOLO26 عبر وحدتي معالجة رسومية ويقسم دفعات التدريب بينهما؛ وهو لا يوجه المدخلات بين شبكات الخبراء. يمكن للفرق أيضاً استخدام تدريب سحابة Ultralytics Platform لإدارة مجموعات بيانات الرؤية، والتدريب، والمقاييس، والتصدير، والنشر دون تكوين البنية التحتية الموزعة يدوياً.









