Distributed Training
استكشف كيف يقوم التدريب الموزع (distributed training) بتوسيع نطاق أعباء عمل الذكاء الاصطناعي عبر وحدات GPU متعددة. تعلم كيفية تسريع تدريب Ultralytics YOLO26 باستخدام DDP للحصول على نتائج أسرع وأكثر دقة.
التدريب الموزع هو أريقة في التعلم الآلي حيث يتم تقسيم عبء عمل تدريب النموذج عبر معالجات أو أجهزة متعددة. هذا النهج أساسي للتعامل مع مجموعات البيانات واسعة النطاق وهى القائمات العصبية المعقدة التي قد تستغرق وقتاً غير عملي للتدريب على جهاز واحد. من خلال الاستفادة من القوة الحاسوبية المجتمعة لوحدات Graphics Processing Units (GPUs) أو وحدات معالجة التنسور (TPUs)، يعمل التدريب الموزع على تسريع دورة التطوير بشكل كبير، مما يتيح للباحثين والمهندسين التكرار بشكل أسرع وتحقيق accuracy أعلى في نماذجهم.
كيف يعمل التدريب الموزع#
الفكرة الأساسية وراء التدريب الموزع هي التوازي. بدلاً من معالجة البيانات بشكل تسلسلي على شريحة واحدة، يتم تقسيم المهمة إلى أجزاء أصغر تتم معالجتها في وقت واحد. هناك استراتيجيتان أساسيتان لتحقيق ذلك:
- Data Parallelism: هذا هو النهج الأكثر شيوعاً لمهام مثل object detection. في هذا الإعداد، يتم وضع نسخة من النموذج بأكمله على كل جهاز. يتم تقسيم training data العامة إلى دفعات أصغر، ويعالج كل جهاز دفعة مختلفة في نفس الوقت. بعد كل خطوة، تتم مزامنة التدرجات (التحديثات للنموذج) عبر جميع الأجهزة لضمان بقاء model weights متسقة.
- Model Parallelism: عندما تكون neural network (NN) أكبر من أن تتسع في ذاكرة GPU واحد، يتم تقسيم النموذج نفسه عبر أجهزة متعددة. توجد طبقات أو مكونات مختلفة للنموذج على رقاقات مختلفة، وتتدفق البيانات فيما بينها. غالباً ما يكون هذا ضرورياً لتدريب foundation models الضخمة وLarge Language Models (LLMs).
تطبيقات العالم الحقيقي#
لقد أحدث التدريب الموزع تحولاً في الصناعات من خلال جعل من الممكن حل المشكلات التي كانت في السابق مستحيلة من الناحية الحسابية.
- القيادة الذاتية: يتطلب تطوير autonomous vehicles الآمنة تحليل بيتابايت من بيانات الفيديو والاستشعار. يستخدم مهندسو السيارات مجموعات موزعة ضخمة لتدريب نماذج الرؤية من أجل semantic segmentation في الوقت الفعلي واكتشاف المسارات. يضمن هذا النطاق الهائل أن أنظمة AI in automotive يمكنها التفاعل بشكل موثوق مع ظروف الطرق المتنوعة.
- التصوير الطبي: في قطاع الرعاية الصحية، يتطلب تحليل عمليات المسح ثلاثية الأبعاد عالية الدقة مثل الرنين المغناطيسي ذاكرة كبيرة وقوة معالجة. يتيح التدريب الموزع للباحثين بناء أدوات تشخيص عالية الأداء من أجل tumor detection والمهام الحرجة الأخرى. من خلال استخدام أطر عمل مثل NVIDIA MONAI، يمكن للمستشفيات تدريب النماذج على مجموعات بيانات متنوعة دون مواجهة عقبات الذاكرة، مما يحسن نتائج AI in healthcare.
استخدام التدريب الموزع مع Ultralytics#
مكتبة ultralytics تجعل من السهل تنفيذ تدريب التوازي الموزع للبيانات (DDP). يمكنك توسيع نطاق تدريب نماذج YOLO26 الحديثة عبر وحدات GPU متعددة ببساطة عن طريق تحديد مؤشرات الجهاز في وسائط التدريب الخاصة بك.
from ultralytics import YOLO
# Load a pre-trained YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model using two GPUs (device 0 and 1)
# The library automatically handles the DDP communication backend
results = model.train(data="coco8.yaml", epochs=100, device=[0, 1])المفاهيم والمقارنات ذات الصلة#
من المفيد تمييز التدريب الموزع عن المصطلحات المشابهة في نظام التعلم الآلي لفهم أدوارها المحددة:
- مقابل التعلم المهاجر: بينما يتضمن كلاهما أجهزة متعددة، فإن أهدافهما تختلف. عادة ما يقوم التدريب الموزع بمركزة البيانات في مجموعة عالية الأداء لتحقيق أقصى سرعة. في المقابل، يحافظ federated learning على لامركزية البيانات على أجهزة المستخدمين (مثل الهواتف الذكية) لإعطاء الأولوية لـ data privacy، وتحديث النموذج العالمي دون مغادرة البيانات الخام للمصدر أبداً.
- مقابل الحوسبة عالية الأداء (HPC): الحوسبة عالية الأداء هي مجال واسع يتضمن الحوسبة الفائقة للمحاكاة العلمية مثل التنبؤ بالطقس. التدريب الموزع هو تطبيق محدد للحوسبة عالية الأداء يتم تطبيقه على optimization algorithms في التعلم العميق. وغالباً ما يعتمد على مكتبات اتصال متخصصة مثل NVIDIA NCCL لتقليل زمن الوصول بين وحدات GPU.
التوسع مع منصات السحابة#
يمكن أن تكون إدارة البنية التحتية للتدريب الموزع معقدة. تعمل المنصات الحديثة على تبسيط ذلك من خلال توفر بيئات مُدارة. على سبيل المثال، تتيح Ultralytics Platform للمستخدمين إدارة مجموعات البيانات وبدء تشغيل عمليات التدريب التي يمكن نشرها في بيئات السحابة أو المجموعات المحلية. يعمل هذا التكامل على تبسيط سير العمل من data annotation إلى model deployment النهائي، مما يضمن أن التوسع إلى وحدات GPU متعددة يتم بسلاسة قدر الإمكان. وبالمثل، توفر مزودات الخدمات السحابية مثل Google Cloud Vertex AI وAmazon SageMaker بنية تحتية قوية لتشغيل مهام التدريب الموزعة على نطاق المؤسسات.






