Distributionally Robust Optimization
تعرف على كيفية تجهيز التحسين القائم على المتانة التوزيعية (DRO) لنماذج التعلم الآلي لتحولات البيانات المعقولة، واستكشف أمثلة عملية لرؤية الكمبيوتر ونصائح للتقييم.
التحسين القوي للتوزيعات (DRO) هو وسيلة لتدريب نموذج أو اتخاذ قرار عندما يكون توزيع الاحتمالات الكامن وراء بياناته غير مؤكد. بدلاً من التحسين بناءً على مثال التدريب المتوسط وحده، يأخذ التحسين القوي للتوزيعات في الاعتبار مجموعة من التوزيعات المعقولة ويسعى إلى إيجاد حل يعمل بشكل جيد في ظل التوزيع الأكثر تحدياً في تلك المجموعة. الحدس هنا عملي: إذا رصدت كاميرا لقطات في النهار أكثر بكثير من الليل أثناء التدريب، فقد يخفي الأداء المتوسط القوي النتائج الضعيفة بعد حلول الظلام.
كيف يعمل التحسين القوي للتوزيعات#
يعمل التدريب العادي على تقليل الخسارة المتوقعة: وهي العقوبة المتوسطة لأخطاء التنبؤ في ظل توزيع مفترض للبيانات. في التحسين القوي للتوزيعات، يتم تمثيل توزيع الواقع غير المعروف بواسطة مجموعة غموض - وهي مجموعة من التوزيعات التي تُعتبر معقولة بالنظر إلى البيانات المتاحة. بعد ذلك، يعمل التدريب على تقليل أعلى خسارة متوقعة بين التوزيعات في تلك المجموعة. يوفر هذا حماية ضد أنواع محددة من عدم اليقين، وليس ضد كل تغيير قد يواجهه النموذج.
تحدد مجموعة الغموض معنى كلمة "قوي". فقد تسمح بتغيير نسب المجموعات المعروفة، مثل وجود صور ليلية أكثر من صور نهارية. بدلاً من ذلك، يمكن أن تحتوي على توزيعات ضمن مسافة إحصائية مختارة من التوزيع المرصود. تقيس مسافة واسيرشتاين، تقريباً، مقدار كتلة الاحتمالات التي يجب نقلها والمسافة اللازمة لتحويل توزيع إلى آخر؛ وتقدم وثائق مسافة واسيرشتاين الخاصة بـ SciPy شرحاً بديهياً أحادي البعد. يوفر دليل كورنيل للتحسين القوي القائم على البيانات سياقاً إضافياً حول بناء وصف لعدم اليقين من البيانات.
تعد مجموعة الغموض الأكبر للتعامل مع المزيد من التغييرات ولكنها قد تضحي بالأداء في ظل الظروف النموذجية. أما المجموعة الصغيرة جداً فقد تفخط التحولات المهمة. لذلك يتطلب اختيار نطاق مجموعة الغموض معرفة ظروف النشر المحتملة، وليس مجرد إعداد رياضي مناسب.
كيف يختلف التحسين القوي للتوزيعات عن المقاربات ذات الصلة#
يقع التحسين القوي للتوزيعات بين فكرتين مألوفتين. يستعد التحسين القوي التقليدي للقيم الصعبة للبيانات غير المؤكدة، مع احتمال التعامل مع مدخل متطرف معين باعتباره أسوأ السيناريوهات. وبدلاً من ذلك، يأخذ التحسين القوي للتوزيعات في الاعتبار النتيجة المتوقعة في ظل أسوأ توزيع احتمالي معقول. يعامل التدريب التجريبي العادي التوزيع المرصود أساساً لخسارته المتوسطة.
كما يختلف التحسين القوي للتوزيعات عن زيادة البيانات. تنشئ زيادة البيانات أمثلة تدريب معدلة، مثل الصور الداكنة أو المدارة؛ ولا تقوم وحدها بالتحسين عبر مجموعة غموض. يمكن أن يكمل التحسين القوي للتوزيعات زيادة البيانات عندما تمثل تلك التغييرات ظروف النشر بشكل معقول. وبالمثل، يصف انحراف البيانات تغييراً مرصوداً في البيانات بمرور الوقت. يتوقع التحسين القوي للتوزيعات تغييرات مختارة قبل النشر، بينما يتحقق مراقبة الانحراف مما يحدث فعلياً بعد ذلك. ولا تحل أي من المقاربتين محل الأخرى.
أين تبرز أهمية التحسين القوي للتوزيعات في رؤية الكمبيوتر#
تخيل نظام اكتشاف الكائنات عبر كاميرات الطرق والذي يحدد المركبات والمشاة. قد تغلب مشاهد النهار الواضحة على لقطات النظام، بينما تكون الليالي الممطرة غير شائعة ولكنها ذات عواقب وخيمة. يمكن لهدف التحسين القوي للتوزيعات التعامل مع الخليط المختلف من ظروف الإضاءة والطقس الموثقة باعتبارها ظروفاً معقولة، مما يمنع النموذج من تحقيق درجات إجمالية جيدة عبر إهمال الظروف الصعبة. ومع ذلك، لا يمكن للتحسين القوي للتوزيعات ضمان التعرف على المخاطر الغائبة عن كل من البيانات ومجموعة الغموض المختارة.
في مجال اكتشاف عيوب التصنيع، قد تختلف الكاميرات والإضاءة بين خطوط الإنتاج. قد يفوت النموذج المحدد حصرياً بواسطة دقة الفحص المتوسطة العيوب الموجودة في خط إنتاج أقل تمثيلاً. إذا تم تحديد تلك الخطوط كجموعات، يمكن لهدف قوي قائم على المجموعة إبراز الأداء عندما تختلف نسبها عن عينة التدريب. يرتبط هذا بـ تحيز مجموعات البيانات، لكن التحسين القوي للتوزيعات لا يصلح التسميات غير الصحيحة ولا ينشئ أمثلة للعيوب التي لم يتم تسجيلها أبداً.
بالنسبة لأي من التطبيقين، احتفظ بالصور ذات الصلة من نفس الكاميرا أو الموقع معاً عند تقييم النقل إلى مواقع جديدة. يساعد التحقق المتقاطع الواعي بالمجموعات على تجنب التقييم الذي يبدو قوياً لأن المشاهد المتطابقة تقريباً تظهر في كل من بيانات التدريب والتحقق.
سير عمل Ultralytics العملي#
تتمثل نقطة البداية المعقولة في إنشاء أساس تدريب وتحقق عادي قبل التفكير في هدف تحسين قوي للتوزيعات مخصص. يدعم سير عمل تدريب YOLO26 من Ultralytics الموثق هذا المثال القصير باستخدام مجموعة بيانات العرض التوضيحي COCO8 المضمنة:
from ultralytics import YOLO
# Load pretrained detection weights.
model = YOLO("yolo26n.pt")
# Train a small baseline on the built-in example dataset.
model.train(data="coco8.yaml", epochs=3)
# Evaluate on the dataset's validation split.
metrics = model.val(data="coco8.yaml")
print(metrics.box.map)الناتج هو متوسط الدقة الشامل لاكتشاف الكائنات (mAP)، وليس نتيجة تحسين قوي للتوزيعات أو دليلاً على المتانة. تُعد مجموعة بيانات COCO8 مفيدة لاختبار سير العمل، وليست لتقدير الأداء عبر ظروف النشر الواقعية الحقيقية. بالنسبة لمشروع حقيقي، قم بإعداد ظروف ممثلة ومصنفة بشكل منفصل؛ واستخدم وضع التحقق من YOLO على كل مجموعة محجوزة ذات صلة وقارن النتائج الإجمالية والنتائج الخاصة بالظروف.
يتطلب تطبيق هدف تحسين قوي للتوزيعات فعلياً تحديد مجموعة الغموض وتغيير طريقة تحسين خسارة التدريب. توفر سير عمل المدرب المخصص الموثق نقاط امتداد، لكن رمز الأساس أعلاه لا ينفذ التحسين القوي للتوزيعات. يمكن للفرق التي تدير وضع التعليقات السحابية والتدريب والنشر استخدام منصة Ultralytics لتنظيم سير العمل الأوسع هذا.
اختيار وفحص الحماية المناسبة#
ابدأ بسؤال محدد: ما هي التحولات المعقولة، وما هي الأخطاء التي قد تسببها؟ اجمع أمثلة من الكاميرات أو المواقع أو الظروف ذات الصلة؛ واحتفظ بمجموعات اختبار مستقلة؛ وقارن نتائج أسوأ الظروف إلى جانب المتوسط. تشرح إرشادات Google حول التعميم سبب تضليل مجموعة التدريب غير الممثلة، بينما تؤكد إرشادات القياس الخاصة بإطار عمل إدارة المخاطر للذكاء الاصطناعي من المعهد الوطني للمعايير والتقنية (NIST) على التقييم الملائم للسياق.
بعد النشر، قم بـ مراقبة التغييرات بين بيانات التدريب وبيانات الخدمة. يكون التحسين القوي للتوزيعات مفيداً للغاية عندما تعكس مجموعة الغموض الخاصة به عدم يقين موثوقاً؛ فهو ليس بديلاً عن جمع البيانات السليم، أو التقييم الدقيق، أو المراقبة المستمرة.









