Dataset Bias
استكشف أسباب تحيّز مجموعات البيانات في الذكاء الاصطناعي وتعلّم كيفية التخفيف من الانحراف. اكتشف كيفية استخدام Ultralytics Platform وUltralytics YOLO26 لتحسين الإنصاف.
يحدث تحيّز مجموعة البيانات عندما تحتوي المعلومات المستخدمة لتعليم نماذج التعلّم الآلي (ML) على أخطاء منهجية أو توزيعات منحازة، مما يؤدي إلى تفضيل نظام الذكاء الاصطناعي الناتج بعض النتائج على غيرها. ونظرًا إلى أن النماذج تعمل كمحركات للتعرّف على الأنماط، فهي تعتمد اعتمادًا كاملًا على مدخلاتها؛ فإذا لم تعكس بيانات التدريب بدقة تنوّع البيئة الواقعية، فسوف يرث النموذج هذه النقاط العمياء. وغالبًا ما تؤدي هذه الظاهرة إلى ضعف التعميم، إذ قد يحقق نظام الذكاء الاصطناعي درجات مرتفعة أثناء الاختبار، لكنه يفشل فشلًا كبيرًا عند نشره لإجراء الاستدلال في الوقت الفعلي في سيناريوهات متنوعة أو غير متوقعة.
المصادر الشائعة لانحراف البيانات#
يمكن أن يتسرّب التحيّز إلى مجموعة البيانات في عدة مراحل من دورة حياة التطوير، وغالبًا ما ينشأ عن قرارات بشرية أثناء الجمع أو التعليق التوضيحي.
- تحيّز الاختيار: ينشأ هذا التحيّز عندما لا تمثّل البيانات المجموعة عشوائيًا المجتمع المستهدف. فعلى سبيل المثال، قد يؤدي إنشاء مجموعة بيانات لـالتعرّف على الوجوه باستخدام صور المشاهير في الغالب إلى تحييز النموذج نحو المكياج الكثيف والإضاءة الاحترافية، مما يتسبب في فشله عند التعامل مع صور كاميرات الويب اليومية.
- أخطاء وضع العلامات: يمكن أن تؤدي الذاتية أثناء وضع علامات على البيانات إلى إدخال تحيّز بشري. فإذا أخطأ المعلّقون باستمرار في تصنيف الكائنات الغامضة بسبب نقص الإرشادات الواضحة، فسيتعامل النموذج مع هذه الأخطاء باعتبارها الحقيقة الأساسية.
- تحيّز التمثيل: حتى عند اختيار المجموعات عشوائيًا، قد تطغى المجموعات الأقلية إحصائيًا تحت تأثير فئة الأغلبية. وفي اكتشاف الكائنات، ستؤدي مجموعة بيانات تضم 10,000 صورة للسيارات، لكنها لا تضم سوى 100 صورة للدراجات، إلى نموذج متحيّز نحو اكتشاف السيارات.
التطبيقات والنتائج في العالم الواقعي#
يؤثر تحيّز مجموعة البيانات تأثيرًا كبيرًا في مختلف القطاعات، ولا سيما حيث تتخذ الأنظمة الآلية قرارات عالية المخاطر أو تتفاعل مع العالم المادي.
في قطاع السيارات، يعتمد الذكاء الاصطناعي في السيارات على الكاميرات للتعرّف على المشاة والعوائق. فإذا دُرّبت سيارة ذاتية القيادة أساسًا على بيانات جُمعت في مناخات مشمسة وجافة، فقد يتدهور أداؤها عند التشغيل في الثلوج أو الأمطار الغزيرة. وهذا مثال نموذجي على عدم تطابق توزيع التدريب مع توزيع التشغيل، مما يؤدي إلى مخاطر تتعلق بالسلامة.
وبالمثل، في تحليل الصور الطبية، تُدرّب النماذج التشخيصية غالبًا على بيانات تاريخية للمرضى. فإذا دُرّب نموذج مصمم لاكتشاف الأمراض الجلدية على مجموعة بيانات تهيمن عليها درجات البشرة الفاتحة، فقد يُظهر دقة أقل بكثير عند تشخيص المرضى ذوي البشرة الداكنة. ويتطلب التصدي لذلك جهدًا منسقًا لتنظيم مجموعات بيانات متنوعة تضمن الإنصاف في الذكاء الاصطناعي عبر جميع المجموعات الديموغرافية.
استراتيجيات التخفيف#
يمكن للمطورين الحد من تحيّز مجموعة البيانات من خلال إجراء عمليات تدقيق صارمة واستخدام استراتيجيات تدريب متقدمة. وتساعد تقنيات مثل زيادة البيانات على موازنة مجموعات البيانات عبر إنشاء تنويعات اصطناعية من الأمثلة ناقصة التمثيل (مثل القلب أو التدوير أو ضبط السطوع). وعلاوة على ذلك، يمكن أن يؤدي إنشاء بيانات اصطناعية إلى سد الفجوات عندما تكون بيانات العالم الحقيقي نادرة أو يصعب جمعها.
تُعد إدارة مجموعات البيانات هذه بفعالية أمرًا بالغ الأهمية. إذ تتيح منصة Ultralytics للفرق تصور توزيعات الفئات وتحديد أوجه الاختلال قبل بدء التدريب. بالإضافة إلى ذلك، يساعد الالتزام بإرشادات مثل إطار إدارة مخاطر الذكاء الاصطناعي الصادر عن NIST المؤسسات على تنظيم نهجها لتحديد هذه المخاطر والتخفيف منها بصورة منهجية.
تحيّز مجموعة البيانات في مقابل المفاهيم ذات الصلة#
من المفيد التمييز بين تحيّز مجموعة البيانات والمصطلحات المشابهة لفهم مصدر الخطأ:
- في مقابل التحيّز الخوارزمي: يتمحور تحيّز مجموعة البيانات حول البيانات؛ فهو يعني أن «المكوّنات» معيبة. أما التحيّز الخوارزمي فيتمحور حول النموذج؛ وينشأ من تصميم الخوارزمية نفسها أو من خوارزمية التحسين، التي قد تعطي الأولوية لفئات الأغلبية لتعظيم المقاييس الإجمالية على حساب مجموعات الأقلية.
- في مقابل انحراف النموذج: تحيّز مجموعة البيانات مشكلة ثابتة موجودة وقت التدريب. أما انحراف النموذج (أو انحراف البيانات) فيحدث عندما تتغير بيانات العالم الحقيقي بمرور الوقت بعد نشر النموذج، مما يتطلب مراقبة النموذج بصورة مستمرة.
مثال على التعليمات البرمجية: زيادة البيانات للحد من التحيّز#
يوضح المثال التالي كيفية تطبيق زيادة البيانات أثناء التدريب باستخدام YOLO26. ومن خلال زيادة عمليات زيادة البيانات الهندسية، يتعلم النموذج التعميم بصورة أفضل، مما قد يحد من التحيّز تجاه اتجاهات أو مواضع معينة للكائنات موجودة في مجموعة التدريب.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)








