Hard Negative Mining
تعلّم كيف يقلّل التنقيب عن السلبيات الصعبة الإيجابيات الكاذبة في الرؤية الحاسوبية عبر تحديد الأمثلة السلبية المربكة وتحسين تدريب نموذج YOLO.
تعدين السلبيات الصعبة هو استراتيجية لبيانات التدريب تحدد الأمثلة السلبية التي يجدها النموذج مقنعة على نحو غير معتاد، وتوليها اهتمامًا أكبر أثناء التعلم. لا ينتمي المثال السلبي إلى الفئة المستهدفة، بينما يشبه المثال السلبي الصعب المثال الإيجابي بدرجة كافية لإنتاج درجة مرتفعة، أو اكتشاف غير صحيح، أو تضمين قريب. ومن خلال التركيز على هذه الحالات المربكة بدلًا من عرض أمثلة الخلفية السهلة على النموذج مرارًا، يمكن لتعدين السلبيات الصعبة أن يصقل حدود القرار ويقلل الإيجابيات الكاذبة.
كيفية عمل تعدين السلبيات الصعبة#
تبدأ العملية عادةً بنموذج أساسي مُدرَّب على بيانات تدريب تمثيلية. ثم يقيّم النموذج مجموعة أكبر من المرشحين، مثل صور الإنتاج غير الموسومة، أو المشاهد التي تحتوي على السلبيات فقط، أو الأمثلة الموجودة ضمن كل دفعة تدريب. وتُختار للمراجعة والتدريب المستقبلي المرشحات التي تحصل على درجات إيجابية مرتفعة رغم كونها سلبية.
يعتمد ما يؤهل المثال ليكون «صعبًا» على المهمة:
- في اكتشاف الأجسام، تكون منطقة الخلفية صعبة عندما يخطئ الكاشف في اعتبارها جسمًا مستهدفًا.
- في التصنيف، يكون المثال الصعب مثالًا ينتمي إلى فئة خاطئة ويُسنِد إليه النموذج درجة ثقة مرتفعة للفئة المستهدفة.
- في الاسترجاع أو التعلم المتري، يكون المثال الصعب عنصرًا غير ذي صلة يُرتَّب قريبًا من الاستعلام في مساحة التضمين. وتصف إرشادات Google بشأن أخذ العينات السلبية لنماذج التوصية السلبيات الصعبة بأنها عناصر سلبية ذات درجات مرتفعة تؤثر بقوة في التدرج.
- في التعلم الثلاثي، يظهر المثال السلبي قريبًا جدًا من المرساة مقارنةً بالمثال الإيجابي المطابق لها. وتشرح وثائق PyTorch TripletMarginLoss بنية المرساة والإيجابي والسلبي المستخدمة لتعلم التشابه النسبي.
قد يحدث التعدين دون اتصال، من خلال تشغيل نموذج دوريًا على مجموعة بيانات كبيرة، أو عبر الإنترنت، من خلال اختيار السلبيات الصعبة من الدفعة المصغرة الحالية. وتقدم طبقة تعدين السلبيات الصعبة في Keras مثالًا على الاختيار لكل استعلام استنادًا إلى درجات المرشحين.
أهمية السلبيات الصعبة#
معظم الأمثلة السلبية سهلة؛ فمن غير المرجح أن تربك سماء خالية كاشفَ رافعات شوكية. وبمجرد أن يصنف النموذج هذه الأمثلة تصنيفًا صحيحًا، فإنها تسهم بإشارة تعلم مفيدة محدودة. وتكشف السلبيات الصعبة عن السمات البصرية أو الدلالية الدقيقة التي أساء النموذج فهمها.
وتكون هذه الأمثلة قيّمة بوجه خاص عندما تؤدي الإنذارات الكاذبة إلى خفض الدقة. ويساعد تحليل الدقة والاسترجاع في تحديد ما إذا كانت إعادة التدريب تقلل الإيجابيات الكاذبة فعلًا من دون التسبب في انخفاض غير مقبول في الاسترجاع، كما يوضح دليل الدقة والاسترجاع في scikit-learn.
يختلف تعدين السلبيات الصعبة عن التقنيات ذات الصلة:
- يختار أخذ العينات السلبية مجموعة فرعية يمكن التعامل معها من جميع الأمثلة السلبية؛ أما تعدين السلبيات الصعبة فيعطي الأولوية للأمثلة الأكثر إرباكًا.
- يختار التعلم النشط عمومًا الأمثلة غير المؤكدة لوضع وسوم بشرية عليها، بما في ذلك الإيجابيات المحتملة. أما تعدين السلبيات الصعبة فيستهدف تحديدًا الأمثلة السلبية المؤكدة التي تتحدى النموذج.
- يغيّر الخسارة البؤرية كيفية ترجيح الأمثلة داخل دالة الخسارة، في حين يغيّر التعدين الأمثلة التي يجري اختيارها أو التركيز عليها.
- تعالج موازنة الفئات تفاوت تكرارات الفئات. وتغطي إرشادات Google بشأن مجموعات البيانات غير المتوازنة فئويًا أخذ العينات المنخفضة وإسناد الأوزان، لكن السلبيات المتكررة ليست بالضرورة سلبيات صعبة.
- تنشئ زيادة البيانات تنويعات من العينات الحالية؛ ولا يمكنها تقديم نمط فشل إنتاجي غير معروف بصورة موثوقة.
التطبيقات الواقعية#
اكتشاف السلامة في المستودعات: لنفترض أن كاشف الرافعات الشوكية يحدد مرارًا عربات نقل الطبالي، وانعكاسات الرفوف، والرافعات المقصية على أنها رافعات شوكية. قد تؤدي هذه الإيجابيات الكاذبة إلى إطلاق إنذارات غير ضرورية وتقليل ثقة المشغلين. ويمكن للمهندسين جمع تلك المشاهد بصفتها صورًا سلبية من دون وسم الرافعات الشوكية، وإضافتها إلى مجموعة البيانات، ثم إعادة تدريب الكاشف لتمييز الهدف عن المعدات المماثلة.
البحث البصري عن المنتجات: يبحث أحد العملاء عن حذاء رياضي أسود محدد، لكن نظام الاسترجاع يرتب الأحذية المشابهة بصريًا من خطوط منتجات مختلفة بدرجة مرتفعة جدًا. وتصبح هذه المنتجات غير المطابقة سلبيات صعبة. ويشجع التدريب عليها نموذج التضمين على الحفاظ على الفروق الدقيقة، مثل شكل النعل وموضع الشعار والخامة. ويوضح مثال شبكة Keras السيامية كيف تدعم صور المرساة والإيجابي والسلبي تعلم التشابه.
سير العمل العملي للتعدين#
سير العمل الموثوق تكراري:
- شغّل التنبؤات على بيانات التحقق والإنتاج التمثيلية.
- راجع الإيجابيات الكاذبة عالية الثقة وأنماط الالتباس بين الفئات باستخدام وضع التحقق في Ultralytics ومصفوفة الالتباس.
- تأكد من أن كل مرشح سلبي فعلًا؛ إذ يمكن للوسوم غير الصحيحة أن تعلم النموذج كبت الأجسام الحقيقية.
- ابحث عن العينات ذات الصلة، وأزل التكرارات، واحتفظ بخلفيات ووجهات نظر وظروف متنوعة.
- أعد التدريب، ثم قارن الأداء على كل من مجموعة الاختبار الكاملة وشريحة مخصصة للسلبيات الصعبة باستخدام سير عمل اختبار نموذج الرؤية الحاسوبية.
يمكن أن يساعد بحث التشابه في Ultralytics Explorer في إظهار الصور المشابهة لإيجابية كاذبة معروفة:
from ultralytics import Explorer
# Build an embedding index for the example dataset
explorer = Explorer(data="coco128.yaml", model="yolo26n.pt")
explorer.create_embeddings_table()
# Retrieve visually similar candidates for human review
candidates = explorer.get_similar(
img="https://ultralytics.com/images/bus.jpg",
limit=12,
)
print(candidates.head())لا يثبت التشابه وحده أن المرشح يمثل سلبية صعبة؛ إذ يجب على المراجع التحقق من وسم الحقيقة الأساسية. ويمكن للفرق استخدام Ultralytics Platform لتنظيم الصور المرشحة، ووضع وسوم عليها أو تصحيحها، وتدريب النماذج المحدّثة، ومراقبة عمليات النشر.
تجنب اختيار أصعب الأمثلة على الإطلاق فقط. فقد تكون بعض هذه الأمثلة موسومة خطأً، أو ملتبسة، أو قيمًا شاذة متطرفة تزعزع استقرار التدريب. ويحافظ المزيج المتوازن من السلبيات السهلة ومتوسطة الصعوبة والصعبة عمومًا على تغطية واسعة، مع تعليم النموذج الموضع الذي يفشل فيه حدّه الحالي.









