Multiple Instance Learning
تعرف على كيفية استخدام التعلم متعدد الحالات (Multiple Instance Learning) لتسميات مستوى الحقيبة، وتجميع الحالات، والإشراف الضعيف في التصوير الطبي، والفحص، والتصنيف.
التعلم متعدد المثيلات (MIL) هو نهج تعلم آلي يتم فيه تنظيم أمثلة التدريب في مجموعات تسمى أكياس (bags)، بينما تُسمى العناصر الموجودة داخل كل كيس مثيلات (instances). يتلقى النموذج تصنيفاً للكيس بأكمله وليس لكل مثيلة على حِدة. على سبيل المثال، قد يتم تصنيف شريحة باثولوجية بعبارة "وجود سرطان" دون تحديد مناطق الصورة التي تحتوي على خلايا سرطانية. يكون التعلم متعدد المثيلات مفيداً عندما يكون التعليق التفصيلي مكلفاً أو غامضاً أو غير متاح.
كيف يعمل التعلم متعدد المثيلات#
في التعلم المُشرف عليه التقليدي، يحتوي كل مثال تدريب على تصنيفه الخاص. يغير التعلم متعدد المثيلات وحدة الإشراف: حيث ينتمي التصنيف إلى مجموعة من الأمثلة ذات الصلة.
قد يكون الكيس عبارة عن فيديو يحتوي على العديد من الإطارات، أو مستنداً يحتوي على العديد من المقاطع، أو صورة كبيرة مقسمة إلى أجزاء (patches). كل إطار أو مقطع أو جزء هو مثيلة. يحتوي نموذج التعلم متعدد المثيلات النموذجي على ثلاثة مكونات:
- يقوم مشفر المثيلات (instance encoder) بتحويل كل مثيلة إلى تمثيل ميزاتي رقمي.
- تقوم دالة التجميع (aggregation function) بدمج تمثيلات المثيلات في تمثيل واحد للكيس.
- يتنبأ مُصنّف الكيس (bag classifier) بتصنيف الكيس من هذا التمثيل المدمج.
بالنسبة للتصنيف الثنائي، يفترض افتراض التعلم متعدد المثيلات التقليدي أن الكيس الإيجابي يحتوي على مثيلة إيجابية واحدة على الأقل، بينما تكون كل مثيلة في الكيس السلبي سالبة. يناسب هذا الافتراض المهام التي يمكن فيها لمنطقة صغيرة واحدة تحديد النتيجة الإجمالية. تتطلب المشكلات الأخرى افتراضات جماعية، مثل التنبؤ بتصنيف إيجابي فقط عندما تظهر عدة مثيلات أدلة داعمة.
نظراً لأن التعلم متعدد المثيلات يتعلم من تصنيفات الأكياس، فهو يعتبر شكلاً من أشكال الإشراف الضعيف (weak supervision). على عكس تصنيف الصور العادي، فهو لا يفترض أن الصورة الكاملة أو كل منطقة تعبر عن الفئة المخصصة. هذا يتجنب نسخ تصنيف الكيس بشكل غير صحيح على جميع المثيلات.
التجميع وأهمية المثيلات#
يجب أن يتعامل التجميع مع أحجام الأكياس المختلفة ويفترض عادةً أن يكون مستقلاً عن ترتيب المثيلات. تشمل الاستراتيجيات الشائعة ما يلي:
- التجميع الأقصى (Max pooling): يستخدم إشارة المثيلة الأقوى. وهو يتوافق مع افتراض "مثيلة إيجابية واحدة على الأقل" ولكنه قد يكون حسّاساً للقيم المتطرفة.
- التجميع المتوسط (Mean pooling): يحسب متوسط الأدلة عبر الكيس. يعمل بشكل أفضل عندما تساهم العديد من المثيلات ولكنه قد يُضعف الأدلة الإيجابية النادرة.
- تجميع الانتباه (Attention pooling): يتعلم مدى قوة تأثير كل مثيلة على النتيجة. يمكن أن تشير الأوزان الناتجة إلى مناطق مهمة، على الرغم من عدم ضمان كونها تفسيرات.
يتم تحويل الناتج المُجمّع إلى درجة للكيس، غالباً باستخدام دالة احتمالية مثل Softmax. يقارن التدريب هذه الدرجة بتصنيف الكيس ويستخدم الانتشار العكسي لتحديث المشفر والمُجمّع معاً.
يُحسن التعلم متعدد المثيلات في المقام الأول التنبؤات على مستوى الكيس. حتى عندما يمنح النموذج أهمية عالية لمثيلَات معينة، فإن تلك الدرجات لا تكون تلقائياً تصنيفات مثيلات موثوقة أو تحديد دقيق للمواقع.
تطبيقات العالم الحقيقي#
-
تحليل الصور الطبية: يمكن أن تحتوي شريحة الأنسجة الرقمية على آلاف الأجزاء، بينما ينطبق التشخيص المتاح فقط على المريض أو الشريحة. يمكن للتعلم متعدد المثيلات معالجة الأجزاء كمثيلَات والتنبؤ بما إذا كانت الشريحة الكاملة تحتوي على أدلة على المرض. هذا قيّم في تحليل الصور الطبية لأن رسم حدود تفصيلية حول كل منطقة غير طبيعية يتطلب وقت متخصص. تصف واردات الموارد الخاصة بذكاء الاصطناعي في NCI Genomic Data Commons صور الشرائح الكاملة كمدخلات لتصنيف السرطان، واكتشاف الميزات، والتنبؤ بالنتائج. (gdc.cancer.gov)
-
الفحص البصري الصناعي: قد يتم تصوير مكون مُصنّع من عدة زوايا أو تسجيله كسلسلة قصيرة. قد يقوم مفتشو الجودة بتصنيف الفحص الكامل على أنه "معيب" دون تحديد العرض الدقيق الذي يحتوي على صدع أو جزء مفقود. يمكن للتعلم متعدد المثيلات التعامل مع العروض ككيس واحد ومعرفة الدليل البصري الذي يتنبأ بالفشل. إذا أصبحت مواقع العيوب الدقيقة ضرورية لاحقاً، يمكن تعليق مثيلات مختارة لـ اكتشاف الكائنات أو تجزئة المثيلات.
إعدادات التعلم ذات الصلة#
يختلف التعلم متعدد المثيلات عن عدة نهج مترابطة ارتباطاً وثيقاً:
- الإشراف الضعيف (Weak supervision) هو الفئة الأوسع التي تغطي التصنيفات غير الكاملة، أو الصاخبة، أو غير المباشرة. يستخدم التعلم متعدد المثيلات على وجه التحديد تصنيفات مرفقة بأكياس من المثيلات.
- التعلم شبه المُشرف (Semi-supervised learning) يجمع بين الأمثلة المُصنّفة وغير المُصنّفة. أكياس التعلم متعدد المثيلات مُصنّفة، ولكن مثيلاتها الفردية عادة ما تكون غير مُصنّفة.
- التعلم متعدد التصنيفات (Multi-label learning) يتنبأ بعدة فئات لمثال واحد. يصف التعلم متعدد المثيلات كيفية تجميع الأمثلة، بحيث يمكن للنظام أن يكون متعدد المثيلات ومتعدد التصنيفات في نفس الوقت.
- آليات الانتباه (Attention mechanisms) تحدد كيف يتم وزن المعلومات أو دمجها. يمكنها تطبيق تجميع التعلم متعدد المثيلات ولكنها لا تحدد التعلم متعدد المثيلات بمفردها.
- اكتشاف الكائنات (Object detection) يتطلب تعليقات مُحددة المواقع مثل مربعات الإحاطة. يمكن للتعلم متعدد المثيلات أحياناً تسليط الضوء على المناطق المحتملة، ولكن التدريب على مستوى الكيس وحده لا يوفر مواقع كائنات مؤكدة.
سير العمل العملي والتقييم#
يستخدم رسم الاستدلال التالي نموذج تصنيف Ultralytics YOLO26 لتقييم مثيلتي صورة وتطبيق التجميع الأقصى. وهو يوضح مفهوم قرار الكيس بدلاً من نموذج تعلم متعدد المثيلات مُدرب بشكل مشترك.
from ultralytics import YOLO
# Treat related images as instances within one bag
sources = [
"https://ultralytics.com/images/bus.jpg",
"https://ultralytics.com/images/zidane.jpg",
]
model = YOLO("yolo26n-cls.pt")
results = model(sources)
# Aggregate evidence for one target class across the bag
target_name = "minibus"
target_id = next(i for i, name in results[0].names.items() if name == target_name)
instance_scores = [float(result.probs.data[target_id]) for result in results]
bag_score = max(instance_scores)
print(f"{target_name} bag probability: {bag_score:.3f}")يتدرب تنفيذ كامل للتعلم متعدد المثيلات على مُجمّع واعي بالأكياس باستخدام تصنيفات الأكياس. يدعم Ultralytics YOLO سير عمل التصنيف القياسي، بينما تكون منطق التعلم متعدد المثيلات المخصص مطلوباً لتجميع المثيلات وتحسين الخسارة على مستوى الكيس.
يجب على الممارسين الحفاظ على حدود الأكياس أثناء التجميع في دفعات، واختبار قواعد تجميع متعددة، ومنع المثيلات ذات الصلة من عبور تقسيمات مجموعة البيانات. يمكن لأدوات مثل التحقق المتقاطع GroupKFold الحفاظ على الأجزاء من نفس المريض أو الفيديو أو المنتج معاً. تقييم الدقة والاستدعاء على مستوى الكيس، وإضافة تقييم على مستوى المثيلة إذا كان تحديد الموقع مهمًا. يمكن لـ منصة Ultralytics دعم إدارة مجموعات البيانات، والتعليق، وتدريب النموذج القياسي، والنشر عندما يتم الجمع بين خط أنابيب التعلم متعدد المثيلات ومكونات الكشف أو التجزئة أو التصنيف.






