ما هو Mask R-CNN وكيف يعمل؟
تعرّف إلى كيفية استخدام Mask R-CNN لتقسيم الكائنات بدقة في الصور ومقاطع الفيديو لمختلف التطبيقات عبر قطاعات متنوعة.

أصبحت ابتكارات مثل الروبوتات في المستودعات، والسيارات ذاتية القيادة التي تتحرك بأمان في الشوارع المزدحمة، والطائرات المسيّرة التي تفحص المحاصيل، وأنظمة الذكاء الاصطناعي التي تفحص المنتجات في المصانع، أكثر شيوعًا مع تزايد اعتماد الذكاء الاصطناعي. وتُعد الرؤية الحاسوبية إحدى التقنيات الأساسية التي تقود هذه الابتكارات، وهي فرع من الذكاء الاصطناعي يتيح للآلات فهم البيانات المرئية وتفسيرها.
على سبيل المثال، يُعد اكتشاف الأجسام مهمةً في الرؤية الحاسوبية تساعد على تحديد الأجسام وتحديد مواقعها في الصور باستخدام الصناديق المحيطة. وعلى الرغم من أن الصناديق المحيطة توفر معلومات مفيدة، فإنها لا تقدم سوى تقدير تقريبي لموضع الجسم، ولا تستطيع تحديد شكله أو حدوده بدقة. وهذا يجعلها أقل فعالية في التطبيقات التي تتطلب تحديدًا دقيقًا.
ولحل هذه المشكلة، طوّر الباحثون نماذج للتقسيم تلتقط المحيطات الدقيقة للأجسام، مما يوفر تفاصيل على مستوى البكسل لاكتشافها وتحليلها بدقة أكبر.
يُعد Mask R-CNN أحد هذه النماذج. وقد قدمته Facebook AI Research (FAIR) في عام 2017، وهو يبني على نماذج سابقة مثل R-CNN وFast R-CNN وFaster R-CNN. وبصفته محطة مهمة في تاريخ الرؤية الحاسوبية، مهّد Mask R-CNN الطريق أمام نماذج أكثر تقدمًا، مثل Ultralytics YOLO11.
في هذه المقالة، سنستكشف ماهية Mask R-CNN، وكيفية عمله، وتطبيقاته، والتحسينات التي ظهرت بعده وأدت إلى Ultralytics YOLO11.
نظرة عامة على Mask R-CNN#
Mask R-CNN، وهو اختصار لشبكة عصبية التفافية قائمة على مناطق القناع، هو نموذج للتعلم العميق مصمم من أجل مهام الرؤية الحاسوبية مثل اكتشاف الأجسام وتقسيم المثيلات.
يتجاوز تقسيم المثيلات اكتشاف الأجسام التقليدي، إذ لا يكتفي بتحديد الأجسام في الصورة، بل يرسم أيضًا حدود كل جسم بدقة. ويُسنِد تسمية فريدة إلى كل جسم يتم اكتشافه، ويلتقط شكله الدقيق على مستوى البكسل. ويتيح هذا النهج التفصيلي التمييز بوضوح بين الأجسام المتداخلة والتعامل بدقة مع الأشكال المعقدة.
يبني Mask R-CNN على Faster R-CNN، الذي يكتشف الأجسام ويضع تسميات لها، لكنه لا يحدد أشكالها الدقيقة. ويحسّن Mask R-CNN ذلك من خلال تحديد البكسلات الدقيقة التي يتكوّن منها كل جسم، مما يتيح تحليلًا للصور أكثر تفصيلًا ودقة بكثير.

الشكل 1. مقارنة بين اكتشاف الأجسام وتقسيم المثيلات.
نظرة على بنية Mask R-CNN وكيفية عمله#
يتبع Mask R-CNN نهجًا تدريجيًا لاكتشاف الأجسام وتقسيمها بدقة. ويبدأ باستخراج السمات الأساسية باستخدام شبكة عصبية عميقة (نموذج متعدد الطبقات يتعلم من البيانات)، ثم يحدد المناطق المحتملة للأجسام باستخدام شبكة اقتراح المناطق (مكوّن يقترح المناطق التي يُرجح أن تحتوي على أجسام)، وأخيرًا يحسّن هذه المناطق من خلال إنشاء أقنعة تقسيم مفصلة (محيطات دقيقة للأجسام) تلتقط الشكل الدقيق لكل جسم.
بعد ذلك، سنستعرض كل خطوة لفهم كيفية عمل Mask R-CNN بصورة أفضل.

الشكل 2. نظرة عامة على بنية Mask R-CNN (المصدر: researchgate.net).
البدء باستخراج السمات#
تتمثل الخطوة الأولى في بنية Mask R-CNN في تفكيك الصورة إلى أجزائها الأساسية حتى يتمكن النموذج من فهم محتواها. ويمكن تشبيه ذلك بالطريقة التي تنظر بها إلى صورة وتلاحظ تلقائيًا تفاصيل مثل الأشكال والألوان والحواف. وينفذ النموذج شيئًا مشابهًا باستخدام شبكة عصبية عميقة تُسمى «العمود الفقري» (غالبًا ResNet-50 أو ResNet-101)، وتعمل كأنها عيناه لمسح الصورة والتقاط التفاصيل الأساسية.
نظرًا إلى أن الأجسام في الصور قد تكون صغيرة جدًا أو كبيرة جدًا، يستخدم Mask R-CNN شبكة هرم السمات. ويشبه ذلك امتلاك عدسات مكبرة مختلفة تتيح للنموذج رؤية التفاصيل الدقيقة والصورة الأكبر، مما يضمن ملاحظة الأجسام بمختلف أحجامها.
بعد استخراج السمات المهمة، ينتقل النموذج إلى تحديد مواقع الأجسام المحتملة في الصورة، ممهدًا الطريق لمزيد من التحليل.
اقتراح المناطق المحتملة التي تحتوي على أجسام في الصورة#
بعد معالجة الصورة لاستخراج السمات الأساسية، تتولى شبكة اقتراح المناطق المهمة. وينظر هذا الجزء من النموذج إلى الصورة ويقترح المناطق التي يُرجح أن تحتوي على أجسام.
وينفذ ذلك من خلال إنشاء مواقع محتملة متعددة للأجسام تُسمى المراسي. ثم تقيّم الشبكة هذه المراسي وتختار أكثرها ترجيحًا لمزيد من التحليل. وبهذه الطريقة، يركز النموذج فقط على المناطق التي يُرجح أن تكون مهمة، بدلًا من فحص كل موضع في الصورة.

الشكل 3. مثال على شبكة اقتراح المناطق.
تحسين السمات المستخرجة#
بعد تحديد المناطق الأساسية، تتمثل الخطوة التالية في تحسين التفاصيل المستخرجة من هذه المناطق. استخدمت النماذج السابقة طريقة تُسمى ROI Pooling (تجميع منطقة الاهتمام) لاستخراج السمات من كل منطقة، لكن هذه التقنية كانت تؤدي أحيانًا إلى حالات عدم محاذاة طفيفة عند تغيير حجم المناطق، مما يقلل فعاليتها، ولا سيما مع الأجسام الصغيرة أو المتداخلة.
يحسّن Mask R-CNN ذلك باستخدام تقنية تُعرف باسم ROI Align (محاذاة منطقة الاهتمام). فبدلًا من تقريب الإحداثيات كما تفعل ROI Pooling، تستخدم ROI Align الاستيفاء ثنائي الخطية لتقدير قيم البكسلات بدقة أكبر. والاستيفاء ثنائي الخطية هو طريقة تحسب قيمة بكسل جديدة من خلال حساب متوسط قيم أقرب أربعة بكسلات مجاورة له، مما ينشئ انتقالات أكثر سلاسة. ويحافظ ذلك على محاذاة السمات بصورة صحيحة مع الصورة الأصلية، وينتج عنه اكتشاف وتقسيم للأجسام بدقة أكبر.
على سبيل المثال، في مباراة لكرة القدم، قد يُشتبه خطأً في أن لاعبين يقفان متقاربين هما جسم واحد بسبب تداخل الصناديق المحيطة بهما. وتساعد ROI Align على الفصل بينهما من خلال الحفاظ على تميّز شكليهما.

الشكل 4. يستخدم Mask R-CNN تقنية ROI Align.
تصنيف الأجسام والتنبؤ بأقنعتها#
بعد أن تعالج ROI Align الصورة، تتمثل الخطوة التالية في تصنيف الأجسام وتحسين مواقعها. وينظر النموذج إلى كل منطقة مستخرجة ويحدد الجسم الذي تحتوي عليه. كما يُسنِد درجة احتمالية إلى الفئات المختلفة ويختار أفضل تطابق.
وفي الوقت نفسه، يضبط الصناديق المحيطة لتتلاءم مع الأجسام بصورة أفضل. فقد لا تكون الصناديق الأولية موضوعة في الموضع المثالي، ولذلك يساعد هذا الضبط على تحسين الدقة من خلال ضمان إحاطة كل صندوق بالجسم المكتشف إحاطة محكمة.
وأخيرًا، يتخذ Mask R-CNN خطوة إضافية، إذ ينشئ قناع تقسيم مفصلًا لكل جسم بالتوازي.
Mask R-CNN وتطبيقاته في الوقت الفعلي#
عند طرح هذا النموذج، لقي حماسًا كبيرًا من مجتمع الذكاء الاصطناعي، وسرعان ما استُخدم في تطبيقات متنوعة. وقد جعلته قدرته على اكتشاف الأجسام وتقسيمها في الوقت الفعلي عاملًا مغيرًا لقواعد اللعبة في مختلف الصناعات.
على سبيل المثال، تُعد متابعة الحيوانات المهددة بالانقراض في البرية مهمة صعبة. إذ تتحرك أنواع كثيرة عبر الغابات الكثيفة، مما يصعّب على خبراء الحفاظ على البيئة متابعتها. وتستخدم الأساليب التقليدية مصائد الكاميرات والطائرات المسيّرة وصور الأقمار الصناعية، لكن فرز كل هذه البيانات يدويًا يستغرق وقتًا طويلًا. وقد تؤدي حالات التعرف الخاطئ والمشاهدات الفائتة إلى إبطاء جهود الحفاظ على البيئة.
ومن خلال التعرف على السمات الفريدة مثل خطوط النمر، وبقع الزرافة، أو شكل أذني الفيل، يستطيع Mask R-CNN اكتشاف الحيوانات وتقسيمها في الصور ومقاطع الفيديو بدقة أكبر. وحتى عندما تكون الحيوانات محجوبة جزئيًا بالأشجار أو واقفة متقاربة، يستطيع النموذج فصلها وتحديد كل منها على حدة، مما يجعل مراقبة الحياة البرية أسرع وأكثر موثوقية.

الشكل 5. اكتشاف الحيوانات وتقسيمها باستخدام Mask R-CNN.
قيود Mask R-CNN#
على الرغم من أهميته التاريخية في اكتشاف الأجسام وتقسيمها، فإن Mask R-CNN ينطوي أيضًا على بعض العيوب الأساسية. فيما يلي بعض التحديات المرتبطة بـ Mask R-CNN:
- متطلبات حسابية مرتفعة: يعتمد على وحدات GPU قوية، مما قد يجعل تشغيله مكلفًا وبطيئًا عند معالجة كميات كبيرة من البيانات.
- سرعة معالجة أبطأ: تجعل عمليته متعددة المراحل أبطأ مقارنةً بنماذج الوقت الفعلي الأسرع مثل YOLO، وقد لا يكون ذلك مثاليًا للمهام الحساسة للوقت.
- الاعتماد على بيانات عالية الجودة: يحقق النموذج أفضل أداء له مع الصور الواضحة والموسومة جيدًا. وقد تقلل الصور الضبابية أو ضعيفة الإضاءة دقته بدرجة كبيرة.
- تعقيد التنفيذ: قد يكون إعداد البنية متعددة المراحل وتحسينها أمرًا صعبًا، ولا سيما عند التعامل مع مجموعات بيانات كبيرة أو موارد محدودة.
من Mask R-CNN إلى Ultralytics YOLO11#
كان Mask R-CNN ممتازًا لمهام التقسيم، لكن العديد من الصناعات كانت تتطلع إلى اعتماد الرؤية الحاسوبية مع إعطاء الأولوية للسرعة والأداء في الوقت الفعلي. وأدى هذا المتطلب إلى تطوير الباحثين نماذج أحادية المرحلة تكتشف الأجسام في تمريرة واحدة، مما حسّن الكفاءة بدرجة كبيرة.
وعلى خلاف عملية Mask R-CNN متعددة الخطوات، تركز نماذج الرؤية الحاسوبية أحادية المرحلة مثل YOLO (ترى مرة واحدة فقط) على مهام الرؤية الحاسوبية في الوقت الفعلي. فبدلًا من معالجة الاكتشاف والتقسيم بصورة منفصلة، تستطيع نماذج YOLO تحليل الصورة دفعة واحدة. وهذا يجعلها مثالية لتطبيقات مثل القيادة الذاتية والرعاية الصحية والتصنيع والروبوتات، حيث يُعد اتخاذ القرارات بسرعة أمرًا بالغ الأهمية.
وعلى وجه الخصوص، يرتقي Ultralytics YOLO11 بهذا الأمر إلى مستوى أبعد من خلال الجمع بين السرعة والدقة. فهو يستخدم معاملات أقل بنسبة 22% من YOLOv8m، ومع ذلك يحقق متوسط دقة (mAP) أعلى على مجموعة بيانات COCO، ما يعني أنه يكتشف الأجسام بدقة أكبر. كما تجعل سرعة معالجته المحسّنة منه خيارًا جيدًا للتطبيقات في الوقت الفعلي التي تكون فيها كل ميلي ثانية مهمة.

الشكل 6. أداء YOLO11 مقارنةً بالنماذج الأخرى.
أهم النقاط المستخلصة#
عند استعراض تاريخ الرؤية الحاسوبية، يُعترف بـ Mask R-CNN بوصفه إنجازًا كبيرًا في اكتشاف الأجسام وتقسيمها. فهو يقدم نتائج دقيقة جدًا حتى في البيئات المعقدة، بفضل عمليته التفصيلية متعددة الخطوات.
ومع ذلك، تجعل هذه العملية نفسها النموذج أبطأ مقارنةً بنماذج الوقت الفعلي مثل YOLO. ومع تزايد الحاجة إلى السرعة والكفاءة، تستخدم تطبيقات كثيرة الآن نماذج أحادية المرحلة مثل Ultralytics YOLO11، التي توفر اكتشافًا سريعًا ودقيقًا للأجسام. وبينما يُعد Mask R-CNN مهمًا لفهم تطور الرؤية الحاسوبية، فإن الاتجاه نحو حلول الوقت الفعلي يسلط الضوء على الطلب المتزايد على حلول رؤية حاسوبية أسرع وأكثر كفاءة.
انضم إلى مجتمعنا المتنامي! استكشف مستودعنا على GitHub لمعرفة المزيد عن الذكاء الاصطناعي. هل أنت مستعد لبدء مشاريعك الخاصة في الرؤية الحاسوبية؟ اطّلع على خيارات الترخيص. واكتشف الذكاء الاصطناعي في الزراعة والذكاء الاصطناعي للرؤية في الرعاية الصحية من خلال زيارة صفحات حلولنا!









