ما هو R-CNN؟ نظرة عامة سريعة
تعرّف على RCNN وتأثيره في اكتشاف الأجسام. سنستعرض مكوناته الأساسية وتطبيقاته ودوره في تطوير تقنيات مثل Fast RCNN وYOLO.

اكتشاف الكائنات هو مهمة في الرؤية الحاسوبية يمكنها التعرّف على الكائنات وتحديد مواقعها في الصور أو مقاطع الفيديو لتطبيقات مثل القيادة الذاتية والمراقبة والتصوير الطبي. اعتمدت أساليب اكتشاف الكائنات الأقدم، مثل كاشف Viola-Jones وHistogram of Oriented Gradients (HOG) مع Support Vector Machines (SVM)، على سمات مصممة يدويًا ونوافذ منزلقة. وغالبًا ما واجهت هذه الأساليب صعوبة في اكتشاف الكائنات بدقة في المشاهد المعقدة التي تحتوي على كائنات متعددة بأشكال وأحجام مختلفة.
غيّرت Region-based Convolutional Neural Networks (R-CNN) طريقة تعاملنا مع اكتشاف الكائنات. وتمثل محطة مهمة في تاريخ الرؤية الحاسوبية. لفهم كيفية ظهور نماذج مثل Ultralytics YOLOv8، نحتاج أولًا إلى فهم نماذج مثل R-CNN.
أنشأ Ross Girshick وفريقه بنية نموذج R-CNN التي تولّد مقترحات للمناطق، وتستخرج السمات باستخدام Convolutional Neural Network (CNN) مدرّبة مسبقًا، وتصنّف الكائنات، وتحسّن الصناديق المحيطة. قد يبدو ذلك معقدًا، لكنك ستتمكن بحلول نهاية هذه المقالة من فهم واضح لكيفية عمل R-CNN وسبب تأثيره الكبير. لِنلقِ نظرة!
كيف يعمل R-CNN؟#
تتضمن عملية اكتشاف الكائنات في نموذج R-CNN ثلاث خطوات رئيسية: توليد مقترحات المناطق، واستخراج السمات، وتصنيف الكائنات مع تحسين الصناديق المحيطة بها. لِنستعرض كل خطوة.

الشكل 1. كيفية عمل R-CNN.
مقترحات المناطق: العمود الفقري لـ RCNN#
في الخطوة الأولى، يمسح نموذج R-CNN الصورة لإنشاء عدد كبير من مقترحات المناطق. ومقترحات المناطق هي مناطق محتملة قد تحتوي على كائنات. وتُستخدم أساليب مثل Selective Search لفحص جوانب مختلفة من الصورة، مثل اللون والملمس والشكل، وتقسيمها إلى أجزاء مختلفة. يبدأ Selective Search بتقسيم الصورة إلى أجزاء أصغر، ثم دمج الأجزاء المتشابهة لتكوين مناطق اهتمام أكبر. وتستمر هذه العملية حتى يتم توليد نحو 2,000 مقترح منطقة.

الشكل 2. كيفية عمل Selective Search.
تساعد مقترحات المناطق هذه في تحديد جميع المواضع المحتملة التي قد يوجد فيها كائن. وفي الخطوات التالية، يستطيع النموذج معالجة المناطق الأكثر صلة بكفاءة من خلال التركيز على هذه المناطق المحددة بدلًا من الصورة كاملة. ويحقق استخدام مقترحات المناطق توازنًا بين الشمول والكفاءة الحسابية.
استخراج سمات الصورة: التقاط التفاصيل#
تتمثل الخطوة التالية في عملية اكتشاف الكائنات في نموذج R-CNN في استخراج السمات من مقترحات المناطق. ويُعاد تحجيم كل مقترح منطقة إلى حجم ثابت تتوقعه CNN، مثل 224x224 بكسل. تساعد إعادة التحجيم CNN على معالجة كل مقترح بكفاءة. وقبل التشويه، يُزاد حجم كل مقترح منطقة قليلًا ليشمل 16 بكسل من السياق الإضافي حول المنطقة، مما يوفر معلومات محيطة أكثر لاستخراج سمات أفضل.
بعد إعادة التحجيم، تُمرَّر مقترحات المناطق هذه إلى CNN مثل AlexNet، التي تكون عادةً مدرّبة مسبقًا على مجموعة بيانات كبيرة مثل ImageNet. تعالج CNN كل منطقة لاستخراج متجهات سمات عالية الأبعاد تلتقط تفاصيل مهمة مثل الحواف والأنسجة والأنماط. وتكثّف متجهات السمات هذه المعلومات الأساسية من المناطق، وتحول بيانات الصورة الخام إلى تنسيق يمكن للنموذج استخدامه لمزيد من التحليل. ويعتمد تصنيف الكائنات وتحديد مواقعها بدقة في المراحل التالية على هذا التحويل الحاسم للمعلومات المرئية إلى بيانات ذات معنى.

الشكل 3. استخراج السمات من مقترح منطقة باستخدام AlexNet.
تصنيف الكائنات: تحديد الكائنات المكتشفة#
تتمثل الخطوة الثالثة في تصنيف الكائنات داخل هذه المناطق. ويعني ذلك تحديد فئة كل كائن عُثر عليه داخل المقترحات. ثم تُمرَّر متجهات السمات المستخرجة عبر مُصنِّف للتعلم الآلي.
في حالة R-CNN، تُستخدم Support Vector Machines (SVMs) عادةً لهذا الغرض. وتُدرَّب كل SVM على التعرّف على فئة محددة من الكائنات من خلال تحليل متجهات السمات وتحديد ما إذا كانت منطقة معينة تحتوي على مثال من تلك الفئة. وبعبارة أساسية، يوجد مُصنِّف مخصص لكل فئة من الكائنات يفحص كل مقترح منطقة بحثًا عن ذلك الكائن المحدد.
أثناء التدريب، تُزوَّد المصنّفات ببيانات معنونة تحتوي على عينات إيجابية وسلبية:
- العينات الإيجابية: مناطق تحتوي على الكائن المستهدف.
- العينات السلبية: مناطق لا تحتوي على الكائن.
تتعلم المصنّفات التمييز بين هذه العينات. ويعمل انحدار الصندوق المحيط على تحسين موضع الكائنات المكتشفة وحجمها من خلال ضبط الصناديق المحيطة المقترحة مبدئيًا لتتطابق بصورة أفضل مع الحدود الفعلية للكائن. ويستطيع نموذج R-CNN تحديد الكائنات وتحديد مواقعها بدقة من خلال الجمع بين التصنيف وانحدار الصندوق المحيط.

الشكل 4. مثال على انحدار الصندوق المحيط. (المصدر: towardsdatascience.com)
جمع كل العناصر: تحسين الاكتشافات باستخدام NMS#
بعد خطوتَي التصنيف وانحدار الصندوق المحيط، غالبًا ما يولّد النموذج عدة صناديق محيطة متداخلة للكائن نفسه. ويُطبَّق Non-Maximum Suppression (NMS) لتحسين هذه الاكتشافات، مع الإبقاء على الصناديق الأكثر دقة. ويتخلص النموذج من الصناديق الزائدة والمتداخلة بتطبيق NMS، ولا يُبقي إلا على الاكتشافات الأعلى ثقة.
يعمل NMS من خلال تقييم درجات الثقة، التي تشير إلى مدى احتمال وجود الكائن المكتشف فعليًا، لجميع الصناديق المحيطة، وقمع الصناديق التي تتداخل بدرجة كبيرة مع صناديق ذات درجات أعلى.

الشكل 5. مثال على القمع غير الأقصى. (المصدر: towardsdatascience.com)
فيما يلي تفصيل لخطوات NMS:
- الترتيب: تُرتَّب الصناديق المحيطة حسب درجات الثقة ترتيبًا تنازليًا.
- الاختيار: يُختار الصندوق ذو أعلى درجة، وتُزال جميع الصناديق التي تتداخل معه بدرجة كبيرة، استنادًا إلى Intersection over Union (IoU).
- التكرار: تتكرر هذه العملية للصندوق التالي ذي أعلى درجة، وتستمر حتى تتم معالجة جميع الصناديق.
باختصار، يكتشف نموذج R-CNN الكائنات من خلال توليد مقترحات المناطق، واستخراج السمات باستخدام CNN، وتصنيف الكائنات وتحسين مواقعها باستخدام انحدار الصندوق المحيط، وتطبيق Non-Maximum Suppression (NMS) للإبقاء على الاكتشافات الأكثر دقة فقط.
R-CNN محطة مهمة في اكتشاف الكائنات#
يُعد R-CNN نموذجًا بارزًا في تاريخ اكتشاف الكائنات لأنه قدم نهجًا جديدًا حسّن الدقة والأداء بدرجة كبيرة. وقبل R-CNN، واجهت نماذج اكتشاف الكائنات صعوبة في تحقيق توازن بين السرعة والدقة. وقد أتاح أسلوب R-CNN في توليد مقترحات المناطق واستخدام CNNs لاستخراج السمات تحديد مواقع الكائنات والتعرّف عليها بدقة داخل الصور.
مهّد R-CNN الطريق أمام نماذج مثل Fast R-CNN وFaster R-CNN وMask R-CNN، التي عززت الكفاءة والدقة بدرجة أكبر. ومن خلال الجمع بين التعلم العميق والتحليل القائم على المناطق، وضع R-CNN معيارًا جديدًا في المجال وفتح آفاقًا لتطبيقات متنوعة في العالم الحقيقي.
إحداث تحول في التصوير الطبي باستخدام R-CNN#
من حالات الاستخدام المثيرة للاهتمام لـ R-CNN استخدامه في التصوير الطبي. فقد استُخدمت نماذج R-CNN لاكتشاف أنواع مختلفة من الأورام وتصنيفها، مثل أورام الدماغ، في الفحوص الطبية مثل التصوير بالرنين المغناطيسي والتصوير المقطعي المحوسب. ويؤدي استخدام نموذج R-CNN في التصوير الطبي إلى تحسين دقة التشخيص ومساعدة أطباء الأشعة على تحديد الأورام الخبيثة في مرحلة مبكرة. ويمكن لقدرة R-CNN على اكتشاف الأورام الصغيرة والمبكرة أن تُحدث فرقًا كبيرًا في علاج أمراض مثل السرطان ومآلها.

الشكل 6. اكتشاف أورام الدماغ باستخدام RCNN.
يمكن تطبيق نموذج R-CNN على مهام أخرى في التصوير الطبي بالإضافة إلى اكتشاف الأورام. فعلى سبيل المثال، يمكنه تحديد الكسور، واكتشاف أمراض الشبكية في صور العين، وتحليل صور الرئة بحثًا عن حالات مثل الالتهاب الرئوي وCOVID-19. وبغض النظر عن المشكلة الطبية، يمكن أن يؤدي الاكتشاف المبكر إلى تحسين نتائج المرضى. ومن خلال تطبيق دقة R-CNN في تحديد الحالات الشاذة ومواقعها، يستطيع مقدمو الرعاية الصحية تحسين موثوقية التشخيص الطبي وسرعته. ومع تبسيط اكتشاف الكائنات لعملية التشخيص، يمكن للمرضى الاستفادة من خطط علاج دقيقة وفي الوقت المناسب.
قيود R-CNN وخلفاؤه#
على الرغم من إمكاناته اللافتة، يعاني R-CNN من عيوب معينة، مثل التعقيد الحسابي المرتفع وبطء أوقات الاستدلال. وتجعل هذه العيوب نموذج R-CNN غير مناسب للتطبيقات الآنية. كما أن فصل مقترحات المناطق عن التصنيف في خطوات منفصلة قد يؤدي إلى أداء أقل كفاءة.
على مر السنين، ظهرت نماذج مختلفة لاكتشاف الكائنات عالجت هذه المشكلات. إذ يجمع Fast R-CNN بين مقترحات المناطق واستخراج السمات باستخدام CNN في خطوة واحدة، مما يسرّع العملية. ويقدم Faster R-CNN شبكة مقترحات المناطق (RPN) لتبسيط توليد المقترحات، بينما يضيف Mask R-CNN التجزئة على مستوى البكسل للحصول على اكتشافات أكثر تفصيلًا.

الشكل 7. مقارنة بين R-CNN وFast R-CNN وFaster R-CNN وMask R-CNN.
في الفترة نفسها تقريبًا التي ظهر فيها Faster R-CNN، بدأت سلسلة YOLO (You Only Look Once) في تطوير اكتشاف الكائنات في الوقت الفعلي. وتتنبأ نماذج YOLO بالصناديق المحيطة واحتمالات الفئات في تمريرة واحدة عبر الشبكة. فعلى سبيل المثال، يوفر Ultralytics YOLOv8 دقة وسرعة محسّنتين مع ميزات متقدمة للعديد من مهام الرؤية الحاسوبية.
أهم النقاط المستخلصة#
غيّر RCNN قواعد اللعبة في الرؤية الحاسوبية، إذ أظهر كيف يمكن للتعلم العميق تغيير اكتشاف الكائنات. وقد ألهم نجاحه العديد من الأفكار الجديدة في المجال. وعلى الرغم من ظهور نماذج أحدث مثل Faster R-CNN وYOLO لمعالجة أوجه قصور RCNN، فإن إسهامه يمثل محطة مهمة للغاية ينبغي تذكّرها.
مع استمرار الأبحاث، سنشهد نماذج أفضل وأسرع لاكتشاف الكائنات. ولن تحسّن هذه التطورات طريقة فهم الآلات للعالم فحسب، بل ستؤدي أيضًا إلى إحراز تقدم في العديد من الصناعات. يبدو مستقبل اكتشاف الكائنات واعدًا!
هل تريد مواصلة استكشاف الذكاء الاصطناعي؟ انضم إلى مجتمع Ultralytics! استكشف مستودعنا على GitHub للاطلاع على أحدث ابتكاراتنا في مجال الذكاء الاصطناعي. وتعرّف على حلولنا للذكاء الاصطناعي في قطاعات متنوعة مثل الزراعة والتصنيع. انضم إلينا للتعلم والتقدم!









