أفضل نماذج كشف الأجسام
استكشفوا أفضل نماذج كشف الأجسام في 2026، بدءًا من Ultralytics YOLO وصولًا إلى RT-DETR، مع مقارنة البنى والمفاضلات المتعلقة بالأداء وعوامل النشر.

في وقت سابق من هذا العام، قدّم Andrew Ng، الرائد في مجالَي الذكاء الاصطناعي وتعلّم الآلة، مفهوم اكتشاف الأجسام الوكيلي. يستخدم هذا النهج وكيلاً استدلالياً لاكتشاف الأجسام استناداً إلى مطالبة نصية، من دون الحاجة إلى كميات هائلة من بيانات التدريب.
إن القدرة على تحديد الأجسام في الصور ومقاطع الفيديو من دون الحاجة إلى مجموعات بيانات ضخمة وموسومة تمثّل خطوة نحو أنظمة الرؤية الحاسوبية الأكثر ذكاءً ومرونة. ومع ذلك، لا يزال الذكاء الاصطناعي للرؤية الوكيلية في مراحله الأولى.
رغم قدرتها على التعامل مع المهام العامة، مثل اكتشاف الأشخاص أو لافتات الشوارع في صورة، لا تزال تطبيقات الرؤية الحاسوبية الأكثر دقة تعتمد على نماذج اكتشاف الأجسام التقليدية. تُدرَّب هذه النماذج على مجموعات بيانات كبيرة وموسومة بعناية لتتعلّم بالضبط ما الذي ينبغي البحث عنه وأين توجد الأجسام.

الشكل 1. مثال على اكتشاف الأجسام. (المصدر)
يُعد اكتشاف الأجسام التقليدي ضرورياً لأنه يوفّر كلاً من التعرّف، أي تحديد ماهية الجسم، وتحديد الموقع، أي تحديد موضعه بدقة في الصورة. ويتيح هذا الجمع للآلات تنفيذ مهام معقدة في العالم الحقيقي بصورة موثوقة، بدءاً من المركبات ذاتية القيادة ووصولاً إلى الأتمتة الصناعية وتشخيص الأمراض.
بفضل التطورات التقنية، تواصل نماذج اكتشاف الأجسام تحسّنها، فأصبحت أسرع وأكثر دقة وأفضل ملاءمة للبيئات الواقعية. في هذه المقالة، سنستعرض بعضاً من أفضل نماذج اكتشاف الأجسام المتاحة اليوم. لنبدأ!
الحاجة إلى اكتشاف الأجسام#
يمكن استخدام مهام الرؤية الحاسوبية، مثل تصنيف الصور، لتحديد ما إذا كانت الصورة تحتوي على سيارة أو شخص أو جسم آخر. لكنها لا تستطيع تحديد موضع الجسم داخل الصورة.
هنا يبرز دور اكتشاف الأجسام. إذ تستطيع نماذج اكتشاف الأجسام تحديد الأجسام الموجودة، وكذلك تحديد مواقعها بدقة. وتتيح هذه العملية، المعروفة باسم تحديد الموقع، للآلات فهم المشاهد بصورة أدق والاستجابة بشكل مناسب، سواء أكان ذلك بإيقاف سيارة ذاتية القيادة، أم توجيه ذراع روبوتية، أم إبراز منطقة في التصوير الطبي.
لقد أحدث ظهور التعلّم العميق تحولاً في اكتشاف الأجسام. فبدلاً من الاعتماد على قواعد مكتوبة يدوياً، تتعلّم النماذج الحديثة الأنماط مباشرةً من التعليقات التوضيحية والبيانات المرئية. وتعلّم هذه المجموعاتُ البيانات النماذجَ شكلَ الأجسام، ومواضع ظهورها المعتادة، وكيفية التعامل مع تحديات مثل الأجسام الصغيرة والمشاهد المزدحمة وظروف الإضاءة المتغيرة.
في الواقع، تستطيع أنظمة اكتشاف الأجسام المتطورة بدقة اكتشاف أجسام متعددة في آن واحد. وهذا يجعل اكتشاف الأجسام تقنية محورية في تطبيقات مثل القيادة الذاتية والروبوتات والرعاية الصحية والأتمتة الصناعية.
كيفية عمل مهام اكتشاف الأجسام#
مدخل نموذج اكتشاف الأجسام هو صورة، وقد تأتي من كاميرا أو إطار فيديو أو حتى مسح طبي. وتُعالَج الصورة المدخلة عبر شبكة عصبية، عادةً ما تكون شبكة عصبية التفافية (CNN)، مُدرَّبة على التعرّف على الأنماط في البيانات المرئية.
داخل الشبكة، تُحلَّل الصورة على مراحل. واستناداً إلى السمات التي يكتشفها، يتنبأ النموذج بالأجسام الموجودة ومواضع ظهورها.
تُمثَّل هذه التنبؤات باستخدام المربعات المحيطة، وهي مستطيلات تُرسم حول كل جسم مكتشف. ولكل مربع محيط، يعيّن النموذج تسمية فئة (مثل سيارة أو شخص أو كلب) ودرجة ثقة تشير إلى مدى يقينه من التنبؤ (ويمكن أيضاً اعتبارها احتمالاً).

الشكل 2. يمكن تصور تنبؤات اكتشاف الأجسام باستخدام المربعات المحيطة.
تعتمد العملية ككل بدرجة كبيرة على استخراج السمات. إذ يتعلّم النموذج تحديد الأنماط المرئية المفيدة، مثل الحواف والأشكال والأنسجة والخصائص المميزة الأخرى. وتُشفَّر هذه الأنماط في خرائط السمات، التي تساعد الشبكة على فهم الصورة عبر مستويات متعددة من التفاصيل.
اكتشاف الأجسام: مرحلتان ومرحلة واحدة#
اعتماداً على بنية النموذج، تستخدم كاشفات الأجسام استراتيجيات مختلفة لتحديد مواقع الأجسام، مع تحقيق توازن بين السرعة والدقة والتعقيد.
تركّز العديد من نماذج اكتشاف الأجسام، ولا سيما الكاشفات ثنائية المرحلة مثل Faster R-CNN، على أجزاء محددة من الصورة تُسمى مناطق الاهتمام (ROIs). ومن خلال التركيز على هذه المناطق، يعطي النموذج الأولوية للمناطق الأكثر احتمالاً لاحتواء أجسام، بدلاً من تحليل كل بكسل بالقدر نفسه.
من ناحية أخرى، لا تختار النماذج أحادية المرحلة، مثل نماذج YOLO المبكرة، مناطق اهتمام محددة كما تفعل النماذج ثنائية المرحلة. بل تقسّم الصورة إلى شبكة وتستخدم مربعات محددة مسبقاً تُسمى مربعات الارتكاز، إلى جانب خرائط السمات، للتنبؤ بالأجسام عبر الصورة بأكملها في مرور واحد.
تستكشف نماذج اكتشاف الأجسام المتطورة اليوم أساليب خالية من الارتكازات. فعلى خلاف النماذج أحادية المرحلة التقليدية التي تعتمد على مربعات ارتكاز محددة مسبقاً، تتنبأ النماذج الخالية من الارتكازات بمواقع الأجسام وأحجامها مباشرةً من خرائط السمات. ويمكن أن يبسط ذلك البنية، ويقلل العبء الحسابي، ويحسّن الأداء، ولا سيما عند اكتشاف أجسام مختلفة الأشكال والأحجام.
نظرة على أفضل نماذج اكتشاف الأجسام#
توجد اليوم نماذج عديدة لاكتشاف الأجسام، وقد صُمم كل منها لتحقيق أهداف محددة. فبعضها مُحسّن للأداء الآني، بينما يركّز بعضها الآخر على تحقيق أعلى دقة ممكنة. وغالباً ما يعتمد اختيار النموذج المناسب لحلّ من حلول الرؤية الحاسوبية على حالة الاستخدام ومتطلبات الأداء الخاصة بك.
بعد ذلك، سنستكشف بعضاً من أفضل نماذج اكتشاف الأجسام لعام 2026.
1. نماذج Ultralytics YOLO#
تُعد عائلة نماذج Ultralytics YOLO إحدى أكثر عائلات نماذج اكتشاف الأجسام استخداماً اليوم. ويحظى YOLO، الذي يرمز إلى You Only Look Once، بشعبية في مختلف القطاعات لأنه يقدّم أداءً قوياً في الاكتشاف، مع الحفاظ على السرعة والموثوقية وسهولة الاستخدام.
تضم عائلة Ultralytics YOLO كلاً من Ultralytics YOLOv5 وUltralytics YOLOv8 وUltralytics YOLO11 وUltralytics YOLO26 المرتقب، ما يوفّر مجموعة من الخيارات لمتطلبات الأداء وحالات الاستخدام المختلفة. وبفضل تصميمها خفيف الوزن وتحسينات السرعة فيها، تُعد نماذج Ultralytics YOLO مثالية للاكتشاف الآني، ويمكن نشرها على الأجهزة الطرفية ذات القدرة المحدودة على الحوسبة والذاكرة.

الشكل 3. استخدام Ultralytics YOLO11 لاكتشاف الأجسام (المصدر)
بالإضافة إلى اكتشاف الأجسام الأساسي، تتميز هذه النماذج بمرونة كبيرة. فهي تدعم أيضاً مهام مثل تقسيم المثيلات، الذي يحدّد الأجسام على مستوى البكسل، وتقدير الوضعية، الذي يحدد النقاط الرئيسية على الأشخاص أو الأجسام. وتجعل هذه المرونة نماذج Ultralytics YOLO خياراً مفضلاً لمجموعة واسعة من التطبيقات، من الزراعة والخدمات اللوجستية إلى البيع بالتجزئة والتصنيع.
ومن الأسباب الرئيسية الأخرى لشعبية نماذج Ultralytics YOLO حزمة Ultralytics Python، التي توفّر واجهة بسيطة وسهلة الاستخدام لتدريب النماذج وضبطها الدقيق ونشرها. ويمكن للمطورين البدء بأوزان مُدرَّبة مسبقاً، وتخصيص النماذج لمجموعات بياناتهم الخاصة، ونشرها باستخدام بضعة أسطر من التعليمات البرمجية فقط.
2. RT-DETR وRT-DETRv2#
إن RT‑DETR (كاشف Transformer في الزمن الحقيقي) وRT‑DETRv2 الأحدث هما نموذجا اكتشاف أجسام مصممان للاستخدام الآني. وعلى خلاف كثير من النماذج التقليدية، يستطيعان استقبال صورة وإخراج الاكتشافات النهائية مباشرةً من دون استخدام كبت غير الأقصى (NMS).
إن NMS خطوة تزيل المربعات المتداخلة الزائدة عندما يتنبأ النموذج بالجسم نفسه أكثر من مرة. ويجعل تجاوز NMS عملية الاكتشاف أبسط وأسرع.
تجمع هذه النماذج بين CNNs والمحوّلات. إذ تكتشف CNN التفاصيل المرئية مثل الحواف والأشكال، بينما يُعد Transformer نوعاً من الشبكات العصبية القادرة على النظر إلى الصورة بأكملها دفعة واحدة وفهم كيفية ارتباط أجزائها المختلفة بعضها ببعض. ويتيح هذا الفهم الشامل للنموذج اكتشاف الأجسام المتقاربة أو المتداخلة.
يحسّن RT‑DETRv2 النموذج الأصلي بميزات مثل الاكتشاف متعدد المقاييس، الذي يساعد على العثور على الأجسام الصغيرة والكبيرة على حد سواء، والتعامل الأفضل مع المشاهد المعقدة. وتحافظ هذه التغييرات على سرعة النموذج مع تحسين الدقة.
3. RF-DETR#
RF‑DETR هو نموذج آني قائم على Transformer، صُمم للجمع بين دقة بنيات Transformer والسرعة اللازمة للتطبيقات الواقعية. وكما هي الحال في RT‑DETR وRT‑DETRv2، يستخدم Transformer لتحليل الصورة بأكملها وCNN لاستخراج السمات المرئية الدقيقة مثل الحواف والأشكال والأنسجة.
يتنبأ النموذج بالأجسام مباشرةً من الصورة المدخلة، متجاوزاً مربعات الارتكاز وكبت غير الأقصى، ما يبسّط عملية الاكتشاف ويحافظ على سرعة الاستدلال. ويدعم RF‑DETR أيضاً تقسيم المثيلات، مما يتيح له تحديد الأجسام على مستوى البكسل، بالإضافة إلى التنبؤ بالمربعات المحيطة.
4. EfficientDet#
أُطلق EfficientDet في أواخر عام 2019، وهو نموذج لاكتشاف الأجسام صُمم لتحقيق تحجيم فعّال وأداء عالٍ. وما يميز EfficientDet هو التحجيم المركب، وهو أسلوب يُحجّم دقة الإدخال وعمق الشبكة وعرضها في الوقت نفسه، بدلاً من ضبط عامل واحد فقط. ويساعد هذا النهج النموذج على الحفاظ على دقة مستقرة، سواء جرى توسيعه لمهام عالية الأداء أم تصغيره لعمليات نشر خفيفة الوزن.
ومن المكونات الرئيسية الأخرى في EfficientDet شبكة هرم السمات الفعّالة (FPN)، التي تتيح للنموذج تحليل الصور على مقاييس متعددة. ويُعد هذا التحليل متعدد المقاييس مهماً لاكتشاف الأجسام ذات الأحجام المختلفة، مما يمكّن EfficientDet من تحديد الأجسام الصغيرة والكبيرة داخل الصورة نفسها بصورة موثوقة.
5. PP-YOLOE+#
أُطلق PP-YOLOE+ في عام 2022، وهو نموذج لاكتشاف الأجسام بأسلوب YOLO، أي إنه يكتشف الأجسام ويصنفها في مرور واحد على الصورة. ويجعل هذا النهج النموذج سريعاً ومناسباً للتطبيقات الآنية، مع الحفاظ على دقة عالية.
يتمثل أحد التحسينات الرئيسية في PP-YOLOE+ في التعلّم المتوافق مع المهمة، الذي يساعد درجات ثقة النموذج على عكس مدى دقة تحديد مواقع الأجسام. ويُعد ذلك مفيداً بصفة خاصة لاكتشاف الأجسام الصغيرة أو المتداخلة.

الشكل 4. اكتشاف الأجسام باستخدام PP-YOLOE+ (المصدر)
يستخدم النموذج أيضاً بنية رأس مفصولة، تفصل بين مهمتَي التنبؤ بمواقع الأجسام وتسميات الفئات. ويتيح له ذلك رسم المربعات المحيطة بدقة أكبر مع تصنيف الأجسام تصنيفاً صحيحاً.
6. GroundingDINO#
GroundingDINO هو نموذج لاكتشاف الأجسام قائم على Transformer، يجمع بين الرؤية واللغة. وبدلاً من الاعتماد على مجموعة ثابتة من الفئات، يتيح للمستخدمين اكتشاف الأجسام باستخدام مطالبات نصية باللغة الطبيعية.
من خلال محاذاة السمات المرئية من صورة مع الأوصاف النصية، يستطيع النموذج تحديد مواقع الأجسام حتى إذا لم تكن تلك التسميات الدقيقة موجودة في بيانات تدريبه. وهذا يعني أنه يمكنك توجيه النموذج بأوصاف مثل «شخص يرتدي خوذة» أو «سيارة حمراء بالقرب من مبنى»، وسيُنشئ مربعات محيطة دقيقة حول الأجسام المطابقة.
وبفضل دعمه للاكتشاف صفري اللقطات، يقلل GroundingDINO أيضاً الحاجة إلى إعادة تدريب النموذج أو ضبطه بدقة لكل حالة استخدام جديدة، مما يجعله مرناً للغاية عبر مجموعة واسعة من التطبيقات. ويفتح هذا الجمع بين فهم اللغة والتعرّف المرئي إمكانات جديدة لأنظمة الذكاء الاصطناعي التفاعلية والمتكيفة.
المقاييس الشائعة المستخدمة لتقييم كاشفات الأجسام#
عند مقارنة نماذج مختلفة لاكتشاف الأجسام، قد تتساءل عن كيفية معرفة أيها يقدّم الأداء الأفضل فعلاً. وهذا سؤال وجيه، لأنه بالإضافة إلى بنية النموذج وجودة بياناتك، يمكن لعوامل عديدة أن تؤثر في الأداء.
يعتمد الباحثون غالباً على معايير قياس مشتركة ومقاييس أداء قياسية لتقييم النماذج باستمرار، ومقارنة النتائج، وفهم المفاضلات بين السرعة والدقة. وتكتسب معايير القياس القياسية أهمية خاصة لأن العديد من نماذج اكتشاف الأجسام تُقيّم على مجموعات البيانات نفسها، مثل مجموعة بيانات COCO.
قياس دقة الاكتشاف وسرعته#
إليك نظرةً أقرب على بعض المقاييس الشائعة المستخدمة لتقييم نماذج اكتشاف الأجسام:
- التقاطع على الاتحاد (IoU): يقيس هذا المقياس مقدار تداخل المربع المحيط المتنبأ به مع الجسم الفعلي في الصورة. ويقارن المربع الذي رسمه النموذج بالمربع المرجعي الحقيقي، أي موضع الجسم كما وُسِم في مجموعة البيانات. ويُحسب IoU بقسمة مساحة التداخل على مساحة اتحاد المربعين. وتشير قيمة IoU الأعلى إلى أن النموذج يضع المربع بدقة أكبر، بينما تعني القيمة الأقل أن التنبؤ أقل دقة. وبعبارة بسيطة، يوضح IoU مدى تطابق تنبؤات النموذج مع مواقع الأجسام الحقيقية.
- متوسط الدقة (mAP): هو المقياس الأساسي المستخدم لتقييم الأداء العام في اكتشاف الأجسام. ويأخذ في الاعتبار كلاً من عدد الأجسام التي يكتشفها النموذج بصورة صحيحة ودقة تلك الاكتشافات عبر مستويات ثقة وفئات أجسام مختلفة.
- الإطارات في الثانية (FPS) وزمن الاستجابة: يوضح FPS عدد الصور أو إطارات الفيديو التي يستطيع النموذج معالجتها في ثانية واحدة. فعلى سبيل المثال، يستطيع نموذج يعمل بسرعة 30 FPS معالجة 30 إطاراً كل ثانية. ويعني FPS الأعلى قدرة النظام على الاستجابة بسرعة أكبر، وهو أمر مهم لحالات استخدام مثل الفيديو المباشر ومراقبة حركة المرور والروبوتات. أما زمن الاستجابة، فيقيس المدة التي يستغرقها النموذج لمعالجة صورة أو إطار واحد، منذ لحظة استلامه حتى تصبح النتيجة جاهزة.
إيجابيات وسلبيات استخدام خوارزميات اكتشاف الأجسام#
فيما يلي بعض المزايا الرئيسية لاستخدام نماذج اكتشاف الأجسام في التطبيقات الواقعية:
- قابلة للتوسع عبر القطاعات: يمكن تطبيق اكتشاف الأجسام على مجموعة واسعة من حالات الاستخدام، بدءاً من مراقبة حركة المرور وتحليلات البيع بالتجزئة ووصولاً إلى الرعاية الصحية والزراعة والتصنيع.
- تقلل الجهد اليدوي: تؤدي أتمتة مهام الفحص والمراقبة المرئية إلى تقليل الحاجة إلى الإشراف البشري المستمر، وتساعد الفرق على التركيز في الأعمال الأعلى قيمة.
- تستفيد من منظومات المصادر المفتوحة: تجعل مجتمعات المصادر المفتوحة النشطة والموارد المتاحة على GitHub الوصول إلى النماذج المُدرَّبة مسبقاً والتجربة وتخصيص الحلول أمراً أسهل.
رغم هذه المزايا، توجد قيود عملية يمكن أن تؤثر في أداء نماذج اكتشاف الأجسام. وفيما يلي بعض العوامل المهمة التي ينبغي أخذها في الاعتبار:
- متطلبات البيانات عالية الجودة: تعتمد نماذج اكتشاف الأجسام على مجموعات بيانات كبيرة وموسومة جيداً للتدريب. وقد يستغرق إنشاء هذه البيانات وصيانتها وقتاً طويلاً، كما قد يكون مكلفاً وصعب التوسع.
- المتطلبات الحسابية: غالباً ما تتطلب النماذج التي تحقق دقة أعلى في الاكتشاف قدرة معالجة كبيرة، أثناء التدريب والنشر الآني على حد سواء. ويعني ذلك عادةً استخدام GPU عالية الأداء، مما قد يزيد تكاليف البنية التحتية.
- الحساسية للظروف الواقعية: يمكن أن تؤثر الاختلافات في الإضاءة وزوايا الكاميرا والطقس والمشاهد المزدحمة في أداء الاكتشاف، مما يجعل الاختبار والضبط المستمرين ضروريين.
أهم النقاط المستخلصة#
يعتمد أفضل نموذج لاكتشاف الأجسام لمشروع الرؤية الحاسوبية الخاص بك على حالة الاستخدام وإعداد البيانات ومتطلبات الأداء وقيود الأجهزة. فبعض النماذج مُحسّن للسرعة، بينما يركّز بعضها الآخر على الدقة، وتحتاج معظم التطبيقات الواقعية إلى تحقيق توازن بينهما. وبفضل أُطر المصادر المفتوحة والمجتمعات النشطة على GitHub، أصبح تقييم هذه النماذج وتكييفها ونشرها للاستخدام العملي أسهل.
لمعرفة المزيد، استكشف مستودع GitHub الخاص بنا. انضم إلى مجتمعنا واطّلع على صفحات حلولنا لقراءة المزيد عن تطبيقات مثل الذكاء الاصطناعي في الرعاية الصحية والرؤية الحاسوبية في قطاع السيارات. تعرّف على خيارات الترخيص الخاصة بنا للبدء باستخدام الذكاء الاصطناعي للرؤية اليوم.









