تطور اكتشاف الأجسام ونماذج YOLO من Ultralytics
انضم إلينا لإلقاء نظرة على تطور اكتشاف الأجسام. سنركز على كيفية تطور نماذج YOLO (ترى مرة واحدة فقط) خلال السنوات الأخيرة.

الرؤية الحاسوبية هي مجال فرعي من الذكاء الاصطناعي (AI) يركز على تعليم الآلات رؤية الصور ومقاطع الفيديو وفهمها، بطريقة مشابهة لإدراك البشر للعالم الحقيقي. في حين أن التعرف على الأجسام أو تحديد الأفعال أمر فطري بالنسبة إلى البشر، تتطلب هذه المهام تقنيات رؤية حاسوبية محددة ومتخصصة عند تنفيذها بواسطة الآلات. فعلى سبيل المثال، تتمثل إحدى المهام الأساسية في الرؤية الحاسوبية في اكتشاف الأجسام، الذي يتضمن تحديد الأجسام وتحديد مواقعها داخل الصور أو مقاطع الفيديو.
منذ ستينيات القرن العشرين، يعمل الباحثون على تحسين قدرة الحواسيب على اكتشاف الأجسام. كانت الأساليب المبكرة، مثل مطابقة القوالب، تتضمن تمرير قالب محدد مسبقًا عبر صورة للعثور على التطابقات. وعلى الرغم من ابتكارها، واجهت هذه الأساليب صعوبات مع التغيرات في حجم الجسم واتجاهه والإضاءة. أما اليوم، فلدينا نماذج متقدمة مثل Ultralytics YOLO11، القادرة على اكتشاف الأجسام الصغيرة والمخفية جزئيًا، المعروفة باسم الأجسام المحجوبة، بدقة لافتة.
مع استمرار الرؤية الحاسوبية في التطور، من المهم إلقاء نظرة على كيفية تطور هذه التقنيات. في هذه المقالة، سنستكشف تطور اكتشاف الأجسام ونسلط الضوء على تحول نماذج YOLO (تنظر مرة واحدة فقط). فلنبدأ!
نشأة الرؤية الحاسوبية#
قبل التعمق في اكتشاف الأجسام، لنلقِ نظرة على كيفية نشأة الرؤية الحاسوبية. تعود نشأة الرؤية الحاسوبية إلى أواخر خمسينيات القرن العشرين وأوائل ستينياته، عندما بدأ العلماء استكشاف كيفية معالجة الدماغ للمعلومات المرئية. وفي تجارب أُجريت على القطط، اكتشف الباحثان David Hubel وTorsten Wiesel أن الدماغ يستجيب لأنماط بسيطة مثل الحواف والخطوط. وقد شكّل ذلك أساس الفكرة الكامنة وراء استخراج السمات، أي مفهوم أن الأنظمة البصرية تكتشف السمات الأساسية في الصور، مثل الحواف، وتتعرف عليها قبل الانتقال إلى أنماط أكثر تعقيدًا.

الشكل 1. ساعد فهم كيفية استجابة دماغ القطة لأشرطة الضوء على تطوير استخراج السمات في الرؤية الحاسوبية.
في الفترة نفسها تقريبًا، ظهرت تقنية جديدة قادرة على تحويل الصور المادية إلى صيغ رقمية، ما أثار الاهتمام بكيفية معالجة الآلات للمعلومات المرئية. وفي عام 1966، دفع مشروع الرؤية الصيفي لمعهد ماساتشوستس للتكنولوجيا (MIT) هذا المجال إلى الأمام. وعلى الرغم من أن المشروع لم ينجح نجاحًا كاملًا، فقد هدف إلى إنشاء نظام يستطيع فصل المقدمة عن الخلفية في الصور. وبالنسبة إلى كثيرين في مجتمع الذكاء الاصطناعي للرؤية، يمثل هذا المشروع البداية الرسمية لـالرؤية الحاسوبية بوصفها مجالًا علميًا.
فهم تاريخ اكتشاف الأجسام#
مع تقدم الرؤية الحاسوبية في أواخر تسعينيات القرن العشرين وأوائل القرن الحادي والعشرين، انتقلت أساليب اكتشاف الأجسام من تقنيات أساسية مثل مطابقة القوالب إلى أساليب أكثر تقدمًا. وكانت Haar Cascade إحدى الأساليب الشائعة التي انتشر استخدامها في مهام مثل اكتشاف الوجوه. إذ كانت تعمل عبر مسح الصور باستخدام نافذة منزلقة، والتحقق من سمات محددة مثل الحواف أو الأنسجة في كل جزء من الصورة، ثم دمج هذه السمات من أجل اكتشاف أجسام مثل الوجوه. وكانت Haar Cascade أسرع بكثير من الأساليب السابقة.

الشكل 2. استخدام Haar Cascade لاكتشاف الوجوه.
إلى جانب هذه الأساليب، طُرحت أيضًا أساليب مثل المدرج التكراري للتدرجات الموجهة (HOG) وآلات المتجهات الداعمة (SVMs). استخدم HOG تقنية النافذة المنزلقة لتحليل كيفية تغير الضوء والظلال في أجزاء صغيرة من الصورة، ما ساعد على تحديد الأجسام استنادًا إلى أشكالها. ثم قامت SVMs بتصنيف هذه السمات لتحديد هوية الجسم. وقد حسّنت هذه الأساليب الدقة، لكنها ظلت تواجه صعوبات في البيئات الواقعية وكانت أبطأ مقارنة بتقنيات اليوم.
الحاجة إلى اكتشاف الأجسام في الوقت الفعلي#
في عقد 2010، أحدث ظهور التعلم العميق والشبكات العصبية الالتفافية (CNNs) تحولًا كبيرًا في اكتشاف الأجسام. وأتاحت CNNs للحواسيب تعلم السمات المهمة تلقائيًا من كميات كبيرة من البيانات، ما جعل الاكتشاف أكثر دقة بكثير.
كانت النماذج المبكرة مثل R-CNN (الشبكات العصبية الالتفافية القائمة على المناطق) تمثل تحسنًا كبيرًا في الدقة، إذ ساعدت على تحديد الأجسام بدقة أكبر من الأساليب الأقدم.
ومع ذلك، كانت هذه النماذج بطيئة لأنها تعالج الصور على مراحل متعددة، ما جعلها غير عملية للتطبيقات الفورية في مجالات مثل السيارات ذاتية القيادة أو المراقبة بالفيديو.
مع التركيز على تسريع العمليات، طُوّرت نماذج أكثر كفاءة. فقد ساعدت نماذج مثل Fast R-CNN وFaster R-CNN على تحسين طريقة اختيار المناطق ذات الاهتمام وتقليل عدد الخطوات اللازمة للاكتشاف. وعلى الرغم من أن ذلك جعل اكتشاف الأجسام أسرع، فإنه لم يكن سريعًا بما يكفي للعديد من التطبيقات الواقعية التي تحتاج إلى نتائج فورية. وقد دفع الطلب المتزايد على الاكتشاف في الوقت الفعلي إلى تطوير حلول أسرع وأكثر كفاءة، قادرة على تحقيق توازن بين السرعة والدقة.

الشكل 3. مقارنة سرعات R-CNN وFast R-CNN وFaster R-CNN.
نماذج YOLO (تنظر مرة واحدة فقط): محطة رئيسية#
YOLO هو نموذج لـاكتشاف الأجسام أعاد تعريف الرؤية الحاسوبية من خلال تمكين اكتشاف أجسام متعددة في الصور ومقاطع الفيديو في الوقت الفعلي، ما جعله مختلفًا تمامًا عن أساليب الاكتشاف السابقة. فبدلًا من تحليل كل جسم مكتشف على حدة، تتعامل بنية YOLO مع اكتشاف الأجسام بوصفه مهمة واحدة، إذ تتنبأ بموقع الأجسام وفئتها دفعة واحدة باستخدام CNNs.
يعمل النموذج على تقسيم الصورة إلى شبكة، بحيث يكون كل جزء مسؤولًا عن اكتشاف الأجسام في المنطقة الخاصة به. ويجري عدة تنبؤات لكل قسم، ثم يستبعد النتائج الأقل ثقة، مع الاحتفاظ بالنتائج الدقيقة فقط.

الشكل 4. نظرة عامة على كيفية عمل YOLO.
جعل إدخال YOLO إلى تطبيقات الرؤية الحاسوبية اكتشاف الأجسام أسرع وأكثر كفاءة بكثير من النماذج السابقة. وبفضل سرعته ودقته، أصبح YOLO سريعًا خيارًا شائعًا للحلول الفورية في صناعات مثل التصنيع والرعاية الصحية والروبوتات.
ومن النقاط المهمة الأخرى التي تجدر الإشارة إليها أن YOLO كان مفتوح المصدر، ما أتاح للمطورين والباحثين تحسينه باستمرار، وأدى إلى ظهور إصدارات أكثر تقدمًا.
المسار من YOLO إلى Ultralytics YOLO11#
تحسنت نماذج YOLO بثبات بمرور الوقت، إذ بُني كل إصدار على التطورات التي حققها الإصدار السابق. وإلى جانب تحسين الأداء، جعلت هذه التحسينات النماذج أسهل استخدامًا للأشخاص ذوي المستويات المختلفة من الخبرة التقنية.
فعلى سبيل المثال، عندما تم تقديم Ultralytics YOLOv5، أصبح نشر النماذج أبسط باستخدام PyTorch، ما أتاح لشريحة أوسع من المستخدمين العمل باستخدام الذكاء الاصطناعي المتقدم. وقد جمع بين الدقة وسهولة الاستخدام، ومنح مزيدًا من الأشخاص القدرة على تطبيق اكتشاف الأجسام دون الحاجة إلى أن يكونوا خبراء في البرمجة.

الشكل 5. تطور نماذج YOLO.
واصل Ultralytics YOLOv8 هذا التقدم بإضافة دعم لمهام مثل تقسيم الحالات وجعل النماذج أكثر مرونة. وأصبح استخدام YOLO في التطبيقات الأساسية والأكثر تعقيدًا أسهل، ما جعله مفيدًا في مجموعة متنوعة من السيناريوهات.
ومع أحدث نموذج، Ultralytics YOLO11، أُجريت تحسينات إضافية. فمن خلال تقليل عدد المعلمات مع تحسين الدقة، أصبح النموذج الآن أكثر كفاءة للمهام الفورية. وسواء كنت مطورًا متمرسًا أو جديدًا في مجال الذكاء الاصطناعي، يقدم YOLO11 نهجًا متقدمًا لاكتشاف الأجسام يسهل الوصول إليه.
التعرف على Ultralytics YOLO11: الميزات والتحسينات الجديدة#
يدعم YOLO11، الذي أُطلق خلال فعالية Ultralytics الهجينة السنوية، YOLO Vision 2024 (YV24)، مهام الرؤية الحاسوبية نفسها التي يدعمها YOLOv8، مثل اكتشاف الأجسام وتقسيم الحالات وتصنيف الصور وتقدير الوضعية. لذلك، يمكن للمستخدمين الانتقال بسهولة إلى هذا النموذج الجديد دون الحاجة إلى تعديل سير عملهم. بالإضافة إلى ذلك، تجعل البنية المحدّثة لـYOLO11 التنبؤات أكثر دقة. وفي الواقع، يحقق YOLO11m متوسط دقة (mAP) أعلى على مجموعة بيانات COCO باستخدام عدد معلمات أقل بنسبة 22% من YOLOv8m.
صُمم YOLO11 أيضًا للعمل بكفاءة على مجموعة من المنصات، بدءًا من الهواتف الذكية والأجهزة الطرفية الأخرى ووصولًا إلى الأنظمة السحابية الأقوى. وتضمن هذه المرونة أداءً سلسًا عبر مختلف تهيئات الأجهزة للتطبيقات الفورية. علاوة على ذلك، يتميز YOLO11 بسرعة وكفاءة أكبر، ما يقلل التكاليف الحاسوبية ويسرّع أوقات الاستدلال. وسواء كنت تستخدم حزمة Ultralytics Python أو Ultralytics HUB من دون برمجة، فمن السهل دمج YOLO11 في سير عملك الحالي.
مستقبل نماذج YOLO واكتشاف الأجسام#
بدأ تأثير اكتشاف الأجسام المتقدم على التطبيقات الفورية والذكاء الاصطناعي الطرفي يظهر بالفعل في مختلف الصناعات. ومع اعتماد قطاعات مثل النفط والغاز والرعاية الصحية والتجزئة على الذكاء الاصطناعي بدرجة متزايدة، يستمر الطلب على اكتشاف سريع ودقيق للأجسام في الارتفاع. ويهدف Ultralytics YOLO11 إلى تلبية هذا الطلب من خلال تمكين الاكتشاف عالي الأداء حتى على الأجهزة ذات القدرة الحاسوبية المحدودة.
مع نمو الذكاء الاصطناعي الطرفي، من المرجح أن تصبح نماذج اكتشاف الأجسام مثل Ultralytics YOLO11 أكثر أهمية لاتخاذ القرارات في الوقت الفعلي ضمن البيئات التي تكون فيها السرعة والدقة عاملين حاسمين. ومع التحسينات المستمرة في التصميم وقابلية التكيف، يبدو أن مستقبل اكتشاف الأجسام سيجلب مزيدًا من الابتكارات عبر مجموعة متنوعة من التطبيقات.
أهم النقاط المستخلصة#
قطع اكتشاف الأجسام شوطًا طويلًا، إذ تطور من أساليب بسيطة إلى تقنيات التعلم العميق المتقدمة التي نراها اليوم. وكانت نماذج YOLO في صميم هذا التقدم، إذ قدمت اكتشافًا فوريًا أسرع وأكثر دقة عبر مختلف الصناعات. ويبني Ultralytics YOLO11 على هذا الإرث، فيحسن الكفاءة ويقلل التكاليف الحاسوبية ويعزز الدقة، ما يجعله خيارًا موثوقًا لمجموعة متنوعة من التطبيقات الفورية. ومع التطورات المستمرة في الذكاء الاصطناعي والرؤية الحاسوبية، يبدو مستقبل اكتشاف الأجسام واعدًا، مع إمكانية تحقيق مزيد من التحسينات في السرعة والدقة وقابلية التكيف.
هل يثير الذكاء الاصطناعي فضولك؟ ابقَ على تواصل مع مجتمعنا لمواصلة التعلم! واطّلع على مستودعنا على GitHub لاكتشاف كيفية استخدامنا للذكاء الاصطناعي لإنشاء حلول مبتكرة في قطاعات مثل التصنيع والرعاية الصحية. 🚀









