Detection Head
تعلم كيف يتيح رأس الكشف (detection head) الكشف عن الكائنات في الوقت الفعلي. استكشف دوره في Ultralytics YOLO26 للتنبؤ بصناديق التحديد (bounding boxes) والتسميات بدقة عالية.
يعمل رأس الكشف كطبقة اتخاذ القرار النهائية في معمقية شبكة عصبية لاكتشاف الكائنات. وبينما تكون الطبقات الأبكر في النموذج مسؤولة عن فهم الأشكال، والمقوام، والميزات داخل الصورة، فإن رأس الكشف هو المكون المحدد الذي يفسر هذه المعلومات للتنبؤ بدقة بالأجسام الموجودة ومكان وجودها. فهو يحول البيانات المجردة وعالية المستوى التي ينتجها مستخرج الميزات إلى نتائج قابلة للتنفيذ، وغالبًا ما يخرج مجموعة من bounding boxes التي تحيط بالأجسام المحددة جنبًا إلى جنب مع تسميات فئاتها المقابلة وconfidence scores.
التمييز بين الرأس والعمود الفقري (Backbone) والعنق (Neck)#
لفهم وظيفة رأس الكشف بشكل كامل، من المفيد تصور الكواشف الحديثة على أنها تتكون من ثلاث مراحل أساسية، تؤدي كل منها غرضًا متميزًا في خط أنابيب computer vision (CV):
- العمود الفقري (Backbone): هذا هو الجزء الأولي من الشبكة، وعادة ما يكون Convolutional Neural Network (CNN) مثل ResNet أو CSPNet. وهو يعالج صورة الإدخال الخام لإنشاء feature maps تمثل الأنماط البصرية.
- العنق (Neck): يقع العنق بين العمود الفقري والرأس، ويعمل على تنقيح ودمج الميزات من مقاييس مختلفة. تضمن معمقيات مثل Feature Pyramid Network (FPN) قدرة النموذج على اكتشاف الأجسام ذات الأحجام المتفاوتة عن طريق تجميع السياق.
- الرأس (Head): هو المكون النهائي الذي يستهلك السمات المحسنة من العنق. ويقوم بتنفيذ المهمة الفعلية للتصنيف (ما هو هذا الشيء؟) والانحدار (أين يقع؟).
التطور: القائم على المراسٍ (Anchor-Based) مقابل الخالي من المراسٍ (Anchor-Free)#
لقد تطور تصميم رؤوس الكشف بشكل كبير لتحسين السرعة والدقة، لا سيما مع الانتقال من الطرق التقليدية إلى نماذج real-time inference الحديثة.
- رؤوس قائمة على المراسي (Anchor-Based Heads): اعتمدت one-stage object detectors التقليدية على anchor boxes محددة مسبقًا، وهي أشكال مرجعية ثابتة بأحجام مختلفة. وكان الرأس يتنبأ بمدى مد أو إزاحة هذه المراسي لتناسب الجسم. يتم تفصيل هذا النهج في الأبحاث الأساسية حول Faster R-CNN.
- رؤوس خالية من المراسي (Anchor-Free Heads): تستخدم النماذج الحديثة، بما في ذلك أحدث طراز YOLO26، anchor-free detectors. تتنبأ هذه الرؤوس بمراكز الأجسام وأبعادها مباشرة من البكسلات الموجودة في خرائط الميزات، مما يلغي الحاجة إلى ضبط المرساة يدويًا. يؤدي هذا إلى تبسيط المعمقية وتعزيز قدرة النموذج على التعميم على أشكال الأجسام الجديدة، وهي تقنية غالباً ما ترتبط بـ Fully Convolutional One-Stage Object Detection (FCOS).
تطبيقات العالم الحقيقي#
تعد دقة رأس الكشف أمرًا بالغ الأهمية لتنفيذ artificial intelligence (AI) في البيئات الحساسة للسلامة والصناعية. يمكن للمستخدمين بسهولة تعليق البيانات وتدريب هذه الرؤوس المتخصصة باستخدام Ultralytics Platform.
- القيادة الذاتية: في مجال AI for automotive، يكون رأس الكشف مسؤولاً عن التمييز بين المشاة وإشارات المرور والยานات الأخرى في الوقت الفعلي. يضمن الرأس المحسن للغاية أن يظل inference latency منخفضًا بما يكفي لتتفاعل السيارة على الفور.
- التشخيص الطبي: في medical image analysis، يتم ضبط رؤوس الكشف بدقة لتحديد الشذوذ مثل الأورام في صور الرنين المغناطيسي. يجب أن يكون فرع الانحدار دقيقًا للغاية لتحديد الحدود الدقيقة للآفة، مما يساعد الأطباء في healthcare solutions.
مثال برمجي#
يوضح المثال التالي كيفية تحميل نموذج YOLO26 فحص إخراج رأس الكشف الخاص به. عند تشغيل الاستدلال، يعالج الرأس الصورة ويعيد boxes النهائي الذي يحتوي على الإحداثيات ومعرفات الفئات.
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to utilize the detection head
results = model("https://ultralytics.com/images/bus.jpg")
# The detection head outputs are stored in results[0].boxes
for box in results[0].boxes:
# Print the bounding box coordinates and the predicted class
print(f"Class: {int(box.cls)}, Coordinates: {box.xywh.numpy()}")يسلط هذا التفاعل الضوء على كيف يترجم رأس الكشف تفعيلات الشبكة العصبية المعقدة إلى بيانات قابلة للقراءة يمكن للمطورين استخدامها للمهام اللاحقة مثل object tracking أو العد.






