Anchor Boxes
تعلّم كيف تعمل الصناديق المرساة كقوالب مرجعية لاكتشاف الأجسام. اكتشف كيف تحسّن الدقة وكيف تستخدم نماذج مثل Ultralytics YOLO26 تصاميم لا تعتمد على المراسي.
الصناديق المرساة هي مستطيلات مرجعية محددة مسبقًا، ذات نسب أبعاد ومقاييس معينة، تُوزَّع عبر الصورة لمساعدة نماذج اكتشاف الكائنات على تحديد الكائنات وتصنيفها. وبدلًا من مطالبة شبكة عصبية بالتنبؤ بالحجم والموضع الدقيقين للكائن من الصفر—وهو ما قد يكون غير مستقر بسبب التنوع الهائل في أشكال الكائنات—يستخدم النموذج هذه القوالب الثابتة كنقطة بداية. ومن خلال تعلم مقدار تعديل هذه الصناديق الأولية، أو "إجراء الانحدار" عليها، لتلائم الحقيقة الأرضية، يستطيع النظام تحقيق تقارب أسرع ودقة أعلى. وقد أحدثت هذه التقنية تحولًا جوهريًا في مجال الرؤية الحاسوبية (CV) من خلال تبسيط مهمة التموقع المعقدة وتحويلها إلى مسألة تحسين أكثر قابلية للإدارة.
آلية عمل الصناديق المرساة#
في كاشفات الكائنات القائمة على الصناديق المرساة التقليدية، تُقسَّم صورة الإدخال إلى شبكة من الخلايا. وعند موضع كل خلية، تُنشئ الشبكة عدة صناديق مرساة ذات أشكال هندسية مختلفة. فعلى سبيل المثال، لاكتشاف مشاة طويل وسيارة عريضة في الوقت نفسه، قد يقترح النموذج صندوقًا طويلًا وضيقًا وصندوقًا قصيرًا وعريضًا لهما نقطة المركز نفسها.
أثناء تدريب النموذج، تُطابَق هذه الصناديق المرساة مع الكائنات الفعلية باستخدام مقياس يُسمى التقاطع على الاتحاد (IoU). وتُعيَّن الصناديق المرساة التي تتداخل بدرجة كبيرة مع كائن مُعنون بوصفها عينات "إيجابية". ثم تتعلم الشبكة مهمتين متوازيتين:
-
التصنيف: تُسنِد درجة احتمالية إلى الصندوق المرساة، تشير إلى احتمال احتوائه على فئة محددة (مثل "كلب" أو "دراجة"). ويستخدم ذلك أهداف التعلم الخاضع للإشراف القياسية، مثل خسارة الانتروبيا المتقاطعة.
-
انحدار الصندوق: تحسب قيم الإزاحة الدقيقة (إزاحات الإحداثيات وعوامل القياس) اللازمة لتحويل الصندوق المرساة العام إلى صندوق إحاطة محكم الملاءمة.
يتيح هذا النهج للنموذج التعامل مع عدة كائنات مختلفة الأحجام تقع بالقرب من بعضها، إذ يمكن إسناد كل كائن إلى الصندوق المرساة الذي يطابق شكله على أفضل نحو.
التطبيقات الواقعية#
على الرغم من أن البنى الأحدث تتجه نحو تصميمات خالية من الصناديق المرساة، تظل الصناديق المرساة أساسية في العديد من أنظمة الإنتاج الراسخة التي يمكن التنبؤ بخصائص الكائنات فيها.
- تجارة التجزئة وإدارة المخزون: في حلول تجارة التجزئة المدعومة بالذكاء الاصطناعي، تراقب الكاميرات مخزون الرفوف. ونظرًا إلى أن منتجات مثل علب الحبوب أو عبوات المشروبات الغازية لها أبعاد معيارية، يمكن ضبط الصناديق المرساة وفق نسب الأبعاد المحددة هذه. وتساعد هذه المعرفة المسبقة النموذج على الحفاظ على استدعاء مرتفع حتى في البيئات المزدحمة.
- القيادة الذاتية: تعتمد حزم الإدراك في المركبات ذاتية القيادة على اكتشاف المشاة والمركبات وإشارات المرور. وبما أن السيارة التي تُرى من مسافة بعيدة تتمتع بملف شكلي متسق نسبيًا مقارنة بالطريق، فإن استخدام صناديق مرساة مهيأة لهذه الأشكال يضمن تتبع الكائنات وتقدير المسافة بموثوقية.
القائم على الصناديق المرساة مقابل الخالي منها#
من المهم التمييز بين الأساليب التقليدية القائمة على الصناديق المرساة وكاشفات الكائنات الخالية من الصناديق المرساة الحديثة.
- القائم على الصناديق المرساة: تستخدم نماذج مثل Faster R-CNN الأصلية أو إصدارات YOLO المبكرة (مثل Ultralytics YOLOv5) هذه القوالب المحددة مسبقًا. وهي متينة، لكنها تتطلب غالبًا ضبطًا يدويًا للمعلمات الفائقة (أحجام الصناديق المرساة ونسبها) أو خوارزميات تجميع مثل التجميع باستخدام k-means للتكيف مع مجموعات البيانات الجديدة.
- الخالي من الصناديق المرساة: غالبًا ما تستخدم النماذج المتقدمة، بما في ذلك YOLO26، أساليب خالية من الصناديق المرساة أو أساليب من طرف إلى طرف. وتتنبأ هذه الشبكات بمراكز الكائنات أو النقاط الرئيسية مباشرةً، ما يلغي الحاجة إلى إعداد الصناديق المرساة يدويًا. وهذا يبسط البنية ويسرّع الاستدلال من خلال إزالة العمليات الحسابية اللازمة لمعالجة آلاف الصناديق المرساة الفارغة الخاصة بالخلفية.
مثال: الوصول إلى معلومات الصناديق المرساة#
مع أن واجهات برمجة التطبيقات عالية المستوى الحديثة مثل منصة Ultralytics تخفي هذه التفاصيل أثناء التدريب، فإن فهم الصناديق المرساة مفيد عند العمل مع بُنى النماذج الأقدم أو تحليل ملفات إعداد النموذج. يوضح المقتطف التالي كيفية تحميل نموذج وفحص إعداده، حيث تُحدَّد عادةً إعدادات الصناديق المرساة، إن وُجدت.
from ultralytics import YOLO
# Load a pre-trained YOLO model (YOLO26 is anchor-free, but legacy configs act similarly)
model = YOLO("yolo26n.pt")
# Inspect the model's stride, which relates to grid cell sizing in detection
print(f"Model strides: {model.model.stride}")
# For older anchor-based models, anchors might be stored in the model's attributes
# Modern anchor-free models calculate targets dynamically without fixed boxes
if hasattr(model.model, "anchors"):
print(f"Anchors: {model.model.anchors}")
else:
print("This model architecture is anchor-free.")التحديات والاعتبارات#
على الرغم من فعاليتها، تضيف الصناديق المرساة تعقيدًا. فالعدد الهائل من الصناديق المرساة المُنشأة—والذي يبلغ غالبًا عشرات الآلاف لكل صورة—يُنشئ مشكلة اختلال في توازن الفئات، إذ لا يغطي معظم الصناديق المرساة سوى الخلفية. وتُستخدم تقنيات مثل الخسارة البؤرية للتخفيف من ذلك عبر تقليل أوزان أمثلة الخلفية السهلة. بالإضافة إلى ذلك، يتطلب الناتج النهائي عادةً القمع غير الأعظمي (NMS) لتصفية الصناديق المتداخلة الزائدة، بما يضمن بقاء الاكتشاف الأكثر ثقة لكل كائن فقط.









