Object Tracking
تعلّم كيفية عمل تتبّع الكائنات في الرؤية الحاسوبية. واكتشف كيفية استخدام Ultralytics YOLO26 لتحديد الكائنات ومراقبتها باستخدام معرّفات فريدة للتحليل في الوقت الفعلي.
تتبع الأجسام هو عملية ديناميكية في الرؤية الحاسوبية (CV) تتضمن تحديد كيانات معينة في مقطع فيديو ومراقبة حركتها عبر سلسلة من الإطارات. وعلى خلاف تحليل الصور الثابتة، الذي يتعامل مع كل لقطة على حدة، يضيف التتبع بُعد الزمن. ويتيح ذلك لأنظمة الذكاء الاصطناعي (AI) تعيين رقم تعريف فريد (ID) لكل عنصر مكتشف—مثل سيارة أو شخص أو حيوان—والحفاظ على هويته أثناء تحرك الجسم أو تغيّر اتجاهه أو حجبه مؤقتًا. وتُعد هذه القدرة حجر الأساس في فهم الفيديو المتقدم، إذ تُمكّن الآلات من تحليل السلوك وحساب المسارات واستخلاص رؤى قابلة للتنفيذ من اللقطات الخام.
كيفية عمل تتبع الأجسام#
تستخدم أنظمة التتبع الحديثة عمومًا نهج «التتبع عبر الكشف». ويجمع سير العمل هذا بين نماذج كشف قوية وخوارزميات متخصصة لربط الكشوفات عبر الزمن. وتتبع العملية عادةً ثلاث مراحل رئيسية:
-
الكشف: في كل إطار، يمسح نموذج كشف الأجسام، مثل YOLO26 المتطور، الصورة لتحديد مواقع الأجسام محل الاهتمام. ويُخرج النموذج مربعات إحاطة تحدد الامتداد المكاني لكل جسم.
-
التنبؤ بالحركة: تقدّر خوارزميات مثل مرشح كالمان الموضع المستقبلي لجسم ما استنادًا إلى سرعته ومساره الحاليين. ويقلل هذا التنبؤ مساحة البحث في الإطار التالي، مما يجعل النظام أكثر كفاءة.
-
ربط البيانات: يطابق النظام الكشوفات الجديدة مع المسارات الحالية باستخدام أساليب التحسين، مثل الخوارزمية المجرية. وتعتمد هذه الخطوة غالبًا على مقاييس مثل التقاطع على الاتحاد (IoU) لقياس مقدار تداخل المربع المتنبأ به مع كشف جديد. وقد تستخدم أدوات التتبع المتقدمة أيضًا استخراج السمات البصرية لإعادة تحديد الأجسام المتشابهة في المظهر.
تتبع الأجسام مقابل كشف الأجسام#
رغم ارتباط هذين المصطلحين ارتباطًا وثيقًا، فإنهما يؤديان وظائف متميزة ضمن خط أنابيب تعلّم الآلة (ML).
- يجيب كشف الأجسام عن السؤال: «ما الموجود في هذه الصورة وأين يوجد؟» وهو عديم الحالة، أي لا يملك ذاكرة للإطارات السابقة. فإذا مرت سيارة عبر مقطع فيديو، يرى الكاشف «سيارة» في الإطار 1 و«سيارة» في الإطار 2، لكنه لا يعرف أنهما المركبة نفسها.
- يجيب تتبع الأجسام عن السؤال: «إلى أين يتجه هذا الجسم المحدد؟» وهو ذو حالة. إذ يربط بين «السيارة» في الإطار 1 و«السيارة» في الإطار 2، مما يتيح للنظام تسجيل أن «معرّف السيارة #42» يتحرك من اليسار إلى اليمين. ويُعد ذلك ضروريًا لمهام مثل النمذجة التنبؤية والعد.
التطبيقات الواقعية#
تتيح القدرة على الحفاظ على هوية الجسم تطبيقات معقدة لـالاستدلال في الوقت الفعلي عبر مختلف القطاعات.
- أنظمة النقل الذكية: يُعد التتبع أمرًا حيويًا لكي تتنقل المركبات ذاتية القيادة بأمان. ومن خلال تتبع المشاة والمركبات الأخرى، تستطيع السيارات التنبؤ بالتصادمات المحتملة. علاوةً على ذلك، يستخدم مهندسو المرور هذه الأنظمة في تقدير السرعة لفرض لوائح السلامة وتحسين انسيابية حركة المرور.
- تحليلات البيع بالتجزئة: تستخدم المتاجر التقليدية الذكاء الاصطناعي في البيع بالتجزئة لفهم سلوك العملاء. ويتيح التتبع لمديري المتاجر إجراء عدّ الأجسام لقياس حركة الزوار، وتحليل أوقات مكوثهم أمام العروض باستخدام الخرائط الحرارية، وتحسين إدارة الطوابير لتقليل أوقات الانتظار.
- تحليل الرياضة: في الرياضات الاحترافية، يستخدم المدربون التتبع بالاقتران مع تقدير الوضعية لتحليل الميكانيكا الحيوية للاعبين وتشكيلات الفرق. وتوفر هذه البيانات ميزة تنافسية من خلال الكشف عن أنماط لا تراها العين المجردة.
تنفيذ التتبع باستخدام Python#
تجعل Ultralytics تنفيذ التتبع عالي الأداء أمرًا بسيطًا. ويتولى الوضع track في المكتبة تلقائيًا مهام الكشف والتنبؤ بالحركة وتعيين المعرّفات. يوضح المثال أدناه كيفية استخدام نموذج YOLO26 المتوافق مع منصة Ultralytics لتتبع الأجسام في مقطع فيديو.
from ultralytics import YOLO
# Load the official YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Track objects in a video file or webcam (source=0)
# 'show=True' displays the video with bounding boxes and unique IDs
results = model.track(source="https://ultralytics.com/images/bus.jpg", show=True)
# Access the unique tracking IDs from the results
if results[0].boxes.id is not None:
print(f"Detected Track IDs: {results[0].boxes.id.cpu().numpy()}")المفاهيم ذات الصلة#
لفهم منظومة التتبع فهمًا كاملًا، من المفيد استكشاف التقسيم الدلالي للكائنات، الذي يتتبع الخطوط الخارجية الدقيقة للجسم على مستوى البكسل بدلًا من تتبع مربع فحسب. بالإضافة إلى ذلك، تتضمن تحديات تتبع الأجسام المتعددة (MOT) غالبًا معايير مرجعية واسعة الاستخدام، مثل MOTChallenge، لتقييم مدى جودة تعامل الخوارزميات مع المشاهد المزدحمة وحالات الحجب. وللنشر في بيئات الإنتاج، يستخدم المطورون عادةً أدوات مثل NVIDIA DeepStream أو OpenCV لدمج هذه النماذج في خطوط أنابيب فعّالة.









