Multi-Object Tracking (MOT)
استكشف تتبّع الكائنات المتعددة (MOT) في الرؤية الحاسوبية. وتعلّم كيفية اكتشاف الكيانات وتتبعها باستخدام Ultralytics YOLO26 للقيادة الذاتية وتجارة التجزئة وغير ذلك.
التتبع متعدد الكائنات (MOT) هو مهمة ديناميكية في الرؤية الحاسوبية (CV) تتضمن اكتشاف كيانات متعددة ومتميزة ضمن دفق فيديو والحفاظ على هوياتها بمرور الوقت. وعلى خلاف اكتشاف الكائنات القياسي، الذي يتعامل مع كل إطار باعتباره لقطة معزولة، يضيف MOT بُعدًا زمنيًا إلى الذكاء الاصطناعي (AI). ومن خلال إسناد رقم تعريف فريد (ID) إلى كل مثيل مكتشف—مثل مشاة محدد ضمن حشد أو مركبة على طريق سريع—تتيح خوارزميات MOT للأنظمة تتبع المسارات وتحليل السلوك وفهم التفاعلات. وتُعد هذه القدرة أساسية لفهم الفيديو الحديث، كما تمكّن الآلات من إدراك الاستمرارية في بيئة متغيرة.
آلية عمل MOT#
تعمل معظم أنظمة التتبع الحديثة وفق نموذج «التتبع عبر الاكتشاف». ويقسّم هذا النهج العملية إلى مرحلتين رئيسيتين: تحديد ما يوجد في الإطار، ثم ربط تلك النتائج بالكائنات المعروفة من الماضي.
-
الاكتشاف: في كل إطار، يفحص نموذج عالي الأداء مثل YOLO26 الصورة لتحديد مواقع الكائنات، وينشئ مربعات الإحاطة واحتمالات الفئات.
-
التنبؤ بالحركة: لاستباق الموضع الذي سيتحرك إليه الكائن، تستخدم الخوارزميات غالبًا مرشح كالمان. وتقدّر هذه الأداة الرياضية حالة نظام ديناميكي—مثل السرعة والموضع—مما يساعد على تضييق نطاق البحث في الإطار التالي.
-
ربط البيانات: يطابق النظام الاكتشافات الجديدة مع المسارات الحالية. وتحل أساليب التحسين، مثل الخوارزمية الهنغارية، مسألة الإسناد هذه عبر تقليل تكلفة المطابقة، وغالبًا ما تعتمد على نسبة التقاطع إلى الاتحاد (IoU) لقياس التداخل المكاني.
-
إعادة التعرّف (ReID): عند حدوث عوائق بصرية—تُعرف باسم الحجب—يستخدم المتتبعون المتقدمون التضمينات البصرية للتعرّف على الكائن عند ظهوره مجددًا. ويساعد ذلك على منع «تبديل المعرّفات»، مما يضمن أن النظام يعرف أن السيارة الخارجة من النفق هي نفسها التي دخلته.
التمييز بين MOT وتتبع كائن واحد#
على الرغم من تشابه المصطلحات، يختلف التتبع متعدد الكائنات (MOT) اختلافًا كبيرًا عن تتبع كائن واحد (SOT). يركّز SOT على متابعة هدف محدد واحد جرى تحديده في الإطار الأول، وغالبًا ما يتجاهل جميع الكيانات الأخرى. وعلى النقيض، يجب على MOT التعامل مع عدد غير معروف ومتغير من الأهداف التي قد تدخل المشهد أو تغادره في أي وقت. وهذا يجعل MOT أكثر تطلبًا من الناحية الحاسوبية، إذ يتطلب منطقًا متينًا للتعامل مع بدء المسارات وإنهائها والتفاعلات المعقدة بين الأجسام المتحركة المتعددة.
التطبيقات الواقعية#
تدفع القدرة على تتبع كيانات متعددة في الوقت نفسه عجلة الابتكار في عدد من الصناعات الرئيسية.
- القيادة الذاتية: تعتمد السيارات ذاتية القيادة اعتمادًا كبيرًا على MOT للتنقل بأمان. ومن خلال تتبع المشاة وراكبي الدراجات والمركبات الأخرى، تستطيع الأنظمة الذاتية التنبؤ بالمواضع المستقبلية لتجنب التصادمات. وغالبًا ما يتضمن ذلك دمج البيانات الواردة من الكاميرات ومستشعرات LiDAR لتحقيق أقصى قدر من الموثوقية.
- تحليلات البيع بالتجزئة: في المتاجر الفعلية، يستخدم تجار التجزئة الذكاء الاصطناعي في قطاع البيع بالتجزئة لرسم مسارات العملاء. وتنشئ خوارزميات MOT خرائط حرارية لحركة المتسوقين، مما يساعد المديرين على تحسين تصميمات المتاجر وتطوير إدارة قوائم الانتظار خلال ساعات الذروة.
- التحليلات الرياضية: تستخدم الفرق المحترفة MOT لتحليل تحركات اللاعبين وتشكيلات الفريق. ومن خلال تتبع كل لاعب في الملعب، يستطيع المدربون استخراج مقاييس تفصيلية للسرعة والمسافة المقطوعة والتموضع التكتيكي باستخدام تقنيات تقدير الوضعية.
تطبيق MOT باستخدام Python#
تجعل Ultralytics تنفيذ التتبع باستخدام أحدث النماذج أمرًا مباشرًا. وتدمج طريقة track() منطق الاكتشاف والتتبع بسلاسة، مع دعم خوارزميات مثل ByteTrack وBoT-SORT. يوضح المثال أدناه تتبع المركبات في فيديو باستخدام نموذج YOLO26 الموصى به.
from ultralytics import YOLO
# Load the official YOLO26 small model
model = YOLO("yolo26s.pt")
# Track objects in a video file (or use '0' for webcam)
# The 'persist=True' argument keeps track IDs consistent between frames
results = model.track(source="traffic_analysis.mp4", show=True, persist=True)
# Print the IDs of objects tracked in the first frame
if results[0].boxes.id is not None:
print(f"Tracked IDs: {results[0].boxes.id.int().tolist()}")التحديات في التتبع متعدد الكائنات#
على الرغم من التطورات، يظل MOT مجالًا مليئًا بالتحديات. يُعد الحجب صعوبة رئيسية؛ فعندما تتقاطع مسارات الكائنات أو تختبئ خلف العوائق، يصبح الحفاظ على الهوية أمرًا معقدًا. وتختبر المشاهد المكتظة، مثل سباق ماراثون مزدحم أو سرب من الطيور، حدود خوارزميات ربط البيانات. علاوة على ذلك، يتطلب الحفاظ على سرعات الاستدلال في الوقت الفعلي أثناء معالجة دفقات الفيديو عالية الدقة معماريات نماذج فعالة، وغالبًا أجهزة متخصصة مثل أجهزة NVIDIA Jetson.
لمواجهة هذه التحديات، يستكشف الباحثون أساليب التعلم العميق الشاملة من البداية إلى النهاية التي توحّد الاكتشاف والتتبع في شبكة واحدة، فضلًا عن الاستفادة من منصة Ultralytics لوضع تعليقات توضيحية على مجموعات البيانات الصعبة وتدريب نماذج مخصصة متينة.









