Multi-Object Tracking (MOT)
استكشف تتبع الكائنات المتعددة (MOT) في رؤية الحاسوب. تعلم كيفية اكتشاف وتتبع الكيانات باستخدام Ultralytics YOLO26 للقيادة المستقلة، وتجارة التجزئة، والمزيد.
التعقب متعدد الكائنات (MOT) هو مهمة ديناميكية في رؤية الحاسوب (CV) تتضمن اكتشاف كيانات متعددة متميزة داخل تدفق فيديو والحفاظ على هوياتها بمرور الوقت. على عكس اكتشاف الكائنات القياسي، الذي يتعامل مع كل إطار كلقطة معزولة، يقدم التعقب متعدد الكائنات (MOT) بُعداً زمنيّاً لـالذكاء الاصطناعي (AI). من خلال تعيين رقم تعريف فريد (ID) لكل مثيل مكتشف—مثل مشاة معين في حشد أو مركبة على طريق سريع—تسمح خوارزميات التعقب متعدد الكائنات (MOT) للأنظمة بتتبع المسارات، وتحليل السلوك، وفهم التفاعلات. هذه القدرة أساسية لـفهم الفيديو الحديث وتمكن الآلات من إدراك الاستمرارية في بيئة متغيرة.
كيف يعمل MOT#
تعمل معظم أنظمة التتبع المعاصرة وفق نموذج "التتبع عبر الاكتشاف". يفصل هذا النهج العملية إلى مرحلتين رئيسيتين: تحديد ما يوجد في الإطار ثم ربط تلك النتائج بأجسام معروفة من الماضي.
-
الاكتشاف: في كل إطار، يقوم نموذج عالي الأداء مثل YOLO26 بمسح الصورة لتحديد مواقع الكائنات، مما يولد مربعات الإحاطة والاحتمالات الفئة.
-
تنبؤ الحركة: لتوقع المكان الذي ستحرك إليه الكلية بعد ذلك، غالباً ما تستخدم الخوارزميات مرشح كالمان. هذه الأداة الرياضية تقيس حالة نظام ديناميكي—مثل السرعة والموقع—مما يساعد في تضييق منطقة البحث في الإطار اللاحق.
-
ربط البيانات: يطابق النظام الاكتشافات الجديدة مع المسارات الحالية. تحل طرق التحسين مثل خوارزمية هنغاريا مشكلة التخصيص هذه عن طريق تقليل تكلفة المطابقة، وغالباً ما تعتمد على التقاطع على الاتحاد (IoU) لقياس التداخل المكاني.
-
إعادة التعريف (ReID): عند حدوث عوائق مرئية—المعروفة باسم الانسداد—تستخدم أدوات التتبع المتقدمة التضمينات المرئية التعرف على الكائن عندما يظهر مرة أخرى. يساعد هذا في منع "تبديل معرّف الهوية (ID)"، مما يضمن معرفة النظام بأن السيارة التي تخرج من نفق هي نفس السيارة التي دخلت إليه.
التمييز بين MOT وتتبع الجسم الواحد#
في حين أن المصطلحات متشابهة، فإن التعقب متعدد الكائنات (MOT) يختلف بشكل كبير عن التعقب أحادي الكائن (SOT). يركز التعقب أحادي الكائن (SOT) على تتبع هدف معين واحد يتم تهيئته في الإطار الأول، وغالباً ما يتجاهل جميع الكيانات الأخرى. في المقابل، يجب أن يتعامل التعقب متعدد الكائنات (MOT) مع عدد مجهول ومتغير من الأهداف التي قد تدخل المشهد أو تغادره في أي وقت. هذا يجعل التعقب متعدد الكائنات (MOT) أكثر تطلباً من الناحية الحسابية، لأنه يتطلب منطقاً قوياً للتعامل مع بدء المسار وإنهاؤه والتفاعلات المعقدة بين الأجسام المتحركة متعددة.
تطبيقات العالم الحقيقي#
تُحفز القدرة على تتبع كيانات متعددة في وقت واحد الابتكار عبر العديد من الصناعات الرئيسية.
- القيادة الذاتية: تعتمد السيارات ذاتية القيادة بشكل كبير على التعقب متعدد الكائنات (MOT) للتنقل بأمان. من خلال تتبع المشاة وراكبي الدراجات والمركبات الأخرى، يمكن لـالأنظمة المستقلة التنبؤ المواقع المستقبلية لتجنب الاصطدامات. يتضمن ذلك غالباً دمج البيانات من الكاميرات ومستشعرات ليدار لأقصى موثوقية.
- تحليلات التجزئة: في المتاجر الفعلية، يستخدم تجار التجزئة الذكاء الاصطناعي في التجزئة لتخطيط رحلات العملاء. تولد خوارزميات التعقب متعدد الكائنات (MOT) خرائط الحرارة لحركة المشاة، مما يساعد المديرين على تحسين تخطيطات المتاجر وتحسين إدارة الطوابير خلال ساعات الذروة.
- تحليلات الرياضة: تستخدم الفرق المهنية التعقب متعدد الكائنات (MOT) لتحليل حركات اللاعبين وتشكيلات الفرق. من خلال تتبع كل لاعب في الملعب، يمكن للمدربين استخراج مقاييس تفصيلية للسرعة والمسافة المقطوعة والتموضع التكتيكي باستخدام تقنيات تقدير الوضعية.
تنفيذ MOT باستخدام Python#
تسهل Ultralytics تنفيذ التتبع باستخدام نماذج حديثة. تدمج طريقة track() منطق الاكتشاف والتتبع بسلاسة، وتدعم خوارزميات مثل ByteTrack وBoT-SORT. يوضح المثال أدناه تتبع المركبات في فيديو باستخدام نموذج YOLO26 الموصى به.
from ultralytics import YOLO
# Load the official YOLO26 small model
model = YOLO("yolo26s.pt")
# Track objects in a video file (or use '0' for webcam)
# The 'persist=True' argument keeps track IDs consistent between frames
results = model.track(source="traffic_analysis.mp4", show=True, persist=True)
# Print the IDs of objects tracked in the first frame
if results[0].boxes.id is not None:
print(f"Tracked IDs: {results[0].boxes.id.int().tolist()}")تحديات في تتبع الأجسام المتعددة#
على الرغم من التطورات، يظل التعقب متعدد الكائنات (MOT) مجالاً صعباً. الانسداد هو صعوبة رئيسية؛ عندما تتقاطع المسارات أو تختفي الكائنات خلف العوائق، يكون الحفاظ على الهوية أمراً معقداً. تختبر المشاهد المزدحمة، مثل ماراثون مزدحم أو سرب من الطيور، حدود خوارزميات ربط البيانات. علاوة على ذلك، يتطلب الحفاظ على سرعات الاستدلال الفوري أثناء معالجة تدفقات الفيديو عالية الدقة بنيات نماذج فعالة وغالباً أجهزة متخصصة مثل أجهزة NVIDIA Jetson.
لمعالجة هذه التحديات، يستكشف الباحثون نهج التعلم العميق من البداية إلى النهاية التي توحد الاكتشاف والتتبع في شبكة واحدة، بالإضافة إلى الاستفادة من منصة Ultralytics لتوضيح مجموعات البيانات الصعبة وتدريب نماذج مخصصة قوية.






