Point Tracking
استكشف أساسيات تتبّع النقاط في الرؤية الحاسوبية. وتعلّم كيف يتتبع Ultralytics YOLO26 ونماذج الذكاء الاصطناعي المتقدمة الحركة الدقيقة في الروبوتات والمؤثرات البصرية.
تتبّع النقاط هو مهمة أساسية في الرؤية الحاسوبية تتضمن تقدير حركة نقاط محددة وموضعية (مثل وحدات البكسل أو السمات المميزة) ومتابعتها عبر الإطارات المتتالية في تسلسل فيديو بمرور الوقت. وعلى خلاف تتبّع الكائنات، الذي يراقب الموقع العام للكيانات بأكملها باستخدام الصناديق المحيطة أو أقنعة التجزئة، يركّز تتبّع النقاط على مستوى أدق بكثير من التفاصيل، يصل إلى مستوى ما دون البكسل. ومن خلال تحديد أوجه التطابق بين هذه المواقع الدقيقة والحفاظ عليها، تستطيع أنظمة الذكاء الاصطناعي (AI) تنفيذ مهام متقدمة في فهم الفيديو تتطلب تحليلًا دقيقًا للحركة.
فهم تتبّع النقاط#
يمثل تتبّع النقاط بدقة في مشهد ديناميكي تحديًا كبيرًا. فكثيرًا ما تتعرض النقاط المتتبَّعة إلى الحجب—حيث تحجب الكائنات رؤية الكاميرا مؤقتًا—أو قد تغادر مجال الرؤية بالكامل. بالإضافة إلى ذلك، يمكن أن تؤدي التغيرات في الإضاءة، وتحولات المنظور، والحركات السريعة إلى تغيير المظهر المرئي للنقطة بشكل كبير.
تاريخيًا، عالجت خوارزميات تقليدية مثل التدفق البصري لـ Lucas-Kanade هذه المهام. أما الأساليب الحديثة فتستخدم بنيات قوية في التعلم العميق. وقد أحدثت الابتكارات الحديثة من مؤسسات بحثية كبرى، مثل TAPIR من Google DeepMind (تتبّع أي نقطة مع التهيئة والتنقيح) وCoTracker3 من Meta AI، ثورة في هذا المجال. وعلى خلاف الأساليب الأقدم التي كانت تتتبّع النقاط بشكل مستقل، تستخدم نماذج مثل CoTracker3 نماذج Transformer لإجراء تتبّع مشترك لنقاط متعددة، مستفيدةً من الترابطات الفيزيائية بين النقاط التي تنتمي إلى الكائن نفسه. كما تستخدم هذه النماذج المتقدمة جدًا الوسم الزائف على مقاطع فيديو من العالم الحقيقي لتدريب أنظمة عالية الدقة مع تقليل متطلبات البيانات بشكل كبير.
تتبّع النقاط مقارنةً بالمهام ذات الصلة#
على الرغم من ارتباطه الوثيق بها، يختلف تتبّع النقاط اختلافًا كبيرًا عن مهام الرؤية الحاسوبية الأخرى:
- تتبّع الكائنات: يعيّن معرّفات فريدة للكائنات بأكملها (مثل شخص أو سيارة) ويتابعها. ويعتمد بدرجة كبيرة على نماذج اكتشاف الكائنات مثل Ultralytics YOLO26.
- تقدير الوضعية: يتتبّع نقاطًا رئيسية دلالية محددة (مثل مفاصل الإنسان) بدلًا من وحدات بكسل عشوائية. وعلى الرغم من تشابهه مع تتبّع النقاط، يتطلب تقدير الوضعية فهمًا دلاليًا للإطار البنيوي للكائن.
التطبيقات الواقعية#
يُعد تتبّع النقاط عاملًا تمكينيًا حاسمًا لمجموعة متنوعة من التطبيقات المتقدمة:
- إعادة البناء ثلاثي الأبعاد والبنية من الحركة (SfM): من خلال تتبّع سمات محددة عبر زوايا كاميرا أو إطارات فيديو مختلفة، تستطيع الأنظمة استنتاج العمق وبناء عمليات إعادة بناء ثلاثية الأبعاد دقيقة للبيئات، وهو أمر أساسي لرسم خرائط الواقع المعزز (AR).
- الروبوتات والملاحة الذاتية: تستخدم المركبات الذاتية والروبوتات تتبّع النقاط (غالبًا عبر الحركة البصرية) لفهم حركتها بالنسبة إلى محيطها، وحساب المسارات، والتنقل بأمان عبر البيئات الديناميكية المعقدة.
- تحرير الفيديو والمؤثرات الخاصة: تعتمد برمجيات المؤثرات البصرية الاحترافية (VFX) بدرجة كبيرة على تتبّع النقاط لتثبيت اللقطات المهتزة أو إرساء الصور المُنشأة حاسوبيًا (CGI) بسلاسة على الكائنات المتحركة في مشهد فعلي.
تتبّع النقاط الرئيسية باستخدام Ultralytics#
بينما تتتبّع أدوات تتبّع النقاط العامة وحدات البكسل المرئية العشوائية، يمكنك تتبّع النقاط الرئيسية البنيوية المحددة (مثل عيني الشخص أو كتفيه أو معصميه) باستخدام إمكانات تتبّع الوضعية في الحزمة ultralytics. ويوفر نموذج YOLO26 الموصى به تتبّعًا عالي السرعة للنقاط الرئيسية من البداية إلى النهاية، وهو مثالي لتحليل الحركة.
from ultralytics import YOLO
# Load the recommended YOLO26 pose model for keypoint tracking
model = YOLO("yolo26n-pose.pt")
# Perform pose tracking on a video stream to follow human keypoints over time
results = model.track(source="video.mp4", stream=True)
# Iterate through the stream to process temporal keypoint tracking data
for frame_result in results:
# Each keypoint maintains its association across frames
print(f"Tracked {len(frame_result.keypoints)} human skeletons in current frame.")عند نشر سير عمل الرؤية الحاسوبية على نطاق واسع، توفر منصة Ultralytics حلًا مبسّطًا لـوسم البيانات، وتدريب النماذج، والنشر السلس، بما يضمن أداءً موثوقًا عبر بيئات الحافة والسحابة المتنوعة.






