Action Recognition
استكشف كيف يحدد التعرف على الإجراءات السلوكيات في الفيديو. تعلم استخدام Ultralytics YOLO26 لتقدير الوضع وبناء أنظمة ذكاء اصطناعي ذكية لمهام HAR.
يُعرف التعرف على الأنشطة، المعروف أيضًا باسم التعرف على النشاط البشري (HAR)، كفرع فرعي ديناميكي من الرؤية الحاسوبية (CV) يهتم بتحديد وتصنيف سلوكيات أو حركات معينة يؤديها الأشخاص في بيانات الفيديو. بينما يجيب اكتشاف الكائنات التقليدي على سؤال "ما الموجود في الصورة؟"، فإن التعرف على الأنشطة يعالج السؤال الأكثر تعقيدًا "ما الذي يحدث بمرور الوقت؟". من خلال تحليل تسلسلات الإطارات بدلاً من الصور الثابتة، يمكن لنماذج التعلم الآلي (ML) التمييز بين الأنشطة المعقدة مثل "المشي" أو "ركوب الدراجات" أو "السقوط" أو "المصافحة"، مما يجعله مكونًا أساسيًا لبناء أنظمة ذكية تفهم نوايا الإنسان وسباقه.
المفاهيم والتقنيات الأساسية#
يتطلب التعرف على الأنشطة من النموذج معالجة كل من المعلومات المكانية (شكل الكائنات أو الأشخاص) والمعلومات الزمنية (كيفية تحركهم عبر الزمن). لتحقيق ذلك، غالباً ما توظف أنظمة الذكاء الاصطناعي (AI) الحديثة هياكل متخصصة تتجاوز الشبكات العصبية التلافيفية (CNNs) القياسية.
- تقدير الوضعية: تقنية قوية يتتبع من خلالها النموذج نقاط رئيسية محددة على جسم الإنسان، مثل المرفقين والركبتين والكتفين. توفر التغييرات الهندسية في هذه النقاط الرئيسية بمرور الوقت إشارة قوية لتصنيف الأنشطة، بمعزل عن تداخل الخلفية.
- النمذجة الزمنية: تستخدم الخوارزميات هياكل مثل الشبكات العصبية المتكررة (RNNs) أو شبكات الذاكرة طويلة القصيرة المدى (LSTM) لتذكر الإطارات السابقة والتنبؤ بالإجراءات المستقبلية. في الآونة الأخيرة، اكتسبت محولات الفيديو شعبية لقدرتها على التعامل مع التبعيات طويلة المدى في تدفقات الفيديو.
- الشبكات ثنائية التدفق: يعالج هذا النهج الميزات المكانية (إطارات RGB) والميزات الزمنية (غالبًا باستخدام تدفق البصري) في تدفقات متوازية، ويقوم بدمج البيانات لاتخاذ التصنيف النهائي.
تطبيقات العالم الحقيقي#
تمتلك القدرة على تفسير حركة الإنسان تلقائياً إمكانات تحويلية عبر مختلف الصناعات، مما يعزز السلامة والكفاءة وتجربة المستخدم.
- الذكاء الاصطناعي في الرعاية الصحية: يُعد التعرف على الأنشطة أمرًا حيويًا لنظمة مراقبة المرضى. على سبيل المثال، يتيح الاكتشاف التلقائي للسقوط في دور الرعاية، مما ينبه الموظفين فورًا في حال سقوط المريض. كما يُستخدم في إعادة التأهيل البدني عن بُعد، حيث يقوم مدربو الذكاء الاصطناعي بتحليل نموذج تمارين المريض لضمان أداء الحركات بشكل صحيح وآمن.
- المراقبة الذكية والأمن: بصرف النظر عن اكتشاف الحركة البسيط، تستخدم أنظمة الأمان المتقدمة التعرف على الأنشطة لتحديد السلوكيات المريبة، مثل الشجار أو السرقة في المتاجر أو الدخول غير المصرح به، مع تجاهل الأنشطة الحميدة. هذا يقلل الإنذارات الكاذبة ويحسن مراقبة الأمان في الوقت الفعلي.
تنفيذ تحليل الإجراءات باستخدام Ultralytics#
تتضمن سير العمل الشائع اكتشاف الأشخاص ووضعية هياكلهم العظمية أولاً، ثم تحليل حركة تلك المفاصل. يوفر نموذج Ultralytics YOLO26 سرعة ودقة متطورتين لخطوة تقدير الوضعية الأولية، والتي تشكل الأساس للعديد من خطوط أنابيب التعرف على الأنشطة.
يوضح المثال التالي كيفية استخراج النقاط الرئيسية للهيكل العظمي من إطار فيديو باستخدام Python:
from ultralytics import YOLO
# Load the YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect person keypoints
results = model("https://ultralytics.com/images/bus.jpg")
# Process results
for result in results:
# Access the keypoints (x, y, visibility)
if result.keypoints is not None:
print(f"Detected keypoints shape: {result.keypoints.data.shape}")التمييز بين المصطلحات ذات الصلة#
من المهم التمييز بين التعرف على الإجراءات ومهام الرؤية الحاسوبية المماثلة لضمان تطبيق الأساليب الصحيحة.
- التعرف على الأنشطة مقابل تتبع الكائنات: يركز تتبع الكائنات على الحفاظ على هوية كائن أو شخص معين أثناء تحركهم عبر الإطارات (مثل "الشخص أ في الإحداثي X"). يفسر التعرف على الأنشطة سلوك ذلك الموضوع المتتبع (مثل "الشخص أ يركض").
- التعرف على الأنشطة مقابل فهم الفيديو: بينما يحدد التعرف على الأنشطة أفعالاً جسدية محددة، فإن فهم الفيديو هو مفهوم أوسع يتضمن استيعاب السرد بأكمله، والسياق، والعلاقات السببية داخل مشهد الفيديو.
التحديات والاتجاهات المستقبلية#
Developing robust action recognition models presents challenges, particularly regarding the need for large, annotated video datasets like Kinetics-400 or UCF101. Labeling video data is significantly more time-consuming than labeling static images. To address this, tools like the Ultralytics Platform help streamline the annotation and training workflow.
علاوة على ذلك، تعد الكفاءة الحاسوبية أمرًا بالغ الأهمية. تتطلب معالجة الفيديو عالي الدقة في الوقت الفعلي موارد الأجهزة الكبيرة. تتجه الصناعة بشكل متزايد نحو الحافة الذكية (Edge AI)، مما يؤدي إلى تحسين النماذج للتشغيل مباشرة على الكاميرات والأجهزة المحمولة لتقليل زمن الوصول واستخدام النطاق الترددي. تهدف التطورات المستقبلية إلى تحسين تعميم النماذج، مما يسمح للأنظمة التعرف على الأنشطة حتى من وجهات النظر التي لم يتم تدريبها عليها صراحةً.






