هل يستطيع الذكاء الاصطناعي اكتشاف أفعال البشر؟ استكشاف التعرّف على النشاط
من تطبيقات اللياقة البدنية إلى مراقبة المرضى، اكتشف كيف تعالج الرؤية الحاسوبية السؤال التالي: هل يستطيع الذكاء الاصطناعي اكتشاف أفعال البشر في البيئات الواقعية؟

تمتلئ الحياة اليومية بحركات صغيرة نادرًا ما نتوقف للتفكير فيها. قد يبدو المشي عبر الغرفة أو الجلوس إلى مكتب أو التلويح لصديق أمرًا سهلًا بالنسبة إلينا، إلا أن اكتشافها باستخدام الذكاء الاصطناعي أكثر تعقيدًا بكثير. فما يأتي طبيعيًا للبشر يتحول إلى شيء أكثر تعقيدًا عندما تحاول آلة فهمه.
تُعرف هذه القدرة باسم التعرف على الأنشطة البشرية (HAR)، وهي تمكّن أجهزة الكمبيوتر من اكتشاف أنماط السلوك البشري وتفسيرها. ويُعد تطبيق اللياقة البدنية مثالًا رائعًا على استخدام HAR عمليًا. فمن خلال تتبع الخطوات وروتينات التمرين، يوضح التطبيق كيف يستطيع الذكاء الاصطناعي مراقبة الأنشطة اليومية.
ومع إدراك إمكانات HAR، بدأت صناعات عديدة في تبني هذه التقنية. وفي الواقع، من المتوقع أن تتجاوز قيمة سوق التعرف على الأفعال البشرية 12.56 مليار دولار بحلول عام 2033.
ويُعد جزء مهم من هذا التقدم مدفوعًا برؤية الكمبيوتر، وهي فرع من الذكاء الاصطناعي يمكّن الآلات من تحليل البيانات المرئية، مثل الصور ومقاطع الفيديو. وبفضل رؤية الكمبيوتر والتعرف على الصور، تطورت HAR من مفهوم بحثي إلى جزء عملي ومثير من تطبيقات الذكاء الاصطناعي المتقدمة.
في هذه المقالة، سنستكشف ماهية HAR، والأساليب المختلفة المستخدمة للتعرف على أفعال البشر، وكيف تساعد رؤية الكمبيوتر في الإجابة عن السؤال: هل يستطيع الذكاء الاصطناعي اكتشاف أفعال البشر في تطبيقات العالم الحقيقي؟ لنبدأ!
ما التعرف على أفعال البشر؟#
يتيح التعرف على أفعال البشر لأنظمة الكمبيوتر فهم الأنشطة أو الأفعال البشرية من خلال تحليل حركات الجسم. وعلى خلاف مجرد اكتشاف شخص في صورة، يمكن لـ HAR المساعدة في تحديد ما يفعله الشخص. فمثلًا، يمكنه التمييز بين المشي والجري، والتعرف على التلويح باليد، أو ملاحظة سقوط شخص ما.
يكمن أساس HAR في أنماط الحركة ووضعيات الجسم. فقد يشير تغير طفيف في وضع ذراعي الشخص أو ساقيه إلى مجموعة متنوعة من الأفعال. ومن خلال التقاط هذه التفاصيل الدقيقة وتفسيرها، تستطيع أنظمة HAR استخلاص رؤى ذات معنى من حركات الجسم.
ولتحقيق ذلك، يجمع التعرف على أفعال البشر بين تقنيات متعددة، مثل تعلّم الآلة، ونماذج التعلّم العميق، ورؤية الكمبيوتر، ومعالجة الصور، التي تعمل معًا لتحليل حركات الجسم وتفسير أفعال البشر بدقة أعلى.

الشكل 1. يتضمن التعرف على الأنشطة البشرية فروعًا مختلفة من علوم الكمبيوتر (المصدر: cell.com)
كانت أنظمة HAR المبكرة محدودة بدرجة أكبر بكثير. فلم تكن قادرة إلا على التعامل مع عدد قليل من الأفعال البسيطة والمتكررة في بيئات خاضعة للتحكم، وكانت تواجه صعوبات في مواقف العالم الحقيقي.
أما اليوم، وبفضل الذكاء الاصطناعي والكميات الكبيرة من بيانات الفيديو، فقد تقدمت HAR بدرجة كبيرة من حيث الدقة والمتانة. وتستطيع الأنظمة الحديثة التعرف على مجموعة واسعة من الأنشطة بدقة أكبر بكثير، ما يجعل هذه التقنية عملية في مجالات مثل الرعاية الصحية والأمن والأجهزة التفاعلية.
الأساليب المختلفة لاكتشاف أفعال البشر#
بعد أن أصبح لدينا فهم أفضل لماهية التعرف على أفعال البشر، فلنلقِ نظرة على الطرق المختلفة التي تستطيع بها الآلات اكتشاف أفعال البشر.
فيما يلي بعض الأساليب الشائعة:
- الأساليب القائمة على المستشعرات: تستطيع الأجهزة الذكية، مثل مقاييس التسارع والأجهزة القابلة للارتداء والهواتف الذكية، التقاط الإشارات مباشرة من جسم الإنسان. ويمكنها إظهار أنماط الحركة مثل المشي والجري وحتى الوقوف بلا حركة. ويُعد عداد الخطوات في الساعة الذكية مثالًا رائعًا على هذا الأسلوب.
- الأساليب القائمة على الرؤية: تحلل الكاميرات المقترنة برؤية الكمبيوتر الصور ومقاطع الفيديو لتتبع مظهر الجسم وحركته إطارًا تلو الآخر. ويتيح ذلك التعرف على أنشطة أكثر تعقيدًا. وتعتمد أجهزة التلفزيون أو أنظمة الألعاب التي تتحكم فيها الإيماءات على هذا الأسلوب.
- الأساليب متعددة الوسائط: يؤدي الجمع بين المستشعرات والكاميرات إلى إنشاء نظام أكثر موثوقية، إذ يمكن لأحد المصدرين تأكيد ما يكتشفه المصدر الآخر. فعلى سبيل المثال، قد يسجل جهاز قابل للارتداء الحركة، بينما تتحقق الكاميرا من وضعية الجسم، وهو إعداد يُستخدم غالبًا لاكتشاف السقوط لدى رعاية المسنين.
دور مجموعات البيانات في التعرف على الأنشطة البشرية#
بالنسبة إلى أي نموذج أو نظام HAR، تُعد مجموعات البيانات نقطة البداية. ومجموعة بيانات HAR هي مجموعة من الأمثلة، مثل مقاطع الفيديو أو الصور أو بيانات المستشعرات، التي تلتقط أفعالًا مثل المشي أو الجلوس أو التلويح. وتُستخدم هذه الأمثلة لتدريب نماذج الذكاء الاصطناعي على التعرف على أنماط الحركة البشرية، التي يمكن تطبيقها بعد ذلك في تطبيقات الحياة الواقعية.
تؤثر جودة بيانات التدريب مباشرةً في مدى جودة أداء النموذج. وتجعل البيانات النظيفة والمتسقة من الأسهل على النظام التعرف على الأفعال بدقة.
ولهذا السبب، غالبًا ما تُعالج مجموعات البيانات مسبقًا قبل التدريب. وتتمثل إحدى الخطوات الشائعة في التطبيع، الذي يضبط القيم على نطاقات متسقة لتقليل الأخطاء ومنع فرط التخصيص (عندما يؤدي النموذج جيدًا على بيانات التدريب لكنه يواجه صعوبة مع البيانات الجديدة).
لقياس أداء النماذج بعد مرحلة التدريب، يعتمد الباحثون على مقاييس التقييم ومجموعات البيانات المعيارية التي تتيح إجراء اختبارات ومقارنات عادلة. وتضم مجموعات شائعة مثل UCF101 وHMDB51 وKinetics آلاف مقاطع الفيديو المصنفة لاكتشاف أفعال البشر. وعلى صعيد المستشعرات، توفر مجموعات البيانات المُجمعة من الهواتف الذكية والأجهزة القابلة للارتداء إشارات حركة قيّمة تجعل نماذج التعرف أكثر متانة في البيئات المختلفة.

الشكل 2. لمحة عن مجموعة بيانات للتعرف على الأنشطة البشرية. (المصدر)
كيف تدعم رؤية الكمبيوتر التعرف على الأنشطة البشرية#
من بين الطرق المختلفة لاكتشاف أفعال البشر، أصبحت رؤية الكمبيوتر بسرعة واحدة من أكثر الطرق شيوعًا وبحثًا. وتتمثل ميزتها الأساسية في قدرتها على استخراج تفاصيل غنية مباشرةً من الصور والفيديو. ومن خلال فحص وحدات البكسل إطارًا تلو الآخر وتحليل أنماط الحركة، يمكنها التعرف على الأنشطة في الوقت الفعلي من دون حاجة الأشخاص إلى ارتداء أجهزة إضافية.
جعل التقدم الحديث في التعلّم العميق، ولا سيما الشبكات العصبية الالتفافية (CNNs)، المصممة لتحليل الصور، رؤية الكمبيوتر أسرع وأكثر دقة وموثوقية.
فعلى سبيل المثال، تعتمد نماذج رؤية الكمبيوتر الحديثة واسعة الاستخدام، مثل Ultralytics YOLO11، على هذه التطورات. ويدعم YOLO11 مهام مثل اكتشاف الكائنات، وتقسيم المثيلات، وتتبع الأشخاص عبر إطارات الفيديو، وتقدير الوضعيات البشرية، ما يجعله أداة رائعة للتعرف على الأنشطة البشرية.
نظرة عامة على Ultralytics YOLO11#
Ultralytics YOLO11 هو نموذج لرؤية الذكاء الاصطناعي مصمم لتحقيق السرعة والدقة على حد سواء. ويدعم مهام رؤية الكمبيوتر الأساسية، مثل اكتشاف الكائنات وتتبع الكائنات وتقدير الوضعية. وتُعد هذه الإمكانات مفيدة بوجه خاص للتعرف على الأنشطة البشرية.
يحدد اكتشاف الكائنات الأشخاص في المشهد ويحدد مواقعهم، بينما يتتبع التتبع حركاتهم عبر إطارات الفيديو للتعرف على تسلسلات الأفعال، وتحدد تقنية تقدير الوضعية المفاصل الأساسية لجسم الإنسان للتمييز بين الأنشطة المتشابهة أو اكتشاف التغيرات المفاجئة مثل السقوط.
فعلى سبيل المثال، يمكن استخدام الرؤى المستخلصة من النموذج للتمييز بين شخص يجلس بهدوء، ثم يقف، وأخيرًا يرفع ذراعيه ابتهاجًا. قد تبدو هذه الأفعال اليومية البسيطة متشابهة للوهلة الأولى، لكنها تحمل معاني مختلفة جدًا عند تحليلها ضمن تسلسل.

الشكل 3. استخدام Ultralytics YOLO11 لتقدير الوضعية. (المصدر)
تطبيقات العالم الحقيقي لرؤية الكمبيوتر وHAR#
بعد ذلك، سنلقي نظرةً أقرب على كيفية تطبيق التعرف على الأنشطة البشرية المدعوم برؤية الكمبيوتر في حالات استخدام واقعية تؤثر في حياتنا اليومية.
الرعاية الصحية والرفاهية#
في الرعاية الصحية، يمكن أن توفر التغيرات الصغيرة في الحركة رؤى مفيدة حول حالة الشخص. فعلى سبيل المثال، قد يكشف تعثر مريض مسن أو زاوية أحد الأطراف أثناء إعادة التأهيل عن مخاطر أو تقدم. وغالبًا ما يصعب اكتشاف هذه العلامات بالوسائل التقليدية، مثل الفحوصات.
يمكن أن يساعد Ultralytics YOLO11 من خلال استخدام تقدير الوضعية وتحليل الصور لمراقبة المرضى في الوقت الفعلي. إذ يمكن استخدامه لاكتشاف حالات السقوط، وتتبع تمارين التعافي، ومراقبة الأنشطة اليومية مثل المشي أو التمدد. وبما أنه يعمل من خلال التحليل المرئي من دون الحاجة إلى مستشعرات أو أجهزة قابلة للارتداء، فإنه يوفر طريقة بسيطة لجمع معلومات دقيقة تدعم رعاية المرضى.

الشكل 4. تتبع حركات الجسم باستخدام دعم Ultralytics YOLO11 لتقدير الوضعية. (المصدر)
الأمن والمراقبة#
تعتمد أنظمة الأمن على اكتشاف الأنشطة البشرية غير المعتادة بسرعة، مثل مكوث شخص في مكان ما، أو ركضه في منطقة محظورة، أو إظهاره عدوانًا مفاجئًا. وغالبًا ما تفوت هذه العلامات في البيئات المزدحمة التي لا يستطيع فيها حراس الأمن مراقبة كل شيء يدويًا. وهنا يأتي دور رؤية الكمبيوتر وUltralytics YOLO11.
يجعل YOLO11 المراقبة الأمنية أسهل من خلال تشغيل المراقبة بالفيديو في الوقت الفعلي، بما يتيح اكتشاف الحركات المشبوهة وإرسال تنبيهات فورية. كما يدعم سلامة الحشود في الأماكن العامة ويعزز اكتشاف التسلل في المناطق الخاصة.
ومن خلال هذا النهج، يستطيع حراس الأمن العمل جنبًا إلى جنب مع أنظمة رؤية الكمبيوتر، وإنشاء تفاعل وشراكة بين الإنسان والكمبيوتر يتيحان استجابات أسرع وأكثر ملاءمة للأنشطة المشبوهة.
إيجابيات وسلبيات استخدام رؤية الكمبيوتر في HAR#
فيما يلي بعض مزايا استخدام رؤية الكمبيوتر للتعرف على الأنشطة البشرية:
- قابلية التوسع: بعد إعداد نظام التعرف، يمكنه مراقبة عدة أشخاص تلقائيًا في الوقت نفسه، ما يجعله مفيدًا للأتمتة في مرافق الرعاية الصحية والمصانع والأماكن العامة.
- المعالجة في الوقت الفعلي: يمكن استخدام حلول رؤية الذكاء الاصطناعي لتحليل تدفقات الفيديو أثناء حدوثها، ما يتيح استجابات أسرع.
- التتبع غير التدخلي: على خلاف الأجهزة القابلة للارتداء أو المستشعرات، لا يتطلب هذا الأسلوب من الأشخاص حمل أجهزة، ما يتيح تحليل السلوك بصورة طبيعية وسلسة.
رغم وجود فوائد عديدة لاستخدام رؤية الكمبيوتر في HAR، فهناك أيضًا قيود ينبغي أخذها في الاعتبار. وفيما يلي بعض العوامل التي يجب وضعها في الحسبان:
- مخاوف الخصوصية: قد تثير المراقبة القائمة على الفيديو قضايا تتعلق بحماية البيانات والموافقة، لا سيما في البيئات الحساسة مثل المنازل أو أماكن العمل.
- التحيز المحتمل: إذا افتقرت مجموعات بيانات التدريب إلى التنوع، فقد تسيء الخوارزميات تفسير الأفعال لدى مجموعات معينة من الأشخاص، ما يؤدي إلى نتائج غير عادلة أو غير دقيقة.
- الحساسية للبيئة: قد تنخفض الدقة بسبب الإضاءة الضعيفة أو الفوضى في الخلفية أو احتجاب أجزاء من الأشخاص، ما يعني ضرورة تصميم الأنظمة بعناية.
أهم النقاط المستخلصة#
يجعل الذكاء الاصطناعي ورؤية الكمبيوتر من الممكن للآلات التعرف على أفعال البشر بدقة أكبر وفي الوقت الفعلي. ومن خلال تحليل إطارات الفيديو وأنماط الحركة، تستطيع هذه الأنظمة تحديد الإيماءات اليومية والتغيرات المفاجئة على حد سواء. ومع استمرار تطور التقنية، ينتقل التعرف على الأنشطة البشرية إلى ما هو أبعد من مختبرات الأبحاث ليصبح أداة عملية للرعاية الصحية والأمن والتطبيقات اليومية.
استكشف المزيد حول الذكاء الاصطناعي بزيارة مستودع GitHub والانضمام إلى مجتمعنا. اطلع على صفحات حلولنا للتعرف على الذكاء الاصطناعي في علم الروبوتات ورؤية الكمبيوتر في التصنيع. تعرّف على خيارات الترخيص لدينا للبدء باستخدام رؤية الذكاء الاصطناعي.









