الدليل الشامل لأدوات تقدير الوضعية
تعلّموا كيف يمكن استخدام أدوات تقدير الوضعية لكشف النقاط الأساسية للجسم في الصور ومقاطع الفيديو، وتقدير الوضعيات ثنائية وثلاثية الأبعاد، ودعم تطبيقات متنوعة للذكاء الاصطناعي البصري.

نحن البشر نقرأ الحركة instinctively. فعندما يميل شخص إلى الأمام، أو يدير رأسه، أو يرفع ذراعه، يمكنك أن تستنتج فورًا ما يفعله. إنها مهارة هادئة وشبه لاواعية تشكّل طريقة تفاعلنا مع الناس واستكشافنا للعالم.
مع ازدياد حضور التكنولوجيا في الحياة اليومية، من الطبيعي أن نرغب في أن تفهم أجهزتنا الحركة بسلاسة كما نفعل نحن. وتجعل التطورات الحديثة في الذكاء الاصطناعي، ولا سيما التطورات القائمة على التعلم العميق، ذلك ممكنًا. ويساعد رؤية الحاسوب تحديدًا الآلات على استخراج المعنى من الصور والفيديو، ويدفع هذا التقدم قدمًا.
على سبيل المثال، يُعد تقدير الوضعية مهمة شائعة في رؤية الحاسوب، إذ يتنبأ بمواقع نقاط الجسم الأساسية المحددة مسبقًا (مثل الكتفين والمرفقين والوركين والركبتين) في صورة أو إطار فيديو. ويمكن ربط هذه النقاط الأساسية باستخدام تعريف ثابت للهيكل العظمي لتكوين تمثيل مبسط للوضعية.
تدعم نماذج رؤية الحاسوب مثل Ultralytics YOLO11 وUltralytics YOLO26 القادمة مهامًا مثل تقدير الوضعية، ويمكن استخدامها لتشغيل تطبيقات آنية، بما في ذلك تقديم ملاحظات حول الأداء في اللياقة البدنية والرياضة، ومراقبة السلامة، وتجارب الواقع المعزز التفاعلية.

الشكل 1. نظرة على استخدام Ultralytics YOLO11 لتقدير الوضعية (المصدر)
في هذه المقالة، سنستكشف أدوات تقدير الوضعية بعمق، ونتعرف على كيفية عمل تقدير الوضعية، ومجالات استخدامه، وبعض أبرز النماذج والمكتبات المتاحة اليوم. لنبدأ!
ما هو تقدير الوضعيات؟#
تقدير الوضعية هو تقنية في رؤية الحاسوب تساعد النظام على فهم كيفية تموضع شخص أو كائن في صورة أو فيديو. وبدلًا من تحليل كل بكسل بالتساوي، يتنبأ النظام بمجموعة من المعالم المتسقة، مثل الرأس والكتفين والمرفقين والوركين والركبتين والكاحلين.
تُخرج معظم النماذج إحداثيات هذه النقاط الأساسية ودرجة تعكس مدى احتمال صحة كل تنبؤ. ويمكن بعد ذلك ربط هذه النقاط الأساسية باستخدام تخطيط هيكلي عظمي محدد مسبقًا لتكوين تمثيل بسيط للوضعية.
عند تطبيق ذلك إطارًا تلو الآخر في مقاطع الفيديو، يمكن ربط النقاط الأساسية الناتجة عبر الزمن لتقدير الحركة. ويتيح ذلك تطبيقات مثل التحقق من الأداء، وتحليل الحركة، والتفاعل القائم على الإيماءات.

الشكل 2. مثال على تقدير الوضعية (المصدر)
الحاجة إلى أدوات تقدير الوضعية#
تحمل حركة الإنسان قدرًا كبيرًا من المعلومات. فقد تكشف طريقة انحناء شخص ما أو مدّه لجسمه أو نقله لوزنه عن النية أو الجهد أو الإرهاق أو حتى خطر الإصابة. وحتى وقت قريب، كان التقاط هذا المستوى من التفاصيل يتطلب عادةً مستشعرات متخصصة أو بدلات لالتقاط الحركة أو بيئات مختبرية مضبوطة.
يغيّر تقدير الوضعية ذلك. فاستخراج معالم الجسم الأساسية من الصور ومقاطع الفيديو العادية يتيح للحواسيب تحليل الحركة باستخدام الكاميرات القياسية. وهذا يجعل تحليل الحركة أكثر سهولة وقابلية للتوسع وعمليةً في البيئات الواقعية.
فيما يلي بعض الطرق التي يمكن أن يُحدث بها تقدير الوضعية أثرًا:
- أماكن عمل أكثر أمانًا: يمكن استخدام الأنظمة المعتمدة على الرؤية لاكتشاف الوضعيات الخطرة، أو الإجهاد المتكرر، أو أساليب رفع الأحمال غير الآمنة قبل وقوع الإصابات.
- تحسين التدريب على اللياقة البدنية والرياضة: يمكن لحلول الذكاء الاصطناعي المعتمدة على الرؤية تقييم الأداء والتوازن والتقنية في الوقت الفعلي، وتقديم ملاحظات فورية للمستخدمين دون أجهزة قابلة للارتداء.
- الرعاية الصحية وإعادة التأهيل: يمكن للأطباء والمختصين متابعة التقدم في التعافي، والوضعية، ونطاق الحركة عن بُعد باستخدام تسجيلات فيديو بسيطة.
- التجارب التفاعلية: يسهّل تقدير الوضعية على الصور الرمزية الرقمية والبيئات الغامرة متابعة الحركة البشرية وعكسها بدقة.
تطور خوارزميات تقدير الوضعية#
فكرة تقدير الوضعيات موجودة منذ سنوات عديدة. فقد استخدمت الأساليب المبكرة نماذج هندسية بسيطة وقواعد مصممة يدويًا، وكانت تعمل عادةً في ظروف مضبوطة فقط.
على سبيل المثال، قد يعمل النظام جيدًا عندما يقف شخص ساكنًا في وضعية ثابتة، لكنه يفشل عندما يبدأ الشخص بالمشي أو الاستدارة أو التفاعل مع الأشياء في مشاهد واقعية. وغالبًا ما واجهت هذه الأساليب صعوبات في التعامل مع الحركة الطبيعية، وزوايا الكاميرا المتغيرة، والخلفيات المزدحمة، والحجب الجزئي.
يعتمد تقدير الوضعية الحديث على التعلم العميق للتعامل مع هذه التحديات. ومن خلال تدريب الشبكات العصبية الالتفافية على مجموعات بيانات كبيرة موسومة، تتعلم النماذج الأنماط البصرية التي تساعدها على اكتشاف النقاط الأساسية بموثوقية أكبر عبر الوضعيات والأشخاص والبيئات المختلفة.
ومع توافر أمثلة أكثر، يحسّن النموذج تنبؤاته ويصبح أفضل في التعميم على مشاهد جديدة. وبفضل هذا التقدم، يدعم تقدير الوضعية الآن مجموعة واسعة من حالات الاستخدام العملية، بما في ذلك مراقبة أماكن العمل وبيئة العمل، وتحليلات الرياضة، حيث يدرس المدربون والمحللون كيفية تحرك الرياضيين.
أنواع تقنيات تقدير الوضعية#
يأتي تقدير الوضعية بأشكال مختلفة، اعتمادًا على البيئة وما تحتاج إلى قياسه. فيما يلي الأنواع الرئيسية التي ستصادفها:
- تقدير الوضعية ثنائي الأبعاد: يكتشف هذا النهج النقاط الأساسية للجسم في صورة أو إطار فيديو ثنائي الأبعاد. وهو يعمل جيدًا مع الكاميرات القياسية وفعال حسابيًا، ما يجعله مناسبًا لمهام مثل تتبع الحركة الأساسي، وتحليل الوضعية، وتقديم ملاحظات فورية حول الأداء.
- تقدير الوضعية ثلاثي الأبعاد: من خلال تقدير العمق إلى جانب إحداثيات الصورة، يوفر تقدير الوضعية ثلاثي الأبعاد فهمًا مكانيًا لحركة الجسم. ويفيد ذلك خصوصًا عندما تكون الحركة إلى الأمام والخلف مهمة، كما في تحليل الرياضة، وإعادة التأهيل، والميكانيكا الحيوية، والرسوم المتحركة. وبالتحديد، يلتقط تقدير وضعية الإنسان ثلاثي الأبعاد مواضع المفاصل وحركتها في فضاء ثلاثي الأبعاد، مما يقلل الالتباس الذي قد يحدث مع الإسقاطات ثنائية الأبعاد.
- تقدير وضعية شخص واحد: صُممت هذه الأنظمة لتتبع فرد واحد في كل مرة. وتميل إلى تحقيق أفضل أداء في البيئات المضبوطة أو شبه المضبوطة، حيث يكون الشخص ظاهرًا بوضوح، مثل تطبيقات التمارين الموجهة، ومكالمات الفيديو، وإعدادات تحليل الحركة.
- تقدير وضعية عدة أشخاص: صُمم هذا النهج للمشاهد التي تضم عدة أشخاص، إذ يكتشف وضعيات عدة أفراد ويتتبعها في الوقت نفسه. ويفيد بوجه خاص في البيئات المزدحمة مثل أماكن العمل، والصالات الرياضية، والأماكن العامة، والأنشطة الجماعية، حيث قد يتداخل الأشخاص أو يحجب بعضهم بعضًا.

الشكل 3. فهم الحركة البشرية في الفضاء ثلاثي الأبعاد مقابل فضاء الصورة ثنائي الأبعاد (المصدر)
فهم كيفية عمل نماذج تقدير وضعية الإنسان#
يمكن تطبيق تقدير الوضعية على أنواع كثيرة من الكائنات، لكن لنبسّط الأمور، سنركز على تقدير وضعية الإنسان.
تُدرَّب معظم أنظمة تقدير وضعية الإنسان على مجموعات بيانات مشروحة، حيث تُوسم أجزاء الجسم الأساسية عبر مجموعات كبيرة من الصور وإطارات الفيديو. وباستخدام هذه الأمثلة، يتعلم النموذج الأنماط البصرية المرتبطة بمعالم جسم الإنسان، مثل الكتفين والمرفقين والوركين والركبتين والكاحلين، كي يتمكن من التنبؤ بالنقاط الأساسية بدقة في المشاهد الجديدة.
ومن الجوانب الرئيسية الأخرى بنية استدلال النموذج، التي تحدد كيفية اكتشافه للنقاط الأساسية وتجميعها في وضعيات كاملة. تكتشف بعض الأنظمة كل شخص أولًا ثم تقدّر النقاط الأساسية داخل منطقة كل شخص، بينما تكتشف أنظمة أخرى النقاط الأساسية عبر الصورة بأكملها ثم تجمعها في أفراد. ويمكن للتصميمات الأحدث أحادية المرحلة التنبؤ بالوضعيات في تمريرة واحدة، محققةً توازنًا بين السرعة والدقة للاستخدام الآني.
والآن، لنستعرض بالتفصيل أساليب تقدير الوضعية المختلفة.
تقدير الوضعية من الأسفل إلى الأعلى#
في نهج من الأسفل إلى الأعلى، ينظر النموذج إلى الصورة بأكملها ويعثر أولًا على النقاط الأساسية للجسم، مثل الرأس والكتفين والمرفقين والوركين والركبتين والكاحلين. وفي هذه المرحلة، لا يحاول النموذج فصل الأشخاص. بل يكتشف ببساطة جميع النقاط الأساسية أو مفاصل الجسم التي يحددها الهيكل العظمي للوضعية عبر المشهد.
بعد ذلك، ينفذ النظام خطوة ثانية لربط النقاط. فهو يربط النقاط الأساسية التي تنتمي إلى بعضها ويجمعها في هياكل عظمية مكتملة، واحدًا لكل شخص. وبما أنه لا يحتاج إلى اكتشاف كل شخص أولًا، غالبًا ما تعمل الأساليب من الأسفل إلى الأعلى جيدًا في المشاهد المزدحمة التي يتداخل فيها الأشخاص أو يظهرون بأحجام مختلفة أو يكونون محجوبين جزئيًا.
اكتشاف الوضعية من الأعلى إلى الأسفل#
وعلى النقيض من ذلك، تبدأ الأنظمة من الأعلى إلى الأسفل باكتشاف كل شخص في الصورة أولًا. فتضع مربع إحاطة حول كل فرد، وتتعامل مع كل مربع باعتباره منطقة مستقلة للتحليل.
بمجرد عزل الشخص، يتنبأ النموذج بالنقاط الأساسية للجسم داخل تلك المنطقة. وغالبًا ما ينتج هذا الإعداد المتدرج نتائج دقيقة جدًا، لا سيما عندما يكون عدد الأشخاص في المشهد قليلًا ويكون كل شخص ظاهرًا بوضوح.
تقدير الوضعية أحادي المرحلة أو الهجين#
تتنبأ النماذج أحادية المرحلة، التي تُسمى أحيانًا النماذج الهجينة، بالوضعيات في تمريرة واحدة. وبدلًا من تنفيذ اكتشاف الأشخاص أولًا وتقدير النقاط الأساسية ثانيًا، تُخرج هذه النماذج موقع الشخص والنقاط الأساسية للجسم في الوقت نفسه.
وبما أن كل شيء يحدث في وحدة واحدة، تكون هذه النماذج غالبًا أسرع وأكثر كفاءة، مما يجعلها مناسبة جدًا للاستخدامات الآنية مثل تتبع الحركة المباشر والتقاط الحركة. وتستند نماذج مثل Ultralytics YOLO11 إلى هذه الفكرة، وتهدف إلى تحقيق توازن بين السرعة والتنبؤات الموثوقة بالنقاط الأساسية.
تدريب نماذج تقدير الوضعية وتقييمها#
بغض النظر عن النهج المستخدم، لا يزال نموذج تقدير الوضعية بحاجة إلى التدريب والاختبار بعناية قبل أن يصبح موثوقًا في العالم الحقيقي. وعادةً ما يتعلم من مجموعات كبيرة من الصور (وأحيانًا الفيديو) التي تُوسم فيها النقاط الأساسية للجسم، مما يساعده على التعامل مع الوضعيات وزوايا الكاميرا والبيئات المختلفة.
تشمل مجموعات بيانات تقدير الوضعية المعروفة COCO Keypoints وMPII Human Pose وCrowdPose وOCHuman. وعندما لا تعكس مجموعات البيانات هذه الظروف التي سيواجهها النموذج عند النشر، غالبًا ما يجمع المهندسون صورًا إضافية من البيئة المستهدفة ويضعون تسميات لها، مثل أرضية مصنع أو صالة رياضية أو عيادة.

الشكل 4. تقدير وضعيات مختلفة باستخدام رؤية الحاسوب (المصدر)
بعد التدريب، يُقيَّم أداء النموذج على معايير قياسية لقياس الدقة والمتانة، ولتوجيه المزيد من الضبط للاستخدام في العالم الحقيقي. وغالبًا ما تُبلَّغ النتائج باستخدام متوسط الدقة، الذي يُشار إليه عادةً باسم mAP، إذ يلخص الأداء عبر عتبات ثقة مختلفة من خلال مقارنة الوضعيات المتنبأ بها بالحقيقة الأساسية الموسومة.
في العديد من معايير الوضعية، تُطابق الوضعية المتنبأ بها مع وضعية الحقيقة الأساسية باستخدام تشابه النقاط الأساسية للكائن (OKS). ويقيس OKS مدى قرب النقاط الأساسية المتنبأ بها من النقاط الأساسية المشروحة، مع مراعاة عوامل مثل مقياس الشخص وصعوبة تحديد موضع كل نقطة أساسية عادةً.
تُخرج نماذج الوضعية أيضًا درجات ثقة للأشخاص المكتشفين وللنقاط الأساسية الفردية. وتعكس هذه الدرجات مدى ثقة النموذج، وتُستخدم لترتيب التنبؤات وتصفيتها، وهو أمر مهم بوجه خاص في الظروف الصعبة مثل الحجب، وضبابية الحركة، أو زوايا الكاميرا غير المعتادة.
أدوات ومكتبات تقدير الوضعية الشائعة#
تتوفر اليوم أدوات كثيرة لتقدير الوضعية، يوازن كل منها بين السرعة والدقة وسهولة الاستخدام. فيما يلي بعض الأدوات والمكتبات الأكثر استخدامًا على نطاق واسع:
- Ultralytics YOLO11: طُوّر YOLO11 بوصفه نموذجًا متطورًا مفتوح المصدر للذكاء الاصطناعي المرئي، وهو يبني على نماذج سابقة مثل Ultralytics YOLOv8. ويحسّن السرعة والدقة والكفاءة الإجمالية، مع دعم مهام مختلفة في رؤية الحاسوب، بما في ذلك تقدير الوضعية. وبفضل أدائه القوي عبر المنصات، من الحواسيب المحمولة إلى الأجهزة الطرفية، يُعد YOLO11 خيارًا ممتازًا للعديد من عمليات النشر الواقعية.
- Ultralytics YOLO26: صُمم هذا النموذج القادم من الجيل التالي ليكون أخف وأصغر وأسرع، مع الحفاظ على دقة قوية. وهو مصمم للاستخدام الآني وسهولة النشر، ويدعم مهام مثل اكتشاف الكائنات، وتقسيم المثيلات، وتقدير الوضعية عبر أحجام نماذج تناسب كل شيء بدءًا من الأجهزة الطرفية وصولًا إلى الأنظمة الأكبر.
- MediaPipe: هو إطار عمل متعدد المنصات لبناء مسارات معالجة الرؤية والتعلم الآلي. ويتسم بخفة الوزن ويعمل بكفاءة على الأجهزة المحمولة والأجهزة اللوحية وتطبيقات الويب، كما يتضمن حلولًا ونماذج جاهزة للاستخدام لتقدير وضعية الجسم بالكامل، ومعالم الوجه، وتتبع اليدين.
- OpenPose: نظام مفتوح المصدر لتقدير الوضعية من البداية إلى النهاية، ويُعرف على نطاق واسع باكتشاف النقاط الأساسية لعدة أشخاص. ويمكنه تقدير النقاط الأساسية للجسم واليدين والوجه معًا، ويُستخدم عادةً في الأبحاث والرسوم المتحركة وتحليل الحركة.
- MMPose: MMPose مجموعة أدوات لتقدير الوضعية قائمة على PyTorch من منظومة OpenMMLab. وتوفر العديد من تطبيقات النماذج، وأدوات التدريب، وخيارات الإعداد، مما يجعلها مفيدة للتجارب والتخصيص المتقدم.
- HRNet وAlphaPose: هذان نموذجان أقدمان لتقدير الوضعية، ولا يزالان مستخدمين في الأبحاث حتى اليوم. وHRNet هو بنية نموذج وضعية تحافظ على ميزات الصور عالية الدقة عبر الشبكة بأكملها، مما يساعدها على تحديد مواضع النقاط الأساسية بدقة. أما AlphaPose فهو نظام واسع الاستخدام لتقدير وضعية عدة أشخاص، ويُستخدم عادةً عندما تكون الدقة العالية مطلوبة في المشاهد المزدحمة أو المعقدة.
التطبيقات الواقعية لتحليل الوضعية وتقديرها#
يُستخدم تقدير الوضعية على نحو متزايد لتحويل مقاطع الفيديو العادية إلى رؤى مفيدة حول الحركة. ومن خلال تتبع النقاط الأساسية للجسم إطارًا تلو الآخر، يمكن لهذه الأنظمة استنتاج الوضعية والحركة والسلوك البدني من بثوث الكاميرات، مما يجعل هذه التقنية عملية في العديد من البيئات الواقعية.
على سبيل المثال، في مجالَي الرعاية الصحية وإعادة التأهيل، يمكن لتتبع الوضعية أن يساعد الأطباء والمختصين على رؤية وقياس كيفية تحرك المريض أثناء العلاج والتعافي. ومن خلال استخراج معالم الجسم من تسجيلات الفيديو العادية، يمكن استخدامه لتقييم الوضعية، ونطاق الحركة، وأنماط الحركة العامة بمرور الوقت. ويمكن لهذه القياسات دعم التقييمات السريرية التقليدية وتحسينها، بل وتسهيل متابعة التقدم أحيانًا دون الحاجة إلى مستشعرات قابلة للارتداء أو معدات متخصصة.
وبالمثل، في الرياضة والبث، يمكن لتقدير الوضعية تحليل كيفية تحرك الرياضيين مباشرةً من بثوث الفيديو. ومن الأمثلة المثيرة للاهتمام Hawk-Eye، وهو نظام تتبع قائم على الكاميرات يُستخدم في الرياضات الاحترافية للتحكيم ورسومات البث. كما يوفر تتبعًا هيكليًا عظميًا من خلال تقدير النقاط الأساسية لجسم الرياضي من مشاهد الكاميرا.
اختيار أداة تقدير الوضعية المناسبة#
يبدأ اختيار أداة تقدير الوضعية المناسبة بفهم احتياجات مشروع رؤية الحاسوب الخاص بك. فبعض التطبيقات تعطي الأولوية للسرعة الآنية، بينما تتطلب تطبيقات أخرى دقة وتفاصيل أعلى.
ويؤثر جهاز النشر المستهدف أيضًا في الاختيار. فعادةً ما تتطلب تطبيقات الأجهزة المحمولة والأجهزة الطرفية نماذج خفيفة وفعالة، بينما تكون النماذج الأكبر ملائمة أكثر للخوادم أو البيئات السحابية.
إضافةً إلى ذلك، قد تؤدي سهولة الاستخدام دورًا مهمًا. إذ يمكن للتوثيق الجيد، والنشر السلس، ودعم التدريب المخصص أن تبسّط مشروعك.
ببساطة، تتفوق الأدوات المختلفة في مجالات مختلفة. فعلى سبيل المثال، توفر نماذج Ultralytics YOLO توازنًا عمليًا بين السرعة والدقة وسهولة النشر للعديد من تطبيقات تقدير الوضعية الواقعية.

الشكل 5. تقدير وضعية الحيوانات باستخدام Ultralytics YOLO11 (المصدر)
أهم النقاط المستخلصة#
يساعد تقدير الوضعية الحواسيب على فهم الحركة البشرية من خلال اكتشاف النقاط الأساسية للجسم في الصور ومقاطع الفيديو. وتجعل نماذج مثل YOLO11 وYOLO26 بناء التطبيقات الآنية لمجالات مثل الرياضة والرعاية الصحية وسلامة أماكن العمل والتجارب التفاعلية أسهل. ومع استمرار النماذج في التحسن من حيث السرعة والدقة، يُرجح أن يصبح تقدير الوضعية ميزة شائعة في العديد من أنظمة الذكاء الاصطناعي المرئي.
هل تريد معرفة المزيد عن الذكاء الاصطناعي؟ اطلع على مجتمعنا ومستودعنا على GitHub. واستكشف صفحات حلولنا للتعرف على الذكاء الاصطناعي في الروبوتات ورؤية الحاسوب في التصنيع. وتعرّف على خيارات الترخيص لدينا وابدأ البناء باستخدام رؤية الحاسوب اليوم!









