يتيح الذكاء الاصطناعي البصري تقنية التعرّف على الإيماءات من دون لمس
استكشفوا كيف تعزّز نماذج الرؤية الحاسوبية تقنية التعرّف على الإيماءات لاكتشاف إيماءات اليد وتتبعها وفهمها في تطبيقات متنوعة.

مع تطوّر التكنولوجيا، تتطوّر أيضًا الطريقة التي نتفاعل بها معها. اعتمدت الآلات المبكرة على الجهد البدني وعناصر التحكم الميكانيكية، بينما قدّمت علوم الحاسوب الحديثة شاشات اللمس والإدخال الصوتي.
أصبح التعرّف على الإيماءات الآن جزءًا من الخطوة التالية، إذ يستخدم الحركات الطبيعية بوصفها واجهة للمستخدم. ويمكن لموجة بسيطة باليد، أو حركة ضمّ الأصابع، أو إشارة يد سريعة أن تتحكم بالفعل في التطبيقات والشاشات والآلات.
يمكن تشغيل هذا التفاعل دون لمس بواسطة رؤية الحاسوب، وهي فرع من الذكاء الاصطناعي يساعد الآلات على رؤية ما تلتقطه الكاميرا وتفسيره. ويمكن دمج أنظمة الذكاء الاصطناعي للرؤية في الهواتف الذكية، وسماعات الواقع الافتراضي (VR) والواقع المعزز (AR)، والسيارات، وأجهزة المنزل الذكي، حيث يمكن للإيماءات أن تحل محل النقرات والضغطات والأزرار لتوفير تجربة مستخدم أكثر سلاسة.
أصبح التحكم دون لمس أكثر شيوعًا في الحياة اليومية. ويمكن أن يؤدي تجنّب التلامس الجسدي في أماكن العمل والمساحات المشتركة إلى تحسين النظافة والسلامة. كما تتجه العديد من المنتجات الرقمية إلى التفاعل دون استخدام اليدين، وتوفر الإيماءات طريقة سهلة وبديهية للتحكم في الأجهزة دون لمسها.
في هذه المقالة، سنستكشف ماهية التعرّف على الإيماءات، وكيف تجعل رؤية الحاسوب هذا التعرّف أكثر دقة، وأين يُستخدم في التطبيقات الواقعية. لنبدأ!
ما هو التعرّف على الإيماءات؟#
التعرّف على الإيماءات هو تقنية استشعار تتيح للآلات فهم الإيماءات البشرية، مثل إشارات اليد أو حركات الجسم، وتحويلها إلى إجراءات رقمية. وبدلًا من النقر على الشاشة أو الضغط على الأزرار، يمكن للمستخدمين التحكم في الأجهزة من خلال حركات بسيطة وطبيعية.
يجعل ذلك التفاعلات أكثر بداهة، ولذلك يجري اعتماد الإدخال القائم على الإيماءات في العديد من أنظمة التحكم المعتمدة على تعلّم الآلة والذكاء الاصطناعي. ويُعدّ التعرّف على إيماءات اليد، على وجه الخصوص، أحد أكثر أشكال التعرّف على الإيماءات استخدامًا، وغالبًا ما يعتمد على رؤية الحاسوب.
ببساطة، يستطيع حلّ للذكاء الاصطناعي للرؤية رصد الأيدي في بثّ الكاميرا، وتتبع كيفية حركتها أو تغيّر شكلها، ومطابقة تلك الأنماط مع إيماءة معروفة لتشغيل إجراء على الشاشة.
يُعدّ نموذج رؤية الحاسوب جزءًا أساسيًا من هذه الحلول، إذ يُدرَّب على مجموعات بيانات من الصور أو مقاطع الفيديو الموسومة التي تعرض إيماءات يد مختلفة. وباستخدام بيانات تدريب متنوعة وتقييم دقيق، يمكن للنموذج أن يعمّم بصورة أفضل على مستخدمين وظروف إضاءة وخلفيات مختلفة، مما يساعده على التعرّف على الإيماءات بدرجة أكبر من الموثوقية في البيئات الواقعية.

الشكل 1. البيانات المستخدمة لتدريب نموذج رؤية حاسوب لاكتشاف النقاط الرئيسية للإيماءات (المصدر)
استكشاف أنواع الإيماءات المختلفة والتفاعل بين الإنسان والحاسوب#
قبل أن نلقي نظرة أكثر تفصيلًا على الدور الذي تؤديه رؤية الحاسوب في التعرّف على الإيماءات، لنتراجع خطوة ونستعرض أنواع الإيماءات التي تتعرّف عليها هذه الأنظمة عادةً.
في معظم الحالات، تنقسم الإيماءات إلى فئتين: ثابتة وديناميكية. الإيماءات الثابتة هي وضعيات يد ثابتة، مثل إشارة الإعجاب، أو إشارة التوقف، أو إشارة النصر. وبما أنها لا تنطوي على حركة، يمكن غالبًا التعرّف عليها من إطار صورة واحد.
أما الإيماءات الديناميكية فتتضمن حركة بمرور الوقت، مثل التلويح أو السحب في الهواء. وللتعرّف عليها، يحتاج نظام الذكاء الاصطناعي للرؤية إلى تحليل إطارات متعددة حتى يتمكن من تتبع حركة اليد وفهم اتجاه الإيماءة وتوقيتها.
دور خوارزميات رؤية الحاسوب في التعرّف على الإيماءات#
يمكن بناء أنظمة التعرّف على الإيماءات بطرق مختلفة. وتستخدم بعض أنظمة أساليب الإدخال مستشعرات قابلة للارتداء، مثل القفازات أو أجهزة التتبع المثبّتة على المعصم، لالتقاط حركة اليد.
قد تكون هذه التجهيزات دقيقة، لكنها ليست عملية دائمًا. إذ يجب ارتداء الأجهزة القابلة للارتداء وإعدادها وشحنها وصيانتها، وقد تبدو مقيّدة في المساحات المشتركة أو عند استخدامها يوميًا.
ولهذا السبب تعتمد العديد من الأنظمة المتطورة بدلًا من ذلك على رؤية الحاسوب. وباستخدام كاميرات RGB القياسية ومستشعرات العمق أو زمن الرحلة، تستطيع الأجهزة التقاط حركات اليد والجسم في الوقت الفعلي دون حاجة المستخدمين إلى ارتداء أجهزة إضافية. وهذا يجعل التعرّف على الإيماءات القائم على الرؤية مناسبًا جدًا للهواتف الذكية والسيارات وأجهزة التلفاز الذكية وسماعات AR وVR.
على سبيل المثال، تدعم نماذج رؤية الحاسوب مثل Ultralytics YOLO11 وUltralytics YOLO26 المرتقب مهام مثل اكتشاف الأجسام وتتبع الأجسام وتقدير الوضعية. ويمكن استخدام هذه الإمكانات لاكتشاف الأيدي في كل إطار، وتتبع حركتها بمرور الوقت، وتحديد النقاط الرئيسية مثل أطراف الأصابع والمفاصل. ويجعل ذلك من الممكن التعرّف على إيماءات مثل رفع الكف للإيقاف المؤقت، وضمّ الأصابع للتكبير، والسحب للتنقل في القوائم، أو الإشارة بإصبع لاختيار عنصر في AR وVR.
مهام رؤية الحاسوب المستخدمة في التعرّف على التفاعل بين الإنسان والآلة#
فيما يلي نظرة عامة على بعض مهام رؤية الحاسوب الأساسية المستخدمة في التعرّف على الإيماءات:
- اكتشاف الأجسام: تُستخدم هذه المهمة لتحديد موضع الأيدي في صورة أو إطار فيديو، عادةً من خلال رسم مربعات إحاطة حولها. وهي تساعد النظام على التركيز على منطقة الإيماءة وتجاهل تفاصيل الخلفية غير الضرورية.
- تتبّع الأجسام: استنادًا إلى اكتشاف الأجسام، تتتبع هذه المهمة الأيدي المكتشفة عبر إطارات متعددة وتحافظ على هويتها بمرور الوقت. وهي مفيدة خصوصًا للإيماءات الديناميكية، حيث تكون الحركة والاتجاه عاملين حاسمين.
- تقدير الوضعية: بدلًا من التركيز على مربعات الإحاطة، يحدد تقدير الوضعية النقاط الرئيسية في اليد، مثل أطراف الأصابع والمفاصل والمعصم. وتنشئ هذه المعالم هيكلًا عظميًا بسيطًا لليد يلتقط مواضع الأصابع والحركة الدقيقة، مما يتيح تصنيفًا أكثر تفصيلًا للإيماءات.
- تقسيم المثيلات: تهدف هذه المهمة إلى فصل كل يد عن الخلفية على مستوى البكسل من خلال إنشاء قناع لكل يد ظاهرة. وهي مفيدة في المشاهد المزدحمة، أو عند تداخل الأيدي، أو عند ظهور أيدٍ متعددة في الإطار.
تستخدم العديد من حلول الذكاء الاصطناعي للرؤية هذه المهام معًا ضمن خط أنابيب واحد. فعلى سبيل المثال، قد يبدأ النظام باكتشاف الأجسام للعثور على الأيدي، ثم يستخدم التتبع لمتابعتها عبر الإطارات في حالة الإيماءات الديناميكية.
إذا كانت الإيماءة تعتمد على موضع الأصابع، فيمكن لتقدير الوضعية إضافة نقاط رئيسية لمزيد من التفاصيل، بينما يمكن لتقسيم المثيلات أن يساعد على عزل كل يد بدقة أكبر في المشاهد المزدحمة أو عند تداخل أيدٍ متعددة. وتوفر هذه الخطوات مجتمعةً معلومات عن الموضع والحركة، مما يجعل التعرّف على الإيماءات أكثر دقة وموثوقية.
كيف يعمل التعرّف على الإيماءات القائم على الرؤية#
بعد أن كوّنا فهمًا أفضل لمهام رؤية الحاسوب الكامنة وراء التعرّف على الإيماءات، لنلقِ نظرة خطوة بخطوة على كيفية عمل نظام قائم على الرؤية.
يبدأ النظام النموذجي بالتقاط الفيديو من كاميرا، وأحيانًا يلتقط بيانات العمق أيضًا إذا كان الجهاز يدعمها. ثم تُعالج الإطارات مسبقًا باستخدام معالجة الصور لتصبح أسهل على النموذج من حيث المعالجة المتسقة، مثل تغيير الحجم أو تثبيت الصورة أو تقليل الضوضاء والتشوش الناتج عن الحركة.
بعد ذلك، يحدد النظام الأيدي في الإطار باستخدام الاكتشاف أو التقسيم، ويتابعها بمرور الوقت باستخدام التتبع. وإذا كان التطبيق يحتاج إلى تفاصيل أدق، فقد يجري أيضًا تقدير الوضعية لاستخراج نقاط رئيسية مثل أطراف الأصابع والمفاصل. وباستخدام هذه المعلومات، يصنّف النموذج الإيماءة، سواء كانت وضعية في إطار واحد مثل إشارة الإعجاب أو نمط حركة مثل السحب.
أخيرًا، تُربط الإيماءة التي جرى التعرّف عليها بإجراء في الواجهة، مثل التمرير أو التكبير أو اختيار عنصر أو ضبط مستوى الصوت أو التحكم في تفاعلات AR وVR. ويمكن أن يختلف خط الأنابيب الفعلي، إذ تستخدم التطبيقات الأبسط خطوات أقل، بينما تجمع التطبيقات الأكثر تعقيدًا بين الاكتشاف والتتبع وتقدير الوضعية لتحسين الدقة.
تطبيقات التعرّف على الإيماءات القائم على الرؤية#
بعد ذلك، لنستعرض كيفية استخدام التعرّف على الإيماءات في تطبيقات واقعية لفهم مواضع اليدين.
التفاعل القائم على الإيماءات مع أنظمة المعلومات والترفيه في السيارات#
بدأ التعرّف على الإيماءات في الظهور في واجهات المركبات الذكية، ولا سيما في أنظمة المعلومات والترفيه. وهو وسيلة مريحة للتحكم في بعض الميزات من خلال حركات يد بسيطة، مما قد يقلل حاجة السائقين إلى مدّ أيديهم نحو شاشات اللمس أو الأزرار الفعلية. فعلى سبيل المثال، يمكن استخدام إيماءة سريعة لضبط مستوى الصوت أو إدارة المكالمات أو التنقل عبر القوائم المعروضة على الشاشة.

الشكل 2. سائق يؤدي إيماءات باليد ضمن نطاق اكتشاف نظام المعلومات والترفيه (المصدر)
التفاعلات المعتمدة على الإيماءات في الألعاب#
في الألعاب والتجارب الغامرة، يغيّر التحكم القائم على الإيماءات طريقة تفاعل الناس مع العوالم الافتراضية. فبدلًا من الاعتماد على وحدات التحكم أو عصي التحكم فقط، يمكن للاعبين استخدام حركات اليد الطبيعية للتنقل في القوائم، والتقاط الأجسام الافتراضية، والتحكم في الشخصيات، أو تشغيل إجراءات داخل اللعبة.

الشكل 3. ممارسة الألعاب باستخدام إيماءات اليد (المصدر).
قد يبدو هذا النوع من التفاعل دون لمس أكثر سلاسة، ولا سيما في AR وVR. ونتيجة لذلك، أصبح تتبع اليد والتحكم بالإيماءات من الميزات الشائعة في سماعات VR والواقع المختلط.
التحكم السلس بالإيماءات في أجهزة المنزل الذكي#
بدأت أجهزة المنزل الذكي، مثل أجهزة التلفاز الذكية ومكبرات الصوت والأضواء المتصلة، في دعم التحكم القائم على الإيماءات لتنفيذ إجراءات سريعة دون لمس. وبحركة يد بسيطة، يمكن للمستخدمين تشغيل الأضواء أو ضبط مستوى الصوت أو تنفيذ أوامر أساسية دون الوصول إلى المفاتيح أو أجهزة التحكم عن بُعد.
فعلى سبيل المثال، يمكن للكاميرات العميقة المدمجة أو المتصلة في أنظمة الترفيه المنزلي التعرّف على إيماءات مثل السحب أو الإشارة أو رفع اليد. وقد يسهّل ذلك تصفح القوائم أو تغيير الإعدادات أو تأكيد الاختيارات من الجهة المقابلة للغرفة. وفي الخلفية، تعالج نماذج رؤية الحاسوب بث الكاميرا في الوقت الفعلي لاكتشاف هذه الإيماءات وتفسيرها.
التحكم بالروبوتات عبر الإيماءات والمدعوم بالذكاء الاصطناعي#
تخيّل موقفًا في مصنع يحتاج فيه عامل إلى توجيه روبوت أثناء حمل القطع، أو ارتداء القفازات، أو الوقوف على مسافة آمنة من المعدات المتحركة. في هذه الظروف، قد يكون الوصول إلى الأزرار أو لوحة التحكم بطيئًا أو حتى غير آمن.
وعلى النقيض من ذلك، يمكن أن تكون أنظمة التحكم القائمة على الإيماءات وسيلة عملية أكثر للتفاعل مع هذه الآلات دون استخدام اليدين. وهذا مفيد خصوصًا للـروبوتات التعاونية، أو الروبوتات التعاونية، المصممة للعمل إلى جانب البشر.
وبدلًا من التوجه إلى لوحة التحكم، يمكن للمشغّلين استخدام إشارات يد بسيطة لبدء الروبوت أو إيقافه أو توجيهه عن بُعد. ويقلل ذلك الاعتماد على عناصر التحكم المادية، ويمكن أن يدعم سير عمل أكثر أمانًا في أرضية المصنع.
كما يمكن لأنظمة التحكم المتقدمة القائمة على الرؤية، والمدعومة بنماذج التعلّم العميق أو خوارزميات التعلّم، أن تتجاوز الأوامر الأساسية. إذ تستطيع تفسير حركات اليد الدقيقة والاستجابة بسلاسة للتغيّرات الصغيرة في الاتجاه وللتوجيه والأتمتة الأكثر دقة.

الشكل 4. يد روبوتية تحلل إيماءة مستخدم (المصدر)
إيجابيات وسلبيات تقنية التعرّف على الإيماءات#
فيما يلي بعض الفوائد الرئيسية لاستخدام تقنية التعرّف على الإيماءات:
- تحسين إمكانية الوصول: يمكن أن توفر الإيماءات بديلًا للمستخدمين الذين يجدون صعوبة في استخدام لوحات المفاتيح أو شاشات اللمس أو وحدات التحكم.
- العمل من مسافة: يمكن التعرّف على الإيماءات من الجهة المقابلة للغرفة، وهو أمر مفيد لأجهزة التلفاز الذكية والأكشاك وأجهزة المنزل.
- المرونة عبر الأجهزة: يمكن أن تعمل مجموعات إيماءات متشابهة عبر الهواتف والسيارات والشاشات الذكية وسماعات AR أو VR، مما يجعل التفاعل متسقًا.
في الوقت نفسه، توجد بعض التحديات الواقعية التي قد تؤثر في الدقة والاتساق. وفيما يلي بعض العوامل التي ينبغي أخذها في الاعتبار:
- مشكلات الإضاءة وجودة الكاميرا: قد يؤدي انخفاض الإضاءة أو الوهج أو الظلال أو الكاميرات منخفضة الدقة إلى تقليل أداء التعرّف. وقد يؤثر ذلك بدوره في التحكم بالحركة.
- الاختلاف بين المستخدمين: يؤدي الأشخاص الإيماءات بطبيعة الحال بطرق مختلفة، وقد تؤثر الاختلافات في حجم اليد ومرونة الأصابع أو الملحقات في الدقة.
- قيود الحركة السريعة: قد تؤدي الإيماءات السريعة إلى تشوش الحركة أو تتسبب في عدم التقاط النموذج للإطارات الرئيسية، ولا سيما في الكاميرات ذات معدل الإطارات المنخفض.
أهم النقاط المستخلصة#
تجاوزت تقنية التعرّف على الإيماءات مختبرات الأبحاث، وأصبحت الآن جزءًا من الأجهزة والابتكارات اليومية. وعلى وجه التحديد، تتيح رؤية الحاسوب التحكم دون لمس في الألعاب والروبوتات والمنازل الذكية وأنظمة السيارات. ومع تحسّن نماذج الرؤية، من المرجح أن يصبح بناء هذه الواجهات دون لمس واستخدامها على نطاق أوسع أسهل.
اكتشف مجتمعنا ومستودع GitHub لمعرفة المزيد عن نماذج رؤية الحاسوب. واستكشف صفحات حلولنا للاطلاع على تطبيقات مثل الذكاء الاصطناعي في الزراعة ورؤية الحاسوب في الخدمات اللوجستية. وراجع خيارات الترخيص وابدأ ببناء نموذج الذكاء الاصطناعي للرؤية الخاص بك.









