الاستفادة من التعلم المعزز في مشاريع الرؤية الحاسوبية
اكتشف كيف يساعد التعلم المعزز في تطبيقات الرؤية الحاسوبية الأنظمةَ على الرؤية واتخاذ القرارات والتحسن في تطبيقات العالم الحقيقي عبر مختلف القطاعات.

تتمثل إحدى الطرق المباشرة لشرح الذكاء الاصطناعي (AI) في أنه مجال يركّز على إعادة إنشاء طريقة تفكير البشر وتعلّمهم. ومن هنا تأتي فكرة تقنيات التعلّم في الذكاء الاصطناعي، وهي أساليب مختلفة تتيح للآلات تحسين أدائها بمرور الوقت، تمامًا كما يفعل البشر.
استكشفنا سابقًا تقنيات التعلّم في الذكاء الاصطناعي الرئيسية، بما في ذلك التعلّم الخاضع للإشراف، والتعلّم غير الخاضع للإشراف، والتعلّم المعزّز، والتعلّم بالنقل، وكيف يؤدي كل منها دورًا مهمًا في مساعدة نماذج الذكاء الاصطناعي على معالجة المعلومات واتخاذ القرارات.
سنلقي اليوم نظرةً أقرب على التعلّم المعزّز، وهي تقنية تعلّم أنظمة الذكاء الاصطناعي من خلال الخبرة عبر التفاعل مع بيئة والتحسّن استنادًا إلى الملاحظات. وسنستكشف تحديدًا كيفية تطبيق التعلّم المعزّز على تطبيقات الرؤية الحاسوبية، أي الأنظمة التي تمكّن الآلات من تفسير المعلومات المرئية من العالم وفهمها.
يفتح الجمع بين مفاهيم مثل التعلّم المعزّز والرؤية الحاسوبية إمكانات جديدة ومثيرة، ويُعد مجالًا نشطًا للبحث. فهو يمكّن أنظمة الذكاء الاصطناعي من التعرّف على ما تراه واتخاذ قرارات مدروسة استنادًا إلى تلك المعلومات المرئية.
ما التعلّم المعزّز؟#
التعلّم المعزّز هو فرع من تعلّم الآلة يتعلّم فيه وكيل الذكاء الاصطناعي من خلال تنفيذ الإجراءات وتلقي الملاحظات في صورة مكافآت أو عقوبات. ويتمثل الهدف في تحديد الإجراءات التي تؤدي إلى أفضل النتائج بمرور الوقت.
يمكنك التفكير في التعلّم المعزّز على أنه يشبه تدريب كلب. فعندما يجلس الكلب استجابةً لأمر، تمنحه مكافأة. وبعد فترة، يتعلّم الكلب أن الجلوس يؤدي إلى مكافأة. وفي التعلّم المعزّز، يشبه وكيل الذكاء الاصطناعي أو النموذج الكلب؛ وتمثل البيئة العالم المحيط به، بينما تساعده المكافأة على فهم ما إذا كان قد اتخذ الخطوة الصحيحة.
يختلف هذا عن التعلّم الخاضع للإشراف، حيث يُعرض على نموذج الذكاء الاصطناعي العديد من الأمثلة على الإجابات الصحيحة. فعلى سبيل المثال، قد يُعرض على النموذج صورة لكلب ويُقال له: "هذا كلب."
أما التعلّم المعزّز فلا يعتمد على البيانات الموسومة. بل يتضمن التعلّم من خلال تجربة إجراءات مختلفة والتعلّم من النتائج، تمامًا كما يحدث عند لعب لعبة ومحاولة تحديد الحركات التي تساعدك على الفوز.

الشكل 1. التعلّم المعزّز مقابل التعلّم الخاضع للإشراف.
يُعد التعلّم المعزّز ضروريًا للمهام التي تُتخذ فيها القرارات خطوةً بخطوة، ويؤثر كل اختيار في ما يحدث لاحقًا. ويُستخدم هذا النوع من التعلّم في ألعاب الفيديو الاستراتيجية لجعل أسلوب اللعب أكثر تحديًا وتشويقًا للاعبين.
كيفية عمل التعلّم المعزّز في حلول الذكاء الاصطناعي#
فكّر في كيفية تعلّمك ركوب الدراجة. قد تسقط في البداية، لكنك تبدأ مع التدريب في اكتشاف ما يساعدك على الحفاظ على توازنك. وكلما ركبت أكثر، تحسّن أداؤك. فأنت تتعلّم بالممارسة، لا بمجرد إخبارك بما يجب فعله.
يعمل التعلّم المعزّز بطريقة مشابهة في الذكاء الاصطناعي. فهو يتعلّم من خلال الخبرة، عبر تجربة إجراءات مختلفة، وملاحظة ما يحدث، وتحسين قدرته تدريجيًا على اتخاذ الخيارات الصحيحة بمرور الوقت.

الشكل 2. فهم كيفية عمل التعلّم المعزّز.
فيما يلي نظرة على بعض المكوّنات الرئيسية للتعلّم المعزّز:
- الوكيل: الوكيل هو المتعلّم أو متخذ القرار. ويتفاعل مع البيئة من خلال تنفيذ الإجراءات، ويهدف إلى تحقيق هدف محدد.
- البيئة: تشمل البيئة كل ما يتفاعل معه الوكيل. وتتغير استجابةً لإجراءات الوكيل، وتوفر ملاحظات استنادًا إلى النتائج.
- الحالة: تمثل الحالة لقطةً للوضع الحالي في البيئة. ويراقب الوكيل الحالة لفهم محيطه وتحديد الإجراء الذي ينبغي اتخاذه بعد ذلك.
- الإجراء: الإجراء هو حركة أو قرار يتخذه الوكيل ويؤثر في البيئة. ويؤدي كل إجراء إلى حالة جديدة، ويمكن أن يؤثر في المكافآت المستقبلية.
- المكافأة: المكافأة هي ببساطة ملاحظات من البيئة تخبر الوكيل بما إذا كان إجراؤه مفيدًا أم لا. وتشجّع المكافآت الإيجابية الوكيل على تكرار الإجراءات الجيدة، بينما تثنيه المكافآت السلبية عن الإجراءات السيئة.
- السياسة: السياسة هي استراتيجية الوكيل لاختيار الإجراءات استنادًا إلى الحالة الحالية. ومع مرور الوقت، ينقّح الوكيل سياسته لتعظيم إجمالي المكافآت التي يمكنه كسبها.
يتيح استخدام هذه المكوّنات معًا لأنظمة الذكاء الاصطناعي تعلّم سلوكيات فعّالة من خلال التجربة والخطأ المستمرين. ومع كل محاولة، يصبح الوكيل أفضل في اختيار الإجراءات التي تؤدي إلى مكافآت أعلى ونتائج أفضل.
التعلّم المعزّز في ابتكارات الرؤية الحاسوبية#
تُستخدم الرؤية الحاسوبية في مهام مثل اكتشاف الكائنات في الصور، وتصنيف محتوى الصورة، وتقسيم الصورة إلى أجزاء مختلفة. وتدعم نماذج الرؤية الحاسوبية مثل Ultralytics YOLO11 هذه المهام، ويمكن استخدامها لبناء تطبيقات مؤثرة تجمع رؤى مرئية.
ومع ذلك، عندما تُدمج مهام الذكاء الاصطناعي للرؤية مع التعلّم المعزّز، تكون النتيجة حلًا للذكاء الاصطناعي لا يكتفي بالرؤية، بل يتعلّم أيضًا كيفية التصرف استنادًا إلى الرؤى المرئية ويتحسّن بمرور الوقت.
من الأمثلة المثيرة للاهتمام على التعلّم المعزّز في تطبيقات الرؤية الحاسوبية استخدام الروبوتات في المستودعات. إذ يمكن للروبوتات المزوّدة بالكاميرات وأنظمة الرؤية الحاسوبية تحليل محيطها، واكتشاف موقع كل عنصر، وتحديد شكله وحجمه، وفهم كيفية تموضعه على الرف.
في كل مرة يحاول فيها الروبوت التقاط عنصر، يتلقى ملاحظات؛ نجاحًا إذا التُقط العنصر بطريقة صحيحة، أو فشلًا إذا سقط. وبمرور الوقت، يتعلّم الروبوت الإجراءات الأفضل لمختلف العناصر. وبدلًا من اتباع مجموعة ثابتة من التعليمات، يتحسّن باستمرار من خلال الخبرة.

الشكل 3. ذراع روبوتية تستخدم الذكاء الاصطناعي للرؤية والتعلّم المعزّز لالتقاط الكائنات.
تطبيقات التعلّم المعزّز في الرؤية الحاسوبية#
بعد أن أصبح لدينا فهم أفضل لماهية التعلّم المعزّز ودوره في الرؤية الحاسوبية، سنلقي نظرةً أقرب على بعض الأمثلة التي يُستخدم فيها التعلّم المعزّز والرؤية الحاسوبية معًا.
دمج الذكاء الاصطناعي للرؤية والتعلّم المعزّز لمركبات أكثر ذكاءً#
يمكن أن تعتمد المركبات ذاتية القيادة على الذكاء الاصطناعي للرؤية لفهم محيطها، وعلى التعلّم المعزّز لاتخاذ القرارات استنادًا إلى ما تراه. ويُعد AWS DeepRacer مثالًا رائعًا على ذلك عمليًا.
إن AWS DeepRacer سيارة سباق ذاتية القيادة بالكامل بمقياس 1/18، تتعلّم القيادة باستخدام كاميرا والتعلّم المعزّز. وبدلًا من إخبارها بما يجب فعله، تكتشف الأمور بنفسها من خلال المحاولة وارتكاب الأخطاء والتعلّم منها.
تعمل كاميرا هذه السيارة الصغيرة كزوج من العينين، إذ تلتقط صورة المسار أمامها. واستنادًا إلى ما تراه، تتعلّم السيارة كيفية التوجيه والسرعة المناسبة. ومع كل دورة، يتحسّن أداؤها. فعلى سبيل المثال، قد تتعلّم اتخاذ منعطفات أوسع أو التباطؤ قبل المنعطفات الحادة من خلال التعلّم من المحاولات السابقة.
يبدأ تدريب DeepRacer في بيئة افتراضية، حيث يتدرّب النموذج على مهارات القيادة ويُنقّحها. وعندما يصل إلى مستوى معين من الأداء، تُنقل تلك المهارات إلى مسارات واقعية باستخدام سيارات فعلية.

الشكل 4. يستخدم AWS DeepRacer الرؤية والتعلّم المعزّز للقيادة ذاتيًا. مصدر الصورة: Amazon.
التوجه نحو الروبوتات الجراحية ذاتية القيادة#
من مجالات البحث المثيرة التي تحظى باهتمام متزايد دمج الذكاء الاصطناعي للرؤية والتعلّم المعزّز في الجراحة الروبوتية. ولا يزال هذا التطبيق في الوقت الحالي نظريًا إلى حد كبير. ويجري الباحثون عمليات محاكاة في بيئات افتراضية.
ومع ذلك، تُظهر التجارب المبكرة نتائج واعدة، ما يشير إلى أن الروبوتات الجراحية قد تتمكن في نهاية المطاف من تنفيذ إجراءات معقدة ودقيقة بدرجة أكبر من الدقة والقدرة على التكيّف، مع الحد الأدنى من التدخل البشري.

الشكل 5. أصبحت الروبوتات الجراحية أكثر تقدمًا بمرور الوقت.
على سبيل المثال، تخيّل موقفًا يلزم فيه رفع قطعة من الشاش بعناية من موضع جراحي. سيحلل روبوت مزوّد بالذكاء الاصطناعي للرؤية المشهد أولًا، باستخدام التقسيم لتحديد الشاش والأنسجة المحيطة به.
وسيساعد التعلّم المعزّز الروبوت الجراحي بعد ذلك على تحديد كيفية التعامل مع المهمة، من خلال تحديد أفضل زاوية لإمساك الشاش، ومقدار الضغط الذي ينبغي تطبيقه، وكيفية رفعه دون إزعاج المناطق الحساسة القريبة. وبمرور الوقت ومن خلال التدريب المتكرر في بيئات محاكاة، يمكن للروبوت أن يتعلّم تنفيذ هذه الحركات الدقيقة والحاسمة بمهارة وثقة متزايدتين.
إيجابيات وسلبيات التعلّم المعزّز في الذكاء الاصطناعي للرؤية#
يتيح التعلّم المعزّز لأنظمة الذكاء الاصطناعي للرؤية تجاوز حدود التعرّف البسيط والبدء في اتخاذ القرارات استنادًا إلى ما تراه. ويفتح ذلك إمكانات جديدة في مجالات مثل الروبوتات والأتمتة والتفاعل في الوقت الفعلي.
فيما يلي بعض المزايا الرئيسية لدمج التعلّم المعزّز في مسارات عمل الذكاء الاصطناعي للرؤية:
- اعتماد أقل على البيانات الموسومة: يمكن لهذه الأنظمة التعلّم من التفاعل، ولذلك لا تحتاج إلى مجموعات بيانات موسومة ضخمة للبدء.
- تعامل أفضل مع عدم اليقين: يستطيع التعلّم المعزّز التعامل مع المعلومات المرئية غير المكتملة أو المشوشة عبر تعديل الإجراءات استنادًا إلى الملاحظات بدلًا من الاعتماد فقط على البيانات المثالية.
- دعم التعلّم طويل الأمد: يساعد النماذج على التحسّن بمرور الوقت من خلال التعلّم من تسلسلات الإجراءات، وليس من قرارات منفردة في خطوة واحدة فحسب.
ومن ناحية أخرى، إليك بعض قيود التعلّم المعزّز التي ينبغي أخذها في الاعتبار:
- مشكلة إسناد الفضل: قد يكون من الصعب على الوكيل تحديد الإجراءات المحددة التي أسهمت في النتيجة النهائية، ولا سيما في التسلسلات الطويلة من القرارات.
- خطر الاستكشاف غير الآمن: أثناء التدريب، قد يجرّب الوكيل إجراءات غير آمنة أو غير مرغوب فيها، وهو ما لن يكون مقبولًا في تطبيقات العالم الحقيقي مثل الرعاية الصحية أو القيادة الذاتية.
- التقارب البطيء: قد يستغرق النموذج وقتًا طويلًا للوصول فعليًا إلى أداء جيد، ولا سيما في المهام المعقدة.
أهم النقاط المستخلصة#
يتيح التعلّم المعزّز في مشاريع الرؤية الحاسوبية لأنظمة الذكاء الاصطناعي فهم محيطها وتعلّم كيفية التصرف من خلال الخبرة. ومع نماذج مثل Ultralytics YOLO11 التي توفر اكتشاف الكائنات في الوقت الفعلي، يمكن للنظام اتخاذ قرارات مدروسة استنادًا إلى ما يراه.
يتجاوز هذا النهج الأساليب التقليدية من خلال السماح للذكاء الاصطناعي بالتحسّن عبر التجربة والملاحظات بدلًا من الاعتماد حصريًا على البيانات الموسومة. وهو يدعم التعلّم المستمر ويساعد على بناء أنظمة ذكاء اصطناعي للرؤية أكثر مرونة وقدرة على التكيّف وذكاءً، تتحسّن بمرور الوقت.
انضم إلى مجتمعنا المتنامي. تفضّل بزيارة مستودعنا على GitHub للتعمّق في الذكاء الاصطناعي. هل تتطلع إلى بدء مشاريعك الخاصة في مجال الرؤية الحاسوبية؟ استكشف خيارات الترخيص لدينا. تعرّف على المزيد حول الذكاء الاصطناعي في التصنيع والذكاء الاصطناعي للرؤية في قطاع السيارات في صفحات حلولنا.









