Reinforcement Learning
استكشف المفاهيم الأساسية للتعلّم المعزز (RL). تعلّم كيف يستخدم الوكلاء التغذية الراجعة لإتقان المهام، وشاهد كيف يدعم Ultralytics YOLO26 أنظمة الرؤية بالتعلّم المعزز.
التعلُّم المعزَّز (RL) هو مجال فرعي موجَّه نحو تحقيق الأهداف من التعلُّم الآلي (ML)، حيث يتعلّم نظام مستقل، يُعرف باسم الوكيل، اتخاذ القرارات من خلال تنفيذ الإجراءات وتلقّي الملاحظات من بيئته. وعلى خلاف التعلُّم الخاضع للإشراف، الذي يعتمد على مجموعات بيانات ثابتة مُعنونة بالإجابات الصحيحة، تتعلّم خوارزميات RL من خلال عملية ديناميكية قائمة على التجربة والخطأ. يتفاعل الوكيل مع محاكاة أو مع العالم الحقيقي، ويراقب عواقب إجراءاته لتحديد الاستراتيجيات التي تحقق أعلى مكافآت طويلة الأمد. يحاكي هذا النهج إلى حد كبير المفهوم النفسي لـالتكييف الإجرائي، حيث يتشكّل السلوك بمرور الوقت من خلال التعزيز الإيجابي (المكافآت) والتعزيز السلبي (العقوبات).
المفاهيم الأساسية لحلقة RL#
لفهم كيفية عمل RL، من المفيد تصوّره على هيئة دورة تفاعل مستمرة. وغالبًا ما تُصاغ هذه البنية رياضيًا باعتبارها عملية اتخاذ القرار لماركوف (MDP)، التي تنظّم عملية اتخاذ القرار في الحالات التي تكون فيها النتائج عشوائية جزئيًا وتحت سيطرة متخذ القرار جزئيًا.
تشمل المكوّنات الأساسية لحلقة التعلّم هذه:
- وكيل AI: الكيان المسؤول عن التعلّم واتخاذ القرارات. يدرك البيئة ويتخذ الإجراءات لتعظيم نجاحه التراكمي.
- البيئة: العالم الخارجي الذي يعمل فيه الوكيل. وقد تكون هذه البيئة لعبة فيديو معقدة، أو محاكاة لسوق مالي، أو مستودعًا ماديًا في مجال الذكاء الاصطناعي في الخدمات اللوجستية.
- الحالة: لقطة أو تمثيل للوضع الحالي. وفي التطبيقات المرئية، يتضمن ذلك غالبًا معالجة تدفقات الكاميرا باستخدام الرؤية الحاسوبية (CV) لاكتشاف الأجسام والعوائق.
- الإجراء: الحركة أو الاختيار المحدد الذي يتخذه الوكيل. ويُشار إلى المجموعة الكاملة لجميع الحركات الممكنة باسم فضاء الإجراءات.
- المكافأة: إشارة رقمية تُرسل من البيئة إلى الوكيل بعد تنفيذ إجراء. وتُسنِد دالة المكافأة المصمَّمة جيدًا قيمًا إيجابية للإجراءات المفيدة، وتفرض عقوبات على الإجراءات الضارة.
- السياسة: الاستراتيجية أو مجموعة القواعد التي يستخدمها الوكيل لتحديد الإجراء التالي استنادًا إلى الحالة الحالية. وتحدّد خوارزميات مثل Q-learning كيفية تحديث هذه السياسة وتحسينها.
التطبيقات الواقعية#
انتقل التعلُّم المعزَّز من نطاق البحث النظري إلى عمليات نشر عملية عالية التأثير في مختلف القطاعات.
- الروبوتات المتقدمة: في مجال الذكاء الاصطناعي في الروبوتات، يمكّن RL الآلات من إتقان مهارات حركية معقدة يصعب ترميزها يدويًا. ويمكن للروبوتات تعلّم إمساك الأجسام غير المنتظمة أو التنقل في التضاريس غير المستوية من خلال التدريب داخل محركات فيزيائية مثل NVIDIA Isaac Sim قبل نشرها في العالم الحقيقي.
- الأنظمة المستقلة: تستخدم المركبات المستقلة RL لاتخاذ قرارات آنية في سيناريوهات المرور غير المتوقعة. وبينما تحدد نماذج اكتشاف الأجسام المشاة والإشارات، تساعد خوارزميات RL في تحديد سياسات القيادة الآمنة للاندماج في المسارات والتنقل عبر التقاطعات.
- التحسين الاستراتيجي: اكتسب RL اهتمامًا عالميًا عندما تغلبت أنظمة مثل AlphaGo التابعة لـ Google DeepMind على أبطال العالم من البشر في ألعاب لوحية معقدة. وبعيدًا عن الألعاب، تعمل هذه الوكلاء على تحسين الخدمات اللوجستية الصناعية، مثل التحكم في أنظمة التبريد في مراكز البيانات لخفض استهلاك الطاقة.
دمج الرؤية مع RL#
في العديد من التطبيقات الحديثة، تكون «الحالة» التي يلاحظها الوكيل مرئية. وتعمل النماذج عالية الأداء مثل YOLO26 كطبقة إدراك لوكلاء RL، فتحوّل الصور الأولية إلى بيانات منظَّمة. وتصبح هذه المعلومات المعالجة—مثل مواقع الأجسام وفئاتها—هي الحالة التي تستخدمها سياسة RL لاختيار إجراء.
يوضح المثال التالي كيفية استخدام الحزمة ultralytics لمعالجة إطار من البيئة، وإنشاء تمثيل للحالة (مثل عدد الأجسام) لحلقة RL نظرية.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")
# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Process the frame to extract the current 'state'
results = model(observation_frame)
# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")تمييز المصطلحات ذات الصلة#
من المهم التمييز بين التعلُّم المعزَّز ونماذج التعلُّم الآلي الأخرى:
- مقابل التعلُّم الخاضع للإشراف: يتطلب التعلُّم الخاضع للإشراف مشرفًا خارجيًا ذا معرفة لتوفير بيانات تدريب معنونة (مثل: «تحتوي هذه الصورة على قطة»). وعلى النقيض، يتعلّم RL من عواقب إجراءاته الخاصة دون تسميات صريحة، ويكتشف المسارات المثلى من خلال الاستكشاف.
- مقابل التعلُّم غير الخاضع للإشراف: يركّز التعلُّم غير الخاضع للإشراف على العثور على البُنى أو الأنماط الخفية داخل البيانات غير المعنونة (مثل تجميع العملاء في عناقيد). ويختلف RL لأنه موجَّه صراحةً نحو تحقيق الأهداف، إذ يركّز على تعظيم إشارة المكافأة بدلًا من مجرد وصف بنية البيانات.
مع ازدياد القدرة الحاسوبية، تعمل تقنيات مثل التعلُّم المعزَّز من الملاحظات البشرية (RLHF) على تحسين كيفية تعلّم الوكلاء، ومواءمة أهدافهم بدرجة أكبر مع القيم الإنسانية المعقدة ومعايير السلامة. وغالبًا ما يستخدم الباحثون بيئات معيارية مثل Gymnasium لقياس أداء هذه الخوارزميات وتحسينها. وبالنسبة إلى الفرق التي تسعى إلى إدارة مجموعات البيانات اللازمة لطبقات الإدراك لدى هذه الوكلاء، توفر منصة Ultralytics أدوات شاملة للتوسيم وإدارة النماذج.









