Reinforcement Learning
استكشف المفاهيم الأساسية للتعلم التعزيزي (RL). تعلم كيف يستخدم الوكلاء التغذية الراجعة لإتقان المهام، وشاهد كيف تدعم Ultralytics YOLO26 أنظمة رؤية التعلم التعزيزي.
التعلم التعزيزي (RL) هو فرع موجه نحو الأهداف من تعلم الآلة (ML) حيث يتعلم نظام مستقل، يُعرف بالوكل، اتخاذ القرارات من خلال تنفيذ إجراءات وتلقي تعليقات من بيئته. على عكس التعلم الخاضع للإشراف، الذي يعتمد على مجموعات بيانات ثابتة مصنفة بالإجابات الصحيحة، تتعلم خوارزميات التعلم التعزيزي من خلال عملية ديناميكية من التجربة والخطأ. يتفاعل الوكيل مع محاكاة أو العالم الحقيقي، مراقباً عواقب أفعاله لتحديد الاستراتيجيات التي تحقق أعلى المكافآت على المدى الطويل. يحاكي هذا النهج عن كثب المفهوم النفسي لـالتكييف الإجرائي، حيث يتم تشكيل السلوك من خلال التعزيز الإيجابي (المكافآت) والتعزيز السلبي (العقوبات) بمرور الوقت.
المفاهيم الأساسية لحلقة RL#
لفهم كيف يعمل التعلم التعزيزي، من المفيد تصوره كدورة مستمرة من التفاعل. غالباً ما يتم صياغة هذا الإطار رياضياً كـعملية قرار ماركوف (MDP)، والتي تنظم عملية اتخاذ القرار في المواقف التي تكون فيها النتائج عشوائية جزئياً ومتحكماً بها جزئياً بواسطة صانع القرار.
تتضمن المكونات الأساسية لحلقة التعلم هذه ما يلي:
- وكيل الذكاء الاصطناعي: الكيان المسؤول عن التعلم واتخاذ القرارات. فهو يدرك البيئة ويتخذ إجراءات لتحقيق أقصى قدر من نجاحه التراكمي.
- البيئة: العالم الخارجي الذي يعمل فيه الوكيل. يمكن أن يكون هذا لعبة فيديو معقدة، أو محاكاة لسوق مالية، أو مستودعاً مادياً في مجال الذكاء الاصطناعي في الخدمات اللوجستية.
- الحالة: لقطة أو تمثيل للوضع الحالي. في التطبيقات المرئية، يتضمن هذا غالباً معالجة تدفقات الكاميرا باستخدام رؤية الكمبيوتر (CV) للكشف عن الكائنات والعقبات.
- الإجراء: الحركة أو الخيار المحدد الذي يتخذه الوكيل. يُشار إلى المجموعة الكاملة لجميع الحركات الممكنة بـمساحة الإجراءات.
- المكافأة: إشارة رقمية يتم إرسالها من البيئة إلى الوكيل بعد إجراء ما. تُخصص دالة المكافأة المصممة جيداً قيمًا إيجابية للأجراءات المفيدة وعقوبات للأجراءات الضارة.
- السياسة: الاستراتيجية أو مجموعة القواعد التي يستخدمها الوكيل لتحديد الإجراء التالي بناءً على الحالة الحالية. تحدد خوارزميات مثل تعلم Q كيف يتم تحديث هذه السياسة وتحسينها.
تطبيقات العالم الحقيقي#
لقد تجاوز التعلم المعزز البحث النظري إلى عمليات نشر عملية عالية التأثير عبر مختلف الصناعات.
- الروبوتات المتقدمة: في مجال الذكاء الاصطناعي في الروبوتات، يمكن التعلم التعزيزي الآلات من إتقان مهارات حركية معقدة يصعب برمجتها بشكل صارم. يمكن للروبوتات أن تتعلم كيفية الإمساك بالأجسام غير المنتظمة أو التنقل في التضاريس الوعرة عن طريق التدريب داخل محركات الفيزياء مثل NVIDIA Isaac Sim قبل نشرها في العالم الحقيقي.
- الأنظمة المستقلة: تستخدم المركبات المستقلة التعلم التعزيزي لاتخاذ قرارات في الوقت الفعلي في سيناريوهات المرور غير المتوقعة. بينما تحدد نماذج اكتشاف الكائنات المشاة واللافتات، تساعد خوارزميات التعلم التعزيزي في تحديد سياسات القيادة الآمنة لدمج المسارات والتنقل في التقاطعات.
- التحسين الاستراتيجي: اكتسب التعلم التعزيزي اهتماماً عالمياً عندما هزمت أنظمة مثل Google DeepMind's AlphaGo أبطال العالم البشريين في ألعاب لوحية معقدة. بالإضافة إلى الألعاب، تعمل هذه الوكلاء على تحسين اللوجستيات الصناعية، مثل التحكم في أنظمة التبريد في مراكز البيانات لتقليل استهلاك الطاقة.
دمج الرؤية مع التعلم المعزز#
في العديد من التطبيقات الحديثة، تكون "الحالة" التي يراها الوكيل مرئية. تعمل النماذج عالية الأداء مثل YOLO26 كطبقة إدراك لوكلاء التعلم التعزيزي، حيث تحول الصور الخام إلى بيانات منظمة. تصبح هذه المعلومات المعالجة - مثل موقع الكائنات وفئتها - هي الحالة التي تستخدمها سياسة التعلم التعزيزي لاختيار إجراء.
يوضح المثال التالي كيفية استخدام حزمة ultralytics لمعالجة إطار بيئي، وإنشاء تمثيل للحالة (مثل عدد الكائنات) لحلقة تعلم تعزيزي نظرية.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")
# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Process the frame to extract the current 'state'
results = model(observation_frame)
# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")التمييز بين المصطلحات ذات الصلة#
من المهم التمييز بين التعلم المعزز ونماذج التعلم الآلي الأخرى:
- مقابل التعلم الخاضع للإشراف: يتطلب التعلم الخاضع للإشراف مشرفاً خارجيبي مطلعاً لتوفير بيانات تدريب مصنفة (مثل: "تحتوي هذه الصورة على قطة"). في المقابل، يتعلم التعلم التعزيزي من عواقب أفعاله الخاصة بدون تسميات صريحة، مكتشفاً المسارات المثلى من خلال الاستكشاف.
- مقابل التعلم غير الخاضع للإشراف: يركز التعلم غير الخاضع للإشراف على العثور على هياكل أو أنماط مخفية داخل البيانات غير المصنفة (مثل تجميع العملاء). يختلف التعلم التعزيزي لأنه موجه نحو الهدف بشكل صريح، مع التركيز على تعظيم إشارة المكافأة بدلاً من مجرد وصف بنية البيانات.
مع زيادة القدرة الحسابية، تعمل تقنيات مثل التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) على تحسين طريقة تعلم الوكلاء بشكل أكبر، ومواءمة أهدافهم بشكل وثيق مع القيم البشرية المعقدة ومعايير الأمان. غالباً ما يستخدم الباحثون بيئات قياسية مثل Gymnasium لتقييم هذه الخوارزميات وتحسينها. بالنسبة للفرق التي تتطلع إلى إدارة مجموعات البيانات اللازمة لطبقات الإدراك لهذه الوكلاء، توفر Ultralytics Platform أدوات شاملة للتعليق وإدارة النماذج.






