Deep Reinforcement Learning
استكشف التعلّم التعزيزي العميق (DRL) وكيف يجمع بين اتخاذ القرار بالذكاء الاصطناعي والتعلّم العميق. تعلّم استخدام Ultralytics YOLO26 كطبقة إدراك اليوم.
التعلم المعزز العميق (DRL) هو مجموعة فرعية متقدمة من الذكاء الاصطناعي (AI) تجمع بين قدرات اتخاذ القرار في التعلم المعزز والقدرة الإدراكية لـالتعلم العميق (DL). وبينما يعتمد التعلم المعزز التقليدي على الأساليب الجدولية لربط الحالات بالإجراءات، تواجه هذه الأساليب صعوبات عندما تكون البيئة معقدة أو مرئية. ويتغلب DRL على ذلك باستخدام الشبكات العصبية لتفسير بيانات الإدخال عالية الأبعاد، مثل إطارات الفيديو أو قراءات المستشعرات، مما يمكّن الآلات من تعلم استراتيجيات فعالة مباشرةً من التجربة الخام دون تعليمات بشرية صريحة.
الآلية الأساسية لـ DRL#
في نظام DRL، يتفاعل وكيل الذكاء الاصطناعي مع بيئة ضمن خطوات زمنية متقطعة. وفي كل خطوة، يلاحظ الوكيل "الحالة" الحالية، ويختار إجراءً بناءً على سياسة، ويتلقى إشارة مكافأة توضح نجاح ذلك الإجراء أو فشله. والهدف الأساسي هو تعظيم المكافأة التراكمية بمرور الوقت.
يشير المكوّن "العميق" إلى استخدام الشبكات العصبية العميقة لتقريب السياسة (الاستراتيجية المتبعة للتصرف) أو دالة القيمة (المكافأة المستقبلية المقدّرة). ويسمح ذلك للوكيل بمعالجة البيانات غير المهيكلة، والاستفادة من الرؤية الحاسوبية (CV) لـ"رؤية" البيئة بطريقة تشبه الإنسان إلى حد كبير. وتدعم هذه القدرة أطر عمل مثل PyTorch أو TensorFlow، التي تيسّر تدريب هذه الشبكات المعقدة.
التطبيقات الواقعية#
تجاوز DRL نطاق البحث النظري ليصل إلى تطبيقات عملية عالية التأثير في مختلف الصناعات:
- الروبوتات المتقدمة: في مجال الذكاء الاصطناعي في الروبوتات، يمكّن DRL الآلات من إتقان مهارات حركية معقدة يصعب ترميزها يدويًا. ويمكن للروبوتات تعلم إمساك أجسام غير منتظمة أو اجتياز تضاريس غير مستوية من خلال تحسين حركاتها داخل محركات فيزيائية مثل NVIDIA Isaac Sim. وغالبًا ما يتضمن ذلك التدريب على البيانات الاصطناعية قبل نشر السياسة على أجهزة فعلية.
- القيادة الذاتية: تستفيد المركبات ذاتية القيادة من DRL لاتخاذ قرارات في الوقت الفعلي ضمن سيناريوهات مرورية غير متوقعة. وبينما تحدد نماذج اكتشاف الأجسام المشاة والإشارات، تستخدم خوارزميات DRL تلك المعلومات لتحديد سياسات قيادة آمنة للاندماج في المسارات، والتنقل عبر التقاطعات، والتحكم في السرعة، مع إدارة زمن استجابة الاستدلال المطلوب لتحقيق السلامة بفعالية.
الرؤية بوصفها مراقبًا للحالة#
في العديد من تطبيقات DRL، تكون "الحالة" مرئية. وتعمل النماذج عالية السرعة بمثابة عيون الوكيل، إذ تحوّل الصور الخام إلى بيانات مهيكلة يمكن لشبكة السياسة الاستناد إليها. يوضح المثال التالي كيفية عمل نموذج YOLO26 بوصفه طبقة الإدراك لوكيل، حيث يستخرج الملاحظات (مثل عدد العوائق) من البيئة.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")تمييز DRL عن المفاهيم ذات الصلة#
من المفيد التمييز بين التعلم المعزز العميق والمصطلحات المشابهة لفهم موقعه الفريد في مجال الذكاء الاصطناعي:
- التعلم المعزز (RL): يُعد RL القياسي المفهوم الأساسي، لكنه يعتمد عادةً على جداول البحث (مثل جداول Q)، التي تصبح غير عملية مع مساحات الحالات الكبيرة. ويحل DRL هذه المشكلة باستخدام التعلم العميق لتقريب الدوال، مما يمكّنه من التعامل مع مدخلات معقدة مثل الصور.
- التعلم المعزز من الملاحظات البشرية (RLHF): بينما يعمل DRL عادةً على تحسين دالة مكافأة محددة رياضيًا (مثل النقاط في لعبة)، يعمل RLHF على تحسين النماذج—وتحديدًا نماذج اللغة الكبيرة (LLMs)—باستخدام التفضيلات البشرية الذاتية لمواءمة سلوك الذكاء الاصطناعي مع القيم البشرية، وهي تقنية شاعت بفضل مجموعات بحثية مثل OpenAI.
- التعلم غير الخاضع للإشراف: تبحث الأساليب غير الخاضعة للإشراف عن أنماط خفية في البيانات دون ملاحظات صريحة. وعلى النقيض من ذلك، فإن DRL موجّه نحو هدف، إذ تدفعه إشارة مكافأة ترشد الوكيل بنشاط نحو هدف محدد، كما نوقش في المؤلفات التأسيسية لـSutton and Barto.
يمكن للمطورين الذين يسعون إلى إدارة مجموعات البيانات المطلوبة لطبقات الإدراك في أنظمة DRL استخدام منصة Ultralytics، التي تبسّط سير عمل التعليق والتدريب السحابي. بالإضافة إلى ذلك، يستخدم الباحثون غالبًا بيئات موحّدة مثل Gymnasium لقياس أداء خوارزميات DRL لديهم مقارنةً بخطوط أساس معتمدة.









