Markov Decision Process (MDP)
استكشف أساسيات عمليات اتخاذ القرار لماركوڤ (MDP). تعلّم كيف تدعم MDPs التعلّم المعزّز وكيف يوفّر Ultralytics YOLO26 بيانات الحالة في الوقت الفعلي.
عملية اتخاذ القرار الماركوفي (MDP) هي إطار رياضي يُستخدم لنمذجة اتخاذ القرارات في الحالات التي تكون فيها النتائج عشوائية جزئيًا وخاضعة جزئيًا لتحكم صانع القرار. وهي المخطط الأساسي لـالتعلّم بالتعزيز (RL)، إذ توفر طريقة منظمة لـوكيل ذكاء اصطناعي للتفاعل مع بيئة بهدف تحقيق غاية محددة. وعلى خلاف التعلّم الخاضع للإشراف القياسي، الذي يعتمد على مجموعات بيانات ثابتة وموسومة، تركز عملية اتخاذ القرار الماركوفي (MDP) على اتخاذ القرارات المتسلسلة، حيث تؤثر الأفعال الحالية في الاحتمالات المستقبلية.
المكونات الأساسية لعملية اتخاذ القرار الماركوفي (MDP)#
لفهم كيفية عمل عملية اتخاذ القرار الماركوفي (MDP)، من المفيد تصورها كدورة تفاعل بين وكيل وبيئته. وتتحدد هذه الدورة بخمسة مكونات رئيسية:
- الحالة: الوضع الحالي للبيئة أو تهيئتها. في المركبات ذاتية القيادة، قد تشمل الحالة سرعة السيارة وموقعها والعوائق القريبة التي تكتشفها مستشعرات الرؤية الحاسوبية (CV).
- الفعل: مجموعة جميع التحركات أو الخيارات الممكنة المتاحة للوكيل. ويُشار إلى ذلك غالبًا باسم فضاء الأفعال، الذي قد يكون متقطعًا (مثل التحرك إلى اليسار أو اليمين) أو مستمرًا (مثل ضبط زاوية التوجيه).
- احتمال الانتقال: يحدد هذا الاحتمال مدى إمكانية الانتقال من حالة إلى أخرى بعد اتخاذ فعل محدد. وهو يأخذ في الحسبان عدم اليقين وديناميكيات العالم الحقيقي، مما يميز عمليات اتخاذ القرار الماركوفي (MDP) عن الأنظمة الحتمية.
- المكافأة: إشارة عددية تُستقبل بعد كل فعل. وتُعد دالة المكافأة بالغة الأهمية لأنها توجه سلوك الوكيل؛ فالمكافآت الإيجابية تشجع الأفعال المرغوبة، بينما تثبط المكافآت السلبية (العقوبات) الأخطاء.
- عامل الخصم: قيمة تحدد أهمية المكافآت المستقبلية مقارنة بالمكافآت الفورية. وهو يساعد الوكيل على إعطاء الأولوية للتخطيط طويل الأمد بدلًا من الإشباع قصير الأمد، وهو مفهوم محوري في التحسين الاستراتيجي.
التطبيقات الواقعية#
تعمل عمليات اتخاذ القرار الماركوفي (MDP) كمحرك لاتخاذ القرارات وراء العديد من التقنيات المتقدمة، مما يتيح للأنظمة التنقل في بيئات معقدة وديناميكية.
- التحكم في الروبوتات: في الذكاء الاصطناعي في الروبوتات، تمكّن عمليات اتخاذ القرار الماركوفي (MDP) الآلات من تعلم مهارات حركية معقدة. فعلى سبيل المثال، يستخدم ذراع روبوتية عمليات اتخاذ القرار الماركوفي (MDP) لتحديد المسار الأمثل لالتقاط جسم مع تجنب الاصطدامات. وتمثل الحالة زوايا المفاصل وموضع الجسم، المستمدين من اكتشاف الأجسام ثلاثي الأبعاد، بينما تستند المكافأة إلى سرعة الإمساك الناجح.
- إدارة المخزون: يستخدم تجار التجزئة عمليات اتخاذ القرار الماركوفي (MDP) من أجل تحسين المخزون. وتمثل الحالة هنا مستويات المخزون الحالية، بينما تتمثل الأفعال في قرارات إعادة الطلب، وتُحسب المكافآت استنادًا إلى هوامش الربح مطروحًا منها تكاليف التخزين ونفاد المخزون.
- العلاج الطبي: في الطب الشخصي، تساعد عمليات اتخاذ القرار الماركوفي (MDP) على تصميم خطط علاج ديناميكية. ومن خلال نمذجة المؤشرات الصحية للمريض بوصفها حالات، والأدوية بوصفها أفعالًا، يمكن للأطباء استخدام النمذجة التنبؤية لتعظيم النتائج الصحية طويلة الأمد للمريض.
العلاقة مع التعلّم بالتعزيز#
على الرغم من ارتباطهما الوثيق، من المهم التمييز بين عملية اتخاذ القرار الماركوفي (MDP) والتعلّم بالتعزيز. فعملية اتخاذ القرار الماركوفي (MDP) هي صياغة المشكلة الرسمية—أي النموذج الرياضي للبيئة. أما التعلّم بالتعزيز فهو الطريقة المستخدمة لحل تلك المشكلة عندما لا تكون الديناميكيات الداخلية (احتمالات الانتقال) معروفة بالكامل. وتتفاعل خوارزميات التعلّم بالتعزيز، مثل Q-learning، مع عملية اتخاذ القرار الماركوفي (MDP) لتعلّم أفضل سياسة من خلال التجربة والخطأ.
الملاحظة البصرية في عمليات اتخاذ القرار الماركوفي (MDP)#
في تطبيقات الذكاء الاصطناعي الحديثة، غالبًا ما تُستمد "الحالة" في عملية اتخاذ القرار الماركوفي (MDP) من البيانات المرئية. وتعمل نماذج الإدراك عالية السرعة كعيون للنظام، فتحوّل تدفقات الكاميرا الخام إلى بيانات منظمة يمكن لعملية اتخاذ القرار الماركوفي (MDP) معالجتها. فعلى سبيل المثال، يمكن لـUltralytics YOLO26 توفير إحداثيات الأجسام في الوقت الفعلي، التي تعمل مدخلات للحالة لدى وكيل اتخاذ القرار.
يوضح المثال التالي كيفية استخراج تمثيل للحالة (المربعات المحيطة) من صورة باستخدام Python، والذي يمكن بعد ذلك تمريره إلى سياسة عملية اتخاذ القرار الماركوفي (MDP).
from ultralytics import YOLO
# Load the YOLO26 model to serve as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to observe the current 'state' of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding box coordinates to form the state vector
# This structured data tells the agent where objects are located
for box in results[0].boxes:
print(f"State Object: Class {int(box.cls)} at {box.xywh.tolist()}")من خلال دمج نماذج الرؤية المتينة مع أطر عمل عمليات اتخاذ القرار الماركوفي (MDP)، يمكن للمطورين بناء أنظمة لا تدرك العالم فحسب، بل تتخذ فيه أيضًا قرارات ذكية وتكيفية. ويُعد هذا التكامل ضروريًا لتطوير الأنظمة ذاتية التشغيل والتصنيع الذكي.









