Process Reward Model (PRM)
استكشف كيف تعمل نماذج مكافأة العملية (PRM) على تحسين استدلال الذكاء الاصطناعي. تعلم كيف تضمن التغذية الراجعة على مستوى الخطوات في RLHF مسارات منطقية وآمنة لنماذج اللغات الكبيرة و Ultralytics YOLO26.
يتطلب تقييم نماذج الذكاء الاصطناعي المعقدة أكثر من مجرد التحقق مما إذا كانت الإجابة النهائية صحيحة. تخصص تقنية التعلم التعزيزي المتقدمة درجات رياضية لكل خطوة وسيطة يتخذها الذكاء الاصطناعي أثناء أداء مهمة ما، مما يوفر تعليقات كثيفة على مستوى الخطوة. يضمن هذا النهج الدقيق ألا يصل النموذج إلى الوجهة الصحيحة فحسب، بل يتبع أيضاً مسارات منطقية وآمنة وقابلة للتحقق للوصول إلى هناك.
نماذج مكافأة العملية مقابل نماذج مكافأة النتيجة#
في السياق الأوسع لـ نمذجة المكافآت، من المهم التمييز بين الإشراف المستند إلى العمليات والإشراف المستند إلى النتائج. توفر نماذج مكافآت النتائج التقليدية (ORMs) مكافأة واحدة متفرقة في نهاية التوليد تماماً. على الرغم من أن نماذج مكافآت النتائج أسهل في التدريب، إلا أنها تعاني من عيب رئيسي في المهام المعقدة: فقد تكافئ عن غير قصد النماذج التي تصل إلى الإجابة الصحيحة من خلال منطق معيب أو هلوسات.
يحل نموذج مكافآت العمليات (PRM) هذه المشكلة عن طريق تقييم مسار الاستدلال بأكمله. وكما شاع بفضل أبحاث OpenAI الأساسية في أوراق بحثية مثل لن تتحقق خطوة بخطوة، يطبق نموذج مكافآت العمليات (PRM) الإشراف خطوة بخطوة على كل فكرة أو إجراء. يعد هذا مكوناً أساسياً في خطوط أنابيب التعلم التعزيزي من تعليقات البشر (RLHF) المتقدمة، حيث يوجه بنشاط تحسين السياسات باستخدام خوارزميات مثل تحسين السياسة القريبة (PPO).
تطبيقات العالم الحقيقي#
تعمل نماذج مكافآت العمليات (PRMs) على تغيير طريقة عمل نماذج اللغات الكبيرة (LLMs) والأنظمة المستقلة في البيئات عالية المخاطر:
- الاستدلال الرياضي: من خلال تقييم المعادلات سطرًا بسطر، تتيح نماذج مكافآت العمليات (PRMs) للنماذج استخدام خوارزميات مثل أخذ عينات الأفضل من N (BoN) أو بحث شجرة مونت كارلو (MCTS) لاستكشاف مسارات حل متعددة وتحديد التسلسل الأكثر سلامة من الناحية المنطقية.
- توليد الكود: عند توليد البرمجيات، لا يكفي مجرد التحقق مما إذا كان النص البرمجية النهائي يعمل أم لا. توفر نماذج مكافآت العمليات (PRMs) إشرافًا على العمليات، حيث تقيم الدوال الفردية كتل المنطق لضمان أن يكون الكود فعالاً وآمنًا وقابلاً للصيانة.
- بحوث العمليات والوكلاء المرئيون: لقد أدت التطورات الحديثة في عامي 2025 و2026 إلى توسيع نطاق نماذج مكافآت العمليات (PRMs) إلى ما هو أبعد من النصوص. على سبيل المثال، تستخدم بحوث العمليات الآن نماذج مكافآت العمليات (PRMs) للتحقق من خوارزميات الجدولة المعقدة. وبالمثل، فإن وكلاء الذكاء الاصطناعي المرئيين المجهزين بمحركات رؤية حاسوبية قوية مثل Ultralytics YOLO26 يتلقون مكافآت خطوة بخطوة للتنقل في البيئات المادية، بدلاً من تلقي مكافأة واحدة فقط للوصول إلى الوجهة.
تنفيذ التغذية الراجعة على مستوى الخطوة#
يتطلب تدريب نموذج مكافآت العمليات (PRM) إدارة مجموعات بيانات واسعة النطاق حيث يتم تقييم كل خطوة فرعية بواسطة البشر أو نماذج ذكاء اصطناعي أقوى. تصبح إدارة مهام تعليقات البيانات المكثفة هذه أسهل مع الأدوات السحابية مثل منصة Ultralytics، والتي تبسط تنظيم المشاريع ونشرها.
أثناء الاستدلال أو تحسين النموذج، يحسب نموذج مكافآت العمليات (PRM) خسارة تراكمية أو مكافأة بناءً على سلسلة الخطوات. يوضح مقتطف Python المفهومي التالي الذي يستخدم torch كيف يتم معاقبة مكافآت مستوى الخطوة إذا فشلت خطوة وسيطة، وهو نهج شائع موجود في توثيق PyTorch لتسجيل التسلسلات:
import torch
# Simulate reward scores from a PRM for 3 consecutive reasoning steps
# Scores represent the probability of correctness for each step (0.0 to 1.0)
step_rewards = torch.tensor([0.95, 0.80, 0.15], requires_grad=True)
# The PRM aggregates the scores, heavily penalizing the poor 3rd step
# Negative log-likelihood is commonly used to optimize the trajectory
prm_loss = -torch.log(step_rewards).mean()
print(f"Calculated PRM Loss: {prm_loss.item():.4f}")
# During RLHF, this loss would guide hyperparameter tuning and model updatesمن خلال ضمان توافق كل خطوة وسيطة مع السلوك المتوقع، يمكن للمطورين نشر أنظمة موثوقة للغاية. يتيح الجمع بين الإشراف على مستوى العمليات والضبط المستمر للبارامترات الفائقة للنماذج من الجيل التالي التفكير حقًا في المشكلات بأمان وفعالية.






