Reinforcement Learning with Verifiable Rewards (RLVR)
اكتشف التعلم المعزز بمكافآت قابلة للتحقق (RLVR). تعلم كيفية تدريب ذكاء اصطناعي متطور باستخدام التغذية الراجعة الحتمية و Ultralytics YOLO26.
التعلم التعزيزي مع المكافآت القابلة للتحقق (RLVR) هو نموذج تدريب متقدم يُستخدم لتحسين قدرات الاستدلال وحل المشكلات لنماذج الذكاء الاصطناعي (AI). على عكس طرق التدريب التقليدية التي تعتمد على بيانات تفضيلات مُعلَّقة بشرياً، يستخدم RLVR أنظمة حتمية قائمة على القواعد لتقييم مخرجات النموذج. من خلال توفير مكافأة موضوعية ثنائية - مثل ما إذا كانت قطعة من الكود المُولَّد تترجم بنجاح أو يتم حل معادلة رياضية بشكل صحيح - يتيح RLVR للنماذج التعلم من خلال الاستكشاف غير المقيد. حلقة التغذية الراجعة الموضوعية هذه هي المحرك الرئيسي وراء الانجازات الأخيرة في نماذج الاستدلال عالية الكفاءة، مما يمكنها من اكتشاف مسارات منطقية مثالية ومعقدة دون تدخل بشري مستمر.
المبادئ الأساسية لـ RLVR#
في بيئات التعلم الآلي (ML) القياسية، يتعلم وكيل الذكاء الاصطناعي من خلال تعظيم إشارة المكافأة. في RLVR، يتم إنشاء إشارة المكافأة هذه بواسطة نظام برمجي صارم بدلاً من الحكم البشري الذاتي. تعتمد عملية التعلم على خطوات أساسية قليلة:
- استراتيجية الاستكشاف: يولد النموذج حلولاً متعددة محتملة أو مسارات استدلال لموجه معين، غالباً باستخدام موجه سلسلة الأفكار لتقسيم المهام المعقدة.
- التحقق الحتمي: تتحقق أداة خارجية - مثل مترجم Python أو آلة حاسبة أو نظام إدراك رؤية حاسوبية (CV) - من المخرجات النهائية مقابل معايير نجاح موضوعية.
- تحسين السياسة: إذا كانت المخرجات صحيحة يمكن التحقق منها، يتلقى النموذج مكافأة إيجابية. يتم بعد ذلك تحديث سياسة النموذج باستخدام خوارزميات التحسين مثل Group Relative Policy Optimization (GRPO) أو Proximal Policy Optimization (PPO) لتفضيل مسارات الاستدلال الناجحة.
يحسن هذا النهج بشكل كبير كفاءة زمن انتقال الاستدلال للنموذج في وقت التدريب ويشجع على قدرات الاستدلال الناشئة، وهي تقنية استخدم مؤخراً لتدريب نماذج عالية القدرة مثل DeepSeek-R1.
RLVR مقابل RLHF و PRMs#
من المهم التمييز بين RLVR ونماذج المحاذاة والتدريب الأخرى في نظام الذكاء الاصطناعي البيئي:
- مقابل التعلم التعزيزي من التغذية الراجعة البشرية (RLHF): يعتمد RLHF على نظام نمذجة المكافآت المُتعلَّم والمُدَرَّب على التفضيلات البشرية الذاتية. يلغي RLVR عنق الزجاجة المتمثل في وجود الإنسان في الحلقة من خلال الاعتماد حصرياً على الحقائق البرمجية الموضوعية، مما يجعله قابل للتوسع بشكل كبير للمهام التي لها إجابات قطعية صحيحة أو خاطئة.
- مقابل نموذج مكافأة العمليات (PRM): بينما توفر نماذج PRM تغذية راجعة مفصلة خطوة بخطوة طوال مسار استدلال النموذج، يركز RLVR عادةً على النتيجة القابلة للتحقق في نهاية العملية. ومع ذلك، تشير أبحاث عام 2025 الأخيرة إلى أن التحسين من أجل مكافأة نهائية قابلة للتحقق في RLVR يحفز ضمنياً خطوات الاستدلال الوسيطة الصحيحة أيضاً.
تطبيقات العالم الحقيقي#
يعمل RLVR على تحويل كيفية تدريب أنظمة الذكاء الاصطناعي المعقدة عبر مختلف المجالات الحتمية:
- الاستدلال الرياضي: تستفيد نماذج الاستدلال الكبيرة مثل سلسلة OpenAI o من RLVR لحل النظريات الرياضية المعقدة. يعمل المُتحقِّق بمثابة محرك يثبت بشكل قاطع ما إذا كانت الإجابة المشتقة للنموذج صحيحة، مما يعزز أداء مجموعة بيانات المعيار بشكل كبير.
- هندسة البرمجيات وتوليد الكود: تستخدم مساعدات ترميز الذكاء الاصطناعي RLVR لكتابة الكود وتصحيحه وتحسينه. يتم تحقيق المكافأة القابلة للتحقق عندما يتم تجميع الكود المُولَّد بنجاح واجتيازه لمجموعة من اختبارات الوحدات الآلية.
- وكلاء الرؤية المستقلون: في البيئات الفيزيائية، يتلقى الوكلاء المستقلون مكافآت قابلة للتحقق عند الوصول إلى وجهة مستهدفة أو معالجة كجسم بنجاح. تعمل نماذج الرؤية كفاحص شروط قابل للتحقق في هذه المساحات.
تنفيذ مكافأة قابلة للتحقق في رؤية الذكاء الاصطناعي#
في البيئات الفيزيائية والمرئية، يمكن لننماذج الإدراك مثل Ultralytics YOLO26 أن تعمل كمتحقق برمجي في حلقة RLVR. على سبيل المثال، إذا كان هدف وكيل الذكاء الاصطناعي هو نقل جسم إلى منطقة معينة، فيمكن لنموذج YOLO التحقق من النجاح عن طريق اكتشاف وجود الكائن في تلك المنطقة.
يوضح مقطع Python التالي متحققاً برمجياً مفاهيمياً باستخدام حزمة ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")من خلال الاستفادة من منصات السحابة مثل Ultralytics Platform لنشر محققات الإدراك هذه، يمكن للمطورين بناء خطوط أنابيب RLVR قوية وقابلة للتطوير تقوم بتدريب الجيل القادم من الوكلاء المستقلين ووكلاء الاستدلال.






