Reinforcement Learning with Verifiable Rewards (RLVR)
اكتشف التعلّم المعزز بالمكافآت القابلة للتحقق (RLVR). تعرّف على كيفية تدريب ذكاء اصطناعي متقدم باستخدام تغذية راجعة حتمية وUltralytics YOLO26.
يُعد التعلم المعزز بالمكافآت القابلة للتحقق (RLVR) نهجًا تدريبيًا متقدمًا يُستخدم لتعزيز قدرات الاستدلال وحل المشكلات في نماذج الذكاء الاصطناعي (AI). وعلى خلاف أساليب التدريب التقليدية التي تعتمد على بيانات تفضيلات يعلّقها البشر، يستخدم RLVR أنظمة قائمة على القواعد لتقييم مخرجات النموذج بطريقة حتمية. ومن خلال تقديم مكافأة ثنائية موضوعية — مثل التحقق مما إذا كان جزء من الشيفرة المولّدة يُترجم بنجاح أو ما إذا كانت معادلة رياضية قد حُلّت على نحو صحيح — يتيح RLVR للنماذج التعلم عبر الاستكشاف غير المقيد. وتُعد حلقة التغذية الراجعة الموضوعية هذه من العوامل الرئيسية وراء الاختراقات الحديثة في نماذج الاستدلال عالية القدرة، إذ تمكّنها من اكتشاف مسارات منطقية مثلى ومعقدة من دون تدخل بشري مستمر.
المبادئ الأساسية لـ RLVR#
في بيئات التعلم الآلي (ML) القياسية، يتعلم وكيل الذكاء الاصطناعي عبر تعظيم إشارة المكافأة. وفي RLVR، يولّد نظام برمجي صارم إشارة المكافأة بدلًا من الأحكام البشرية الذاتية. وتعتمد عملية التعلم على بضع خطوات أساسية:
- استراتيجية الاستكشاف: ينشئ النموذج حلولًا محتملة متعددة أو مسارات استدلال مختلفة لمطالبة معينة، وغالبًا ما يستخدم أسلوب سلسلة الأفكار لتجزئة المهام المعقدة.
- التحقق الحتمي: تتحقق أداة خارجية — مثل مترجم Python أو آلة حاسبة أو نظام إدراك للرؤية الحاسوبية (CV) لرؤية الحاسوب — من المخرجات النهائية وفق معايير نجاح موضوعية.
- تحسين السياسة: إذا أمكن التحقق من صحة المخرجات، يحصل النموذج على مكافأة إيجابية. ثم تُحدَّث سياسة النموذج باستخدام خوارزميات التحسين، مثل تحسين السياسة النسبي الجماعي (GRPO) أو تحسين السياسة القريبة (PPO)، لترجيح مسارات الاستدلال الناجحة.
يحسّن هذا النهج كفاءة زمن استجابة الاستدلال للنموذج بدرجة كبيرة أثناء التدريب، ويشجع على نشوء قدرات استدلالية؛ وقد استُخدمت هذه التقنية مؤخرًا لتدريب نماذج عالية القدرة مثل DeepSeek-R1.
RLVR مقابل RLHF ونماذج مكافأة العملية#
من المهم التمييز بين RLVR وغيرها من مناهج المواءمة والتدريب في منظومة الذكاء الاصطناعي:
- مقابل التعلم المعزز من التغذية الراجعة البشرية (RLHF): يعتمد RLHF على نظام نمذجة المكافأة متعلّم ومدرّب على تفضيلات بشرية ذاتية. ويلغي RLVR عنق الزجاجة الناتج عن وجود الإنسان في حلقة التدريب، إذ يعتمد حصريًا على حقائق موضوعية قابلة للبرمجة، ما يجعله قابلًا للتوسع بدرجة كبيرة في المهام التي لها إجابات محددة صحيحة أو خاطئة.
- مقابل نموذج مكافأة العملية (PRM): بينما تقدم نماذج PRM تغذية راجعة تفصيلية خطوة بخطوة على امتداد مسار استدلال النموذج، يركز RLVR عادةً على النتيجة القابلة للتحقق في نهاية العملية. ومع ذلك، تشير أبحاث حديثة من عام 2025 إلى أن التحسين لتحقيق مكافأة نهائية قابلة للتحقق في RLVR يحفز ضمنيًا أيضًا صحة خطوات الاستدلال الوسيطة.
تطبيقات عملية#
يُحدث RLVR تحولًا في أساليب تدريب أنظمة الذكاء الاصطناعي المعقدة ضمن مجالات حتمية متعددة:
- الاستدلال الرياضي: تستفيد نماذج الاستدلال الكبيرة، مثل سلسلة OpenAI o، من RLVR لحل نظريات رياضية معقدة. ويعمل المتحقق كمحرك يثبت بصورة قاطعة صحة الإجابة التي استنتجها النموذج، ما يعزز أداء مجموعة بيانات معيارية بدرجة كبيرة.
- هندسة البرمجيات وتوليد الشيفرات: تستخدم مساعدات البرمجة بالذكاء الاصطناعي RLVR لكتابة الشيفرات وتصحيحها وتحسينها. وتتحقق المكافأة القابلة للتحقق عندما تُترجم الشيفرة المولّدة بنجاح وتجتاز مجموعة من اختبارات الوحدات المؤتمتة.
- وكلاء الرؤية الذاتية: في البيئات المادية، يحصل الوكلاء الذاتيون على مكافآت قابلة للتحقق عند بلوغ وجهة مستهدفة أو التعامل بنجاح مع جسم ما. وتعمل نماذج الرؤية في هذه البيئات كمتحققات من الشروط.
تنفيذ مكافأة قابلة للتحقق في ذكاء الرؤية الاصطناعي#
في البيئات المادية والبصرية، يمكن لنماذج الإدراك مثل Ultralytics YOLO26 أن تعمل كمتحقق قابل للبرمجة ضمن حلقة RLVR. فعلى سبيل المثال، إذا كان هدف وكيل الذكاء الاصطناعي نقل جسم إلى منطقة محددة، يمكن لنموذج YOLO التحقق من النجاح عبر اكتشاف وجود الجسم في تلك المنطقة.
يوضح مقتطف Python التالي مثالًا تصوريًا لمتحقق قابل للبرمجة باستخدام الحزمة ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")من خلال الاستفادة من المنصات السحابية مثل منصة Ultralytics لنشر متحققات الإدراك هذه، يستطيع المطورون إنشاء مسارات عمل RLVR متينة وقابلة للتوسع لتدريب الجيل التالي من الوكلاء الذاتيين ووكلاء الاستدلال.









