Reinforcement Learning from Human Feedback (RLHF)
تعلّم كيف توائم عملية التعلّم المعزز من خلال التغذية الراجعة البشرية (RLHF) الذكاء الاصطناعي مع القيم الإنسانية. استكشف مكوّناتها الأساسية وتكاملها مع Ultralytics YOLO26.
التعلّم بالتعزيز من الملاحظات البشرية (RLHF) هو تقنية متقدمة في تعلّم الآلة تعمل على تحسين نماذج الذكاء الاصطناعي من خلال دمج المدخلات البشرية المباشرة في حلقة التدريب. وعلى خلاف التعلّم الخاضع للإشراف القياسي، الذي يعتمد حصراً على مجموعات بيانات ثابتة وموسومة، يقدّم RLHF آلية ملاحظات ديناميكية يقيّم فيها المقوّمون البشريون مخرجات النموذج أو يرتّبونها. تتيح هذه العملية للذكاء الاصطناعي استيعاب أهداف معقدة أو ذاتية أو دقيقة—مثل "الإفادة" أو "السلامة" أو "الإبداع"—يصعب تعريفها باستخدام دالة خسارة رياضية بسيطة. أصبح RLHF ركناً أساسياً في تطوير نماذج اللغة الكبيرة (LLMs) الحديثة والذكاء الاصطناعي التوليدي، بما يضمن توافق نماذج الأساس القوية بفاعلية مع القيم البشرية ونوايا المستخدمين.
المكوّنات الأساسية لـ RLHF#
تتبع عملية RLHF عموماً خط أنابيب من ثلاث خطوات، صُمّم لردم الفجوة بين القدرات التنبؤية الأولية والسلوك المتوافق مع البشر.
-
الضبط الدقيق الخاضع للإشراف (SFT): تبدأ سيرورة العمل عادةً بـنموذج أساس مدرَّب مسبقاً. وينفّذ المطوّرون ضبطاً دقيقاً أولياً باستخدام مجموعة بيانات أصغر وعالية الجودة من الأمثلة التوضيحية (مثل أزواج الأسئلة والأجوبة التي يكتبها الخبراء). تؤسس هذه الخطوة سياسة أساسية، وتعلّم النموذج الصيغة والنبرة العامتين المتوقعتين للمهمة.
-
تدريب نموذج المكافأة: تُعدّ هذه المرحلة السمة المميّزة لـ RLHF. يراجع المعلّقون البشريون مخرجات متعددة أنشأها النموذج للمدخل نفسه، ويرتّبونها من الأفضل إلى الأسوأ. وينتج عن جهد وسم البيانات هذا مجموعة بيانات للتفضيلات. وتُدرَّب شبكة عصبية منفصلة، تُسمى نموذج المكافأة، على بيانات المقارنة هذه للتنبؤ بدرجة عددية تعكس الحكم البشري. ويمكن للأدوات المتاحة على منصة Ultralytics تبسيط إدارة سيرورات التعليق هذه.
-
تحسين التعلّم بالتعزيز: يعمل النموذج الأصلي أخيراً بوصفه وكيلاً للذكاء الاصطناعي ضمن بيئة تعلّم بالتعزيز. وباستخدام نموذج المكافأة دليلاً، تضبط خوارزميات التحسين مثل تحسين السياسة القريبة (PPO) معاملات النموذج لتعظيم المكافأة المتوقعة. توائم هذه الخطوة سياسة النموذج مع التفضيلات البشرية المتعلَّمة، وتشجّع السلوكيات المفيدة والآمنة، بينما تثبط المخرجات السامة أو العبثية.
التطبيقات الواقعية#
أثبت RLHF أهميته البالغة في نشر أنظمة ذكاء اصطناعي تتطلب معايير سلامة عالية وفهماً دقيقاً للتفاعل البشري.
- الذكاء الاصطناعي التحاوري وروبوتات الدردشة: يتمثل أبرز تطبيق لـ RLHF في مواءمة روبوتات الدردشة لتكون مفيدة وغير مؤذية وصادقة. ومن خلال معاقبة المخرجات المتحيزة أو غير الصحيحة من الناحية الواقعية أو الخطرة، يساعد RLHF على الحد من الهلوسة في LLMs وتقليل خطر التحيز الخوارزمي. ويضمن ذلك قدرة المساعدين الافتراضيين على رفض التعليمات الضارة مع بقائهم مفيدين للاستفسارات المشروعة.
- الروبوتات والتحكم الفيزيائي: يمتد RLHF إلى ما هو أبعد من النصوص ليشمل الذكاء الاصطناعي في الروبوتات، حيث يصعب تحديد دالة مكافأة مثالية للمهام الفيزيائية المعقدة. فعلى سبيل المثال، قد يتلقى روبوت يتعلم التنقل في مستودع مزدحم ملاحظات من المشرفين البشريين حول المسارات الآمنة وتلك التي تسببت في اضطرابات. وتعمل هذه الملاحظات على تحسين سياسة تحكم الروبوت بفاعلية أكبر من التعلّم بالتعزيز العميق البسيط القائم حصراً على إتمام الهدف.
RLHF مقارنةً بالتعلّم بالتعزيز القياسي#
من المفيد التمييز بين RLHF والتعلّم بالتعزيز (RL) التقليدي لفهم فائدته الخاصة.
- التعلّم بالتعزيز القياسي: في الإعدادات التقليدية، غالباً ما تكون دالة المكافأة مبرمجة مسبقاً بواسطة البيئة. فعلى سبيل المثال، توفّر البيئة في لعبة فيديو إشارة واضحة (+1 للفوز، -1 للخسارة). ويُحسّن الوكيل أفعاله ضمن عملية اتخاذ القرار لماركوف (MDP) المحددة هذه.
- RLHF: في كثير من سيناريوهات العالم الحقيقي، مثل كتابة قصة إبداعية أو القيادة بأدب، يكون "النجاح" أمراً ذاتياً. ويعالج RLHF ذلك باستبدال المكافأة المبرمجة مسبقاً بنموذج مكافأة متعلَّم مستمد من التفضيلات البشرية. ويتيح هذا تحسين مفاهيم مجردة مثل "الجودة" أو "الملاءمة" يستحيل برمجتها صراحةً.
دمج الإدراك مع حلقات الملاحظات#
في التطبيقات المرئية، يعتمد الوكلاء المتوافقون مع RLHF غالباً على الرؤية الحاسوبية (CV) لإدراك حالة بيئتهم قبل التصرف. ويعمل كاشف متين، مثل YOLO26، بوصفه طبقة الإدراك، موفراً ملاحظات منظمة (مثل "اكتُشف عائق على بُعد 3 أمتار") تستخدمها شبكة السياسة لاختيار إجراء.
يوضّح مثال Python التالي مفهوماً مبسطاً يوفّر فيه نموذج YOLO حالة البيئة. وفي حلقة RLHF مكتملة، ستأتي إشارة "المكافأة" من نموذج مدرَّب على الملاحظات البشرية المتعلقة بقرارات الوكيل المستندة إلى بيانات الكشف هذه.
from ultralytics import YOLO
# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")
# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")
# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)
print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.من خلال الجمع بين نماذج الإدراك القوية والسياسات المحسّنة عبر الملاحظات البشرية، يستطيع المطوّرون بناء أنظمة ليست ذكية فحسب، بل متوافقة أيضاً بصرامة مع مبادئ سلامة الذكاء الاصطناعي. ويواصل البحث الجاري في الإشراف القابل للتوسع، مثل الذكاء الاصطناعي الدستوري، تطوير هذا المجال بهدف تقليل عنق الزجاجة المتمثل في التعليق البشري واسع النطاق، مع الحفاظ على الأداء العالي للنموذج.









