Reinforcement Learning from Human Feedback (RLHF)
تعلم كيف يعمل التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) على مواءمة الذكاء الاصطناعي مع القيم البشرية. استكشف مكوناته الأساسية وتكامله مع Ultralytics YOLO26.
التعلم التعزيزي من التقييم البشري (RLHF) هو تقنية متقدمة في التعلم الآلي تعمل على تحسين نماذج الذكاء الاصطناعي من خلال دمج المدخلات البشرية المباشرة في حلقة التدريب. على عكس التعلم الخاضع للإشراف القياسي، والذي يعتمد كلياً على مجموعات بيانات ثابتة وملصقة، يقدّم RLHF آلية تقييم ديناميكية يقوم فيها المقيمون البشريون بترتيب مخرجات النموذج أو تقييمها. تتيح هذه العملية للذكاء الاصطناعي التقاط أهداف معقدة، أو ذاتية، أو دقيقة - مثل "المساعدة" أو "الأمان" أو "الإبداع" - والتي يصعب تحديدها باستخدام دالة خسارة رياضية بسيطة. أصبح RLHF حجر الأساس في تطوير نماذج اللغات الكبيرة (LLMs) الحديثة والذكاء الاصطناعي التوليدي، مما يضمن توافق نماذج الأساس القوية بفعالية مع القيم البشرية ونيّة المستخدم.
المكونات الأساسية لـ RLHF#
تتبع عملية RLHF بشكل عام خط أنابيب من ثلاث خطوات مصمم لسد الفجوة بين القدرات التنبؤية الخام والسلوك المتوافق مع البشر.
-
الضبط الدقيق الخاضع للإشراف (SFT): تبدأ سير العمليات عادةً بنموذج أساس مدرب مسبقاً. يقوم المطورون بإجراء الضبط الدقيق الأولي باستخدام مجموعة بيانات أصغر وعالية الجودة من العروض التوضيحية (على سبيل المثال، أزواج أسئلة وأجوبة كتبها خبراء). تؤسس هذه الخطوة سياسة أساسية، مما يعلم النموذج التنسيق العام والنبرة المتوقعة للمهمة.
-
تدريب نموذج المكافأة: هذه المرحلة هي الميزة المميزة لـ RLHF. يقوم المقيمون البشريون بمراجعة مخرجات متعددة أنشأها النموذج لنفس المدخلات وترتيبها من الأفضل إلى الأسوأ. يولّد جهد ترميز البيانات هذا مجموعة بيانات من التفضيلات. يتم تدريب شبكة عصبية منفصلة، تُسمى نموذج المكافأة، على بيانات المقارنة هذه للتنبؤ بنتيجة عددية تعكس الحكم البشري. يمكن للأدوات المتوفرة على Ultralytics Platform تبسيط إدارة عمليات ترميز البيانات هذه.
-
تحسين التعلم التعزيزي: أخيراً، يعمل النموذج الأصلي كوكيل ذكاء اصطناعي داخل بيئة تعلم تعزيزي. باستخدام نموذج المكافأة كدليل، تقوم خوارزميات التحسين مثل تحسين السياسة القريبة (PPO) بتعديل معاملات النموذج لتعظيم المكافأة المتوقعة. توازن هذه الخطوة سياسة النموذج مع التفضيلات البشرية المتعلمة، مما يشجع السلوكيات المفيدة والآمنة بينما يثبط المخرجات السامة أو غير المنطقية.
تطبيقات العالم الحقيقي#
لقد أثبت RLHF أهميته في نشر أنظمة الذكاء الاصطناعي التي تتطلب معايير أمان عالية وفهمًا دقيقًا للتفاعل البشري.
- الذكاء الاصطناعي التحدثي وروبوتات الدردشة: التطبيق الأبرز لـ RLHF هو مطابقة روبوتات الدردشة لتكون مفيدة وغير ضارة وصادقة. من خلال معاقبة المخرجات المتحيزة أو غير الدقيقة واقعياً أو الخطيرة، يساعد RLHF في التخفيف من الهلوسة في نماذج اللغات الكبيرة ويقلل من خطر التحيز الخوارزمي. يضمن ذلك قدرة المساعدين الافتراضيين على رفض التعليمات الضارة مع البقاء مفيدين للاستفسارات المشروعة.
- الروبوتات والتحكم الفيزيائي: يمتد RLHF إلى ما وחר النص ليشمل الذكاء الاصطناعي في الروبوتات، حيث يمثل تحديد دالة مكافأة مثالية للمهام الفيزيائية المعقدة تحدياً. على سبيل المثال، قد يتلقى روبوت يتعلم التنقل في مستودع مزدحم تعليقات من المشرفين البشر حول المسارات الآمنة مقارنة بتلك التي تسببت في اضطرابات. تعمل هذه التعليقات على صقل سياسة التحكم للروبوت بشكل أكثر فعالية من التعلم التعزيزي العميق البسيط المستند فقط إلى إنجاز الأهداف.
RLHF مقابل التعلم التعزيزي القياسي#
من المفيد التمييز بين RLHF والتعلم التعزيزي (RL) التقليدي لفهم فائدته المحددة.
- التعلم التعزيزي القياسي: في الإعدادات التقليدية، غالباً ما يتم ترميز دالة المكافأة مسبقاً بواسطة البيئة. على سبيل المثال، في لعبة فيديو، توفر البيئة إشارة واضحة (+1 للفوز، -1 للخسارة). يحسن الوكيل إجراءاته داخل عملية قرار ماركوف (MDP) المحددة هذه.
- RLHF: في العديد من سيناريوهات العالم الحقيقي، مثل كتابة قصة إبداعية أو القيادة بتهذيب، يكون "النجاح" أمرًا ذاتيًا. يحل RLHF هذه المشكلة عن طريق استبدال المكافأة المرمزة برمجياً بنموذج مكافأة متعلم مشتق من التفضيلات البشرية. يتيح ذلك تحسين مفاهيم مجردة مثل "الجودة" أو "الملاءمة" التي يستحيل برمجتها بشكل صريح.
دمج الإدراك مع حلقات التغذية الراجعة#
في التطبيقات المرئية، غالباً ما تعتمد الوكلاء الموائمون مع RLHF على الرؤية الحاسوبية (CV) لإدراك حالة بيئتهم قبل اتخاذ الإجراءات. يعمل كاشف قوي، مثل YOLO26، كطبقة إدراك، موفراً ملاحظات منظمة (على سبيل المثال، "تم اكتشاف عائق على مسافة 3 أمتار") تستخدمها شبكة السياسة لاختيار إجراء ما.
يوضح مثال Python التالي مفهومًا مبسطًا حيث يوفر نموذج YOLO حالة البيئة. في حلقة RLHF كاملة، ستأتي إشارة "المكافأة" من نموذج تم تدريبه على التغذية الراجعة البشرية فيما يتعلق بقرارات الوكيل بناءً على بيانات الكشف هذه.
from ultralytics import YOLO
# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")
# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")
# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)
print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.من خلال الجمع بين نماذج الإدراك القوية والسياسات المحسنة عبر التعليقات البشرية، يمكن للمطورين بناء أنظمة لا تتميز بالذكاء فحسب، بل تتوافق بدقة أيضاً مع مبادئ أمان الذكاء الاصطناعي. يستمر البحث المستمر في الرقابة القابلة للتطوير، مثل Constitutional AI، في تطوير هذا المجال، بهدف تقليل عنق الزجاجة المتمثل في التعليقات البشرية واسعة النطاق مع الحفاظ على أداء عالٍ للنموذج.






