Reward Modeling
استكشف نمذجة المكافآت في تعلّم الآلة. تعلّم كيف تستخدم التغذية الراجعة البشرية لمواءمة وكلاء الذكاء الاصطناعي ونماذج Ultralytics YOLO26 لتحقيق أداء أكثر أمانًا ودقة.
نمذجة المكافآت هي تقنية في تعلّم الآلة تُستخدم لتعليم أنظمة الذكاء الاصطناعي كيفية تقييم سلوكياتها وترتيب أولوياتها استنادًا إلى تفضيلات البشر. في بيئات التعلّم المعزّز التقليدية، يتعلّم وكيل الذكاء الاصطناعي من خلال تعظيم دالة مكافأة محددة مسبقًا وجامدة رياضيًا، مثل النتيجة في لعبة فيديو. غير أنّ كتابة دالة مكافأة مثالية يدويًا تكاد تكون مستحيلة بالنسبة إلى المهام المعقدة في العالم الحقيقي، حيث يكون السلوك «الجيد» ذاتيًا أو دقيقًا—مثل كتابة بريد إلكتروني مهذب أو اجتياز تقاطع بأمان. وتحل نمذجة المكافآت هذه المشكلة من خلال تدريب شبكة عصبية ثانوية (نموذج المكافأة) لتعمل بديلًا عن الحكم البشري. ويقيّم هذا النموذج مخرجات الذكاء الاصطناعي الأساسي ويُسنِد إليها درجات عددية، موجّهًا النموذج الرئيسي ديناميكيًا نحو سلوكيات آمنة ومفيدة ودقيقة.
كيفية عمل نمذجة المكافآت#
تعتمد عملية بناء نموذج مكافأة اعتمادًا كبيرًا على جمع ملاحظات بشرية عالية الجودة.
- وسم البيانات والتفضيلات: يُزوَّد الم annotatorون البشريون بمطالبات إلى جانب استجابات متعددة مولّدة بواسطة نموذج ذكاء اصطناعي. ويرتّب المقيّمون هذه الاستجابات من الأفضل إلى الأسوأ استنادًا إلى معايير مثل الفائدة وعدم الإضرار والدقة. ويمكن إدارة عمليات سير عمل الوسم واسعة النطاق هذه بسلاسة باستخدام Ultralytics Platform.
- تدريب الشبكة البديلة: تُدرَّب شبكة عصبية متخصصة على مجموعة البيانات هذه من المقارنات البشرية. ومن خلال عملية تحسين، تتعلّم التنبؤ بالمخرج الذي سيفضّله الإنسان، إذ تربط التضمينات لفعل أو استجابة نصية بقيمة مكافأة عددية واحدة. ويمكنك قراءة المزيد عن بناء معماريات الشبكات العصبية في وثائق PyTorch API.
- تحسين السياسة: يستخدم النموذج الأساسي الملاحظات المستمرة من نموذج المكافأة لتحسين أفعاله، مستعينًا عادةً بخوارزميات مثل تحسين السياسة القريبة (PPO). تعمل هذه الخطوة على مواءمة سياسة النموذج تكراريًا مع النية البشرية المتعلَّمة.
نمذجة المكافآت مقابل RLHF#
من المهم التمييز بين نمذجة المكافآت والتعلّم المعزّز من الملاحظات البشرية (RLHF). فعلى الرغم من مناقشة المصطلحين معًا frequently، فإنهما ليسا مترادفين. يُعد RLHF خط أنابيب شاملًا من البداية إلى النهاية لمواءمة النماذج، ويشمل الضبط الدقيق الخاضع للإشراف، وجمع البيانات، وتحديثات السياسة. أما نمذجة المكافآت فهي مكوّن محدد وحاسم ضمن خط أنابيب RLHF. وتعمل بوصفها جسرًا يترجم التصنيفات البشرية المنفصلة إلى إشارة رياضية مستمرة يمكن لخوارزمية التعلّم المعزّز تحسينها.
التطبيقات الواقعية#
تؤدي نمذجة المكافآت دورًا محوريًا في تطوير أنظمة الذكاء الاصطناعي الحديثة التي تتفاعل مباشرةً مع البشر والعالم المادي.
- النماذج اللغوية الكبيرة (LLMs): تعتمد مساعدات الذكاء الاصطناعي الحوارية على نماذج المكافآت لضمان أن تكون إجاباتها صحيحة من حيث الحقائق، ومهذبة وملائمة وخالية من اللغة السامة. وتواصل المؤسسات التي تستكشف سلامة الذكاء الاصطناعي تطوير نمذجة المكافآت لبناء أنظمة تعكس مواءمة الذكاء الاصطناعي المفيدة وغير الضارة.
- المركبات ذاتية القيادة والروبوتات: في الأتمتة المادية، تساعد نماذج المكافآت الروبوتات على فهم آداب القيادة المعقدة أو استراتيجيات التعامل مع الأجسام. وقد يكتشف نظام إدراك مدعوم بـ Ultralytics YOLO26 المشاة وإشارات المرور، بينما يقيّم نموذج المكافأة المسار المخطط للمركبة، بما يضمن إعطاء الذكاء الاصطناعي الأولوية لراحة الركاب وسلامتهم بدلًا من الملاحة العدوانية البحتة من نقطة إلى نقطة.
تنفيذ مفهوم أساسي لنموذج المكافأة#
يستخدم مثال Python التالي torch لتوضيح البنية الأساسية لنموذج المكافأة. وعمليًا، تتعلّم هذه الشبكة إسناد درجة عددية أعلى إلى مخرج يتوافق مع تفضيلات البشر.
import torch
import torch.nn as nn
# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
def __init__(self):
super().__init__()
# Maps the AI's output embedding to a single reward score
self.fc = nn.Linear(768, 1)
def forward(self, embeddings):
return self.fc(embeddings)
# Initialize the model
reward_model = SimpleRewardModel()
# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)
# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")للتعمق أكثر في كيفية تأثير المواءمة في النماذج الأساسية مفتوحة المصدر، استكشف الأبحاث الأساسية حول مواءمة النماذج اللغوية مع النية البشرية، وتعلّم كيف تستفيد أنظمة الرؤية الحاسوبية (CV) من حلقات الملاحظات المتقدمة للتفاعل بأمان مع البيئات الديناميكية.






