YOLO Vision 2026:
العودة إلى مسرد Ultralytics

Reward Modeling

استكشف نمذجة المكافآت في تعلّم الآلة. تعلّم كيف تستخدم التغذية الراجعة البشرية لمواءمة وكلاء الذكاء الاصطناعي ونماذج Ultralytics YOLO26 لتحقيق أداء أكثر أمانًا ودقة.

نمذجة المكافآت هي تقنية في تعلّم الآلة تُستخدم لتعليم أنظمة الذكاء الاصطناعي كيفية تقييم سلوكياتها وترتيب أولوياتها استنادًا إلى تفضيلات البشر. في بيئات التعلّم المعزّز التقليدية، يتعلّم وكيل الذكاء الاصطناعي من خلال تعظيم دالة مكافأة محددة مسبقًا وجامدة رياضيًا، مثل النتيجة في لعبة فيديو. غير أنّ كتابة دالة مكافأة مثالية يدويًا تكاد تكون مستحيلة بالنسبة إلى المهام المعقدة في العالم الحقيقي، حيث يكون السلوك «الجيد» ذاتيًا أو دقيقًا—مثل كتابة بريد إلكتروني مهذب أو اجتياز تقاطع بأمان. وتحل نمذجة المكافآت هذه المشكلة من خلال تدريب شبكة عصبية ثانوية (نموذج المكافأة) لتعمل بديلًا عن الحكم البشري. ويقيّم هذا النموذج مخرجات الذكاء الاصطناعي الأساسي ويُسنِد إليها درجات عددية، موجّهًا النموذج الرئيسي ديناميكيًا نحو سلوكيات آمنة ومفيدة ودقيقة.

كيفية عمل نمذجة المكافآت#

تعتمد عملية بناء نموذج مكافأة اعتمادًا كبيرًا على جمع ملاحظات بشرية عالية الجودة.

  • وسم البيانات والتفضيلات: يُزوَّد الم annotatorون البشريون بمطالبات إلى جانب استجابات متعددة مولّدة بواسطة نموذج ذكاء اصطناعي. ويرتّب المقيّمون هذه الاستجابات من الأفضل إلى الأسوأ استنادًا إلى معايير مثل الفائدة وعدم الإضرار والدقة. ويمكن إدارة عمليات سير عمل الوسم واسعة النطاق هذه بسلاسة باستخدام Ultralytics Platform.
  • تدريب الشبكة البديلة: تُدرَّب شبكة عصبية متخصصة على مجموعة البيانات هذه من المقارنات البشرية. ومن خلال عملية تحسين، تتعلّم التنبؤ بالمخرج الذي سيفضّله الإنسان، إذ تربط التضمينات لفعل أو استجابة نصية بقيمة مكافأة عددية واحدة. ويمكنك قراءة المزيد عن بناء معماريات الشبكات العصبية في وثائق PyTorch API.
  • تحسين السياسة: يستخدم النموذج الأساسي الملاحظات المستمرة من نموذج المكافأة لتحسين أفعاله، مستعينًا عادةً بخوارزميات مثل تحسين السياسة القريبة (PPO). تعمل هذه الخطوة على مواءمة سياسة النموذج تكراريًا مع النية البشرية المتعلَّمة.

نمذجة المكافآت مقابل RLHF#

من المهم التمييز بين نمذجة المكافآت والتعلّم المعزّز من الملاحظات البشرية (RLHF). فعلى الرغم من مناقشة المصطلحين معًا frequently، فإنهما ليسا مترادفين. يُعد RLHF خط أنابيب شاملًا من البداية إلى النهاية لمواءمة النماذج، ويشمل الضبط الدقيق الخاضع للإشراف، وجمع البيانات، وتحديثات السياسة. أما نمذجة المكافآت فهي مكوّن محدد وحاسم ضمن خط أنابيب RLHF. وتعمل بوصفها جسرًا يترجم التصنيفات البشرية المنفصلة إلى إشارة رياضية مستمرة يمكن لخوارزمية التعلّم المعزّز تحسينها.

التطبيقات الواقعية#

تؤدي نمذجة المكافآت دورًا محوريًا في تطوير أنظمة الذكاء الاصطناعي الحديثة التي تتفاعل مباشرةً مع البشر والعالم المادي.

  • النماذج اللغوية الكبيرة (LLMs): تعتمد مساعدات الذكاء الاصطناعي الحوارية على نماذج المكافآت لضمان أن تكون إجاباتها صحيحة من حيث الحقائق، ومهذبة وملائمة وخالية من اللغة السامة. وتواصل المؤسسات التي تستكشف سلامة الذكاء الاصطناعي تطوير نمذجة المكافآت لبناء أنظمة تعكس مواءمة الذكاء الاصطناعي المفيدة وغير الضارة.
  • المركبات ذاتية القيادة والروبوتات: في الأتمتة المادية، تساعد نماذج المكافآت الروبوتات على فهم آداب القيادة المعقدة أو استراتيجيات التعامل مع الأجسام. وقد يكتشف نظام إدراك مدعوم بـ Ultralytics YOLO26 المشاة وإشارات المرور، بينما يقيّم نموذج المكافأة المسار المخطط للمركبة، بما يضمن إعطاء الذكاء الاصطناعي الأولوية لراحة الركاب وسلامتهم بدلًا من الملاحة العدوانية البحتة من نقطة إلى نقطة.

تنفيذ مفهوم أساسي لنموذج المكافأة#

يستخدم مثال Python التالي torch لتوضيح البنية الأساسية لنموذج المكافأة. وعمليًا، تتعلّم هذه الشبكة إسناد درجة عددية أعلى إلى مخرج يتوافق مع تفضيلات البشر.

import torch
import torch.nn as nn


# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
    def __init__(self):
        super().__init__()
        # Maps the AI's output embedding to a single reward score
        self.fc = nn.Linear(768, 1)

    def forward(self, embeddings):
        return self.fc(embeddings)


# Initialize the model
reward_model = SimpleRewardModel()

# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)

# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")

للتعمق أكثر في كيفية تأثير المواءمة في النماذج الأساسية مفتوحة المصدر، استكشف الأبحاث الأساسية حول مواءمة النماذج اللغوية مع النية البشرية، وتعلّم كيف تستفيد أنظمة الرؤية الحاسوبية (CV) من حلقات الملاحظات المتقدمة للتفاعل بأمان مع البيئات الديناميكية.

Explore solutions

Real-time AI that works with your team

الرؤية الحاسوبية في الروبوتات

عزّز أداء الآلات الأكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية والإدراك وتتبع الأجسام والتحكم في الوقت الفعلي.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. يتيح الذكاء الاصطناعي للرؤية فحص الطرود وفرزها وتتبع المركبات ومراقبة سلامة المستودعات في الوقت الفعلي.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية تتبع المخزون ومراقبة الرفوف وإدارة الطوابير وتحليلات العملاء الأكثر ذكاءً.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الرعاية الصحية

أنشئ حلولًا للرعاية الصحية باستخدام نماذج Ultralytics YOLO. تعمل الرؤية بالذكاء الاصطناعي في مجال الرعاية الصحية على تسريع التصوير الطبي، وتحسين التشخيص، ومراقبة المرضى.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في التصنيع

حسّن التصنيع باستخدام نماذج Ultralytics YOLO. تدفع الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لـPPE، وأتمتة خطوط التجميع.
معرفة المزيد
Real-time AI that works with your operation

الرؤية الحاسوبية في قطاع السيارات

طبّق الرؤية الحاسوبية في قطاع السيارات باستخدام نماذج Ultralytics YOLO. يعزز الذكاء الاصطناعي للرؤية سلامة الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
معرفة المزيد
Real-time AI tailored to your operation

الرؤية الحاسوبية في الزراعة

أضف الذكاء الاصطناعي للرؤية إلى الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة لتحقيق إنتاجية أعلى وأكثر ذكاءً.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الروبوتات

عزّز أداء الآلات الأكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية والإدراك وتتبع الأجسام والتحكم في الوقت الفعلي.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. يتيح الذكاء الاصطناعي للرؤية فحص الطرود وفرزها وتتبع المركبات ومراقبة سلامة المستودعات في الوقت الفعلي.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية تتبع المخزون ومراقبة الرفوف وإدارة الطوابير وتحليلات العملاء الأكثر ذكاءً.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الرعاية الصحية

أنشئ حلولًا للرعاية الصحية باستخدام نماذج Ultralytics YOLO. تعمل الرؤية بالذكاء الاصطناعي في مجال الرعاية الصحية على تسريع التصوير الطبي، وتحسين التشخيص، ومراقبة المرضى.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في التصنيع

حسّن التصنيع باستخدام نماذج Ultralytics YOLO. تدفع الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لـPPE، وأتمتة خطوط التجميع.
معرفة المزيد
Real-time AI that works with your operation

الرؤية الحاسوبية في قطاع السيارات

طبّق الرؤية الحاسوبية في قطاع السيارات باستخدام نماذج Ultralytics YOLO. يعزز الذكاء الاصطناعي للرؤية سلامة الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
معرفة المزيد
Real-time AI tailored to your operation

الرؤية الحاسوبية في الزراعة

أضف الذكاء الاصطناعي للرؤية إلى الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة لتحقيق إنتاجية أعلى وأكثر ذكاءً.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الروبوتات

عزّز أداء الآلات الأكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية والإدراك وتتبع الأجسام والتحكم في الوقت الفعلي.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. يتيح الذكاء الاصطناعي للرؤية فحص الطرود وفرزها وتتبع المركبات ومراقبة سلامة المستودعات في الوقت الفعلي.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية تتبع المخزون ومراقبة الرفوف وإدارة الطوابير وتحليلات العملاء الأكثر ذكاءً.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الرعاية الصحية

أنشئ حلولًا للرعاية الصحية باستخدام نماذج Ultralytics YOLO. تعمل الرؤية بالذكاء الاصطناعي في مجال الرعاية الصحية على تسريع التصوير الطبي، وتحسين التشخيص، ومراقبة المرضى.
معرفة المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في التصنيع

حسّن التصنيع باستخدام نماذج Ultralytics YOLO. تدفع الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لـPPE، وأتمتة خطوط التجميع.
معرفة المزيد
Real-time AI that works with your operation

الرؤية الحاسوبية في قطاع السيارات

طبّق الرؤية الحاسوبية في قطاع السيارات باستخدام نماذج Ultralytics YOLO. يعزز الذكاء الاصطناعي للرؤية سلامة الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
معرفة المزيد
Real-time AI tailored to your operation

الرؤية الحاسوبية في الزراعة

أضف الذكاء الاصطناعي للرؤية إلى الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة لتحقيق إنتاجية أعلى وأكثر ذكاءً.
معرفة المزيد

لنبنِ مستقبل الذكاء الاصطناعي معًا!

ابدأ رحلتك مع مستقبل التعلم الآلي