YOLO Vision 2026:
العودة إلى قاموس مصطلحات Ultralytics

Direct Preference Optimization

تعرف على كيفية تبسيط تحسين التفضيل المباشر (Direct Preference Optimization (DPO)) لمحاذاة الذكاء الاصطناعي. اكتشف كيفية تحسين سلامة النموذج وأدائه بكفاءة أكبر من RLHF التقليدي.

التصحيح المباشر للتفضيلات (DPO) هو تقنية خوارزمية مستقرة وفعالة تستخدم لضبط نماذج الذكطس الاصطناعي، وتحديداً ضمان توافقها مع رغبات البشر ومعايير الأمان. على عكس طرق التعلم المعزز التقليدية التي تتطلب نمذجة مكافأة معقدة، تبسط DPO عملية المحاذاة من خلال معاملة مشكلة تعلم التفضيلات كمهام تصنيف. من خلال تحسين النموذج مباشرة استناداً إلى مجموعة بيانات من التفضيلات البشرية - حيث يختار المدققون استجابة "فائزة" على استجابة "خاسرة" - يمكن للمطورين تحسين فائدة وصدق وأمان foundation models وأنظمة generative AI بشكل كبير. اكتسب هذا النهج زخماً هائلاً في عامي 2024 و2025 لقدرته على تحقيق نتائج متطورة بجهد حسابي أقل بكثير.

كيف يبسط DPO مواءمة النموذج#

يكمن الابتكار الأساسي لتقنية التصحيح المباشر للتفضيلات في إزالة "الوسيط" الموجود في خطوط أنابيب المحاذاة القديمة. تاريخياً، تضمنت محاذاة Large Language Model (LLM) أو Vision-Language Model عملية متعددة الخطوات تعرف باسم Reinforcement Learning from Human Feedback (RLHF). يتطلب RLHF تدريب نموذج مكافأة منفصل لتقريب التقييم البشري، يليه استخدام خوارزمية عرضة عدم الاستقرار مثل PPO (تحسين السياسة القريب) لتحديث النموذج الرئيسي.

تلغي DPO رياضياً الحاجة إلى نموذج المكافأة المنفصل هذا. بدلاً من ذلك، تستخدم loss function مشتقة تزيد من احتمالية توليد مخرجات "مفضلة" بينما تقلل من احتمالية المخرجات "المرفوضة". يعتمد هذا على نموذج مرجعي لضمان عدم انحراف النموذج المحدث بشكل كبير عن توزيع training data الأصلي الخاص به. يجعل هذا التبسيط الرياضي العملية تسلك سلوكاً أقرب بكثير إلى supervised learning القياسي، مما ينتج عنه تقارب أسرع واستخدام أقل للذاكرة على GPU hardware.

التمييز عن RLHF#

بينما تشترك كل من DPO وRLHF في هدف AI Safety والمحاذاة، فإن تنفيذها يختلف بشكل كبير:

  • التعقيد: تتضمن RLHF الحفاظ على نماذج متعددة (نموذج الممثل، الناقد، نموذج المكافأة، النموذج المرجعي) في وقت واحد أثناء التدريب. تتطلب DPO فقط النموذج الذي يتم تدريبه ونموذجاً مرجعياً مجمداً.
  • الاستقرار: يُعرف التعلم المعزز بحساسيته المفرطة تجاه hyperparameter tuning. عادةً ما تعمل DPO باستقرار مهمة تصنيف قياسية، مما يقلل من خطر model collapse.
  • الكفاءة: من خلال إزالة خطوات استنتاج نموذج المكافأة، تقلل DPO العبء الحسابي، مما يسمح للمؤسسات بمواءمة نماذج أكبر على مجموعات حوسبة أصغر.

تطبيقات العالم الحقيقي#

يعيد تحسين التفضيلات المباشر حالياً تشكيل كيفية بناء أنظمة الذكاء الاصطناعي التفاعلية عبر مختلف الصناعات.

تعزيز الوكلاء التخاطبيين#

في مجال chatbots والمساعدين الافتراضيين، تُستخدم DPO لتقليل السمية وتحسين الدقة الواقعية. يقوم المطورون برعاية مجموعات بيانات يقوم فيها مدقق بشري بمراجعة إجابتين لموجه واحد - إجابة هلوسة أو فظة، وأخرى دقيقة ومؤدبة. يضع الشخص علامة على الإجابة المؤدبة على أنها "مختارة". بعد ذلك، تقوم DPO بتحديث model weights لتفضيل النمط المختار. يُعد هذا أمراً بالغ الأهمية لنشر وكلاء خدمة العملاء الذين يلتزمون بإرشادات AI Ethics الصارمة.

تنقيح نماذج الرؤية اللغوية#

مع تطور الرؤية الحاسوبية، يُطلب من النماذج بشكل متزايد شرح ما تراه. بالنسبة للتطبيقات مثل image captioning أو الإجابة على الأسئلة المرئية، تتيح DPO للباحثين محاذاة المخرجات النصية للنموذج مع التفضيلات البشرية التفصيلية. على سبيل المثال، إذا طلب المستخدم من security system "وصف المتسلل"، فيمكن لـ DPO تدريب النموذج على إعطاء الأولوية للوصف الواقعي (على سبيل المثال، "قميص أحمر، قبعة زرقاء") على الأوصاف الشعرية أو الغامضة، مما يعزز فائدة computer vision system.

DPO في سير عمل الذكاء الاصطناعي الحديث#

يتطلب تنفيذ DPO بيانات زوجية عالية الجودة. غالباً ما تستخدم سير العمل الحديثة أدوات مثل Ultralytics Platform لإدارة مجموعات البيانات، مما يضمن أن عملية data annotation تسفر عن أمثلة واضحة "فائزة" و"خاسرة". في حين رُوّدت DPO للنص، فإن مبادئها تُطبق بشكل متزايد لتحسين object detection architectures والوسائط الأخرى من خلال صياغة مقاييس الجودة كأزواج تفضيل.

توضح مقتطفة Python التالية التي تستخدم torch بنية البيانات الأساسية المطلوبة لحساب الخسارة بأسلوب DPO. وهي توضح كيف يتم إعداد الاستجابات "المختارة" و"المرفوضة" في حزم، وهو مفهوم حاسم لـ model optimization الحديث.

import torch
import torch.nn.functional as F

# Simulate log probabilities for 'chosen' and 'rejected' responses
# In a real scenario, these come from your model (e.g., a VLM or LLM)
chosen_log_probs = torch.tensor([-0.5, -0.8, -0.2], requires_grad=True)
rejected_log_probs = torch.tensor([-2.5, -3.0, -1.5], requires_grad=True)

# DPO aims to maximize the margin between chosen and rejected
# This is a simplified conceptual look at the margin calculation
beta = 0.1  # A hyperparameter controlling deviation from the reference model
logits = beta * (chosen_log_probs - rejected_log_probs)

# The loss minimizes the negative log sigmoid of this margin
loss = -F.logsigmoid(logits).mean()

print(f"DPO Loss: {loss.item()}")
# Output demonstrates the penalty applied if the model doesn't prefer the chosen data

من خلال الاستفادة من تقنيات مثل DPO، يمكن للمطورين دفع حدود الأداء في نماذج مثل Ultralytics YOLO26، مما يضمن أن القرارات الآلية ليست دقيقة فحسب، بل متوافقة أيضاً مع النية البشرية. يُعد هذا أمراً حيويًا للبيئات عالية المخاطر مثل autonomous vehicles وmedical image analysis، حيث تكون الموثوقية ذات أهمية قصوى.

الموارد الخارجية#

Explore solutions

Real-time AI that works with your team

الرؤية الحاسوبية في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

رؤية الحاسوب في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

رؤية الحاسوب في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

رؤية الحاسوب في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

رؤية الحاسوب في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

رؤية الحاسوب في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

رؤية الحاسوب في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

رؤية الحاسوب في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الرؤية الحاسوبية في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

رؤية الحاسوب في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

رؤية الحاسوب في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد

لنبنِ مستقبل الذكاء الاصطناعي معاً!

ابدأ رحلتك مع مستقبل تعلم الآلة