Brier Score
تعرف على كيفية قياس درجات Brier Score لدقة التنبؤ الاحتمالي، والمعايرة، والتحليل. استكشف الصيغ، والأمثلة، المقاييس ذات الصلة، وسير عمل تقييم YOLO26.
تقيس درجة بريير دقة التنبؤات الاحتمالية من خلال حساب متوسط الفرق المربع بين كل احتمال متوقع والنتيجة التي حدثت بالفعل. تمثل الدرجة 0 تنبؤات مثالية؛ بينما تشير القيم الأكبر إلى أن التنبؤات كانت أقل دقة، أو أسوأ معايرة، أو كلاهما. على عكس المقاييس المستندة فقط إلى تسميات الفئات النهائية، تقيّم درجة بريير ما إذا كان نموذج التعلم الآلي يخصص احتمالات معقولة.
كيف تعمل درجة بريير#
بالنسبة للتصنيف الثنائي، قم بتشفير النتيجة كـ 1 عند حدوث الحدث و0 عند عدم حدوثه. لكل مثال، احسب (predicted probability - outcome) squared، ثم احسب متوسط تلك القيم.
فترض أن نموذجاً يتنبأ باحتمالية بنسبة 80% بأن صورة تحتوي على عيب:
- إذا كان العيب موجوداً، يكون الخطأ المربع هو
(0.8 - 1) squared، أو 0.04. - إذا لم يكن هناك عيب موجوداً، يكون الخطأ هو
(0.8 - 0) squared، أو 0.64.
يتلقى التنبؤ الثاني عقوبة أكبر بكثير لأن النموذج كان مخطئاً بثقة. هذا يجعل درجة بريير قاعدة تسجيل صحيحة تماماً: في المتوسط، يحصل المُتنبئ على أفضل درجة من خلال الإبلاغ عن تقدير احتمالي صادق. توفر وثائق خسارة درجة بريير في scikit-learn تنفيذاً قياسياً.
بالنسبة للمشاكل الثنائية، النطاق التقليدي هو من 0 إلى 1. تجمع إصدارات التصنيف المتعدد الأخطاء المربعة عبر كل فئة، لذا قد يكون نطاقها من 0 إلى 2 ما لم يتم التقسيم على اثنين. نظراً لأن المكتبات تستخدم اتفاقيات قياس مختلفة، مثل النهج المُعاد قياسه في درجة بريير للتصنيف المتعدد في yardstick, يجب أن تستخدم المقارنات نفس التنفيذ والإعدادات.
تفسير درجة بريير الجيدة#
الأقل هو الأفضل، ولكن لا توجد عتبة عالمية لدرجة بريير "الجيدة". يعتمد معناها على انتشار الحدث، وصعوبة مجموعة البيانات، وجودة خط الأساس المعقول.
على سبيل المثال، إذا حدث حدث في 10% من الحالات، فإن النموذج الذي يتنبأ دائماً بـ 0.10 يتلقى درجة متوقعة تبلغ 0.09. يجب أن يتحسن النموذج المفيد بشكل عام مقارنة بخط الأساس المستند إلى الانتشار. يجب أن يستخدم التقييم بيانات التحقق الممثلة، مع تقارير منفصلة للفئات المهمة، أو بيئات التشغيل، أو المجموعات الديموغرافية.
تعكس الدرجة خاصيتين مترابطتين:
- الـمعايرة: يجب أن تكون التنبؤات التي تبلغ 0.80 صحيحة بنسبة 80% تقريباً من الوقت. يمكن أن تكشف طرق معايرة الاحتمالات ومخططات الموثوقية عن الثقة المفرطة أو الضعيفة المنهجية.
- التمييز: يجب أن تفصل التنبؤات الأحداث المرجحة عن غير المرجحة بشكل ذو مغزى. قد يكون النموذج الذي يتنبأ دائماً بالمعدل الأساسي معايراً بشكل عام ولكنه يوفر القليل من المعلومات الخاصة بالحالة.
يمكن لدرجة إجمالية واحدة أن تخفي المشاكل المحلية. ادمجها مع منحنى المعايرة، وتحليل المجموعات الفرعية، وتحديد الارتياب الأوسع.
درجة بريير مقابل المقاييس ذات الصلة#
-
الدقة، والضبط، والاتساع: تقيّم هذه القرارات المنفصلة بعد تطبيق العتبة. تقيّم درجة بريير الاحتمالات قبل تطبيق العتبة، مما يميز التنبؤ الصحيح الحذر بنسبة 0.51 عن التنبؤ الواثق بنسبة 0.99.
-
ROC AUC: يقيس AUC الترتيب—ما إذا كانت الحالات الإيجابية تميل إلى تلقي درجات أعلى من الحالات السلبية. يمكن للنموذج ترتيب الحالات بشكل صحيح ومع ذلك ينتج احتمالات سيئة المعايرة.
-
فقدان السجل (Log loss): كلاهما قاعدتا تسجيل صالحتان، لكن فقدان السجل يعاقب الأخطاء الواثقة للغاية بشكل أكثر حدة. غالباً ما يكون تفسير الخطأ المربع لدرجة بريير أسهل في الشرح.
-
الثقة: خرج النموذج المسجل بـ "الثقة" ليس تلقائياً احتمال حدث معاير. يجب التحقق من معناه قبل تطبيق درجة بريير.
تطبيقات العالم الحقيقي#
في فرز الصور الطبية، قد يقدر نموذج تصنيف الصور احتمالية احتواء الفحص على تشوه. يمكن لدرجة بريير تقييم ما إذا كانت هذه الاحتمالات تتطابق مع التشخيصات المرصودة، وهو أمر مهم عندما تعامل قواعد الإحالة التقدير بنسبة 90% بشكل مختلف عن التتقدير بنسبة 55%.
في الفحص البصري للتصنيع، قد يقدر النموذج احتمالية أن يكون المنتج معيباً. تدعم التنبؤات جيدة المعايرة التوجيه المستند إلى المخاطر: يمكن رفض حالات الاحتمال العالي، وإرسال الحالات غير المؤكدة للفحص البشري، وقبول حالات الاحتمال المنخفض. يمكن أن تتسبب المعايرة السيئة في هروب العيوب أو الهدر غير الضروري. يؤكد إطار عمل إدارة مخاطر الذكاء الاصطناعي NIST Core على قياس الارتياب ومراقبة الأداء في الأنظمة المُنشورة.
سير عمل التقييم العملي#
يحسب المثال التالي درجة النموذج ويقارنها بخط أساس للانتشار الثابت:
from sklearn.metrics import brier_score_loss
# Binary outcomes and predicted event probabilities
y_true = [0, 1, 1, 0, 1, 0]
y_probability = [0.10, 0.75, 0.60, 0.30, 0.90, 0.40]
model_score = brier_score_loss(y_true, y_probability)
# Compare against always predicting the observed event rate
event_rate = sum(y_true) / len(y_true)
baseline_probability = [event_rate] * len(y_true)
baseline_score = brier_score_loss(y_true, baseline_probability)
print(f"Model: {model_score:.3f}")
print(f"Baseline: {baseline_score:.3f}")بالنسبة لرؤية الكمبيوتر، تعرض تنبؤات تصنيف Ultralytics YOLO26 احتمالات الفئات من خلال وضع التنبؤ (Predict mode). اجمع هذه الاحتمالات على الصور المصنفة المحجوزة قبل حساب الدرجة. ادمج النتيجة مع وضع التحقق من Ultralytics ودليل مقاييس الأداء لـ YOLO بدلاً من اعتبارها بديلاً للمقاييس الخاصة بالمهمة.
بعد النشر، أعد حساب الدرجة عندما تتوفر تسميات الحقيقة الأرضية الجديدة. يمكن لـ مراقبة نشر منصة Ultralytics دعم سير العمل التشغيلي المحيط، بينما تساعد التقييمات المصنفة المتكررة في اكتشاف تغييرات المعايرة الناتجة عن انحراف البيانات.






