F1-Score
تعرّف على كيفية موازنة درجة F1 بين الدقة والاسترجاع لتقييم نماذج التعلم الآلي. اكتشف كيفية تحسين أداء Ultralytics YOLO26 لتحقيق دقة أفضل.
تُعد درجة F1 مقياسًا مهمًا للأداء في تعلّم الآلة، إذ تجمع بين الدقة والاستدعاء في متوسط توافقي واحد. وتفيد خصوصًا في تقييم نماذج التصنيف عندما تكون مجموعة البيانات غير متوازنة أو عندما تكون للتنبؤات الإيجابية الكاذبة والسلبية الكاذبة تكاليف مختلفة. وعلى خلاف الدقة المباشرة، التي قد تكون مضللة إذا هيمنت فئة واحدة على مجموعة البيانات، تقدم درجة F1 رؤية أكثر توازنًا لقدرة النموذج على تحديد الحالات ذات الصلة بصورة صحيحة مع تقليل الأخطاء. ومن خلال معاقبة القيم المتطرفة، تضمن ألا تتحقق الدرجة المرتفعة إلا عندما تكون كل من الدقة والاستدعاء مرتفعين بدرجة معقولة، ما يجعلها مقياسًا أساسيًا في مجالات تتراوح من التشخيص الطبي إلى استرجاع المعلومات.
أهمية درجة F1 في تعلّم الآلة#
في كثير من السيناريوهات الواقعية، لا تكفي معرفة نسبة التنبؤات الصحيحة (الدقة) وحدها. فعلى سبيل المثال، في اكتشاف الحالات الشاذة، تفوق الحالات الطبيعية الحالات الشاذة بكثير. وقد يحقق نموذج يتنبأ بأن كل مُدخل «طبيعي» دقة تبلغ 99%، لكنه سيكون عديم الفائدة في اكتشاف المشكلات الفعلية. تعالج درجة F1 ذلك من خلال الموازنة بين مقياسين متنافسين:
- الدقة: تقيس جودة التنبؤات الإيجابية. وتجيب عن السؤال: «من بين جميع الحالات التي صنّفها النموذج على أنها إيجابية، كم حالة كانت إيجابية فعلًا؟»
- الاستدعاء: يقيس عدد التنبؤات الإيجابية التي جرى تحديدها. ويجيب عن السؤال: «من بين جميع الحالات الإيجابية الفعلية، كم حالة حدّدها النموذج بصورة صحيحة؟»
نظرًا إلى وجود مفاضلة غالبًا—إذ يؤدي تحسين الدقة إلى خفض الاستدعاء عادةً والعكس صحيح—تعمل درجة F1 كمقياس موحّد لإيجاد نقطة التوازن المثلى. ويكتسب ذلك أهمية حاسمة عند ضبط النماذج باستخدام تحسين المعلمات الفائقة لضمان أداء متين عبر ظروف متنوعة.
التطبيقات الواقعية#
تمتد فائدة درجة F1 إلى صناعات مختلفة تكون فيها تكلفة الخطأ كبيرة.
- التشخيص الطبي: في الذكاء الاصطناعي في الرعاية الصحية، وتحديدًا في مهام مثل اكتشاف الأورام، تكون السلبية الكاذبة (عدم اكتشاف ورم) مهددة للحياة، بينما تؤدي الإيجابية الكاذبة (الإبلاغ عن نسيج سليم) إلى قلق غير ضروري. تساعد درجة F1 الباحثين على تحسين نماذج مثل YOLO26 لضمان حساسية النظام بدرجة تكفي لاكتشاف الأمراض دون إغراق الأطباء بالإنذارات الكاذبة.
- استرجاع المعلومات والبحث: تستخدم محركات البحث وأنظمة تصنيف المستندات درجة F1 لتقييم الصلة. يريد المستخدمون رؤية جميع المستندات ذات الصلة (استدعاء مرتفع)، لكنهم لا يريدون تصفح نتائج غير ذات صلة (دقة مرتفعة). وتشير درجة F1 المرتفعة إلى أن المحرك يسترجع المعلومات الصحيحة بفاعلية دون إرباك.
- تصفية البريد العشوائي: تستخدم خدمات البريد الإلكتروني تصنيف النصوص لفصل الرسائل العشوائية. ويجب على النظام اكتشاف رسائل البريد العشوائي (الاستدعاء)، لكن عليه بصورة حاسمة ألا يصنّف رسائل العمل المهمة على أنها غير مرغوب فيها (الدقة). وتُعد درجة F1 المعيار الأساسي لهذه المرشحات.
حساب درجة F1 باستخدام Ultralytics#
تُبسّط أطر رؤية الحاسوب الحديثة حساب هذه المقاييس. وعند تدريب نماذج اكتشاف الأجسام، تُحسب درجة F1 تلقائيًا أثناء مرحلة التحقق. وتعرض منصة Ultralytics هذه المقاييس في مخططات آنية، ما يتيح للمستخدمين رؤية منحنى درجة F1 مقابل عتبات ثقة مختلفة.
إليك كيفية الوصول إلى مقاييس التحقق، بما في ذلك مكونات درجة F1، باستخدام Python API:
from ultralytics import YOLO
# Load a pre-trained YOLO26 model
model = YOLO("yolo26n.pt")
# Validate the model on a dataset (metrics are computed automatically)
# This returns a validator object containing precision, recall, and mAP
metrics = model.val(data="coco8.yaml")
# Print the Mean Average Precision (mAP50-95), which correlates with F1 performance
print(f"mAP50-95: {metrics.box.map}")
# Access precision and recall arrays to manually inspect the balance
print(f"Precision: {metrics.box.p}")
print(f"Recall: {metrics.box.r}")درجة F1 مقابل المقاييس ذات الصلة#
يُعد فهم اختلاف درجة F1 عن معايير التقييم الأخرى أمرًا أساسيًا لاختيار الأداة المناسبة لمشروعك.
- الاختلاف عن الدقة: تتعامل الدقة مع جميع الأخطاء على قدم المساواة. وتتفوق درجة F1 في مجموعات البيانات غير المتوازنة لأنها تركز على أداء الفئة الإيجابية (فئة الأقلية محل الاهتمام).
- العلاقة بـ mAP: يُعد متوسط الدقة (mAP) المعيار المستخدم لمقارنة نماذج اكتشاف الأجسام عبر جميع عتبات الثقة. إلا أن درجة F1 تُستخدم غالبًا لتحديد عتبة الثقة المثلى للنشر. وقد تختار العتبة التي يبلغ عندها منحنى F1 ذروته لنشر تطبيقك.
- مصفوفة الالتباس: توفر مصفوفة الالتباس الأعداد الأولية (الإيجابيات الحقيقية، والإيجابيات الكاذبة، وغير ذلك) التي تُشتق منها درجة F1. وبينما تقدم المصفوفة تفاصيل دقيقة، توفر درجة F1 إحصائية تلخيصية واحدة للمقارنة السريعة.
- ROC-AUC: تقيس المساحة تحت المنحنى (AUC) قابلية الفصل عبر جميع العتبات. وتُفضّل درجة F1 عمومًا على ROC-AUC عندما يكون توزيع الفئات منحرفًا بدرجة كبيرة (مثل اكتشاف الاحتيال، حيث يكون الاحتيال نادرًا).
تحسين درجة F1 لديك#
إذا كان نموذجك يعاني من انخفاض درجة F1، فقد تساعد عدة استراتيجيات. يمكن أن تؤدي زيادة البيانات إلى زيادة تنوع الأمثلة الإيجابية، ما يساعد النموذج على التعميم بصورة أفضل. ويسمح استخدام التعلّم بالنقل من نماذج أساس متينة للشبكة بالاستفادة من السمات المتعلّمة مسبقًا. إضافةً إلى ذلك، يمكن أن يؤدي ضبط عتبة الثقة أثناء الاستدلال إلى تغيير التوازن يدويًا بين الدقة والاستدعاء لتعظيم درجة F1 لحالة الاستخدام الخاصة بك.









