F1-Score
تعرف على كيفية موازنة F1-Score بين الدقة (precision) والاستدعاء (recall) لتقييم نماذج تعلم الآلة. اكتشف كيفية تحسين أداء Ultralytics YOLO26 للحصول على دقة أفضل.
يعد مقياس F1-Score مقياساً حاسماً للأداء في تعلم الآلة، حيث يجمع بين الدقة (Precision) والاسترجاع (Recall) في متوسط توافقي واحد. وهو مفيد بشكل خاص لتقييم نماذج التصنيف التي تعاني من عدم توازن في مجموعات البيانات أو حيث تحمل النتائج الإيجابية الخاطئة والسلبية الخاطئة تكاليف مختلفة. بخلاف الدقة المباشرة، التي قد تكون مضللة إذا كانت إحدى الفئات تهيمن على مجموعة البيانات، يوفر مقياس F1-Score رؤية أكثر توازناً لقدرة النموذج على تحديد الحالات ذات الصلة بشكل صحيح مع تقليل الأخطاء. ومن خلال معاقبة القيم المتطرفة، فإنه يضمن عدم تحقيق درجة عالية إلا عندما تكون كل من الدقة والاسترجاع مرتفعتين بشكل معقول، مما يجعله مقياساً أساسياً في مجالات تتراوح من التشخيص الطبي إلى استرجاع المعلومات.
لماذا يعد مقياس F1-Score مهماً في تعلم الآلة#
في العديد من سيناريوهات العالم الحقيقي، فإن مجرد معرفة نسبة التنبؤات الصحيحة (الدقة) يعد غير كافٍ. على سبيل المثال، في اكتشاف الشاذات، تفوق الحالات الطبيعية بكثير الحالات الشاذة. النموذج الذي يتنبأ بـ "طدعي" لكل مدخلة منفردة قد يحقق دقة بنسبة 99% ولكنه سيكون عديم الفائدة لاكتشاف المشكلات الفعلية. يعالج معيار F1-Score هذه المشكلة من خلال موازنة مقياسين متنافسين:
- الدقة (Precision): يقيس هذا جودة التنبؤات الإيجابية. وهو يجيب على السؤال: "من بين جميع الحالات التي صنفها النموذج على أنها إيجابية، كم عدد الحالات الإيجابية حقًا؟"
- الاسترجاع (Recall): يقيس هذا كمية التنبؤات الإيجابية. وهو يجيب على: "من بين جميع الحالات الإيجابية الفعلية، كم عدد الحالات التي حددها النموذج بشكل صحيح؟"
نظرًا لوجود مقايضة غالبًا - حيث يؤدي تحسين الدقة عادةً إلى تقليل الاسترجاع والعكس صحيح - فإن F1-Score يعمل كمقياس موحد لإيجاد نقطة توازن مثالية. هذا أمر بالغ الأهمية عند ضبط النماذج باستخدام تحسين المعلمات الفائقة لضمان أداء قوي عبر ظروف متنوعة.
تطبيقات العالم الحقيقي#
تمتد فائدة مقياس F1-Score عبر العديد من الصناعات حيث تكون تكلفة الخطأ كبيرة.
- التشخيص الطبي: في الذكاء الاصطناعي في الرعاية الصحية، وتحديدًا لمهام مثل الكشف عن الأورام، تعتبر السلبية الكاذبة (تفويت الورم) مهددة للحياة، بينما تتسبب الإيجابية الكاذبة (تحديد الأنسجة الحميدة) في قلق غير موصوف. يساعد F1-Score الباحثين على تحسين نماذج مثل YOLO26 لضمان أن النظام حساس بدرجة كافية لاكتشاف الأمراض دون إرهاق الأطباء بإنذارات كاذبة.
- استرجاع المعلومات والبحث: تستخدم محركات البحث وأنظمة تصنيف المستندات مقياس F1-Score لتقييم الصلة. يرغب المستخدمون في رؤية جميع المستندات ذات الصلة (استرجاع عالٍ) ولكنهم لا يريدون البحث في نتائج غير ذات صلة (دقة عالية). يشير مقياس F1-Score المرتفع إلى أن المحرك يسترجع المعلومات الصحيحة بفعالية دون تشتيت.
- تصفية البريد العشوائي: تستخدم خدمات البريد الإلكتروني تصنيف النصوص لفصل البريد العشوائي. يجب أن يلتقط النظام رسائل البريد الإلكتروني العشوائية (الاسترجاع) ولكن الأهم من ذلك أنه يجب ألا يصنف رسائل البريد الإلكتروني الخاصة بالعمل الهامة على أنها غير مهمة (الدقة). يعمل F1-Score كمعيار أساسي لهذه المرشحات.
حساب مقياس F1-Score باستخدام Ultralytics#
تعمل أطر الرؤية الحاسوبية الحديثة على تبسيط حساب هذه المقاييس. عند تدريب نماذج اكتشاف الكائنات، يتم حساب F1-Score تلقائيًا خلال مرحلة التحقق من الصحة. تقوم منصة Ultralytics بتجسيد هذه المقاييس في مخططات في الوقت الفعلي، مما يسمح للمستخدمين برؤية منحنى F1-Score مقابل عتبات الثقة المختلفة.
إليك كيفية الوصول إلى مقاييس التحقق، بما في ذلك مكونات مقياس F1-Score، باستخدام واجهة برمجة تطبيقات Python:
from ultralytics import YOLO
# Load a pre-trained YOLO26 model
model = YOLO("yolo26n.pt")
# Validate the model on a dataset (metrics are computed automatically)
# This returns a validator object containing precision, recall, and mAP
metrics = model.val(data="coco8.yaml")
# Print the Mean Average Precision (mAP50-95), which correlates with F1 performance
print(f"mAP50-95: {metrics.box.map}")
# Access precision and recall arrays to manually inspect the balance
print(f"Precision: {metrics.box.p}")
print(f"Recall: {metrics.box.r}")F1-Score مقابل المقاييس ذات الصلة#
يعد فهم كيفية اختلاف مقياس F1-Score عن معايير التقييم الأخرى أمراً ضرورياً لاختيار الأداة المناسبة لمشروعك.
- الفرق عن الدقة (Accuracy): تعامل الدقة جميع الأخطاء بالتساوي. يُعد F1-Score متفوقًا لـ مجموعات البيانات غير المتوازنة لأنه يركز على أداء الفئة الإيجابية (فئة الأقلية ذات الاهتمام).
- العلاقة بـ mAP: يُعد متوسط الدقة المتوسط (mAP) المعيار لمقارنة نماذج اكتشاف الكائنات عبر جميع عتبات الثقة. ومع ذلك، غالبًا ما يُستخدم F1-Score لتحديد عتبة الثقة المثالية للنشر. يمكنك اختيار العتبة حيث يبلغ منحنى F1 ذروته لنشر تطبيقك.
- مصفوفة الارتباك (Confusion Matrix): توفر مصفوفة الارتباك التعدادات الخام (الإيجابيات الحقيقية، الإيجابيات الكاذبة، إلخ) التي يتم اشتقاق F1-Score منها. بينما توفر المصفوفة تفاصيل دقيقة، يوفر F1-Score إحصائية ملخص فردية للمقارنة السريعة.
- ROC-AUC: تقيس المساحة تحت المنحنى (AUC) القابلية للفصل عبر جميع العتبات. يُفضل عمومًا F1-Score على ROC-AUC عندما يكون لديك توزيع فئوي منحرف للغاية (على سبيل المثال، اكتشاف الاحتيال حيث يكون الاحتيال نادرًا).
تحسين مقياس F1-Score الخاص بك#
إذا كان نموذجك يعاني من انخفاض F1-Score، فيمكن أن تساعد عدة استراتيجيات. يمكن لـ زيادة البيانات زيادة تنوع الأمثلة الإيجابية، مما يساعد النموذج على التعميم بشكل أفضل. يتيح توظيف التعلم المنقول من النماذج الأساسية القوية للشبكة الاستفادة من الميزات المتعلمة مسبقًا. بالإضافة إلى ذلك، فإن ضبط عتبة الثقة أثناء الاستدلال يمكن أن يغير يدويًا التوازن بين الدقة والاسترجاع لتحقيق أقصى قدر من F1-Score لحالة الاستخدام الخاصة بك.






