Accuracy مقابل Precision مقابل Recall في تعلّم الآلة
تعرّف على Accuracy وPrecision وRecall في تعلّم الآلة. واستكشف مصفوفة الالتباس ودرجة F1 وكيفية استخدام مقاييس التقييم الحيوية هذه.

تعلّم الآلة (ML) هو فرع من الذكاء الاصطناعي (AI) يركّز على إنشاء أنظمة تتعلّم من البيانات. ويؤدي دورًا محوريًا في العديد من مجالات الذكاء الاصطناعي الأخرى، بما في ذلك الرؤية الحاسوبية، حيث تفسّر الآلات الصور، ومعالجة اللغة الطبيعية، حيث تفهم اللغة البشرية وتُنشئها.
غالبًا ما تستخدم نماذج الذكاء الاصطناعي هذه تقنيات التعلّم العميق لإجراء تنبؤات من البيانات. ورغم أن هذه الأنظمة قد تكون فعّالة للغاية، فإنها لا تنتج دائمًا تنبؤات صحيحة. قد تكون بعض المخرجات دقيقة، بينما تخطئ مخرجات أخرى الهدف.
تُعدّ معرفة كيفية حدوث هذه الأخطاء جزءًا أساسيًا من تقييم مدى جودة أداء النموذج. ولقياس الأداء، يمكننا استخدام مقاييس تقييم النموذج.
تشمل مقاييس التقييم الشائعة الدقة (الصحة الإجمالية)، والإحكام (موثوقية التنبؤات الإيجابية)، والاسترجاع (مدى جودة تحديد النموذج للحالات الإيجابية الفعلية). قد تبدو متشابهة في البداية، لكن كلًا منها يركّز على جانب مختلف من سلوك النموذج.
في هذه المقالة، سنلقي نظرةً أعمق على كل مقياس من مقاييس أداء نماذج الذكاء الاصطناعي هذه. وسنستكشف أيضًا كيفية ارتباطها ببعضها وكيفية اختيار المقياس المناسب لحالة الاستخدام الخاصة بك. لنبدأ!
أهمية مقاييس تقييم النموذج في تعلّم الآلة#
قد يبدو نموذج تعلّم الآلة وكأنه يؤدي أداءً جيدًا في البداية. لكن من دون مقاييس التقييم المناسبة، يصعب فهم مدى دقة نتائجه. تمنح هذه المقاييس تقييم النموذج بنيةً واضحة وتساعد في الإجابة عن سؤال أساسي: هل تنبؤات النموذج مفيدة وموثوقة لمهمة معينة؟
تمنح مقاييس مثل الدقة والإحكام والاسترجاع مطوّري الذكاء الاصطناعي طريقةً واضحة لقياس مدى جودة عمل النموذج. فعلى سبيل المثال، عند مقارنة نماذج مختلفة، تتيح هذه المقاييس معرفة أيّها يحقق أفضل أداء لمهمة محددة. وهي تساعد على تقييم الأداء وتوجيه اختيار النموذج الأنسب لأهداف مشروع الذكاء الاصطناعي.

الشكل 1. سير عمل تدريب النموذج وتقييمه (المصدر)
تجعل هذه المقاييس أيضًا مقارنات الأداء أكثر موضوعية. فبدلًا من الاعتماد على التخمين أو الملاحظات غير المكتملة، تقدم رؤى قابلة للقياس حول كيفية تصرف النموذج في مواقف مختلفة. وبذلك، تبرز جوانب الأداء الأكثر أهمية في كل سياق.
فعلى سبيل المثال، يعتمد اختيار المقياس غالبًا على التطبيق. ففي تطبيقات الذكاء الاصطناعي في الرعاية الصحية، يُعدّ الاسترجاع مهمًا لأن الهدف هو تحديد أكبر عدد ممكن من الحالات الإيجابية، حتى إذا وُسِمت بعض الحالات السلبية بالخطأ. وعلى النقيض، قد يعطي مرشح البريد العشوائي الأولوية للإحكام لتجنب تصنيف الرسائل المشروعة على أنها بريد عشوائي.
مصفوفة الالتباس: أساس مقاييس التصنيف#
مصفوفة الالتباس هي جدول ثنائي الأبعاد أساسي لتقييم نماذج الذكاء الاصطناعي. وهي تنظّم التنبؤات في أربع فئات من خلال مقارنة النتائج الفعلية بالنتائج المتنبأ بها (الإجابات التي يقدمها النموذج).
توفر هذه المقارنة عرضًا تفصيليًا لأداء النموذج. وتشكل أساسًا لمقاييس تقييم رئيسية مثل الإحكام والاسترجاع، اللذين يُحسبان مباشرةً من القيم الموجودة في المصفوفة.
تمثل صفوف الجدول الفئات الفعلية، بينما تمثل أعمدته الفئات المتنبأ بها. وتعرض كل خلية عدد النتائج في تلك الفئة. وببساطة، توضح المصفوفة عدد التنبؤات الصحيحة وأنواع الأخطاء التي ارتكبها النموذج.
تكون مصفوفة الالتباس مفيدةً بصفة خاصة عندما تكون البيانات غير متوازنة، أي عندما تحتوي بعض الفئات على أمثلة أكثر بكثير من غيرها. كما أنها مفيدة عندما تترتب على أنواع الأخطاء المختلفة تكاليف مختلفة.
فعلى سبيل المثال، يُعدّ اكتشاف النشاط الاحتيالي أمرًا بالغ الأهمية في كشف الاحتيال، لكن وسم المعاملات الحقيقية بالخطأ قد يسبب مشكلات أيضًا. وتوضح المصفوفة عدد مرات حدوث كل نوع من الأخطاء.
عناصر مصفوفة الالتباس#
فيما يلي نظرة عامة على العناصر المختلفة في مصفوفة الالتباس:
- الإيجابي الحقيقي (TP): عندما يتنبأ النموذج بوجود حالة إيجابية بشكل صحيح، تُسجَّل النتيجة كإيجابي حقيقي. فعلى سبيل المثال، يصنّف نموذج رؤية حاسوبية مركبةً في صورة تصنيفًا صحيحًا.
- السلبي الحقيقي (TN): يحدث السلبي الحقيقي عندما يحدد النموذج حالةً سلبية بشكل صحيح. فعلى سبيل المثال، يصنّف مصنّف البريد الإلكتروني رسالةً عادية على أنها ليست بريدًا عشوائيًا.
- الإيجابي الزائف (FP): يولّد النموذج إيجابيًا زائفًا عندما يتنبأ بشكل غير صحيح بنتيجة إيجابية لحالة سلبية في الواقع. ويُعرف ذلك أيضًا بالخطأ من النوع الأول، وقد يحدث عندما يوسم نظام كشف الاحتيال معاملةً صحيحة على أنها احتيالية.
- السلبي الزائف (FN): يُسجَّل السلبي الزائف عندما يفشل النموذج في اكتشاف حالة إيجابية ويتنبأ بها بشكل غير صحيح على أنها سلبية. ويُشار إليه أيضًا بالخطأ من النوع الثاني، وقد يحدث عندما تفشل أداة تشخيصية في اكتشاف مرض لدى مريض مصاب به فعليًا.

الشكل 2. عناصر مصفوفة الالتباس (المصدر)
التمثيل المرئي لمصفوفة الالتباس وتفسيرها#
تُعرض مصفوفة الالتباس في شكل شبكة. يوضح المحور الرأسي الفئات الفعلية، بينما يوضح المحور الأفقي الفئات المتنبأ بها. وتظهر التنبؤات الصحيحة على القطر، ممثلةً الإيجابيات الحقيقية والسلبيات الحقيقية.
تقع الأخطاء خارج القطر، وتشمل الإيجابيات الزائفة والسلبيات الزائفة. ويجعل هذا الهيكل رصد نقاط القوة والضعف أمرًا سهلًا.
ما الدقة في تعلّم الآلة؟#
تُعدّ الدقة أحد المقاييس الأكثر استخدامًا لتقييم مدى جودة أداء نموذج تعلّم الآلة. وهي تقيس معدل صحة التنبؤات عبر جميع الفئات. وبعبارة أخرى، تجيب عن سؤال بسيط: من بين جميع التنبؤات التي أجراها نموذج الذكاء الاصطناعي، كم تنبؤًا كان صحيحًا؟
تتمثل صيغة الدقة في قسمة عدد التنبؤات الصحيحة (التي تشمل الإيجابيات الحقيقية والسلبيات الحقيقية) على إجمالي عدد التنبؤات. ومن السهل حساب الدقة وفهمها، مما يجعلها نقطة بداية شائعة في تقييم النماذج.
عمومًا، تكون الدقة موثوقة عند التعامل مع مجموعات البيانات المتوازنة. لكنها قد تكون مضللة في كثير من الأحيان في مجموعات البيانات غير المتوازنة التي تهيمن فيها فئة واحدة على الفئات الأخرى. فقد يحقق نموذج يتنبأ دائمًا بالفئة الأكبر درجة دقة مرتفعة، مع فشله في اكتشاف فئات الأقلية الأخرى.
فعلى سبيل المثال، في مجموعة بيانات للصور لا تحتوي إلا على عدد قليل من الصور التي تضم مشاة، قد يحقق نموذج يتنبأ بعبارة «لا يوجد مشاة» لكل صورة دقةً مرتفعة، لكنه يفشل تمامًا في اكتشاف المشاة الفعليين.
ويرجع ذلك إلى أن الدقة وحدها لا توضح أنواع الأخطاء التي يرتكبها النموذج أو معدل حدوثها. لذلك من المهم أيضًا النظر إلى مقاييس مثل الإحكام والاسترجاع لفهم مدى جودة عمل نموذج الذكاء الاصطناعي فهمًا كاملًا.
تحليل متعمق للإحكام: تقليل الإنذارات الكاذبة#
الإحكام مقياس تقييم رئيسي يقيس دقة التنبؤات الإيجابية للنموذج. ويجيب عن السؤال: من بين جميع الحالات التي تنبأ النموذج بأنها إيجابية، كم حالة كانت صحيحة؟
تتمثل صيغة الإحكام في قسمة عدد الإيجابيات الحقيقية على مجموع الإيجابيات الحقيقية والإيجابيات الزائفة. ويكتسب أهمية خاصة عندما يكون التنبؤ الإيجابي مكلفًا إذا اتضح أنه خاطئ.

الشكل 3. مقارنة الدقة والإحكام. (المصدر)
فعلى سبيل المثال، قد يوسم نموذج منخفض الإحكام في كشف الاحتيال العديد من المعاملات الصحيحة على أنها احتيالية، مما يسبب مشكلات غير ضرورية للمستخدمين وفرق الدعم على حد سواء. ويقلل النموذج ذو الإحكام المرتفع هذا الخطر من خلال ضمان زيادة احتمال أن تكون المعاملات المعلّمة احتيالية فعلًا.
رغم أن الإحكام المرتفع أمر جيد، فإن النماذج التي تركّز عليه أكثر من اللازم قد تصبح انتقائية جدًا، فتفشل في اكتشاف الحالات الإيجابية الفعلية. لذلك غالبًا ما يُفحَص مقياس الإحكام إلى جانب الاسترجاع للحفاظ على توازن الأداء.
ما الاسترجاع؟#
الاسترجاع مقياس يُستخدم لقياس مدى جودة تحديد النموذج للحالات الإيجابية الفعلية. ويُعرف باسم الحساسية أو معدل الإيجابيات الحقيقية، ويجيب عن السؤال: من بين جميع الحالات الإيجابية الفعلية، كم حالة اكتشفها النموذج بشكل صحيح؟
تتمثل صيغة الاسترجاع في قسمة عدد الإيجابيات الحقيقية على مجموع الإيجابيات الحقيقية والسلبيات الزائفة. وتشير درجة الاسترجاع المرتفعة إلى أن النموذج يلتقط معظم الحالات الإيجابية الحقيقية في البيانات.
يُعدّ الاسترجاع ضروريًا في صناعات مثل الرعاية الصحية، حيث قد يؤدي الفشل في اكتشاف حالة ما إلى تأخير العلاج وتعريض المرضى للخطر. وحتى إذا وُسِمت بعض الحالات السلبية بالخطأ، يظل تحديد جميع الحالات الحقيقية أولوية قصوى.
لكن النماذج التي تركّز على الاسترجاع وحده قد تضع وسمًا لعدد كبير جدًا من الإيجابيات الزائفة، مما يخفض الإحكام ويضر بالكفاءة الإجمالية للنموذج. ويُعدّ تحقيق التوازن بين الاسترجاع والإحكام أمرًا بالغ الأهمية لضمان أداء نموذج الذكاء الاصطناعي الموثوق.
الموازنة: المفاضلة بين الإحكام والاسترجاع#
غالبًا ما يتحرك الإحكام والاسترجاع في اتجاهين متعاكسين. فعندما يتحسن أحدهما، قد ينخفض الآخر. وتمثل هذه المفاضلة تحديًا شائعًا في مهام تعلّم الآلة.
لا يتنبأ النموذج ذو الإحكام المرتفع بأن شيئًا ما إيجابي إلا عندما يكون واثقًا منه. ويقلل ذلك الإنذارات الكاذبة، لكنه قد يفوّت الإيجابيات الحقيقية، مما يخفض الاسترجاع. أما النموذج الذي يحاول التقاط كل حالة إيجابية فيرفع الاسترجاع، لكنه يخاطر بإنذارات كاذبة أكثر، مما يخفض الإحكام.
تتضح هذه المفاضلة أكثر عند ضبط عتبة قرار النموذج. فالعتبة هي الحد الفاصل الذي يستخدمه النظام لتحويل درجة أو احتمال إلى إجراء أو تسمية. ويجعل خفض العتبة النظام يتصرف بإيجابية بوتيرة أكبر، مما قد يزيد الاسترجاع لكنه قد يقلل الإحكام. أما رفع العتبة فله تأثير معاكس: يتنبأ النموذج بعدد أقل من الإيجابيات، ويتحسن الإحكام، لكن الاسترجاع ينخفض عادةً.
لنفترض أنك تعمل على اكتشاف البريد العشوائي. يتعين على النموذج الموازنة بين خطر السماح للبريد العشوائي بالوصول إلى صندوق الوارد وخطر حظر الرسائل الحقيقية. قد يفوّت المرشح الصارم بعض الرسائل العشوائية، بينما قد يحظر المرشح الأكثر تساهلًا الرسائل المشروعة عن طريق الخطأ. ويعتمد التوازن المناسب على حالة الاستخدام وتكلفة كل نوع من الأخطاء.
أهمية منحنى الإحكام–الاسترجاع#
يوضح منحنى الإحكام–الاسترجاع، أو منحنى PR، كيفية تغير الإحكام والاسترجاع مع تغير عتبة قرار النموذج. وتمثل كل نقطة مفاضلةً مختلفة بينهما. ويُعدّ منحنى PR مفيدًا بصفة خاصة لمجموعات البيانات غير المتوازنة التي تكون فيها إحدى الفئات أقل شيوعًا بكثير.
كما يوفر رؤى أكثر دلالة من منحنى خاصية تشغيل مستقبل الإشارة (ROC)، الذي يوضح أيضًا مدى جودة فصل النموذج بين الإيجابيات والسلبيات عند عتبات قرار مختلفة. وسيكون لمنحنى الإحكام–الاسترجاع الخاص بنموذج ذي إحكام واسترجاع مرتفعين منحنى يظل قريبًا من الزاوية العلوية اليمنى، وهو أمر مثالي عمومًا.
التعريف بدرجة F1: مقياس مركب لتحقيق التوازن#
توفر درجة F1 قيمة واحدة تلتقط التوازن بين الإحكام والاسترجاع. وتُحسب درجة F1 بضرب الإحكام في الاسترجاع، ثم ضرب الناتج في اثنين، وقسمة ذلك على مجموع الإحكام والاسترجاع. وتكون مفيدة عندما تكون الإيجابيات الزائفة والسلبيات الزائفة مهمة، كما تفيد عند العمل مع مجموعات بيانات غير متوازنة أو عند الحاجة إلى رؤية متوازنة لأداء النموذج.

الشكل 4. حساب درجة F1 باستخدام الإحكام والاسترجاع (المصدر)
ما بعد الدقة والإحكام والاسترجاع#
رغم أهمية الدقة والإحكام والاسترجاع، توفر مقاييس أخرى رؤى إضافية استنادًا إلى نوع النموذج وخصائص مجموعة البيانات.
فيما يلي بعض المقاييس الشائعة الاستخدام التي تساعد على تقييم جوانب مختلفة من الأداء:
- النوعية: تقيس مدى جودة تحديد النموذج للسلبيات الفعلية. وتكون مفيدة عندما يكون تجنب الإيجابيات الزائفة مهمًا.
- AUC: تمنح AUC، أو المساحة تحت المنحنى، درجةً واحدة تعكس مدى قدرة النموذج على التمييز بين الفئات.
- خسارة اللوغاريتم: تُستخدم خسارة اللوغاريتم لقياس مدى ثقة النموذج عند إجراء التنبؤات، وتفرض عقوبة أكبر على التنبؤات الخاطئة التي أُجريت بثقة عالية. وهنا يشير مستوى الثقة إلى مدى يقين النموذج من تنبؤه.
- التقييم متعدد التسميات: في المهام متعددة التسميات، تُحسَب متوسطات المقاييس عبر التسميات لتعكس أداء النموذج الإجمالي.
تطبيق الدقة والإحكام والاسترجاع في الرؤية الحاسوبية#
والآن بعد أن أصبح لدينا فهم أوضح للدقة والإحكام والاسترجاع، دعونا نستعرض كيفية تطبيق هذه المقاييس في الرؤية الحاسوبية.
تدعم نماذج الرؤية الحاسوبية مثل Ultralytics YOLO11 مهامًا مثل اكتشاف الأجسام، حيث يحدد النموذج الأجسام الموجودة في الصورة ويحدد مواقعها باستخدام مربعات الإحاطة. ويتضمن كل تنبؤ تسمية الجسم وموضعه، مما يجعل التقييم أكثر تعقيدًا من مجرد التحقق من صحة التسمية.

الشكل 5. مثال على استخدام Ultralytics YOLO11 لاكتشاف الأجسام. (المصدر)
لنفكر في تطبيق التجزئة حيث تُستخدم الكاميرات لتتبع المنتجات على الرفوف تلقائيًا. قد يحدد نموذج اكتشاف الأجسام عناصر مثل علب الحبوب أو علب المشروبات الغازية أو زجاجات المياه، ويحدد مواقعها.
في هذه الحالة، يوضح الإحكام عدد العناصر المكتشفة الصحيحة فعلًا. ويعني الإحكام المرتفع أن النظام يتجنب الإيجابيات الزائفة، مثل تصنيف ظل أو جسم في الخلفية على أنه منتج. ويوضح الاسترجاع عدد المنتجات الحقيقية على الرف التي تمكن النموذج من اكتشافها. ويعني الاسترجاع المرتفع تفويت عدد أقل من العناصر، وهو أمر بالغ الأهمية لإجراء عمليات جرد دقيقة.
يمكن أن توفر الدقة مقياسًا عامًا للصحة، لكن في هذا النوع من البيئات قد يؤثر تفويت عدد قليل من المنتجات أو اكتشاف عناصر غير موجودة تأثيرًا كبيرًا في إدارة المخزون. لذلك ينظر المطورون إلى الإحكام والاسترجاع والدقة معًا لضمان أن يكون النظام موثوقًا وعمليًا للاستخدام في العالم الحقيقي.
الدقة والإحكام والاسترجاع: أهم النقاط#
يعرض كل من الدقة والإحكام والاسترجاع جانبًا مختلفًا من أداء نموذج تعلّم الآلة. وقد يكون الاعتماد على مقياس واحد فقط مضللًا.
تساعد الأدوات والمقاييس مثل مصفوفة الالتباس، ومنحنيات الإحكام–الاسترجاع، ودرجة F1 على كشف المفاضلات وتوجيه القرارات المتعلقة بإجراء تحسينات على نموذج ML. ومن خلال اختيار مجموعة المقاييس المناسبة لحل محدد من حلول الذكاء الاصطناعي، يمكنك ضمان أن تكون النماذج دقيقة وموثوقة وفعّالة في التطبيقات الواقعية.
استكشف مجتمعنا المتنامي! اطلع على مستودعنا على GitHub لمعرفة المزيد عن الذكاء الاصطناعي. هل أنت مستعد لبدء مشاريعك في الرؤية الحاسوبية؟ ألقِ نظرة على خيارات الترخيص لدينا. اكتشف الذكاء الاصطناعي في الزراعة والذكاء الاصطناعي للرؤية في الروبوتات بزيارة صفحات حلولنا!









