Précision moyenne (mAP) en détection d’objets
Comprends la précision moyenne (mAP) en détection d’objets. Découvre sa signification, son calcul et pourquoi la mAP est essentielle pour évaluer les performances d’un modèle.

L’adoption de l’IA progresse rapidement et l’IA est intégrée à diverses innovations, des voitures autonomes aux systèmes de vente au détail capables d’identifier les produits en rayon. Ces technologies reposent sur la vision par ordinateur, une branche de l’intelligence artificielle (AI) qui permet aux machines d’analyser des données visuelles.
Une métrique d’évaluation essentielle utilisée pour mesurer la précision des systèmes et des algorithmes de vision par ordinateur est la précision moyenne (mAP). La métrique mAP indique dans quelle mesure les prédictions d’un modèle d’IA visuelle correspondent aux résultats du monde réel.
La détection d’objets est une tâche courante en vision par ordinateur : un modèle identifie plusieurs objets dans une image et trace des cadres englobants autour d’eux. La mAP est la métrique standard utilisée pour évaluer les performances des modèles de détection d’objets et elle est largement employée pour comparer des modèles d’apprentissage profond comme Ultralytics YOLO11.
Dans cet article, tu découvriras comment la précision moyenne est calculée et pourquoi elle est essentielle pour toute personne qui entraîne ou évalue des modèles de détection d’objets. Commençons !
Qu’est-ce que la précision moyenne (mAP) ?#
La précision moyenne est un score qui montre à quel point un modèle d’apprentissage profond est précis pour les tâches liées à la recherche d’informations visuelles, comme la détection et l’identification de différents objets dans une image. Par exemple, imagine un modèle de détection d’objets qui analyse une photo contenant un chien, un chat et une voiture. Un modèle fiable peut effectuer la détection d’objets en reconnaissant chaque objet et en traçant autour de lui des cadres englobants et des étiquettes, afin d’indiquer où il se trouve et de quoi il s’agit.
La mAP indique dans quelle mesure le modèle accomplit cette tâche sur de nombreuses images et différents types d’objets. Elle vérifie si le modèle identifie correctement chaque objet et sa position dans l’image. Le score varie de 0 à 1 : 1 signifie que le modèle a tout trouvé parfaitement, tandis que 0 signifie qu’il n’a détecté aucun objet.
Concepts clés de la précision moyenne (mAP)#
Avant d’examiner les concepts qui sous-tendent la précision moyenne en apprentissage automatique, clarifions deux termes fondamentaux : la vérité terrain et les prédictions.
La vérité terrain désigne les données de référence exactes, dans lesquelles les objets et leurs positions dans l’image sont soigneusement étiquetés par des humains au moyen d’un processus appelé annotation. Les prédictions, quant à elles, correspondent aux résultats fournis par les modèles d’IA après l’analyse d’une image. En comparant les prédictions du modèle d’IA à la vérité terrain, nous pouvons mesurer à quel point le modèle s’est approché des résultats corrects.

Fig. 1. Cadres englobants issus de la prédiction du modèle et de la vérité terrain. Image de l’auteur.
Matrice de confusion#
Une matrice de confusion est souvent utilisée pour comprendre la précision d’un modèle de détection d’objets. Il s’agit d’un tableau qui montre dans quelle mesure les prédictions du modèle correspondent aux réponses correctes réelles (la vérité terrain). Ce tableau permet de distinguer quatre composants ou résultats clés : les vrais positifs, les faux positifs, les faux négatifs et les vrais négatifs.
Voici ce que représentent ces composants dans la matrice de confusion :
- Vrai positif (TP) : Un objet et sa position sont correctement détectés par le modèle.
- Faux positif (FP) : Le modèle a effectué une détection, mais celle-ci était incorrecte.
- Faux négatif (FN) : Un objet effectivement présent dans l’image, mais que le modèle n’a pas réussi à détecter.
- Vrai négatif (TN) : Les vrais négatifs apparaissent lorsque le modèle identifie correctement l’absence d’un objet.
Les vrais négatifs ne sont généralement pas utilisés en détection d’objets, car nous ignorons habituellement les nombreuses régions vides d’une image. Ils sont toutefois essentiels dans d’autres tâches de vision par ordinateur, comme la classification d’images, où le modèle attribue une étiquette à l’image. Par exemple, si la tâche consiste à déterminer si une image contient un chat ou non, et que le modèle identifie correctement « pas de chat » lorsque l’image n’en contient aucun, il s’agit d’un vrai négatif.

Fig. 2. Résultats de classification dans une matrice de confusion. Image de l’auteur.
Intersection sur union (IoU)#
Une autre métrique essentielle pour évaluer les modèles de détection d’objets est l’intersection sur union (IoU). Pour ces modèles d’IA visuelle, détecter simplement la présence d’un objet dans une image ne suffit pas ; le modèle doit également localiser l’objet dans l’image afin de tracer des cadres englobants.
La métrique IoU mesure dans quelle mesure le cadre prédit par le modèle correspond au cadre réel correct (la vérité terrain). Le score est compris entre 0 et 1 : 1 signifie une correspondance parfaite et 0 signifie une absence totale de chevauchement.
Par exemple, un IoU élevé (comme 0,80 ou 0,85) signifie que le cadre prédit correspond étroitement au cadre de la vérité terrain, ce qui indique une localisation précise. Un IoU faible (comme 0,30 ou 0,25) signifie que le modèle n’a pas localisé l’objet avec précision.
Pour déterminer si une détection est réussie, nous utilisons différents seuils. Un seuil IoU courant est 0,5, ce qui signifie qu’un cadre prédit doit chevaucher le cadre de la vérité terrain d’au moins 50 % pour être comptabilisé comme un vrai positif. Tout chevauchement inférieur à ce seuil est considéré comme un faux positif.

Fig. 3. Comprendre l’intersection sur union. Image de l’auteur.
Précision et rappel#
Jusqu’à présent, nous avons examiné certaines métriques d’évaluation fondamentales pour comprendre les performances des modèles de détection d’objets. Dans cette continuité, deux des métriques les plus importantes sont la précision et le rappel. Elles donnent une vision claire de la précision des détections du modèle. Voyons ce qu’elles représentent.
Les valeurs de précision indiquent combien des prédictions du modèle étaient effectivement correctes. Elles répondent à la question suivante : parmi tous les objets que le modèle prétend avoir détectés, combien étaient réellement présents ?
Les valeurs de rappel, quant à elles, mesurent dans quelle mesure le modèle trouve tous les objets réellement présents dans l’image. Elles répondent à la question suivante : parmi tous les objets réels présents, combien le modèle a-t-il correctement détectés ?
Ensemble, la précision et le rappel donnent une vision plus claire des performances d’un modèle. Par exemple, si un modèle prédit 10 voitures dans une image et que 9 d’entre elles sont effectivement des voitures, sa précision est de 90 % (une prédiction positive).
Ces deux métriques d’évaluation impliquent souvent un compromis : un modèle peut obtenir une valeur de précision élevée en ne faisant que des prédictions dont il est totalement sûr, mais cela peut lui faire manquer de nombreux objets et réduire le rappel. À l’inverse, il peut aussi atteindre un rappel très élevé en prédisant un cadre englobant presque partout, mais cela réduirait la précision.

Fig. 4. Précision et rappel. Image de l’auteur.
Précision moyenne#
Alors que la précision et le rappel nous aident à comprendre les performances d’un modèle sur des prédictions individuelles, la précision moyenne (AP) offre une vision plus globale. Elle illustre l’évolution de la précision du modèle lorsqu’il tente de détecter davantage d’objets et résume ses performances en un seul nombre.
Pour calculer le score de précision moyenne, nous pouvons d’abord créer, pour chaque type d’objet, une métrique combinée semblable à un graphique appelée courbe précision-rappel (ou courbe PR). Cette courbe montre ce qui se passe lorsque le modèle effectue davantage de prédictions.
Imaginons que le modèle commence par détecter uniquement les objets les plus faciles ou les plus évidents. À ce stade, la précision est élevée, car la plupart des prédictions sont correctes, mais le rappel est faible puisque de nombreux objets ne sont pas encore détectés. Lorsque le modèle essaie de détecter davantage d’objets, notamment les plus difficiles ou les plus rares, il introduit généralement davantage d’erreurs. La précision diminue alors que le rappel augmente.
La précision moyenne correspond à l’aire sous la courbe (AUC de la courbe PR). Une aire plus grande signifie que le modèle conserve mieux la précision de ses prédictions, même lorsqu’il détecte davantage d’objets. L’AP est calculée séparément pour chaque étiquette de classe.
Par exemple, pour un modèle capable de détecter des voitures, des vélos et des piétons, nous pouvons calculer les valeurs AP individuellement pour chacune de ces trois catégories. Cela nous aide à voir quels objets le modèle détecte correctement et sur quels points il pourrait encore être amélioré.

Fig. 5. Une courbe PR pour cinq classes différentes. (Source)
Précision moyenne#
Après avoir calculé la précision moyenne pour chaque classe d’objets, nous avons encore besoin d’un score unique qui reflète les performances globales du modèle pour toutes les classes. Pour cela, nous pouvons utiliser la formule de précision moyenne. Elle calcule la moyenne des scores AP de chaque catégorie.
Par exemple, supposons qu’un modèle de vision par ordinateur comme Ultralytics YOLO11 obtienne une AP de 0,827 pour les voitures, de 0,679 pour les motos, de 0,355 pour les camions, de 0,863 pour les bus et de 0,982 pour les vélos. À l’aide de la formule mAP, nous pouvons additionner ces nombres et les diviser par le nombre total de classes comme suit :
mAP = (0.827 + 0.679 + 0.355 + 0.863 + 0.982) ÷ 5 = 0.7432 ≈ 0.743
Le score mAP de 0,743 fournit une solution simple pour évaluer les performances du modèle sur toutes les classes d’objets. Une valeur proche de 1 signifie que le modèle est précis pour la plupart des catégories, tandis qu’une valeur plus faible suggère qu’il rencontre des difficultés avec certaines d’entre elles.
Importance de l’AP et de la mAP en vision par ordinateur#
Maintenant que nous comprenons mieux comment l’AP et la mAP sont calculées et quels sont leurs composants, voici un aperçu de leur importance en vision par ordinateur :
-
AP faible pour une classe spécifique : Une AP faible pour une seule classe signifie souvent que le modèle rencontre des difficultés avec cette classe d’objets précise. Cela peut être dû à des données d’entraînement insuffisantes ou à des difficultés visuelles dans les images, comme l’occlusion.
-
Erreurs de localisation : Une valeur mAP plus élevée avec un seuil IoU plus faible (comme mAP@0.50), associée à une baisse importante avec un seuil IoU plus élevé (comme mAP@0.75), indique que le modèle peut détecter les objets, mais qu’il peine à les localiser avec précision.
-
Surapprentissage : Une valeur mAP plus élevée sur le jeu de données d’entraînement, mais plus faible sur le jeu de données de validation, est un signe de surapprentissage, ce qui rend le modèle peu fiable pour de nouvelles images.
Applications concrètes de la précision moyenne#
Examinons ensuite comment des métriques clés comme la mAP peuvent aider à développer des cas d’usage réels de la vision par ordinateur.
Véhicules autonomes : pourquoi une valeur mAP plus élevée rend les routes plus sûres#
Pour les voitures autonomes, la détection d’objets est essentielle pour identifier les piétons, les panneaux routiers, les cyclistes et les marquages au sol. Par exemple, si un enfant traverse soudainement la rue en courant, la voiture dispose de quelques secondes pour détecter l’objet (l’enfant), localiser sa position, suivre son mouvement et prendre les mesures nécessaires (appliquer les freins).
Des modèles comme Ultralytics YOLO11 sont conçus pour la détection d’objets en temps réel dans de tels scénarios à haut risque. Dans ces cas, la mAP devient une mesure essentielle de la sécurité.
Un score mAP élevé garantit que le système détecte rapidement l’enfant, le localise avec précision et déclenche le freinage avec un délai minimal. Une mAP faible peut entraîner des détections manquées ou des classifications erronées dangereuses, comme confondre l’enfant avec un autre petit objet.

Fig. 6. Exemple d’utilisation de YOLO11 pour détecter des piétons sur la route. (Source)
Utiliser la mAP pour une détection précise des produits#
De même, dans le commerce de détail, les modèles de détection d’objets peuvent être utilisés pour automatiser des tâches comme le suivi des stocks et les processus de passage en caisse. Lorsqu’un client scanne un produit à une caisse en libre-service, une erreur de détection peut provoquer de la frustration.
Un score mAP élevé garantit que le modèle distingue correctement des produits similaires et trace des cadres englobants précis, même lorsque les articles sont très serrés les uns contre les autres. Un score mAP faible peut entraîner des confusions. Par exemple, si le modèle prend une bouteille de jus d’orange pour une bouteille de jus de pomme visuellement similaire, cela peut entraîner une facturation incorrecte et des rapports d’inventaire inexacts.
Les systèmes de vente au détail intégrant des modèles comme Ultralytics YOLO11 peuvent détecter les produits en temps réel, les comparer à l’inventaire et mettre instantanément à jour les systèmes principaux. Dans les environnements de vente au détail où tout va très vite, la mAP joue un rôle essentiel pour maintenir des opérations précises et fiables.
Améliorer la précision des diagnostics grâce à une mAP élevée dans le secteur de la santé#
Améliorer la précision des diagnostics dans le secteur de la santé commence par une détection précise en imagerie médicale. Des modèles comme YOLO11 peuvent aider les radiologues à repérer des tumeurs, des fractures ou d’autres anomalies sur ces examens médicaux. Ici, la précision moyenne est une métrique essentielle pour évaluer la fiabilité clinique d’un modèle.
Une mAP élevée indique que le modèle atteint à la fois un rappel élevé (identification de la plupart des problèmes réels) et une précision élevée (réduction des fausses alertes), ce qui est essentiel pour la prise de décision clinique. De plus, le seuil IoU dans le secteur de la santé est souvent fixé à un niveau très élevé (0,85 ou 0,90) afin de garantir une détection extrêmement précise.
Cependant, un score mAP faible peut susciter des inquiétudes. Supposons qu’un modèle ne détecte pas une tumeur : cela pourrait retarder le diagnostic ou conduire à un traitement incorrect.
Avantages et inconvénients de l’utilisation de la mAP#
Voici les principaux avantages de l’utilisation de la précision moyenne pour évaluer les modèles de détection d’objets :
-
Métrique standardisée : La mAP est la norme du secteur pour évaluer les modèles de détection d’objets. Une valeur mAP permet de comparer différents modèles de manière équitable et cohérente.
-
Reflète les performances dans le monde réel : Une mAP élevée indique que le modèle excelle dans la détection de différentes classes d’objets et conserve de bonnes performances dans des scénarios complexes du monde réel.
-
Diagnostics par classe : Un score mAP évalue séparément les performances de détection pour chaque classe. Il est ainsi plus facile d’identifier les catégories moins performantes (comme les vélos ou les panneaux de signalisation) et d’ajuster le modèle en conséquence.
Bien que l’utilisation de la métrique mAP présente de nombreux avantages, certaines limites doivent être prises en compte. Voici quelques facteurs à considérer :
-
Difficile à comprendre pour les parties prenantes non techniques : Les équipes commerciales ou cliniques peuvent trouver les valeurs mAP abstraites, contrairement à des métriques plus intuitives et faciles à comprendre.
-
Ne reflète pas les contraintes du temps réel : La mAP ne tient pas compte de la vitesse d’inférence ni de la latence, qui sont essentielles au déploiement dans les applications sensibles au facteur temps.
Points clés à retenir#
Nous avons vu que la précision moyenne n’est pas seulement un score technique, mais aussi le reflet des performances potentielles d’un modèle dans le monde réel. Qu’il s’agisse d’un système de véhicule autonome ou d’une caisse de magasin, un score mAP élevé constitue un indicateur fiable des performances et de l’état de préparation pratique d’un modèle.
Bien que la mAP soit une métrique essentielle et pertinente, elle doit être considérée comme un élément d’une stratégie d’évaluation complète. Pour les applications critiques comme les soins de santé et la conduite autonome, il ne suffit pas de se fier uniquement à la mAP.
D’autres facteurs, comme la vitesse d’inférence (la rapidité avec laquelle le modèle effectue ses prédictions), la taille du modèle (qui influence son déploiement sur des appareils périphériques) et l’analyse qualitative des erreurs (qui permet de comprendre les types d’erreurs commises par le modèle), doivent également être pris en compte pour garantir que le système est sûr, efficace et réellement adapté à son objectif.
Rejoins notre communauté grandissante et notre dépôt GitHub pour en savoir plus sur la vision par ordinateur. Explore nos pages de solutions pour découvrir les applications de la vision par ordinateur dans l’agriculture et de l’IA dans la logistique. Consulte nos options de licence pour commencer dès aujourd’hui à créer ton propre modèle de vision par ordinateur !









