Mean Average Precision (mAP) nel rilevamento degli oggetti
Comprendi la Mean Average Precision (mAP) nel rilevamento degli oggetti. Scopri il suo significato, come si calcola e perché la mAP è fondamentale per valutare le prestazioni dei modelli.

L'adozione dell'AI sta crescendo rapidamente e l'AI viene integrata in diverse innovazioni, dalle auto a guida autonoma ai sistemi di vendita al dettaglio in grado di identificare i prodotti sugli scaffali. Queste tecnologie si basano sulla visione artificiale, un ramo dell'intelligenza artificiale (AI) che consente alle macchine di analizzare i dati visivi.
Una metrica di valutazione fondamentale utilizzata per misurare l'accuratezza dei sistemi e degli algoritmi di visione artificiale è la precisione media media (mAP). La metrica mAP indica quanto la previsione di un modello di AI per la visione corrisponda ai risultati del mondo reale.
Un'attività comune di visione artificiale è il rilevamento degli oggetti, in cui un modello identifica più oggetti in un'immagine e traccia dei riquadri di delimitazione intorno a essi. La mAP è la metrica standard utilizzata per valutare le prestazioni dei modelli di rilevamento degli oggetti ed è ampiamente usata per confrontare modelli di deep learning come Ultralytics YOLO11.
In questo articolo vedremo come viene calcolata la precisione media media e perché è essenziale per chiunque addestri o valuti modelli di rilevamento degli oggetti. Iniziamo!
Che cos'è la precisione media media (mAP)?#
La precisione media media è un punteggio che mostra quanto sia accurato un modello di deep learning nelle attività correlate al recupero di informazioni visive, come il rilevamento e l'identificazione di diversi oggetti in un'immagine. Per esempio, considera un modello di rilevamento degli oggetti che analizza una foto contenente un cane, un gatto e un'auto. Un modello affidabile può rilevare gli oggetti riconoscendoli tutti e tracciando intorno a essi riquadri di delimitazione ed etichette, evidenziando dove si trovano e cosa sono.
La mAP indica quanto bene il modello svolge questa attività su molte immagini e diversi tipi di oggetti. Verifica se il modello identifica accuratamente ogni oggetto e la sua posizione nell'immagine. Il punteggio varia da 0 a 1, dove uno significa che il modello ha trovato tutto perfettamente e zero significa che non è riuscito a rilevare alcun oggetto.
Concetti chiave della precisione media media (mAP)#
Prima di esaminare i concetti alla base della precisione media media nel machine learning, comprendiamo meglio due termini di base: ground truth e previsioni.
La ground truth si riferisce ai dati di riferimento accurati, in cui gli oggetti e le loro posizioni nell'immagine vengono etichettati attentamente dagli esseri umani attraverso un processo noto come annotazione. Le previsioni, invece, sono i risultati forniti dai modelli di AI dopo aver analizzato un'immagine. Confrontando le previsioni del modello di AI con la ground truth, possiamo misurare quanto il modello si sia avvicinato ai risultati corretti.

Fig. 1. I riquadri di delimitazione della previsione del modello e della ground truth. Immagine dell'autore.
Matrice di confusione#
Una matrice di confusione viene spesso utilizzata per comprendere quanto sia preciso un modello di rilevamento degli oggetti. È una tabella che mostra come le previsioni del modello corrispondano alle risposte corrette effettive (ground truth). Da questa tabella possiamo ottenere una suddivisione di quattro componenti o risultati chiave: veri positivi, falsi positivi, falsi negativi e veri negativi.
Ecco cosa rappresentano questi componenti nella matrice di confusione:
- Vero positivo (TP): Un oggetto e la sua posizione vengono rilevati correttamente dal modello.
- Falso positivo (FP): Il modello ha effettuato un rilevamento, ma questo era errato.
- Falso negativo (FN): Un oggetto effettivamente presente nell'immagine che il modello non è riuscito a rilevare.
- Vero negativo (TN): I veri negativi si verificano quando il modello identifica correttamente l'assenza di un oggetto.
I veri negativi non vengono comunemente utilizzati nel rilevamento degli oggetti, poiché in genere ignoriamo le numerose regioni vuote di un'immagine. Tuttavia, sono essenziali in altre attività di visione artificiale, come la classificazione delle immagini, in cui il modello assegna un'etichetta all'immagine. Per esempio, se l'attività consiste nel rilevare se un'immagine contiene o meno un gatto e il modello identifica correttamente "nessun gatto" quando l'immagine non ne contiene uno, si tratta di un vero negativo.

Fig. 2. Risultati della classificazione in una matrice di confusione. Immagine dell'autore.
Intersezione sull'unione (IoU)#
Un'altra metrica fondamentale nella valutazione dei modelli di rilevamento degli oggetti è l'Intersezione sull'unione (IoU). Per questi modelli di AI per la visione, rilevare semplicemente la presenza di un oggetto in un'immagine non è sufficiente; il modello deve anche individuarne la posizione nell'immagine per tracciare i riquadri di delimitazione.
La metrica IoU misura quanto il riquadro previsto dal modello corrisponda al riquadro effettivo corretto (ground truth). Il punteggio è compreso tra 0 e 1, dove 1 indica una corrispondenza perfetta e 0 indica una totale assenza di sovrapposizione.
Per esempio, un IoU più elevato (come 0.80 o 0.85) significa che il riquadro previsto corrisponde strettamente al riquadro della ground truth, indicando una localizzazione accurata. Un IoU più basso (come 0.30 o 0.25) significa che il modello non ha individuato accuratamente l'oggetto.
Per determinare se un rilevamento ha esito positivo, utilizziamo soglie diverse. Una soglia IoU comune è 0.5, il che significa che un riquadro previsto deve sovrapporsi al riquadro della ground truth per almeno il 50% per essere conteggiato come vero positivo. Qualsiasi sovrapposizione al di sotto di questa soglia viene considerata un falso positivo.

Fig. 3. Comprendere l'Intersezione sull'unione. Immagine dell'autore.
Precisione e richiamo#
Finora abbiamo esaminato alcune metriche di valutazione di base per comprendere le prestazioni dei modelli di rilevamento degli oggetti. Sulla base di queste, due delle metriche più importanti sono precisione e richiamo. Forniscono un quadro chiaro dell'accuratezza dei rilevamenti del modello. Vediamo di cosa si tratta.
I valori di precisione indicano quante delle previsioni del modello erano effettivamente corrette. Rispondono alla domanda: tra tutti gli oggetti che il modello ha dichiarato di aver rilevato, quanti erano realmente presenti?
I valori di richiamo, invece, misurano quanto bene il modello individui tutti gli oggetti effettivamente presenti nell'immagine. Rispondono alla domanda: tra tutti gli oggetti reali presenti, quanti ne ha rilevati correttamente il modello?
Insieme, precisione e richiamo forniscono un quadro più chiaro delle prestazioni del modello. Per esempio, se un modello prevede 10 auto in un'immagine e 9 di esse sono effettivamente auto, ha una precisione del 90% (una previsione positiva).
Queste due metriche di valutazione comportano spesso un compromesso: un modello può ottenere un valore di precisione elevato effettuando solo previsioni di cui è completamente sicuro, ma ciò può fargli perdere molti oggetti, riducendo il livello di richiamo. Allo stesso tempo, può raggiungere un richiamo molto elevato prevedendo un riquadro di delimitazione quasi ovunque, ma questo ridurrebbe la precisione.

Fig. 4. Precisione e richiamo. Immagine dell'autore.
Precisione media#
Mentre precisione e richiamo ci aiutano a comprendere le prestazioni di un modello sulle singole previsioni, la precisione media (AP) può offrire una visione più ampia. Illustra come cambia la precisione del modello mentre tenta di rilevare più oggetti e riassume le sue prestazioni in un unico numero.
Per calcolare il punteggio di precisione media, possiamo innanzitutto creare per ogni tipo di oggetto una metrica combinata simile a un grafico, chiamata curva precisione-richiamo (o curva PR). Questa curva mostra cosa accade quando il modello effettua più previsioni.
Considera uno scenario in cui il modello inizia rilevando solo gli oggetti più facili o evidenti. In questa fase, la precisione è elevata perché la maggior parte delle previsioni è corretta, ma il richiamo è basso poiché molti oggetti non vengono ancora rilevati. Quando il modello cerca di rilevare più oggetti, inclusi quelli più difficili o rari, di solito introduce più errori. Questo fa diminuire la precisione mentre il richiamo aumenta.
La precisione media è l'area sotto la curva (AUC della curva PR). Un'area maggiore significa che il modello è più bravo a mantenere accurate le proprie previsioni anche mentre rileva più oggetti. L'AP viene calcolata separatamente per ogni etichetta di classe.
Per esempio, in un modello in grado di rilevare auto, biciclette e pedoni, possiamo calcolare individualmente i valori AP per ciascuna di queste tre categorie. Questo ci aiuta a capire quali oggetti il modello rileva bene e dove potrebbe essere ancora necessario migliorarlo.

Fig. 5. Una curva PR per cinque classi diverse. (Fonte)
Precisione media media#
Dopo aver calcolato la precisione media per ogni classe di oggetti, abbiamo ancora bisogno di un singolo punteggio che rifletta le prestazioni complessive del modello su tutte le classi. Questo si può ottenere utilizzando la formula della precisione media media. La formula calcola la media dei punteggi AP di ogni categoria.
Per esempio, supponiamo che un modello di visione artificiale come Ultralytics YOLO11 raggiunga un AP di 0.827 per le auto, 0.679 per le motociclette, 0.355 per i camion, 0.863 per gli autobus e 0.982 per le biciclette. Utilizzando la formula mAP, possiamo sommare questi numeri e dividerli per il numero totale di classi come segue:
mAP = (0.827 + 0.679 + 0.355 + 0.863 + 0.982) ÷ 5 = 0.7432 ≈ 0.743
Il punteggio mAP di 0.743 offre un modo diretto per valutare le prestazioni del modello su tutte le classi di oggetti. Un valore vicino a 1 significa che il modello è accurato per la maggior parte delle categorie, mentre un valore più basso suggerisce che incontra difficoltà con alcune di esse.
Importanza di AP e mAP nella visione artificiale#
Ora che abbiamo compreso meglio come vengono calcolate AP e mAP e quali sono i loro componenti, ecco una panoramica della loro importanza nella visione artificiale:
-
AP bassa per una classe specifica: Un'AP bassa per una singola classe spesso significa che il modello ha difficoltà con quella specifica classe di oggetti. Ciò può essere dovuto a dati di addestramento insufficienti o a difficoltà visive nelle immagini, come l'occlusione.
-
Errori di localizzazione: Un valore mAP più elevato a una soglia IoU più bassa (come mAP@0.50), combinato con un calo significativo a una soglia IoU più alta (come mAP@0.75), indica che il modello è in grado di rilevare gli oggetti, ma ha difficoltà a localizzarli con precisione.
-
Overfitting: Un valore mAP più elevato sul dataset di addestramento, ma un valore mAP più basso sul dataset di validazione, è un segnale di overfitting e rende il modello inaffidabile per le nuove immagini.
Applicazioni della precisione media media nel mondo reale#
Vediamo ora come metriche chiave come mAP possano aiutare nella realizzazione di casi d'uso di visione artificiale nel mondo reale.
Veicoli autonomi: perché un valore mAP più elevato significa strade più sicure#
Per le auto a guida autonoma, il rilevamento degli oggetti è fondamentale per identificare pedoni, segnali stradali, ciclisti e segnaletica orizzontale. Per esempio, se un bambino attraversa improvvisamente la strada correndo, l'auto ha pochi secondi per rilevare l'oggetto (il bambino), individuarne la posizione, seguirne il movimento e intraprendere l'azione necessaria (applicare i freni).
Modelli come Ultralytics YOLO11 sono progettati per il rilevamento degli oggetti in tempo reale in scenari ad alto rischio di questo tipo. In questi casi, la mAP diventa una misura critica della sicurezza.
Un punteggio mAP elevato garantisce che il sistema rilevi rapidamente il bambino, ne localizzi con precisione la posizione e attivi la frenata con un ritardo minimo. Una mAP bassa può indicare rilevamenti mancati o classificazioni errate pericolose, come confondere il bambino con un altro oggetto di piccole dimensioni.

Fig. 6. Un esempio di utilizzo di YOLO11 per rilevare pedoni sulla strada. (Fonte)
Utilizzare la mAP per un rilevamento accurato dei prodotti#
Analogamente, nel commercio al dettaglio, i modelli di rilevamento degli oggetti possono essere utilizzati per automatizzare attività come il monitoraggio delle scorte e i processi di pagamento. Quando un cliente scansiona un prodotto a una cassa automatica, un errore nel rilevamento può causare frustrazione.
Un punteggio mAP elevato garantisce che il modello distingua accuratamente tra prodotti simili e tracci riquadri di delimitazione precisi, anche quando gli articoli sono disposti molto vicini. Un punteggio mAP basso può causare scambi. Per esempio, se il modello scambia una bottiglia di succo d'arancia per una bottiglia di succo di mela visivamente simile, ciò potrebbe comportare una fatturazione errata e report di inventario inesatti.
I sistemi di vendita al dettaglio integrati con modelli come Ultralytics YOLO11 possono rilevare i prodotti in tempo reale, confrontarli con l'inventario e aggiornare istantaneamente i sistemi backend. Negli ambienti di vendita al dettaglio dinamici, la mAP svolge un ruolo cruciale nel mantenere le operazioni accurate e affidabili.
Migliorare l'accuratezza diagnostica in ambito sanitario con una mAP elevata#
Migliorare l'accuratezza diagnostica in ambito sanitario inizia con un rilevamento preciso nell'imaging medico. Modelli come YOLO11 possono aiutare i radiologi a individuare tumori, fratture o altre anomalie nelle scansioni mediche. In questo contesto, la precisione media media è una metrica essenziale per valutare l'affidabilità clinica di un modello.
Una mAP elevata indica che il modello raggiunge sia un richiamo elevato (identificando la maggior parte dei problemi effettivi) sia un'elevata precisione (evitando falsi allarmi), aspetti cruciali nel processo decisionale clinico. Inoltre, la soglia IoU in ambito sanitario viene spesso impostata su valori molto elevati (0.85 o 0.90) per garantire un rilevamento estremamente accurato.
Tuttavia, un punteggio mAP basso può destare preoccupazione. Supponiamo che un modello non rilevi un tumore: ciò potrebbe ritardare la diagnosi o portare a un trattamento errato.
Vantaggi e svantaggi dell'utilizzo della mAP#
Ecco i principali vantaggi dell'utilizzo della precisione media media per valutare i modelli di rilevamento degli oggetti:
-
Metrica standardizzata: La mAP è lo standard del settore per valutare i modelli di rilevamento degli oggetti. Un valore mAP consente confronti equi e coerenti tra modelli diversi.
-
Riflette le prestazioni nel mondo reale: Una mAP elevata indica che il modello eccelle nel rilevare diverse classi di oggetti e mantiene prestazioni elevate in scenari complessi del mondo reale.
-
Diagnostica per classe: Un punteggio mAP valuta le prestazioni di rilevamento per ogni classe individualmente. Ciò facilita l'identificazione delle categorie con prestazioni inferiori (come biciclette o segnali stradali) e la conseguente ottimizzazione del modello.
Sebbene l'utilizzo della metrica mAP offra diversi vantaggi, presenta anche alcune limitazioni da considerare. Ecco alcuni fattori da tenere presenti:
-
Difficile da comprendere per gli stakeholder non tecnici: I team aziendali o clinici potrebbero considerare astratti i valori mAP, a differenza di metriche più intuitive e facili da comprendere.
-
Non riflette i vincoli in tempo reale: La mAP non tiene conto della velocità di inferenza o della latenza, aspetti cruciali per la distribuzione in applicazioni sensibili al fattore tempo.
Punti chiave#
Abbiamo visto che la precisione media media non è solo un punteggio tecnico, ma riflette le potenziali prestazioni di un modello nel mondo reale. Che si tratti di un sistema per veicoli autonomi o di una cassa automatica nel commercio al dettaglio, un punteggio mAP elevato è un indicatore affidabile delle prestazioni e della preparazione pratica di un modello.
Sebbene la mAP sia una metrica essenziale e significativa, dovrebbe essere considerata come parte di una strategia di valutazione completa. Per applicazioni critiche come l'assistenza sanitaria e la guida autonoma, non è sufficiente affidarsi esclusivamente alla mAP.
Per garantire che il sistema sia sicuro, efficiente e realmente adatto allo scopo previsto, è necessario considerare anche fattori aggiuntivi come la velocità di inferenza (la rapidità con cui il modello effettua le previsioni), le dimensioni del modello (che influiscono sulla distribuzione sui dispositivi edge) e l'analisi qualitativa degli errori (la comprensione dei tipi di errore commessi dal modello).
Unisciti alla nostra community in crescita e al nostro repository GitHub per saperne di più sulla visione artificiale. Esplora le nostre pagine sulle soluzioni per conoscere le applicazioni della visione artificiale nell'agricoltura e dell'AI nella logistica. Dai un'occhiata alle nostre opzioni di licenza per iniziare oggi stesso a creare il tuo modello di visione artificiale!









