Accuracy, precision e recall a confronto nel machine learning
Scopri Accuracy, Precision e Recall nel machine learning. Esplora la matrice di confusione, il punteggio F1 e come utilizzare queste metriche di valutazione essenziali.

L'apprendimento automatico (ML) è un ramo dell'intelligenza artificiale (AI) che si concentra sulla creazione di sistemi capaci di apprendere dai dati. Svolge un ruolo centrale in molte altre aree dell'AI, tra cui la visione artificiale, dove le macchine interpretano le immagini, e l'elaborazione del linguaggio naturale, dove comprendono e generano il linguaggio umano.
Spesso, questi modelli di AI utilizzano tecniche di deep learning per fare previsioni a partire dai dati. Sebbene tali sistemi possano essere molto efficaci, non producono sempre previsioni corrette. Alcuni output possono essere accurati, mentre altri possono non centrare l'obiettivo.
Capire come si verificano questi errori è fondamentale per valutare il rendimento di un modello. Per misurare le prestazioni, possiamo usare le metriche di valutazione dei modelli.
Tra le metriche di valutazione più comuni rientrano l'accuratezza (correttezza complessiva), la precisione (affidabilità delle previsioni positive) e il richiamo (capacità del modello di identificare i positivi effettivi). A prima vista possono sembrare simili, ma ciascuna si concentra su un aspetto diverso del comportamento di un modello.
In questo articolo esamineremo più da vicino ciascuna di queste metriche delle prestazioni dei modelli di AI. Vedremo anche come sono correlate tra loro e come scegliere quella giusta per il tuo caso d'uso. Iniziamo!
Le metriche di valutazione dei modelli sono importanti nell'apprendimento automatico#
Un modello di apprendimento automatico può sembrare inizialmente efficace. Tuttavia, senza le metriche di valutazione giuste, è difficile capire quanto siano accurate le sue prestazioni. Queste metriche danno struttura alla valutazione del modello e aiutano a rispondere a una domanda fondamentale: le previsioni del modello sono utili e affidabili per una determinata attività?
Metriche come accuratezza, precisione e richiamo offrono agli sviluppatori di AI un modo chiaro per misurare il funzionamento di un modello. Ad esempio, quando si confrontano modelli diversi, queste metriche permettono di capire quale offre le prestazioni migliori per un'attività specifica. Aiutano a valutare le prestazioni e a scegliere il modello più adatto agli obiettivi di un progetto di AI.

Fig. 1. Flusso di lavoro per l'addestramento e la valutazione del modello (Fonte)
Queste metriche rendono inoltre più obiettivi i confronti delle prestazioni. Anziché affidarsi a supposizioni o osservazioni incomplete, forniscono informazioni misurabili sul comportamento di un modello in situazioni diverse. In questo modo, evidenziano quali aspetti delle prestazioni siano più importanti in ciascun contesto.
Ad esempio, la scelta della metrica dipende spesso dall'applicazione. Nelle applicazioni dell'AI nel settore sanitario, il richiamo è importante perché l'obiettivo è identificare il maggior numero possibile di casi positivi, anche se alcuni negativi vengono segnalati erroneamente. Al contrario, un filtro antispam può dare priorità alla precisione per evitare di contrassegnare erroneamente come spam le email legittime.
La matrice di confusione: il fondamento delle metriche di classificazione#
La matrice di confusione è una tabella due per due fondamentale per valutare i modelli di AI. Organizza le previsioni in quattro categorie confrontando i risultati effettivi con quelli previsti (le risposte fornite dal modello).
Questo confronto offre una visione dettagliata delle prestazioni del modello. Costituisce la base di metriche di valutazione fondamentali come precisione e richiamo, calcolate direttamente a partire dai valori della matrice.
Le righe della tabella rappresentano le classi effettive, mentre le colonne rappresentano le classi previste. Ogni cella mostra il numero di risultati appartenenti a quella categoria. In parole semplici, indica quante previsioni erano corrette e quali tipi di errori ha commesso il modello.
La matrice di confusione è particolarmente utile quando i dati sono sbilanciati, ovvero quando alcune categorie hanno molti più esempi di altre. È utile anche quando diversi tipi di errore comportano costi differenti.
Ad esempio, nel rilevamento delle frodi è fondamentale individuare le attività fraudolente, ma anche segnalare erroneamente transazioni reali può causare problemi. La matrice chiarisce con quale frequenza si verifica ciascun tipo di errore.
Elementi della matrice di confusione#
Ecco una panoramica dei diversi elementi di una matrice di confusione:
- Vero positivo (TP): quando il modello prevede correttamente un'istanza positiva, questa viene registrata come vero positivo. Ad esempio, un modello di visione artificiale classifica correttamente un veicolo in un'immagine.
- Vero negativo (TN): si verifica un vero negativo quando il modello identifica correttamente un'istanza negativa. Ad esempio, un classificatore di email contrassegna un messaggio normale come non spam.
- Falso positivo (FP): il modello genera un falso positivo quando prevede erroneamente un risultato positivo per un'istanza che in realtà è negativa. Noto anche come errore di tipo I, può verificarsi quando un sistema di rilevamento delle frodi segnala come fraudolenta una transazione valida.
- Falso negativo (FN): un falso negativo viene registrato quando il modello non rileva un caso positivo e lo prevede erroneamente come negativo. Noto anche come errore di tipo II, può verificarsi quando uno strumento diagnostico non rileva una malattia in un paziente che ne è effettivamente affetto.

Fig. 2. Gli elementi di una matrice di confusione (Fonte)
Rappresentazione visiva e interpretazione della matrice di confusione#
Una matrice di confusione viene visualizzata in formato a griglia. L'asse verticale mostra le classi effettive, mentre quello orizzontale mostra le classi previste. Le previsioni corrette compaiono lungo la diagonale e rappresentano veri positivi e veri negativi.
Gli errori si trovano al di fuori della diagonale e comprendono falsi positivi e falsi negativi. Questa struttura rende facile individuare punti di forza e debolezze.
Che cos'è l'accuratezza nell'apprendimento automatico?#
L'accuratezza è una delle metriche più utilizzate per valutare le prestazioni di un modello di apprendimento automatico. Misura la frequenza con cui le previsioni sono corrette in tutte le classi. In altre parole, risponde a una domanda semplice: di tutte le previsioni effettuate dal modello di AI, quante erano corrette?
La formula dell'accuratezza è il numero di previsioni corrette (che include sia i veri positivi sia i veri negativi) diviso per il numero totale di previsioni. L'accuratezza è semplice da calcolare e facile da comprendere, il che la rende un punto di partenza comune nella valutazione dei modelli.
In generale, l'accuratezza è affidabile quando si lavora con dataset bilanciati. Tuttavia, può spesso risultare fuorviante nei dataset sbilanciati, dove una classe prevale sulle altre. Un modello che prevede sempre la classe maggioritaria può comunque ottenere un punteggio di accuratezza elevato, pur non riuscendo a rilevare le altre classi minoritarie.
Ad esempio, in un dataset di immagini in cui solo poche immagini contengono pedoni, un modello che prevede "nessun pedone" per ogni immagine può comunque ottenere un'accuratezza elevata, ma non riuscire completamente a rilevare i pedoni effettivamente presenti.
Questo accade perché l'accuratezza da sola non mostra quali tipi di errore commette un modello né con quale frequenza si verificano. Per questo è importante esaminare anche metriche come precisione e richiamo per comprendere appieno il funzionamento di un modello di AI.
Approfondimento sulla precisione: ridurre al minimo i falsi allarmi#
La precisione è una metrica di valutazione fondamentale che misura l'accuratezza delle previsioni positive di un modello. Risponde alla domanda: di tutte le istanze previste come positive, quante erano corrette?
La formula della precisione è il numero di veri positivi diviso per la somma di veri positivi e falsi positivi. È particolarmente importante quando una previsione positiva avrebbe conseguenze costose se si rivelasse errata.

Fig. 3. Confronto tra accuratezza e precisione. (Fonte)
Ad esempio, nel rilevamento delle frodi, un modello con bassa precisione può segnalare come fraudolente molte transazioni valide, creando problemi inutili sia per gli utenti sia per i team di supporto. Un modello con alta precisione riduce questo rischio assicurandosi che le transazioni segnalate siano più probabilmente effettivamente fraudolente.
Sebbene un'elevata precisione sia positiva, i modelli che si concentrano eccessivamente su di essa possono diventare molto selettivi e non rilevare casi positivi effettivi. Per questo la metrica della precisione viene spesso esaminata insieme al richiamo, così da mantenere bilanciate le prestazioni.
Che cos'è il richiamo?#
Il richiamo è una metrica utilizzata per misurare quanto bene un modello identifica i casi positivi effettivi. È noto anche come sensibilità o tasso di veri positivi e risponde alla domanda: di tutte le istanze effettivamente positive, quante ne ha rilevate correttamente il modello?
La formula del richiamo è il numero di veri positivi diviso per la somma di veri positivi e falsi negativi. Un punteggio di richiamo elevato indica che il modello rileva la maggior parte dei casi positivi reali presenti nei dati.
Il richiamo è essenziale in settori come quello sanitario, dove non rilevare una condizione può ritardare il trattamento e mettere a rischio i pazienti. Anche se alcuni casi negativi vengono segnalati erroneamente, identificare tutti i casi effettivi resta la priorità principale.
Tuttavia, i modelli che si concentrano solo sul richiamo possono generare troppi falsi positivi, riducendo la precisione e penalizzando l'efficienza complessiva del modello. Bilanciare richiamo e precisione è fondamentale per ottenere prestazioni affidabili dei modelli di AI.
L'equilibrio: il compromesso tra precisione e richiamo#
Precisione e richiamo spesso si muovono in direzioni opposte. Quando una migliora, l'altra può diminuire. Questo compromesso è una sfida comune nelle attività di apprendimento automatico.
Un modello ad alta precisione prevede qualcosa come positivo solo quando è sicuro. Ciò riduce i falsi allarmi, ma può non rilevare positivi reali, diminuendo il richiamo. Un modello che cerca di intercettare ogni positivo aumenta il richiamo, ma rischia di generare più falsi allarmi, riducendo la precisione.
Questo compromesso diventa più evidente quando si regola la soglia decisionale del modello. La soglia è il limite che un sistema utilizza per trasformare un punteggio o una probabilità in un'azione o un'etichetta. Abbassare la soglia induce il sistema ad agire positivamente più spesso, aumentando potenzialmente il richiamo ma riducendo la precisione. Alzare la soglia ha l'effetto opposto: il modello prevede meno positivi, la precisione migliora, ma il richiamo solitamente diminuisce.
Supponiamo che tu stia lavorando al rilevamento dello spam. Il modello deve bilanciare il rischio di lasciar passare lo spam nella posta in arrivo con quello di bloccare email reali. Un filtro rigido può comunque non rilevare una parte dello spam, mentre uno più permissivo può bloccare accidentalmente messaggi legittimi. L'equilibrio giusto dipende dal caso d'uso e dal costo di ciascun tipo di errore.
L'importanza della curva precisione-richiamo#
La curva precisione-richiamo, o curva PR, mostra come cambiano precisione e richiamo al variare della soglia decisionale del modello. Ogni punto rappresenta un compromesso diverso tra le due metriche. La curva PR è particolarmente utile per i dataset sbilanciati, in cui una classe è molto meno frequente.
Fornisce inoltre informazioni più significative rispetto alla curva caratteristica operativa del ricevitore (ROC), che mostra anch'essa quanto bene un modello separa i positivi dai negativi a diverse soglie decisionali. Un modello con precisione e richiamo entrambi elevati avrà una curva precisione-richiamo che rimane vicino all'angolo in alto a destra, una condizione generalmente ideale.
Introduzione al punteggio F1: una metrica combinata per l'equilibrio#
Il punteggio F1 fornisce un singolo valore che rappresenta l'equilibrio tra precisione e richiamo. Il punteggio F1 si calcola come due volte il prodotto di precisione e richiamo, diviso per la somma di precisione e richiamo. È utile quando contano sia i falsi positivi sia i falsi negativi, quando si lavora con dataset sbilanciati o quando è necessaria una visione equilibrata delle prestazioni del modello.

Fig. 4. Calcolo del punteggio F1 usando precisione e richiamo (Fonte)
Oltre accuratezza, precisione e richiamo#
Sebbene accuratezza, precisione e richiamo siano essenziali, altre metriche offrono informazioni aggiuntive in base al tipo di modello e alle caratteristiche del dataset.
Ecco alcune metriche comunemente utilizzate che aiutano a valutare diversi aspetti delle prestazioni:
- Specificità: misura quanto bene il modello identifica i negativi effettivi. È utile quando è importante evitare i falsi positivi.
- AUC: l'AUC, o area sotto la curva, fornisce un singolo punteggio che riflette quanto bene il modello riesce a distinguere tra le classi.
- Log loss: la log loss viene utilizzata per misurare il grado di sicurezza con cui un modello effettua le previsioni e penalizza maggiormente le previsioni errate effettuate con elevata sicurezza. In questo caso, la sicurezza indica quanto il modello sia certo della propria previsione.
- Valutazione multi-etichetta: nelle attività multi-etichetta, le metriche vengono mediate tra le etichette per rappresentare le prestazioni complessive del modello.
Applicazione di accuratezza, precisione e richiamo nella visione artificiale#
Ora che abbiamo compreso meglio accuratezza, precisione e richiamo, vediamo come vengono applicate queste metriche nella visione artificiale.
I modelli di visione artificiale come Ultralytics YOLO11 supportano attività come il rilevamento degli oggetti, in cui il modello identifica quali oggetti sono presenti in un'immagine e ne individua la posizione utilizzando riquadri di delimitazione. Ogni previsione include sia l'etichetta dell'oggetto sia la sua posizione, rendendo la valutazione più complessa del semplice controllo della correttezza di un'etichetta.

Fig. 5. Un esempio di utilizzo di Ultralytics YOLO11 per il rilevamento degli oggetti. (Fonte)
Considera un'applicazione nel commercio al dettaglio in cui le telecamere vengono utilizzate per monitorare automaticamente i prodotti sugli scaffali. Un modello di rilevamento degli oggetti potrebbe identificare articoli come scatole di cereali, lattine di bibite o bottiglie d'acqua e indicarne la posizione.
In questo caso, la precisione ci dice quanti degli articoli rilevati sono effettivamente corretti. Un'elevata precisione significa che il sistema evita i falsi positivi, come etichettare un'ombra o un oggetto dello sfondo come prodotto. Il richiamo mostra quanti dei prodotti realmente presenti sullo scaffale il modello è riuscito a rilevare. Un richiamo elevato significa che vengono persi meno articoli, un aspetto fondamentale per conteggi accurati dell'inventario.
L'accuratezza può comunque fornire una misura generale della correttezza, ma in questo tipo di scenario non rilevare anche solo pochi prodotti o rilevare articoli inesistenti può avere un forte impatto sulla gestione delle scorte. Per questo gli sviluppatori esaminano insieme precisione, richiamo e accuratezza, così da garantire che il sistema sia affidabile e pratico per l'uso nel mondo reale.
Accuratezza, precisione e richiamo: punti chiave#
Accuratezza, precisione e richiamo evidenziano ciascuno aspetti diversi delle prestazioni di un modello di apprendimento automatico. Affidarsi a una sola metrica può essere fuorviante.
Strumenti e metriche come la matrice di confusione, le curve precisione-richiamo e il punteggio F1 aiutano a evidenziare i compromessi e a guidare le decisioni su come migliorare il modello di ML. Scegliendo la combinazione giusta di metriche per una soluzione di AI specifica, puoi assicurarti che i modelli siano accurati, affidabili ed efficaci nelle applicazioni del mondo reale.
Esplora la nostra community in continua crescita! Dai un'occhiata al nostro repository GitHub per saperne di più sull'AI. Pronto per iniziare i tuoi progetti di visione artificiale? Scopri le nostre opzioni di licenza. Scopri l'AI nell'agricoltura e l'AI per la visione nella robotica visitando le nostre pagine dedicate alle soluzioni!









