Uncertainty Quantification
Scopri la quantificazione dell'incertezza nell'IA e nel machine learning, inclusa l'incertezza aleatoria ed epistemica, la calibrazione, i metodi di valutazione e i flussi di lavoro di Ultralytics YOLO.
La quantificazione dell'incertezza (UQ) è il processo di stima, valutazione e comunicazione del livello di incertezza di un modello di IA o apprendimento automatico riguardo alle sue predizioni. Invece di restituire solo un'etichetta, un valore o un bounding box, un flusso di lavoro UQ fornisce informazioni aggiuntive come una distribuzione di probabilità, un intervallo di predizione, un punteggio di confidenza o un insieme di predizioni. Questo aiuta gli utenti a comprendere non solo cosa predice un modello, ma anche quanta fiducia riporre in tale predizione.
Link to this sectionPerché la Quantificazione dell'Incertezza è Importante#
I modelli apprendono pattern da dati limitati, quindi i loro output non sono mai perfettamente certi. Gli input possono essere rumorosi, le etichette possono essere ambigue e i dati di produzione possono differire dalla distribuzione di addestramento. La UQ rende queste limitazioni misurabili e supporta decisioni più sicure, la revisione umana e una migliore raccolta di dati.
Questa idea estende l'obiettivo più ampio di caratterizzare la qualità del modello descritto dal programma di misurazione virtuale del NIST. Nei sistemi di IA, le stime dell'incertezza possono aiutare i team a:
- Rifiutare o revisionare le predizioni quando l'incertezza supera un livello accettabile.
- Confrontare predizioni alternative anziché fare affidamento su un'unica risposta.
- Identificare input non familiari e possibili deriva dei dati.
- Dare priorità ai campioni incerti per l'etichettatura tramite apprendimento attivo.
- Propagare l'incertezza nei calcoli e nelle decisioni a valle, come illustrato dalla panoramica del Dipartimento dell'Energia sull'incertezza nei modelli computazionali.
La UQ è particolarmente importante quando gli errori di previsione hanno conseguenze disuguali. Mancare un pedone è più grave rispetto a rilevare erroneamente un cartello stradale, quindi la soglia di incertezza accettabile dipende dall'applicazione.
Link to this sectionIncertezza Aleatoria ed Epistemica#
Due categorie spiegano da dove proviene l'incertezza predittiva:
- L'incertezza aleatoria, chiamata anche incertezza aleatoria, deriva da casualità o ambiguità intrinseche nei dati. Sfocatura da movimento, rumore dei sensori, occlusione parziale ed etichette incoerenti possono rendere un'immagine difficile da interpretare anche per un modello ben addestrato. Più dati di addestramento possono aiutare a stimare questa incertezza, ma non possono rimuovere completamente l'ambiguità di fondo.
- L'incertezza epistemica deriva da una conoscenza incompleta del modello. Spesso appare quando i dati di addestramento sono insufficienti, non rappresentativi o privi di situazioni importanti. Può essere frequentemente ridotta raccogliendo esempi pertinenti, migliorando le annotazioni o modificando il modello.
La UQ combina informazioni su queste fonti in output utili. Strumenti di modellazione probabilistica come TensorFlow Probability possono rappresentare le predizioni come distribuzioni, mentre i metodi d'insieme stimano l'incertezza confrontando più modelli o esecuzioni di addestramento. Un disaccordo elevato suggerisce generalmente una maggiore incertezza epistemica.
L'incertezza è correlata a, ma più ampia di, un punteggio di confidenza. La confidenza descrive la forza di una singola predizione, mentre la UQ valuta se quel punteggio è affidabile e quali fonti di incertezza lo influenzano. Allo stesso modo, la predizione conforme è una tecnica specifica per produrre insiemi o intervalli di predizione con una copertura target sotto ipotesi definite.
Link to this sectionMetodi e Valutazione#
Gli approcci UQ comuni includono output probabilistici, insiemi, campionamento ripetuto, modellazione bayesiana e intervalli di predizione. Gli intervalli di confidenza bootstrap stimano la variabilità ricampionando ripetutamente i dati osservati. Per la classificazione, la calibrazione verifica se le predizioni a cui è assegnata una probabilità di circa l'80% sono corrette circa l'80% delle volte.
Un modello può essere accurato ma scarsamente calibrato, quindi i team dovrebbero valutare sia le prestazioni del compito che la qualità dell'incertezza. Gli strumenti di calibrazione della probabilità utilizzano diagrammi di affidabilità e tecniche di calibrazione per confrontare le probabilità predette con i risultati osservati. Anche le Regole di Machine Learning di Google enfatizzano predizioni probabilistiche interpretabili e monitorate.
I criteri di valutazione utili includono copertura, ampiezza dell'intervallo, errore di calibrazione e prestazioni su sezioni di dati difficili. Per la visione artificiale, la modalità di validazione di Ultralytics e la guida alle metriche delle prestazioni YOLO aiutano a esaminare precisione, richiamo, matrici di confusione e comportamento della confidenza tra classi e soglie.
Link to this sectionApplicazioni nel mondo reale#
- Analisi di immagini mediche: Un modello diagnostico può segnalare una scansione per la revisione da parte di uno specialista quando diversi risultati plausibili hanno punteggi simili o quando l'immagine differisce dai suoi dati di addestramento. Senza questa escalation, una predizione errata troppo sicura di sé potrebbe ritardare il trattamento.
- Ispezione visiva industriale: Un rilevatore di difetti può incontrare riflessi, nuovi materiali o danni precedentemente non visti. L'instradamento basato sull'incertezza può inviare prodotti ambigui all'ispezione manuale invece di accettarli o rifiutarli automaticamente, riducendo sia i difetti sfuggiti che gli sprechi non necessari.
Queste politiche collegano l'incertezza del modello al rischio operativo. Il NIST AI Risk Management Framework Core raccomanda di misurare l'incertezza, documentare i limiti di generalizzazione e monitorare i sistemi durante l'intero dispiegamento.
Link to this sectionIncertezza nei Flussi di Lavoro di Ultralytics YOLO#
Ultralytics YOLO26 espone i punteggi di confidenza del rilevamento tramite la sua documentata modalità Predici:
from ultralytics import YOLO
# Load an official detection model
model = YOLO("yolo26n.pt")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Inspect each detection's confidence
for box in result.boxes:
class_id = int(box.cls.item())
class_name = result.names[class_id]
confidence = box.conf.item()
print(f"{class_name}: {confidence:.3f}")Questo flusso di lavoro espone un utile segnale correlato all'incertezza, ma la sola confidenza non è una UQ completa e non dovrebbe essere interpretata automaticamente come una probabilità calibrata. Valida i punteggi su dati rappresentativi trattenuti, scegli le soglie in base ai costi degli errori e monitora le distribuzioni della confidenza dopo il dispiegamento.
I team possono utilizzare la piattaforma Ultralytics per annotare dataset, addestrare e distribuire modelli e monitorare gli endpoint. Combinati con il continuo monitoraggio e manutenzione del modello, i segnali di incertezza possono rivelare condizioni non familiari, guidare la revisione umana e identificare quando sono necessari nuovi dati o un nuovo addestramento.






