Data Cleaning
Padroneggia la pulizia dei dati per migliorare l’accuratezza dei modelli AI. Impara le tecniche per rimuovere gli errori, gestire i valori mancanti e preparare dataset puliti per Ultralytics YOLO26.
La pulizia dei dati è il processo fondamentale di rilevamento e correzione (o rimozione) dei record corrotti, inaccurati o irrilevanti da un insieme di record, una tabella o un database. Nell'ambito dell'intelligenza artificiale (AI) e dell'apprendimento automatico (ML), questo passaggio è spesso considerato la parte più dispendiosa in termini di tempo, ma anche essenziale, del flusso di lavoro. Prima che un modello come YOLO26 possa imparare efficacemente a riconoscere gli oggetti, i dati di addestramento devono essere ripuliti dagli errori per prevenire il fenomeno "Garbage In, Garbage Out", in cui dati di input di scarsa qualità producono risultati inaffidabili.
L'importanza dell'integrità dei dati nell'AI#
I modelli di computer vision ad alte prestazioni dipendono fortemente dalla qualità dei dataset che utilizzano. Se un dataset contiene immagini etichettate erroneamente, duplicati o file corrotti, il modello avrà difficoltà a generalizzare gli schemi, causando overfitting o una scarsa accuratezza dell'inferenza. Una pulizia efficace dei dati migliora l'affidabilità dei modelli predittivi e garantisce che l'algoritmo impari da segnali validi anziché dal rumore.
Tecniche comuni di pulizia dei dati#
I professionisti adottano diverse strategie per perfezionare i dataset utilizzando strumenti come Pandas per i dati tabellari o strumenti specializzati per la computer vision.
- Gestione dei valori mancanti: consiste nel rimuovere i record con dati mancanti oppure nell'utilizzare tecniche di imputazione per colmare le lacune sulla base di medie statistiche o dei vicini più prossimi.
- Rimozione dei duplicati: le immagini duplicate in un set di addestramento possono introdurre involontariamente un bias nel modello. La loro rimozione garantisce che il modello non memorizzi esempi specifici, contribuendo a mitigare il bias del dataset.
- Rilevamento degli outlier: identificare e gestire le anomalie o gli outlier che si discostano significativamente dalla norma è fondamentale, poiché possono distorcere l'analisi statistica e i pesi del modello.
- Riparazione strutturale: include la correzione degli errori di battitura nelle etichette delle classi (ad esempio, correggere "Car" e "car") per garantire la coerenza delle classi.
Applicazioni nel mondo reale#
La pulizia dei dati è fondamentale in diversi settori in cui viene utilizzata l'AI.
- Analisi delle immagini mediche: nelle applicazioni di AI in ambito sanitario, i dataset contengono spesso scansioni con artefatti, metadati dei pazienti errati o rumore di fondo irrilevante. La pulizia di questi dati garantisce che i modelli di analisi delle immagini mediche si concentrino esclusivamente sui marcatori biologici rilevanti per la diagnosi.
- Gestione dell'inventario nel commercio al dettaglio: per l'AI nel commercio al dettaglio, i dataset dei prodotti possono contenere articoli obsoleti o immagini con rapporti d'aspetto errati. La pulizia di questi dataset garantisce che i modelli di rilevamento degli oggetti possano identificare con precisione i livelli delle scorte e ridurre i falsi positivi in un ambiente operativo reale.
Distinguere la pulizia dei dati dal preprocessing#
Sebbene siano spesso utilizzati come sinonimi, la pulizia dei dati è distinta dal preprocessing dei dati. La pulizia dei dati si concentra sulla correzione degli errori e sulla rimozione dei dati "scadenti". Al contrario, il preprocessing consiste nel trasformare i dati puliti in un formato adatto al modello, ad esempio mediante il ridimensionamento delle immagini, la normalizzazione o l'applicazione dell'aumento dei dati per incrementare la varietà.
Automatizzare i controlli di qualità#
I flussi di lavoro moderni, come quelli disponibili sulla Ultralytics Platform, integrano controlli automatizzati per identificare immagini corrotte o incoerenze nelle etichette prima dell'inizio dell'addestramento. Di seguito è riportato un semplice esempio in Python che mostra come verificare e identificare i file immagine corrotti utilizzando la libreria Pillow standard, un passaggio comune prima di fornire i dati a un modello come YOLO26.
from pathlib import Path
from PIL import Image
def verify_images(dataset_path):
"""Iterates through a directory to identify corrupt images."""
for img_path in Path(dataset_path).glob("*.jpg"):
try:
with Image.open(img_path) as img:
img.verify() # Checks file integrity
except (OSError, SyntaxError):
print(f"Corrupt file found: {img_path}")
# Run verification on your dataset
verify_images("./coco8/images/train")








