Data Labeling
Impara i fondamenti del data labeling per il machine learning. Scopri i tipi principali, come l’object detection, e come accelerare i workflow usando Ultralytics YOLO26.
L'etichettatura dei dati è il processo fondamentale di identificazione dei dati grezzi — come immagini, fotogrammi video, testo o audio — e di aggiunta di tag o metadati informativi per fornire contesto. Nel campo dell'apprendimento automatico (ML), gli algoritmi non sono in grado di comprendere intrinsecamente il mondo fisico; hanno bisogno di un "insegnante" che li guidi. Questa guida viene fornita tramite dataset etichettati utilizzati durante l'apprendimento supervisionato. Le etichette fungono da verità di riferimento, rappresentando le risposte corrette che il modello cerca di prevedere. Che si tratti di addestrare un semplice classificatore o un'architettura complessa come Ultralytics YOLO26, l'accuratezza, la coerenza e la qualità di queste etichette sono i principali fattori determinanti del successo di un modello.
Etichettatura dei dati vs. annotazione dei dati#
Sebbene nella conversazione informale i termini vengano spesso usati come sinonimi, esiste una sottile distinzione degna di nota. "Etichettatura dei dati" si riferisce generalmente all'atto ampio di assegnare una categoria o un tag a un elemento di dati (ad esempio, contrassegnare un'e-mail come "spam"). Al contrario, l'annotazione dei dati è spesso più specifica della visione artificiale (CV) e prevede la delimitazione precisa degli oggetti tramite bounding box, poligoni o keypoint. Tuttavia, nella maggior parte dei flussi di lavoro delle operazioni di apprendimento automatico (MLOps), entrambi i termini descrivono la creazione di dati di addestramento di alta qualità.
Tipi principali nella visione artificiale#
Il metodo di etichettatura varia in base all'attività che il modello deve svolgere. I tipi più comuni includono:
- Classificazione delle immagini: assegnazione di una singola etichetta a un'intera immagine, ad esempio identificando una condizione meteorologica come "nuvoloso" o "soleggiato".
- Rilevamento degli oggetti: disegno di bounding box 2D attorno a oggetti distinti per insegnare al modello che cosa sono e dove si trovano.
- Segmentazione delle istanze: creazione di maschere o poligoni accurati a livello di pixel attorno agli oggetti, essenziale per determinare forme e confini precisi.
- Stima della posa: marcatura di specifici keypoint su un soggetto, come le articolazioni dello scheletro, per analizzare il movimento o la postura.
Applicazioni nel mondo reale#
L'utilità dell'etichettatura dei dati si estende praticamente a ogni settore che utilizza l'AI.
-
Veicoli autonomi: le auto a guida autonoma si basano su enormi dataset in cui ogni veicolo, pedone, segnale stradale e delimitatore di corsia è etichettato meticolosamente. Questi dati etichettati consentono al sistema di percezione di navigare in sicurezza in ambienti complessi. Le aziende di veicoli autonomi investono molto nell'etichettatura a livello di pixel per garantire la conformità ai requisiti di sicurezza.
-
Agricoltura di precisione: nell'agricoltura moderna, l'AI nell'agricoltura viene utilizzata per rilevare le malattie delle colture o monitorare le fasi di crescita. Gli agricoltori utilizzano modelli addestrati su immagini etichettate di foglie "sane" e "malate" per automatizzare i trattamenti, riducendo l'uso di sostanze chimiche e aumentando la resa.
Il flusso di lavoro dell'etichettatura#
La creazione di un dataset etichettato è spesso la parte più dispendiosa in termini di tempo di un progetto di AI. Il processo prevede in genere un approccio "umano nel ciclo" (HITL), in cui gli annotatori umani verificano le etichette per garantire un'elevata accuratezza. I flussi di lavoro moderni sfruttano strumenti come la Ultralytics Platform, che semplifica la gestione dei dataset e consente ai team di collaborare alle annotazioni. È inoltre possibile utilizzare tecniche avanzate come l'apprendimento attivo, in cui un modello pre-etichetta i dati e gli esseri umani correggono solo le previsioni a bassa confidenza, accelerando significativamente il processo.
L'esempio seguente mostra come utilizzare un modello Ultralytics YOLO26 pre-addestrato per generare automaticamente le etichette (auto-etichettatura) per una nuova immagine, che può quindi essere corretta dagli esseri umani:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")








