Data Lake
Scopri come i data lake costituiscono la base per AI e ML. Impara a sfruttare i dati grezzi per addestrare Ultralytics YOLO26 e semplificare i workflow di computer vision.
Un data lake è un repository di archiviazione centralizzato che contiene una vasta quantità di dati grezzi nel loro formato nativo finché non se ne presenta la necessità. A differenza dei sistemi di archiviazione tradizionali, che richiedono che i dati siano strutturati prima dell'inserimento, un data lake accetta i dati "così come sono", inclusi dati strutturati (righe e colonne), dati semi-strutturati (CSV, log, XML, JSON), dati non strutturati (e-mail, documenti, PDF) e dati binari (immagini, audio, video). Questa flessibilità architetturale rende i data lake un elemento fondamentale delle moderne strategie di Big Data, in particolare per le organizzazioni che utilizzano l'Intelligenza Artificiale (AI) e l'Apprendimento automatico (ML). Separando l'acquisizione dei dati dal loro utilizzo, le organizzazioni possono archiviare enormi quantità di informazioni a costi relativamente contenuti e determinare in un secondo momento le domande specifiche a cui rispondere con l'analisi.
Il ruolo dei data lake nell'Intelligenza Artificiale e nell'apprendimento automatico#
Nel contesto dello sviluppo dell'Intelligenza Artificiale, il valore principale di un data lake risiede nella sua capacità di supportare i flussi di lavoro di Apprendimento profondo (DL). Le reti neurali avanzate richiedono [dati di addestramento](https://ultralytics-translation-1.invalid diversificati e voluminosi per raggiungere un'elevata accuratezza. Un data lake funge da area di preparazione in cui risiedono risorse grezze, come milioni di immagini ad alta risoluzione per la Visione artificiale (CV) o migliaia di ore di audio per il Riconoscimento vocale, prima di essere elaborate.
I data scientist utilizzano metodologie di tipo "schema-on-read" all'interno dei data lake. Ciò significa che la struttura viene applicata ai dati solo quando questi vengono letti per l'elaborazione, anziché al momento della scrittura nell'archiviazione. Questo consente una notevole agilità: lo stesso dataset grezzo può essere elaborato in più modi per diverse attività di modellazione predittiva senza modificare la fonte originale. Inoltre, i data lake più robusti spesso si integrano con servizi di cloud computing come Amazon S3 o Azure Blob Storage, consentendo l'elaborazione parallela e scalabile necessaria per addestrare modelli complessi come YOLO26.
Data Lake vs. Data Warehouse#
Sebbene vengano spesso confusi, un data lake è distinto da un data warehouse. Un data warehouse archivia i dati in tabelle strutturate ed è ottimizzato per query SQL rapide e report di business intelligence. Utilizza lo "schema-on-write", il che significa che i dati devono essere puliti e trasformati tramite un processo di Estrazione, trasformazione e caricamento (ETL) prima di essere inseriti nel sistema.
Al contrario, un data lake è ottimizzato per il volume e la varietà dei dati archiviati. Supporta l'apprendimento non supervisionato e l'analisi esplorativa, in cui l'obiettivo potrebbe non essere ancora definito. Ad esempio, un data warehouse potrebbe dirti quanti prodotti sono stati venduti lo scorso mese, mentre un data lake conserva i log grezzi del sentiment dei clienti e i dati delle immagini che aiutano un modello di Intelligenza Artificiale a comprendere perché siano stati venduti.
Applicazioni nel mondo reale#
I data lake sono fondamentali in vari settori che spingono oltre i limiti dell'automazione:
- Veicoli autonomi: lo sviluppo della tecnologia di guida autonoma richiede l'elaborazione di petabyte di dati provenienti dai sensori. I veicoli autonomi generano flussi continui di nuvole di punti LiDAR, segnali radar e video ad alta definizione. Un data lake archivia questi dati telemetrici grezzi, consentendo agli ingegneri di riprodurre scenari del mondo reale per addestrare modelli di rilevamento degli oggetti in grado di identificare pedoni e ostacoli in condizioni meteorologiche variabili.
- Diagnostica sanitaria: nella moderna analisi delle immagini mediche, gli ospedali consolidano la storia clinica dei pazienti, i dati genomici e i file di imaging (scansioni MRI e CT) in un data lake sicuro. I ricercatori possono quindi accedere a questi dati anonimizzati e non strutturati per addestrare modelli per il rilevamento dei tumori o la previsione delle malattie, utilizzando spesso tecniche di segmentazione per isolare le aree di interesse all'interno delle immagini mediche.
Utilizzo dei data lake con Ultralytics#
Quando lavorano con la Ultralytics Platform, gli utenti spesso estraggono sottoinsiemi di dati grezzi dal data lake della propria organizzazione per creare dataset annotati destinati all'addestramento. Una volta recuperate ed etichettate, le immagini grezze possono essere utilizzate per addestrare modelli all'avanguardia.
L'esempio seguente mostra come uno sviluppatore potrebbe caricare un dataset locale (simulando il recupero da un data lake) per addestrare il modello YOLO26 a un'attività di rilevamento.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Train the model using a dataset configuration file
# In a production pipeline, this data might be streamed or downloaded
# from a cloud-based data lake prior to this step.
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)
# Run inference on a new image to verify performance
predictions = model("https://ultralytics.com/images/bus.jpg")








