Data Lake
Explora cómo los data lakes sirven como base para la IA y ML. Aprende a aprovechar los datos sin procesar para entrenar Ultralytics YOLO26 y agilizar los flujos de trabajo de visión por computadora.
Un data lake es un repositorio de almacenamiento centralizado que contiene una gran cantidad de datos sin procesar en su formato nativo hasta que se necesitan. A diferencia de los sistemas de almacenamiento tradicionales que requieren que los datos estén estructurados antes de entrar, un data lake acepta los datos "tal cual", incluyendo datos estructurados (filas y columnas), semiestructurados (CSV, registros, XML, JSON), no estructurados (correos electrónicos, documentos, PDFs) y datos binarios (imágenes, audio, video). Esta flexibilidad arquitectónica convierte a los data lakes en un pilar fundamental de las estrategias modernas de Big Data, especialmente para las organizaciones que aprovechan la Artificial Intelligence (AI) y el Machine Learning (ML). Al desacoplar la captura de datos del uso de los mismos, las organizaciones pueden almacenar enormes volúmenes de información de forma relativamente económica y determinar las preguntas de análisis específicas más adelante.
El papel de los data lakes en la IA y el Machine Learning#
En el contexto del desarrollo de IA, el valor principal de un data lake radica en su capacidad para admitir flujos de trabajo de Deep Learning (DL). Las redes neuronales avanzadas requieren training data diversa y voluminosa para lograr una gran precisión. Un data lake actúa como el entorno de ensayo donde residen los recursos sin procesar —como millones de imágenes de alta resolución para Computer Vision (CV) o miles de horas de audio para Speech Recognition— antes de ser procesados.
Los científicos de datos utilizan metodologías de "esquema en lectura" dentro de los data lakes. Esto significa que la estructura se aplica a los datos únicamente cuando se leen para su procesamiento, en lugar de cuando se escriben en el almacenamiento. Esto permite una inmensa agilidad; el mismo conjunto de datos sin procesar se puede procesar de múltiples maneras para diferentes tareas de predictive modeling sin alterar la fuente original. Además, los data lakes robustos suelen integrarse con servicios de cloud computing como Amazon S3 o Azure Blob Storage, lo que permite el procesamiento escalable y paralelo necesario para entrenar modelos pesados como YOLO26.
Data lake frente a Data warehouse#
Aunque a menudo se confunden, un data lake es distinto de un data warehouse. Un data warehouse almacena datos en tablas estructuradas y está optimizado para consultas SQL rápidas e informes de inteligencia empresarial. Utiliza "esquema en escritura", lo que significa que los datos deben limpiarse y transformarse mediante un proceso ETL (Extract, Transform, Load) antes de ingresar al sistema.
Por el contrario, un data lake está optimizado para el volumen y la variedad de almacenamiento. Admite unsupervised learning y análisis exploratorios donde el objetivo aún puede no estar definido. Por ejemplo, un data warehouse puede indicarte cuántos productos se vendieron el mes pasado, mientras que un data lake contiene los registros de customer sentiment y los datos de imagen sin procesar que ayudan a un modelo de IA a comprender por qué se vendieron.
Aplicaciones en el mundo real#
Los data lakes son fundamentales en diversas industrias que superan los límites de la automatización:
- Vehículos autónomos: el desarrollo de tecnología de conducción autónoma requiere procesar petabytes de datos de sensores. Los Autonomous vehicles generan flujos continuos de nubes de puntos LiDAR, señales de radar y video de alta definición. Un data lake almacena esta telemetría sin procesar, lo que permite a los ingenieros reproducir escenarios del mundo real para entrenar modelos de Object Detection con el fin de identificar peatones y obstáculos bajo diversas condiciones climáticas.
- Diagnósticos sanitarios: En el medical image analysis moderno, los hospitales consolidan el historial de los pacientes, los datos genómicos y los archivos de imagen (resonancias magnéticas, tomografías computarizadas) en un data lake seguro. Los investigadores pueden acceder a estos datos anónimos y no estructurados para entrenar modelos para la tumor detection o la predicción de enfermedades, utilizando a menudo técnicas de segmentation para aislar regiones de interés dentro de la imaginería médica.
Uso de data lakes con Ultralytics#
Al trabajar con la Ultralytics Platform, los usuarios a menudo extraen subconjuntos de datos sin procesar del data lake de su organización para crear conjuntos de datos anotados para el entrenamiento. Una vez que se recuperan y etiquetan las imágenes sin procesar, se pueden utilizar para entrenar modelos de vanguardia.
El siguiente ejemplo demuestra cómo un desarrollador podría cargar un conjunto de datos local (imitando una recuperación de un data lake) para entrenar el modelo YOLO26 para una tarea de detección.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Train the model using a dataset configuration file
# In a production pipeline, this data might be streamed or downloaded
# from a cloud-based data lake prior to this step.
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)
# Run inference on a new image to verify performance
predictions = model("https://ultralytics.com/images/bus.jpg")





