Data Lake
Explora cómo los lagos de datos sirven de base para la IA y el ML. Aprende a aprovechar datos sin procesar para entrenar Ultralytics YOLO26 y agilizar los flujos de trabajo de visión por ordenador.
Un lago de datos es un repositorio de almacenamiento centralizado que contiene una gran cantidad de datos sin procesar en su formato nativo hasta que se necesitan. A diferencia de los sistemas de almacenamiento tradicionales, que requieren estructurar los datos antes de incorporarlos, un lago de datos acepta los datos «tal cual», incluidos datos estructurados (filas y columnas), datos semiestructurados (CSV, registros, XML, JSON), datos no estructurados (correos electrónicos, documentos, PDF) y datos binarios (imágenes, audio y vídeo). Esta flexibilidad arquitectónica convierte a los lagos de datos en un pilar fundamental de las estrategias modernas de Big Data, especialmente para las organizaciones que utilizan Inteligencia Artificial (AI) y aprendizaje automático (ML). Al desacoplar la captura de datos de su uso, las organizaciones pueden almacenar grandes volúmenes de información a un coste relativamente bajo y determinar más adelante las preguntas específicas que desean analizar.
El papel de los lagos de datos en la Inteligencia Artificial y el aprendizaje automático#
En el contexto del desarrollo de la Inteligencia Artificial, el valor principal de un lago de datos reside en su capacidad para admitir flujos de trabajo de aprendizaje profundo (DL). Las redes neuronales avanzadas necesitan datos de entrenamiento diversos y abundantes para alcanzar una gran precisión. Un lago de datos actúa como entorno de preparación donde se almacenan recursos sin procesar, como millones de imágenes de alta resolución para la visión artificial (CV) o miles de horas de audio para el reconocimiento de voz, antes de procesarlos.
Los científicos de datos utilizan metodologías de «esquema al leer» en los lagos de datos. Esto significa que la estructura se aplica a los datos únicamente cuando se leen para procesarlos, en lugar de cuando se escriben en el almacenamiento. Esto permite una enorme agilidad: el mismo conjunto de datos sin procesar se puede procesar de varias formas para distintas tareas de modelado predictivo sin modificar la fuente original. Además, los lagos de datos robustos suelen integrarse con servicios de computación en la nube, como Amazon S3 o Azure Blob Storage, lo que permite el procesamiento paralelo y escalable necesario para entrenar modelos exigentes como YOLO26.
Lago de datos frente a almacén de datos#
Aunque a menudo se confunden, un lago de datos es distinto de un almacén de datos. Un almacén de datos guarda los datos en tablas estructuradas y está optimizado para realizar consultas SQL rápidas y generar informes de inteligencia empresarial. Utiliza el «esquema al escribir», lo que significa que los datos deben limpiarse y transformarse mediante un proceso de extracción, transformación y carga (ETL) antes de incorporarse al sistema.
Por el contrario, un lago de datos está optimizado para el volumen y la variedad de almacenamiento. Admite el aprendizaje no supervisado y el análisis exploratorio, cuyo objetivo puede no estar definido todavía. Por ejemplo, un almacén de datos podría indicarte cuántos productos se vendieron el mes pasado, mientras que un lago de datos contiene los registros sin procesar del sentimiento de los clientes y los datos de imagen que ayudan a un modelo de Inteligencia Artificial a comprender por qué se vendieron.
Aplicaciones en el mundo real#
Los lagos de datos son fundamentales en diversos sectores que llevan la automatización al límite:
- Vehículos autónomos: desarrollar tecnología de conducción autónoma requiere procesar petabytes de datos de sensores. Los vehículos autónomos generan flujos continuos de nubes de puntos de LiDAR, señales de radar y vídeo de alta definición. Un lago de datos almacena esta telemetría sin procesar y permite a los ingenieros reproducir situaciones del mundo real para entrenar modelos de detección de objetos que identifiquen peatones y obstáculos en distintas condiciones meteorológicas.
- Diagnóstico sanitario: en el análisis de imágenes médicas moderno, los hospitales consolidan el historial de los pacientes, los datos genómicos y los archivos de imagen (MRI, CT) en un lago de datos seguro. A continuación, los investigadores pueden acceder a estos datos anonimizados y no estructurados para entrenar modelos de detección de tumores o predicción de enfermedades, utilizando a menudo técnicas de segmentación para aislar regiones de interés en las imágenes médicas.
Uso de lagos de datos con Ultralytics#
Al trabajar con la plataforma Ultralytics, los usuarios suelen extraer subconjuntos de datos sin procesar del lago de datos de su organización para crear conjuntos de datos anotados destinados al entrenamiento. Una vez recuperadas y etiquetadas las imágenes sin procesar, se pueden utilizar para entrenar modelos de última generación.
El siguiente ejemplo muestra cómo un desarrollador podría cargar un conjunto de datos local (que simula la extracción de datos de un lago de datos) para entrenar el modelo YOLO26 en una tarea de detección.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Train the model using a dataset configuration file
# In a production pipeline, this data might be streamed or downloaded
# from a cloud-based data lake prior to this step.
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)
# Run inference on a new image to verify performance
predictions = model("https://ultralytics.com/images/bus.jpg")








