Data Cleaning
Domina la limpieza de datos para mejorar la precisión de los modelos de IA. Aprende técnicas para eliminar errores, gestionar valores ausentes y preparar conjuntos de datos limpios para Ultralytics YOLO26.
La limpieza de datos es el proceso crítico de detectar y corregir (o eliminar) registros dañados, inexactos o irrelevantes de un conjunto de registros, una tabla o una base de datos. En el ámbito de la inteligencia artificial (AI) y el aprendizaje automático (ML), este paso suele considerarse la parte más laboriosa, pero también esencial, del flujo de trabajo. Antes de que un modelo como YOLO26 pueda aprender eficazmente a reconocer objetos, los datos de entrenamiento deben depurarse para eliminar errores y evitar el fenómeno «Basura entra, basura sale», en el que una entrada de baja calidad produce resultados poco fiables.
La importancia de la integridad de los datos en la inteligencia artificial#
Los modelos de alto rendimiento de visión artificial dependen en gran medida de la calidad de los conjuntos de datos que consumen. Si un conjunto de datos contiene imágenes mal etiquetadas, duplicados o archivos dañados, el modelo tendrá dificultades para generalizar patrones, lo que puede provocar sobreajuste o una precisión de inferencia deficiente. Una limpieza de datos eficaz mejora la fiabilidad de los modelos predictivos y garantiza que el algoritmo aprenda de señales válidas en lugar de ruido.
Técnicas habituales de limpieza de datos#
Los profesionales emplean diversas estrategias para perfeccionar sus conjuntos de datos mediante herramientas como pandas para datos tabulares o herramientas especializadas de visión.
- Gestión de valores ausentes: consiste en eliminar los registros con datos ausentes o utilizar técnicas de imputación para completar los huecos basándose en promedios estadísticos o en los vecinos más cercanos.
- Eliminación de duplicados: las imágenes duplicadas en un conjunto de entrenamiento pueden sesgar involuntariamente el modelo. Eliminarlas garantiza que el modelo no memorice ejemplos concretos y ayuda a mitigar el sesgo del conjunto de datos.
- Detección de valores atípicos: identificar y gestionar anomalías o valores atípicos que se desvían significativamente de la norma es crucial, ya que pueden distorsionar el análisis estadístico y los pesos del modelo.
- Reparación estructural: incluye corregir errores tipográficos en las etiquetas de clase (p. ej., corregir «Car» frente a «car») para garantizar la coherencia de las clases.
Aplicaciones en el mundo real#
La limpieza de datos es fundamental en diversos sectores en los que se implementa la inteligencia artificial.
- Análisis de imágenes médicas: en las aplicaciones de inteligencia artificial en el sector sanitario, los conjuntos de datos suelen contener exploraciones con artefactos, metadatos incorrectos de los pacientes o ruido de fondo irrelevante. La limpieza de estos datos garantiza que los modelos de análisis de imágenes médicas se centren exclusivamente en los marcadores biológicos relevantes para el diagnóstico.
- Gestión del inventario minorista: en la inteligencia artificial aplicada al comercio minorista, los conjuntos de datos de productos pueden contener artículos obsoletos o imágenes con relaciones de aspecto incorrectas. La limpieza de estos conjuntos de datos garantiza que los modelos de detección de objetos puedan identificar con precisión los niveles de existencias y reducir los falsos positivos en un entorno en tiempo real.
Diferencias entre la limpieza y el preprocesamiento de datos#
Aunque a menudo se utilizan indistintamente, la limpieza de datos es distinta del preprocesamiento de datos. La limpieza de datos se centra en corregir errores y eliminar datos «malos». En cambio, el preprocesamiento consiste en transformar datos limpios a un formato adecuado para el modelo, por ejemplo mediante el redimensionado de imágenes, la normalización o la aplicación de aumento de datos para aumentar la variedad.
Automatización de las comprobaciones de calidad#
Los flujos de trabajo modernos, como los disponibles en Ultralytics Platform, integran comprobaciones automatizadas para identificar imágenes dañadas o incoherencias en las etiquetas antes de que comience el entrenamiento. A continuación se muestra un ejemplo sencillo en Python que demuestra cómo comprobar e identificar archivos de imagen dañados mediante la biblioteca Pillow estándar, un paso habitual antes de introducir los datos en un modelo como YOLO26.
from pathlib import Path
from PIL import Image
def verify_images(dataset_path):
"""Iterates through a directory to identify corrupt images."""
for img_path in Path(dataset_path).glob("*.jpg"):
try:
with Image.open(img_path) as img:
img.verify() # Checks file integrity
except (OSError, SyntaxError):
print(f"Corrupt file found: {img_path}")
# Run verification on your dataset
verify_images("./coco8/images/train")








