Dataset Bias
Explora las causas del sesgo en los datasets en la IA y aprende a mitigar el sesgo. Descubre cómo usar la Plataforma Ultralytics y Ultralytics YOLO26 para mejorar la equidad.
El sesgo de datos se produce cuando la información utilizada para entrenar modelos de machine learning (ML) contiene errores sistemáticos o distribuciones sesgadas, lo que lleva a que el sistema de IA resultante favorezca ciertos resultados sobre otros. Debido a que los modelos funcionan como motores de reconocimiento de patrones, dependen por completo de sus entradas; si los datos de entrenamiento no reflejan con precisión la diversidad del entorno del mundo real, el modelo heredará estos puntos ciegos. Este fenómeno a menudo da como resultado una generalización deficiente, donde una IA puede obtener puntuaciones altas durante las pruebas, pero falla significativamente cuando se implementa para la inferencia en tiempo real en escenarios diversos o inesperados.
Fuentes comunes de sesgo en los datos#
El sesgo puede infiltrarse en un conjunto de datos en varias etapas del ciclo de vida de desarrollo, originándose con frecuencia a partir de decisiones humanas durante la recopilación o el etiquetado.
- Sesgo de selección: Esto surge cuando los datos recopilados no representan de forma aleatoria a la población objetivo. Por ejemplo, crear un conjunto de datos de reconocimiento facial utilizando predominantemente imágenes de celebridades puede sesgar el modelo hacia un maquillaje pesado y una iluminación profesional, provocando que falle en imágenes cotidianas de cámara web.
- Errores de etiquetado: La subjetividad durante el etiquetado de datos puede introducir prejuicios humanos. Si los anotadores clasifican erróneamente de manera constante objetos ambiguos debido a la falta de directrices claras, el modelo trata estos errores como verdad de referencia.
- Sesgo de representación: Incluso si se seleccionan de forma aleatoria, los grupos minoritarios pueden quedar estadísticamente eclipsados por la clase mayoritaria. En la detección de objetos, un conjunto de datos con 10 000 imágenes de coches pero solo 100 imágenes de bicicletas dará como resultado un modelo sesgado hacia la detección de coches.
Aplicaciones y consecuencias en el mundo real#
El impacto del sesgo en los conjuntos de datos es significativo en diversas industrias, especialmente donde los sistemas automatizados toman decisiones de gran repercusión o interactúan con el mundo físico.
En la industria de la automoción, la IA en la automoción se basa en cámaras para identificar peatones y obstáculos. Si un coche autónomo se entrena principalmente con datos recopilados en climas soleados y secos, puede mostrar una degradación del rendimiento al operar en nieve o lluvia intensa. Este es un ejemplo clásico de cómo la distribución de entrenamiento no coincide con la distribución operativa, lo que conlleva riesgos de seguridad.
De igual manera, en el análisis de imágenes médicas, los modelos de diagnóstico suelen entrenarse con datos históricos de pacientes. Si un modelo diseñado para detectar afecciones cutáneas se entrena con un conjunto de datos dominado por tonos de piel más claros, puede demostrar una precisión significativamente menor al diagnosticar a pacientes con pieles más oscuras. Abordar esto requiere un esfuerzo concertado para seleccionar conjuntos de datos diversos que garanticen la equidad en la IA en todos los grupos demográficos.
Estrategias de mitigación#
Los desarrolladores pueden reducir el sesgo de datos empleando auditorías rigurosas y estrategias de entrenamiento avanzadas. Técnicas como la aumento de datos ayudan a equilibrar los conjuntos de datos creando artificialmente variaciones de ejemplos subrepresentados (por ejemplo, voltear, rotar o ajustar el brillo). Además, generar datos sintéticos puede cubrir vacíos donde los datos del mundo real son escasos o difíciles de recopilar.
Gestionar estos conjuntos de datos de forma eficaz es fundamental. La Ultralytics Platform permite a los equipos visualizar distribuciones de clases e identificar desequilibrios antes de que comience el entrenamiento. Además, adherirse a directrices como el marco de gestión de riesgos de IA del NIST ayuda a las organizaciones a estructurar su enfoque para identificar y mitigar estos riesgos de manera sistemática.
Sesgo en los conjuntos de datos frente a conceptos relacionados#
Es útil distinguir el sesgo en los conjuntos de datos de otros términos similares para comprender dónde se origina el error:
- Frente al sesgo algorítmico: El sesgo de datos está centrado en los datos; implica que los "ingredientes" son defectuosos. El sesgo algorítmico está centrado en el modelo; surge del diseño del propio algoritmo o del algoritmo de optimización, el cual podría priorizar las clases mayoritarias para maximizar las métricas generales a expensas de los grupos minoritarios.
- Frente a la deriva del modelo: El sesgo de datos es un problema estático presente en el momento del entrenamiento. La deriva del modelo (o deriva de datos) ocurre cuando los datos del mundo real cambian con el tiempo después de que el modelo se ha implementado, lo que requiere un monitoreo de modelos continuo.
Ejemplo de código: Aumentación para reducir el sesgo#
El siguiente ejemplo demuestra cómo aplicar el aumento de datos durante el entrenamiento con YOLO26. Al incrementar las aumentaciones geométricas, el modelo aprende a generalizar mejor, lo que potencialmente reduce el sesgo hacia orientaciones o posiciones específicas de objetos encontradas en el conjunto de entrenamiento.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)





