Dataset Bias
Explora las causas del sesgo en los conjuntos de datos de IA y aprende a mitigar las desviaciones. Descubre cómo usar Ultralytics Platform y Ultralytics YOLO26 para mejorar la equidad.
El sesgo del conjunto de datos se produce cuando la información utilizada para enseñar a los modelos de aprendizaje automático (ML) contiene errores sistemáticos o distribuciones sesgadas, lo que lleva al sistema de IA resultante a favorecer determinados resultados frente a otros. Como los modelos funcionan como motores de reconocimiento de patrones, dependen por completo de sus datos de entrada; si los datos de entrenamiento no reflejan con precisión la diversidad del entorno real, el modelo heredará estos puntos ciegos. Este fenómeno suele dar lugar a una mala generalización, por la que una IA puede obtener puntuaciones altas durante las pruebas, pero fallar considerablemente cuando se implementa para la inferencia en tiempo real en escenarios diversos o inesperados.
Fuentes habituales del sesgo de los datos#
El sesgo puede infiltrarse en un conjunto de datos en varias etapas del ciclo de vida del desarrollo, y suele deberse a decisiones humanas durante la recopilación o la anotación.
- Sesgo de selección: Se produce cuando los datos recopilados no representan aleatoriamente a la población objetivo. Por ejemplo, crear un conjunto de datos de reconocimiento facial utilizando principalmente imágenes de famosos puede sesgar el modelo hacia el maquillaje intenso y la iluminación profesional, haciendo que falle con imágenes cotidianas de cámaras web.
- Errores de etiquetado: La subjetividad durante el etiquetado de datos puede introducir prejuicios humanos. Si los anotadores clasifican sistemáticamente de forma incorrecta objetos ambiguos por falta de directrices claras, el modelo trata estos errores como verdad de referencia.
- Sesgo de representación: Aunque se seleccionen aleatoriamente, los grupos minoritarios pueden quedar estadísticamente eclipsados por la clase mayoritaria. En la detección de objetos, un conjunto de datos con 10.000 imágenes de coches, pero solo 100 imágenes de bicicletas, dará lugar a un modelo sesgado hacia la detección de coches.
Aplicaciones y consecuencias en el mundo real#
El impacto del sesgo del conjunto de datos es significativo en diversos sectores, especialmente cuando los sistemas automatizados toman decisiones de alto riesgo o interactúan con el mundo físico.
En el sector de la automoción, la IA en automoción depende de cámaras para identificar peatones y obstáculos. Si un coche autónomo se entrena principalmente con datos recopilados en climas soleados y secos, su rendimiento puede degradarse al funcionar con nieve o lluvia intensa. Este es un ejemplo clásico de cómo la distribución de entrenamiento no coincide con la distribución operativa, lo que genera riesgos para la seguridad.
Del mismo modo, en el análisis de imágenes médicas, los modelos de diagnóstico suelen entrenarse con datos históricos de pacientes. Si un modelo diseñado para detectar afecciones cutáneas se entrena con un conjunto de datos dominado por tonos de piel claros, puede mostrar una precisión considerablemente menor al diagnosticar a pacientes con tonos de piel oscuros. Para abordar este problema, es necesario un esfuerzo coordinado para seleccionar conjuntos de datos diversos que garanticen la equidad en la IA entre todos los grupos demográficos.
Estrategias de mitigación#
Los desarrolladores pueden reducir el sesgo del conjunto de datos mediante auditorías rigurosas y estrategias de entrenamiento avanzadas. Técnicas como el aumento de datos ayudan a equilibrar los conjuntos de datos al crear artificialmente variaciones de ejemplos infrarrepresentados (por ejemplo, volteándolos, girándolos o ajustando su brillo). Además, generar datos sintéticos puede cubrir carencias cuando los datos del mundo real son escasos o difíciles de recopilar.
Gestionar estos conjuntos de datos de forma eficaz es fundamental. Ultralytics Platform permite a los equipos visualizar las distribuciones de las clases e identificar desequilibrios antes de que comience el entrenamiento. Además, seguir directrices como el Marco de gestión de riesgos de IA del NIST ayuda a las organizaciones a estructurar sistemáticamente su enfoque para identificar y mitigar estos riesgos.
Sesgo del conjunto de datos frente a conceptos relacionados#
Es útil distinguir el sesgo del conjunto de datos de términos similares para comprender dónde se origina el error:
- Frente al sesgo algorítmico: El sesgo del conjunto de datos se centra en los datos; implica que los «ingredientes» son defectuosos. El sesgo algorítmico se centra en el modelo; surge del diseño del propio algoritmo o del algoritmo de optimización, que puede priorizar las clases mayoritarias para maximizar las métricas generales a costa de los grupos minoritarios.
- Frente a la deriva del modelo: El sesgo del conjunto de datos es un problema estático presente en el momento del entrenamiento. La deriva del modelo (o deriva de los datos) se produce cuando los datos del mundo real cambian con el tiempo después de implementar el modelo, lo que requiere una supervisión continua del modelo.
Ejemplo de código: aumento para reducir el sesgo#
El siguiente ejemplo muestra cómo aplicar el aumento de datos durante el entrenamiento con YOLO26. Al aumentar los aumentos geométricos, el modelo aprende a generalizar mejor, lo que puede reducir el sesgo hacia orientaciones o posiciones específicas de los objetos presentes en el conjunto de entrenamiento.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)








