Dataset Bias
Découvre les causes du biais des jeux de données en IA et apprends à atténuer les distorsions. Découvre comment utiliser l’Ultralytics Platform et Ultralytics YOLO26 pour améliorer l’équité.
Le biais des données survient lorsque les informations utilisées pour entraîner les modèles d’apprentissage automatique (ML) contiennent des erreurs systématiques ou des distributions déséquilibrées, ce qui amène le système d’IA résultant à favoriser certains résultats au détriment d’autres. Comme les modèles fonctionnent comme des moteurs de reconnaissance de formes, ils dépendent entièrement de leurs données d’entrée ; si les données d’entraînement ne reflètent pas fidèlement la diversité de l’environnement réel, le modèle héritera de ces angles morts. Ce phénomène entraîne souvent une mauvaise généralisation : une IA peut obtenir de très bons scores pendant les tests, mais échouer largement une fois déployée pour l’inférence en temps réel dans des scénarios variés ou inattendus.
Sources courantes de biais dans les données#
Le biais peut s’infiltrer dans un jeu de données à plusieurs étapes du cycle de développement, et découle souvent de décisions humaines prises lors de la collecte ou de l’annotation.
- Biais de sélection : Ce biais apparaît lorsque les données collectées ne représentent pas aléatoirement la population cible. Par exemple, créer un jeu de données de reconnaissance faciale à partir d’images majoritairement consacrées à des célébrités peut orienter le modèle vers le maquillage prononcé et l’éclairage professionnel, ce qui l’amène à échouer sur des images prises avec une webcam ordinaire.
- Erreurs d’étiquetage : La subjectivité lors de l’étiquetage des données peut introduire des préjugés humains. Si les annotateurs classent systématiquement mal des objets ambigus en raison de directives peu claires, le modèle considère ces erreurs comme la vérité terrain.
- Biais de représentation : Même lorsque la sélection est aléatoire, les groupes minoritaires peuvent être statistiquement noyés par la classe majoritaire. En détection d’objets, un jeu de données contenant 10 000 images de voitures, mais seulement 100 images de vélos, produira un modèle biaisé en faveur de la détection des voitures.
Applications et conséquences dans le monde réel#
L’impact du biais des données est important dans divers secteurs, en particulier lorsque des systèmes automatisés prennent des décisions lourdes de conséquences ou interagissent avec le monde physique.
Dans l’industrie automobile, l’IA dans l’automobile s’appuie sur des caméras pour identifier les piétons et les obstacles. Si une voiture autonome est entraînée principalement sur des données collectées dans des régions au climat ensoleillé et sec, ses performances peuvent se dégrader lorsqu’elle circule sous la neige ou une forte pluie. Il s’agit d’un exemple classique où la distribution d’entraînement ne correspond pas à la distribution opérationnelle, ce qui entraîne des risques pour la sécurité.
De même, dans l’analyse d’images médicales, les modèles de diagnostic sont souvent entraînés sur des données historiques de patients. Si un modèle conçu pour détecter des affections cutanées est entraîné sur un jeu de données dominé par des teints clairs, il peut afficher une [précision](https://ultralytics-translation-1.invalid nettement inférieure lors du diagnostic de patients ayant la peau plus foncée. Pour y remédier, il faut s’efforcer de constituer des jeux de données diversifiés afin de garantir l’équité de l’IA pour tous les groupes démographiques.
Stratégies d’atténuation#
Les développeurs peuvent réduire le biais des données en appliquant des audits rigoureux et des stratégies d’entraînement avancées. Des techniques telles que l’augmentation des données contribuent à équilibrer les jeux de données en créant artificiellement des variantes d’exemples sous-représentés (par exemple, en les retournant, en les faisant pivoter ou en ajustant leur luminosité). De plus, la génération de données synthétiques peut combler les lacunes lorsque les données du monde réel sont rares ou difficiles à collecter.
La gestion efficace de ces jeux de données est essentielle. La plateforme Ultralytics permet aux équipes de visualiser la distribution des classes et d’identifier les déséquilibres avant le début de l’entraînement. En outre, le respect de directives telles que le cadre de gestion des risques liés à l’IA du NIST aide les organisations à structurer systématiquement leur approche pour identifier et atténuer ces risques.
Biais des données et concepts associés#
Il est utile de distinguer le biais des données de termes similaires afin de comprendre l’origine de l’erreur :
- Par rapport au biais algorithmique : Le biais des données est centré sur les données ; il signifie que les « ingrédients » sont défectueux. Le biais algorithmique est centré sur le modèle ; il découle de la conception de l’algorithme lui-même ou de l’algorithme d’optimisation, qui peut donner la priorité aux classes majoritaires afin de maximiser les métriques globales au détriment des groupes minoritaires.
- Par rapport à la dérive du modèle : Le biais des données est un problème statique présent au moment de l’entraînement. La dérive du modèle (ou dérive des données) survient lorsque les données du monde réel changent au fil du temps après le déploiement du modèle, ce qui nécessite une surveillance continue du modèle.
Exemple de code : augmentation pour réduire le biais#
L’exemple suivant montre comment appliquer l’augmentation des données pendant l’entraînement avec YOLO26. En augmentant les transformations géométriques, le modèle apprend à mieux généraliser, ce qui peut réduire le biais envers certaines orientations ou positions d’objets présentes dans le jeu de données d’entraînement.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)








