Dataset Bias
Erfahre mehr über die Ursachen von Datensatzverzerrungen in AI und lerne, wie du Schieflagen minimierst. Entdecke, wie du die Ultralytics Platform und Ultralytics YOLO26 nutzt, um Fairness zu verbessern.
Datensatzverzerrung tritt auf, wenn die Informationen, die zum Trainieren von maschinellen Lernmodellen (ML) verwendet werden, systematische Fehler oder verzerrte Verteilungen enthalten, wodurch das resultierende KI-System bestimmte Ergebnisse gegenüber anderen bevorzugt. Da Modelle als Mustererkennungsmaschinen funktionieren, sind sie vollständig von ihren Eingaben abhängig. Wenn die Trainingsdaten die Vielfalt der realen Umgebung nicht genau widerspiegeln, übernimmt das Modell diese blinden Flecken. Dieses Phänomen führt häufig zu einer schlechten Generalisierung: Eine KI kann beim Testen hohe Werte erzielen, versagt aber erheblich, wenn sie für Echtzeit-Inferenz in vielfältigen oder unerwarteten Szenarien eingesetzt wird.
Häufige Ursachen für Datenverzerrungen#
Verzerrungen können in mehreren Phasen des Entwicklungslebenszyklus in einen Datensatz gelangen und entstehen häufig durch menschliche Entscheidungen bei der Erfassung oder Annotation.
- Auswahlverzerrung: Diese entsteht, wenn die gesammelten Daten die Zielpopulation nicht zufällig repräsentieren. Wird beispielsweise ein Datensatz zur Gesichtserkennung überwiegend mit Bildern von Prominenten erstellt, kann dies das Modell auf starkes Make-up und professionelle Beleuchtung ausrichten, sodass es bei alltäglichen Webcam-Bildern versagt.
- Fehler bei der Beschriftung: Subjektivität bei der Datenbeschriftung kann menschliche Vorurteile einführen. Wenn Annotatoren mehrdeutige Objekte aufgrund fehlender klarer Richtlinien wiederholt falsch klassifizieren, behandelt das Modell diese Fehler als Ground Truth.
- Repräsentationsverzerrung: Selbst bei zufälliger Auswahl können Minderheitengruppen statistisch von der Mehrheitsklasse überlagert werden. Bei der Objekterkennung führt ein Datensatz mit 10.000 Bildern von Autos, aber nur 100 Bildern von Fahrrädern zu einem Modell, das darauf ausgerichtet ist, Autos zu erkennen.
Anwendungen und Folgen in der Praxis#
Die Auswirkungen von Datensatzverzerrungen sind in verschiedenen Branchen erheblich, insbesondere dort, wo automatisierte Systeme Entscheidungen mit weitreichenden Folgen treffen oder mit der physischen Welt interagieren.
In der Automobilbranche ist KI im Automobilbereich auf Kameras angewiesen, um Fußgänger und Hindernisse zu erkennen. Wenn ein autonom fahrendes Auto hauptsächlich mit Daten trainiert wird, die in sonnigen, trockenen Klimazonen erfasst wurden, kann sich seine Leistung bei Schnee oder starkem Regen verschlechtern. Dies ist ein klassisches Beispiel dafür, dass die Trainingsverteilung nicht der Betriebsverteilung entspricht, was zu Sicherheitsrisiken führt.
Auch bei der medizinischen Bildanalyse werden diagnostische Modelle häufig mit historischen Patientendaten trainiert. Wird ein Modell zur Erkennung von Hautkrankheiten mit einem Datensatz trainiert, der von helleren Hauttönen dominiert wird, kann es bei der Diagnose von Patienten mit dunklerer Haut eine deutlich geringere Genauigkeit zeigen. Um dies zu beheben, müssen vielfältige Datensätze sorgfältig zusammengestellt werden, damit Fairness in der KI über alle demografischen Gruppen hinweg gewährleistet ist.
Strategien zur Minderung#
Entwickler können Datensatzverzerrungen durch gründliche Prüfungen und fortschrittliche Trainingsstrategien reduzieren. Techniken wie Datenerweiterung helfen dabei, Datensätze auszugleichen, indem sie künstlich Variationen unterrepräsentierter Beispiele erzeugen, etwa durch Spiegeln, Drehen oder Anpassen der Helligkeit. Darüber hinaus kann die Erstellung synthetischer Daten Lücken schließen, wenn reale Daten knapp oder schwer zu erfassen sind.
Die effektive Verwaltung dieser Datensätze ist entscheidend. Die Ultralytics Platform ermöglicht es Teams, Klassenverteilungen zu visualisieren und Ungleichgewichte zu erkennen, bevor das Training beginnt. Darüber hinaus hilft die Einhaltung von Richtlinien wie dem NIST AI Risk Management Framework Organisationen dabei, ihren Ansatz zur systematischen Erkennung und Minderung dieser Risiken zu strukturieren.
Datensatzverzerrung im Vergleich zu verwandten Konzepten#
Es ist hilfreich, Datensatzverzerrungen von ähnlichen Begriffen zu unterscheiden, um zu verstehen, wo der Fehler entsteht:
- Im Vergleich zu algorithmischer Verzerrung: Datensatzverzerrung ist datenorientiert und bedeutet, dass die „Zutaten“ fehlerhaft sind. Algorithmische Verzerrung ist modellorientiert und entsteht durch das Design des Algorithmus selbst oder des Optimierungsalgorithmus, der möglicherweise Mehrheitsklassen priorisiert, um die Gesamtmetriken zulasten von Minderheitengruppen zu maximieren.
- Im Vergleich zu Modelldrift: Datensatzverzerrung ist ein statisches Problem, das zum Zeitpunkt des Trainings vorhanden ist. Modelldrift (oder Datendrift) tritt auf, wenn sich die realen Daten im Laufe der Zeit nach der Bereitstellung des Modells ändern, wodurch eine kontinuierliche Modellüberwachung erforderlich wird.
Codebeispiel: Datenerweiterung zur Reduzierung von Verzerrungen#
Das folgende Beispiel zeigt, wie du während des Trainings mit YOLO26 eine Datenerweiterung anwendest. Durch die Verstärkung geometrischer Erweiterungen lernt das Modell, besser zu generalisieren, und kann dadurch möglicherweise Verzerrungen gegenüber bestimmten Objektorientierungen oder -positionen im Trainingsdatensatz reduzieren.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)








