Data Cleaning
Beherrsche die Datenbereinigung, um die Genauigkeit von AI-Modellen zu verbessern. Lerne Techniken kennen, um Fehler zu entfernen, fehlende Werte zu behandeln und saubere Datensätze für Ultralytics YOLO26 vorzubereiten.
Datenbereinigung ist der entscheidende Prozess zur Erkennung und Korrektur (oder Entfernung) beschädigter, ungenauer oder irrelevanter Datensätze aus einer Datensammlung, Tabelle oder Datenbank. Im Bereich der künstlichen Intelligenz (AI) und des maschinellen Lernens (ML) gilt dieser Schritt häufig als der zeitaufwändigste und zugleich wichtigste Teil des Arbeitsablaufs. Bevor ein Modell wie YOLO26 Objekte zuverlässig erkennen kann, müssen die Trainingsdaten von Fehlern bereinigt werden, um das Phänomen „Garbage In, Garbage Out“ zu verhindern, bei dem Eingaben schlechter Qualität zu unzuverlässigen Ausgaben führen.
Die Bedeutung der Datenintegrität in der künstlichen Intelligenz#
Leistungsstarke Modelle für Computer Vision sind in hohem Maße auf die Qualität der von ihnen verarbeiteten Datensätze angewiesen. Enthält ein Datensatz falsch beschriftete Bilder, Duplikate oder beschädigte Dateien, fällt es dem Modell schwer, Muster zu verallgemeinern, was zu Overfitting oder einer schlechten Inferenzgenauigkeit führen kann. Eine effektive Datenbereinigung verbessert die Zuverlässigkeit von Vorhersagemodellen und stellt sicher, dass der Algorithmus aus gültigen Signalen statt aus Rauschen lernt.
Gängige Techniken zur Datenbereinigung#
Fachleute setzen verschiedene Strategien ein, um ihre Datensätze zu verfeinern, und verwenden dafür Tools wie pandas für tabellarische Daten oder spezielle Werkzeuge für Computer Vision.
- Umgang mit fehlenden Werten: Dabei werden entweder Datensätze mit fehlenden Daten entfernt oder Imputationstechniken verwendet, um Lücken auf Grundlage statistischer Mittelwerte oder der nächstgelegenen Nachbarn zu füllen.
- Entfernen von Duplikaten: Doppelte Bilder in einem Trainingsdatensatz können das Modell unbeabsichtigt verzerren. Durch ihre Entfernung wird verhindert, dass sich das Modell bestimmte Beispiele einprägt, und der Datensatz-Bias kann so verringert werden.
- Erkennung von Ausreißern: Das Erkennen und Behandeln von Anomalien oder Ausreißern, die erheblich von der Norm abweichen, ist entscheidend, da sie statistische Analysen und Modellgewichte verzerren können.
- Strukturelle Korrektur: Dazu gehört die Behebung von Tippfehlern in Klassenbezeichnungen (z. B. die Korrektur von „Car“ zu „car“), um Konsistenz bei Klassenbezeichnungen sicherzustellen.
Anwendungen in der Praxis#
Datenbereinigung ist in verschiedenen Branchen, in denen künstliche Intelligenz eingesetzt wird, von zentraler Bedeutung.
- Analyse medizinischer Bilder: In Anwendungen künstlicher Intelligenz im Gesundheitswesen enthalten Datensätze häufig Aufnahmen mit Artefakten, falschen Patientenmetadaten oder irrelevanten Hintergrundstörungen. Die Bereinigung dieser Daten stellt sicher, dass sich Modelle für die Analyse medizinischer Bilder ausschließlich auf die für die Diagnose relevanten biologischen Marker konzentrieren.
- Verwaltung von Einzelhandelsbeständen: Bei künstlicher Intelligenz im Einzelhandel können Produktdatensätze veraltete Artikel oder Bilder mit falschen Seitenverhältnissen enthalten. Durch die Bereinigung dieser Datensätze können Modelle zur Objekterkennung Bestandsmengen genau erkennen und Fehlalarme in einer Live-Umgebung reduzieren.
Datenbereinigung und Vorverarbeitung im Vergleich#
Obwohl die Begriffe häufig synonym verwendet werden, unterscheidet sich die Datenbereinigung von der Datenvorverarbeitung. Die Datenbereinigung konzentriert sich darauf, Fehler zu beheben und „schlechte“ Daten zu entfernen. Bei der Vorverarbeitung werden saubere Daten dagegen in ein für das Modell geeignetes Format umgewandelt, etwa durch Ändern der Bildgröße, Normalisierung oder das Anwenden von Datenerweiterung, um die Vielfalt zu erhöhen.
Automatisierung von Qualitätsprüfungen#
Moderne Arbeitsabläufe, wie sie auf der Ultralytics Platform verfügbar sind, integrieren automatisierte Prüfungen, um beschädigte Bilder oder Inkonsistenzen bei Beschriftungen zu erkennen, bevor das Training beginnt. Das folgende einfache Python-Beispiel zeigt, wie sich beschädigte Bilddateien mit der standardmäßigen Pillow-Bibliothek überprüfen und erkennen lassen – ein üblicher Schritt, bevor Daten in ein Modell wie YOLO26 eingespeist werden.
from pathlib import Path
from PIL import Image
def verify_images(dataset_path):
"""Iterates through a directory to identify corrupt images."""
for img_path in Path(dataset_path).glob("*.jpg"):
try:
with Image.open(img_path) as img:
img.verify() # Checks file integrity
except (OSError, SyntaxError):
print(f"Corrupt file found: {img_path}")
# Run verification on your dataset
verify_images("./coco8/images/train")








