Test Data
Entdecke die wichtige Rolle von Testdaten im Machine Learning. Erfahre, wie du die Leistung von Ultralytics YOLO26 mit unverzerrten Datensätzen bewertest, um Genauigkeit in der Praxis sicherzustellen.
Testdaten sind eine spezifische Teilmenge eines größeren Datensatzes, die ausschließlich für die Bewertung der endgültigen Leistung eines maschinellen Lernmodells (ML) reserviert ist. Anders als Daten, die während der früheren Lernphasen verwendet werden, bleiben Testdaten für den Algorithmus bis zum Ende des Entwicklungszyklus vollständig „unbekannt“. Diese Trennung ist entscheidend, da sie eine unvoreingenommene Bewertung ermöglicht, wie gut ein Modell zur computergestützten Bildverarbeitung (CV) oder ein anderes KI-System auf neue Eingaben aus der realen Welt verallgemeinert. Durch die Simulation einer Produktionsumgebung hilft Testdaten Entwicklern zu überprüfen, ob ihr Modell tatsächlich zugrunde liegende Muster gelernt hat, anstatt lediglich die Trainingsbeispiele auswendig zu lernen.
Die Rolle von Testdaten im Lebenszyklus des maschinellen Lernens#
Im standardmäßigen Workflow des maschinellen Lernens werden Daten typischerweise in drei klar voneinander unterschiedene Kategorien aufgeteilt, die jeweils einem bestimmten Zweck dienen. Das Verständnis der Unterschiede zwischen diesen Aufteilungen ist entscheidend für die Entwicklung robuster Systeme der künstlichen Intelligenz (AI).
- Trainingsdaten: Dies ist der größte Teil des Datensatzes und wird verwendet, um das Modell zu trainieren. Der Algorithmus passt seine internen Parameter, also die Gewichte, iterativ an, um Fehler in dieser spezifischen Beispielsammlung zu minimieren.
- Validierungsdaten: Diese Teilmenge wird während des Trainingsprozesses regelmäßig verwendet, um Hyperparameter abzustimmen und Entscheidungen über die Architektur zu treffen. Sie dient als Zwischenprüfung, um Überanpassung zu verhindern, bei der ein Modell bei Trainingsdaten gute Ergebnisse erzielt, bei neuen Daten jedoch versagt.
- Testdaten: Dies ist die abschließende „Prüfung“ für das Modell. Sie werden niemals zum Aktualisieren von Gewichten oder Abstimmen von Einstellungen verwendet. Die Bewertung anhand von Testdaten liefert definitive Leistungskennzahlen wie Genauigkeit, Recall und mittlere durchschnittliche Präzision (mAP), anhand derer Stakeholder entscheiden, ob ein Modell für die Bereitstellung des Modells bereit ist.
Die korrekte Verwaltung dieser Aufteilungen wird häufig durch Tools wie die Ultralytics Platform unterstützt. Sie kann hochgeladene Datensätze automatisch in diese wichtigen Kategorien organisieren und so eine sorgfältige Modellbewertung gewährleisten.
Die Bedeutung einer unvoreingenommenen Bewertung#
Der wichtigste Wert von Testdaten liegt in ihrer Fähigkeit, Verzerrungen in Datensätzen und Probleme mit der Varianz zu erkennen. Wenn ein Modell bei Trainingsdaten eine Genauigkeit von 99 %, bei Testdaten jedoch nur 60 % erreicht, deutet dies auf eine hohe Varianz hin (Überanpassung). Eine schlechte Leistung bei beiden Datensätzen deutet dagegen auf Unteranpassung hin.
Die Verwendung eines festgelegten Testsatzes entspricht den wissenschaftlichen Prinzipien der Reproduzierbarkeit und Objektivität. Ohne einen unverfälschten Testsatz besteht für Entwickler das Risiko, „auf den Test hin zu trainieren“ und dadurch Informationen aus der Bewertungsphase zurück in die Trainingsphase gelangen zu lassen – ein als Datenleck bekanntes Phänomen. Dies führt zu übermäßig optimistischen Leistungsschätzungen, die zusammenbrechen, wenn das Modell mit Daten aus der realen Welt konfrontiert wird.
Anwendungen in der Praxis#
Testdaten sind in allen Branchen, in denen KI eingesetzt wird, unverzichtbar, um die Sicherheit und Zuverlässigkeit von Systemen vor ihrer Inbetriebnahme zu gewährleisten.
- Autonomes Fahren: Bei der Entwicklung autonomer Fahrzeuge können die Trainingsdaten aus Millionen auf Autobahnen bei klarem Wetter gefahrenen Kilometern bestehen. Die Testdaten müssen dagegen seltene und anspruchsvolle Szenarien enthalten – etwa starken Schneefall, plötzlich auftauchende Hindernisse oder verwirrende Verkehrsschilder –, die das Fahrzeug während des Trainings noch nie ausdrücklich „gesehen“ hat. So wird sichergestellt, dass das System zur Objekterkennung in unvorhersehbaren Umgebungen sicher reagieren kann.
- Medizinische Diagnostik: Bei der Entwicklung eines Modells zur Tumorerkennung in medizinischen Bildern kann der Trainingssatz aus der Datenbank eines bestimmten Krankenhauses stammen. Um zu überprüfen, ob das Modell robust und für die allgemeine Verwendung sicher ist, sollten die Testdaten idealerweise Aufnahmen aus verschiedenen Krankenhäusern umfassen, die mit unterschiedlichen Geräten erstellt wurden und eine vielfältige Patientengruppe repräsentieren. Diese externe Validierung bestätigt, dass die KI nicht auf einen bestimmten Gerätetyp oder eine bestimmte Bevölkerungsgruppe ausgerichtet ist.
Leistung mit Code bewerten#
Mit dem Paket ultralytics kannst du die Leistung eines Modells ganz einfach anhand eines zurückgehaltenen Datensatzes bewerten. Während der Modus val häufig zur Validierung während des Trainings verwendet wird, kann er auch so konfiguriert werden, dass er auf einer bestimmten Testaufteilung ausgeführt wird, die in deiner YAML-Konfiguration des Datensatzes definiert ist.
So bewertest du ein vortrainiertes YOLO26-Modell, um Kennzahlen wie mAP50-95 zu erhalten:
from ultralytics import YOLO
# Load a pre-trained YOLO26 model
model = YOLO("yolo26n.pt")
# Evaluate the model's performance on the validation set
# (Note: In a strict testing workflow, you would point 'data'
# to a YAML that defines a specific 'test' split and use split='test')
metrics = model.val(data="coco8.yaml")
# Print a specific metric, e.g., mAP at 50-95% IoU
print(f"Mean Average Precision (mAP50-95): {metrics.box.map}")Dieser Prozess erzeugt umfassende Kennzahlen, mit denen Entwickler verschiedene Architekturen wie YOLO26 im Vergleich zu YOLO11 objektiv vergleichen und sicherstellen können, dass die ausgewählte Lösung die definierten Ziele des Projekts erfüllt. Sorgfältige Tests sind der abschließende Kontrollschritt, um sicherzustellen, dass hohe Standards für die KI-Sicherheit eingehalten werden.









