Training Data
Erfahre, wie Trainingsdaten KI-Modelle antreiben. Entdecke die Beschaffung und Annotation von Daten sowie das Training von Ultralytics YOLO26 für höhere Genauigkeit bei Computer-Vision-Aufgaben.
Trainingsdaten sind der ursprüngliche Datensatz, mit dem einem maschinellen Lernmodell beigebracht wird, Muster zu erkennen, Vorhersagen zu treffen oder bestimmte Aufgaben auszuführen. Sie dienen als grundlegendes Lehrbuch für Systeme der künstlichen Intelligenz und liefern die Ground Truth, die der Algorithmus analysiert, um seine internen Parameter anzupassen. Beim überwachten Lernen bestehen Trainingsdaten aus Eingabebeispielen mit den jeweils zugehörigen Ausgabelabels, sodass das Modell die Beziehung zwischen beiden erlernen kann. Die Qualität, Menge und Vielfalt dieser Daten beeinflussen direkt die spätere Genauigkeit des Modells und seine Fähigkeit, auf neue, bisher unbekannte Informationen zu generalisieren.
Die Rolle von Trainingsdaten in der KI#
Die wichtigste Funktion von Trainingsdaten besteht darin, den Fehler zwischen den Vorhersagen des Modells und den tatsächlichen Ergebnissen zu minimieren. Während des Trainingsprozesses des Modells verarbeitet der Algorithmus die Daten iterativ und identifiziert Merkmale – etwa Kanten in einem Bild oder Schlüsselwörter in einem Satz –, die mit bestimmten Labels korrelieren. Dieser Prozess unterscheidet sich von Validierungsdaten, die während des Trainings zur Abstimmung der Hyperparameter verwendet werden, und von Testdaten, die für die abschließende Bewertung der Modellleistung reserviert sind.
Hochwertige Trainingsdaten müssen repräsentativ für die realen Szenarien sein, mit denen das Modell konfrontiert wird. Wenn der Datensatz Verzerrungen enthält oder es ihm an Vielfalt mangelt, kann das Modell unter Overfitting leiden: Es merkt sich die Trainingsbeispiele, erzielt aber bei neuen Eingaben keine guten Ergebnisse. Umgekehrt tritt Underfitting auf, wenn die Daten zu einfach oder unzureichend sind, sodass das Modell die zugrunde liegenden Muster nicht erfassen kann.
Anwendungen in der Praxis#
Trainingsdaten ermöglichen Innovationen in nahezu jeder Branche, indem sie Systemen erlauben, aus historischen Beispielen zu lernen.
- KI im Gesundheitswesen: In der medizinischen Diagnostik können Trainingsdaten aus Tausenden von Röntgenbildern bestehen, die entweder als „gesund“ oder mit bestimmten Erkrankungen wie einer Lungenentzündung gekennzeichnet sind. Durch die Verarbeitung dieser gekennzeichneten Beispiele können Modelle wie Ultralytics YOLO26 Radiologen unterstützen, indem sie potenzielle Auffälligkeiten mit hoher Präzision hervorheben und so die Diagnosezeiten erheblich verkürzen.
- Autonome Fahrzeuge: Selbstfahrende Autos sind auf riesige Datensätze mit Millionen von gefahrenen Kilometern angewiesen. Diese Trainingsdaten enthalten annotierte Einzelbilder mit Fußgängern, Verkehrsschildern, anderen Fahrzeugen und Fahrbahnmarkierungen. Diese aus umfassenden Bibliotheken wie dem Waymo Open Dataset oder nuScenes stammenden Informationen bringen dem Wahrnehmungssystem des Fahrzeugs bei, komplexe Umgebungen sicher zu navigieren.
Daten beschaffen und verwalten#
Die Beschaffung robuster Trainingsdaten ist oft der anspruchsvollste Teil eines maschinellen Lernprojekts. Daten können aus öffentlichen Repositorien wie Google Dataset Search oder aus spezialisierten Sammlungen wie COCO für die Objekterkennung stammen. Rohdaten erfordern jedoch häufig eine sorgfältige Datenbereinigung und Annotation, um ihre Genauigkeit sicherzustellen.
Tools wie die Ultralytics Platform haben diesen Arbeitsablauf vereinfacht und bieten eine integrierte Umgebung zum Hochladen, Labeln und Verwalten von Datensätzen. Eine effektive Verwaltung umfasst auch die Datenerweiterung, eine Technik, mit der die Größe des Trainingssatzes künstlich erhöht wird, indem vorhandene Bilder transformiert werden – etwa durch Spiegeln, Drehen oder Anpassen der Farben. Dadurch werden Modelle robuster gegenüber Schwankungen in den Eingabedaten.
Praktisches Beispiel mit Ultralytics YOLO26#
Das folgende Python-Beispiel zeigt, wie das Training mit der Bibliothek ultralytics gestartet wird. Dabei wird ein vortrainiertes YOLO26-Modell anhand des COCO8-Datensatzes feinabgestimmt, einem kleinen Datensatz zur Überprüfung von Trainingspipelines.
from ultralytics import YOLO
# Load a pre-trained YOLO26n model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 5 epochs
# The 'data' argument specifies the dataset configuration file
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)Die Bedeutung der Datenqualität#
Das Sprichwort „Garbage in, garbage out“ ist für maschinelles Lernen grundlegend. Selbst die anspruchsvollsten Architekturen, etwa Transformer oder tiefe faltungsneuronale Netze (CNNs), können unzureichende Trainingsdaten nicht ausgleichen. Probleme wie Labelrauschen, bei dem die Ground-Truth-Labels falsch sind, können die Leistung erheblich beeinträchtigen. Daher sind strenge Qualitätssicherungsprozesse, die häufig eine Verifizierung durch Menschen im Prozess umfassen, unerlässlich, um die Integrität des Datensatzes zu wahren.
Darüber hinaus erfordert die Einhaltung der Grundsätze der KI-Ethik, dass Trainingsdaten auf demografische oder sozioökonomische Verzerrungen geprüft werden. Die Gewährleistung von Fairness in der KI beginnt mit einem ausgewogenen und repräsentativen Trainingsdatensatz, der dazu beiträgt, diskriminierende Ergebnisse in bereitgestellten Anwendungen zu verhindern.









