Synthetic Data
Entdecke, wie synthetische Daten AI und Machine Learning voranbringen. Erfahre, wie du hochwertige Datensätze für Ultralytics YOLO26 erzeugst, um die Modellgenauigkeit zu steigern.
Synthetische Daten sind künstlich erzeugte Informationen, die die statistischen Eigenschaften, Muster und strukturellen Merkmale realer Daten nachahmen. In den sich rasant entwickelnden Bereichen der künstlichen Intelligenz (AI) und des maschinellen Lernens (ML) dienen diese Daten als wichtige Ressource, wenn die Erfassung authentischer Daten teuer und zeitaufwendig ist oder durch Datenschutzbestimmungen eingeschränkt wird. Anders als organische Daten, die aus Ereignissen der realen Welt gewonnen werden, werden synthetische Daten mithilfe von Verfahren wie Computersimulationen und fortschrittlichen generativen Modellen algorithmisch erstellt. Branchenanalysten von Gartner prognostizieren, dass synthetische Daten bis 2030 in KI-Modellen echte Daten übertreffen werden, wodurch sich die Entwicklung und Bereitstellung intelligenter Systeme grundlegend verändern wird.
Die Rolle synthetischer Daten bei der Entwicklung von KI#
Der wichtigste Grund für die Nutzung synthetischer Datensätze besteht darin, die Einschränkungen herkömmlicher Datenerfassung und -annotierung zu überwinden. Für das Training robuster Computer-Vision (CV)-Modelle sind häufig riesige Datensätze mit vielfältigen Szenarien erforderlich. Wenn reale Daten knapp sind – etwa bei der Diagnose seltener Krankheiten oder bei gefährlichen Verkehrsunfällen in ungewöhnlichen Grenzfällen –, schließen synthetische Daten diese Lücke.
Durch die Erzeugung dieser Daten können Entwickler bei Bedarf perfekt annotierte Trainingsdaten erstellen. Dazu gehören präzise Begrenzungsrahmen für die Objekterkennung oder pixelgenaue Masken für die semantische Segmentierung, wodurch menschliche Fehler vermieden werden, die bei der manuellen Annotation häufig auftreten. Darüber hinaus wirken synthetische Daten dem Bias in der KI entgegen, da Ingenieure Datensätze gezielt mit unterrepräsentierten Gruppen oder Umweltbedingungen ausbalancieren können, um eine fairere Modellleistung sicherzustellen.
Anwendungen in der Praxis#
Synthetische Daten revolutionieren Branchen, in denen Datenschutz, Sicherheit und Skalierbarkeit von entscheidender Bedeutung sind.
- Simulationen für autonomes Fahren: Das ausschließliche Testen autonomer Fahrzeuge in der physischen Welt ist riskant und geografisch begrenzt. Unternehmen nutzen fotorealistische Simulatoren wie NVIDIA Omniverse, um ihre Wahrnehmungssysteme zu trainieren. Diese Simulatoren erzeugen Milliarden virtueller Kilometer und setzen die KI gefährlichen Wetterbedingungen, unberechenbarem Verhalten von Fußgängern und komplexen städtischen Umgebungen aus, die in der realen Welt nur schwer konsistent erfasst werden können.
- Gesundheitswesen und medizinische Bildgebung: Datenschutzgesetze für Patientendaten wie HIPAA und die DSGVO (GDPR) regeln die Weitergabe medizinischer Unterlagen streng. Synthetische Daten ermöglichen die Erstellung realistischer Datensätze für die Analyse medizinischer Bilder – etwa von Röntgen- oder MRT-Aufnahmen –, die pathologische Merkmale bewahren, ohne personenbezogene Informationen zu enthalten. So können Forschende gemeinsam Modelle zur Tumorerkennung trainieren, ohne die Vertraulichkeit der Patientendaten zu gefährden.
Synthetische Daten für KI zur Bildverarbeitung erzeugen#
Die Erstellung hochwertiger synthetischer Daten erfolgt häufig über zwei zentrale Ansätze: Simulations-Engines und generative KI. Simulations-Engines wie die Unity Engine nutzen 3D-Grafiken, um Szenen mit physikbasierten Lichtverhältnissen und Texturen zu rendern. Alternativ lernen generative Modelle wie generative gegnerische Netzwerke (GANs) und Diffusionsmodelle die Verteilung realer Daten, um neue fotorealistische Beispiele zu synthetisieren.
Sobald ein synthetischer Datensatz erstellt wurde, kann er zum Trainieren leistungsstarker Modelle verwendet werden. Das folgende Python-Beispiel zeigt, wie du ein Modell – das möglicherweise mit synthetischen Daten trainiert wurde – mithilfe des Pakets ultralytics laden kannst, um eine Inferenz auf einem Bild durchzuführen.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable generation for superior accuracy)
model = YOLO("yolo26n.pt")
# Run inference on a source image (this could be a synthetic validation image)
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results to verify model performance
results[0].show()Synthetische Daten im Vergleich zur Datenerweiterung#
Es ist hilfreich, synthetische Daten von der Datenerweiterung zu unterscheiden, da beide Verfahren Datensätze vergrößern sollen, aber unterschiedlich funktionieren.
- Bei der Datenerweiterung werden Transformationen wie Spiegeln, Drehen, Zuschneiden oder Farbanpassungen auf bereits vorhandene Bilder aus der realen Welt angewendet, um geringfügige Variationen zu erzeugen. Sie basiert auf der ursprünglichen Datenquelle.
- Bei synthetischen Daten werden mithilfe von Algorithmen oder Simulationen vollständig neue Dateninstanzen von Grund auf erstellt. Für jede Ausgabe ist nicht zwingend ein Originalbild erforderlich, sodass Szenarien erzeugt werden können, die noch nie von einer Kamera erfasst wurden.
Moderne Arbeitsabläufe auf der Ultralytics Platform kombinieren häufig beide Ansätze: Synthetische Daten schließen Lücken im Datensatz, während während des Trainings eine Datenerweiterung angewendet wird, um die Robustheit von Modellen wie YOLO26 zu maximieren.









