Was sind synthetische Daten in Computer Vision? Ein Überblick
Entdecke, wie synthetische Daten zum Training von KI-Modellen in Computer-Vision-Anwendungen verschiedener Branchen wie dem Gesundheitswesen und der Robotik eingesetzt werden.

Daten waren schon immer ein entscheidender Faktor in Bereichen wie Datenanalyse und künstlicher Intelligenz (AI). Tatsächlich prägt die Art und Weise, wie wir Daten erfassen, erzeugen und nutzen, die Zukunft intelligenter Systeme. Selbstfahrende Autos sind beispielsweise auf Millionen annotierter Bilder und Sensordaten angewiesen – von Verkehrsschildern bis hin zu Bewegungen von Fußgängern –, um zu lernen, wie sie sicher auf Straßen navigieren.
Eine der wichtigsten Datenarten, die diesen Fortschritt vorantreiben, insbesondere in Bereichen wie autonomen Fahrzeugen und Sicherheit, sind visuelle Daten wie Bilder und Videos.
Insbesondere wird der Bereich der AI, der Maschinen die Interpretation dieser visuellen Informationen ermöglicht, als Computer Vision bezeichnet. Er hilft Systemen, visuelle Eingaben ähnlich wie Menschen zu verstehen und zu analysieren, und unterstützt Aufgaben wie Gesichtserkennung, die Erkennung von Verkehrsschildern und die Analyse medizinischer Bilder.
Die Erfassung umfangreicher, hochwertiger visueller Datensätze aus der realen Welt kann jedoch zeitaufwendig und kostspielig sein und wirft häufig Datenschutzbedenken auf. Deshalb untersuchen Forschende aktiv das Konzept der Nutzung synthetischer Daten.
Synthetische Daten sind künstlich erzeugte visuelle Daten, die realen Bildern und Videos sehr ähnlich sind. Sie werden mit Techniken wie 3D-Modellierung, Computersimulationen und Methoden der generativen AI wie Generative Adversarial Networks (GANs) erstellt, die Muster aus realen Daten lernen, um realistische neue Beispiele zu erzeugen.
Synthetische Daten werden voraussichtlich schon bald eine entscheidende Rolle bei der Entwicklung von AI spielen – Gartner prognostiziert, dass sie bis 2030 wichtiger als Daten aus der realen Welt sein werden. In diesem Artikel untersuchen wir, was synthetische Daten im Kontext von Computer Vision sind, wie sie erzeugt werden und wo sie in realen Szenarien zum Einsatz kommen. Legen wir los!
Was sind synthetische Daten im Bereich Computer Vision?#
Angenommen, du möchtest ein Vision-AI-Modell trainieren, das Objekte in unterschiedlichen Umgebungen und unter verschiedenen Bedingungen erkennt. Sich ausschließlich auf Daten aus der realen Welt zu stützen, kann schwierig sein und sich manchmal einschränkend anfühlen.
Synthetische Daten können dagegen genutzt werden, um den passenden Datensatz mit Objekten unter verschiedenen künstlich erzeugten Bedingungen zu erstellen. Mit Werkzeugen wie 3D-Modellierung und Simulationen können Entwickler Bilder erzeugen und dabei Faktoren wie Beleuchtung, Blickwinkel und Objektplatzierung präzise steuern. Das bietet beim Modelltraining mehr Flexibilität als Daten aus der realen Welt.
Synthetische Daten sind besonders hilfreich, wenn die Erfassung realer Daten schwierig oder unmöglich ist. Um beispielsweise ein Modell darauf zu trainieren, Menschen in einer Vielzahl von Körperhaltungen wie beim Laufen, Hocken oder Liegen zu erkennen, müssten Tausende Fotos in vielen verschiedenen Umgebungen, aus unterschiedlichen Blickwinkeln und unter verschiedenen Lichtbedingungen aufgenommen werden.
Mit synthetischen Daten können Entwickler diese Varianten dagegen problemlos mit präzisen Annotationen erzeugen, wodurch sie Zeit und Aufwand sparen und gleichzeitig die Modellleistung verbessern.

Abb. 1. Ein synthetischer Datensatz mit unterschiedlichen menschlichen Körperhaltungen und Beleuchtungsvarianten (Quelle).
Synthetische Daten im Vergleich zu realen Daten in der AI#
Sehen wir uns als Nächstes die Unterschiede zwischen synthetischen und realen Daten genauer an. Beide haben beim Training von AI-Modellen ihre Vor- und Nachteile.
Synthetische Daten sind beispielsweise nützlich, wenn reale Daten schwer zu erfassen sind, erfassen aber möglicherweise nicht jedes noch so kleine Detail des wirklichen Lebens. Reale Daten sind hingegen authentischer, können jedoch schwer zu beschaffen und zeitaufwendig zu annotieren sein und decken möglicherweise nicht jede Situation ab.
Durch die Kombination synthetischer und realer Daten können Entwickler die Vorteile beider Ansätze nutzen. Dieses Gleichgewicht hilft AI-Modellen, genauer zu lernen, besser auf verschiedene Szenarien zu generalisieren und Verzerrungen zu reduzieren.

Abb. 2. Synthetische Daten im Vergleich zu realen Daten in der AI. Abbildung des Autors.
Datenerzeugung für Computer-Vision-Modelle im Überblick#
Von der Erstellung virtueller Welten mit 3D-Werkzeugen bis zur Bilderzeugung mit generativer AI – hier sind einige gängige Methoden zur Erstellung synthetischer Trainingsdaten für Computer-Vision-Modelle:
- 3D-Modellierung: Entwickler verwenden 3D-Software, um digitale Objekte und Szenen zu erstellen. Dadurch lassen sich Aspekte wie Beleuchtung, Kamerawinkel und Objektplatzierung vollständig steuern, was bei der Erzeugung realistischer Bilder von Menschen, Fahrzeugen und Umgebungen hilfreich ist.
- Simulationen: Sie bilden reale Situationen wie Verkehr oder Fabrikumgebungen mithilfe physikbasierter Engines nach. Simulationen eignen sich dazu, Trainingsdaten in Bereichen wie Robotik und autonomem Fahren sicher zu erzeugen.
- Generative Adversarial Networks: GANs sind eine Art Deep-Learning-Modell, das aus zwei Netzwerken besteht: eines erzeugt Bilder, das andere bewertet sie. Gemeinsam erzeugen sie durch das Lernen aus realen Beispielen äußerst realistische Bilder, etwa von menschlichen Gesichtern oder Straßenansichten.
- Prozedurale Erzeugung: Diese Technik nutzt vordefinierte Regeln oder mathematische Modelle, um automatisch komplexe visuelle Strukturen wie Gelände, Gebäude oder Texturen zu erzeugen. Sie wird häufig in Spielen und Simulationsplattformen eingesetzt und kann mit minimalem menschlichem Aufwand umfangreiche, vielfältige Datensätze erstellen.
- Domain-Randomisierung: Dabei können Aspekte wie Beleuchtung, Farben und Objektformen in synthetischen Szenen zufällig verändert werden. Ziel dieser Technik ist es, Modellen zu helfen, sich auf das Wesentliche zu konzentrieren und sie dadurch anpassungsfähiger an Umgebungen der realen Welt zu machen.

Abb. 3. Datenbeispiele: (a) 3D-modellbasiert, (b) synthetische Szenen mit mehreren Objekten und (c) Bilder aus einem realen Datensatz (Quelle).
Training von Vision-AI-Modellen mit synthetischen Daten#
Nachdem wir einige der verschiedenen Methoden zur Erstellung synthetischer Daten besprochen haben, sehen wir uns nun an, wie diese Daten zum Training von AI-Modellen eingesetzt werden.
Nach ihrer Erzeugung lassen sich synthetische Daten in der Regel genauso wie Daten aus der realen Welt direkt in die Trainingspipeline integrieren. Sie enthalten typischerweise die erforderlichen Annotationen wie Objektbezeichnungen, Begrenzungsrahmen oder Segmentierungsmasken. Dadurch können sie für Aufgaben des überwachten Lernens verwendet werden, bei denen Modelle aus annotierten Eingabe-Ausgabe-Paaren lernen, ohne dass eine manuelle Annotation erforderlich ist.
Während des Trainings verarbeitet das Modell synthetische Bilder, um Merkmale zu erkennen, Muster zu identifizieren und Objekte zu klassifizieren. Diese Daten können verwendet werden, um zunächst ein Modell von Grund auf zu erstellen oder einen vorhandenen Datensatz zu erweitern und so die Modellleistung zu verbessern.
In vielen Arbeitsabläufen werden synthetische Daten außerdem für das Vortraining verwendet, sodass Modelle ein breites grundlegendes Verständnis entwickeln, bevor sie mit Beispielen aus der realen Welt feinabgestimmt werden. Ebenso dienen sie zur Erweiterung von Datensätzen durch kontrollierte Variationen wie unterschiedliche Lichtbedingungen, Blickwinkel oder seltene Objektklassen, um die Generalisierung zu verbessern und Überanpassung zu reduzieren.
Durch die Kombination synthetischer und realer Daten können Teams robustere Modelle trainieren, die unter einer Vielzahl von Bedingungen gute Ergebnisse liefern, und gleichzeitig die Abhängigkeit von zeitaufwendigen und teuren manuellen Datenerfassungen verringern.
Praktische Anwendungen synthetischer Daten in Computer Vision#
Da synthetische Daten zunehmend praxistauglich und zugänglich werden, werden sie in immer mehr realen Anwendungsfällen für Vision AI eingesetzt. Sehen wir uns einige der wirkungsvollsten Anwendungen im Bereich Computer Vision an, in denen sie zum Einsatz kommen.
Synthetische Daten zur Objekterkennung in autonomen Fahrzeugen#
Damit selbstfahrende Autos sicher fahren können, müssen Modelle anhand einer Vielzahl von Szenarien trainiert werden, darunter seltene oder gefährliche Situationen. Die Erfassung realer Daten für solche Grenzfälle kann jedoch schwierig und manchmal unsicher sein. Synthetische Daten können dabei helfen, Szenen zu erstellen, in denen Modelle lernen, Objekte in schwierigen Situationen zu erkennen. Sie können außerdem verschiedene Sensorkonfigurationen nachbilden, was hilfreich ist, da nicht alle selbstfahrenden Autos dieselbe Hardware verwenden.
Die Plattform NVIDIA’s DRIVE Sim ist ein hervorragendes Beispiel dafür. Sie erzeugt hochwertige synthetische Daten mithilfe fotorealistischer 3D-Modelle, virtueller Umgebungen und Sensorsimulationen. Außerdem kann sie aus einem einzigen Bild Aufnahmen aus mehreren Fahrwinkeln erzeugen. Der Einsatz solcher synthetischen Daten reduziert den Bedarf an teuren Tests in der realen Welt und bietet dem Modell dennoch die nötige Vielfalt für effektives Lernen.

Abb. 4. Erstellung mehrerer Fahraufnahmen aus einem Bild (Quelle).
Verzerrungen in der AI für medizinische Bildgebung mit synthetischen Daten reduzieren#
Computer-Vision-Modelle wie Ultralytics YOLO11, die Aufgaben wie Objekterkennung und Instanzsegmentierung unterstützen, können speziell für Anwendungen in der medizinischen Bildgebung trainiert werden. Trainingsdaten aus der realen Welt enthalten jedoch häufig Verzerrungen, da sie Patienten aus nicht allen Bevölkerungsgruppen angemessen repräsentieren.
Beispielsweise wird Hautkrebs bei Menschen mit dunkleren Hauttönen seltener diagnostiziert, was zu einer begrenzten Datenlage für diese Bevölkerungsgruppen führt. Dieses Ungleichgewicht kann zu Fehldiagnosen und einer ungleichen medizinischen Versorgung beitragen, insbesondere in Bereichen wie Histopathologie, Röntgenaufnahmen des Brustkorbs und Dermatologie.
Synthetische Bilder können dazu beitragen, diese Datenlücke schrittweise zu schließen. Durch die Erzeugung zusätzlicher, vielfältiger Beispiele – etwa verschiedener Gewebeveränderungen, eines breiten Spektrums an Lungenerkrankungen und unterschiedlicher Hauttöne mit verschiedenen Läsionstypen – können synthetische Daten die Modellleistung bei unterrepräsentierten Gruppen verbessern.
Forschende arbeiten derzeit daran, synthetische Datensätze zu entwickeln und zu validieren, um diese Ziele zu unterstützen. Außerdem untersuchen sie, wie synthetische Daten zum Testen medizinischer Werkzeuge und Behandlungsstrategien eingesetzt werden können, ohne auf reale Patientenakten zurückzugreifen. So lässt sich die Forschung beschleunigen und gleichzeitig die Privatsphäre der Patienten schützen. Durch diese Arbeit ebnen synthetische Daten den Weg für inklusivere, genauere und ethischere medizinische AI-Systeme.
Landwirtschaftliche AI mit synthetischen Daten für die Präzisionslandwirtschaft voranbringen#
Die Entwicklung von Vision-AI-Systemen für landwirtschaftliche Anwendungen hängt vom Zugang zu großen Mengen annotierter Daten ab. Das Erfassen und Annotieren von Bildern von Nutzpflanzen, Krankheiten und Feldbedingungen ist jedoch langsam, teuer und wird häufig durch Faktoren wie Wetter, Vegetationsperioden oder die schwierige Erreichbarkeit bestimmter Gebiete eingeschränkt.
Diese Herausforderungen erschweren das Training von Computer-Vision-Modellen für Aufgaben wie die Erkennung von Pflanzenkrankheiten, die Überwachung von Nutzpflanzen oder die Ertragsprognose. Hier können synthetische Daten helfen, indem sie verschiedene landwirtschaftliche Umgebungen nachbilden und so nützliche Trainingsbeispiele erzeugen.

Abb. 5. Verwendung synthetischer Bilder zur verbesserten Krankheitserkennung (Quelle).
Wichtige Erkenntnisse#
Die Verwendung synthetischer Daten ist ein wichtiger Schritt beim Training von AI-Modellen, insbesondere für Computer-Vision-Systeme in Bereichen, in denen reale Daten nur begrenzt verfügbar oder schwer zu beschaffen sind. Statt sich ausschließlich auf reale Fotos oder Videos zu stützen, deren Erfassung teuer und zeitaufwendig sein oder Datenschutzbedenken aufwerfen kann, ermöglichen synthetische Daten die bedarfsgerechte Erzeugung realistischer, annotierter Bilder.
Dadurch wird das Training von Vision-AI-Modellen für Aufgaben wie autonomes Fahren, Krankheitserkennung oder die Überwachung von Nutzpflanzen erleichtert. Mit der Weiterentwicklung der AI werden synthetische Daten eine noch größere Rolle dabei spielen, Innovationen zu beschleunigen und den Zugang zu entsprechenden Technologien branchenübergreifend zu verbessern.
Erfahre mehr über AI in unserem GitHub-Repository und werde Teil unserer wachsenden Community. Entdecke die Auswirkungen von Anwendungen wie AI in autonomen Fahrzeugen und Computer Vision in der Landwirtschaft. Informiere dich über unsere Lizenzierungsoptionen und erwecke deine Vision-AI-Projekte zum Leben.









