YOLO Vision 2026:
Ultralytics YOLO

Erkundung der Datenkennzeichnung für Computer Vision-Projekte

Lies unseren umfassenden Deep Dive zum Thema Datenkennzeichnung für Computer Vision-Projekte und erfahre, wie man visuelle Daten labelt und warum dies so wichtig ist.

ABAbirami Vina4 min read
Datenkennzeichnung für Computer Vision-Projekte

Künstliche Intelligenz (KI) konzentriert sich darauf, Maschinen menschenähnliche Fähigkeiten zu verleihen, und eine der beliebtesten Methoden hierfür ist das überwachte Lernen. Mit anderen Worten: KI-Modellen das Lernen durch das Zeigen beschrifteter Beispiele beizutragen, hilft ihnen, aus Mustern zu lernen und Aufgaben besser zu bewältigen. Dies ist sehr vergleichbar damit, wie Menschen aus Erfahrung lernen. Wie werden diese beschrifteten Beispiele also erstellt?

Die Datenannotation umfasst das Beschriften oder Taggen von Daten, um Algorithmen des maschinellen Lernens das Verständnis zu erleichtern. In der Computer Vision bedeutet dies das Markieren von Bildern oder Videos, um Objekte, Aktionen oder Szenen genau zu erkennen und zu kategorisieren. Die Datenbeschriftung ist von entscheidender Bedeutung, da der Erfolg eines KI-Modells maßgeblich von der Qualität der beschrifteten Daten abhängt, mit denen es trainiert wurde.

Studien zeigen, dass über 80 % der Projektzeit im Bereich KI für die Verwaltung von Daten aufgewendet werden, von der Erfassung und Aggregation bis hin zum Bereinigen und Beschriften. Dies verdeutlicht, wie wichtig die Datenannotation bei der Entwicklung von KI-Modellen ist. Die Verwendung hochwertiger annotierter Daten ermöglicht es KI-Modellen, Aufgaben wie Gesichtserkennung und Objekterkennung in realen Situationen mit größerer Genauigkeit und Zuverlässigkeit auszuführen.

Warum Datenannotation notwendig ist#

Die Datenannotation bildet die Grundlage für die Leistungsfähigkeit eines Computer-Vision-Modells. Beschriftete Daten sind die Ground Truth (Wahrheit), die das Modell zum Lernen und Treffen von Vorhersagen verwendet. Ground-Truth-Daten sind der Schlüssel, da sie die reale Welt darstellen, die das Modell zu verstehen versucht. Ohne diese zuverlässige Basis wäre das KI-Modell wie ein Schiff, das ohne Kompass navigiert.

Ground truth versus prediction

Abb. 1: Ground Truth vs. Vorhersage.

Eine genaue Beschriftung hilft diesen Modellen zu verstehen, was sie sehen, und führt zu einer besseren Entscheidungsfindung. Wenn die Daten unzureichend beschriftet oder inkonsistent sind, hat das Modell Schwierigkeiten, korrekte Vorhersagen und Entscheidungen zu treffen – ganz wie ein Schüler, der aus fehlerhaften Lehrbüchern lernt. Dank annotierter Daten kann ein Modell Aufgaben wie Bildklassifizierung, Instanzsegmentierung und Posenschätzung von Objekten in Bildern und Videos erlernen.

Beste Ressourcen für Datensätze#

Bevor du einen völlig neuen Datensatz erstellst und Bilder sowie Videos akribisch beschriftest, ist es ratsam zu prüfen, ob du bereits vorhandene Datensätze für dein Projekt nutzen kannst. Es gibt mehrere fantastische Open-Source-Repositorys, über die du kostenlos auf hochwertige Datensätze zugreifen kannst. Zu den beliebtesten gehören:

  • ImageNet: Wird häufig zum Trainieren von Bildklassifizierungsmodellen verwendet.
  • COCO: Dieser Datensatz ist für Objekterkennung, Segmentierung und Bildbeschriftung konzipiert.
  • PASCAL VOC: Unterstützt Aufgaben zur Objekterkennung und Segmentierung.

Beispiele für Daten im COCO-Datensatz

Abb. 2: Beispiele für Daten im COCO-Datensatz.

Bei der Auswahl eines Datensatzes ist es wichtig, Faktoren wie die Eignung für dein Projekt, die Größe des Datensatzes, dessen Vielfalt und die Qualität der Labels zu berücksichtigen. Überprüfe außerdem unbedingt die Lizenzbedingungen des Datensatzes, um rechtliche Konsequenzen zu vermeiden, und prüfe, ob die Daten in einem Format vorliegen, das zu deinem Workflow und deinen Tools passt.

Das Erstellen eines benutzerdefinierten Datensatzes ist eine großartige Option, wenn bestehende Datensätze nicht ganz deinen Anforderungen entsprechen. Du kannst Bilder mit Tools wie Webcams, Drohnen oder Smartphones sammeln, je nachdem, was dein Projekt erfordert. Idealerweise sollte dein benutzerdefinierter Datensatz vielfältig, ausgeglichen und wirklich repräsentativ für das Problem sein, das du zu lösen versuchst. Das kann bedeuten, Bilder unter verschiedenen Lichtbedingungen, aus verschiedenen Winkeln und in verschiedenen Umgebungen aufzunehmen.

Wenn du nur eine geringere Anzahl von Bildern oder Videos sammeln kannst, ist Datenaugmentation eine hilfreiche Technik. Sie beinhaltet die Erweiterung deines Datensatzes durch das Anwenden von Transformationen wie Rotation, Spiegelung oder Farbanpassungen auf vorhandene Bilder. Dies vergrößert deinen Datensatz und macht dein Modell robuster sowie widerstandsfähiger gegenüber Abweichungen in den Daten. Durch die Verwendung einer Mischung aus Open-Source-Datensätzen, benutzerdefinierten Datensätzen und augmentierten Daten kannst du die Leistung deiner Computer-Vision-Modelle erheblich steigern.

Arten von Bildannotationstechniken#

Bevor du mit der Annotation von Bildern beginnst, ist es wichtig, mit den verschiedenen Arten von Annotationen vertraut zu sein. Dies hilft dir bei der Auswahl der richtigen Methode für dein Projekt. Als Nächstes schauen wir uns einige der wichtigsten Arten von Annotationen an.

Begrenzungsrahmen#

Bounding Boxes sind die häufigste Art der Annotation in der Computer Vision. Es handelt sich dabei um rechteckige Rahmen, die verwendet werden, um die Position eines Objekts in einem Bild zu markieren. Diese Boxen werden durch die Koordinaten ihrer Ecken definiert und helfen KI-Modellen, Objekte zu identifizieren und zu lokalisieren. Bounding Boxes werden hauptsächlich für die Objekterkennung eingesetzt.

Ein Beispiel für Bounding Boxes

Abb. 3: Ein Beispiel für Bounding Boxes.

Segmentierungsmasken#

Manchmal muss ein Objekt genauer erkannt werden als nur durch eine darum gezogene Bounding Box. Möglicherweise interessierst du dich für die Begrenzung der Objekte in einem Bild. In diesem Fall ermöglichen es dir Segmentierungsmasken, komplexe Objekte zu umreißen. Segmentierungsmasken sind eine detailliertere Darstellung auf Pixelebene.

Diese Masken können für semantische Segmentierung und Instanzsegmentierung verwendet werden. Die semantische Segmentierung umfasst das Beschriften jedes Pixels in einem Bild entsprechend dem Objekt oder Bereich, den es darstellt, wie etwa ein Fußgänger, ein Auto, eine Straße oder ein Gehweg. Die Instanzsegmentierung geht jedoch noch einen Schritt weiter, indem sie jedes Objekt einzeln identifiziert und trennt, wie beispielsweise die Unterscheidung zwischen jedem Auto auf einem Bild, selbst wenn sie alle vom selben Typ sind.

Ein Beispiel für semantische Segmentierung (links) und Instanzsegmentierung (rechts)

Abb. 4: Ein Beispiel für semantische Segmentierung (links) und Instanzsegmentierungsmasken (rechts).

3D-Kuboid#

3D-Quader ähneln Bounding Boxes; was sie einzigartig macht, ist, dass 3D-Quader Tiefeninformationen hinzufügen und eine dreidimensionale Darstellung eines Objekts ermöglichen. Diese zusätzlichen Informationen versetzen Systeme in die Lage, die Form, das Volumen und die Position von Objekten in einem 3D-Raum zu verstehen. 3D-Quader werden häufig in selbstfahrenden Autos eingesetzt, um den Abstand von Objekten zum Fahrzeug zu messen.

Ein Beispiel für 3D-Quader

Abb. 5: Ein Beispiel für 3D-Quader.

Key-Points und Landmarks#

Eine weitere interessante Art der Annotation sind Key-Points, bei denen spezifische Punkte wie Augen, Nasen oder Gelenke an Objekten markiert werden. Landmarks gehen noch einen Schritt weiter, indem sie diese Punkte verbinden, um die Struktur und Bewegung komplexerer Formen wie Gesichter oder Körperhaltungen zu erfassen. Diese Arten von Annotationen werden für Anwendungen wie Gesichtserkennung, Motion Capturing und Augmented Reality verwendet. Sie verbessern zudem die Genauigkeit von KI-Modellen bei Aufgaben wie Gestenerkennung oder der Analyse sportlicher Leistungen.

Ein Beispiel für Key-Points

Abb. 6. Ein Beispiel für Key-Points.

Wie du Daten mit LabelImg annotierst#

Nachdem wir nun die verschiedenen Arten von Annotationen besprochen haben, wollen wir uns ansehen, wie du Bilder mit einem beliebigen Tool wie LabelImg annotieren kannst. LabelImg ist ein Open-Source-Tool, das die Bildannotation vereinfacht und zur Erstellung von Datensätzen im YOLO-Format (You Only Look Once) verwendet werden kann. Es ist eine hervorragende Wahl für Anfänger, die an kleinen Ultralytics YOLOv8-Projekten arbeiten.

Das Einrichten von LabelImg ist unkompliziert. Stelle zunächst sicher, dass Python 3 auf deinem Computer installiert ist. Anschließend kannst du LabelImg mit einem kurzen Befehl installieren:

pip3 install labelImg

Sobald es installiert ist, kannst du das Tool mit dem Befehl starten:

labelImg

LabelImg funktioniert auf mehreren Plattformen, darunter Windows, macOS und Linux. Wenn während der Installation Probleme auftreten, findest du im offiziellen LabelImg-Repository detailliertere Anweisungen.

Verwendung von LabelImg zur Bildannotation

Abb. 7. Verwendung von LabelImg zur Bildannotation.

Sobald du das Tool startest, befolge diese einfachen Schritte, um mit der Kennzeichnung deiner Bilder zu beginnen:

  • Richte deine Klassen ein: Beginne damit, die Liste der Klassen (Kategorien), die du annotieren möchtest, in einer Datei namens „predefined_classes.txt“ zu definieren. Diese Datei teilt der Software mit, welche Objekte du in deinen Bildern kennzeichnen wirst.
  • Wechsle zum YOLO-Format: Standardmäßig verwendet LabelImg das PASCAL VOC-Format, aber wenn du mit YOLO arbeitest, musst du das Format wechseln. Klicke einfach auf die Schaltfläche „PascalVOC“ in der Symbolleiste, um zu YOLO zu wechseln.
  • Starte die Annotation: Verwende die Optionen „Open“ oder „OpenDIR“, um deine Bilder zu laden. Zeichne dann Bounding Boxes um die Objekte, die du annotieren möchtest, und weise das richtige Klassenlabel zu. Speichere nach der Kennzeichnung jedes Bildes deine Arbeit. LabelImg erstellt eine Textdatei mit dem gleichen Namen wie dein Bild, die die YOLO-Annotationen enthält.
  • Speichern und überprüfen: Die Annotationen werden in einer .txt-Datei im YOLO-Format gespeichert. Die Software speichert auch eine „classes.txt“-Datei, die alle deine Klassennamen auflistet.

Effiziente Strategien zur Datenannotation#

Um den Prozess der Datenannotation reibungsloser zu gestalten, gibt es einige wichtige Strategien, die du beachten solltest. Zum Beispiel sind klare Annotationsrichtlinien entscheidend. Ohne sie könnten verschiedene Annotatoren eine Aufgabe unterschiedlich interpretieren.

Nehmen wir an, die Aufgabe besteht darin, Vögel in Bildern mit Bounding Boxes zu annotieren. Ein Annotator könnte den gesamten Vogel markieren, während ein anderer nur den Kopf oder die Flügel markieren könnte. Diese Art von Inkonsistenz kann das Modell während des Trainings verwirren. Durch die Bereitstellung klarer Definitionen, wie etwa „Markiere den gesamten Vogel inklusive Flügeln und Schwanz“, zusammen mit Beispielen und Anweisungen für schwierige Fälle, kannst du sicherstellen, dass die Daten genau und konsistent getaggt werden.

Regelmäßige Qualitätsprüfungen sind ebenfalls wichtig, um hohe Standards aufrechtzuerhalten. Durch das Setzen von Benchmarks und die Verwendung spezifischer Metriken zur Überprüfung der Arbeit kannst du die Datengenauigkeit beibehalten und den Prozess durch kontinuierliches Feedback verfeinern.

Datenannotation kurz und knapp#

Datenannotation ist ein einfaches Konzept, das einen erheblichen Einfluss auf dein Computer-Vision-Modell haben kann. Egal, ob du Tools wie LabelImg verwendest, um Bilder zu annotieren, oder Modelle mit Open-Source-Datensätzen trainierst: Das Verständnis der Datenannotation ist der Schlüssel. Strategien zur Datenannotation können den gesamten Prozess rationalisieren und effizienter machen. Die Zeit, die du investierst, um deinen Annotationsansatz zu verfeinern, kann zu besseren, zuverlässigeren KI-Ergebnissen führen.

Entdecke weiter und erweitere deine Fähigkeiten! Bleibe mit unserer Community in Verbindung, um kontinuierlich etwas über KI zu lernen! Schau dir unser GitHub-Repository an, um zu erfahren, wie wir KI nutzen, um innovative Lösungen in Branchen wie der fertigenden Industrie und im Gesundheitswesen zu entwickeln. 🚀

Explore solutions

Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

Computer Vision im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

Computer Vision in der Automobilindustrie

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

Computer Vision in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens