So automatisiert die Ultralytics Platform Annotationen mithilfe von KI
Entdecke, wie die Ultralytics Platform Annotationen mithilfe von KI automatisiert, große Datensätze verwaltet, die Konsistenz verbessert und die Entwicklung von Computer Vision beschleunigt.

Lösungen für Computer Vision, die Bilder und Videos analysieren, sind in vielen Branchen inzwischen fester Bestandteil der Arbeitsabläufe – von der Fertigung bis zur medizinischen Bildgebung. In der Fertigung hängt beispielsweise das Erkennen von Oberflächenfehlern an Produkten auf einem Förderband von Modellen für Computer Vision ab, die feine Muster erkennen können.
Damit solche Modelle zuverlässig funktionieren, müssen sie mit annotierten Daten trainiert werden, in denen jeder Fehler eindeutig gekennzeichnet ist. So lernen die Modelle, worauf sie achten und wie sie ähnliche Muster erkennen müssen.
Das Erstellen dieser Kennzeichnungen wird als Datenannotation bezeichnet. Bei der Bildannotation und Videoannotation werden insbesondere Begrenzungsrahmen gezeichnet, Formen umrandet oder bestimmte Bereiche in Bildern und Videobildern gekennzeichnet.
Bei kleinen Datensätzen ist das noch gut zu bewältigen, doch mit zunehmender Datenmenge wird es schnell schwieriger. Tausende von Bildern zu kennzeichnen erfordert kontinuierliche manuelle Arbeit und macht die Annotation zu einem erheblichen Engpass. Herkömmliche Tools sind oft langsam, unzusammenhängend und schwer skalierbar.
Die Ultralytics Platform, die All-in-one-Plattform für KI im Bereich Computer Vision, hilft mit KI-gestützter Annotation, diese Herausforderungen zu bewältigen. Sie nutzt KI, um automatisch erste Kennzeichnungen zu erstellen, die sich schnell überprüfen und verfeinern lassen. Dadurch verringert sich der manuelle Aufwand und die Effizienz steigt.
In diesem Artikel zeigen wir, wie KI-gestützte Annotation auf der Ultralytics Platform funktioniert und wie sie den Kennzeichnungsprozess verbessert. Los geht’s!
Ein Überblick über den Datenannotationsprozess#
Bevor wir uns ansehen, wie KI-gestützte Annotation auf der Ultralytics Platform funktioniert, werfen wir zunächst einen genaueren Blick auf die Datenannotation.
Datenannotation, auch Datenkennzeichnung genannt, bezeichnet das Zuweisen strukturierter Kennzeichnungen zu Rohdaten, damit diese zum Trainieren von Machine-Learning-Modellen verwendet werden können. Im Bereich Computer Vision beschreiben diese Kennzeichnungen die interessierenden Objekte, Bereiche oder Merkmale in Bildern und Videos.
Während des Trainings lernen Modelle oder Algorithmen, Eingabedaten diesen Kennzeichnungen zuzuordnen. Deshalb ist die Qualität der Annotation ein entscheidender Faktor für die Modellleistung. Genau und einheitlich annotierte Datensätze ermöglichen es dem Modell, korrekte Muster zu lernen, während ungenaue oder uneinheitliche Annotationen zu unzuverlässigen Vorhersagen führen können.
Bei der Erkennung von Fehlern kann beispielsweise ein Produkt auf einem Förderband annotiert werden, indem die Stellen markiert werden, an denen Fehler auftreten, und die jeweilige Fehlerart gekennzeichnet wird. So lernt das Modell, wie Fehler aussehen, und kann sie in neuen Bildern erkennen.
Ein Überblick über gängige Annotationsaufgaben#
Sehen wir uns als Nächstes einige gängige Methoden zur Bildannotation im Bereich Computer Vision an. Mit diesen Methoden werden visuelle Daten für Aufgaben wie Objekterkennung, Instanzsegmentierung und Bildklassifizierung gekennzeichnet. Jede Annotationsmethode erfüllt einen anderen Zweck, etwa Objekte zu lokalisieren, Formen zu erfassen oder wichtige Strukturen zu erkennen.
Begrenzungsrahmen#
Begrenzungsrahmen sind einfache Rechtecke, die um Objekte in einem Bild gezeichnet werden, um deren Position zu zeigen. Sie gehören zu den gängigsten Methoden, Daten für Computer Vision zu kennzeichnen.
Wenn Objekterkennungsmodelle mit Bildern trainiert werden, die solche Rahmen enthalten, lernen sie, verschiedene Objekte zu erkennen und ihre Position im Bild zu bestimmen. Dadurch können sie mehrere Objekte gleichzeitig erkennen und feststellen, wo sich jedes einzelne befindet.
Stell dir zum Beispiel ein Baseballspiel vor, das mithilfe von Computer Vision analysiert wird. In jedem Videobild können Rahmen um die Spieler, den Schläger und den Ball gezeichnet werden. So kann das Modell diese Objekte während des gesamten Spiels erkennen und identifizieren.

Abb. 1: Mit Begrenzungsrahmen lassen sich mehrere Objekte kennzeichnen und lokalisieren. (Quelle)
Polygone oder Segmentierungsmasken#
Polygone, auch Segmentierungsmasken genannt, gehen über Begrenzungsrahmen hinaus, indem sie Objekte auf Pixelebene kennzeichnen. Statt ein grobes Rechteck zu zeichnen, erfassen sie die exakte Form und die Kanten jedes Objekts in einem Bild. Dadurch eignen sie sich für Aufgaben, die ein detaillierteres Verständnis erfordern.
Beim autonomen Fahren werden Segmentierungsmasken beispielsweise für Aufgaben wie die semantische Segmentierung eingesetzt, bei der jedem Pixel eine Kategorie wie Straße oder Himmel zugewiesen wird, und für die Instanzsegmentierung, bei der einzelne Objekte wie Fahrzeuge oder Fußgänger separat identifiziert werden.
Sie werden auch für Aufgaben wie das Entfernen des Hintergrunds verwendet, bei denen ein Objekt, etwa eine Person, vom Rest des Bildes getrennt werden muss.
Schlüsselpunkte#
Schlüsselpunkte werden verwendet, um bestimmte Punkte auf einem Objekt zu markieren, etwa Gelenke am menschlichen Körper oder Teile eines Tiers. Anhand dieser Punkte können Modelle die Struktur eines Objekts und die Position seiner Teile zueinander verstehen.
In der Computer Vision wird dies als Posenschätzung bezeichnet. Dabei geht es darum, die Position dieser Schlüsselpunkte zu bestimmen und ihre Beziehungen zueinander zu verstehen. Werden diese Punkte im Zeitverlauf verfolgt, lassen sich Bewegungen und Haltungsänderungen analysieren.

Abb. 2: Schlüsselpunktannotationen können Gelenke markieren, um menschliche Posen zu schätzen. (Quelle)
Ein gängiges Beispiel ist das Markieren von Gelenken in einem Video, um menschliche Bewegungen zu analysieren. Indem sie sich auf diese Schlüsselpunkte konzentrieren, können Modelle erfassen, wie eine Person positioniert ist und wie sich ihre Haltung im Zeitverlauf verändert.
Orientierte Begrenzungsrahmen (OBB)#
Nicht alle Objekte in einem Bild sind perfekt ausgerichtet. In vielen Situationen der realen Welt erscheinen Objekte geneigt oder gedreht oder werden aus verschiedenen Blickwinkeln betrachtet.
Herkömmliche Begrenzungsrahmen sind in solchen Fällen oft ungeeignet, da sie unnötige Hintergrundbereiche einschließen oder das Objekt nicht genau umschließen. Orientierte Begrenzungsrahmen lösen dieses Problem mit gedrehten Rechtecken, die an der Ausrichtung des Objekts ausgerichtet sind. Dadurch entstehen engere und genauere Annotationen.
Dieser Ansatz kommt bei der Erkennung mit orientierten Begrenzungsrahmen (OBB) zum Einsatz. Dabei ermitteln Modelle sowohl die Position eines Objekts als auch seine Ausrichtung. Ein Beispiel sind Luftaufnahmen, auf denen Objekte wie Gebäude, Schiffe oder Fahrzeuge häufig in unterschiedlichen Winkeln erscheinen. Gedrehte Rahmen erleichtern es, ihre tatsächliche Form und Ausrichtung in der Szene zu erfassen.
Klassifikationslabels#
Klassifikationslabels unterscheiden sich von anderen Annotationsmethoden: Statt bestimmte Objekte oder Bereiche zu markieren, weisen sie einem ganzen Bild ein einziges Label zu. Sie werden verwendet, wenn es darum geht, den Inhalt eines Bildes zu bestimmen, ohne dessen Position zu berücksichtigen.
Ein Bild kann beispielsweise anhand seines Gesamtinhalts als „Katze“ oder „Hund“ gekennzeichnet werden. Dadurch eignet sich die Bildklassifizierung für Aufgaben, bei denen ein allgemeines Verständnis des Bildes ausreicht.
Einschränkungen herkömmlicher Annotationswerkzeuge#
Viele herkömmliche Kennzeichnungswerkzeuge beruhen auf mehreren Schritten und voneinander getrennten Abläufen. Entwicklungsteams für KI müssen häufig zwischen verschiedenen Annotationsplattformen für Kennzeichnung, Speicherung und Validierung wechseln, was KI-Projekte verlangsamt.
Die meisten Werkzeuge unterstützen nur eine begrenzte Auswahl an Annotationstypen und Datentypen. Daher verwenden Teams oft unterschiedliche Werkzeuge für Begrenzungsrahmen, Segmentierung und Schlüsselpunkte. Diese fragmentierte Einrichtung kann schwierig zu verwalten sein, insbesondere für Teams, die neu im Bereich Computer Vision sind.
Der manuelle Aufwand ist eine weitere große Herausforderung. Auch wenn die Annotation eines einzelnen Bildes nur wenige Minuten dauern kann, wird die Arbeit mit großen Datensätzen schnell zeitaufwendig, besonders wenn ähnliche Bilder wiederkehrende Aufgaben erfordern.
Mit wachsenden Datensätzen müssen Teams außerdem Dateien verwalten, Dataset-Versionen nachverfolgen und die Einheitlichkeit der Annotationen sicherstellen. Das erhöht den Arbeitsaufwand: Es bleibt weniger Zeit für die Verbesserung der Modellleistung, weil mehr Zeit in die Datenverwaltung fließt.
Effizienter ist es, KI-gestützte Annotationen auf der Ultralytics Platform zu verwenden. Die Plattform nutzt KI, um Labels zu erstellen und zu verfeinern, und reduziert so den manuellen Aufwand bei höherer Geschwindigkeit und Einheitlichkeit. Dataset-Verwaltung, Annotation, Modelltraining, Bereitstellung und Überwachung sind dabei in einer einzigen Umgebung vereint.
So unterstützt die Ultralytics Platform den Annotationsprozess#
Die Ultralytics Platform vereinfacht die Annotation, indem sie diese direkt in den übrigen Arbeitsablauf der Computer Vision einbindet. Statt auf separate Werkzeuge angewiesen zu sein, können Teams mit Daten, Annotationen und Modellen in einer einzigen Umgebung arbeiten.
Die Plattform unterstützt eine Reihe von Computer-Vision-Aufgaben, darunter Objekterkennung, Bildklassifizierung, Instanzsegmentierung, Posenschätzung und die Erkennung mit orientierten Begrenzungsrahmen.
In diesem Rahmen gibt es mehrere Möglichkeiten zur Annotation. Teams können Daten manuell kennzeichnen und so die volle Kontrolle behalten, SAM-gestützte intelligente Annotation für interaktive, punktbasierte Kennzeichnung verwenden oder mit YOLO-gestützter intelligenter Annotation automatisch Annotationen erstellen lassen, die anschließend überprüft und verfeinert werden können. Diese Flexibilität erleichtert die Arbeit mit unterschiedlichen Datensätzen und Annotationsanforderungen.

Abb. 3: Einblick in die Annotation auf der Ultralytics Platform (Quelle)
Da KI-gestützte und manuelle Annotation in die Dataset-Verwaltung und das Modelltraining integriert sind, können Teams nahtlos von der Datenkennzeichnung zur Organisation von Datensätzen und zum Training von Modellen übergehen. So bleiben Arbeitsabläufe strukturiert und der Wechsel zwischen Werkzeugen oder die Neuformatierung von Annotationen entfällt.
Die Plattform unterstützt außerdem Ultralytics-YOLO-Modelle wie Ultralytics YOLO11 und Ultralytics YOLO26. Dadurch können annotierte Daten direkt zum Training und Testen verwendet werden. So lassen sich Lücken in Datensätzen leichter erkennen, Annotationen verfeinern und Modelle durch kontinuierliche Iteration erneut trainieren.
Wichtige Funktionen der SAM-gestützten intelligenten Annotation auf der Ultralytics Platform#
Die SAM-gestützte intelligente Annotation auf der Ultralytics Platform wurde entwickelt, um Annotationen für Aufgaben der Objekterkennung, Instanzsegmentierung und der Erkennung mit orientierten Begrenzungsrahmen (OBB) zu beschleunigen.
Die Plattform bietet mehrere Varianten von SAM-Modellen, darunter SAM 2.1 Tiny, SAM 2.1 Small, SAM 2.1 Base, SAM 2.1 Large und SAM 3. So können Nutzerinnen und Nutzer zwischen Geschwindigkeit und Genauigkeit abwägen.

Abb. 4: SAM-gestützte intelligente Annotation auf der Ultralytics Platform (Quelle)
Kleinere Modelle wie Tiny und Small sind schneller und eignen sich gut für zügige Annotationsabläufe, während größere Modelle wie Large und SAM 3 bei komplexeren Szenen eine höhere Genauigkeit bieten. Ein Modellwechsel ändert das Verhalten der Annotation sofort.
Sobald im Annotationseditor ein SAM-Modell ausgewählt ist, können menschliche Annotierende in den Smart-Modus wechseln und mit der Kennzeichnung beginnen. Statt Formen manuell zu zeichnen, wird das Modell mit einfachen punktbasierten Eingaben gesteuert.
Ein Linksklick fügt einen positiven Punkt hinzu, um einen Bereich einzuschließen, während ein Rechtsklick einen negativen Punkt zum Ausschließen unerwünschter Bereiche hinzufügt. Anhand dieser Eingaben erstellt das Modell in Echtzeit eine präzise Maske.
Um den Arbeitsablauf zu beschleunigen, kannst du den Modus für die automatische Anwendung aktivieren. Ist er aktiv, erstellt jeder Klick automatisch eine Annotation und speichert sie, ohne dass eine manuelle Bestätigung erforderlich ist. Bei komplexeren Objekten können Annotierende entweder "Shift" gedrückt halten, um mehrere Punkte zu setzen, bevor die Maske angewendet wird, oder die automatische Anwendung deaktivieren, um beliebig Punkte hinzuzufügen und anschließend "Enter" zu drücken, um die Maske anzuwenden.
Die intelligente YOLO-Annotation auf der Ultralytics Platform verstehen#
Ähnlich wie die SAM-gestützte intelligente Annotation nutzt die intelligente YOLO-Annotation auf der Ultralytics Platform KI, um den Kennzeichnungsprozess zu beschleunigen. Statt das Modell mit Klicks zu steuern, verwendet sie Modellvorhersagen, um automatisch Annotationen zu erstellen.
Dieser Ansatz unterstützt Aufgaben wie Objekterkennung, Instanzsegmentierung und Annotation mit orientierten Begrenzungsrahmen (OBB). Er funktioniert speziell mit Ultralytics-YOLO-Modellen, darunter von Ultralytics bereitgestellte vortrainierte Modelle und individuell trainierte YOLO-Modelle.
Im Annotationseditor können Annotierende in den Smart-Modus wechseln, im Modellauswahlmenü ein YOLO-Modell auswählen und auf Predict klicken. Das Modellauswahlmenü zeigt nur YOLO-Modelle an, die zur aktuellen Dataset-Aufgabe passen. So ist sichergestellt, dass die erstellten Annotationen kompatibel sind.
Das Modell analysiert das Bild und erstellt anhand seiner Vorhersagen Annotationen, die direkt zum Bild hinzugefügt werden. Überschneiden sich Vorhersagen mit bereits vorhandenen Annotationsergebnissen derselben Klasse, werden doppelte Erkennungen automatisch übersprungen, wenn die Überschneidung einen festgelegten Schwellenwert überschreitet. So bleiben die Labels sauber und einheitlich.

Abb. 5: Intelligente Annotation mit Ultralytics-YOLO-Modellen auf der Ultralytics Platform (Quelle)
Sobald Vorhersagen erstellt wurden, können menschliche Annotierende im Regelkreis sie überprüfen, anpassen oder bei Bedarf entfernen. So lassen sich große Datensätze schneller kennzeichnen: Statt alles manuell zu annotieren, beginnt man mit den vom Modell erstellten Annotationen und verfeinert sie.
Im Laufe der Zeit lassen sich verbesserte YOLO-Modelle erneut verwenden, um bessere Vorhersagen zu erstellen und einen iterativen Arbeitsablauf zur automatischen Kennzeichnung zu unterstützen.
KI-gestützte Kennzeichnung in realen Arbeitsabläufen einsetzen#
Sehen wir uns nun Beispiele dafür an, wie die Ultralytics Platform die Datenannotation in realen Anwendungsfällen unterstützt.
Segmentierung beim autonomen Fahren#
Autonome Fahrzeuge, die mit Computer-Vision-Modellen ausgestattet sind, benötigen gut annotierte Bilddaten, um ihre Umgebung in Echtzeit zu verstehen. Mit diesen Daten trainierte Modelle können Fahrzeuge, Fußgänger, Verkehrsschilder und Straßenbegrenzungen erkennen und segmentieren.
Segmentierungsaufgaben erfordern präzise Begrenzungen auf Pixelebene, weshalb die Annotation sowohl entscheidend als auch zeitaufwendig ist. Die manuelle Kennzeichnung großer Mengen an Sensordaten kann schnell zum Engpass werden, besonders bei komplexen Fahrszenen.
Die Ultralytics Platform optimiert diesen Prozess durch KI-gestützte Annotation mit SAM- und YOLO-Modellen. Die SAM-gestützte intelligente Annotation ermöglicht eine schnelle, klickbasierte Segmentierung mit präzisen Masken, während sich mit YOLO-Modellen automatisch Annotationen für Bilder erstellen lassen.
Zusammen erleichtern diese Ansätze den Umgang mit komplexen Szenen, in denen sich Objekte überschneiden.
Da die Annotation direkt mit dem Modelltraining verknüpft ist, können aktualisierte, umfangreiche Datensätze sofort zum erneuten Trainieren und Bewerten von Modellen verwendet werden. So können Teams die Leistung kontinuierlich verbessern und sich effizienter an neue Fahrbedingungen anpassen.
Qualitätssicherungssysteme in der Fertigung verbessern#
In der Fertigung hängt eine gleichbleibende Qualitätskontrolle davon ab, Fehler während der Produktion präzise zu erkennen. Computer-Vision-Modelle werden häufig eingesetzt, um Probleme in Echtzeit zu erkennen. Ihre Leistung hängt jedoch davon ab, wie gut die Trainingsdaten die tatsächlichen Produktionsbedingungen abbilden.
Veränderungen in der Fertigungsumgebung, etwa bei Rohstoffen, Maschineneinstellungen oder Beleuchtung, können neue und seltene Fehlertypen verursachen, die in den ursprünglichen Trainingsdaten nicht enthalten waren. Dadurch entsteht eine Lücke zwischen dem Gelernten des Modells und den tatsächlichen Beobachtungen an der Produktionslinie.
Damit Datensätze die aktuellen Bedingungen abbilden, müssen sie regelmäßig durch hochwertige, intern erstellte Annotationen aktualisiert werden. Mit der Ultralytics Platform lassen sich Annotationen einfach aktualisieren und Datensätze erweitern, sobald neue Fehlermuster auftreten. Diese aktualisierten Datensätze können anschließend zum erneuten Trainieren von Modellen verwendet werden, sodass Teams sich schneller an veränderte Produktionsbedingungen anpassen können.
Baustellen überwachen und die Sicherheit gewährleisten#
Baustellen sind dynamische Umgebungen mit mehreren Teams, beweglichen Maschinen und sich ständig verändernden Layouts. Um unter diesen Bedingungen die Sicherheit zu gewährleisten, braucht es klare, gut annotierte Bilddaten.
Präzise Annotationen können die Datenqualität verbessern und KI-Systemen helfen, Beschäftigte, Maschinen, Schutzausrüstung und potenzielle Gefahren unter unterschiedlichsten Bedingungen auf Baustellen zu erkennen – auch bei dichtem Gedränge, wechselnden Hintergründen und unterschiedlicher Beleuchtung.
Die Ultralytics Platform unterstützt dies, indem sich Annotationen leicht aktualisieren und an veränderte Bedingungen auf der Baustelle anpassen lassen. Neue Bilder können bei Bedarf aufgenommen und dem Dataset hinzugefügt werden, damit es weiterhin reale Szenarien abbildet.
Die wichtigsten Erkenntnisse#
Hochwertige Annotationen sind entscheidend für zuverlässige Computer-Vision- und KI-Modelle, doch herkömmliche Arbeitsabläufe bremsen Teams oft aus. Die Ultralytics Platform optimiert den Prozess mit automatisierten Annotationswerkzeugen und einem skalierbaren Arbeitsablauf. So gelangen Teams schneller von den Daten zum Modell und können zugleich Genauigkeit und Einheitlichkeit wahren.
Entdecke unsere wachsende Community und unser GitHub-Repository, um mehr über Computer Vision zu erfahren. Wenn du Lösungen im Bereich Computer Vision entwickeln möchtest, sieh dir unsere Lizenzoptionen an. Auf unseren Lösungsseiten erfährst du mehr über die Vorteile von Computer Vision in der Fertigung und KI im Gesundheitswesen.









