Was ist Instanzsegmentierung? Eine Kurzanleitung
Begleite uns, während wir uns genauer ansehen, was Instanzsegmentierung ist, wie sie funktioniert, wo sie in verschiedenen Computer-Vision-Anwendungen eingesetzt wird und welche Auswirkungen sie haben kann.

Computer vision-Anwendungen werden in unserem täglichen Leben immer häufiger, von Verkehrskameras, die die Straßenverhältnisse überwachen, bis hin zu SB-Kassen in Geschäften. Indem sie Maschinen befähigt, visuelle Daten auf eine ähnliche Weise wie Menschen zu verstehen, hat Vision AI in einer Reihe von Branchen Auswirkungen.
Viele dieser Anwendungen basieren auf Objekterkennung, einer Computer-Vision-Aufgabe, die Bounding Boxes um Schlüsselobjekte in Bildern platziert. Während dieser Ansatz oft gut funktioniert, benötigen einige Bildanalyselösungen eine noch größere Präzision.
Zum Beispiel erfordert medizinische Bildgebung mehr als nur die Erkennung eines Tumors – es ist entscheidend, dessen exakte Form zu umreißen. Ähnlich müssen Maschinen in der Robotik die genauen Konturen eines Objekts erkennen, um es korrekt zu greifen. Um diese Herausforderungen zu bewältigen, bietet die Instanzsegmentierung eine präzisere Lösung.
Die Instanzsegmentierung ist eine Computer-Vision-Aufgabe, die Anwendungsfälle unterstützen soll, bei denen das Erkennen von Objekten nicht ausreicht – sie bietet eine Genauigkeit auf Pixelebene. Computer-Vision-Modelle wie Ultralytics YOLO11 können verwendet werden, um Instanzsegmentierung einfach auf Bilder und Videos anzuwenden.

Abb. 1 Beispiel für die Verwendung von YOLO11 zur Instanzsegmentierung.
In diesem Leitfaden erklären wir, wie die Instanzsegmentierung funktioniert, welche Anwendungen es gibt und wie Ultralytics YOLO11 für spezifische Segmentierungsaufgaben individuell trainiert werden kann.
Was ist Instanzsegmentierung?#
Nehmen wir an, es gibt ein Gruppenfoto von Menschen, die dicht beieinander stehen. Die Objekterkennung kann helfen, Rahmen um jede Person zu zeichnen, aber das verrät dir nichts über ihre genaue Form.
Instanzsegmentierung hingegen ist ähnlich wie das sorgfältige Nachzeichnen jeder Person, damit du ihre vollständige Umrisslinie sehen kannst, selbst wenn sie sich überlappen. Anstatt nur zu markieren, wo sich etwas befindet, mit einer Box, identifiziert sie die genaue Form jedes Objekts auf Pixelebene, was es einfacher macht, komplexe Bilder zu verstehen.
Das Ergebnis ist eine detaillierte Maske, die die Form eines Objekts ausfüllt und genau angibt, welche Pixel dazu gehören. Dieser Grad an Präzision ist in vielen realen Anwendungen nützlich, bei denen es wichtig ist, die genaue Form und die Grenzen von Objekten zu verstehen.

Abb. 2. Demonstration der Unterstützung von Ultralytics YOLO11 für Instanzsegmentierung.
Instanzsegmentierung vs. semantische Segmentierung#
Beim Erkunden der Instanzsegmentierung stolperst du möglicherweise über das Konzept der semantischen Segmentierung.
Beide Techniken helfen Computern, Bilder auf Pixelebene zu verstehen, aber sie dienen unterschiedlichen Zwecken. Die semantische Segmentierung klassifiziert jedes Pixel basierend auf seiner Kategorie und gruppiert alle Objekte desselben Typs zusammen. Zum Beispiel würde die semantische Segmentierung in einem Bild mit mehreren Autos alle als „Auto“ markieren, ohne zwischen einzelnen Fahrzeugen zu unterscheiden.
Die Instanzsegmentierung hingegen geht einen Schritt weiter, indem sie jedes Objekt einzeln identifiziert. Sie weist einzelnen Instanzen eindeutige Labels zu und erstellt präzise Masken um deren Formen. Im selben Bild würde die Instanzsegmentierung also nicht alles nur als „Auto“ kennzeichnen, sondern jedes Auto einzeln erkennen und umreißen.
Der Hauptunterschied zwischen den beiden besteht darin, dass die semantische Segmentierung Objekte nach Kategorien gruppiert, während die Instanzsegmentierung jedes Objekt als einzigartiges Entität mit klaren Grenzen unterscheidet. Die Wahl der zu verwendenden Aufgabe hängt von der spezifischen Anwendung ab – ob es ausreicht zu wissen, was sich auf einem Bild befindet, oder ob es wichtig ist, zwischen einzelnen Objekten zu unterscheiden.

Abb. 3 Instanzsegmentierung vs. semantische Segmentierung (jeweils rechts und links).
Gängige Modelle zur Instanzsegmentierung#
Es gibt heute verschiedene Modelle zur Instanzsegmentierung für die Vision-AI-Community. Einige sind schneller, einige genauer und einige einfacher zu bedienen.
Diese Optionen können, obwohl nützlich, zu der Frage führen: Welches ist das richtige für eine spezifische Aufgabe? Unter den Optionen sind Ultralytics YOLO-Modelle sehr beliebt, da sie sich auf Geschwindigkeit und Genauigkeit konzentrieren.
Außerdem haben sich diese Modelle im Laufe der Jahre erheblich weiterentwickelt. Zum Beispiel hat Ultralytics YOLOv5 die Bereitstellung mit Frameworks wie PyTorch vereinfacht, wodurch fortgeschrittene Vision AI einem breiteren Publikum zugänglich gemacht wurde, ohne dass tiefes technisches Fachwissen erforderlich ist.
Auf diesem Erfolg aufbauend, führte Ultralytics YOLOv8 eine verbesserte Unterstützung für Computer-Vision-Aufgaben wie Instanzsegmentierung, Pose Estimation und Bildklassifizierung ein.
Jetzt hebt Ultralytics YOLO11 die Leistung auf ein neues Niveau. Das Modell erreicht eine höhere mean average precision (mAP) auf dem COCO Dataset mit 22 % weniger Parametern als YOLOv8m, was bedeutet, dass es Objekte präziser erkennen und gleichzeitig weniger Ressourcen verbrauchen kann.

Abb. 4 Benchmark für YOLO11.
Einfach ausgedrückt liefert Ultralytics YOLO11 branchenführende Genauigkeit, ohne Kompromisse bei der Effizienz einzugehen, was es zu einem echten Wendepunkt auf diesem Gebiet macht.
Verständnis der Funktionsweise der Instanzsegmentierung#
Als Nächstes schauen wir uns an, wie die Instanzsegmentierung typischerweise funktioniert. Ältere Computer-Vision-Modelle verwenden einen zweistufigen Ansatz.
Zuerst erkennen sie Objekte, indem sie Bounding Boxes darum ziehen. Dann generieren sie eine Maske auf Pixelebene, um die genaue Form jedes Objekts zu umrissen. Ein bekanntes Beispiel ist Mask R-CNN, das auf Objekterkennungsmodellen aufbaut, indem es einen Masken-Vorhersageschritt hinzufügt. Obwohl diese Methode effektiv ist, kann sie langsam sein, da sie das Bild in mehreren Schritten verarbeitet, was Echtzeitanwendungen anspruchsvoller macht.
Unterdessen verarbeiten Modelle wie Ultralytics YOLO11 Bilder in einem einzigen Durchgang und sagen gleichzeitig Objekt-Bounding-Boxen und Instanz-Segmentierungsmasken voraus. Dieser optimierte Ansatz macht sie deutlich schneller bei gleichbleibend hoher Genauigkeit. Daher eignen sie sich besonders für Echtzeitanwendungen wie autonomes Fahren, Videoanalyse und Robotik, bei denen sowohl Geschwindigkeit als auch Präzision entscheidend sind.
Individuelles Training von Ultralytics YOLO11 für Instanzsegmentierung#
Aus dem Karton heraus wird YOLO11 als vortrainiertes Modell geliefert. Es wurde auf dem COCO-Seg-Dataset trainiert, das alltägliche Objekte für die Instanzsegmentierung abdeckt. Das Ultralytics Python-Paket unterstützt jedoch das benutzerdefinierte Training, das für spezialisierte Anwendungen unerlässlich ist, bei denen eindeutige Objekte segmentiert werden müssen.
Warum ist benutzerdefiniertes Training oder Feinabstimmung eines Modells wichtig? Benutzerdefiniertes Training nutzt Transferlernen, indem es auf dem Wissen aufbaut, das bereits in vortrainierten Modellen eingebettet ist. Anstatt von Grund auf neu zu beginnen, passt es ein bestehendes Modell mit kleineren Datensätzen und weniger Rechenressourcen an neue Aufgaben an und behält dabei eine hohe Genauigkeit bei.
So trainierst du Ultralytics YOLO11 individuell#
Hier ist ein genauerer Blick auf die Schritte beim Fine-Tuning von Ultralytics YOLO11 für die Instanzsegmentierung:
- Datenaufbereitung: Sammle und annotiere Bilder basierend auf deiner spezifischen Anwendung. Ultralytics bietet Unterstützung für mehrere Bild-Datasets, aber du kannst auch mit deinem eigenen Dataset trainieren, indem du Bilder und Annotationen im erforderlichen YOLO-Format vorbereitest.
- Verwendung eines vortrainierten Modells: Anstatt bei null anzufangen, verwende ein vortrainiertes Ultralytics YOLO11-Modell.
- Modelltraining: Passe wichtige Trainingseinstellungen wie die Batchgröße (pro Iteration verarbeitete Bilder), die Bildgröße (Ziel-Eingabeauflösung) und Epochen (gesamte Trainingszyklen) an und trainiere das Modell.
- Leistungsbewertung: Nach Abschluss des Modelltrainings kannst du die Genauigkeit des Modells anhand von Leistungsmetriken wie mAP testen. Das Ultralytics Python-Paket bietet auch integrierte Funktionen für die Modellbewertung.
Anwendungen der Instanzsegmentierung, ermöglicht durch Ultralytics YOLO11#
Instanzsegmentierung kann zur Lösung realer Herausforderungen eingesetzt werden, indem sie Maschinen hilft, Objekte genauer zu sehen und zu verstehen. Von der Verbesserung der Automatisierung bis hin zum Schutz der Umwelt spielt sie in vielen Bereichen eine Schlüsselrolle. Gehen wir einige Beispiele durch, in denen sie Auswirkungen hat.
Sicherheit und Überwachung auf Baustellen mit Ultralytics YOLO11#
Die Instanzsegmentierung kann ein entscheidender Teil der Gewährleistung von Sicherheit und Effizienz auf Baustellen sein. Sie kann zum Beispiel zur Überwachung schwerer Maschinen eingesetzt werden.
Ultralytics YOLO11 kann so angepasst werden, dass verschiedene Arten von Geräten wie Kräne, Bagger und Bulldozer präzise segmentiert und identifiziert sowie deren Positionen in Echtzeit verfolgt werden. Dies ermöglicht es Bauleitern sicherzustellen, dass Maschinen strikt innerhalb ausgewiesener Bereiche arbeiten und nicht in Zonen vordringen, in denen sich Arbeiter aufhalten oder Gefahren bestehen.
Zudem ermöglicht die Integration solcher Lösungen mit Echtzeit-Warnsystemen schnelle Korrekturmaßnahmen. Darüber hinaus können die gesammelten Erkenntnisse dazu beitragen, die Baustelleneinrichtung und den Arbeitsablauf zu optimieren, was Risiken weiter reduziert und die Produktivität steigert.

Fig 5. Überwachung schwerer Maschinen mit Ultralytics YOLO11.
Tierüberwachung mit Segmentierung und Ultralytics YOLO11#
Verhaltensüberwachung von Tieren hilft Forschern, Landwirten und Tierschützern, sich in verschiedenen Umgebungen besser um Tiere zu kümmern. Die Instanzsegmentierung spielt in diesen Systemen eine hilfreiche Rolle, indem sie einzelne Tiere auf Farmen, in Zoos und in natürlichen Lebensräumen identifiziert und segmentiert. Im Gegensatz zur traditionellen Objekterkennung, die Bounding Boxes verwendet, bietet die Instanzsegmentierung eine Abgrenzung jedes Tieres auf Pixelebene, was besonders nützlich ist, wenn sich Tiere in unmittelbarer Nähe befinden.
Detaillierte Segmentierung ermöglicht eine genauere Verfolgung von Bewegungen und Verhaltensweisen. Überlappende oder dicht beieinander stehende Tiere können deutlich erkannt werden und bieten eine präzisere Analyse von Interaktionen, Gesundheitsbewertungen und Aktivitätsmustern. Insgesamt verbessern tiefere Einblicke in das Tierverhalten die Tierpflege- und Managementpraktiken.

Abb. 6 Überwachung von Viehbeständen mit Instanzsegmentierung.
Ultralytics YOLO11 in der Sportanalytik und Spieler-Verfolgung#
Präzise Spieler- und Ereignisverfolgung ist ein großer Teil der Sportanalyse. Herkömmliche Tracking-Methoden basieren auf manueller Tagging, das detaillierte Interaktionen möglicherweise nicht erfasst. Computer Vision kann verwendet werden, um Details wie jeden Spieler, den Ball und wichtige Ereignisse auf Pixelebene zu segmentieren, um detaillierte Einblicke zu erhalten.
Beispielsweise kann die Instanzsegmentierung dabei helfen, Ereignisse wie Fouls oder Vorfälle abseits des Balls zu erkennen, indem jeder Spieler und jedes Objekt klar getrennt werden. Diese granulare Überwachung durch Modelle wie Ultralytics YOLO11 bietet Analysten klarere Informationen, um Bewegungsmuster, die räumliche Positionierung und Interaktionen mit hoher Genauigkeit zu untersuchen. Ein Hauptvorteil dieser Einblicke besteht darin, dass sie Teams helfen, ihre Strategien zu verfeinern und die Gesamtleistung zu steigern.
Vor- und Nachteile der Instanzsegmentierung#
Hier sind einige der wichtigsten Vorteile, die die Instanzsegmentierung verschiedenen Branchen bieten kann:
- Verbesserte Automatisierung: Durch die Automatisierung von Aufgaben wie Qualitätskontrolle und Sicherheitsüberwachung reduziert die Instanzsegmentierung den Bedarf an manuellem Eingreifen und minimiert menschliches Versagen.
- Besseres Szenenverständnis: Durch das genaue Umreißen jedes Objekts trägt die Instanzsegmentierung zu einem tieferen Verständnis komplexer Szenen bei und unterstützt eine fundiertere Entscheidungsfindung.
- Effiziente Nachbearbeitung: Die Ausgabe auf Pixelebene vereinfacht Aufgaben wie Hintergrundentfernung, Objektzählung und räumliche Analyse, was den Bedarf an zusätzlichen Verarbeitungsschritten reduziert.
Obwohl diese Vorteile hervorheben, wie die Instanzsegmentierung verschiedene Anwendungsfälle beeinflusst, ist es auch wichtig, die Herausforderungen bei ihrer Implementierung zu berücksichtigen.
Hier sind einige der wichtigsten Einschränkungen der Instanzsegmentierung:
- Herausforderungen bei Transparenz: Das Segmentieren transparenter oder reflektierender Objekte wie Glas und Wasser ist schwierig, was zu ungenauen Grenzen führt.
- Wartungsaufwand: Um Modelle genau und relevant zu halten, sind kontinuierliche Updates und Feinabstimmungen erforderlich, da sich Umweltbedingungen und Datensätze ändern.
- Hoher Annotationsaufwand: Das Training von Instanzsegmentierungsmodellen erfordert detaillierte Annotationen auf Pixelebene, was den Zeit- und Kostenaufwand für die Datenvorbereitung erheblich erhöht.
Wichtige Erkenntnisse#
Die Instanzsegmentierung ermöglicht es, einzelne Objekte präzise zu unterscheiden, selbst wenn sie sich überlappen. Durch das Erfassen von Objektgrenzen auf Pixelebene bietet sie ein tieferes Verständnis visueller Daten im Vergleich zu herkömmlichen Computer-Vision-Aufgaben wie der Objekterkennung.
Jüngste Fortschritte im Computer Vision haben die Instanzsegmentierung schneller und einfacher nutzbar gemacht. Insbesondere Computer-Vision-Modelle wie Ultralytics YOLO11 vereinfachen den Prozess und ermöglichen Echtzeit-Segmentierung mit minimalem Einrichtungsaufwand, was sie für verschiedene Branchen und Anwendungen zugänglicher macht.
Neugierig auf KI? Besuche unser GitHub-Repository und verbinde dich mit unserer Community, um weiter zu forschen. Erfahre mehr über Innovationen wie KI in selbstfahrenden Autos und Vision AI in der Landwirtschaft auf unseren Lösungsseiten. Schau dir unsere Lizenzierungsoptionen an und lege mit einem Computer-Vision-Projekt los!






