Was ist Instanzsegmentierung? Ein kurzer Leitfaden
Begleite uns bei einem genaueren Blick darauf, was Instanzsegmentierung ist, wie sie funktioniert, wie sie in verschiedenen Computer-Vision-Anwendungen eingesetzt wird und welche Auswirkungen sie haben kann.

Computer-Vision-Anwendungen werden in unserem Alltag immer häufiger eingesetzt – von Verkehrskameras zur Überwachung der Straßenverhältnisse bis hin zu Selbstbedienungskassen in Geschäften. Indem Vision AI Maschinen ermöglicht, visuelle Daten ähnlich wie Menschen zu verstehen, wirkt sie sich auf zahlreiche Branchen aus.
Viele dieser Anwendungen basieren auf Objekterkennung, einer Computer-Vision-Aufgabe, bei der Begrenzungsrahmen um wichtige Objekte in Bildern gelegt werden. Dieser Ansatz funktioniert oft gut, aber einige Lösungen zur Bildanalyse benötigen noch höhere Präzision.
Bei medizinischen Bildern reicht es beispielsweise nicht aus, nur einen Tumor zu erkennen – entscheidend ist, seine genaue Form zu umreißen. Auch in der Robotik müssen Maschinen die exakten Konturen eines Objekts erkennen, um es richtig greifen zu können. Instanzsegmentierung bietet eine präzisere Lösung für diese Herausforderungen.
Instanzsegmentierung ist eine Computer-Vision-Aufgabe für Anwendungsfälle, in denen die Erkennung von Objekten nicht ausreicht – sie liefert Genauigkeit auf Pixelebene. Computer-Vision-Modelle wie Ultralytics YOLO11 können verwendet werden, um Instanzsegmentierung einfach auf Bilder und Videos anzuwenden.

Abb. 1 Beispiel für die Verwendung von YOLO11 zur Instanzsegmentierung.
In diesem Leitfaden erklären wir, wie Instanzsegmentierung funktioniert, welche Anwendungen es gibt und wie du Ultralytics YOLO11 für bestimmte Segmentierungsaufgaben individuell trainieren kannst.
Was ist Instanzsegmentierung?#
Stell dir ein Gruppenfoto mit Menschen vor, die dicht beieinander stehen. Die Objekterkennung kann dabei helfen, Rahmen um jede Person zu zeichnen, aber sie zeigt nicht deren genaue Form.
Instanzsegmentierung ähnelt dagegen dem sorgfältigen Nachzeichnen jeder Person, sodass du ihre vollständige Kontur sehen kannst, selbst wenn sie sich überschneiden. Statt nur mit einem Rahmen zu markieren, wo sich etwas befindet, erkennt sie die genaue Form jedes Objekts auf Pixelebene und erleichtert so das Verständnis komplexer Bilder.
Das Ergebnis ist eine detaillierte Maske, die die Form eines Objekts ausfüllt und exakt bestimmt, welche Pixel zu ihm gehören. Diese Präzision ist in vielen realen Anwendungen nützlich, in denen das genaue Aussehen und die Grenzen von Objekten wichtig sind.

Abb. 2. Darstellung der Unterstützung von Ultralytics YOLO11 für die Instanzsegmentierung.
Instanzsegmentierung im Vergleich zur semantischen Segmentierung#
Bei der Beschäftigung mit Instanzsegmentierung stößt du möglicherweise auf das Konzept der semantischen Segmentierung.
Beide Verfahren helfen Computern, Bilder auf Pixelebene zu verstehen, dienen aber unterschiedlichen Zwecken. Die semantische Segmentierung versieht jedes Pixel anhand seiner Kategorie mit einer Bezeichnung und fasst alle Objekte desselben Typs zusammen. Bei einem Bild mit mehreren Autos würden beispielsweise alle als „Auto“ gekennzeichnet, ohne die einzelnen Fahrzeuge zu unterscheiden.
Die Instanzsegmentierung geht dagegen einen Schritt weiter und identifiziert jedes Objekt einzeln. Sie weist einzelnen Instanzen eindeutige Bezeichnungen zu und erstellt präzise Masken um ihre Formen. Im selben Bild würde sie also nicht einfach alles als „Auto“ kennzeichnen, sondern jedes Auto einzeln erkennen und umreißen.
Der Hauptunterschied besteht darin, dass die semantische Segmentierung Objekte nach Kategorien gruppiert, während die Instanzsegmentierung jedes Objekt als eigenständige Einheit mit klaren Grenzen unterscheidet. Welche Aufgabe du verwendest, hängt von der konkreten Anwendung ab – davon, ob es ausreicht zu wissen, was sich in einem Bild befindet, oder ob einzelne Objekte unterschieden werden müssen.

Abb. 3 Instanzsegmentierung im Vergleich zur semantischen Segmentierung (rechts bzw. links).
Beliebte Modelle zur Instanzsegmentierung#
Heutzutage stehen der Vision-AI-Community verschiedene Modelle zur Instanzsegmentierung zur Verfügung. Einige sind schneller, andere genauer und wieder andere einfacher zu verwenden.
Diese nützlichen Optionen führen möglicherweise zu der Frage, welches Modell für eine bestimmte Aufgabe das richtige ist. Unter den verfügbaren Optionen sind die Ultralytics YOLO-Modelle sehr beliebt, da sie auf Geschwindigkeit und Genauigkeit ausgerichtet sind.
Außerdem haben sich diese Modelle im Laufe der Jahre deutlich weiterentwickelt. Ultralytics YOLOv5 vereinfachte beispielsweise die Bereitstellung mit Frameworks wie PyTorch und machte fortschrittliche Vision AI einem breiteren Publikum zugänglich, ohne tiefgreifende technische Kenntnisse vorauszusetzen.
Auf diesem Erfolg aufbauend führte Ultralytics YOLOv8 eine verbesserte Unterstützung für Computer-Vision-Aufgaben wie Instanzsegmentierung, Posenschätzung und Bildklassifizierung ein.
Jetzt hebt Ultralytics YOLO11 die Leistung auf ein neues Niveau. Auf dem COCO-Datensatz erreicht es eine höhere mittlere durchschnittliche Präzision (mAP) mit 22 % weniger Parametern als YOLOv8m. Das bedeutet, dass es Objekte präziser erkennen und dabei weniger Ressourcen verwenden kann.

Abb. 4 Leistungsvergleich von YOLO11.
Kurz gesagt liefert Ultralytics YOLO11 hochmoderne Genauigkeit ohne Einbußen bei der Effizienz und setzt damit neue Maßstäbe in diesem Bereich.
So funktioniert die Instanzsegmentierung#
Sehen wir uns als Nächstes an, wie Instanzsegmentierung typischerweise funktioniert. Ältere Computer-Vision-Modelle verwenden einen zweistufigen Ansatz.
Zuerst erkennen sie Objekte, indem sie Begrenzungsrahmen um sie zeichnen. Anschließend erzeugen sie eine Maske auf Pixelebene, um die genaue Form jedes Objekts zu umreißen. Ein bekanntes Beispiel ist Mask R-CNN, das auf Objekterkennungs-Modellen aufbaut und einen Schritt zur Maskenvorhersage ergänzt. Diese Methode ist zwar effektiv, kann aber langsam sein, da sie das Bild in mehreren Phasen verarbeitet. Dadurch werden Echtzeitanwendungen anspruchsvoller.
Modelle wie Ultralytics YOLO11 verarbeiten Bilder dagegen in einem Durchgang und sagen gleichzeitig die Begrenzungsrahmen der Objekte und die Masken für die Instanzsegmentierung voraus. Dieser optimierte Ansatz ist deutlich schneller und behält dennoch eine hohe Genauigkeit bei. Daher eignet er sich besonders für Echtzeitanwendungen wie autonomes Fahren, Videoanalyse und Robotik, bei denen sowohl Geschwindigkeit als auch Präzision entscheidend sind.
Ultralytics YOLO11 für die Instanzsegmentierung individuell trainieren#
YOLO11 wird standardmäßig als vortrainiertes Modell bereitgestellt. Es wurde mit dem COCO-Seg-Datensatz trainiert, der Alltagsobjekte für die Instanzsegmentierung umfasst. Das Ultralytics Python-Paket unterstützt jedoch auch individuelles Training, das für spezialisierte Anwendungen mit besonderen Objekten unerlässlich ist.
Warum sind individuelles Training oder Feinabstimmung eines Modells wichtig? Individuelles Training nutzt Transfer Learning, indem es auf dem Wissen vortrainierter Modelle aufbaut. Statt ganz von vorn zu beginnen, passt es ein vorhandenes Modell mit kleineren Datensätzen und weniger Rechenressourcen an neue Aufgaben an und behält dabei eine hohe Genauigkeit bei.
So trainierst du Ultralytics YOLO11 individuell#
Hier erhältst du einen genaueren Überblick über die Schritte zur Feinabstimmung von Ultralytics YOLO11 für die Instanzsegmentierung:
- Datenvorbereitung: Sammle und annotiere Bilder passend zu deiner konkreten Anwendung. Ultralytics unterstützt mehrere Bilddatensätze. Du kannst aber auch mit deinem eigenen Datensatz trainieren, indem du Bilder und Annotationen im erforderlichen YOLO-Format vorbereitest.
- Verwendung eines vortrainierten Modells: Verwende ein vortrainiertes Ultralytics-YOLO11-Modell, statt ganz von vorn zu beginnen.
- Modelltraining: Passe wichtige Trainingseinstellungen wie die Batchgröße (Anzahl der pro Iteration verarbeiteten Bilder), die Bildgröße (Zielauflösung der Eingabe) und die Epochen (Gesamtzahl der Trainingszyklen) an und trainiere das Modell.
- Leistungsbewertung: Nach Abschluss des Modelltrainings kannst du die Genauigkeit des Modells anhand von Leistungsmetriken wie mAP testen. Das Ultralytics Python-Paket stellt außerdem integrierte Funktionen zur Modellbewertung bereit.
Anwendungen der Instanzsegmentierung mit Ultralytics YOLO11#
Instanzsegmentierung kann reale Herausforderungen lösen, indem sie Maschinen hilft, Objekte genauer zu sehen und zu verstehen. Von der Verbesserung der Automatisierung bis zum Umweltschutz spielt sie in vielen Bereichen eine wichtige Rolle. Sehen wir uns einige Beispiele an, in denen sie Wirkung zeigt.
Sicherheit und Überwachung auf Baustellen mit Ultralytics YOLO11#
Instanzsegmentierung kann entscheidend dazu beitragen, Sicherheit und Effizienz auf Baustellen zu gewährleisten. Sie kann beispielsweise zur Überwachung schwerer Maschinen eingesetzt werden.
Ultralytics YOLO11 lässt sich feinabstimmen, um verschiedene Ausrüstungstypen wie Kräne, Bagger und Bulldozer präzise zu segmentieren und zu identifizieren sowie ihre Positionen in Echtzeit zu verfolgen. So können Bauleiter sicherstellen, dass Maschinen ausschließlich in den vorgesehenen Bereichen betrieben werden und nicht in Zonen mit anwesenden Arbeitskräften oder Gefahren eindringen.
Die Integration solcher Lösungen in Echtzeit-Warnsysteme ermöglicht außerdem schnelle Korrekturmaßnahmen. Darüber hinaus können die gewonnenen Erkenntnisse helfen, die Anordnung und Arbeitsabläufe auf der Baustelle zu optimieren, Risiken weiter zu reduzieren und die Produktivität zu steigern.

Abb. 5 Überwachung schwerer Maschinen mit Ultralytics YOLO11.
Tierüberwachung mit Segmentierung und Ultralytics YOLO11#
Die Überwachung des Tierverhaltens hilft Forschenden, Landwirten und Naturschützern, Tiere in unterschiedlichen Umgebungen besser zu versorgen. Instanzsegmentierung spielt in diesen Systemen eine wichtige Rolle, indem sie einzelne Tiere auf Bauernhöfen, in Zoos und in natürlichen Lebensräumen identifiziert und segmentiert. Anders als die herkömmliche Objekterkennung mit Begrenzungsrahmen liefert die Instanzsegmentierung eine Abgrenzung jedes Tieres auf Pixelebene, was besonders nützlich ist, wenn sich Tiere nahe beieinander befinden.
Eine detaillierte Segmentierung ermöglicht eine genauere Verfolgung von Bewegungen und Verhaltensweisen. Überlappende oder dicht beieinander stehende Tiere können eindeutig erkannt werden und ermöglichen eine präzisere Analyse von Interaktionen, Gesundheitszustand und Aktivitätsmustern. Insgesamt verbessern tiefere Einblicke in das Tierverhalten die Haltung und das Management von Tieren.

Abb. 6 Überwachung von Rindern mit Instanzsegmentierung.
Ultralytics YOLO11 in der Sportanalyse und Spielerverfolgung#
Die präzise Verfolgung von Spielern und Ereignissen ist ein wesentlicher Bestandteil der Sportanalyse. Herkömmliche Verfolgungsmethoden basieren auf manueller Kennzeichnung, die möglicherweise keine detaillierten Interaktionen erfasst. Computer Vision kann verwendet werden, um Details wie einzelne Spieler, den Ball und wichtige Ereignisse auf Pixelebene zu segmentieren und so detaillierte Erkenntnisse zu gewinnen.
Die Instanzsegmentierung kann beispielsweise dabei helfen, Ereignisse wie Fouls oder Vorfälle abseits des Ballgeschehens zu erkennen, indem sie jeden Spieler und jedes Objekt klar voneinander trennt. Diese detaillierte Überwachung mit Modellen wie Ultralytics YOLO11 liefert Analysten klarere Informationen zur Untersuchung von Bewegungsmustern, räumlicher Positionierung und Interaktionen mit hoher Genauigkeit. Ein wichtiger Vorteil dieser Erkenntnisse besteht darin, dass sie Teams dabei helfen, ihre Strategien zu verbessern und ihre Gesamtleistung zu steigern.
Vor- und Nachteile der Instanzsegmentierung#
Hier sind einige der wichtigsten Vorteile, die Instanzsegmentierung für verschiedene Branchen bieten kann:
- Verbesserte Automatisierung: Durch die Automatisierung von Aufgaben wie Qualitätskontrolle und Sicherheitsüberwachung reduziert die Instanzsegmentierung den Bedarf an manuellen Eingriffen und minimiert menschliche Fehler.
- Besseres Szenenverständnis: Durch die präzise Umgrenzung jedes Objekts trägt die Instanzsegmentierung zu einem tieferen Verständnis komplexer Szenen bei und unterstützt fundiertere Entscheidungen.
- Effiziente Nachbearbeitung: Die Ausgabe auf Pixelebene vereinfacht Aufgaben wie Hintergrundentfernung, Objektzählung und räumliche Analyse und reduziert den Bedarf an zusätzlichen Verarbeitungsschritten.
Diese Vorteile zeigen, wie sich Instanzsegmentierung auf verschiedene Anwendungsfälle auswirkt. Dennoch ist es wichtig, auch die mit ihrer Implementierung verbundenen Herausforderungen zu berücksichtigen.
Hier sind einige der wichtigsten Einschränkungen der Instanzsegmentierung:
- Herausforderungen bei Transparenz: Die Segmentierung transparenter oder reflektierender Objekte wie Glas und Wasser ist schwierig und führt zu ungenauen Grenzen.
- Wartungsaufwand: Damit Modelle genau und relevant bleiben, sind kontinuierliche Aktualisierungen und Feinabstimmungen erforderlich, wenn sich Umgebungsbedingungen und Datensätze ändern.
- Hoher Annotationsaufwand: Das Training von Modellen zur Instanzsegmentierung erfordert detaillierte Annotationen auf Pixelebene, wodurch Zeit- und Kostenaufwand für die Datenvorbereitung erheblich steigen.
Wichtige Erkenntnisse#
Instanzsegmentierung ermöglicht es, einzelne Objekte präzise zu unterscheiden, selbst wenn sie sich überschneiden. Durch die Erfassung von Objektgrenzen auf Pixelebene bietet sie ein tieferes Verständnis visueller Daten als herkömmliche Computer-Vision-Aufgaben wie die Objekterkennung.
Fortschritte im Bereich Computer Vision haben die Instanzsegmentierung schneller und einfacher nutzbar gemacht. Insbesondere Computer-Vision-Modelle wie Ultralytics YOLO11 vereinfachen den Prozess und ermöglichen eine Echtzeitsegmentierung mit minimalem Einrichtungsaufwand, wodurch sie für verschiedene Branchen und Anwendungen zugänglicher wird.
Interessierst du dich für AI? Besuche unser GitHub-Repository und vernetze dich mit unserer Community, um weiter auf Entdeckungsreise zu gehen. Erfahre auf unseren Lösungsseiten mehr über Innovationen wie AI in selbstfahrenden Autos und Vision AI in der Landwirtschaft. Sieh dir unsere Lizenzoptionen an und starte dein eigenes Computer-Vision-Projekt!









