Instance Segmentation
Erfahre, wie die Instanzsegmentierung eine Objekterkennung auf Pixelebene ermöglicht. Entdecke, wie du Ultralytics YOLO26 für die schnelle Echtzeitgenerierung von Masken und weitere Aufgaben einsetzt.
Instanzsegmentierung ist eine hochentwickelte Technik im Bereich des maschinellen Sehens (CV), die jedes einzelne relevante Objekt in einem Bild auf Pixelebene identifiziert und abgrenzt. Während die standardmäßige Objekterkennung Objekte mithilfe rechteckiger Begrenzungsrahmen lokalisiert, geht die Instanzsegmentierung bei der Analyse noch einen Schritt weiter, indem sie für jedes erkannte Objekt eine präzise Maske erzeugt. Dadurch können Modelle der künstlichen Intelligenz (AI) einzelne Objekte derselben Klasse unterscheiden – beispielsweise zwei sich überschneidende Personen voneinander trennen. So entsteht im Vergleich zu einfacheren Klassifizierungsmethoden ein umfassenderes und detaillierteres Verständnis der visuellen Szene.
Segmentierungstypen unterscheiden#
Um den Nutzen der Instanzsegmentierung vollständig zu verstehen, ist es hilfreich, sie von anderen verwandten Aufgaben der Bildverarbeitung abzugrenzen. Jede Methode bietet abhängig von den Anforderungen der jeweiligen Anwendung eine andere Detailgenauigkeit.
- Semantische Segmentierung: Bei diesem Ansatz wird jedes Pixel eines Bildes einer Kategorie zugeordnet, beispielsweise „Straße“, „Himmel“ oder „Auto“. Dabei wird jedoch nicht zwischen einzelnen Objekten derselben Kategorie unterschieden. Wenn drei Autos nebeneinander geparkt sind, betrachtet die semantische Segmentierung sie als eine einzige „Auto“-Region.
- Instanzsegmentierung: Bei dieser Methode wird jedes Objekt als eigenständige Einheit behandelt. Sie erkennt einzelne Instanzen und weist den Pixeln jeder Instanz eine eindeutige Bezeichnung zu. Im Beispiel der geparkten Autos würde die Instanzsegmentierung drei verschiedene Masken erstellen und „Auto A“, „Auto B“ und „Auto C“ separat identifizieren.
- Panoptische Segmentierung: Ein hybrider Ansatz, der die Kennzeichnung des Hintergrunds durch die semantische Segmentierung mit der Identifizierung zählbarer Objekte durch die Instanzsegmentierung kombiniert.
Die Funktionsweise der Analyse auf Pixelebene#
Moderne Modelle für die Instanzsegmentierung basieren typischerweise auf fortschrittlichen Architekturen für Deep Learning (DL), insbesondere auf Faltungsneuronalen Netzen (CNNs). Diese Netze extrahieren Merkmale aus einem Bild, um sowohl die Klasse eines Objekts als auch seine räumliche Kontur vorherzusagen. Historisch waren zweistufige Architekturen wie Mask R-CNN der Standard: Zuerst wurden relevante Regionen vorgeschlagen und anschließend zu Masken verfeinert.
Neuere Fortschritte haben jedoch zu einstufigen Detektoren wie YOLO26 geführt, die Erkennung und Segmentierung gleichzeitig durchführen. Dieser „End-to-End“-Ansatz verbessert die Geschwindigkeit der Echtzeit-Inferenz erheblich und ermöglicht so eine hochpräzise Segmentierung von Live-Videostreams auf handelsüblicher Hardware.
Anwendungen in der Praxis#
Die präzisen Grenzen, die die Instanzsegmentierung liefert, sind für Branchen entscheidend, in denen die genaue Form und Position eines Objekts für die Entscheidungsfindung bekannt sein muss.
- AI im Gesundheitswesen: In der medizinischen Diagnostik ist es entscheidend, die genaue Größe und Form von Tumoren oder Läsionen zu bestimmen. Die Instanzsegmentierung ermöglicht es Modellen, Anomalien in MRT-Aufnahmen mit hoher Präzision abzugrenzen, wodurch Radiologinnen und Radiologen bei der Behandlungsplanung und der Überwachung des Krankheitsverlaufs unterstützt werden.
- Autonome Fahrzeuge: Selbstfahrende Autos sind für die Navigation in komplexen Umgebungen auf Segmentierung angewiesen. Mithilfe von Datensätzen wie Cityscapes können Fahrzeuge befahrbare Flächen erkennen, Fahrbahnmarkierungen identifizieren und einzelne Fußgänger an stark frequentierten Zebrastreifen voneinander unterscheiden, um die Sicherheit zu gewährleisten.
- AI in der Landwirtschaft: Die Präzisionslandwirtschaft nutzt Segmentierung zur Überwachung der Pflanzengesundheit. Roboter mit visuellen Erkennungssystemen können einzelne Früchte für die automatisierte Ernte identifizieren oder bestimmte Unkräuter für eine gezielte Anwendung von Herbiziden erkennen. Dadurch wird der Einsatz von Chemikalien reduziert und der Ertrag optimiert.
Segmentierung mit Python implementieren#
Entwickler können mithilfe der Bibliothek ultralytics ganz einfach eine Instanzsegmentierung implementieren. Das folgende Beispiel zeigt, wie ein vortrainiertes YOLO26-Modell geladen und Segmentierungsmasken für ein Bild erzeugt werden.
from ultralytics import YOLO
# Load a pre-trained YOLO26 instance segmentation model
# The 'n' suffix denotes the nano version, optimized for speed
model = YOLO("yolo26n-seg.pt")
# Run inference on an image
# This predicts classes, bounding boxes, and masks
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results
# Displays the image with overlaid segmentation masks
results[0].show()Herausforderungen und Modelltraining#
Obwohl die Instanzsegmentierung leistungsfähig ist, benötigt sie im Vergleich zur einfachen Erkennung von Begrenzungsrahmen viele Rechenressourcen. Die Erzeugung pixelgenauer Masken erfordert umfangreiche GPU-Ressourcen und eine präzise Datenannotation. Für diese Aufgaben müssen eng anliegende Polygone um jedes Objekt gezeichnet werden, was zeitaufwendig sein kann.
Um diesen Prozess zu vereinfachen, verwenden Teams häufig Werkzeuge wie die Ultralytics Platform, die Funktionen für die Datensatzverwaltung, automatische Annotation und cloudbasiertes Training bietet. Dadurch können Entwickler Modelle mit benutzerdefinierten Daten – etwa bestimmten Industrieteilen oder biologischen Proben – feinabstimmen und sie mithilfe optimierter Formate wie ONNX oder TensorRT effizient auf Edge-AI-Geräten bereitstellen.









