Ultralytics YOLO27:
Vision-KI

Was ist Mask R-CNN und wie funktioniert es?

Erfahre, wie Mask R-CNN zur präzisen Segmentierung von Objekten in Bildern und Videos für verschiedene Anwendungen in unterschiedlichen Branchen eingesetzt werden kann.

ABAbirami Vina8 min read
Instanzsegmentierung mit Mask R-CNN

Innovationen wie Roboter in Lagerhäusern, selbstfahrende Autos, die sich sicher durch belebte Straßen bewegen, Drohnen zur Überwachung von Nutzpflanzen und KI-Systeme zur Produktprüfung in Fabriken werden mit zunehmender Nutzung von KI immer häufiger. Eine wichtige Technologie hinter diesen Innovationen ist Computer Vision, ein Teilgebiet der KI, das Maschinen ermöglicht, visuelle Daten zu verstehen und zu interpretieren.

Die Objekterkennung ist beispielsweise eine Computer-Vision-Aufgabe, die dabei hilft, Objekte in Bildern mithilfe von Begrenzungsrahmen zu identifizieren und zu lokalisieren. Begrenzungsrahmen liefern zwar nützliche Informationen, bieten aber nur eine grobe Schätzung der Position eines Objekts und können seine genaue Form oder Begrenzung nicht erfassen. Dadurch sind sie für Anwendungen, die eine präzise Identifizierung erfordern, weniger geeignet.

Um dieses Problem zu lösen, entwickelten Forschende Segmentierungsmodelle, die die exakten Konturen von Objekten erfassen und dadurch pixelgenaue Details für eine präzisere Erkennung und Analyse liefern.

Mask R-CNN ist eines dieser Modelle. Es wurde 2017 von Facebook AI Research (FAIR) vorgestellt und baut auf früheren Modellen wie R-CNN, Fast R-CNN und Faster R-CNN auf. Als wichtiger Meilenstein in der Geschichte von Computer Vision ebnete Mask R-CNN den Weg für fortschrittlichere Modelle wie Ultralytics YOLO11.

In diesem Artikel erfährst du, was Mask R-CNN ist, wie es funktioniert, wofür es eingesetzt wird und welche Verbesserungen danach entwickelt wurden, die zu Ultralytics YOLO11 führten.

Ein Überblick über Mask R-CNN#

Mask R-CNN, kurz für faltendes neuronales Netzwerk auf Maskenbasis für Regionen (Mask Region-based Convolutional Neural Network), ist ein Deep-Learning-Modell für Computer-Vision-Aufgaben wie Objekterkennung und Instanzsegmentierung.

Die Instanzsegmentierung geht über die herkömmliche Objekterkennung hinaus, indem sie Objekte in einem Bild nicht nur identifiziert, sondern auch jedes einzelne präzise umreißt. Sie weist jedem erkannten Objekt eine eindeutige Bezeichnung zu und erfasst seine exakte Form auf Pixelebene. Dieser detaillierte Ansatz ermöglicht es, überlappende Objekte klar voneinander zu unterscheiden und komplexe Formen präzise zu verarbeiten.

Mask R-CNN baut auf Faster R-CNN auf, das Objekte erkennt und klassifiziert, ihre exakten Formen jedoch nicht bestimmt. Mask R-CNN verbessert dies, indem es die genauen Pixel identifiziert, aus denen jedes Objekt besteht, und so eine wesentlich detailliertere und präzisere Bildanalyse ermöglicht.

Vergleich von Objekterkennung und Instanzsegmentierung

Abb. 1: Vergleich von Objekterkennung und Instanzsegmentierung.

Ein Blick auf die Architektur von Mask R-CNN und seine Funktionsweise#

Mask R-CNN verfolgt einen schrittweisen Ansatz, um Objekte präzise zu erkennen und zu segmentieren. Zunächst extrahiert es mithilfe eines tiefen neuronalen Netzwerks wichtige Merkmale (ein mehrschichtiges Modell, das aus Daten lernt). Anschließend identifiziert es mit einem Netzwerk zur Erstellung von Regionsvorschlägen mögliche Objektbereiche (eine Komponente, die wahrscheinliche Objektregionen vorschlägt). Abschließend verfeinert es diese Bereiche, indem es detaillierte Segmentierungsmasken (präzise Umrisse von Objekten) erstellt, die die exakte Form jedes Objekts erfassen.

Im nächsten Abschnitt gehen wir jeden Schritt durch, damit du besser verstehst, wie Mask R-CNN funktioniert.

Überblick über die Architektur von Mask R-CNN

Abb. 2: Ein Überblick über die Architektur von Mask R-CNN (Quelle: researchgate.net).

Beginn mit der Merkmalsextraktion#

Der erste Schritt in der Architektur von Mask R-CNN besteht darin, das Bild in seine wichtigsten Bestandteile zu zerlegen, damit das Modell verstehen kann, was darauf zu sehen ist. Stell dir vor, du betrachtest ein Foto und bemerkst ganz selbstverständlich Details wie Formen, Farben und Kanten. Das Modell arbeitet ähnlich und verwendet dafür ein tiefes neuronales Netzwerk, das als „Backbone“ bezeichnet wird (häufig ResNet-50 oder ResNet-101). Dieses fungiert gewissermaßen als Auge des Modells, scannt das Bild und erfasst wichtige Details.

Da Objekte in Bildern sehr klein oder sehr groß sein können, verwendet Mask R-CNN ein Feature-Pyramid-Network. Das ist vergleichbar mit verschiedenen Vergrößerungsgläsern, durch die das Modell sowohl feine Details als auch das große Ganze erkennen kann. So werden Objekte jeder Größe berücksichtigt.

Sobald diese wichtigen Merkmale extrahiert wurden, fährt das Modell damit fort, die möglichen Objekte im Bild zu lokalisieren, und schafft so die Grundlage für die weitere Analyse.

Vorschlagen möglicher Objektbereiche im Bild#

Nachdem das Bild auf wichtige Merkmale untersucht wurde, übernimmt das Netzwerk zur Erstellung von Regionsvorschlägen. Dieser Teil des Modells betrachtet das Bild und schlägt Bereiche vor, die wahrscheinlich Objekte enthalten.

Dazu erzeugt es mehrere mögliche Objektpositionen, die als Anker bezeichnet werden. Anschließend bewertet das Netzwerk diese Anker und wählt die vielversprechendsten für die weitere Analyse aus. So konzentriert sich das Modell nur auf die Bereiche, die wahrscheinlich interessant sind, anstatt jede einzelne Stelle im Bild zu überprüfen.

Darstellung eines Netzwerks zur Erstellung von Regionsvorschlägen

Abb. 3: Beispiel für ein Netzwerk zur Erstellung von Regionsvorschlägen.

Verbessern der extrahierten Merkmale#

Nachdem die wichtigen Bereiche identifiziert wurden, besteht der nächste Schritt darin, die aus diesen Regionen extrahierten Details zu verfeinern. Frühere Modelle verwendeten eine Methode namens ROI Pooling (Pooling der Interessensregion), um Merkmale aus jedem Bereich zu erfassen. Beim Skalieren von Regionen führte diese Technik jedoch manchmal zu geringfügigen Fehlalignments, wodurch sie weniger effektiv war – insbesondere bei kleinen oder überlappenden Objekten.

Mask R-CNN verbessert dies durch eine Technik namens ROI Align (Ausrichtung der Interessensregion). Statt Koordinaten wie bei ROI Pooling zu runden, verwendet ROI Align eine bilineare Interpolation, um Pixelwerte präziser zu schätzen. Die bilineare Interpolation berechnet einen neuen Pixelwert, indem sie die Werte der vier nächsten Nachbarn mittelt, wodurch weichere Übergänge entstehen. Dadurch bleiben die Merkmale korrekt am ursprünglichen Bild ausgerichtet, was zu einer präziseren Objekt­erkennung und Segmentierung führt.

Bei einem Fußballspiel könnten beispielsweise zwei dicht beieinander stehende Spieler aufgrund ihrer überlappenden Begrenzungsrahmen miteinander verwechselt werden. ROI Align hilft dabei, sie zu trennen, indem ihre Formen klar voneinander abgegrenzt bleiben.

Darstellung der Verwendung von ROI Align durch Mask R-CNN

Abb. 4: Mask R-CNN verwendet ROI Align.

Klassifizieren von Objekten und Vorhersagen ihrer Masken#

Sobald ROI Align das Bild verarbeitet hat, besteht der nächste Schritt darin, Objekte zu klassifizieren und ihre Positionen zu optimieren. Das Modell betrachtet jede extrahierte Region und entscheidet, welches Objekt sie enthält. Es weist verschiedenen Kategorien eine Wahrscheinlichkeitsbewertung zu und wählt die beste Übereinstimmung aus.

Gleichzeitig passt es die Begrenzungsrahmen an, damit sie besser zu den Objekten passen. Die ursprünglichen Rahmen sind möglicherweise nicht optimal platziert. Durch die Anpassung wird die Genauigkeit verbessert, da jeder Rahmen das erkannte Objekt eng umschließt.

Zum Schluss geht Mask R-CNN noch einen Schritt weiter und erzeugt parallel für jedes Objekt eine detaillierte Segmentierungsmaske.

Mask R-CNN und seine Echtzeitanwendungen#

Als dieses Modell veröffentlicht wurde, stieß es in der KI-Community auf große Begeisterung und wurde bald in verschiedenen Anwendungen eingesetzt. Seine Fähigkeit, Objekte in Echtzeit zu erkennen und zu segmentieren, stellte für zahlreiche Branchen einen Wendepunkt dar.

Gefährdete Tiere in freier Wildbahn zu verfolgen, ist beispielsweise eine anspruchsvolle Aufgabe. Viele Arten bewegen sich durch dichte Wälder, wodurch es für Naturschutzorganisationen schwierig ist, sie im Blick zu behalten. Herkömmliche Methoden nutzen Fotofallen, Drohnen und Satellitenbilder. Die manuelle Auswertung dieser Daten ist jedoch zeitaufwendig. Fehlidentifikationen und übersehene Sichtungen können die Naturschutzarbeit verlangsamen.

Indem Mask R-CNN einzigartige Merkmale wie Tigerstreifen, Giraffenflecken oder die Form von Elefantenohren erkennt, kann es Tiere in Bildern und Videos genauer erkennen und segmentieren. Selbst wenn Tiere teilweise von Bäumen verdeckt werden oder dicht beieinander stehen, kann das Modell sie voneinander trennen und jedes einzelne identifizieren. Dadurch wird die Überwachung von Wildtieren schneller und zuverlässiger.

Erkennen und Segmentieren von Tieren mit Mask R-CNN

Abb. 5: Erkennen und Segmentieren von Tieren mit Mask R-CNN.

Einschränkungen von Mask R-CNN#

Trotz seiner historischen Bedeutung für die Objekterkennung und Segmentierung bringt Mask R-CNN auch einige wesentliche Nachteile mit sich. Hier sind einige Herausforderungen im Zusammenhang mit Mask R-CNN:

  • Hoher Rechenaufwand: Das Modell benötigt leistungsstarke GPUs, wodurch sein Betrieb teuer und die Verarbeitung großer Datenmengen langsam sein kann.
  • Geringere Verarbeitungsgeschwindigkeit: Durch den mehrstufigen Prozess ist das Modell langsamer als schnellere Echtzeitmodelle wie YOLO, was für zeitkritische Aufgaben möglicherweise nicht ideal ist.
  • Abhängigkeit von hochwertigen Daten: Das Modell erzielt die besten Ergebnisse mit klaren, gut beschrifteten Bildern. Unscharfe oder schlecht beleuchtete Bilder können seine Genauigkeit deutlich verringern.
  • Komplexe Implementierung: Die mehrstufige Architektur kann schwierig einzurichten und zu optimieren sein, insbesondere bei großen Datensätzen oder begrenzten Ressourcen.

Von Mask R-CNN zu Ultralytics YOLO11#

Mask R-CNN eignete sich hervorragend für Segmentierungsaufgaben, doch viele Branchen wollten Computer Vision einsetzen und dabei Geschwindigkeit sowie Echtzeitverarbeitung priorisieren. Diese Anforderung führte zur Entwicklung einstufiger Modelle, die Objekte in einem einzigen Durchlauf erkennen und dadurch die Effizienz deutlich steigern.

Im Gegensatz zum mehrstufigen Prozess von Mask R-CNN konzentrieren sich einstufige Computer-Vision-Modelle wie YOLO (You Only Look Once) auf Computer-Vision-Aufgaben in Echtzeit. Statt Erkennung und Segmentierung getrennt zu verarbeiten, können YOLO-Modelle ein Bild in einem einzigen Durchlauf analysieren. Dadurch eignen sie sich ideal für Anwendungen wie autonomes Fahren, Gesundheitswesen, Fertigung und Robotik, bei denen schnelle Entscheidungen entscheidend sind.

Insbesondere geht Ultralytics YOLO11 noch einen Schritt weiter, da es sowohl schnell als auch präzise ist. Es verwendet 22 % weniger Parameter als YOLOv8m und erzielt dennoch eine höhere mittlere durchschnittliche Präzision (mAP) auf dem COCO-Datensatz, erkennt Objekte also genauer. Die verbesserte Verarbeitungsgeschwindigkeit macht es zu einer guten Wahl für Echtzeitanwendungen, bei denen jede Millisekunde zählt.

Leistung von Ultralytics YOLO11 im Vergleich zu anderen Modellen

Abb. 6: Die Leistung von YOLO11 im Vergleich zu anderen Modellen.

Wichtige Erkenntnisse#

Rückblickend auf die Geschichte von Computer Vision gilt Mask R-CNN als bedeutender Durchbruch in der Objekterkennung und Segmentierung. Dank seines detaillierten mehrstufigen Prozesses liefert es selbst in komplexen Umgebungen sehr präzise Ergebnisse.

Dieser Prozess macht das Modell jedoch langsamer als Echtzeitmodelle wie YOLO. Da der Bedarf an Geschwindigkeit und Effizienz zunimmt, verwenden viele Anwendungen inzwischen einstufige Modelle wie Ultralytics YOLO11, die eine schnelle und präzise Objekterkennung ermöglichen. Mask R-CNN ist zwar wichtig, um die Entwicklung von Computer Vision zu verstehen, doch der Trend zu Echtzeitlösungen verdeutlicht die wachsende Nachfrage nach schnelleren und effizienteren Computer-Vision-Lösungen.

Werde Teil unserer wachsenden Community! Besuche unser GitHub-Repository, um mehr über KI zu erfahren. Möchtest du eigene Computer-Vision-Projekte starten? Sieh dir unsere Lizenzierungsoptionen an. Entdecke KI in der Landwirtschaft und Computer Vision im Gesundheitswesen auf unseren Lösungsseiten!

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens