Ultralytics YOLO27:
Vision-KI

Was ist R-CNN? Ein kurzer Überblick

Erfahre mehr über RCNN und seine Auswirkungen auf die Objekterkennung. Wir behandeln die wichtigsten Komponenten, Anwendungen und die Rolle bei der Weiterentwicklung von Verfahren wie Fast RCNN und YOLO.

ABAbirami Vina8 min read
Wie R-CNN eine regionsbasierte Objekterkennung durchführt

Objekterkennung ist eine Aufgabe der Computer Vision, bei der Objekte in Bildern oder Videos für Anwendungen wie autonomes Fahren, Überwachung und medizinische Bildgebung erkannt und lokalisiert werden können. Frühere Verfahren zur Objekterkennung, etwa der Viola-Jones-Detektor und Histogramme orientierter Gradienten (HOG) mit Support-Vektor-Maschinen (SVM), beruhten auf von Hand entwickelten Merkmalen und gleitenden Fenstern. Diese Verfahren hatten häufig Schwierigkeiten, Objekte in komplexen Szenen mit mehreren Objekten unterschiedlicher Form und Größe präzise zu erkennen.

Region-basierte Faltungsneuronale Netze (R-CNN) haben die Herangehensweise an die Objekterkennung verändert. Sie stellen einen wichtigen Meilenstein in der Geschichte der Computer Vision dar. Um zu verstehen, wie Modelle wie Ultralytics YOLOv8 entstanden sind, müssen wir zunächst Modelle wie R-CNN verstehen.

Die von Ross Girshick und seinem Team entwickelte R-CNN-Modellarchitektur erzeugt Regionsvorschläge, extrahiert Merkmale mit einem vortrainierten Faltungsneuronalen Netz (CNN), klassifiziert Objekte und verfeinert Begrenzungsrahmen. Das mag zunächst anspruchsvoll wirken, aber am Ende dieses Artikels wirst du genau verstehen, wie R-CNN funktioniert und warum es so wirkungsvoll ist. Sehen wir uns das an!

Wie funktioniert R-CNN?#

Der Prozess der Objekterkennung mit dem R-CNN-Modell umfasst drei Hauptschritte: das Erzeugen von Regionsvorschlägen, die Merkmalsextraktion und die Klassifizierung von Objekten bei gleichzeitiger Verfeinerung ihrer Begrenzungsrahmen. Sehen wir uns jeden Schritt an.

Diagramm zur Funktionsweise von R-CNN

Abb. 1 Funktionsweise von R-CNN.

Regionsvorschläge: Das Rückgrat von R-CNN#

Im ersten Schritt durchsucht das R-CNN-Modell das Bild, um zahlreiche Regionsvorschläge zu erstellen. Regionsvorschläge sind mögliche Bereiche, die Objekte enthalten könnten. Verfahren wie Selective Search untersuchen verschiedene Aspekte des Bildes, etwa Farbe, Textur und Form, und teilen es in unterschiedliche Bereiche auf. Selective Search beginnt damit, das Bild in kleinere Bereiche zu unterteilen, und führt anschließend ähnliche Bereiche zu größeren interessanten Gebieten zusammen. Dieser Vorgang wird fortgesetzt, bis etwa 2.000 Regionsvorschläge erzeugt wurden.

Diagramm zur Funktionsweise von Selective Search

Abb. 2 Funktionsweise von Selective Search.

Diese Regionsvorschläge helfen dabei, alle möglichen Stellen zu identifizieren, an denen sich ein Objekt befinden könnte. In den folgenden Schritten kann das Modell die relevantesten Bereiche effizient verarbeiten, indem es sich auf diese spezifischen Bereiche statt auf das gesamte Bild konzentriert. Die Verwendung von Regionsvorschlägen schafft ein Gleichgewicht zwischen gründlicher Analyse und Recheneffizienz.

Merkmalsextraktion aus Bildern: Details erfassen#

Im nächsten Schritt des Objekterkennungsprozesses von R-CNN werden Merkmale aus den Regionsvorschlägen extrahiert. Jeder Regionsvorschlag wird auf eine einheitliche Größe gebracht, die das CNN erwartet, beispielsweise 224x224 Pixel. Die Größenanpassung hilft dem CNN, jeden Vorschlag effizient zu verarbeiten. Vor der Verformung wird die Größe jedes Regionsvorschlags geringfügig erweitert, um 16 zusätzliche Pixel Kontext rund um den Bereich einzubeziehen und dadurch mehr Umgebungsinformationen für eine bessere Merkmalsextraktion bereitzustellen.

Nach der Größenanpassung werden diese Regionsvorschläge einem CNN wie AlexNet zugeführt, das üblicherweise auf einem großen Datensatz wie ImageNet vortrainiert wurde. Das CNN verarbeitet jeden Bereich, um hochdimensionale Merkmalsvektoren zu extrahieren, die wichtige Details wie Kanten, Texturen und Muster erfassen. Diese Merkmalsvektoren verdichten die wesentlichen Informationen aus den Bereichen. Sie wandeln die Rohdaten des Bildes in ein Format um, das das Modell für die weitere Analyse verwenden kann. Die präzise Klassifizierung und Lokalisierung von Objekten in den nächsten Phasen hängt entscheidend von dieser Umwandlung visueller Informationen in aussagekräftige Daten ab.

Extraktion von Merkmalen aus einem Regionsvorschlag mit AlexNet

Abb. 3 Merkmale aus einem Regionsvorschlag mit AlexNet extrahieren.

Objektklassifizierung: Erkannte Objekte identifizieren#

Im dritten Schritt werden die Objekte innerhalb dieser Bereiche klassifiziert. Das bedeutet, die Kategorie oder Klasse jedes in den Vorschlägen gefundenen Objekts zu bestimmen. Die extrahierten Merkmalsvektoren werden anschließend einem Klassifikator für maschinelles Lernen zugeführt.

Bei R-CNN werden hierfür häufig Support-Vektor-Maschinen (SVMs) eingesetzt. Jede SVM wird darauf trainiert, eine bestimmte Objektklasse zu erkennen, indem sie die Merkmalsvektoren analysiert und entscheidet, ob ein bestimmter Bereich ein Objekt dieser Klasse enthält. Im Wesentlichen gibt es für jede Objektkategorie einen eigenen Klassifikator, der jeden Regionsvorschlag auf das jeweilige Objekt überprüft.

Während des Trainings erhalten die Klassifikatoren annotierte Daten mit positiven und negativen Beispielen:

  • Positive Beispiele: Bereiche, die das Zielobjekt enthalten.
  • Negative Beispiele: Bereiche ohne das Objekt.

Die Klassifikatoren lernen, zwischen diesen Beispielen zu unterscheiden. Die Regression der Begrenzungsrahmen verfeinert außerdem Position und Größe der erkannten Objekte, indem die zunächst vorgeschlagenen Begrenzungsrahmen so angepasst werden, dass sie besser mit den tatsächlichen Objektgrenzen übereinstimmen. Durch die Kombination aus Klassifizierung und Regression der Begrenzungsrahmen kann das R-CNN-Modell Objekte identifizieren und präzise lokalisieren.

Beispiel für die Regression von Begrenzungsrahmen

Abb. 4. Beispiel für die Regression von Begrenzungsrahmen. (Quelle: towardsdatascience.com)

Alles zusammenführen: Erkennungen mit NMS verfeinern#

Nach den Schritten der Klassifizierung und der Regression der Begrenzungsrahmen erzeugt das Modell häufig mehrere überlappende Begrenzungsrahmen für dasselbe Objekt. Zur Verfeinerung dieser Erkennungen wird die Unterdrückung nicht maximaler Werte (NMS) angewendet, wobei die präzisesten Rahmen beibehalten werden. Das Modell entfernt durch die Anwendung von NMS redundante und überlappende Rahmen und behält nur die Erkennungen mit der höchsten Konfidenz.

NMS bewertet die Konfidenzwerte aller Begrenzungsrahmen, die angeben, wie wahrscheinlich ein erkanntes Objekt tatsächlich vorhanden ist, und unterdrückt diejenigen, die sich deutlich mit Rahmen mit höheren Werten überschneiden.

Beispiel für die Unterdrückung nicht maximaler Werte

Abb. 5. Beispiel für die Unterdrückung nicht maximaler Werte. (Quelle: towardsdatascience.com)

Hier ist eine Übersicht über die Schritte bei NMS:

  • Sortierung: Die Begrenzungsrahmen werden absteigend nach ihren Konfidenzwerten sortiert.
  • Auswahl: Der Rahmen mit dem höchsten Wert wird ausgewählt, und alle Rahmen, die sich mit ihm deutlich überschneiden (basierend auf Intersection over Union, IoU), werden entfernt.
  • Iteration: Dieser Vorgang wird für den Rahmen mit dem nächsthöchsten Wert wiederholt und fortgesetzt, bis alle Rahmen verarbeitet wurden.

Zusammengefasst erkennt das R-CNN-Modell Objekte, indem es Regionsvorschläge erzeugt, Merkmale mit einem CNN extrahiert, Objekte klassifiziert und ihre Positionen durch die Regression der Begrenzungsrahmen verfeinert und die Unterdrückung nicht maximaler Werte (NMS) verwendet, um nur die präzisesten Erkennungen beizubehalten.

R-CNN ist ein Meilenstein in der Objekterkennung#

R-CNN ist ein wegweisendes Modell in der Geschichte der Objekterkennung, da es einen neuen Ansatz eingeführt hat, der Genauigkeit und Leistung deutlich verbesserte. Vor R-CNN hatten Objekterkennungsmodelle Schwierigkeiten, Geschwindigkeit und Präzision miteinander in Einklang zu bringen. Die Methode von R-CNN, Regionsvorschläge zu erzeugen und CNNs zur Merkmalsextraktion zu verwenden, ermöglicht eine präzise Lokalisierung und Identifizierung von Objekten in Bildern.

R-CNN ebnete den Weg für Modelle wie Fast R-CNN, Faster R-CNN und Mask R-CNN, die Effizienz und Genauigkeit weiter verbesserten. Durch die Kombination von Deep Learning und regionenbasierter Analyse setzte R-CNN einen neuen Standard in diesem Bereich und eröffnete Möglichkeiten für verschiedene Anwendungen in der Praxis.

Medizinische Bildgebung mit R-CNN verändern#

Ein interessantes Einsatzgebiet von R-CNN ist die medizinische Bildgebung. R-CNN-Modelle wurden verwendet, um verschiedene Arten von Tumoren, beispielsweise Hirntumoren, in medizinischen Aufnahmen wie MRT- und CT-Scans zu erkennen und zu klassifizieren. Der Einsatz des R-CNN-Modells in der medizinischen Bildgebung verbessert die diagnostische Genauigkeit und hilft Radiologinnen und Radiologen, bösartige Veränderungen frühzeitig zu erkennen. Die Fähigkeit von R-CNN, selbst kleine Tumoren und Tumoren im Frühstadium zu erkennen, kann die Behandlung und Prognose von Krankheiten wie Krebs maßgeblich beeinflussen.

Erkennung von Hirntumoren mit R-CNN

Abb. 6 Erkennung von Hirntumoren mit RCNN.

Das R-CNN-Modell kann neben der Tumorerkennung auch für andere Aufgaben der medizinischen Bildgebung eingesetzt werden. So kann es beispielsweise Frakturen identifizieren, Netzhauterkrankungen in Augenaufnahmen erkennen und Lungenbilder auf Erkrankungen wie Lungenentzündung und COVID-19 analysieren. Unabhängig vom medizinischen Problem kann eine frühe Erkennung zu besseren Behandlungsergebnissen führen. Durch die Präzision von R-CNN bei der Identifizierung und Lokalisierung von Auffälligkeiten können Gesundheitsdienstleister die Zuverlässigkeit und Geschwindigkeit medizinischer Diagnosen verbessern. Da die Objekterkennung den Diagnoseprozess effizienter gestaltet, können Patientinnen und Patienten von zeitnahen und präzisen Behandlungsplänen profitieren.

Die Grenzen von R-CNN und seine Nachfolger#

R-CNN ist zwar beeindruckend, hat aber bestimmte Nachteile, etwa eine hohe Rechenkomplexität und langsame Inferenzzeiten. Dadurch eignet sich das R-CNN-Modell nicht für Echtzeitanwendungen. Die Trennung von Regionsvorschlägen und Klassifizierung in eigenständige Schritte kann zu einer geringeren Effizienz führen.

Im Laufe der Jahre wurden verschiedene Modelle zur Objekterkennung entwickelt, die diese Probleme behoben haben. Fast R-CNN kombiniert Regionsvorschläge und CNN-Merkmalsextraktion in einem einzigen Schritt und beschleunigt dadurch den Prozess. Faster R-CNN führt ein Netzwerk zur Erzeugung von Regionsvorschlägen (RPN) ein, um die Generierung von Vorschlägen zu optimieren, während Mask R-CNN eine Segmentierung auf Pixelebene für detailliertere Erkennungen ergänzt.

Vergleich von R-CNN, Fast R-CNN, Faster R-CNN und Mask R-CNN

Abb. 7. Vergleich von R-CNN, Fast R-CNN, Faster R-CNN und Mask R-CNN.

Etwa zur gleichen Zeit wie Faster R-CNN begann die YOLO-Serie (Du siehst nur einmal) damit, die Echtzeit-Objekterkennung voranzutreiben. YOLO-Modelle sagen Begrenzungsrahmen und Klassenwahrscheinlichkeiten in einem einzigen Durchlauf durch das Netzwerk voraus. Beispielsweise bietet Ultralytics YOLOv8 mit fortschrittlichen Funktionen eine höhere Genauigkeit und Geschwindigkeit für zahlreiche Aufgaben der Computer Vision.

Wichtige Erkenntnisse#

RCNN hat die Computer Vision grundlegend verändert und gezeigt, wie Deep Learning die Objekterkennung verbessern kann. Sein Erfolg inspirierte viele neue Ideen in diesem Bereich. Auch wenn neuere Modelle wie Faster R-CNN und YOLO entwickelt wurden, um die Schwächen von RCNN zu beheben, bleibt sein Beitrag ein wichtiger Meilenstein, an den man sich erinnern sollte.

Mit dem Fortschritt der Forschung werden wir noch bessere und schnellere Modelle zur Objekterkennung sehen. Diese Entwicklungen werden nicht nur das Verständnis von Maschinen für die Welt verbessern, sondern auch den Fortschritt in vielen Branchen vorantreiben. Die Zukunft der Objekterkennung sieht vielversprechend aus!

Möchtest du weiterhin mehr über KI erfahren? Werde Teil der Ultralytics-Community! Sieh dir unser GitHub-Repository an, um unsere neuesten Innovationen im Bereich der künstlichen Intelligenz kennenzulernen. Entdecke unsere KI-Lösungen für verschiedene Bereiche wie Landwirtschaft und Fertigung. Mach mit, lerne dazu und entwickle dich weiter!

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens