Two-Stage Object Detectors
Entdecke die Funktionsweise zweistufiger Objektdetektoren mit Schwerpunkt auf Regionsvorschlägen und Klassifizierung. Erfahre, warum moderne Modelle wie Ultralytics YOLO26 heute führend sind.
Zweistufige Objektdetektoren sind eine anspruchsvolle Klasse von Architekturen für Deep Learning (DL), die in der Computer Vision eingesetzt werden, um Objekte in einem Bild zu erkennen und zu lokalisieren. Im Gegensatz zu ihren einstufigen Gegenstücken, die die Erkennung in einem einzigen Durchlauf durchführen, teilen diese Modelle die Aufgabe in zwei unterschiedliche Phasen auf: Regionsvorschlag und Objektklassifizierung. Dieser zweigeteilte Ansatz wurde entwickelt, um eine hohe Lokalisierungsgenauigkeit zu priorisieren, wodurch diese Detektoren in der Entwicklung der künstlichen Intelligenz (AI) historisch bedeutsam wurden. Durch die Trennung von „wo“ und „was“ erreichen zweistufige Detektoren häufig eine höhere Präzision, insbesondere bei kleinen oder verdeckten Objekten. Dies geht jedoch typischerweise mit einem höheren Bedarf an Rechenressourcen und einer längeren Inferenzlatenz einher.
Der zweistufige Prozess#
Die Architektur eines zweistufigen Detektors basiert auf einem sequenziellen Ablauf, der nachahmt, wie ein Mensch eine Szene sorgfältig untersuchen könnte.
-
Regionsvorschlag: In der ersten Phase durchsucht das Modell das Eingabebild, um mögliche Bereiche zu identifizieren, in denen sich Objekte befinden könnten. Eine als Netzwerk für Regionsvorschläge (RPN) bekannte Komponente erzeugt eine dünne Menge von Kandidatenrahmen, die häufig als Interessensbereiche (RoIs) bezeichnet werden. Diese Phase filtert den Großteil des Hintergrunds heraus, sodass sich das Netzwerk auf relevante Bereiche konzentrieren kann.
-
Klassifizierung und Verfeinerung: In der zweiten Phase extrahiert das Modell mithilfe faltungsneuronaler Netze (CNNs) Merkmale aus diesen Kandidatenbereichen. Anschließend weist es jedem Bereich eine bestimmte Klassenbezeichnung (z. B. „Person“ oder „Fahrzeug“) zu und verfeinert die Koordinaten des Begrenzungsrahmens, sodass dieser das Objekt eng umschließt.
Zu den bekannten Beispielen dieser Architektur gehört die R-CNN-Familie, insbesondere Faster R-CNN und Mask R-CNN, die mehrere Jahre lang den Standard für akademische Benchmarks setzten.
Vergleich mit einstufigen Detektoren#
Es ist hilfreich, zweistufige Modelle von einstufigen Objektdetektoren wie dem Einzelbild-MultiBox-Detektor (SSD) und der Ultralytics-YOLO-Serie zu unterscheiden. Während zweistufige Modelle die Genauigkeit priorisieren, indem sie Bereiche getrennt verarbeiten, formulieren einstufige Modelle die Erkennung als Regressionsproblem, bei dem Bildpixel direkt auf Begrenzungsrahmenkoordinaten und Klassenwahrscheinlichkeiten abgebildet werden.
Historisch entstand dadurch ein Zielkonflikt: Zweistufige Modelle waren genauer, aber langsamer, während einstufige Modelle schneller, jedoch weniger präzise waren. Moderne Fortschritte haben diese Grenze jedoch zunehmend verwischt. Hochmoderne Modelle wie YOLO26 verwenden inzwischen durchgängige Architekturen, die bei der Genauigkeit mit zweistufigen Detektoren konkurrieren und gleichzeitig die für Echtzeitinferenz erforderliche Geschwindigkeit beibehalten.
Anwendungen in der Praxis#
Aufgrund ihrer Ausrichtung auf Präzision und Trefferquote werden zweistufige Detektoren häufig in Szenarien bevorzugt, in denen Sicherheit und Detailgenauigkeit wichtiger sind als die reine Verarbeitungsgeschwindigkeit.
- Medizinische diagnostische Bildgebung: Im Bereich der künstlichen Intelligenz im Gesundheitswesen kann eine übersehene Diagnose schwerwiegende Folgen haben. Zweistufige Architekturen werden häufig in der medizinischen Bildanalyse eingesetzt, um Anomalien wie Tumore in Röntgen- oder MRT-Aufnahmen zu erkennen. Der mehrstufige Prozess trägt dazu bei, dass kleine Läsionen vor komplexen Gewebehintergründen nicht übersehen werden, und bietet Radiologen eine automatisierte Unterstützung mit hoher Zuverlässigkeit.
- Industrielle Inspektion mit hoher Präzision: In der intelligenten Fertigung nutzen automatisierte visuelle Inspektionssysteme diese Modelle, um mikroskopisch kleine Defekte an Montagelinien zu erkennen. So erfordert beispielsweise die Erkennung eines Haarrisses in einem Turbinenblatt die hohe Genauigkeit der Schnittmenge über die Vereinigung (IoU), die zweistufige Detektoren bieten, damit nur fehlerfreie Komponenten in die nächste Produktionsstufe gelangen.
Implementierung moderner Erkennung#
Während zweistufige Detektoren die Grundlage für hochgenaue Bildverarbeitung geschaffen haben, nutzen moderne Entwickler häufig fortschrittliche einstufige Modelle, die eine vergleichbare Leistung bei deutlich einfacheren Bereitstellungsabläufen bieten. Die Ultralytics Platform vereinfacht das Training und die Bereitstellung dieser Modelle und verwaltet Datensätze und Rechenressourcen effizient.
Das folgende Python-Beispiel zeigt, wie du mithilfe von ultralytics ein modernes Verfahren zur Objekterkennung laden und eine Inferenz ausführen kannst. Dabei werden Ergebnisse mit hoher Genauigkeit erzielt, die traditionellen zweistufigen Ansätzen ähneln, jedoch eine höhere Effizienz bieten:
from ultralytics import YOLO
# Load the YOLO26 model, a modern high-accuracy detector
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Process results (bounding boxes, classes, and confidence scores)
for result in results:
result.show() # Display the detection outcomes
print(result.boxes.conf) # Print confidence scores








