Detection Head
Lerne, wie ein Erkennungskopf die Objekterkennung in Echtzeit ermöglicht. Erfahre mehr über seine Rolle in Ultralytics YOLO26 bei der präzisen Vorhersage von Begrenzungsrahmen und Bezeichnungen.
Ein Erkennungskopf fungiert als abschließende Entscheidungsebene in der Architektur eines neuronalen Netzwerks zur Objekterkennung. Während die früheren Schichten des Modells für das Verständnis der Formen, Texturen und Merkmale in einem Bild zuständig sind, ist der Erkennungskopf die Komponente, die diese Informationen interpretiert, um genau vorherzusagen, welche Objekte vorhanden sind und wo sie sich befinden. Er wandelt die abstrakten, auf hoher Ebene liegenden Daten des Merkmalsextraktors in verwertbare Ergebnisse um und gibt typischerweise eine Reihe von Begrenzungsrahmen aus, die erkannte Objekte umschließen, zusammen mit den zugehörigen Klassenbezeichnungen und Konfidenzwerten.
Unterscheidung zwischen Erkennungskopf, Backbone und Neck#
Um die Funktion eines Erkennungskopfs vollständig zu verstehen, ist es hilfreich, sich moderne Detektoren als aus drei Hauptphasen bestehend vorzustellen, von denen jede einen bestimmten Zweck in der Pipeline der Bildverarbeitung (CV) erfüllt:
- Backbone: Dies ist der erste Teil des Netzwerks, häufig ein Faltungsneuronales Netzwerk (CNN) wie ResNet oder CSPNet. Es verarbeitet das rohe Eingabebild, um Merkmalskarten zu erzeugen, die visuelle Muster repräsentieren.
- Neck: Der Neck befindet sich zwischen Backbone und Erkennungskopf und verfeinert und kombiniert Merkmale aus verschiedenen Maßstäben. Architekturen wie das Pyramiden-Netzwerk für Merkmale (FPN) stellen durch die Zusammenführung von Kontext sicher, dass das Modell Objekte unterschiedlicher Größe erkennen kann.
- Erkennungskopf: Die abschließende Komponente, die die verfeinerten Merkmale des Neck verarbeitet. Sie führt die eigentliche Klassifizierung (was ist es?) und Regression (wo ist es?) durch.
Entwicklung: Ankerbasiert vs. ankerfrei#
Das Design von Erkennungsköpfen hat sich erheblich weiterentwickelt, um Geschwindigkeit und Genauigkeit zu verbessern, insbesondere durch den Übergang von traditionellen Methoden zu modernen Modellen für Echtzeitinferenz.
- Ankerbasierte Erkennungsköpfe: Traditionelle einstufige Objektdetektoren stützten sich auf vordefinierte Ankerrahmen – feste Referenzformen in verschiedenen Größen. Der Erkennungskopf sagte voraus, wie stark diese Anker gedehnt oder verschoben werden mussten, um zum Objekt zu passen. Dieser Ansatz wird in grundlegenden Forschungsarbeiten zu Faster R-CNN ausführlich beschrieben.
- Ankerfreie Erkennungsköpfe: Hochmoderne Modelle, darunter das neueste YOLO26, verwenden ankerfreie Detektoren. Diese Erkennungsköpfe sagen Objektmittelpunkte und Abmessungen direkt anhand der Pixel in den Merkmalskarten voraus, sodass eine manuelle Abstimmung von Ankern entfällt. Dadurch wird die Architektur vereinfacht und die Fähigkeit des Modells verbessert, auf neue Objektformen zu generalisieren – eine Technik, die häufig mit der vollständig faltenden einstufigen Objekterkennung (FCOS) in Verbindung gebracht wird.
Anwendungen in der Praxis#
Die Präzision des Erkennungskopfs ist entscheidend für den Einsatz von künstlicher Intelligenz (AI) in sicherheitskritischen und industriellen Umgebungen. Mit der Ultralytics Platform können Nutzer Daten einfach annotieren und diese spezialisierten Erkennungsköpfe trainieren.
- Autonomes Fahren: Im Bereich AI für die Automobilindustrie ist der Erkennungskopf dafür zuständig, Fußgänger, Ampeln und andere Fahrzeuge in Echtzeit voneinander zu unterscheiden. Ein hochoptimierter Erkennungskopf stellt sicher, dass die Inferenzlatenz niedrig genug bleibt, damit das Fahrzeug sofort reagieren kann.
- Medizinische Diagnostik: In der medizinischen Bildanalyse werden Erkennungsköpfe darauf abgestimmt, Anomalien wie Tumore in MRT-Aufnahmen zu lokalisieren. Der Regressionszweig muss äußerst präzise sein, um die exakten Grenzen einer Läsion zu bestimmen und Ärztinnen und Ärzte bei Lösungen für das Gesundheitswesen zu unterstützen.
Codebeispiel#
Das folgende Beispiel zeigt, wie ein YOLO26-Modell geladen und die Ausgabe seines Erkennungskopfs untersucht wird. Bei der Inferenz verarbeitet der Erkennungskopf das Bild und gibt das abschließende boxes mit Koordinaten und Klassen-IDs zurück.
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to utilize the detection head
results = model("https://ultralytics.com/images/bus.jpg")
# The detection head outputs are stored in results[0].boxes
for box in results[0].boxes:
# Print the bounding box coordinates and the predicted class
print(f"Class: {int(box.cls)}, Coordinates: {box.xywh.numpy()}")Diese Interaktion verdeutlicht, wie der Erkennungskopf komplexe Aktivierungen des neuronalen Netzwerks in lesbare Daten umwandelt, die Entwickler für nachgelagerte Aufgaben wie Objektverfolgung oder Zählen verwenden können.









