Bounding Box
Lerne, wie Bounding Boxes Objektpositionen in der Computer Vision definieren. Erforsche Koordinatenformate, reale Anwendungen und wie du Ultralytics YOLO26 verwendest.
A bounding box is a rectangular region defined by a set of coordinates that encloses a specific object within an image or video frame. In the field of computer vision (CV), these boxes serve as the fundamental annotations for teaching artificial intelligence (AI) systems how to locate and recognize distinct items. Rather than simply classifying an entire image as "containing a car," a bounding box allows a model to pinpoint the exact location and spatial extent of the car, separating it from the background and other entities. This localization capability is essential for object detection tasks, where the goal is to identify multiple objects simultaneously with high precision.
Grundlegende Konzepte und Koordinaten#
Um visuelle Daten effektiv zu verarbeiten, stützen sich machine learning (ML) Modelle auf spezifische Koordinatensysteme, um Bounding Boxes mathematisch darzustellen. Das gewählte Format bestimmt oft, wie Daten für das model training vorbereitet werden und wie das Modell seine Vorhersagen ausgibt.
- XYXY Coordinates: Dieses Format definiert eine Box mithilfe der absoluten Pixelwerte der oberen linken und der unteren rechten Ecke. Es ist intuitiv für Visualisierungstools wie OpenCV oder Matplotlib, wenn Rechtecke direkt auf Bilder gezeichnet werden.
- XYWH Format: Diese Methode ist in Datensätzen wie COCO verbreitet und gibt den Mittelpunkt des gefolgt von der Breite und Höhe der Box an. Diese Darstellung ist entscheidend für die Berechnung von loss functions während des Lernprozesses.
- Normalized Coordinates: Um die scalability über Bilder unterschiedlicher Auflösungen hinweg sicherzustellen, werden Koordinaten oft auf einen Bereich zwischen 0 und 1 skaliert. Dies hilft Modellen, bei der Analyse von Eingaben mit variierenden Dimensionen besser zu verallgemeinern.
Praxisanwendungen#
Bounding Boxes sind die Bausteine für unzählige AI-Lösungen in verschiedenen Branchen. Durch die Ermöglichung präziser Lokalisierung erlauben sie Systemen, intelligent mit der physischen Welt zu interagieren.
- Autonomous Vehicles: Selbstfahrende Autos verwenden Bounding Boxes, um Fußgänger, andere Fahrzeuge, Verkehrsschilder und Hindernisse in Echtzeit zu erkennen und zu verfolgen. Dieses räumliche Bewusstsein ist für Navigations- und Sicherheitssysteme von entscheidender Bedeutung, um Entscheidungen in Bruchteilen von Sekunde zu treffen.
- Retail Analytics: In intelligenten Geschäften helfen Bounding Boxes dabei, den Bestand in Regalen zu überwachen und Kundeninteraktionen mit Produkten zu verfolgen. Diese Daten können die Bestandsauffüllung automatisieren und Einblicke in das Käuferverhalten bieten, ohne dass manuell gezählt werden muss.
Bounding Boxes im Einsatz#
Bei der Verwendung moderner Architekturen wie YOLO26 sagt das Modell Bounding Boxes zusammen mit einem Klassenlabel und einem confidence score voraus. Das folgende Beispiel veranschaulicht, wie man eine Inferenz auf einem Bild durchführt und mit dem Paket ultralytics auf die Bounding-Box-Koordinaten zugreift.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])Verwandte Begriffe und Unterscheidung#
Während Bounding Boxes Standard für die allgemeine Erkennung sind, unterscheiden sie sich von anderen Annotationstypen, die für granularere Aufgaben verwendet werden.
- Instance Segmentation: Im Gegensatz zu einem rechteckigen Bounding Box erstellt die Segmentierung eine pixelgenaue Maske, die die genaue Kontur eines Objekts nachzeichnet. Dies ist nützlich, wenn die genaue Form wichtiger ist als der allgemeine Standort.
- Oriented Bounding Box (OBB): Standardmäßige Bounding Boxes sind achsenausgerichtet (aufrechte Rechtecke). OBBs können gedreht werden, um winklige Objekte wie Schiffe in Satellitenbildern oder Pakete auf einem Förderband einzupassen, was eine engere Passform ermöglicht und Hintergrundrauschen reduziert.
- Keypoints: Anstatt ein Objekt zu umschließen, identifizieren Keypoints spezifische Orientierungspunkte, wie etwa Gelenke an einem menschlichen Körper für die pose estimation.
Tools für Annotation und Verwaltung#
Das Erstellen hochwertiger Bounding-Box-Annotationen ist ein kritischer Schritt in der ML Pipeline. Die Ultralytics Platform vereinfacht diesen Prozess, indem sie Tools für die data annotation und das Datensatzmanagement bereitstellt. Eine ordnungsgemäße Annotation stellt sicher, dass Modelle lernen, Objekte präzise zu unterscheiden, und minimiert Fehler wie overfitting oder Hintergrundverwechslungen. Fortgeschrittene Techniken wie Non-Maximum Suppression (NMS) werden während der Inferenz verwendet, um diese Vorhersagen zu verfeinern, indem überlappende Boxen entfernt werden, sodass für jedes Objekt nur die genaueste Erkennung übrig bleibt.






