Bounding Box
Erfahre, wie Begrenzungsrahmen Objektpositionen in der Computer Vision definieren. Entdecke Koordinatenformate, Anwendungen in der Praxis und die Verwendung von Ultralytics YOLO26.
Ein Begrenzungsrahmen ist ein rechteckiger Bereich, der durch eine Reihe von Koordinaten definiert wird und ein bestimmtes Objekt innerhalb eines Bildes oder Videoframes einschließt. Im Bereich der Computer Vision (CV) dienen diese Rahmen als grundlegende Annotationen, mit denen Systeme der künstlichen Intelligenz (AI) lernen, einzelne Objekte zu lokalisieren und zu erkennen. Statt ein gesamtes Bild einfach als „ein Auto enthaltend“ zu klassifizieren, ermöglicht ein Begrenzungsrahmen einem Modell, die genaue Position und räumliche Ausdehnung des Autos zu bestimmen und es vom Hintergrund sowie von anderen Objekten abzugrenzen. Diese Fähigkeit zur Lokalisierung ist für Aufgaben der Objekterkennung entscheidend, bei denen mehrere Objekte gleichzeitig mit hoher Präzision identifiziert werden sollen.
Grundlegende Konzepte und Koordinaten#
Um visuelle Daten effektiv zu verarbeiten, stützen sich Modelle des maschinellen Lernens (ML) auf bestimmte Koordinatensysteme, um Begrenzungsrahmen mathematisch darzustellen. Das gewählte Format bestimmt häufig, wie Daten für das Modelltraining aufbereitet werden und wie das Modell seine Vorhersagen ausgibt.
- XYXY-Koordinaten: Dieses Format definiert einen Rahmen anhand der absoluten Pixelwerte der oberen linken und der unteren rechten Ecke. Es ist intuitiv für Visualisierungswerkzeuge wie OpenCV oder Matplotlib, wenn Rechtecke direkt auf Bilder gezeichnet werden.
- XYWH-Format: Diese Methode ist in Datensätzen wie COCO üblich und gibt den Mittelpunkt des Objekts gefolgt von der Breite und Höhe des Rahmens an. Diese Darstellung ist entscheidend für die Berechnung von Verlustfunktionen während des Lernprozesses.
- Normalisierte Koordinaten: Damit die Skalierbarkeit über Bilder mit unterschiedlichen Auflösungen hinweg gewährleistet ist, werden Koordinaten häufig auf einen Bereich zwischen 0 und 1 skaliert. Dadurch können Modelle beim Analysieren von Eingaben mit unterschiedlichen Abmessungen besser verallgemeinern.
Anwendungen in der Praxis#
Begrenzungsrahmen sind die Grundlage unzähliger KI-Lösungen in verschiedensten Branchen. Durch die präzise Lokalisierung ermöglichen sie es Systemen, intelligent mit der physischen Welt zu interagieren.
- Autonome Fahrzeuge: Selbstfahrende Autos verwenden Begrenzungsrahmen, um Fußgänger, andere Fahrzeuge, Verkehrsschilder und Hindernisse in Echtzeit zu erkennen und zu verfolgen. Dieses räumliche Bewusstsein ist entscheidend, damit Navigations- und Sicherheitssysteme in Sekundenbruchteilen Entscheidungen treffen können.
- Einzelhandelsanalyse: In intelligenten Geschäften helfen Begrenzungsrahmen dabei, den Bestand in den Regalen zu überwachen und die Interaktionen von Kunden mit Produkten zu verfolgen. Diese Daten können die Nachbestückung automatisieren und ohne manuelles Zählen Einblicke in das Verhalten von Kunden liefern.
Begrenzungsrahmen in der Praxis#
Bei der Verwendung moderner Architekturen wie YOLO26 sagt das Modell Begrenzungsrahmen zusammen mit einer Klassenbezeichnung und einem Konfidenzwert voraus. Das folgende Beispiel zeigt, wie eine Inferenz auf einem Bild ausgeführt und auf die Koordinaten des Begrenzungsrahmens über das Paket ultralytics zugegriffen wird.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Access bounding box coordinates (xyxy format) for the first detected object
boxes = results[0].boxes
print(boxes.xyxy[0]) # Output: tensor([x1, y1, x2, y2, ...])Verwandte Begriffe und Abgrenzung#
Während Begrenzungsrahmen bei der allgemeinen Objekterkennung Standard sind, unterscheiden sie sich von anderen Annotationstypen, die für detailliertere Aufgaben verwendet werden.
- Instanzsegmentierung: Im Gegensatz zu einem rechteckigen Begrenzungsrahmen erzeugt die Segmentierung eine pixelgenaue Maske, die den exakten Umriss eines Objekts nachzeichnet. Das ist nützlich, wenn die genaue Form wichtiger ist als die allgemeine Position.
- Ausgerichteter Begrenzungsrahmen (OBB): Standardbegrenzungsrahmen sind achsenausgerichtet (aufrechte Rechtecke). OBBs können gedreht werden, um sich an schräg ausgerichtete Objekte anzupassen, etwa Schiffe in Satellitenbildern oder Pakete auf einem Förderband. Dadurch passen sie sich enger an und reduzieren Hintergrundstörungen.
- Schlüsselpunkte: Schlüsselpunkte umschließen ein Objekt nicht, sondern identifizieren bestimmte Orientierungspunkte, etwa Gelenke eines menschlichen Körpers für die Posenschätzung.
Werkzeuge für Annotation und Verwaltung#
Das Erstellen hochwertiger Annotationen für Begrenzungsrahmen ist ein entscheidender Schritt in der ML-Pipeline. Die Ultralytics Platform vereinfacht diesen Prozess durch Werkzeuge für die Datenannotation und die Verwaltung von Datensätzen. Eine korrekte Annotation stellt sicher, dass Modelle Objekte präzise unterscheiden lernen, und minimiert Fehler wie Überanpassung oder Verwechslungen mit dem Hintergrund. Fortschrittliche Techniken wie die Unterdrückung nicht maximaler Werte (NMS) werden während der Inferenz eingesetzt, um diese Vorhersagen durch das Entfernen überlappender Rahmen zu verfeinern und sicherzustellen, dass für jedes Objekt nur die genaueste Erkennung erhalten bleibt.









