Object Detection
Entdecke die Grundlagen der Objekterkennung. Erfahre, wie Ultralytics YOLO26 Objekte in Echtzeit mit unübertroffener Geschwindigkeit und Genauigkeit identifiziert und lokalisiert.
Objekterkennung ist eine zentrale Technologie im Bereich Computervision (CV), mit der Computersysteme bestimmte Objekte in visuellen Daten identifizieren und lokalisieren können. Im Gegensatz zu einfacheren Aufgaben der Bildklassifizierung, bei denen einem gesamten Bild eine einzige Bezeichnung zugewiesen wird, ermöglicht die Objekterkennung ein detailliertes Verständnis, indem sie gleichzeitig die Klasse eines Objekts (z. B. „Person“, „Auto“, „Hund“) und dessen räumliche Position vorhersagt. Diese Position wird typischerweise durch einen rechteckigen Begrenzungsrahmen dargestellt, der das Objekt umschließt, zusammen mit einem Konfidenzwert, der die Sicherheit des Modells angibt. Diese doppelte Fähigkeit – Erkennung und Lokalisierung – bildet die sensorische Grundlage moderner Anwendungen der künstlichen Intelligenz (AI) und ermöglicht es Maschinen, sinnvoll mit ihrer Umgebung zu interagieren.
Die Funktionsweise der Erkennung#
Moderne Detektoren stützen sich stark auf Architekturen des Deep Learning (DL), insbesondere auf Faltungsneuronale Netze (CNNs), um komplexe Merkmale aus Eingabebildern zu extrahieren. Der Prozess beginnt mit einer Trainingsphase, in der ein Modell anhand umfangreicher, beschrifteter Sammlungen wie dem COCO-Datensatz lernt, Muster zu erkennen. In dieser Phase optimiert der Algorithmus seine Modellgewichte, um Vorhersagefehler zu minimieren.
Wenn das Modell zur Inferenz bereitgestellt wird, durchsucht es neue Bilder nach möglichen Objekten. Fortschrittliche Algorithmen wenden anschließend die Unterdrückung nichtmaximaler Werte (NMS) an, um doppelte Erkennungen herauszufiltern und sicherzustellen, dass jedes einzelne Objekt nur einmal hervorgehoben wird. Die Genauigkeit dieser Vorhersagen wird häufig anhand der Metrik Schnittmenge über Vereinigungsmenge (IoU) bewertet, die die Überschneidung zwischen dem vorhergesagten Rahmen und der Referenzannotation misst. Jüngste Fortschritte haben zu End-to-End-Architekturen wie YOLO26 geführt, die diese Pipeline für außergewöhnliche Geschwindigkeit und Inferenz in Echtzeit auf Edge-Geräten optimieren.
Wichtige Begriffe im Vergleich#
Für die Auswahl des richtigen Werkzeugs für ein Projekt ist es entscheidend, die Objekterkennung von verwandten Konzepten abzugrenzen:
- Objekterkennung im Vergleich zur Bildklassifizierung: Während die Bildklassifizierung die Frage „Was ist in diesem Bild?“ beantwortet, beantwortet die Objekterkennung die Frage „Was befindet sich wo?“
- Objekterkennung im Vergleich zur Instanzsegmentierung: Bei der Erkennung wird ein Rahmen um ein Objekt gezeichnet. Im Gegensatz dazu identifiziert die Instanzsegmentierung die exakte, pixelgenaue Kontur (Maske) jedes Objekts.
- Objekterkennung im Vergleich zur Objektverfolgung: Die Erkennung findet Objekte in einem einzelnen Bild. Die Objektverfolgung verknüpft diese Erkennungen über eine Videosequenz hinweg, um Bewegungen im Zeitverlauf zu überwachen.
Anwendungen in der Praxis#
Die Vielseitigkeit der Objekterkennung treibt Innovationen in wichtigen Branchen voran. Im Automobilsektor ist KI in autonomen Fahrzeugen in hohem Maß auf Erkennungsmodelle angewiesen, um Fußgänger, Verkehrsschilder und andere Fahrzeuge sofort zu identifizieren und sicher zu navigieren. Durch die Verarbeitung von Videobildern der Bordkameras treffen diese Systeme Entscheidungen in Sekundenbruchteilen, die Unfälle verhindern.
Ein weiterer wichtiger Anwendungsfall findet sich bei KI im Einzelhandel. Automatisierte Kassensysteme und intelligente Roboter zur Bestandsverwaltung nutzen die Objekterkennung, um Regale zu scannen, Produkte zu erkennen und fehlende oder falsch platzierte Artikel festzustellen. Diese Automatisierung optimiert Lieferketten und verbessert das Kundenerlebnis, indem sie sicherstellt, dass Produkte jederzeit verfügbar sind.
Objekterkennung implementieren#
Entwickler können Erkennungs-Workflows mithilfe des ultralytics-Python-Pakets einfach implementieren. Das folgende Beispiel zeigt, wie ein vortrainiertes YOLO26-Modell geladen und eine Inferenz auf einem Bild durchgeführt wird.
from ultralytics import YOLO
# Load the latest YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on an image from a URL
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results with bounding boxes
results[0].show()Für Teams, die ihre Abläufe skalieren möchten, bietet die Ultralytics Platform eine umfassende Umgebung, um Daten zu annotieren, benutzerdefinierte Modelle in der Cloud zu trainieren und sie in verschiedene Formate wie ONNX oder TensorRT bereitzustellen. Der Einsatz solcher Plattformen vereinfacht den MLOps-Lebenszyklus, sodass sich Ingenieure auf die Weiterentwicklung ihrer Anwendungen konzentrieren können, anstatt die Infrastruktur zu verwalten.









