Multi-Object Tracking (MOT)
Entdecke die Verfolgung mehrerer Objekte (MOT) in der Computer Vision. Erfahre, wie du Entitäten mit Ultralytics YOLO26 für autonomes Fahren, den Einzelhandel und weitere Anwendungen erkennst und verfolgst.
Verfolgung mehrerer Objekte (MOT) ist eine dynamische Aufgabe in der Computervision (CV), bei der mehrere unterschiedliche Entitäten innerhalb eines Videostreams erkannt und ihre Identitäten über die Zeit hinweg verfolgt werden. Im Gegensatz zur standardmäßigen Objekterkennung, bei der jedes Bild als isolierte Momentaufnahme behandelt wird, führt MOT eine zeitliche Dimension in die künstliche Intelligenz (AI) ein. Indem jeder erkannten Instanz eine eindeutige Identifikationsnummer (ID) zugewiesen wird – etwa einem bestimmten Fußgänger in einer Menschenmenge oder einem Fahrzeug auf einer Autobahn –, ermöglichen MOT-Algorithmen es Systemen, Bewegungsbahnen zu verfolgen, Verhalten zu analysieren und Interaktionen zu verstehen. Diese Fähigkeit ist grundlegend für das moderne Videoverständnis und ermöglicht es Maschinen, Kontinuität in einer sich verändernden Umgebung wahrzunehmen.
Funktionsweise von MOT#
Die meisten modernen Verfolgungssysteme arbeiten nach dem Prinzip „tracking by detection“. Dieser Ansatz teilt den Prozess in zwei Hauptphasen auf: Zuerst wird ermittelt, was sich im Bild befindet, anschließend werden diese Ergebnisse bekannten Objekten aus der Vergangenheit zugeordnet.
-
Erkennung: In jedem Bild durchsucht ein leistungsstarkes Modell wie YOLO26 die Aufnahme nach Objekten und erzeugt Begrenzungsrahmen sowie Klassenwahrscheinlichkeiten.
-
Bewegungsvorhersage: Um vorherzusagen, wohin sich ein Objekt als Nächstes bewegt, verwenden Algorithmen häufig einen Kalman-Filter. Dieses mathematische Werkzeug schätzt den Zustand eines dynamischen Systems – etwa Geschwindigkeit und Position – und hilft dabei, den Suchbereich im folgenden Bild einzugrenzen.
-
Datenzuordnung: Das System ordnet neue Erkennungen bestehenden Verfolgungsspuren zu. Optimierungsverfahren wie der ungarische Algorithmus lösen dieses Zuordnungsproblem, indem sie die Kosten der Zuordnung minimieren und sich dabei häufig auf Schnittmenge über Vereinigungsmenge (IoU) stützen, um die räumliche Überlappung zu messen.
-
Wiederidentifizierung (ReID): Wenn visuelle Verdeckungen auftreten – sogenannte Okklusionen –, verwenden fortgeschrittene Verfolger visuelle Einbettungen, um das Objekt bei seinem erneuten Auftauchen zu erkennen. Dadurch wird verhindert, dass die „ID wechselt“, und sichergestellt, dass das System erkennt, dass es sich bei dem aus einem Tunnel kommenden Fahrzeug um dasselbe handelt, das zuvor hineingefahren ist.
MOT von der Verfolgung einzelner Objekte unterscheiden#
Obwohl die Begriffe ähnlich sind, unterscheidet sich die Verfolgung mehrerer Objekte (MOT) deutlich von der Verfolgung eines einzelnen Objekts (SOT). SOT konzentriert sich darauf, ein bestimmtes Ziel zu verfolgen, das im ersten Bild initialisiert wurde, und ignoriert häufig alle anderen Entitäten. MOT muss dagegen eine unbekannte und wechselnde Anzahl von Zielen verarbeiten, die jederzeit in die Szene eintreten oder sie verlassen können. Dadurch ist MOT rechenintensiver, da eine robuste Logik für die Initialisierung und Beendigung von Verfolgungsspuren sowie für die komplexen Interaktionen zwischen mehreren bewegten Körpern erforderlich ist.
Anwendungen in der Praxis#
Die Fähigkeit, mehrere Entitäten gleichzeitig zu verfolgen, treibt Innovationen in mehreren wichtigen Branchen voran.
- Autonomes Fahren: Selbstfahrende Autos sind in hohem Maße auf MOT angewiesen, um sicher zu navigieren. Durch die Verfolgung von Fußgängern, Radfahrern und anderen Fahrzeugen können autonome Systeme zukünftige Positionen vorhersagen und so Kollisionen vermeiden. Dafür werden häufig Daten von Kameras und LiDAR-Sensoren zusammengeführt, um eine möglichst hohe Zuverlässigkeit zu erreichen.
- Einzelhandelsanalyse: Im stationären Handel nutzen Händler AI im Einzelhandel, um die Wege von Kunden abzubilden. MOT-Algorithmen erzeugen Wärmekarten der Kundenbewegungen und helfen Managern dabei, die Gestaltung von Verkaufsflächen zu optimieren und das Warteschlangenmanagement zu Stoßzeiten zu verbessern.
- Sportanalyse: Profiteams nutzen MOT, um die Bewegungen von Spielern und Mannschaftsformationen zu analysieren. Durch die Verfolgung jedes Spielers auf dem Spielfeld können Trainer mithilfe von Verfahren zur Posenschätzung detaillierte Kennzahlen zu Geschwindigkeit, zurückgelegter Strecke und taktischer Positionierung gewinnen.
MOT mit Python implementieren#
Ultralytics ermöglicht eine unkomplizierte Implementierung der Verfolgung mit hochmodernen Modellen. Die Methode track() integriert Erkennungs- und Verfolgungslogik nahtlos und unterstützt Algorithmen wie ByteTrack und BoT-SORT. Das folgende Beispiel zeigt die Verfolgung von Fahrzeugen in einem Video mit dem empfohlenen YOLO26-Modell.
from ultralytics import YOLO
# Load the official YOLO26 small model
model = YOLO("yolo26s.pt")
# Track objects in a video file (or use '0' for webcam)
# The 'persist=True' argument keeps track IDs consistent between frames
results = model.track(source="traffic_analysis.mp4", show=True, persist=True)
# Print the IDs of objects tracked in the first frame
if results[0].boxes.id is not None:
print(f"Tracked IDs: {results[0].boxes.id.int().tolist()}")Herausforderungen bei der Verfolgung mehrerer Objekte#
Trotz aller Fortschritte bleibt MOT ein anspruchsvolles Forschungsgebiet. Okklusion ist eine der größten Schwierigkeiten: Wenn Objekte sich kreuzen oder hinter Hindernissen verborgen werden, ist die Aufrechterhaltung ihrer Identität komplex. Dicht bevölkerte Szenen, etwa bei einem stark besetzten Marathon oder mit einem Vogelschwarm, bringen die Grenzen von Algorithmen zur Datenzuordnung zum Vorschein. Darüber hinaus erfordert die Aufrechterhaltung von Geschwindigkeiten für Echtzeitinferenz bei der Verarbeitung hochauflösender Videostreams effiziente Modellarchitekturen und häufig spezialisierte Hardware wie NVIDIA Jetson-Geräte.
Um diese Herausforderungen zu bewältigen, erforschen Wissenschaftler End-to-End-Ansätze des Deep Learning, die Erkennung und Verfolgung in einem einzigen Netzwerk vereinen. Außerdem nutzen sie die Ultralytics Platform, um anspruchsvolle Datensätze zu annotieren und robuste benutzerdefinierte Modelle zu trainieren.









