Real-time Inference
Entdecke die Möglichkeiten der Echtzeit-Inferenz für sofortige KI-Vorhersagen. Erfahre, wie Ultralytics YOLO26 Ergebnisse mit geringer Latenz für Edge-Geräte und Robotik liefert.
Echtzeit-Inferenz bezeichnet den Prozess, bei dem ein trainiertes Modell für maschinelles Lernen (ML) Live-Eingabedaten akzeptiert und nahezu sofort Vorhersagen generiert. Im Gegensatz zur Offline-Verarbeitung, bei der Daten gesammelt und zu einem späteren Zeitpunkt gesammelt analysiert werden, findet die Echtzeit-Inferenz unmittelbar statt und ermöglicht es Systemen, schnell und flexibel auf ihre Umgebung zu reagieren. Diese Fähigkeit bildet das Herzstück moderner Anwendungen der künstlichen Intelligenz (AI) und ermöglicht es Geräten, Daten innerhalb von Millisekunden wahrzunehmen, zu interpretieren und darauf zu reagieren.
Die Bedeutung einer geringen Latenz#
Die wichtigste Kennzahl zur Bewertung der Echtzeit-Leistung ist die Inferenzlatenz. Sie misst die Zeitverzögerung zwischen dem Zeitpunkt, an dem Daten in das Modell eingegeben werden – beispielsweise ein Einzelbild einer Videokamera –, und dem Zeitpunkt, an dem das Modell eine Ausgabe erzeugt, etwa einen Begrenzungsrahmen oder ein Klassifikationslabel. Damit eine Anwendung als „Echtzeit“-Anwendung gilt, muss die Latenz niedrig genug sein, um mit der Geschwindigkeit des eingehenden Datenstroms Schritt zu halten.
Bei Aufgaben zum Verstehen von Videos, die mit 30 Bildern pro Sekunde (FPS) ausgeführt werden, hat das System beispielsweise ein strenges Zeitbudget von etwa 33 Millisekunden für die Verarbeitung jedes Einzelbilds. Dauert die Inferenz länger, führt dies zu Verzögerungen und möglicherweise zu ausgelassenen Einzelbildern oder verzögerten Reaktionen. Um dies zu erreichen, ist häufig eine Hardwarebeschleunigung durch GPUs oder spezielle Edge-AI-Geräte wie den NVIDIA Jetson erforderlich.
Echtzeit-Inferenz im Vergleich zur Batch-Inferenz#
Es ist hilfreich, Echtzeit-Workflows von der Batch-Verarbeitung zu unterscheiden. Beide erzeugen zwar Vorhersagen, ihre Ziele und Architekturen unterscheiden sich jedoch erheblich:
- Echtzeit-Inferenz: Sie stellt eine geringe Latenz in den Mittelpunkt. Einzelne Datenpunkte (oder sehr kleine Batches) werden verarbeitet, sobald sie eintreffen. Dies ist für interaktive Anwendungen wie autonome Fahrzeuge unerlässlich, bei denen ein Auto einen Fußgänger sofort erkennen muss, um rechtzeitig zu bremsen.
- Batch-Inferenz: Sie stellt einen hohen Durchsatz in den Mittelpunkt. Dabei wird eine große Datenmenge gesammelt und auf einmal verarbeitet. Dies eignet sich für nicht dringende Aufgaben, etwa die Erstellung nächtlicher Bestandsberichte oder die Analyse von Trends in Big Data aus der Vergangenheit.
Anwendungen in der Praxis#
Die Fähigkeit, Entscheidungen in Sekundenbruchteilen zu treffen, hat verschiedene Branchen verändert, indem sie Automatisierung in dynamischen Umgebungen ermöglicht.
- Intelligente Fertigung: Bei KI in der Fertigung nutzen Kameras über Förderbändern die Echtzeit-Inferenz zur automatisierten Qualitätskontrolle. Ein Modell zur Objekterkennung kann Fehler oder Fremdkörper in Produkten, die sich mit hoher Geschwindigkeit bewegen, sofort erkennen. Wird eine Anomalie erkannt, löst das System unmittelbar einen Roboterarm aus, der das Produkt entfernt, sodass nur hochwertige Waren die Verpackung erreichen.
- Überwachung und Sicherheit: Moderne Sicherheitssysteme nutzen Computer Vision, um Außenbereiche zu überwachen. Statt lediglich Aufnahmen zu speichern, führen diese Kameras eine Echtzeit-Personenerkennung oder Gesichtserkennung aus, um das Sicherheitspersonal im Moment eines unbefugten Zugriffs zu alarmieren.
- Robotik: Im Bereich der KI in der Robotik nutzen Roboter die Posenschätzung, um sich in komplexen physischen Umgebungen zu bewegen. Ein Lagerroboter muss die Position von Hindernissen und menschlichen Arbeitskräften kontinuierlich erfassen, um seinen Weg sicher und effizient zu planen.
Optimierung und Bereitstellung#
Die Bereitstellung von Modellen für Echtzeitanwendungen erfordert häufig eine Optimierung, damit sie effizient auf der Zielhardware ausgeführt werden. Techniken wie die Modellquantisierung verringern die Präzision der Modellgewichte (z. B. von float32 auf int8), um den Speicherbedarf zu reduzieren und die Inferenzgeschwindigkeit bei minimalen Auswirkungen auf die Genauigkeit zu erhöhen.
Entwickler können die Ultralytics Platform nutzen, um diesen Prozess zu optimieren. Die Plattform vereinfacht das Training und ermöglicht es Nutzern, Modelle in optimierte Formate zu exportieren, etwa TensorRT für NVIDIA GPUs, OpenVINO für Intel CPUs oder TFLite für die mobile Bereitstellung.
Codebeispiel#
Das folgende Python-Snippet zeigt, wie du mit der Bibliothek ultralytics Echtzeit-Inferenz für einen Webcam-Stream ausführst. Es verwendet das YOLO26 Nano-Modell, das speziell für hohe Geschwindigkeit auf Edge-Geräten entwickelt wurde.
from ultralytics import YOLO
# Load the YOLO26 Nano model, optimized for speed and real-time tasks
model = YOLO("yolo26n.pt")
# Run inference on the default webcam (source="0")
# 'stream=True' returns a generator for memory-efficient processing
# 'show=True' displays the video feed with bounding boxes in real-time
results = model.predict(source="0", stream=True, show=True)
# Iterate through the generator to process frames as they arrive
for result in results:
# Example: Print the number of objects detected in the current frame
print(f"Detected {len(result.boxes)} objects")








