YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Inference Latency

Erkunde die Bedeutung von Inferenzlatenz in der KI. Lerne, wie du Echtzeit-Performance mit Ultralytics YOLO26 für schnellere, reaktionsschnellere Anwendungen optimierst.

Die Inferenzlatenz beschreibt die Zeitverzögerung zwischen dem Empfang einer Eingabe – wie etwa einem Bild oder einem Text-Prompt – durch ein machine learning (ML)-Modell und der Erstellung einer entsprechenden Ausgabe oder Vorhersage. Im Kontext der artificial intelligence (AI) wird diese Metrik typischerweise in Millisekunden (ms) gemessen und dient als kritischer Indikator für die Reaktionsfähigkeit des Systems. Für Entwickler, die computer vision-Anwendungen entwickeln, ist das Verständnis und die Minimierung der Latenz entscheidend, um reibungslose, interaktive Benutzererlebnisse zu schaffen, insbesondere wenn Modelle in ressourcenbeschränkten Umgebungen wie Mobiltelefonen oder eingebetteten Geräten bereitgestellt werden.

Warum Inferenz-Latenz wichtig ist#

Die Bedeutung der Inferenzlatenz hängt stark vom jeweiligen Anwendungsfall ab. Während eine Verzögerung von wenigen Sekunden für eine batch processing-Aufgabe wie die Analyse eines nächtlichen Serverberichts akzeptabel sein mag, ist sie für interaktive Anwendungen oft inakzeptabel. Geringe Latenz ist der Grundstein der real-time inference, bei der Systeme Daten verarbeiten und unverzüglich reagieren müssen.

Die Reduzierung der Latenz sorgt dafür, dass AI agents auf natürliche Weise mit Menschen interagieren können und automatisierte Systeme sicher arbeiten. Eine hohe Latenz kann zu „verzögerten“ Schnittstellen, einer schlechten Nutzerbindung oder in sicherheitskritischen Szenarien zu gefährlichen Betriebsausfällen führen. Ingenieure müssen oft den Kompromiss zwischen der Modellkomplexität – die die accuracy verbessern kann – und der Ausführungsgeschwindigkeit abwägen.

Faktoren, die die Latenz beeinflussen#

Mehrere technische Komponenten tragen zur Gesamtdauer bei, die für einen einzelnen Inferenz-Durchgang benötigt wird:

  • Modellarchitektur: Das Design des neural network (NN) ist ein Hauptfaktor. Tiefe Modelle mit vielen Schichten erfordern im Allgemeinen mehr Rechenleistung als flachere. Moderne Architekturen wie YOLO26 sind speziell darauf optimiert, eine hohe Genauigkeit bei minimalem Rechenaufwand zu liefern.
  • Hardware-Fähigkeiten: Die Wahl der Verarbeitungseinheit beeinflusst die Geschwindigkeit maßgeblich. Während eine CPU vielseitig einsetzbar ist, ist spezialisierte Hardware wie eine GPU (Graphics Processing Unit) oder eine TPU (Tensor Processing Unit) darauf ausgelegt, die zentralen Matrixoperationen des deep learning zu parallelisieren, wodurch die Latenz erheblich reduziert wird.
  • Eingabegröße: Das Verarbeiten hochauflösender 4K-Video-Frames dauert länger als das Verarbeiten von Standard-640p-Bildern. Entwickler skalieren Eingaben während der data preprocessing häufig in der Größe, um einen Mittelweg zwischen Geschwindigkeit und der Fähigkeit zur Erkennung kleiner Details zu finden.
  • Optimierungstechniken: Methoden wie model quantization (Umwandlung von Gewichten in geringere Präzision) und model pruning (Entfernen unnötiger Verbindungen) sind effektive Wege, um die Ausführung zu beschleunigen. Werkzeuge wie NVIDIA TensorRT können Modelle weiter für spezifische Hardware optimieren.

Praxisanwendungen#

Die Auswirkungen der Inferenz-Latenz lassen sich am besten anhand praktischer Beispiele verdeutlichen, bei denen Geschwindigkeit nicht verhandelbar ist.

  1. Autonomes Fahren: Im Bereich AI in automotive muss ein selbstfahrendes Auto kontinuierlich seine Umgebung nach Fußgängern, anderen Fahrzeugen und Verkehrssignalen absuchen. Wenn das object detection-System eine hohe Latenz aufweist, bremst das Auto möglicherweise nicht rechtzeitig, wenn ein Hindernis auftaucht. Selbst eine Verzögerung von 100 Millisekunden bei Autobahngeschwindigkeit kann zu einem Bremsweg von mehreren Metern führen, was eine niedrige Latenz zu einer kritischen Sicherheitsanforderung macht.

  2. Hochfrequenzhandel: Finanzinstitute nutzen predictive modeling, um Markttrends zu analysieren und Geschäfte auszuführen. Diese Algorithmen müssen riesige Datenmengen verarbeiten und Entscheidungen in Mikrosekunden treffen. In diesem Bereich führt eine geringere Latenz direkt zu einem Wettbewerbsvorteil, da Unternehmen flüchtige Marktchancen nutzen können, bevor die Konkurrenz reagieren kann.

Latenzmessung mit Python#

Du kannst die Inferenzgeschwindigkeit von Ultralytics Modellen ganz einfach mit dem Benchmark-Modus messen. Dies hilft bei der Auswahl der richtigen Modellgröße für deine spezifischen Hardwarebeschränkungen.

from ultralytics import YOLO

# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")

# Benchmark the model on CPU to measure latency
# This provides a breakdown of preprocess, inference, and postprocess time
model.benchmark(data="coco8.yaml", imgsz=640, device="cpu")

Inferenz-Latenz vs. Durchsatz#

Es ist wichtig, Latenz und Durchsatz zu unterscheiden, da es sich um verwandte, aber unterschiedliche Konzepte im model deployment handelt.

  • Inferenz-Latenz misst die Zeit für eine einzelne Vorhersage (z. B. „Die Verarbeitung dieses Bildes dauerte 20 ms“). Dies ist die wichtigste Kennzahl für Echtzeitanwendungen für einzelne Nutzer.
  • Durchsatz misst das Volumen von Vorhersagen über die Zeit (z. B. „Das System hat 500 Bilder pro Sekunde verarbeitet“). Ein hoher Durchsatz wird oft durch Erhöhung der batch size erreicht, wodurch viele Eingaben gleichzeitig verarbeitet werden. Das Batching kann jedoch die Latenz für einzelne Elemente, die in der Warteschlange warten, tatsächlich erhöhen.

Die Optimierung auf das eine geht oft zu Lasten des anderen. Zum Beispiel priorisieren Edge AI-Anwendungen typischerweise die Latenz, um ein sofortiges Feedback zu gewährleisten, während cloudbasierte data mining-Aufgaben den Durchsatz priorisieren können, um riesige Datensätze effizient zu verarbeiten.

Optimierungsstrategien#

Entwickler setzen verschiedene Strategien ein, um die Latenz zu minimieren. Das Exporting models in optimierte Formate wie ONNX oder OpenVINO kann signifikante Geschwindigkeitsverbesserungen auf Standard-CPUs bringen. Für mobile Bereitstellungen stellt die Umwandlung von Modellen in TFLite oder CoreML sicher, dass sie effizient auf iOS- und Android-Geräten laufen. Darüber hinaus stellt die Verwendung leichter Architekturen wie MobileNet oder des neuesten Ultralytics YOLO26 sicher, że das zugrundeliegende Modell von Haus aus effizient ist. Benutzer können auch die Ultralytics Platform nutzen, um Modelle nahtlos in diese optimierten Formate bereitzustellen, ganz ohne komplexe manuelle Konfiguration.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens