Model Deployment
Erfahre, wie du Machine-Learning-Modelle in Cloud- oder Edge-Umgebungen bereitstellst. Entdecke, wie die Ultralytics Platform Export und Produktion für YOLO26 optimiert.
Die Modellbereitstellung ist die entscheidende Phase, in der ein trainiertes Machine-Learning-Modell in eine Produktionsumgebung integriert wird, um auf Grundlage neuer Daten praktische Entscheidungen zu treffen oder Vorhersagen zu erstellen. Sie stellt den Übergang von einer Forschungs- oder Experimentierumgebung – oft in isolierten Notebooks – zu einer Live-Anwendung dar, in der das Modell mit realen Nutzern und Systemen interagiert. Dieser Prozess verwandelt eine statische Datei mit Gewichten und Architektur in einen aktiven KI-Agenten, der einen konkreten Nutzen schaffen kann, etwa indem er Objekte in einem Videostream erkennt oder Produkte auf einer Website empfiehlt.
Eine effektive Bereitstellung erfordert die Bewältigung von Herausforderungen, die sich von denen beim Modelltraining unterscheiden, darunter Latenz, Skalierbarkeit und Hardwarekompatibilität. Unternehmen nutzen häufig die Ultralytics Platform, um diesen Lebenszyklus zu optimieren und sicherzustellen, dass in der Cloud trainierte Modelle nahtlos in verschiedenste Umgebungen bereitgestellt werden können – von leistungsstarken Servern bis hin zu ressourcenbeschränkten Edge-Geräten.
Die Landschaft der Bereitstellung#
Bereitstellungsstrategien lassen sich grundsätzlich in zwei Kategorien einteilen: Cloud-Bereitstellung und Edge-Bereitstellung. Die Wahl hängt maßgeblich von den jeweiligen Anforderungen an Geschwindigkeit, Datenschutz und Konnektivität ab.
- Cloud-Bereitstellung: Das Modell befindet sich auf zentralen Servern, die häufig von Diensten wie AWS SageMaker oder Google Vertex AI verwaltet werden. Anwendungen senden Daten über das Internet über eine REST API an das Modell, das die Anfrage verarbeitet und das Ergebnis zurückgibt. Diese Methode bietet nahezu unbegrenzte Rechenleistung und eignet sich daher ideal für große, komplexe Modelle, ist jedoch auf eine stabile Internetverbindung angewiesen.
- Edge-Bereitstellung: Das Modell läuft lokal auf dem Gerät, auf dem die Daten erzeugt werden, etwa auf einem Smartphone, einer Drohne oder einer Industriekamera. Dieser Ansatz, der als Edge Computing bezeichnet wird, minimiert die Latenz und verbessert den Datenschutz, da die Informationen das Gerät nicht verlassen. Tools wie TensorRT werden häufig eingesetzt, um Modelle für diese Umgebungen zu optimieren.
Modelle für den Produktionseinsatz vorbereiten#
Bevor ein Modell bereitgestellt werden kann, wird es normalerweise optimiert, damit es effizient auf der Zielhardware ausgeführt werden kann. Dieser Prozess umfasst den Modellexport, bei dem das Trainingsformat, etwa PyTorch, in ein für die Bereitstellung geeignetes Format wie ONNX (Austausch offener neuronaler Netzwerke) oder OpenVINO konvertiert wird.
Optimierungstechniken wie die Quantisierung reduzieren die Größe und den Speicherbedarf des Modells, ohne die Genauigkeit wesentlich zu beeinträchtigen. Um die Konsistenz über verschiedene Rechenumgebungen hinweg sicherzustellen, verwenden Entwickler häufig Tools zur Containerisierung wie Docker, die das Modell zusammen mit allen erforderlichen Softwareabhängigkeiten bündeln.
Unten siehst du ein Beispiel für den Export eines YOLO26-Modells in das ONNX-Format – ein üblicher Schritt bei der Vorbereitung auf die Bereitstellung:
from ultralytics import YOLO
# Load the YOLO26 nano model
model = YOLO("yolo26n.pt")
# Export the model to ONNX format for broad compatibility
# This creates a file suitable for various inference engines
path = model.export(format="onnx")
print(f"Model successfully exported to: {path}")Anwendungen in der Praxis#
Die Modellbereitstellung ermöglicht weit verbreitete Systeme für Computer Vision in verschiedensten Branchen.
- Qualitätskontrolle in der Fertigung: In der intelligenten Fertigung überwachen bereitgestellte Modelle Förderbänder in Echtzeit. Ein Kamerasystem mit einem für NVIDIA Jetson-Geräte optimierten Modell kann Produktfehler sofort erkennen und dadurch einen Roboterarm auslösen, der fehlerhafte Teile entfernt. Dafür ist eine extrem niedrige Latenz erforderlich, die nur eine Bereitstellung mit Edge AI bieten kann.
- Einzelhandelsanalysen: Geschäfte setzen bereitgestellte Modelle ein, um das Passantenaufkommen und das Kundenverhalten zu analysieren. Durch die Integration von Modellen zur Objektverfolgung in die Aufnahmen von Überwachungskameras können Händler Heatmaps beliebter Gänge erstellen. Diese Erkenntnisse helfen, die Gestaltung der Verkaufsflächen zu optimieren und die Bestandsverwaltung zu verbessern, wobei häufig eine cloudbasierte Bereitstellung genutzt wird, um Daten aus mehreren Standorten zusammenzuführen.
Bereitstellung vs. Inferenz vs. Training#
Es ist wichtig, Modellbereitstellung von verwandten Begriffen im Lebenszyklus des maschinellen Lernens zu unterscheiden:
- Modelltraining ist die Lernphase, in der der Algorithmus Muster aus einem Datensatz erlernt.
- Modellbereitstellung ist die Integrationsphase, in der das trainierte Modell in eine Produktionsinfrastruktur (Server, Apps oder Geräte) installiert wird.
- Inferenz ist die Betriebsphase – die eigentliche Verarbeitung von Live-Daten durch das bereitgestellte Modell, um eine Vorhersage zu erzeugen. Beispielsweise führt die Inferenz-Engine die vom bereitgestellten Modell definierten Berechnungen aus.
Überwachung und Wartung#
Mit der Bereitstellung ist der Prozess nicht abgeschlossen. Sobald Modelle produktiv eingesetzt werden, müssen sie kontinuierlich durch Modellüberwachung überwacht werden, um Probleme wie Datenverschiebungen zu erkennen, bei denen reale Daten zunehmend von den Trainingsdaten abweichen. Tools wie Prometheus oder Grafana werden häufig integriert, um Leistungskennzahlen zu verfolgen und die Zuverlässigkeit des Systems langfristig sicherzustellen. Wenn die Leistung nachlässt, muss das Modell möglicherweise erneut trainiert und bereitgestellt werden, wodurch der MLOps-Kreislauf abgeschlossen wird.









