Model Serving
Erfahre, wie Model Serving die Lücke zwischen trainierten Modellen und der Produktion schließt. Entdecke Bereitstellungsstrategien für Ultralytics YOLO26 auf der Ultralytics Platform.
Die Bereitstellung von Modellen bezeichnet den Prozess, ein trainiertes maschinelles Lernmodell zu hosten und seine Funktionen über eine Netzwerkschnittstelle für Softwareanwendungen verfügbar zu machen. Sie bildet die Brücke zwischen einer statischen, auf einem Datenträger gespeicherten Modelldatei und einem aktiven System, das reale Daten verarbeitet. Sobald ein Modell die Trainingsphase des maschinellen Lernens (ML) abgeschlossen hat, muss es in eine Produktionsumgebung integriert werden, in der es Eingaben – etwa Bilder, Text oder Tabellendaten – empfangen und Vorhersagen zurückgeben kann. Dies wird typischerweise erreicht, indem das Modell in eine Anwendungsprogrammierschnittstelle (API) eingebunden wird, über die es mit Webservern, mobilen Apps oder IoT-Geräten kommunizieren kann.
Die Rolle der Modellbereitstellung in der KI#
Das Hauptziel der Modellbereitstellung besteht darin, die Fähigkeiten der prädiktiven Modellierung effektiv produktiv nutzbar zu machen. Während beim Training Genauigkeit und die Minimierung des Verlusts im Mittelpunkt stehen, konzentriert sich die Bereitstellung auf Leistungskennzahlen wie Latenz (wie schnell eine Vorhersage zurückgegeben wird) und Durchsatz (wie viele Anfragen pro Sekunde verarbeitet werden können). Eine robuste Infrastruktur für die Modellbereitstellung stellt sicher, dass Computer-Vision (CV)-Systeme auch unter hoher Auslastung zuverlässig bleiben. Dazu gehören häufig Technologien wie die Containerisierung mit Tools wie Docker, die das Modell zusammen mit seinen Abhängigkeiten bündeln, um ein konsistentes Verhalten in verschiedenen Rechnerumgebungen sicherzustellen.
Anwendungen in der Praxis#
Die Modellbereitstellung ermöglicht branchenübergreifend allgegenwärtige KI-Funktionen, indem sie unmittelbare Entscheidungen auf Grundlage von Daten ermöglicht.
- Intelligente Fertigung: In industriellen Umgebungen verwenden Systeme für KI in der Fertigung bereitgestellte Modelle zur Inspektion von Produktionslinien. Hochauflösende Bilder von Bauteilen werden an einen lokalen Server gesendet, auf dem ein YOLO26-Modell Defekte wie Kratzer oder Fehlpositionierungen erkennt und dadurch sofortige Warnungen zum Aussortieren fehlerhafter Teile auslöst.
- Automatisierung im Einzelhandel: Einzelhändler nutzen KI im Einzelhandel, um das Kundenerlebnis zu verbessern. Kameras, die von Modellen zur Objekterkennung unterstützt werden, identifizieren Produkte in einem Kassenbereich und addieren automatisch die Gesamtkosten, ohne dass Barcodes manuell gescannt werden müssen.
Praktische Umsetzung#
Für eine effektive Modellbereitstellung ist es oft sinnvoll, Modelle zu exportieren und in ein standardisiertes Format wie ONNX zu überführen. Dadurch wird die Interoperabilität zwischen verschiedenen Trainingsframeworks und Bereitstellungs-Engines verbessert. Das folgende Beispiel zeigt, wie ein Modell geladen und eine Inferenz mit Python ausgeführt wird, und simuliert damit die Logik, die innerhalb eines Bereitstellungsendpunkts vorhanden wäre.
from ultralytics import YOLO
# Load the YOLO26 model (this typically happens once when the server starts)
model = YOLO("yolo26n.pt")
# Simulate an incoming API request with an image source URL
image_source = "https://ultralytics.com/images/bus.jpg"
# Run inference to generate predictions for the user
results = model.predict(source=image_source)
# Process results (e.g., simulating a JSON response to a client)
print(f"Detected {len(results[0].boxes)} objects in the image.")Die richtige Strategie auswählen#
Die Wahl der Bereitstellungsstrategie hängt stark vom jeweiligen Anwendungsfall ab. Online-Bereitstellung liefert über Protokolle wie REST oder gRPC sofortige Antworten und ist daher für benutzerorientierte Webanwendungen unverzichtbar. Im Gegensatz dazu verarbeitet die Batch-Bereitstellung große Datenmengen offline und eignet sich beispielsweise für die nächtliche Erstellung von Berichten. Für Anwendungen, die Datenschutz oder eine geringe Latenz ohne Abhängigkeit vom Internet erfordern, verlagert Edge AI die Modellbereitstellung direkt auf das Gerät und nutzt optimierte Formate wie TensorRT, um die Leistung auf Hardware mit begrenzten Ressourcen zu maximieren. Viele Unternehmen nutzen die Ultralytics Platform, um die Bereitstellung dieser Modelle an verschiedenen Endpunkten, einschließlich Cloud-APIs und Edge-Geräten, zu vereinfachen.
Abgrenzung zu verwandten Begriffen#
Obwohl sie eng miteinander verbunden sind, unterscheidet sich die „Modellbereitstellung“ von Modellbereitstellung in der Produktion und Inferenz.
- Modellbereitstellung in der Produktion: Damit ist die übergeordnete Phase im Lebenszyklus gemeint, in der ein Modell in einer Produktionsumgebung veröffentlicht wird. Die Modellbereitstellung bezeichnet den konkreten Mechanismus oder die Software (wie NVIDIA Triton Inference Server oder TorchServe), mit der das bereitgestellte Modell ausgeführt wird.
- Inferenz: Dabei handelt es sich um den mathematischen Vorgang, aus einer Eingabe eine Vorhersage zu berechnen. Die Modellbereitstellung stellt die Infrastruktur (Netzwerk, Skalierbarkeit und Sicherheit) bereit, die eine zuverlässige Inferenz für Endanwender ermöglicht.
- Mikrodienste: Die Modellbereitstellung wird häufig als eine Gruppe von Mikrodiensten konzipiert. Dabei läuft das Modell als unabhängiger Dienst, den andere Teile einer Anwendung abfragen können und der häufig Daten in leichtgewichtigen Formaten wie JSON austauscht.









