AI Gateway
Erfahre, was ein AI-Gateway ist, wie es Modelle weiterleitet, Kosten steuert, Anfragen schützt und Inferenz für zuverlässige AI- und Ultralytics-YOLO-Bereitstellungen überwacht.
Ein KI-Gateway ist eine Steuerebene zwischen Anwendungen und einem oder mehreren Diensten für künstliche Intelligenz. Wie ein API-Gateway empfängt es Anfragen und leitet sie an Backends weiter, bietet jedoch zusätzliche KI-spezifische Kontrollen für die Modellauswahl, den Token- oder Rechenressourcenverbrauch, Sicherheit, Datenschutz, Kosten und Leistung. Es kann einen stabilen Endpunkt für Cloud-Modelle, selbst gehostete Systeme und die Bereitstellung von Ultralytics YOLO-Modellen bereitstellen, sodass sich produktive Systeme für künstliche Intelligenz leichter verwalten lassen, wenn sich ihre Modelle und Anbieter ändern. (learn.microsoft.com)
Funktionsweise eines KI-Gateways#
Das Gateway bewertet jede eingehende Anfrage, bevor es sie an eine Inferenz-Engine sendet. Je nach konfigurierten Richtlinien kann es:
- Anfragen authentifizieren und schützen: Zugriffskontrollen, Kontingente, Eingabevalidierung und Schutzmaßnahmen auf Grundlage der OWASP Top 10 für LLM-Anwendungen sowie umfassenderer Verfahren zur Datensicherheit anwenden.
- Datenverkehr intelligent weiterleiten: Ein Modell oder einen Endpunkt anhand von Latenz, Verfügbarkeit, Kosten, Region, Aufgabe oder Hardwareauslastung auswählen. Die Inference Extension der Kubernetes Gateway API standardisiert die modellabhängige Weiterleitung für selbst gehostete generative Modelle.
- Zuverlässigkeit verbessern: Wiederholungsversuche, Lastverteilung und Modell-Fallbacks des Vercel AI Gateways verwenden, wenn ein Anbieter oder Modell nicht verfügbar ist.
- Verbrauch kontrollieren: Anfrage-, Token- oder Rechenbudgets durch Richtlinien wie die Ratenbegrenzung des Envoy Gateways durchsetzen.
- Telemetrie erfassen: Latenz, Fehler, Modellauswahl und Nutzung über Beobachtungssysteme erfassen, die Standards wie die OpenTelemetry-Attribute für GenAI verwenden. (gateway.envoyproxy.io)
Anwendungen in der Praxis#
- Visuelle Inspektion im Einzelhandel: Kameras über ein Gateway Produktbilder an ein YOLO26-Modell zur Objekterkennung senden. Das Gateway authentifiziert jedes Geschäft, begrenzt das Anfragevolumen, leitet den Datenverkehr an die nächstgelegene Bereitstellung weiter und sendet fehlgeschlagene Anfragen an einen Backup-Endpunkt, was eine zuverlässige Echtzeit-Inferenz unterstützt.
- Kundenassistent mit mehreren Modellen: Eine Anwendung verwendet die einheitliche API des Vercel AI Gateways oder das Cloudflare AI Gateway, um einfache Fragen an ein kostengünstigeres Modell und komplexe Anfragen an ein leistungsfähigeres Modell weiterzuleiten. Protokolle unterstützen die Kostenanalyse, die Fehlersuche und die Modellüberwachung.
- Unternehmenszugriff auf KI: Unternehmen können die KI-Gateway-Funktionen von Azure API Management verwenden, um Modelle, Werkzeuge und Remote-Dienste des Model Context Protocol über zentrale Authentifizierung, Kontingente, Protokollierung und Richtlinien für Inhaltssicherheit zu verwalten. (learn.microsoft.com)
Beispiel für Computer Vision#
Der Inferenzcode bleibt auf die Vorhersage konzentriert, während das Gateway Zugriff, Weiterleitung, Begrenzungen und Telemetrie übernimmt:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Dieser Handler könnte hinter einem Bereitstellungsendpunkt der Ultralytics Platform ausgeführt werden, wobei die Überwachung der Bereitstellung Anfragen, Latenz, Fehler, Protokolle und Zustandsprüfungen erfasst. (learn.microsoft.com)
KI-Gateway im Vergleich zu verwandten Begriffen#
Ein KI-Gateway verwaltet den Datenverkehr vor und nach der Modellausführung, während die Modellbereitstellung ein Modell in die Produktion überführt und das Modellbereitstellen Vorhersagen ausführt. Ein Inferenz-Gateway ist spezialisierter und optimiert die Weiterleitung zwischen Modellreplikaten oder Beschleunigern. Die Orchestrierung von KI-Agenten koordiniert dagegen mehrstufige Entscheidungen und Werkzeuge, anstatt den Netzwerkzugriff zu kontrollieren.
Zu den aktuellen bewährten Verfahren gehören die Minimierung protokollierter sensibler Inhalte, die Anwendung von Kontrollen zum Datenschutz, das Testen von Fallback-Pfaden, die Überwachung von Qualität und Kosten pro Modell sowie die Befolgung des Risikomanagementprofils für generative KI des NIST. Aktuelle Forschung zu Steuerungsebenen für LLMs und gegnerischen Risiken bei der Modellweiterleitung unterstreicht ebenfalls die Bedeutung prüfbarer Richtlinien und sicherer Weiterleitungsentscheidungen. (nist.gov)









