AI Gateway
Apprends ce qu'est une passerelle IA, comment elle achemine les modèles, contrôle les coûts, protège les requêtes et surveille l'inférence pour des déploiements fiables d'IA et d'Ultralytics YOLO.
Une passerelle IA est une couche de contrôle placée entre les applications et un ou plusieurs services d'intelligence artificielle. À l'instar d'une passerelle API, elle reçoit les requêtes et les transmet aux backends, mais elle y ajoute des contrôles spécifiques à l'IA pour la sélection des modèles, l'utilisation de jetons ou de calcul, la sécurité, la confidentialité, les coûts et les performances. Elle peut fournir un point de terminaison stable pour les modèles cloud, les systèmes auto-hébergés et Ultralytics YOLO model serving, ce qui rend les artificial intelligence systems de production plus faciles à administrer à mesure que leurs modèles et fournisseurs évoluent. (learn.microsoft.com)
Comment fonctionne une passerelle IA#
La passerelle évalue chaque requête entrante avant de l'envoyer à un inference engine. Selon les politiques configurées, elle peut :
- Authentifier et protéger les requêtes : appliquer des contrôles d'accès, des quotas, la validation des entrées et des défenses basées sur le OWASP Top 10 for LLM Applications, ainsi que des pratiques plus larges de data security.
- Acheminer le trafic intelligemment : sélectionner un modèle ou un point de terminaison en fonction de la latence, de la disponibilité, du coût, de la région, de la tâche ou de la charge matérielle. Le Kubernetes Gateway API Inference Extension normalise le routage conscient des modèles pour les modèles génératifs auto-hébergés.
- Améliorer la fiabilité : utiliser des nouvelles tentatives, l'équilibrage de charge et les Vercel AI Gateway model fallbacks lorsqu'un fournisseur ou un modèle devient indisponible.
- Contrôler la consommation : appliquer des budgets de requêtes, de jetons ou de calcul par le biais de politiques telles que Envoy Gateway rate limiting.
- Enregistrer la télémétrie : capturer la latence, les erreurs, les choix de modèles et l'utilisation via des systèmes d'observability utilisant des normes telles que OpenTelemetry GenAI attributes. (gateway.envoyproxy.io)
Applications concrètes#
- Retail Vision Inspection : les caméras soumettent des images de produits par l'intermédiaire d'une passerelle à un YOLO26 object detection model. La passerelle authentifie chaque magasin, limite le volume des requêtes, achemine le trafic vers le déploiement le plus proche et envoie les échecs vers un point de terminaison de secours, garantissant ainsi une real-time inference fiable.
- Multi-Model Customer Assistant : une application utilise le Vercel AI Gateway unified API ou Cloudflare AI Gateway pour acheminer les questions simples vers un modèle moins coûteux et les requêtes complexes vers un modèle plus performant. Les journaux prennent en charge l'analyse des coûts, le débogage et le model monitoring.
- Enterprise AI Access : les organisations peuvent utiliser les Azure API Management AI gateway capabilities pour régir les modèles, les outils et les Model Context Protocol services distants grâce à une authentification centralisée, des quotas, la journalisation et des politiques de sécurité du contenu. (learn.microsoft.com)
Exemple de vision par ordinateur#
Le code d'inférence reste concentré sur la prédiction tandis que la passerelle gère l'accès, le routage, les limites et la télémétrie :
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Ce gestionnaire pourrait s'exécuter derrière un Ultralytics Platform deployment endpoint, où le deployment monitoring suit les requêtes, la latence, les erreurs, les journaux et les vérifications d'intégrité. (learn.microsoft.com)
Passerelle IA vs termes associés#
Une passerelle IA gère le trafic avant et après l'exécution du modèle, tandis que le model deployment place un modèle en production et que le service de modèles exécute les prédictions. Une passerelle d'inférence est plus spécialisée et optimise le routage entre les répliques de modèles ou les accélérateurs. Pendant ce temps, l'AI agent orchestration coordonne les décisions et les outils en plusieurs étapes plutôt de contrôler l'accès au réseau.
Les meilleures pratiques actuelles incluent la minimisation du contenu sensible enregistré, l'application de contrôles de data privacy, le test des chemins de secours, le suivi de la qualité et du coût par modèle, ainsi que le respect du NIST Generative AI Risk Management Profile. Des recherches récentes sur les LLM control planes et les adversarial risks in model routing soulignent également l'importance de politiques auditables et de décisions de routage sécurisées. (nist.gov)






