AI Gateway
Découvre ce qu’est une passerelle IA, comment elle achemine les modèles, contrôle les coûts, protège les requêtes et surveille l’inférence pour garantir la fiabilité de l’IA et des déploiements Ultralytics YOLO.
Une passerelle d’IA est une couche de contrôle placée entre les applications et un ou plusieurs services d’intelligence artificielle. Comme une passerelle API, elle reçoit les requêtes et les transmet à des backends, mais elle ajoute des contrôles spécifiques à l’IA pour la sélection des modèles, l’utilisation des tokens ou des ressources de calcul, la sécurité, la confidentialité, les coûts et les performances. Elle peut fournir un point de terminaison stable unique pour les modèles cloud, les systèmes auto-hébergés et le déploiement de modèles Ultralytics YOLO, ce qui facilite la gouvernance des systèmes d’intelligence artificielle en production lorsque leurs modèles et leurs fournisseurs évoluent. (learn.microsoft.com)
Fonctionnement d’une passerelle d’IA#
La passerelle évalue chaque requête entrante avant de l’envoyer à un moteur d’inférence. Selon les règles configurées, elle peut :
- Authententifier et protéger les requêtes : appliquer des contrôles d’accès, des quotas, une validation des entrées et des défenses fondées sur le Top 10 de l’OWASP pour les applications LLM, en complément de pratiques plus générales de sécurité des données.
- Router intelligemment le trafic : sélectionner un modèle ou un point de terminaison en fonction de la latence, de la disponibilité, du coût, de la région, de la tâche ou de la charge matérielle. L’extension Inference de la Kubernetes Gateway API standardise le routage tenant compte des modèles pour les modèles génératifs auto-hébergés.
- Améliorer la fiabilité : utiliser des nouvelles tentatives, l’équilibrage de charge et les solutions de repli des modèles de Vercel AI Gateway lorsqu’un fournisseur ou un modèle devient indisponible.
- Contrôler la consommation : faire respecter les budgets de requêtes, de tokens ou de calcul grâce à des règles telles que la limitation du débit d’Envoy Gateway.
- Enregistrer la télémétrie : collecter la latence, les erreurs, les choix de modèles et l’utilisation via des systèmes d’observabilité qui utilisent des standards tels que les attributs GenAI d’OpenTelemetry. (gateway.envoyproxy.io)
Applications concrètes#
- Inspection visuelle dans le commerce de détail : les caméras envoient des images de produits via une passerelle vers un modèle de détection d’objets YOLO26. La passerelle authentifie chaque magasin, limite le volume de requêtes, achemine le trafic vers le déploiement le plus proche et redirige les échecs vers un point de terminaison de secours, ce qui favorise une inférence en temps réel fiable.
- Assistant client multi-modèles : une application utilise l’API unifiée de Vercel AI Gateway ou Cloudflare AI Gateway pour router les questions simples vers un modèle moins coûteux et les requêtes complexes vers un modèle plus performant. Les journaux facilitent l’analyse des coûts, le débogage et la surveillance des modèles.
- Accès à l’IA en entreprise : les organisations peuvent utiliser les fonctionnalités de passerelle d’IA d’Azure API Management pour gouverner les modèles, les outils et les services Model Context Protocol distants grâce à une authentification, des quotas, une journalisation et des règles de sécurité du contenu centralisés. (learn.microsoft.com)
Exemple de vision par ordinateur#
Le code d’inférence reste centré sur la prédiction, tandis que la passerelle gère l’accès, le routage, les limites et la télémétrie :
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Ce gestionnaire pourrait s’exécuter derrière un point de terminaison de déploiement Ultralytics Platform, où la surveillance du déploiement suit les requêtes, la latence, les erreurs, les journaux et les vérifications d’état. (learn.microsoft.com)
Passerelle d’IA et termes associés#
Une passerelle d’IA gère le trafic avant et après l’exécution du modèle, tandis que le déploiement de modèles place un modèle en production et que le service de modèles exécute les prédictions. Une passerelle d’inférence est plus spécialisée et optimise le routage entre les répliques de modèles ou les accélérateurs. De son côté, l’orchestration d’agents d’IA coordonne les décisions et les outils en plusieurs étapes au lieu de contrôler l’accès réseau.
Les bonnes pratiques actuelles consistent notamment à réduire au minimum le contenu sensible journalisé, à appliquer des contrôles de confidentialité des données, à tester les chemins de repli, à suivre la qualité et le coût de chaque modèle et à respecter le profil de gestion des risques liés à l’IA générative du NIST. Les recherches récentes sur les plans de contrôle des LLM et les risques adversariaux liés au routage des modèles soulignent également l’importance de règles auditables et de décisions de routage sécurisées. (nist.gov)









