Model Routing
Apprends comment le routage de modèles sélectionne le bon modèle d'IA pour chaque requête afin d'équilibrer précision, coût, latence et utilisation des ressources dans les systèmes multi-modèles.
Le routage de modèles est le processus qui consiste à sélectionner le modèle d'IA devant traiter chaque requête entrante. Au lieu d'envoyer chaque entrée à un seul modèle, une couche de routage évalue des signaux tels que la tâche demandée, le type d'entrée, la complexité, l'objectif de latence, la limite de coût, la disponibilité du matériel ou les exigences de confiance. Elle transmet ensuite la requête au candidat le plus adapté. Dans ce contexte, un « routeur » est un composant de décision d'inférence, et non un routeur réseau physique. Le routage aide les systèmes d'apprentissage automatique multi-modèles à équilibrer la qualité des prédictions, l'utilisation des ressources et la latence d'inférence.
Fonctionnement du routage de modèles#
Un système de routage contient généralement un ensemble de modèles déployés, une logique de décision et une interface applicative commune. L'application soumet une requête, le routeur sélectionne un modèle éligible et la couche de servage de modèles renvoie la sortie de ce modèle.
Les décisions de routage peuvent être :
- Basées sur des règles : Sélectionne un modèle à l'aide de métadonnées explicites, telles que le routage d'images demandant des masques vers un modèle de segmentation.
- Basées sur des scores : Estime la qualité, le coût ou le temps de réponse attendus de chaque candidat et choisit l'option ayant le score le plus élevé.
- Appises : Utilise un classifieur léger ou un modèle de routage pour déduire quel candidat correspond le mieux à l'entrée.
- En cascade : Exécute d'abord un modèle rapide, puis transfère les résultats incertains ou à haut risque vers un modèle plus performant.
Par exemple, le routage intelligent des invites d'Amazon Bedrock prédit la qualité des réponses avant de choisir entre les modèles de langage, tandis que le guide sur la stratégie de routage des modèles de Microsoft décrit le routage basé sur les coûts, la qualité et l'équilibre. Des principes similaires s'appliquent à la vision par ordinateur : les requêtes peuvent être routées par tâche, emplacement de la caméra, résolution d'image ou niveau de détail de prédiction requis.
Concepts connexes et principales différences#
Le routage de modèles est étroitement lié à d'autres techniques multi-modèles, mais les termes ne sont pas interchangeables.
- Passerelles d'IA : Une passerelle d'IA offre une couche de contrôle plus large pour l'authentification, les quotas, la journalisation et la gestion du trafic. La sélection du modèle peut être l'une des fonctionnalités de la passerelle. L'API Kubernetes Gateway API Inference Extension distingue également le routage conscient des modèles de la sélection de points de terminaison et de l'équilibrage de charge.
- Ensembles de modèles : Un ensemble exécute normalement plusieurs modèles et combine leurs prédictions. Un routeur choisit généralement un seul modèle, ce qui réduit le calcul. Les modèles d'ensemble NVIDIA Triton définissent plutôt des flux de données fixes à travers plusieurs modèles.
- Mélange d'experts : Une architecture MoE route les représentations internes vers des composants au sein d'un seul réseau de neurones. Le routage de modèles sélectionne parmi des modèles ou des points de terminaison déployables séparément.
- Routage d'agents : Un routeur d'agents choisit un agent spécialisé, un flux de travail ou un outil. Le routage de modèles choisit le modèle sous-jacent qui effectue une étape d'inférence. Dans un système à agents, les deux formes de routage peuvent être présentes.
L'équilibrage de charge est une autre distinction importante. Il répartit les requêtes entre des répliques du même service pour améliorer la disponibilité ou le débit. Le routage de modèles choisit entre des modèles ayant des capacités, des coûts ou des sorties différents.
Applications concrètes#
Inspection visuelle : Un système de fabrication peut utiliser la détection d'objets pour le comptage de routine de pièces, mais router les défauts de surface suspectés vers la segmentation d'instance pour obtenir des limites précises. Ultralytics YOLO26 prend en charge à la fois la détection d'objets et la segmentation d'instance, ce qui rend possible le routage basé sur les tâches au sein d'une API cohérente. Cela évite de payer le coût de la segmentation lorsque des boîtes englobantes suffisent.
Assistants d'IA : Un assistant de support peut envoyer des requêtes simples de classification et de recherche à un petit modèle de langage rapide tout en réservant un modèle plus puissant pour le raisonnement complexe ou l'utilisation d'outils. Le guide d'architecture d'agents de Google Cloud décrit ce modèle comme un moyen d'équilibrer la qualité, la latence et le coût. Contrairement à une cascade fixe, le routage dynamique peut sélectionner le modèle le plus puissant avant de générer une réponse initiale.
Mise en œuvre et évaluation d'un routeur#
Cet exemple minimal d'Ultralytics route une image vers la détection ou la segmentation en fonction de la sortie demandée par une application :
from ultralytics import YOLO
models = {
"detect": YOLO("yolo26n.pt"),
"segment": YOLO("yolo26n-seg.pt"),
}
requested_task = "segment"
source = "https://ultralytics.com/images/bus.jpg"
model = models.get(requested_task)
if model is None:
raise ValueError(f"Unsupported task: {requested_task}")
results = model(source)
result = results[0]
result.save(filename=f"{requested_task}_result.jpg")La règle est intentionnellement simple : les requêtes nécessitant des masques d'objets vont vers la segmentation, tandis que les requêtes ne nécessitant que des boîtes peuvent utiliser la détection. Les routeurs de production peuvent également prendre en compte la précision mesurée, la profondeur de la file d'attente, le type d'appareil, les contraintes de confidentialité ou la santé du service.
Évalue le routage sur un trafic représentatif plutôt que sur les seules moyennes des modèles. Suis la distribution des routes, la latence de bout en bout, le coût, les échecs et la qualité au niveau des tâches pour chaque modèle sélectionné. Le guide d'observabilité OpenTelemetry explique comment les traces, les métriques et les journaux peuvent suivre des requêtes individuelles à travers des services distribués. La surveillance du déploiement de la plateforme Ultralytics prend également en charge l'inspection de la latence des points de terminaison, des erreurs, de la santé et de l'activité des requêtes.
Un mauvais routage peut augmenter les coûts, manquer les objectifs de latence ou envoyer des entrées difficiles à un modèle inadéquat. Les équipes doivent par conséquent définir un comportement de repli, restreindre les modèles éligibles pour les charges de travail sensibles, consigner la route sélectionnée et retester périodiquement la politique. Ces contrôles alignent les décisions de routage sur les pratiques plus larges du NIST AI Risk Management Framework.






