Model Routing
Erfahre, wie die Modellweiterleitung das richtige KI-Modell für jede Anfrage auswählt, um Genauigkeit, Kosten, Latenz und Ressourcennutzung in Systemen mit mehreren Modellen auszugleichen.
Modell-Routing ist der Prozess der Auswahl, welches KI-Modell jede eingehende Anfrage verarbeiten soll. Anstatt jede Eingabe an ein einziges Modell zu senden, bewertet eine Routing-Schicht Signale wie die angeforderte Aufgabe, den Eingabetyp, die Komplexität, das Latenzziel, das Kostenlimit, die Hardwareverfügbarkeit oder die Konfidenzanforderungen. Anschließend leitet die Routing-Schicht die Anfrage an den am besten geeigneten Kandidaten weiter. In diesem Kontext ist ein „Router“ eine Inferenz-Entscheidungskomponente und kein physischer Netzwerk-Router. Routing hilft Systemen für maschinelles Lernen mit mehreren Modellen dabei, Vorhersagequalität, Ressourcennutzung und Inferenzlatenz auszugleichen.
Wie Modell-Routing funktioniert#
Ein Routing-System umfasst im Allgemeinen einen Pool bereitgestellter Modelle, Entscheidungslogik und eine gemeinsame Anwendungsschnittstelle. Die Anwendung sendet eine Anfrage, der Router wählt ein geeignetes Modell aus, und die Modellbereitstellungs-Schicht gibt die Ausgabe dieses Modells zurück.
Routing-Entscheidungen können wie folgt aussehen:
- Regelbasiert: Wähle ein Modell anhand expliziter Metadaten aus, z. B. indem Bilder, die Masken anfordern, an ein Segmentierungsmodell weitergeleitet werden.
- Ergebnisbasiert: Schätze die erwartete Qualität, die Kosten oder die Antwortzeit jedes Kandidaten und wähle die Option mit der höchsten Bewertung aus.
- Angelernt: Verwende einen leichtgewichtigen Klassifikator oder ein Routing-Modell, um abzuleiten, welcher Kandidat am besten zur Eingabe passt.
- Kaskadiert: Führe zuerst ein schnelles Modell aus und eskaliere unsichere oder risikoreiche Ergebnisse dann an ein leistungsfähigeres Modell.
Beispielsweise sagt das intelligente Prompt-Routing von Amazon Bedrock die Antwortqualität voraus, bevor zwischen Sprachmodellen gewählt wird, während die Leitlinien zur Modell-Routing-Strategie von Microsoft kosten-, qualitäts- und ausgewogenes Routing beschreiben. Ähnliche Prinzipien gelten für Computer Vision: Anfragen können nach Aufgabe, Kameraposition, Bildauflösung oder erforderlichem Vorhersagedetail geroutet werden.
Verwandte Konzepte und wichtige Unterschiede#
Modell-Routing ist eng mit anderen Techniken für mehrere Modelle verbunden, aber die Begriffe sind nicht austauschbar.
- KI-Gateways: Ein KI-Gateway bietet eine breitere Steuerungsschicht für Authentifizierung, Kontingente, Protokollierung und Datenverkehrsverwaltung. Die Modellauswahl kann eine Funktion des Gateways sein. Die Kubernetes Gateway API Inference Extension unterscheidet zudem modellbewusstes Routing von Endpunktauswahl und Lastausgleich.
- Modell-Ensembles: Ein Ensemble führt normalerweise mehrere Modelle aus und kombiniert deren Vorhersagen. Ein Router wählt typischerweise ein Modell aus, wodurch die Rechenleistung reduziert wird. NVIDIA Triton Ensemble-Modelle definieren stattdessen feste Datenflüsse über mehrere Modelle hinweg.
- Mixture of Experts: Eine MoE-Architektur routet interne Darstellungen an Komponenten innerhalb eines einzigen neuronalen Netzwerks. Modell-Routing wählt zwischen separat bereitstellbaren Modellen oder Endpunkten aus.
- Agenten-Routing: Ein Agenten-Router wählt einen spezialisierten Agenten, einen Workflow oder ein Tool aus. Modell-Routing wählt das zugrunde liegende Modell aus, das einen Inferenzschritt ausführt. In einem agentenbasierten System können beide Formen des Routings vorhanden sein.
Lastausgleich ist ein weiterer wichtiger Unterschied. Er verteilt Anfragen auf Replikate desselben Dienstes, um die Verfügbarkeit oder den Durchsatz zu verbessern. Modell-Routing wählt zwischen Modellen mit unterschiedlichen Funktionen, Kosten oder Ausgaben aus.
Anwendungen in der Praxis#
Visuelle Inspektion: Ein Fertigungssystem kann Objekterkennung für routinemäßige Teilezählung verwenden, aber vermutete Oberflächenfehler zur präzisen Abgrenzung an die Instanzsegmentierung weiterleiten. Ultralytics YOLO26 unterstützt sowohl Objekterkennung als auch Instanzsegmentierung, wodurch aufgabenbasiertes Routing innerhalb einer konsistenten API möglich wird. Dadurch wird vermieden, die Kosten für die Segmentierung zu tragen, wenn Bounding-Boxen ausreichen.
KI-Assistenten: Ein Support-Assistent kann einfache Klassifizierungs- und Abrufanfragen an ein kleines, schnelles Sprachmodell senden und sich gleichzeitig ein stärkeres Modell für komplexe Argumentation oder Werkzeugverwendung vorbehalten. Die Leitlinien zur agentenbasierten Architektur von Google Cloud beschreiben dieses Muster als eine Möglichkeit, Qualität, Latenz und Kosten auszugleichen. Im Gegensatz zu einer festen Kaskade kann dynamisches Routing das stärkere Modell auswählen, bevor eine erste Antwort generiert wird.
Implementierung und Evaluierung eines Routers#
Dieses minimale Ultralytics-Beispiel routet ein Bild entsprechend der von einer Anwendung angeforderten Ausgabe an Erkennung oder Segmentierung:
from ultralytics import YOLO
models = {
"detect": YOLO("yolo26n.pt"),
"segment": YOLO("yolo26n-seg.pt"),
}
requested_task = "segment"
source = "https://ultralytics.com/images/bus.jpg"
model = models.get(requested_task)
if model is None:
raise ValueError(f"Unsupported task: {requested_task}")
results = model(source)
result = results[0]
result.save(filename=f"{requested_task}_result.jpg")Die Regel ist absichtlich einfach: Anfragen, die Objektmasken benötigen, gehen an die Segmentierung, während Anfragen, die nur Bounding-Boxen benötigen, die Erkennung verwenden können. Produktions-Router können auch gemessene Genauigkeit, Warteschlangentiefe, Gerätetyp, Datenschutzbeschränkungen oder den Systemzustand berücksichtigen.
Evaluiere das Routing anhand repräsentativer Datenströme und nicht nur anhand von Modellmittelwerten. Verfolge die Routing-Verteilung, die End-to-End-Latenz, die Kosten, Fehler und die Qualität auf Aufgaben Ebene für jedes ausgewählte Modell. Die Beobachtbarkeits-Leitlinien von OpenTelemetry erklären, wie Traces, Metriken und Protokolle einzelne Anfragen über verteilte Dienste hinweg verfolgen können. Die Überwachung der Ultralytics Platform unterstützt gleicherweise die Überprüfung von Endpunktlatenz, Fehlern, Systemzustand und Anfrageaktivität.
Fehlrouting kann die Kosten erhöhen, Latenzziele verfehlen oder schwierige Eingaben an ein unzulängliches Modell senden. Teams sollten daher ein Fallback-Verhalten definieren, berechtigte Modelle für sensible Workloads einschränken, die ausgewählte Route protokollieren und die Richtlinie regelmäßig erneut testen. Diese Kontrollen stimmen die Routing-Entscheidungen mit den umfassenderen Praktiken im NIST AI Risk Management Framework ab.






