Model Routing
Scopri in che modo il routing dei modelli seleziona il modello di intelligenza artificiale giusto per ogni richiesta per bilanciare precisione, costi, latenza e utilizzo delle risorse nei sistemi multi-modello.
Il routing dei modelli è il processo di selezione del modello di intelligenza artificiale che deve gestire ciascuna richiesta in arrivo. Invece di inviare ogni input a un singolo modello, un livello di routing valuta segnali quali l'attività richiesta, il tipo di input, la complessità, l'obiettivo di latenza, il limite di costo, la disponibilità dell'hardware o i requisiti di affidabilità. Inoltra quindi la richiesta al candidato più idoneo. In questo contesto, un “router” è un componente decisionale di inferenza, non un router di rete fisico. Il routing aiuta i sistemi di machine learning multi-modello a bilanciare la qualità delle predizioni, l'utilizzo delle risorse e la latenza di inferenza.
Come funziona il routing dei modelli#
Un sistema di routing contiene generalmente un pool di modelli distribuiti, logica decisionale e un'interfaccia applicativa comune. L'applicazione invia una richiesta, il router seleziona un modello idoneo e il livello di servizio del modello restituisce l'output di tale modello.
Le decisioni di routing possono essere:
- Basate su regole: Selezionano un modello utilizzando metadati espliciti, come l'instradamento di immagini che richiedono maschere a un modello di segmentazione.
- Basate su punteggio: Stimano la qualità attesa, il costo o il tempo di risposta di ciascun candidato e scelgono l'opzione con il punteggio più alto.
- Apprese: Utilizzano un classificatore leggero o un modello di routing per dedurre quale candidato corrisponde meglio all'input.
- A cascata: Eseguono prima un modello veloce, quindi trasferiscono i risultati incerti o ad alto rischio a un modello più capace.
Ad esempio, il routing intelligente dei prompt di Amazon Bedrock prevede la qualità della risposta prima di scegliere tra modelli linguistici, mentre la guida alla strategia di routing dei modelli di Microsoft descrive il routing basato su costi, qualità e bilanciamento. Principi simili si applicano alla computer vision: le richieste possono essere instradate per attività, posizione della telecamera, risoluzione dell'immagine o dettaglio di predizione richiesto.
Concetti correlati e differenze chiave#
Il routing dei modelli è strettamente connesso ad altre tecniche multi-modello, ma i termini non sono intercambiabili.
- Gateway di IA: Un gateway di IA fornisce un livello di controllo più ampio per autenticazione, quote, registrazione e gestione del traffico. La selezione del modello può essere una delle funzionalità del gateway. Anche l'estensione dell'API Gateway di Kubernetes per l'inferenza distingue il routing consapevole del modello dalla selezione degli endpoint e dal bilanciamento del carico.
- Ensemble di modelli: Un ensemble normalmente esegue più modelli e combina le loro predizioni. Un router in genere sceglie un modello, riducendo il calcolo. I modelli di ensemble di NVIDIA Triton definiscono invece flussi di dati fissi attraverso diversi modelli.
- Miscela di esperti: Un'architettura basata su miscela di esperti instrada le rappresentazioni interne verso componenti all'interno di un'unica rete neurale. Il routing dei modelli seleziona tra modelli o endpoint distribuibili separatamente.
- Routing degli agenti: Un router di agenti sceglie un agente specializzato, un flusso di lavoro o uno strumento. Il routing dei modelli sceglie il modello sottostante che esegue una fase di inferenza. In un sistema basato su agenti, possono essere presenti entrambe le forme di routing.
Il bilanciamento del carico è un'altra distinzione importante. Distribuisce le richieste tra le repliche dello stesso servizio per migliorare la disponibilità o il throughput. Il routing dei modelli sceglie tra modelli con capacità, costi o output differenti.
Applicazioni nel mondo reale#
Ispezione visiva: Un sistema di produzione può utilizzare il rilevamento di oggetti per il conteggio di routine dei pezzi, ma instradare i presunti difetti superficiali alla segmentazione di istanze per ottenere confini precisi. Ultralytics YOLO26 supporta sia il rilevamento di oggetti che la segmentazione di istanze, rendendo possibile il routing basato sulle attività all'interno di un'API coerente. Ciò evita di pagare il costo della segmentazione quando i box di delimitazione sono sufficienti.
Assistenti di IA: Un assistente di supporto può inviare richieste semplici di classificazione e ricerca a un modello linguistico piccolo e veloce, riservando un modello più forte per il ragionamento complesso o l'uso di strumenti. La guida all'architettura basata su agenti di Google Cloud descrive questo pattern come un modo per bilanciare qualità, latenza e costo. A differenza di una cascata fissa, il routing dinamico può selezionare il modello più forte prima di generare una risposta iniziale.
Implementazione e valutazione di un router#
Questo esempio minimale di Ultralytics instrada un'immagine verso il rilevamento o la segmentazione in base all'output richiesto da un'applicazione:
from ultralytics import YOLO
models = {
"detect": YOLO("yolo26n.pt"),
"segment": YOLO("yolo26n-seg.pt"),
}
requested_task = "segment"
source = "https://ultralytics.com/images/bus.jpg"
model = models.get(requested_task)
if model is None:
raise ValueError(f"Unsupported task: {requested_task}")
results = model(source)
result = results[0]
result.save(filename=f"{requested_task}_result.jpg")La regola è intenzionalmente semplice: le richieste che necessitano di maschere di oggetti vanno alla segmentazione, mentre le richieste che necessitano solo di box di delimitazione possono utilizzare il rilevamento. I router di produzione possono anche considerare l'accuratezza misurata, la profondità della coda, il tipo di dispositivo, i vincoli di privacy o lo stato di salute del servizio.
Valuta il routing su traffico rappresentativo anziché solo sulle medie dei modelli. Tieni traccia della distribuzione delle rotte, della latenza end-to-end, del costo, degli errori e della qualità a livello di attività per ciascun modello selezionato. La guida all'osservabilità di OpenTelemetry spiega come tracce, metriche e log possono seguire le singole richieste attraverso servizi distribuiti. Il monitoraggio del deployment della piattaforma Ultralytics supporta analogamente l'ispezione della latenza degli endpoint, degli errori, dello stato di salute e dell'attività delle richieste.
Un errore di routing può aumentare i costi, non raggiungere gli obiettivi di latenza o inviare input difficili a un modello inadeguato. I team dovrebbero pertanto definire un comportamento di fallback, limitare i modelli idonei per carichi di lavoro sensibili, registrare la rotta selezionata e ripetere periodicamente il test della policy. Questi controlli allineano le decisioni di routing alle pratiche più ampie del NIST AI Risk Management Framework.






