AI Gateway
Scopri cos'è un gateway AI, come instrada i modelli, controlla i costi, protegge le richieste e monitora l'inferenza per garantire AI e implementazioni Ultralytics YOLO affidabili.
Un gateway AI è un livello di controllo posizionato tra le applicazioni e uno o più servizi di intelligenza artificiale. Come un gateway API, riceve le richieste e le inoltra ai backend, ma aggiunge controlli specifici per l'AI relativi alla selezione dei modelli, all'uso di token o risorse di calcolo, alla sicurezza, alla privacy, ai costi e alle prestazioni. Può fornire un unico endpoint stabile per modelli cloud, sistemi self-hosted e serving di modelli Ultralytics YOLO, facilitando la governance dei sistemi di intelligenza artificiale in produzione quando cambiano i modelli e i provider. (learn.microsoft.com)
Come funziona un gateway AI#
Il gateway valuta ogni richiesta in ingresso prima di inviarla a un motore di inferenza. A seconda dei criteri configurati, può:
- Autenticare e proteggere le richieste: applicare controlli di accesso, quote, convalida degli input e difese basate sull'OWASP Top 10 per le applicazioni LLM, insieme a pratiche più ampie di sicurezza dei dati.
- Instradare il traffico in modo intelligente: selezionare un modello o un endpoint in base a latenza, disponibilità, costi, area geografica, attività o carico hardware. La Kubernetes Gateway API Inference Extension standardizza l'instradamento basato sul modello per i modelli generativi self-hosted.
- Migliorare l'affidabilità: utilizzare tentativi ripetuti, bilanciamento del carico e i fallback dei modelli di Vercel AI Gateway quando un provider o un modello non è disponibile.
- Controllare i consumi: applicare limiti alle richieste, ai token o alle risorse di calcolo tramite criteri come il rate limiting di Envoy Gateway.
- Registrare la telemetria: acquisire latenza, errori, scelte dei modelli e utilizzo tramite sistemi di osservabilità che usano standard come gli attributi GenAI di OpenTelemetry. (gateway.envoyproxy.io)
Applicazioni nel mondo reale#
- Ispezione visiva nella vendita al dettaglio: le telecamere inviano immagini dei prodotti tramite un gateway a un modello di rilevamento degli oggetti YOLO26. Il gateway autentica ogni punto vendita, limita il volume delle richieste, instrada il traffico verso la distribuzione più vicina e invia gli errori a un endpoint di backup, supportando un'inferenza in tempo reale affidabile.
- Assistente clienti multimodello: un'applicazione utilizza l'API unificata di Vercel AI Gateway o Cloudflare AI Gateway per instradare le domande semplici verso un modello meno costoso e le richieste complesse verso un modello più avanzato. I log supportano l'analisi dei costi, il debugging e il monitoraggio dei modelli.
- Accesso aziendale all'AI: le organizzazioni possono utilizzare le funzionalità di gateway AI di Azure API Management per governare modelli, strumenti e servizi Model Context Protocol remoti tramite autenticazione centralizzata, quote, registrazione dei log e criteri di sicurezza dei contenuti. (learn.microsoft.com)
Esempio di visione artificiale#
Il codice di inferenza rimane focalizzato sulla predizione, mentre il gateway gestisce accesso, instradamento, limiti e telemetria:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Questo handler potrebbe essere eseguito dietro un endpoint di distribuzione della Ultralytics Platform, dove il monitoraggio della distribuzione tiene traccia di richieste, latenza, errori, log, e controlli di integrità. (learn.microsoft.com)
Gateway AI e termini correlati#
Un gateway AI gestisce il traffico prima e dopo l'esecuzione del modello, mentre la distribuzione del modello inserisce un modello in produzione e il model serving esegue le predizioni. Un gateway di inferenza è più specializzato e ottimizza l'instradamento tra repliche del modello o acceleratori. L'orchestrazione degli agenti AI, invece, coordina decisioni e strumenti in più passaggi anziché controllare l'accesso alla rete.
Le migliori pratiche attuali includono la riduzione al minimo dei contenuti sensibili registrati nei log, l'applicazione di controlli di privacy dei dati, il test dei percorsi di fallback, il monitoraggio della qualità e dei costi per ogni modello e l'adesione al Profilo di gestione dei rischi dell'AI generativa del NIST. Le ricerche recenti sui piani di controllo degli LLM e sui rischi avversari nell'instradamento dei modelli evidenziano inoltre l'importanza di criteri verificabili e di decisioni di instradamento sicure. (nist.gov)









