AI Gateway
Aprende qué es una pasarela de IA, cómo enruta modelos, controla costes, protege las solicitudes y monitoriza la inferencia para obtener despliegues fiables de IA y Ultralytics YOLO.
Un AI gateway es una capa de control situada entre las aplicaciones y uno o más servicios de inteligencia artificial. Al igual que un API gateway, recibe solicitudes y las reenvía a los backends, pero añade controles específicos de IA para la selección de modelos, el uso de tokens o cómputo, la seguridad, la privacidad, el coste y el rendimiento. Puede proporcionar un único punto de acceso estable para modelos en la nube, sistemas autoalojados y Ultralytics YOLO model serving, lo que facilita la gobernanza de los artificial intelligence systems de producción a medida que cambian sus modelos y proveedores. (learn.microsoft.com)
Cómo funciona un AI Gateway#
El gateway evalúa cada solicitud entrante antes de enviarla a un inference engine. Dependiendo de las políticas configuradas, puede:
- Autenticar y proteger solicitudes: Aplicar controles de acceso, cuotas, validación de entradas y defensas basadas en el OWASP Top 10 for LLM Applications, junto con prácticas más amplias de data security.
- Enrutar el tráfico de forma inteligente: Seleccionar un modelo o punto de acceso en función de la latencia, la disponibilidad, el coste, la región, la tarea o la carga de hardware. La Kubernetes Gateway API Inference Extension estandariza el enrutamiento consciente de modelos para modelos generativos autoalojados.
- Mejorar la fiabilidad: Utilizar reintentos, equilibrado de carga y Vercel AI Gateway model fallbacks cuando un proveedor o modelo deja de estar disponible.
- Controlar el consumo: Aplicar presupuestos de solicitudes, tokens o cómputo mediante políticas como el Envoy Gateway rate limiting.
- Registrar telemetría: Capturar la latencia, los errores, las elecciones de modelos y el uso a través de sistemas de observability utilizando estándares como OpenTelemetry GenAI attributes. (gateway.envoyproxy.io)
Aplicaciones en el mundo real#
- Inspección visual minorista: Las cámaras envían imágenes de productos a través de un gateway a un YOLO26 object detection model. El gateway autentica cada tienda, limita el volumen de solicitudes, enruta el tráfico al despliegue más cercano y envía los fallos a un punto de acceso de respaldo, lo que permite un real-time inference fiable.
- Asistente de cliente multimodelo: Una aplicación utiliza el Vercel AI Gateway unified API o el Cloudflare AI Gateway para enrutar las preguntas sencillas a un modelo de menor coste y las solicitudes complejas a uno más capaz. Los registros (logs) facilitan el análisis de costes, la depuración y el model monitoring.
- Acceso de IA empresarial: Las organizaciones pueden utilizar las Azure API Management AI gateway capabilities para gobernar modelos, herramientas y servicios remotos del Model Context Protocol services mediante autenticación centralizada, cuotas, registro y políticas de seguridad de contenidos. (learn.microsoft.com)
Ejemplo de visión por computador#
El código de inferencia sigue centrado en la predicción mientras el gateway maneja el acceso, el enrutamiento, los límites y la telemetría:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Este controlador podría ejecutarse detrás de un Ultralytics Platform deployment endpoint, donde el deployment monitoring realiza un seguimiento de las solicitudes, la latencia, los errores, los registros y las comprobaciones de estado. (learn.microsoft.com)
AI Gateway frente a términos relacionados#
Un AI gateway gestiona el tráfico antes y después de la ejecución del modelo, mientras que el model deployment coloca un modelo en producción y el model serving ejecuta las predicciones. Un inference gateway es más especializado y optimiza el enrutamiento entre réplicas de modelos o aceleradores. Por su parte, la AI agent orchestration coordina decisiones y herramientas de varios pasos en lugar de controlar el acceso a la red.
Las mejores prácticas actuales incluyen minimizar el contenido sensible registrado, aplicar controles de data privacy, probar las rutas de respaldo, realizar un seguimiento de la calidad y el coste por modelo, y seguir el NIST Generative AI Risk Management Profile. La investigación reciente sobre los LLM control planes y los adversarial risks in model routing también destaca la importancia de unas políticas auditables y unas decisiones de enrutamiento seguras. (nist.gov)






