AI Gateway
Aprende qué es una pasarela de IA, cómo enruta modelos, controla los costes, protege las solicitudes y supervisa la inferencia para lograr una IA y despliegues de Ultralytics YOLO fiables.
Un gateway de IA es una capa de control situada entre las aplicaciones y uno o varios servicios de inteligencia artificial. Al igual que un gateway de API, recibe solicitudes y las reenvía a los backends, pero añade controles específicos de IA para la selección de modelos, el uso de tokens o recursos computacionales, la seguridad, la privacidad, el coste y el rendimiento. Puede proporcionar un único endpoint estable para modelos en la nube, sistemas autoalojados y el servicio de modelos YOLO de Ultralytics, lo que facilita la gobernanza de los sistemas de inteligencia artificial en producción a medida que cambian sus modelos y proveedores. (learn.microsoft.com)
Cómo funciona un gateway de IA#
El gateway evalúa cada solicitud entrante antes de enviarla a un motor de inferencia. Según las políticas configuradas, puede:
- Autenticar y proteger las solicitudes: Aplicar controles de acceso, cuotas, validación de entradas y defensas basadas en el OWASP Top 10 para aplicaciones LLM, junto con prácticas más amplias de seguridad de los datos.
- Enrutar el tráfico de forma inteligente: Seleccionar un modelo o endpoint en función de la latencia, la disponibilidad, el coste, la región, la tarea o la carga del hardware. La extensión de inferencia de la API Gateway de Kubernetes estandariza el enrutamiento basado en modelos generativos autoalojados.
- Mejorar la fiabilidad: Usar reintentos, balanceo de carga y mecanismos de respaldo de modelos de Vercel AI Gateway cuando un proveedor o modelo deje de estar disponible.
- Controlar el consumo: Aplicar límites de solicitudes, tokens o recursos computacionales mediante políticas como la limitación de velocidad de Envoy Gateway.
- Registrar la telemetría: Capturar la latencia, los errores, las elecciones de modelo y el uso mediante sistemas de observabilidad que empleen estándares como los atributos GenAI de OpenTelemetry. (gateway.envoyproxy.io)
Aplicaciones en el mundo real#
- Inspección visual minorista: Las cámaras envían imágenes de productos a través de un gateway a un modelo de detección de objetos YOLO26. El gateway autentica cada tienda, limita el volumen de solicitudes, dirige el tráfico a la implementación más cercana y envía los fallos a un endpoint de respaldo, lo que permite una inferencia en tiempo real fiable.
- Asistente de cliente multimodelo: Una aplicación utiliza la API unificada de Vercel AI Gateway o Cloudflare AI Gateway para dirigir las preguntas sencillas a un modelo de menor coste y las solicitudes complejas a otro más capaz. Los registros permiten analizar los costes, depurar y realizar la monitorización de modelos.
- Acceso empresarial a la IA: Las organizaciones pueden utilizar las funcionalidades de gateway de IA de Azure API Management para gobernar modelos, herramientas y servicios remotos de Model Context Protocol mediante autenticación centralizada, cuotas, registro y políticas de seguridad de contenido. (learn.microsoft.com)
Ejemplo de visión artificial#
El código de inferencia sigue centrado en la predicción, mientras que el gateway gestiona el acceso, el enrutamiento, los límites y la telemetría:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Este controlador podría ejecutarse detrás de un endpoint de implementación de Ultralytics Platform, donde la monitorización de la implementación realiza el seguimiento de las solicitudes, la latencia, los errores, los registros y las comprobaciones de estado. (learn.microsoft.com)
Gateway de IA frente a términos relacionados#
Un gateway de IA gestiona el tráfico antes y después de la ejecución del modelo, mientras que la implementación de modelos coloca un modelo en producción y el servicio de modelos ejecuta las predicciones. Un gateway de inferencia es más especializado y optimiza el enrutamiento entre réplicas de modelos o aceleradores. Por su parte, la orquestación de agentes de IA coordina decisiones y herramientas en varios pasos, en lugar de controlar el acceso a la red.
Entre las prácticas recomendadas actuales se incluyen minimizar el contenido sensible registrado, aplicar controles de privacidad de los datos, probar las rutas de respaldo, realizar un seguimiento de la calidad y el coste de cada modelo y seguir el Perfil de gestión de riesgos de la IA generativa del NIST. Las investigaciones recientes sobre planos de control de LLM y riesgos adversarios en el enrutamiento de modelos también destacan la importancia de contar con políticas auditables y decisiones de enrutamiento seguras. (nist.gov)









