AI Gateway
Saiba o que é um gateway de IA, como encaminha modelos, controla custos, protege pedidos e monitoriza a inferência para implementações fiáveis de IA e Ultralytics YOLO.
Um gateway de IA é uma camada de controlo colocada entre aplicações e um ou mais serviços de inteligência artificial. Tal como um gateway de API, recebe pedidos e encaminha-os para backends, mas acrescenta controlos específicos de IA para seleção de modelos, utilização de tokens ou computação, segurança, privacidade, custo e desempenho. Pode fornecer um endpoint estável único para modelos na cloud, sistemas alojados localmente e serving de modelos Ultralytics YOLO, facilitando a governação de sistemas de inteligência artificial em produção à medida que os respetivos modelos e fornecedores mudam. (learn.microsoft.com)
Como funciona um gateway de IA#
O gateway avalia cada pedido recebido antes de o enviar para um motor de inferência. Dependendo das políticas configuradas, pode:
- Autenticar e proteger pedidos: Aplicar controlos de acesso, quotas, validação de entradas e defesas baseadas no OWASP Top 10 para aplicações LLM, em conjunto com práticas mais abrangentes de segurança de dados.
- Encaminhar o tráfego de forma inteligente: Selecionar um modelo ou endpoint com base na latência, disponibilidade, custo, região, tarefa ou carga do hardware. A extensão de inferência da API Gateway do Kubernetes normaliza o encaminhamento com conhecimento do modelo para modelos generativos alojados localmente.
- Melhorar a fiabilidade: Utilizar novas tentativas, balanceamento de carga e alternativas de modelos do Vercel AI Gateway quando um fornecedor ou modelo fica indisponível.
- Controlar o consumo: Aplicar limites de pedidos, tokens ou computação através de políticas como a limitação de taxa do Envoy Gateway.
- Registar telemetria: Capturar latência, erros, escolhas de modelos e utilização através de sistemas de observabilidade que utilizam normas como os atributos GenAI do OpenTelemetry. (gateway.envoyproxy.io)
Aplicações no mundo real#
- Inspeção visual no retalho: As câmaras enviam imagens de produtos através de um gateway para um modelo de deteção de objetos YOLO26. O gateway autentica cada loja, limita o volume de pedidos, encaminha o tráfego para a implementação mais próxima e envia as falhas para um endpoint de reserva, permitindo uma inferência em tempo real fiável.
- Assistente de cliente multimodelo: Uma aplicação utiliza a API unificada do Vercel AI Gateway ou o Cloudflare AI Gateway para encaminhar perguntas simples para um modelo de menor custo e pedidos complexos para um modelo mais capaz. Os registos apoiam a análise de custos, a depuração e a monitorização de modelos.
- Acesso empresarial a IA: As organizações podem utilizar as capacidades de gateway de IA do Azure API Management para governar modelos, ferramentas e serviços do Model Context Protocol remotos através de autenticação centralizada, quotas, registos e políticas de segurança de conteúdos. (learn.microsoft.com)
Exemplo de visão computacional#
O código de inferência continua focado na predição, enquanto o gateway trata do acesso, encaminhamento, limites e telemetria:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
results = model.predict("https://ultralytics.com/images/bus.jpg")
detections = len(results[0].boxes)
print({"detections": detections})Este handler poderia ser executado por trás de um endpoint de implementação da Ultralytics Platform, onde a monitorização da implementação acompanha pedidos, latência, erros, registos e verificações de estado. (learn.microsoft.com)
Gateway de IA vs. termos relacionados#
Um gateway de IA gere o tráfego antes e depois da execução do modelo, enquanto a implementação de modelos coloca um modelo em produção e o serving de modelos executa predições. Um gateway de inferência é mais especializado, otimizando o encaminhamento entre réplicas de modelos ou aceleradores. Entretanto, a orquestração de agentes de IA coordena decisões e ferramentas em várias etapas, em vez de controlar o acesso à rede.
As práticas recomendadas atuais incluem minimizar o conteúdo sensível registado, aplicar controlos de privacidade de dados, testar caminhos alternativos, acompanhar a qualidade e o custo por modelo e seguir o Perfil de gestão de riscos de IA generativa do NIST. Investigações recentes sobre planos de controlo de LLM e riscos adversariais no encaminhamento de modelos também destacam a importância de políticas auditáveis e decisões de encaminhamento seguras. (nist.gov)









