Model Routing
Aprende como o roteamento de modelos seleciona o modelo de IA certo para cada solicitação para equilibrar precisão, custo, latência e uso de recursos em sistemas de múltiplos modelos.
O roteamento de modelo é o processo de selecionar qual modelo de IA deve lidar com cada solicitação recebida. Em vez de enviar cada entrada para um modelo, uma camada de roteamento avalia sinais como a tarefa solicitada, o tipo de entrada, a complexidade, a meta de latência, o limite de custo, a disponibilidade de hardware ou os requisitos de confiança. Em seguida, ela encaminha a solicitação para o candidato mais adequado. Nesse contexto, um “roteador” é um componente de decisão de inferência, não um roteador de rede físico. O roteamento ajuda os sistemas de aprendizado de máquina multi-modelo a equilibrar a qualidade de previsão, o uso de recursos e a latência de inferência.
Como Funciona o Roteamento de Modelo#
Um sistema de roteamento geralmente contém um conjunto de modelos implantados, lógica de decisão e uma interface de aplicativo comum. O aplicativo envia uma solicitação, o roteador seleciona um modelo elegível e a camada de serviço de modelo retorna a saída desse modelo.
As decisões de roteamento podem ser:
- Baseadas em regras: Seleciona um modelo usando metadados explícitos, como o roteamento de imagens que solicitam máscaras para um modelo de segmentação.
- Baseadas em pontuação: Estima a qualidade, o custo ou o tempo de resposta esperados de cada candidato e escolhe a opção com a pontuação mais alta.
- Baseadas em aprendizado: Usa um classificador leve ou um modelo de roteamento para inferir qual candidato corresponde melhor à entrada.
- Em cascata: Executa um modelo rápido primeiro e, em seguida, encaminha resultados incertos ou de alto risco para um modelo mais capaz.
Por exemplo, o roteamento inteligente de prompts do Amazon Bedrock prevê a qualidade da resposta antes de escolher entre modelos de linguagem, enquanto a orientação de estratégia de roteamento de modelos da Microsoft descreve o roteamento por custo, qualidade e equilibrado. Princípios semelhantes se aplicam à visão computacional: as solicitações podem ser roteadas por tarefa, localização da câmera, resolução da imagem ou detalhe de previsão necessário.
Conceitos relacionados e principais diferenças#
O roteamento de modelo está intimamente conectado a outras técnicas multi-modelo, mas os termos não são intercambiáveis.
- Gateways de IA: Um gateway de IA fornece uma camada de controle mais ampla para autenticação, cotas, registro e gerenciamento de tráfego. A seleção de modelo pode ser um recurso do gateway. A Extensão de Inferência da API de Gateway do Kubernetes também distingue o roteamento ciente de modelos da seleção de pontos de extremidade e do balanceamento de carga.
- Ensembles de modelos: Um ensemble normalmente executa vários modelos e combina suas previsões. Um roteador geralmente escolhe um modelo, reduzindo a computação. Os modelos de ensemble do NVIDIA Triton, em vez disso, definem fluxos de dados fixos por meio de vários modelos.
- Mistura de especialistas: Uma arquitetura MoE roteia representações internas para componentes dentro de uma rede neural. O roteamento de modelo seleciona entre modelos ou pontos de extremidade implantáveis separadamente.
- Roteamento de agentes: Um roteador de agentes escolhe um agente, fluxo de trabalho ou ferramenta especializada. O roteamento de modelo escolhe o modelo subjacente que executa uma etapa de inferência. Em um sistema agêntico, ambas as formas de roteamento podem estar presentes.
O balanceamento de carga é outra distinção importante. Ele distribui solicitações entre réplicas do mesmo serviço para melhorar a disponibilidade ou a vazão. O roteamento de modelo escolhe entre modelos com diferentes capacidades, custos ou saídas.
Aplicações no mundo real#
Inspeção visual: Um sistema de fabricação pode usar detecção de objetos para contagem rotineira de peças, mas rotear defeitos de superfície suspeitos para segmentação de instâncias para limites precisos. O Ultralytics YOLO26 oferece suporte tanto à detecção de objetos quanto à segmentação de instâncias, tornando o roteamento baseado em tarefas possível dentro de uma API consistente. Isso evita pagar o custo da segmentação quando as caixas delimitadoras são suficientes.
Assistentes de IA: Um assistente de suporte pode enviar solicitações simples de classificação e consulta para um modelo de linguagem pequeno e rápido, enquanto reserva um modelo mais forte para raciocínio complexo ou uso de ferramentas. A orientação de arquitetura agêntica do Google Cloud descreve esse padrão como uma maneira de equilibrar qualidade, latência e custo. Ao contrário de uma cascata fixa, o roteamento dinâmico pode selecionar o modelo mais forte antes de gerar uma resposta inicial.
Implementando e Avaliando um Roteador#
Este exemplo minimalista da Ultralytics roteia uma imagem para detecção ou segmentação de acordo com a saída solicitada por um aplicativo:
from ultralytics import YOLO
models = {
"detect": YOLO("yolo26n.pt"),
"segment": YOLO("yolo26n-seg.pt"),
}
requested_task = "segment"
source = "https://ultralytics.com/images/bus.jpg"
model = models.get(requested_task)
if model is None:
raise ValueError(f"Unsupported task: {requested_task}")
results = model(source)
result = results[0]
result.save(filename=f"{requested_task}_result.jpg")A regra é intencionalmente simples: solicitações que precisam de máscaras de objetos vão para a segmentação, enquanto solicitações que precisam apenas de caixas delimitadoras podem usar a detecção. Os roteadores de produção também podem considerar a precisão medida, a profundidade da fila, o tipo de dispositivo, as restrições de privacidade ou a integridade do serviço.
Avalie o roteamento com base em tráfego representativo, em vez de apenas nas médias dos modelos. Acompanhe a distribuição de rotas, a latência de ponta a ponta, o custo, as falhas e a qualidade em nível de tarefa para cada modelo selecionado. A orientação de observabilidade do OpenTelemetry explica como rastreamentos, métricas e logs podem acompanhar solicitações individuais por meio de serviços distribuídos. O monitoramento de implantação da Ultralytics Platform também oferece suporte à inspeção de latência de pontos de extremidade, erros, integridade e atividade de solicitações.
O roteamento incorreto pode aumentar os custos, perder metas de latência ou enviar entradas difíceis para um modelo inadequado. Portanto, as equipes devem definir comportamento de fallback, restringir modelos elegíveis para cargas de trabalho confidenciais, registrar a rota selecionada e testar novamente a política periodicamente. Esses controles alinham as decisões de roteamento com práticas mais amplas no NIST AI Risk Management Framework.






