Compound AI Systems
Aprende como os sistemas de IA composta combinam modelos, ferramentas, dados e regras. Explora arquiteturas, aplicações, compromissos e boas práticas para fluxos de trabalho de IA fiáveis.
Os sistemas de IA compostos são aplicações de IA construídas a partir de vários componentes interativos, em vez de um único modelo. Um sistema pode combinar modelos, serviços de recuperação, bases de dados, regras determinísticas, ferramentas externas e revisão humana num único fluxo de trabalho coordenado. Na visão computacional, por exemplo, um modelo pode detetar objetos enquanto o software de rastreamento mantém as identidades, as regras de negócio interpretam os eventos e os serviços de monitorização acompanham o desempenho em produção. A característica definidora é a composição: o comportamento ao nível do sistema emerge da forma como as partes trocam informações e tomam decisões.
Como funcionam os sistemas de IA compostos#
Um sistema composto divide uma tarefa maior em etapas especializadas. Os componentes típicos incluem pré-processamento de dados, um ou mais modelos de IA, armazenamento, lógica de validação, interfaces de programação de aplicações e uma camada de orquestração. Contratos claros, como os descritos na Especificação OpenAPI, definem os dados que cada serviço aceita e devolve.
O controlo pode ser determinístico, com código convencional a chamar os componentes numa sequência fixa, ou dinâmico, com uma camada de orquestração de agentes de IA a selecionar ferramentas e rotas em tempo de execução. A orquestração de IA coordena dependências, novas tentativas, recursos e fluxo de dados em toda a aplicação.
Os padrões comuns incluem a geração aumentada por recuperação, em que a recuperação fornece contexto a um modelo de linguagem, e pipelines de fusão de sensores que combinam câmaras, radar ou outras entradas. A mudança mais ampla de modelos isolados para sistemas integrados é descrita na visão geral da Berkeley AI Research sobre sistemas de IA compostos. (bair.berkeley.edu)
Porque são importantes os sistemas compostos#
A composição permite aos programadores melhorar uma aplicação sem voltar a treinar um modelo enorme. Um componente especializado pode ser substituído, dimensionado ou otimizado enquanto o restante do fluxo de trabalho permanece estável. As regras e as etapas de validação também podem proporcionar mais controlo do que depender inteiramente da saída probabilística do modelo.
Estes benefícios introduzem compromissos ao nível do sistema:
- Propagação de falhas: Uma deteção incorreta, uma recuperação falhada ou uma API indisponível pode afetar todas as decisões posteriores.
- Latência e custo: Cada chamada de modelo, pedido de rede e etapa de verificação consome parte do orçamento total de resposta.
- Deriva das interfaces: A atualização de um serviço pode alterar o seu formato de saída ou pressupostos e interromper silenciosamente outro componente.
- Avaliação difícil: Um componente forte não garante um resultado sólido de ponta a ponta.
Consequentemente, as operações de machine learning devem abranger todo o fluxo de trabalho. As orientações de observabilidade do OpenTelemetry explicam como os traces, as métricas e os logs revelam o que aconteceu entre serviços distribuídos, enquanto o acompanhamento de experiências do MLflow pode registar configurações de modelos e resultados de avaliação. (opentelemetry.io)
Conceitos relacionados e principais diferenças#
Um sistema de IA composto não é simplesmente outro nome para um modelo complexo.
Um ensemble de modelos combina previsões de vários modelos, frequentemente através de votação, média ou stacking. Um ensemble pode ser um componente de um sistema composto, mas normalmente não inclui bases de dados, ferramentas, lógica de fluxo de trabalho e serviços operacionais.
Um fluxo de trabalho agentivo permite que os modelos escolham ações ou ferramentas de forma autónoma. Os sistemas compostos são mais abrangentes: muitos utilizam pipelines fixos, serviços orientados por eventos ou aprovação humana sem agentes autónomos.
Da mesma forma, RAG é um padrão composto específico que envolve recuperação e geração. A IA composta também pode coordenar visão computacional, previsão, otimização, robótica e software convencional sem utilizar um modelo de linguagem.
Aplicações no mundo real#
-
Inspeção visual na indústria: Uma câmara captura os produtos, um modelo Ultralytics YOLO26 deteta defeitos, a lógica baseada em regras verifica a gravidade e a localização, e um sistema de produção rejeita ou aprova cada item. Os casos incertos podem ser encaminhados para um inspetor humano, enquanto as imagens armazenadas apoiam um novo treino posterior.
-
Análise de tráfego e estacionamento: A deteção identifica veículos, o rastreamento de vários objetos mantém as identidades entre frames, a lógica geométrica determina a ocupação da faixa ou da região de estacionamento, e os dashboards agregam contagens e alertas. Os erros podem causar contagens duplicadas, eventos de congestionamento não detetados ou estimativas incorretas de disponibilidade, pelo que cada etapa deve ser testada em conjunto.
O exemplo simplificado seguinte mostra a perceção a alimentar uma lógica de decisão determinística:
from ultralytics import YOLO
# Perception component
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Policy component
person_class = next(i for i, name in result.names.items() if name == "person")
person_count = int((result.boxes.cls == person_class).sum())
decision = "review" if person_count >= 4 else "continue"
print({"people_detected": person_count, "next_step": decision})
result.save(filename="compound_system_input.jpg")Aqui, YOLO produz observações estruturadas, enquanto uma lógica de políticas separada determina a ação seguinte. Um sistema de produção poderia adicionar armazenamento, notificações, controlos de acesso ou revisão humana.
Orientações práticas de conceção#
Começa por definir um objetivo mensurável de ponta a ponta e, em seguida, atribui a cada componente uma responsabilidade clara. Define esquemas e tempos limite em cada fronteira, testa os componentes de forma independente e avalia fluxos de trabalho realistas, em vez de avaliar apenas a precisão do modelo.
Utiliza traces para acompanhar pedidos individuais, define orçamentos de latência e custo e disponibiliza novas tentativas ou alternativas seguras para serviços indisponíveis. As sondas de integridade do Kubernetes ilustram como os serviços implementados podem expor sinais de prontidão e atividade.
Os controlos de risco devem abranger o sistema completo, incluindo o acesso a dados, ferramentas externas, substituições humanas e consequências posteriores. O NIST AI Risk Management Framework fornece orientações orientadas para o ciclo de vida para governar, medir e gerir estes riscos. As equipas podem utilizar a Ultralytics Platform para ligar a anotação de conjuntos de dados, o treino, a implementação e a monitorização em produção dos componentes de visão dentro de uma aplicação composta mais abrangente. (nist.gov)









