Mixture of Agents (MoA)
Descubra como a Mistura de Agentes (MoA) utiliza vários LLMs para resolver tarefas complexas. Aprenda a integrar o Ultralytics YOLO26 como agente visual em fluxos de trabalho MoA.
Uma Mistura de Agentes (MoA) é uma arquitetura avançada de inteligência artificial que utiliza vários modelos de linguagem de grande escala (LLMs) ou agentes autónomos para resolver colaborativamente tarefas complexas. Em vez de depender de um único modelo para gerar uma resposta, um sistema MoA consulta vários modelos distintos em simultâneo. Estes agentes iniciais produzem respostas independentes, que são depois transmitidas a um agente agregador ou sintetizador. O agregador avalia, aperfeiçoa e combina as diversas perspetivas numa única saída final de alta qualidade. Esta abordagem colaborativa aumenta significativamente as capacidades de raciocínio e reduz os enviesamentos ou as limitações individuais dos modelos autónomos, representando um grande avanço no processamento de linguagem natural (NLP) e na resolução de problemas.
Mistura de Agentes vs. Mistura de Especialistas#
Embora pareçam semelhantes, é crucial distinguir o MoA do conceito relacionado de Mistura de Especialistas (MoE).
- Mistura de Especialistas (MoE): Funciona dentro de uma única arquitetura de rede neuronal. Utiliza um mecanismo de encaminhamento para ativar apenas subcamadas específicas e especializadas (especialistas) para cada token durante a inferência. Isto otimiza a eficiência computacional, mantendo um elevado número de parâmetros.
- Mistura de Agentes (MoA): Funciona ao nível do modelo ou do sistema. Envolve agentes de IA totalmente separados — frequentemente baseados em diferentes modelos fundacionais — que interagem numa pipeline. O MoA funciona mais como um ensemble de modelos combinado com um processo inteligente de revisão, conforme descrito em investigação recente sobre sistemas multiagente.
Aplicações no mundo real#
As arquiteturas MoA destacam-se em ambientes que exigem raciocínio profundo, verificação de factos e síntese de dados diversificados.
- Engenharia de Software Complexa: No desenvolvimento de software, um sistema MoA pode utilizar o Anthropic Claude para escrever a lógica principal, o OpenAI GPT-4o para gerar testes unitários e um modelo local para realizar uma auditoria de segurança. Um agente agregador final revê o código combinado, testa-o e produz um script aperfeiçoado e sem erros.
- Diagnóstico Médico Automatizado: Na IA na área da saúde, uma pipeline de diagnóstico MoA pode utilizar agentes especializados para rever o historial do paciente, analisar resultados laboratoriais e processar imagens médicas. O agente sintetizador agrega estas conclusões para ajudar os médicos a formular um diagnóstico abrangente, reduzindo drasticamente a probabilidade de erro humano.
Integração da Visão em Pipelines MoA#
Os sistemas MoA modernos são cada vez mais multimodais, o que significa que dependem de modelos de visão computacional (CV) para percecionar o mundo físico antes de raciocinarem sobre ele. Por exemplo, na IA na indústria, um agente visual pode inspecionar uma transmissão de câmara em direto e enviar as suas observações factuais a um agente de raciocínio.
O exemplo seguinte em Python demonstra como o Ultralytics YOLO26 pode funcionar como um "agente visual" numa pipeline MoA, extraindo dados contextuais para serem transmitidos a LLMs a jusante. Os programadores podem gerir e ajustar estes recursos especializados de visão de forma simples através da Ultralytics Platform.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Ao estabelecer uma ligação entre modelos de visão altamente capazes, desenvolvidos com frameworks como o PyTorch, e motores cognitivos avançados como o Google Gemini, os ecossistemas MoA reproduzem a colaboração humana. Estão rapidamente a tornar-se a espinha dorsal das pipelines de Agentic RAG, abrindo caminho para sistemas autónomos mais robustos e fiáveis.









