Mixture of Agents (MoA)
Découvre comment le mélange d’agents (MoA) exploite plusieurs LLMs pour résoudre des tâches complexes. Apprends à intégrer Ultralytics YOLO26 comme agent visuel dans les workflows MoA.
Un mélange d'agents (MoA) est une architecture avancée d'intelligence artificielle qui exploite plusieurs grands modèles de langage (LLMs) ou agents autonomes pour résoudre des tâches complexes en collaboration. Au lieu de s'appuyer sur un seul modèle pour générer une réponse, un système MoA interroge simultanément plusieurs modèles distincts. Ces agents initiaux produisent des réponses indépendantes, qui sont ensuite transmises à un agent agrégateur ou de synthèse. L'agrégateur évalue, affine et combine ces perspectives variées en une sortie finale unique et de haute qualité. Cette approche collaborative améliore considérablement les capacités de raisonnement et atténue les biais ou les faiblesses propres aux modèles autonomes, ce qui représente une avancée majeure dans le traitement automatique du langage (NLP) et la résolution de problèmes.
Mélange d'agents contre mélange d'experts#
Bien qu'ils semblent similaires, il est essentiel de distinguer le MoA du concept connexe de mélange d'experts (MoE).
- Mélange d'experts (MoE) : fonctionne au sein d'une seule architecture de réseau neuronal. Il utilise un mécanisme de routage pour activer uniquement des sous-couches spécialisées spécifiques (les experts) pour chaque token pendant l'inférence. Cela optimise l'efficacité des calculs tout en conservant un nombre élevé de paramètres.
- Mélange d'agents (MoA) : fonctionne au niveau du modèle ou du système. Il implique des agents d'IA entièrement distincts — souvent construits à partir de différents modèles de base — qui interagissent au sein d'un pipeline. Le MoA ressemble davantage à un ensemble de modèles associé à un processus intelligent de vérification, comme l'expliquent les travaux récents sur les systèmes multi-agents.
Applications concrètes#
Les architectures MoA excellent dans les environnements qui nécessitent un raisonnement approfondi, une vérification des faits et une synthèse de données diversifiées.
- Ingénierie logicielle complexe : dans le développement logiciel, un système MoA peut utiliser Anthropic Claude pour écrire la logique principale, OpenAI GPT-4o pour générer des tests unitaires et un modèle localisé pour effectuer un audit de sécurité. Un agent agrégateur final examine le code combiné, le teste et produit un script affiné et exempt de bogues.
- Diagnostics médicaux automatisés : dans le domaine de la santé avec l'IA, un pipeline MoA de diagnostic peut déployer des agents spécialisés pour examiner les antécédents du patient, analyser les résultats de laboratoire et traiter les images médicales. L'agent de synthèse regroupe ces résultats afin d'aider les médecins à établir un diagnostic complet, réduisant considérablement le risque d'erreur humaine.
Intégrer la vision aux workflows MoA#
Les systèmes MoA modernes sont de plus en plus multimodaux, ce qui signifie qu'ils s'appuient sur des modèles de vision par ordinateur (CV) pour percevoir le monde physique avant de le traiter par le raisonnement. Par exemple, dans le domaine de l'IA pour la fabrication, un agent visuel peut inspecter un flux vidéo de caméra en direct et transmettre ses observations factuelles à un agent de raisonnement.
L'exemple Python suivant montre comment Ultralytics YOLO26 peut fonctionner comme un « agent visuel » au sein d'un pipeline MoA, en extrayant des données contextuelles destinées à être transmises aux LLM en aval. Les développeurs peuvent gérer et affiner facilement ces outils de vision spécialisés à l'aide de la Ultralytics Platform.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")En comblant l'écart entre des modèles de vision très performants construits avec des frameworks comme PyTorch et des moteurs cognitifs avancés comme Google Gemini, les écosystèmes MoA reproduisent la collaboration humaine. Ils deviennent rapidement l'épine dorsale des pipelines Agentic RAG, ouvrant la voie à des systèmes autonomes plus robustes et plus fiables.









