Mixture of Agents (MoA)
Descubre cómo la mezcla de agentes (MoA) utiliza varios LLM para resolver tareas complejas. Aprende a integrar Ultralytics YOLO26 como agente visual en flujos de trabajo de MoA.
Una mezcla de agentes (MoA) es una arquitectura avanzada de inteligencia artificial que aprovecha varios modelos de lenguaje de gran tamaño (LLMs) o agentes autónomos para resolver tareas complejas de forma colaborativa. En lugar de depender de un único modelo para generar una respuesta, un sistema MoA consulta simultáneamente varios modelos distintos. Estos agentes iniciales producen respuestas independientes, que después se envían a un agente agregador o sintetizador. El agregador evalúa, perfecciona y combina las distintas perspectivas en un único resultado final de alta calidad. Este enfoque colaborativo mejora considerablemente las capacidades de razonamiento y mitiga los sesgos o las deficiencias individuales de los modelos independientes, lo que representa un gran avance en el procesamiento del lenguaje natural (NLP) y la resolución de problemas.
Mezcla de agentes frente a mezcla de expertos#
Aunque suenan parecidas, es fundamental diferenciar MoA del concepto relacionado de mezcla de expertos (MoE).
- Mezcla de expertos (MoE): Funciona dentro de una única arquitectura de red neuronal. Utiliza un mecanismo de enrutamiento para activar únicamente subcapas específicas y especializadas (expertos) para cada token durante la inferencia. Esto optimiza la eficiencia computacional al tiempo que mantiene un elevado número de parámetros.
- Mezcla de agentes (MoA): Funciona en el nivel del modelo o del sistema. Implica agentes de IA completamente independientes —a menudo basados en distintos modelos fundacionales— que interactúan en una canalización. MoA se parece más a un ensamblado de modelos combinado con un proceso inteligente de revisión, como se detalla en investigaciones recientes sobre sistemas multiagente.
Aplicaciones en el mundo real#
Las arquitecturas MoA destacan en entornos que requieren razonamiento profundo, verificación de datos y síntesis de datos diversos.
- Ingeniería de software compleja: En el desarrollo de software, un sistema MoA podría utilizar Anthropic Claude para escribir la lógica principal, OpenAI GPT-4o para generar pruebas unitarias y un modelo localizado para realizar una auditoría de seguridad. Un agente agregador final revisa el código combinado, lo prueba y genera un script perfeccionado y sin errores.
- Diagnóstico médico automatizado: En la IA aplicada a la atención sanitaria, una canalización MoA de diagnóstico puede desplegar agentes especializados para revisar el historial del paciente, analizar los resultados de laboratorio y procesar imágenes médicas. El agente sintetizador agrega estos hallazgos para ayudar a los médicos a elaborar un diagnóstico completo, reduciendo drásticamente la probabilidad de error humano.
Integración de la visión en los flujos de trabajo de MoA#
Los sistemas MoA modernos son cada vez más multimodales, lo que significa que dependen de modelos de visión por ordenador (CV) para percibir el mundo físico antes de razonar sobre él. Por ejemplo, en la IA aplicada a la fabricación, un agente visual puede inspeccionar la señal de vídeo de una cámara en directo y enviar sus observaciones objetivas a un agente de razonamiento.
El siguiente ejemplo en Python muestra cómo Ultralytics YOLO26 puede funcionar como un «agente visual» dentro de una canalización MoA, extrayendo datos contextuales que se proporcionarán a los LLM posteriores. Los desarrolladores pueden gestionar y ajustar estos recursos especializados de visión sin complicaciones mediante Ultralytics Platform.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Al cerrar la brecha entre modelos de visión altamente capaces creados con frameworks como PyTorch y motores cognitivos avanzados como Google Gemini, los ecosistemas MoA reflejan la colaboración humana. Se están convirtiendo rápidamente en la columna vertebral de las canalizaciones de RAG agéntico, allanando el camino hacia sistemas autónomos más sólidos y fiables.









