Mixture of Agents (MoA)
Descubre cómo la mezcla de agentes (MoA) aprovecha múltiples LLM para resolver tareas complejas. Aprende a integrar Ultralytics YOLO26 como agente visual en los flujos de trabajo de MoA.
Una Mixture of Agents (MoA) es una arquitectura avanzada de inteligencia artificial que aprovecha múltiples large language models (LLMs) o agentes autónomos para resolver tareas complejos de forma colaborativa. En lugar de depender de un único modelo para generar una respuesta, un sistema MoA consulta varios modelos distintos de manera simultánea. Estos agentes iniciales producen respuestas independientes, las cuales se pasan posteriormente a un agente agregador o sintetizador. El agregador evalúa, depura y combina las diversas perspectivas en un único resultado final de gran calidad. Este enfoque colaborativo potencia considerablemente las capacidades de razonamiento y mitiga los sesgos o debilidades individuales de los modelos aislados, lo que representa un gran avance en natural language processing (NLP) y en la resolución de problemas.
Mezcla de agentes frente a mezcla de expertos#
Aunque suenen parecidos, resulta fundamental distinguir la MoA del concepto relacionado de Mixture of Experts (MoE).
- Mixture of Experts (MoE): Funciona dentro de una única neural network architecture. Utiliza un mecanismo de encaminamiento para activar únicamente subcapas específicas y especializadas (expertos) para cada token durante la inferencia. Esto optimiza la eficiencia computacional al tiempo que mantiene un recuento de parámetros elevado.
- Mixture of Agents (MoA): Opera a nivel de modelo o de sistema. Implica AI agents completamente separados —a menudo construidos sobre diferentes modelos fundacionales— que interactúan en una tubería. La MoA actúa más como un model ensemble combinado con un proceso de revisión inteligente, tal como se detalla en investigaciones recientes sobre multi-agent system research.
Aplicaciones en el mundo real#
Las arquitecturas MoA destacan en entornos que requieren un razonamiento profundo, verificación de hechos y síntesis de datos diversa.
- Ingeniería de software compleja: En el desarrollo de software, un sistema MoA podría emplear Anthropic Claude para escribir la lógica principal, OpenAI GPT-4o para generar pruebas unitarias y un modelo localizado para realizar auditorías de seguridad. Un agente agregador final revisa el código combinado, lo prueba y genera un script depurado y sin errores.
- Diagnósticos médicos automatizados: En AI in healthcare, una tubería diagnóstica MoA puede desplegar agentes especializados para revisar el historial del paciente, analizar resultados de laboratorio y procesar imágenes médicas. El agente sintetizador agrupa estos hallazgos para ayudar a los médicos a formular un diagnóstico integral, reduciendo drásticamente la probabilidad de error humano.
Integración de la visión en los flujos de trabajo de MoA#
Los sistemas MoA modernos son cada vez más multimodales, lo que significa que confían en modelos de computer vision (CV) para percibir el mundo físico antes de razonar sobre él. Por ejemplo, en AI in manufacturing, un agente visual puede inspeccionar la transmisión de una cámara en directo y enviar sus observaciones fácticas a un agente de razonamiento.
El siguiente ejemplo en Python muestra cómo Ultralytics YOLO26 puede funcionar como un "agente visual" dentro de una tubería MoA, extrayendo datos contextuales para alimentar a los LLMs posteriores. Los desarrolladores pueden gestionar y afinar estas herramientas de visión especializadas de manera fluida utilizando el Ultralytics Platform.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Al tender un puente entre modelos de visión sumamente capaces construidos con frameworks como PyTorch y motores cognitivos avanzados como Google Gemini, los ecosistemas MoA reflejan la colaboración humana. Se están convirtiendo con rapidez en la columna vertebral de las tuberías de Agentic RAG, abriendo el camino hacia sistemas autónomos más sólidos y fiables.






