Mixture of Agents (MoA)
Entdecke, wie Mixture of Agents (MoA) mehrere LLMs nutzt, um komplexe Aufgaben zu lösen. Lerne, Ultralytics YOLO26 als visuellen Agenten in MoA-Workflows zu integrieren.
Mixture of Agents (MoA) ist eine fortgeschrittene Architektur der künstlichen Intelligenz, die mehrere large language models (LLMs) oder autonome Agenten nutzt, um komplexe Aufgaben kollaborativ zu lösen. Anstatt sich auf ein einzelnes Modell zu verlassen, um eine Antwort zu generieren, fragt ein MoA-System mehrere verschiedene Modelle gleichzeitig ab. Diese initialen Agenten erzeugen unabhängige Antworten, die dann an einen Aggregator- oder Synthesizer-Agenten weitergeleitet werden. Der Aggregator bewertet, verfeinert und kombiniert die unterschiedlichen Perspektiven zu einem einzigen, hochwertigen Endergebnis. Dieser kollaborative Ansatz steigert die Argumentationsfähigkeiten erheblich und mildert die individuellen Verzerrungen oder Schwächen einzelner Modelle ab, was einen großen Sprung nach vorn bei natural language processing (NLP) und der Problemlösung darstellt.
Mixture of Agents vs. Mixture of Experts#
Obwohl sie ähnlich klingen, ist es entscheidend, MoA von dem verwandten Konzept der Mixture of Experts (MoE) zu unterscheiden.
- Mixture of Experts (MoE): Arbeitet innerhalb einer einzigen neural network architecture. Es verwendet einen Routing-Mechanismus, um bei der Inferenz nur bestimmte, spezialisierte Sub-Layer (Experten) für jeden Token zu aktivieren. Dies optimiert die Recheneffizienz bei gleichbleibend hoher Parameteranzahl.
- Mixture of Agents (MoA): Arbeitet auf Modell- oder Systemebene. Es umfasst vollständig getrennte AI agents – die oft auf verschiedenen Foundation-Modellen basieren –, die in einer Pipeline interagieren. MoA fungiert eher wie ein model ensemble in Kombination mit einem intelligenten Überprüfungsprozess, wie in aktueller multi-agent system research dargelegt.
Praxisanwendungen#
MoA-Architekturen zeichnen sich in Umgebungen aus, die tiefgreifendes Schlussfolgern, Faktenprüfung und die Synthese vielfältiger Daten erfordern.
- Komplexe Softwareentwicklung: In der Softwareentwicklung kann ein MoA-System Anthropic Claude zum Schreiben der Kernlogik, OpenAI GPT-4o zum Generieren von Unit-Tests und ein lokalisiertes Modell für die Sicherheitsprüfung verwenden. Ein finaler Aggregator-Agent überprüft den kombinierten Code, testet ihn und gibt ein verfeinertes, fehlerfreies Skript aus.
- Automatisierte medizinische Diagnostik: In AI in healthcare kann eine diagnostische MoA-Pipeline spezialisierte Agenten einsetzen, um die Patientenakte zu überprüfen, Laborergebnisse zu analysieren und medizinische Bildgebung zu verarbeiten. Der Synthesizer-Agent fasst diese Ergebnisse zusammen, um Ärzte bei der Erstellung einer umfassenden Diagnose zu unterstützen, wodurch die Wahrscheinlichkeit menschlicher Fehler drastisch reduziert wird.
Integration von Vision in MoA-Workflows#
Moderne MoA-Systeme sind zunehmend multimodal, was bedeutet, dass sie sich auf computer vision (CV)-Modelle verlassen, um die physische Welt wahrzunehmen, bevor sie darüber nachdenken. Zum Beispiel kann in AI in manufacturing ein visueller Agent einen Live-Kamerastream inspizieren und seine faktischen Beobachtungen an einen Reasoning-Agenten senden.
Das folgende Python-Beispiel zeigt, wie Ultralytics YOLO26 als „visueller Agent“ innerhalb einer MoA-Pipeline fungieren kann, um kontextbezogene Daten zu extrahieren, die an nachgeschaltete LLMs übergeben werden. Entwickler können diese spezialisierten Vision-Tools nahtlos verwalten und feinabstimmen, indem sie die Ultralytics Platform nutzen.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Indem sie die Lücke zwischen hocheffizienten Vision-Modellen, die mit Frameworks wie PyTorch erstellt wurden, und fortgeschrittenen kognitiven Engines wie Google Gemini schließen, spiegeln MoA-Ökosysteme die menschliche Zusammenarbeit wider. Sie entwickeln sich rasch zum Rückgrat von Agentic RAG-Pipelines und ebnen den Weg für robustere und zuverlässigere autonome Systeme.






