Mixture of Agents (MoA)
Entdecke, wie Mixture of Agents (MoA) mehrere LLMs zur Lösung komplexer Aufgaben nutzt. Erfahre, wie du Ultralytics YOLO26 als visuellen Agenten in MoA-Workflows integrierst.
Eine Mischung von Agenten (MoA) ist eine fortschrittliche Architektur für künstliche Intelligenz, die mehrere große Sprachmodelle (LLMs) oder autonome Agenten nutzt, um komplexe Aufgaben gemeinsam zu lösen. Statt sich auf ein einzelnes Modell zur Erzeugung einer Antwort zu verlassen, fragt ein MoA-System gleichzeitig mehrere unterschiedliche Modelle ab. Diese ersten Agenten erzeugen unabhängige Antworten, die anschließend an einen Aggregator- oder Synthese-Agenten übergeben werden. Der Aggregator bewertet, verfeinert und kombiniert die unterschiedlichen Perspektiven zu einer einzigen hochwertigen endgültigen Ausgabe. Dieser kooperative Ansatz steigert die Schlussfolgerungsfähigkeit erheblich und verringert individuelle Verzerrungen oder Schwächen einzelner Modelle. Damit stellt er einen bedeutenden Fortschritt in der Verarbeitung natürlicher Sprache (NLP) und bei der Problemlösung dar.
Mischung von Agenten im Vergleich zur Mischung von Experten#
Obwohl sie ähnlich klingen, ist es wichtig, MoA vom verwandten Konzept der Mischung von Experten (MoE) zu unterscheiden.
- Mischung von Experten (MoE): Sie arbeitet innerhalb einer einzelnen Architektur neuronaler Netzwerke. Dabei wird ein Routing-Mechanismus verwendet, um während der Inferenz für jedes Token nur bestimmte spezialisierte Teilschichten (Experten) zu aktivieren. Das optimiert die Recheneffizienz und erhält gleichzeitig eine hohe Anzahl von Parametern.
- Mischung von Agenten (MoA): Sie arbeitet auf Modell- oder Systemebene. Dabei interagieren vollständig getrennte KI-Agenten—oft auf Basis unterschiedlicher Basismodelle—innerhalb einer Pipeline. MoA ähnelt eher einem Modellensemble, das mit einem intelligenten Prüfprozess kombiniert wird, wie in aktueller Forschung zu Multi-Agenten-Systemen ausführlich beschrieben.
Anwendungen in der Praxis#
MoA-Architekturen eignen sich besonders für Umgebungen, in denen tiefgehendes Schlussfolgern, Faktenprüfung und die Synthese vielfältiger Daten erforderlich sind.
- Komplexe Softwareentwicklung: Bei der Softwareentwicklung könnte ein MoA-System Anthropic Claude zum Schreiben der Kernlogik, OpenAI GPT-4o zum Erzeugen von Unit-Tests und ein lokal betriebenes Modell für Sicherheitsprüfungen einsetzen. Ein abschließender Aggregator-Agent überprüft den kombinierten Code, testet ihn und gibt ein verfeinertes, fehlerfreies Skript aus.
- Automatisierte medizinische Diagnostik: Im Bereich KI im Gesundheitswesen kann eine diagnostische MoA-Pipeline spezialisierte Agenten einsetzen, um die Krankengeschichte zu prüfen, Laborergebnisse zu analysieren und medizinische Bilddaten zu verarbeiten. Der Synthese-Agent fasst diese Erkenntnisse zusammen, um Ärztinnen und Ärzte bei der Erstellung einer umfassenden Diagnose zu unterstützen und die Wahrscheinlichkeit menschlicher Fehler deutlich zu verringern.
Integration von Vision in MoA-Workflows#
Moderne MoA-Systeme sind zunehmend multimodal. Das bedeutet, dass sie sich auf Modelle für Computer Vision (CV) stützen, um die physische Welt wahrzunehmen, bevor sie Schlussfolgerungen daraus ziehen. Beispielsweise kann im Bereich KI in der Fertigung ein visueller Agent einen Live-Kamerastream untersuchen und seine sachlichen Beobachtungen an einen Schlussfolgerungsagenten senden.
Das folgende Python-Beispiel zeigt, wie Ultralytics YOLO26 als „visueller Agent“ innerhalb einer MoA-Pipeline fungieren kann, indem es Kontextdaten extrahiert, die nachgelagerten LLMs zugeführt werden. Entwickler können diese spezialisierten Vision-Tools mit der Ultralytics Platform nahtlos verwalten und feinabstimmen.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Indem sie die Lücke zwischen leistungsfähigen Vision-Modellen auf Basis von Frameworks wie PyTorch und fortschrittlichen kognitiven Engines wie Google Gemini schließen, spiegeln MoA-Ökosysteme die menschliche Zusammenarbeit wider. Sie entwickeln sich rasch zum Rückgrat von Agentic-RAG-Pipelines und ebnen den Weg für robustere und zuverlässigere autonome Systeme.









