Mixture of Agents (MoA)
探索代理混合 (MoA) 如何利用多个 LLM 解决复杂任务。学习如何将 Ultralytics YOLO26 集成为 MoA 工作流中的视觉代理。
Mixture of Agents (MoA) 是一种先进的人工智能架构,它利用多个 large language models (LLMs) 或自主代理来协同解决复杂任务。与依赖单个模型生成响应不同,MoA 系统会同时查询多个不同的模型。这些初始代理会生成独立的答案,然后将其传递给聚合器或综合器代理。聚合器对这些不同的观点进行评估、优化和组合,最终形成单一的高质量输出。这种协作方法显著增强了推理能力,并减轻了单机模型固有的偏差或弱点,代表了 natural language processing (NLP) 和问题解决方面的一大飞跃。
Mixture of Agents 与 Mixture of Experts#
虽然听起来相似,但必须将 MoA 与相关的 Mixture of Experts (MoE) 概念区分开来。
- Mixture of Experts (MoE): 在单个 neural network architecture 内运行。它在推理期间使用路由机制仅激活每个 token 的特定专用子层(专家)。这在保持高参数量的同时优化了计算效率。
- Mixture of Agents (MoA): 在模型或系统级别运行。它涉及完全独立的 AI agents(通常构建在不同的基础模型之上)在流水线中交互。如最近的 multi-agent system research 中所述,MoA 的运作方式更像是结合了智能审核过程的 model ensemble。
实际应用#
MoA 架构在需要深度推理、事实核查和多样化数据合成的环境中表现优异。
- 复杂软件工程: 在软件开发中,MoA 系统可能会使用 Anthropic Claude 来编写核心逻辑,使用 OpenAI GPT-4o 来生成单元测试,并使用本地化模型来进行安全审计。最终的聚合器代理会审核合并后的代码、对其进行测试并输出经过优化的无 bug 脚本。
- 自动化医疗诊断: 在 AI in healthcare 中,诊断 MoA 流水线可以部署专用代理来审查患者病史、分析实验室结果并处理医学影像。综合器代理会汇总这些发现以协助医生形成综合诊断,从而大幅降低人为错误的几率。
将视觉集成到 MoA 工作流中#
现代 MoA 系统越来越多地具备多模态特性,这意味着它们依靠 computer vision (CV) 模型在对物理世界进行推理之前先对其进行感知。例如,在 AI in manufacturing 中,视觉代理可以检查实时摄像头画面并将其客观观察结果发送给推理代理。
以下 Python 示例演示了 Ultralytics YOLO26 如何在 MoA 流水线中充当“视觉代理”,提取上下文数据以馈送给下游 LLM。开发者可以使用 Ultralytics Platform 无缝管理和微调这些专用的视觉工具。
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")通过弥合使用诸如 PyTorch 等框架构建的高性能视觉模型与诸如 Google Gemini 等高级认知引擎之间的差距,MoA 生态系统模仿了人类的协作。它们正迅速成为 Agentic RAG 流水线的骨干,为更具鲁棒性和可靠性的自主系统铺平了道路。






