返回 Ultralytics 术语表
Mixture of Agents (MoA)
了解智能体混合(MoA)如何利用多个 LLMs 解决复杂任务。了解如何在 MoA 工作流中将 Ultralytics YOLO26 集成为视觉智能体。
智能体混合(MoA)是一种先进的人工智能架构,利用多个大型语言模型(LLMs)或自主智能体协作解决复杂任务。MoA 系统不依赖单个模型生成响应,而是同时查询多个不同的模型。这些初始智能体会生成独立答案,然后将其传递给聚合智能体或综合智能体。聚合智能体会评估、优化并整合这些多样化观点,生成单一的高质量最终输出。这种协作方式显著提升了推理能力,并减轻了独立模型自身的偏见或弱点,代表了自然语言处理(NLP)和问题解决领域的一次重大进步。
智能体混合与专家混合的比较#
虽然两者听起来相似,但必须将 MoA 与相关概念专家混合(MoE)区分开来。
- 专家混合(MoE): 在单个神经网络架构内运行。它使用路由机制,在推理过程中为每个词元仅激活特定的专业化子层(专家)。这种方式在保持较大参数量的同时优化了计算效率。
- 智能体混合(MoA): 在模型或系统层面运行。它包含完全独立的AI 智能体——这些智能体通常基于不同的基础模型构建——并在流水线中相互交互。MoA 更像是模型集成与智能审查流程的结合,具体内容详见近期的多智能体系统研究。
实际应用#
MoA 架构擅长应用于需要深度推理、事实核查和多样化数据综合的环境。
- 复杂软件工程: 在软件开发中,MoA 系统可以使用 Anthropic Claude 编写核心逻辑,使用 OpenAI GPT-4o 生成单元测试,并使用本地化模型执行安全审计。最终的聚合智能体会审查整合后的代码,对其进行测试,并输出经过优化且无错误的脚本。
- 自动化医疗诊断: 在医疗保健领域的 AI中,诊断 MoA 流水线可以部署专业化智能体,分别查看患者病史、分析实验室结果和处理医学影像。综合智能体会汇总这些发现,帮助医生形成全面诊断,大幅降低人为错误的可能性。
将视觉能力集成到 MoA 工作流中#
现代 MoA 系统正日益采用多模态方式,这意味着它们依赖计算机视觉(CV)模型感知物理世界,然后对其进行推理。例如,在制造业中的 AI应用中,视觉智能体可以检查实时摄像头画面,并将事实观察结果发送给推理智能体。
以下 Python 示例演示了 Ultralytics YOLO26 如何在 MoA 流水线中充当“视觉智能体”,提取上下文数据并将其提供给下游 LLM。开发者可以使用 Ultralytics Platform 无缝管理和微调这些专业化视觉工具。
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")通过弥合使用 PyTorch 等框架构建的高性能视觉模型与 Google Gemini 等高级认知引擎之间的差距,MoA 生态系统展现出类似人类协作的特征。它们正迅速成为智能体 RAG流水线的支柱,为构建更稳健、更可靠的自主系统铺平道路。









