Mixture of Agents (MoA)
Узнай, как смесь агентов (MoA) использует несколько LLM для решения сложных задач. Научись интегрировать Ultralytics YOLO26 в качестве визуального агента в рабочие процессы MoA.
Mixture of Agents (MoA) — это передовая архитектура искусственного интеллекта, которая задействует множество large language models (LLMs) или автономных агентов для совместного решения сложных задач. Вместо того чтобы полагаться на одну модель для генерации ответа, система MoA одновременно обращается к нескольким различным моделям. Эти первоначальные агенты выдают независимые ответы, которые затем передаются агенту-агрегатору или синтезатору. Агрегатор оценивает, дорабатывает и объединяет эти разнообразные точки зрения в единый высококачественный финальный результат. Такой подход на основе сотрудничества значительно расширяет возможности рассуждений и сглаживает индивидуальные предвзятости или слабые стороны отдельных моделей, представляя собой крупный шаг вперед в области natural language processing (NLP) и решения задач.
Mixture of Agents против Mixture of Experts#
Несмотря на схожесть звучания, крайне важно отличать MoA от смежной концепции Mixture of Experts (MoE).
- Mixture of Experts (MoE): функционирует в рамках единой neural network architecture. В ней используется механизм маршрутизации для активации только определенных специализированных подслоев (экспертов) для каждого токена во время инференса. Это оптимизирует вычислительную эффективность при сохранении большого количества параметров.
- Mixture of Agents (MoA): функционирует на уровне модели или системы. Она предполагает взаимодействие совершенно раздельных AI agents, часто созданных на базе различных базовых моделей, в конвейере. MoA больше похожа на model ensemble в сочетании с интеллектуальным процессом проверки, как подробно описано в недавних исследованиях multi-agent system research.
Реальные приложения#
Архитектуры MoA превосходно работают в средах, требующих глубоких рассуждений, проверки фактов и синтеза разнообразных данных.
- Сложная разработка программного обеспечения: в разработке ПО система MoA может использовать Anthropic Claude для написания базовой логики, OpenAI GPT-4o для генерации модульных тестов и локальную модель для аудита безопасности. Финальный агент-агрегатор проверяет объединенный код, тестирует его и выдает доработанный скрипт без ошибок.
- Автоматизированная медицинская диагностика: в AI in healthcare диагностический конвейер MoA может задействовать специализированных агентов для изучения истории болезни пациента, анализа результатов лабораторных исследований и обработки медицинских изображений. Агент-синтезатор объединяет эти данные, чтобы помочь врачам поставить комплексный диагноз, что кардинально снижает вероятность человеческой ошибки.
Интеграция зрения в рабочие процессы MoA#
Современные системы MoA становятся все более мультимодальными, то есть они опираются на модели computer vision (CV) для восприятия физического мира перед тем, как выполнять рассуждения над ним. Например, в сфере AI in manufacturing визуальный агент может проверять трансляцию с камеры в реальном времени и передавать свои фактические наблюдения агенту рассуждений.
Следующий пример на Python демонстрирует, как Ultralytics YOLO26 может функционировать в качестве «визуального агента» внутри конвейера MoA, извлекая контекстные данные для передачи последующим LLM. Разработчики могут легко управлять этими специализированными инструментами компьютерного зрения и дообучать их с помощью Ultralytics Platform.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Связывая воедино высокопроизводительные модели зрения, созданные с помощью таких фреймворков, как PyTorch, и продвинутые когнитивные движки вроде Google Gemini, экосистемы MoA отражают принципы человеческого сотрудничества. Они стремительно становятся основой конвейеров Agentic RAG, прокладывая путь к созданию более надежных и устойчивых автономных систем.






