Mixture of Agents (MoA)
Узнай, как смесь агентов (MoA) использует несколько LLM для решения сложных задач. Научись интегрировать Ultralytics YOLO26 как визуального агента в рабочие процессы MoA.
Смесь агентов (MoA) — это передовая архитектура искусственного интеллекта, использующая несколько больших языковых моделей (LLMs) или автономных агентов для совместного решения сложных задач. Вместо того чтобы полагаться на одну модель для генерации ответа, система MoA одновременно отправляет запросы нескольким различным моделям. Эти исходные агенты формируют независимые ответы, которые затем передаются агенту-агрегатору или агенту-синтезатору. Агрегатор оценивает, дорабатывает и объединяет различные точки зрения в единый высококачественный итоговый результат. Такой совместный подход значительно повышает способности к рассуждению и снижает влияние индивидуальных предубеждений или недостатков отдельных моделей, что представляет собой значительный шаг вперёд в области обработки естественного языка (NLP) и решения задач.
Смесь агентов и смесь экспертов#
Хотя эти понятия звучат похоже, важно различать MoA и связанное с ним понятие смеси экспертов (MoE).
- Смесь экспертов (MoE): Работает внутри единой архитектуры нейронной сети. Она использует механизм маршрутизации, который во время инференса активирует только определённые специализированные подслои (экспертов) для каждого токена. Это повышает вычислительную эффективность при сохранении большого количества параметров.
- Смесь агентов (MoA): Работает на уровне модели или системы. Она объединяет полностью независимых агентов ИИ, часто созданных на основе разных базовых моделей, которые взаимодействуют в рамках конвейера. MoA больше похожа на ансамбль моделей, объединённый с интеллектуальным процессом проверки, как подробно описано в недавних исследованиях мультиагентных систем.
Практические применения#
Архитектуры MoA особенно эффективны в средах, требующих глубокого рассуждения, проверки фактов и синтеза разнообразных данных.
- Сложная разработка программного обеспечения: В разработке ПО система MoA может использовать Anthropic Claude для написания основной логики, OpenAI GPT-4o для создания модульных тестов и локализованную модель для аудита безопасности. Затем итоговый агент-агрегатор проверяет объединённый код, тестирует его и выдаёт доработанный скрипт без ошибок.
- Автоматизированная медицинская диагностика: В сфере ИИ в здравоохранении диагностический конвейер MoA может задействовать специализированных агентов для изучения истории болезни пациента, анализа лабораторных результатов и обработки медицинских изображений. Агент-синтезатор объединяет эти результаты, помогая врачам сформировать комплексный диагноз и значительно снижая вероятность человеческой ошибки.
Интеграция компьютерного зрения в рабочие процессы MoA#
Современные системы MoA становятся всё более мультимодальными: это означает, что перед рассуждением они используют модели компьютерного зрения (CV) для восприятия физического мира. Например, в сфере ИИ в производстве визуальный агент может анализировать видеопоток с камеры в реальном времени и передавать фактические наблюдения агенту, отвечающему за рассуждение.
Следующий пример на Python демонстрирует, как Ultralytics YOLO26 может функционировать как «визуальный агент» в конвейере MoA, извлекая контекстные данные для последующей передачи большим языковым моделям. Разработчики могут легко управлять этими специализированными инструментами компьютерного зрения и дообучать их с помощью Ultralytics Platform.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")Объединяя высокоэффективные модели компьютерного зрения, созданные с использованием таких фреймворков, как PyTorch, с передовыми когнитивными движками, такими как Google Gemini, экосистемы MoA имитируют сотрудничество людей. Они быстро становятся основой конвейеров Agentic RAG, открывая путь к созданию более надёжных и устойчивых автономных систем.









