Mixture of Agents (MoA)
اكتشف كيف يستفيد مزيج الوكلاء (MoA) من نماذج LLM متعددة لحل المهام المعقدة. تعلم دمج Ultralytics YOLO26 كوكيل مرئي في سير عمل MoA.
إن هيكلية مزيج الوكلاء (MoA) هي بنية متقدمة للذكاء الاصطناعي تستفيد من متعدد النماذج اللغوية الكبيرة (LLMs) أو الوكلاء المستقلين للتعاون في حل المهام المعقدة. بدلاً من الاعتماد على نموذج واحد لتوليد الاستجابة، يقوم نظام MoA بالاستعلام عن عدة نماذج متميزة في وقت واحد. ينتج هؤلاء الوكلاء الأوائل إجابات مستقلة، والتي يتم تمريرها بعد ذلك إلى وكيل تجميع أو دمج. يقوم المجمع بتقييم وتحسين ودمج وجهات النظر المتنوعة في مخرج نهائي واحد وعالي الجودة. هذا النهج التعاوني يعزز قدرات الاستدلال بشكل كبير ويخفف من التحيزات الفردية أو نقاط الضعف في النماذج المستقلة، مما يمثل قفزة نوعية إلى الأمام في مجال معالجة اللغات الطبيعية (NLP) وحل المشكلات.
خليط الوكلاء مقابل خليط الخبراء#
على الرغم من تشابه أسمائهما، فمن الضروري التمييز بين MoA والمفهوم ذي الصلة مزيج الخبراء (MoE).
- مزيج الخبراء (MoE): يعمل ضمن بنية شبكة عصبية واحدة. وهو يستخدم آلية توجيه لتنشيط طبقات فرعية مخصصة ومحددة (خبراء) فقط لكل رمز أثناء الاستدلال. وهذا يحسن الكفاءة الحاسوبية مع الحفاظ على أعداد عالية من المعلمات.
- مزيج الوكلاء (MoA): يعمل على مستوى النموذج أو النظام. وهو يتضمن وكلاء ذكاء اصطناعي منفصلين تماماً - وغالباً ما يتم بناؤهم على نماذج أساسية مختلفة - يتفاعلون في خط أنابيب. يعمل MoA بشكل أكبر مثل مجموعة نماذج مجتمعة مع عملية مراجعة ذكية، كما هو موضح بالتفصيل في أبحاث أنظمة الوكلاء المتعددين الحديثة.
تطبيقات العالم الحقيقي#
تتفوق بنى MoA في البيئات التي تتطلب تفكيرًا عميقًا، والتحقق من الحقائق، وتوليف البيانات المتنوعة.
- ** هندسة البرمجيات المعقدة:** في تطوير البرمجيات، قد يستخدم نظام MoA نموذج Anthropic Claude لكتابة المنطق الأساسي، ونموذج OpenAI GPT-4o لتوليد اختبارات الوحدة، ونموذجاً محلياً لتدقيق الأمان. يقوم وكيل التجميع النهائي بمراجعة الكود المجمع، واختبارها، وإخراج نص محسن وخالي من الأخطاء.
- التشخيص الطبي الآلي: في مجال الذكاء الاصطناعي في الرعاية الصحية، يمكن لخط أنابيب تشخيصي يعتمد على MoA نشر وكلاء متخصصين لمراجعة تاريخ المريض، وتحليل نتائج المختبر، ومعالجة التصوير الطبي. يقوم وكيل التجميع بجمع هذه النتائج لمساعدة الأطباء في تكوين تشخيص شامل، مما يقلل بشكل كبير من فرصة الخطأ البشري.
دمج الرؤية في سير عمل MoA#
أنظمة MoA الحديثة أصبحت متعددة الوسائط بشكل متزايد، مما يعني أنها تعتمد على نماذج الرؤية الحاسوبية (CV) لإدراك العالم المادي قبل الاستدلال عليه. على سبيل المثال، في الذكاء الاصطناعي في التصنيع، يمكن لوكيل بصري فحص بث مباشر للكاميرا وإرسال ملاحظاته الواقعية إلى وكيل استدلال.
يوضح مثال Python التالي كيف يمكن لـ Ultralytics YOLO26 العمل كـ "وكيل بصري" داخل خط أنابيب MoA، لاستخراج البيانات السياقية ليتم تغذيتها إلى النماذج اللغوية الكبيرة (LLMs) اللاحقة. يمكن للمطورين إدارة هذه الأدوات البصرية المتخصصة وضبطها بسلاسة باستخدام منصة Ultralytics.
from ultralytics import YOLO
# Initialize YOLO26 as a dedicated visual agent
visual_agent = YOLO("yolo26n.pt")
# The agent observes the environment by running inference on an image
results = visual_agent("https://ultralytics.com/images/bus.jpg")
# Extract structured data to pass to the MoA aggregator
detected_classes = [visual_agent.names[int(cls)] for cls in results[0].boxes.cls]
unique_objects = set(detected_classes)
# This text context is then sent to the reasoning agent
print(f"Visual Agent Report: I have identified {', '.join(unique_objects)} in the scene.")من خلال سد الفجوة بين نماذج الرؤية عالية الكفاءة المبنية بأطر عمل مثل PyTorch ومحركات الإدراك المتقدمة مثل Google Gemini، تعكس بيئات MoA التعاون البشري. وهي تصبح بسرعة العمود الفقري لخطوط أنابيب Agentic RAG، مما يمهد الطريق لنظام مستقل أكثر قوة وموثوقية.






