Agent Evaluation
يختبر تقييم الوكلاء ما إذا كان وكيل الذكاء الاصطناعي يحقق أهدافه بأمان وكفاءة، من خلال تقييم النظام بأكمله بما فيه النموذج والأدوات والذاكرة والبيئة.
تقييم الوكلاء هو الاختبار المنهجي لقدرة وكيل الذكاء الاصطناعي على إنجاز الأهداف بأمان وصحة وكفاءة، عبر تفاعل واحد أو أكثر. وعلى خلاف تقييم النماذج المعتاد، يفحص هذا التقييم النظام كاملًا: النموذج الأساسي والتعليمات والذاكرة والأدوات ومنطق التحكم والبيئة. لذلك، لا يقتصر التقييم المفيد على التحقق مما يقوله وكيل الذكاء الاصطناعي في النهاية أو ما يغيّره، بل يشمل أيضًا الإجراءات التي يتخذها أثناء ذلك.
آلية عمل تقييم الوكلاء#
يبدأ التقييم بمهمة، مثل حل طلب دعم أو فحص صورة منتج أو تحديث سجل في قاعدة بيانات. ويحاول الوكيل تنفيذ المهمة ضمن بيئة اختبار مضبوطة، منتجًا أثرًا أو مسارًا: سجلًا للرسائل والمخرجات الوسيطة واستدعاءات الأدوات ومعاملاتها والأخطاء وتغيّرات الحالة.
ثم يقارن المُقيِّم المحاولة بمعايير نجاح محددة. وتنقسم المُقيِّمات إلى ثلاثة أنواع شائعة: برامج حتمية، وأحكام قائمة على النماذج، ومراجعون بشريون. وتناسب الفحوصات الحتمية النتائج القابلة للتحقق، مثل التأكد من إنشاء سجل. أما المُقيِّمات القائمة على النماذج فتستطيع تقييم خصائص مثل الملاءمة أو النبرة، لكن ينبغي معايرتها بالاستناد إلى أحكام بشرية.
تضم مجموعة التقييم عادةً مهام تمثيلية عديدة، وقد تكرر كل مهمة عدة مرات لأن سلوك الوكيل قد يختلف بين مرات التشغيل. ويجب أن يشمل التقييم أيضًا إطار تشغيل الوكيل المحيط به؛ إذ قد يؤدي تغيير أوصاف الأدوات أو قواعد الذاكرة أو منطق إعادة المحاولة إلى تغيير الأداء حتى لو ظل النموذج الأساسي دون تغيير.
ما الذي يقيسه تقييم الوكلاء؟#
تجمع مجموعة موثوقة عدة أبعاد بدلًا من اختزال الأداء في درجة واحدة:
- نجاح المهمة: هل وصلت البيئة إلى الحالة النهائية المطلوبة؟
- جودة استخدام الأدوات: هل اختار الوكيل الأداة الصحيحة، وقدّم وسيطات صالحة، وفسّر نتيجتها بدقة؟ تتضمن مقاييس تقييم الوكلاء لدى Google مقاييس منفصلة للاستجابات النهائية واستخدام الأدوات والمسارات والهلوسات والسلامة.
- جودة المسار: هل كانت الإجراءات ذات صلة ومرتبة ترتيبًا صحيحًا وفعالة إلى حد معقول؟ قد تظل الإجابة الصحيحة التي تم التوصل إليها بخطوات غير آمنة أو مهدرة إخفاقًا.
- الموثوقية: ما معدل نجاح الوكيل عبر التجارب المتكررة والطلبات المعاد صياغتها والحالات الصعبة وتعطل الأدوات؟
- السلامة والامتثال للسياسات: هل يحترم الأذونات ويحمي البيانات الحساسة ويطلب الموافقة قبل الإجراءات ذات العواقب المهمة؟ وتساعد إرشادات OWASP لمخاطر الذكاء الاصطناعي الوكِيل الفرق على تحديد مخاطر مثل الاستقلالية المفرطة والتفاعلات غير الآمنة مع الأدوات.
- الأداء التشغيلي: تكتسب مقاييس زمن الاستجابة واستخدام الرموز وعدد استدعاءات الأدوات ومعدل الأخطاء والتكلفة لكل مهمة مكتملة أهمية في بيئة الإنتاج.
توفر مجموعة بيانات مرجعية ذهبية من المهام التي خضعت للمراجعة والنتائج المتوقعة والحالات الحدية مرجعًا ثابتًا. ومع ذلك، ينبغي استكمالها بحالات خصامية وإخفاقات مستمدة من الإنتاج. ويضع مركز موارد الذكاء الاصطناعي التابع لـ NIST الاختبار والتقييم والتحقق والتصديق والقياس المستمر ضمن إطار أوسع لإدارة مخاطر الذكاء الاصطناعي.
تقييم الوكلاء والمفاهيم ذات الصلة#
يتجاوز تقييم الوكلاء تقييم النماذج، الذي يختبر عادةً مخرجات نموذج على مجموعة بيانات ثابتة. كما يختلف عن قابلية الملاحظة: إذ تسجل قابلية الملاحظة ما حدث في نظام مباشر، بينما يطبّق التقييم معايير لتحديد مدى مقبولية ذلك السلوك.
وبالمثل، تبحث اختبارات الاختراق للذكاء الاصطناعي بنشاط عن إخفاقات قابلة للاستغلال، بينما يقيس التقييم الروتيني القدرات المعروفة والتراجعات بصورة متكررة. وتحدد مسارات العمل الوكِيلة كيفية تنفيذ المهام؛ أما التقييم فيختبر ما إذا كانت مسارات العمل هذه تنتج نتائج موثوقة.
تظل اختبارات المكونات مفيدة. فعلى سبيل المثال، إذا استخدم الوكيل الرؤية عبر استدعاء الدوال واستخدام الأدوات، فينبغي للمطورين التحقق من نموذج الرؤية على نحو منفصل قبل تقييم حلقة اتخاذ القرار الكاملة.
from ultralytics import YOLO
# Load the agent's visual perception model
model = YOLO("yolo26n.pt")
# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")
# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")يقيس سير عمل التحقق الموثق لـ Ultralytics YOLO مكوّن الإدراك. لكنه لا يثبت ما إذا كان الوكيل قد اختار الصورة الصحيحة، أو فسّر الاكتشافات على نحو صحيح، أو اتخذ إجراءً مناسبًا.
تطبيقات عملية#
-
الفحص البصري للتصنيع: يلتقط الوكيل صورة منتج، ويستدعي كاشفًا، ويتحقق من قواعد الجودة، ويوجه العناصر غير المؤكدة للمراجعة البشرية. ويمكن للتقييم التحقق من دقة اكتشاف العيوب وصحة معاملات الأدوات وسلوك التصعيد، وما إذا كانت المنتجات المرفوضة تدخل بالفعل قائمة انتظار الفحص.
-
الوكلاء الصوتيون لخدمة العملاء: قد يتحقق وكيل صوتي من هوية المتصل، ويسترجع معلومات الحساب، وينفذ طلبًا عبر أدوار حوارية متعددة. وينبغي أن تغيّر الاختبارات اللهجات والمقاطعات والتعليمات الملتبسة وانقطاع الأدوات، مع قياس إتمام المهمة وجودة المحادثة والإجراءات غير المصرح بها وزمن الاستجابة. ويصف سير عمل Google لتقييم الوكلاء تقييم الآثار الكاملة بدلًا من الاستجابات النهائية وحدها.
بناء عملية تقييم عملية#
ابدأوا بمجموعة صغيرة من المهام المعتادة والحالات الحدية المهمة والإخفاقات التي لوحظت سابقًا. وحددوا شروط النجاح القابلة للرصد قبل تشغيل الوكيل، ثم اجمعوا بين الفحوص الحتمية والتقييم وفق معايير ومراجعة بشرية دورية. وأعيدوا تشغيل المجموعة كلما تغيرت المطالبات أو النماذج أو الأدوات أو مهارات الوكلاء.
بعد النشر، اربطوا الاختبارات غير المتصلة بمراجعة عينات من الآثار ومراقبة النماذج. وبالنسبة إلى الوكلاء المزودين بالرؤية، تدعم Ultralytics Platform التعليق على مجموعات البيانات وتدريب النماذج ونشر خدمات الإدراك التي تستدعيها الوكلاء ومراقبتها. والتقييم الفعال مستمر: تتحول إخفاقات الإنتاج إلى حالات اختبار جديدة، ويجب أن يثبت كل تغيير في النظام تحقيق تحسن دون الإخلال بالسلوك الراسخ.










