Uncertainty Quantification
تعلم قياس عدم اليقين في الذكاء الاصطناعي وتعلم الآلة، بما في ذلك عدم اليقين العشوائي والمعرفي، وال معايرة، وطرق التقييم، وتدفقات عمل Ultralytics YOLO.
قياس عدم اليقين (UQ) هو عملية تقدير وتقييم وإيصال مدى عدم يقين نموذج الذكاء الاصطناعي أو machine learning بشأن تنبؤاته. بدلاً من إرجاع تسمية أو قيمة أو مربع محيط فقط، يوفر سير عمل قياس عدم اليقين معلومات إضافية مثل توزيع الاحتمالات، أو فترة التنبؤ، أو درجة الثقة، أو مجموعة التنبؤ. يساعد هذا المستخدمين على فهم ليس فقط ما يتوقعه النموذج، بل وأيضاً مقدار الثقة التي يجب وضعها في هذا التنبؤ.
Link to this sectionلماذا يُعد قياس عدم اليقين مهمًا#
تتعلم النماذج الأنماط من بيانات محدودة، لذا فإن مخرجاتها ليست مؤكدة تمامًا أبدًا. قد تكون المدخلات مشوشة، وقد تكون التسميات غامضة، وقد تختلف بيانات الإنتاج عن توزيع التدريب. يجعل قياس عدم اليقين هذه القيود قابلة للقياس ويدعم اتخاذ قرارات أكثر أمانًا، والمراجعة البشرية، وجمع بيانات أفضل.
توسع هذه الفكرة الهدف الأوسع المتمثل في توصيف جودة النموذج كما وصفه NIST’s virtual measurement program. في أنظمة الذكاء الاصطناعي، يمكن لتقديرات عدم اليقين أن تساعد الفرق في:
- رفض أو مراجعة التنبؤات عندما يتجاوز عدم اليقين مستوى مقبولاً.
- مقارنة التنبؤات البديلة بدلاً من الاعتماد على إجابة واحدة.
- تحديد المدخلات غير المألوفة وdata drift المحتمل.
- منح الأولوية للعينات غير المؤكدة لتمييزها عبر active learning.
- نقل عدم اليقين إلى الحسابات والقرارات اللاحقة، كما توضحه نظرة عامة لوزارة الطاقة حول uncertainty in computational models.
يُعد قياس عدم اليقين مهمًا بشكل خاص عندما تكون لعواقب أخطاء التنبؤ نتائج غير متساوية. إن تفويت أحد المشاة يُعد أكثر خطورة من الاكتشاف الخاطئ للافته على جانب الطريق، لذا فإن عتبة عدم اليقين المقبولة تعتمد على التطبيق.
Link to this sectionعدم اليقين العشوائي والمعرفي#
هناك فئتان تفسران مصدر عدم اليقين التنبؤي:
- عدم اليقين العشوائي، ويسمى أيضًا عدم اليقين العرضي، وينشأ من العشوائية المتأصلة أو الغامضة في البيانات. يمكن لضبابية الحركة، وضوضاء المستشعرات، والحجب الجزئي، والتسميات غير المتسقة أن تجعل تفسير الصورة أمرًا صعبًا حتى بالنسبة لنموذج مدرب جيدًا. قد تساعد بيانات التدريب الإضافية في تقدير هذا النوع من عدم اليقين، ولكنها لا تستطيع إزالة الغموض الأساسي تمامًا.
- عدم اليقين المعرفي ينشأ من المعرفة غير الكاملة للنموذج. وغالبًا ما يظهر عندما تكون بيانات التدريب غير كافية، أو غير معبرة، أو تفتقر إلى مواقف مهمة. وغالبًا ما يمكن تقليله عن طريق جمع أمثلة ذات صلة، أو تحسين التعليقات التوضيحية، أو تغيير النموذج.
يجمع قياس عدم اليقين المعلومات المتعلقة بهذه المصادر لإنتاج مخرجات مفيدة. يمكن لأدوات النمذجة الاحتمالية مثل TensorFlow Probability تمثيل التنبؤات كتوزيعات، بينما تقيم ensemble methods عدم اليقين عبر مقارنة نماذج متعددة أو عمليات تدريب متعددة. يشير الاختلاف الكبير عمومًا إلى ارتفاع عدم اليقين المعرفي.
يرتبط عدم اليقين بمفهوم confidence score، ولكنه أشمل منه. تصف الثقة قوة تنبؤ واحد، بينما يقيّم قياس عدم اليقين ما إذا كانت هذه الدرجة موثوقة وما هي مصادر عدم اليقين التي تؤثر عليها. وبالمثل، يُعد conformal prediction تقنية محددة لإنتاج مجموعات أو فترات تنبؤ تغطي الهدف وفق افتراضات محددة.
Link to this sectionالأساليب والتقييم#
تشمل نهج قياس عدم اليقين الشائعة المخرجات الاحتمالية، والمجموعات، والخذ العيني المتكرر، والنمذجة البايزية، وفترات التنبؤ. تقدر Bootstrap confidence intervals التقلب عبر إعادة أخذ العينات بشكل متكرر من البيانات المرصودة. وبالنسبة للتصنيف، يتحقق المعايرة مما إذا كانت التنبؤات المُعطاة احتمالاً بنسبة 80% تقريبًا صحيحة بنسبة 80% من الوقت.
يمكن أن يكون النموذج دقيقًا ولكنه سيئ المعايرة، لذا يجب على الفرق تقييم أداء المهمة وجودة عدم اليقين على حد سواء. تستخدم Probability calibration tools مخططات الموثوقية وتقنيات المعايرة لمقارنة الاحتمالات المتوقعة بالنتائج المرصودة. كما تؤكد Rules of Machine Learning التابعة لجوجل على التنبؤات الاحتمالية القابلة للتفسير والمراقبة.
تشمل معايير التقييم المفيدة التغطية، وعرض الفترة، وخطأ المعايرة، والأداء على شرائح البيانات الصعبة. وفي مجال الرؤية الحاسوبية، يساعد كل من Ultralytics validation mode وYOLO performance metrics guide في فحص الدقة، والاسترجاع، ومصفوفات الارتباك، وسلوك الثقة عبر الفئات والعتبات.
Link to this sectionتطبيقات العالم الحقيقي#
- Medical image analysis: يمكن للنموذج التشخيصي الإشارة إلى مسح ضوئي لمراجعته من قبل متخصص عندما يكون لعدة نتائج محتملة درجات متشابهة أو عندما تختلف الصورة عن بيانات التدريب الخاصة به. بدون هذا التصعيد، يمكن للتنبؤ غير الصحيح والواثق بشكل مفرط أن يؤخر العلاج.
- Manufacturing visual inspection: قد تواجه أداة اكتشاف العيوب وهجًا أو مواد جديدة أو تلفًا لم يسبق رؤيته. يمكن للتوجيه المدرك لعدم اليقين إرسال المنتجات الغامضة إلى الفحص اليدوي بدلاً من قبولها أو رفضها تلقائيًا، مما يقلل من العيوب الهاربة والنفايات غير الضرورية.
تربط هذه السياسات عدم اليقين بالنموذج بالمخاطر التشغيلية. يوصي NIST AI Risk Management Framework Core بقياس عدم اليقين، وتوثيق حدود التعميم، ومراقبة الأنظمة طوال فترة نشرها.
Link to this sectionعدم اليقين في سير عمل Ultralytics YOLO#
يكشف Ultralytics YOLO26 عن درجات ثقة الاكتشاف من خلال Predict mode الموثق الخاص به:
from ultralytics import YOLO
# Load an official detection model
model = YOLO("yolo26n.pt")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Inspect each detection's confidence
for box in result.boxes:
class_id = int(box.cls.item())
class_name = result.names[class_id]
confidence = box.conf.item()
print(f"{class_name}: {confidence:.3f}")يكشف سير العمل هذا عن إشارة مفيدة تتعلق بدم اليقين، ولكن الثقة وحدها لا تشكل قياس عدم اليقين بشكل كامل ولا ينبغي تفسيرها تلقائيًا على أنها احتمال مُعاير. قم بالتحقق من الدرجات على بيانات ممثلة ومحتجزة، واختر العتبات بناءً على تكاليف الأخطاء، وراقب توزيعات الثقة بعد النشر.
يمكن للفرق استخدام Ultralytics Platform لتمييز مجموعات البيانات، وتدريب النماذج ونشرها، ومراقبة نقاط النهاية. إلى جانب model monitoring and maintenance المستمرين، يمكن لإشارات عدم اليقين الكشف عن الظروف غير المألوفة، وتوجيه المراجعة البشرية، وتحديد متى تكون هناك حاجة لبيانات جديدة أو إعادة تدريب.






