Adversarial Attacks
استكشف كيف تتلاعب الهجمات العدائية بنماذج التعلم الآلي. تعرف على استراتيجيات الصندوق الأبيض والصندوق الأسود، والمخاطر على سلامة الذكاء الاصطناعي، والدفاع باستخدام Ultralytics YOLO26.
الهجمات التنافسية هي فئة متطورة من تقنيات التلاعب المصممة خداع نماذج machine learning (ML) لجعلها تقوم بتنبؤات غير صحيحة بثقة عالية. تعمل هذه الهجمات عن طريق إدخال اضطرابات طفيفة وغالباً ما تكون غير محسوسة في بيانات الإدخال—مثل الصور، أو الصوت، أو النص. وفي الوقت الذي تبدو فيه هذه التغييرات غير ضارة أو عشوائية للمراقب البشري، فإنها تستغل نقاط ضعف رياضية محددة في decision boundaries للشبكات العصبية عالية الأبعاد. ومع أصبحت أنظمة Artificial Intelligence (AI) جزءاً لا يتجزأ من البنية التحتية الحرجة للسلامة، فإن فهم كيفية عمل نقاط الضعف هذه يعد أمراً بالغ الأهمية لتطوير بروتوكولات قوية لـ AI safety وآليات الدفاع عنها.
كيف تعمل الهجمات العدائية#
في عملية التدريب النموذجية لـ deep learning (DL)، يقوم النموذج بتحسين أوزانه لتقليل الخطأ في مجموعة بيانات التدريب. ومع ذلك، تنشئ هذه النماذج في جوهرها خرائط معقدة في مساحة متعددة الأبعاد. تحسب الهجمة التنافسية "الاتجاه" الدقيق في هذه المساحة اللازم لدفع الإدخال عبر الحد، مما يؤدي إلى قلب تصنيف النموذج. على سبيل المثال، في computer vision (CV)، قد يؤدي تغيير قيم البكسل لصورة باندا بمقدار محسوب من "الضوضاء" إلى قيام النظام بتصنيفها بشكل خاطئ بثقة على أنها قرد غيبون، على الرغم من أن الصورة لا تزال تبدو تماماً مثل البندة للعين البشرية.
تصنف استراتيجيات الهجوم بشكل عام حسب مستوى الوصول الذي يمتلكه المهاجم إلى النظام المستهدف:
- White-Box Attacks: يمتلك المهاجم شفافية كاملة في بنية النموذج، والتدرجات، وmodel weights. هذا يسمح لهم بحساب الاضطراب الأكثر فعالية رياضياً، وغالباً ما يتم ذلك باستخدام تقنيات مثل طريقة إشارة التدرج السريع (FGSM).
- Black-Box Attacks: ليس لدى المهاجم أي معرفة بمعلمات النموذج الداخلية ولا يمكنه سوى مراقبة المدخلات والمخرجات. غالباً ما يستخدم المهاجمون "نموذجاً بديلاً" لتوليد أمثلة تنافسية تنتقل بفعالية إلى النظام المستهدف، وهي خاصية تُعرف بالقابلية للنقل.
التطبيقات والمخاطر في العالم الحقيقي#
على الرغم من مناقشتها غالباً في البحوث النظرية، إلا أن الهجمات العدائية تشكل مخاطر ملموسة على عمليات النشر في العالم الحقيقي، لا سيما في الأنظمة الذاتية والأمن.
- Autonomous Vehicles: تعتمد السيارات ذاتية القيادة بشكل كبير على object detection لتفسير إشارات المرور. أظهرت الأبحاث أن تطبيق ملصقات أو شريط مصمم بعناية على إشارة توقف يمكن أن يخدع نظام الرؤية الخاص بالسيارة ليعتبرها إشارة حد أقصى للسرعة. هذا النوع من الهجمات في العالم الحقيقي يمكن أن يؤدي إلى اخفاقات خطيرة في تطبيقات AI in automotive.
- Facial Recognition الهاربون: يمكن اختراق أنظمة الأمان التي تتحكم في الوصول بناءً على المقاييس الحيوية بواسطة "التصحيحات" التنافسية. يمكن أن تكون هذه أنماطاً مطبوعة يتم ارتداؤها على النظارات أو الملابس والتي تعطل عملية feature extraction. هذا يسمح لفرد غير مصرح له إما بالتهرب من الكشف تماماً أو انتحال شخصية مستخدم معين، متجاوزاً security alarm systems.
توليد الأمثلة العدائية باستخدام Python#
لفهم مدى هشاشة بعض النماذج، من المفيد أن ترى مدى سهولة تشويش الصورة. وفي حين أن الاستدلال القياسي مع نماذج مثل YOLO26 قوي للاستخدام العام، إلا أن الباحثين غالباً ما يحاكون الهجمات لتحسين model monitoring والدفاع. يستخدم المثال المفاهيمي التالي PyTorch لإظهار كيف تُستخدم التدرجات لحساب اضطراب تنافسي (ضوضاء) لصورة ما.
import torch.nn.functional as F
# Assume 'model' is a loaded PyTorch model and 'image' is a normalized tensor
# 'target_class' is the correct label index for the image
def generate_adversarial_noise(model, image, target_class, epsilon=0.01):
# Enable gradient calculation for the input image
image.requires_grad = True
# Forward pass: get prediction
output = model(image)
# Calculate loss based on the correct class
loss = F.nll_loss(output, target_class)
# Backward pass: calculate gradients of loss w.r.t input
model.zero_grad()
loss.backward()
# Create perturbation using the sign of the data gradient (FGSM)
# This pushes the image in the direction of maximizing error
perturbation = epsilon * image.grad.data.sign()
return perturbationمفاهيم ذات صلة#
من المهم التمييز بين الهجمات العدائية وأشكال أخرى من فشل النموذج أو التلاعب:
- Data Poisoning: على عكس الهجمات التنافسية التي تتلاعب بـ الإدخال أثناء الاستدلال (وقت الاختبار)، يتضمن تسميم البيانات إفساد training data نفسها قبل بناء النموذج، مما يؤدي إلى دمج أبواب خلفية مخفية أو تحيزات.
- Prompt Injection: هذا خاص بـ Large Language Models (LLMs) وواجهات النصوص. على الرغم من أنها تشابه من الناحية المفاهيمية - أي خداع النموذج - إلا أنها تعتمد على التلاعب اللغوي الدلالي بدلاً من الاضطراب الرياضي للبيانات البكسلية أو الإشارية.
- Overfitting: هذا فشل في التدريب حيث يتعلم النموذج الضوضاء في بيانات التدريب بدلاً من النمط الأساسي. غالباً ما تكون النماذج الزائدة التوافق أكثر عرضة للهجمات التنافسية لأن حدود قرارها مفرطة التعقيد وهشة.
يعد تطوير الدفاعات ضد هذه الهجمات مكوناً أساسياً لـ MLOps الحديثة. تساعد التقنيات مثل التدريب التنافسي - حيث يتم إضافة الأمثلة التي تعرضت للهجوم إلى مجموعة التدريب - النماذج على أن تصبح أكثر مرونة. تسهل منصات مثل Ultralytics Platform خطوط أنابيب التدريب والتحقق الصارمة، مما يسمح للفرق بتقييم قوة النموذج قبل النشر على حافة الأجهزة.






