Adversarial Attacks
استكشف كيفية تلاعب الهجمات الخصمية بنماذج تعلّم الآلة. تعرّف إلى استراتيجيات الصندوق الأبيض والصندوق الأسود ومخاطرها على سلامة الذكاء الاصطناعي وسبل الدفاع باستخدام Ultralytics YOLO26.
الهجمات الخصمية هي فئة متطورة من تقنيات التلاعب المصممة لخداع نماذج التعلّم الآلي (ML) ودفعها إلى إجراء تنبؤات غير صحيحة بثقة عالية. تعمل هذه الهجمات من خلال إدخال اضطرابات دقيقة، غالبًا ما يتعذر على العين ملاحظتها، إلى بيانات الإدخال، مثل الصور أو الصوت أو النصوص. وعلى الرغم من أن هذه التغييرات تبدو غير ضارة أو عشوائية للمراقب البشري، فإنها تستغل نقاط ضعف رياضية محددة في حدود القرار للشبكات العصبية عالية الأبعاد. ومع ازدياد اندماج أنظمة الذكاء الاصطناعي (AI) في البنية التحتية الحيوية للسلامة، يصبح فهم كيفية عمل نقاط الضعف هذه أمرًا أساسيًا لتطوير بروتوكولات متينة لـسلامة الذكاء الاصطناعي وآليات دفاع فعالة.
كيفية عمل الهجمات الخصمية#
في عملية تدريب نموذج التعلّم العميق (DL) نموذجية، يحسّن النموذج أوزانه لتقليل الخطأ في مجموعة بيانات التدريب. غير أن هذه النماذج تنشئ في جوهرها خرائط معقدة في فضاء متعدد الأبعاد. تحسب الهجمة الخصمية «الاتجاه» الدقيق في هذا الفضاء اللازم لدفع الإدخال عبر حدٍّ ما، مما يقلب تصنيف النموذج. فعلى سبيل المثال، في الرؤية الحاسوبية (CV)، قد يؤدي تغيير قيم البكسلات في صورة باندا بمقدار محسوب من «الضوضاء» إلى جعل النظام يخطئ بثقة في تصنيفها على أنها جيبون، رغم أن الصورة لا تزال تبدو كباندا تمامًا للعين البشرية.
تُصنَّف استراتيجيات الهجوم عمومًا بحسب مستوى وصول المهاجم إلى النظام المستهدف:
- هجمات الصندوق الأبيض: يتمتع المهاجم بشفافية كاملة تجاه بنية النموذج وتدرجاته وأوزان النموذج. ويتيح له ذلك حساب الاضطراب الأكثر فعالية رياضيًا، وغالبًا باستخدام تقنيات مثل طريقة إشارة التدرج السريع (FGSM).
- هجمات الصندوق الأسود: لا يمتلك المهاجم أي معرفة بالمعلمات الداخلية للنموذج، ولا يمكنه سوى مراقبة المدخلات والمخرجات. وغالبًا ما يستخدم المهاجمون «نموذجًا بديلًا» لإنشاء أمثلة خصمية تنتقل بفعالية إلى النظام المستهدف، وهي خاصية تُعرف باسم قابلية الانتقال.
التطبيقات والمخاطر في العالم الحقيقي#
رغم أن الهجمات الخصمية تُناقش غالبًا في إطار الأبحاث النظرية، فإنها تفرض مخاطر ملموسة على عمليات النشر في العالم الحقيقي، ولا سيما في الأنظمة الذاتية والأمن.
- المركبات الذاتية: تعتمد السيارات ذاتية القيادة اعتمادًا كبيرًا على اكتشاف الأجسام لتفسير إشارات المرور. وقد أظهرت الأبحاث أن وضع ملصقات أو شريط لاصق مصمم بعناية على إشارة التوقف يمكن أن يخدع نظام الرؤية في المركبة، فيجعله يدركها على أنها إشارة تحديد السرعة. وقد يؤدي هذا النوع من الهجمات في العالم المادي إلى إخفاقات خطيرة في تطبيقات الذكاء الاصطناعي في قطاع السيارات.
- المتملصون من التعرّف على الوجوه: يمكن اختراق أنظمة الأمان التي تتحكم في الوصول استنادًا إلى القياسات الحيوية باستخدام «رقع» خصمية. وقد تكون هذه الرقع أنماطًا مطبوعة تُرتدى على النظارات أو الملابس، فتعرقل عملية استخراج السمات. ويتيح ذلك لفرد غير مصرح له إما تفادي الاكتشاف تمامًا أو انتحال شخصية مستخدم محدد، متجاوزًا أنظمة الإنذار الأمني.
إنشاء أمثلة خصمية في Python#
لفهم مدى هشاشة بعض النماذج، من المفيد رؤية مدى سهولة إحداث اضطراب في صورة. وعلى الرغم من أن الاستدلال القياسي باستخدام نماذج مثل YOLO26 متين للاستخدام العام، فإن الباحثين غالبًا ما يحاكون الهجمات لتحسين مراقبة النماذج والدفاعات. يستخدم المثال المفاهيمي التالي PyTorch لإيضاح كيفية استخدام التدرجات لحساب اضطراب خصمي (ضوضاء) لصورة.
import torch.nn.functional as F
# Assume 'model' is a loaded PyTorch model and 'image' is a normalized tensor
# 'target_class' is the correct label index for the image
def generate_adversarial_noise(model, image, target_class, epsilon=0.01):
# Enable gradient calculation for the input image
image.requires_grad = True
# Forward pass: get prediction
output = model(image)
# Calculate loss based on the correct class
loss = F.nll_loss(output, target_class)
# Backward pass: calculate gradients of loss w.r.t input
model.zero_grad()
loss.backward()
# Create perturbation using the sign of the data gradient (FGSM)
# This pushes the image in the direction of maximizing error
perturbation = epsilon * image.grad.data.sign()
return perturbationالمفاهيم ذات الصلة#
من المهم التمييز بين الهجمات الخصمية والأشكال الأخرى من إخفاق النماذج أو التلاعب بها:
- تسميم البيانات: بخلاف الهجمات الخصمية التي تتلاعب بـالإدخال أثناء الاستدلال (وقت الاختبار)، ينطوي تسميم البيانات على إفساد بيانات التدريب نفسها قبل بناء النموذج، مع تضمين أبواب خلفية أو تحيزات خفية.
- حقن الأوامر: يقتصر هذا النوع على النماذج اللغوية الكبيرة (LLMs) وواجهات النصوص. وعلى الرغم من تشابهه المفاهيمي، أي خداع النموذج، فإنه يعتمد على التلاعب باللغة الدلالية بدلًا من الاضطراب الرياضي لبيانات البكسلات أو الإشارات.
- فرط التكيّف: هذا إخفاق في التدريب يتعلم فيه النموذج الضوضاء الموجودة في بيانات التدريب بدلًا من النمط الأساسي. وغالبًا ما تكون النماذج مفرطة التكيّف أكثر عرضة للهجمات الخصمية، لأن حدود قرارها شديدة التعقيد وهشة للغاية.
يُعد تطوير دفاعات ضد هذه الهجمات مكوّنًا أساسيًا من MLOps الحديث. وتساعد تقنيات مثل التدريب الخصمي، حيث تُضاف الأمثلة التي تعرضت للهجوم إلى مجموعة التدريب، النماذج على أن تصبح أكثر صمودًا. وتسهّل منصات مثل Ultralytics Platform تنفيذ مسارات تدريب وتحقق صارمة، مما يتيح للفرق تقييم متانة النماذج قبل نشرها على الأجهزة الطرفية.









