Catastrophic Forgetting
اكتشف كيفية منع النسيان الكارثي في الشبكات العصبية. استكشف استراتيجيات الحدّ المثبتة عند تدريب نماذج Ultralytics YOLO.
النسيان الكارثي، الذي يُشار إليه كثيرًا باسم التداخل الكارثي، هو ظاهرة مدروسة على نطاق واسع في التعلم الآلي، حيث تفقد شبكة عصبية اصطناعية المعلومات التي تعلمتها سابقًا بشكل مفاجئ عند تعلم مهام جديدة. عندما يخضع نموذج لتدريب متسلسل للتكيف مع مجموعة بيانات جديدة، تحدّث خوارزميات التحسين التي تستخدم الانتشار العكسي أوزان النموذج. وغالبًا ما تؤدي هذه العملية، من دون قصد، إلى الكتابة فوق التمثيلات الرياضية اللازمة للمهام السابقة. ونتيجةً لذلك، قد يواجه نظام ذكاء اصطناعي مُحسّن بدرجة كبيرة لغرضه الأصلي تدهورًا حادًا في الأداء في تلك المهام الأولية إذا دُرّب حصريًا على بيانات جديدة من دون تدابير مضادة محددة.
لماذا يحدث النسيان الكارثي#
في التعلم العميق، تُخزَّن معرفة النموذج عبر شبكة موزعة من العصبونات المترابطة. أثناء الضبط الدقيق، تضبط دوال التحسين، مثل الانحدار المتدرج العشوائي، هذه الوصلات لتقليل الخطأ في البيانات الجديدة. إذا لم تتضمن مجموعة بيانات التدريب الجديدة أمثلةً للفئات الأصلية، تحوّل عملية التحسين الأوزان نحو توزيع البيانات الجديدة، ما يؤدي فعليًا إلى محو «ذاكرة» التوزيع القديم. وتشير الدراسات الحديثة حول التحول البنيوي إلى أن هذا الانهيار الداخلي يحدّ جوهريًا من قدرة الشبكات العصبية الحديثة على تحقيق التعلم مدى الحياة الشبيه بالتعلم البشري من دون تجهيزات إضافية.
تمييز المفاهيم ذات الصلة#
من الضروري التمييز بين النسيان الكارثي ومفاهيم الذكاء الاصطناعي الأخرى:
- النسيان الكارثي مقابل انهيار النموذج: يحدث النسيان نتيجة تعلم مهام جديدة بصورة تدريجية، في حين أن انهيار النموذج هو تدهور تدريجي في الأداء في المهمة نفسها عندما يتدرب نموذج تكراريًا على بيانات اصطناعية تُنشئها نماذج ذكاء اصطناعي أخرى.
- النسيان الكارثي مقابل التعلم المستمر: يُعد التعلم المستمر منهجية البحث الشاملة الهادفة إلى حل مشكلة النسيان الكارثي. وتحاول خوارزميات التعلم المستمر تمكين النماذج من اكتساب معرفة جديدة بالتتابع من دون نسيان المعرفة السابقة.
أمثلة من العالم الواقعي#
يمثل النسيان الكارثي تحديًا كبيرًا في مختلف مجالات الذكاء الاصطناعي التي تعمل في بيئات العالم الحقيقي الديناميكية:
- الأنظمة الذاتية: في مسارات إدراك المركبات الذاتية، قد يُضبط نظام الرؤية الحاسوبية المُدرّب في البداية على التعرّف على المشاة وإشارات المرور القياسية بدقة ليتعرّف على إشارات إنشاءات جديدة خاصة بمنطقة معينة. ومن دون وسائل حماية، قد يواجه النظام فجأة صعوبة في اكتشاف المشاة بشكل موثوق، ما يسبب خطرًا شديدًا على السلامة.
- الذكاء الاصطناعي اللغوي والإدراكي: عند تخصيص نماذج اللغة الكبيرة لمهام خاصة بمجال معين، مثل التشخيص الطبي، قد ينسى النموذج توافقه الحواري أو مهاراته العامة في الاستدلال. ويُظهر تحليل مقارن حديث لنماذج LLMs أن الضبط الدقيق القياسي على نصوص متخصصة للغاية يؤدي غالبًا إلى تآكل مواءمة السلامة السابقة، ما يتسبب في فقدان النماذج لقدراتها الأساسية على اتباع التعليمات.
التغلب على النسيان الكارثي#
يستخدم مهندسو الذكاء الاصطناعي عدة استراتيجيات للتخفيف من هذه المشكلة والحفاظ على معضلة اللدونة والاستقرار المثلى:
- إعادة تشغيل مجموعات البيانات ودمجها: تتمثل الطريقة الأكثر موثوقية في مزج مجموعة فرعية من بيانات التدريب الأصلية مع البيانات الجديدة. وتسهّل أدوات مثل منصة Ultralytics إدارة مجموعات البيانات المدمجة وإصدارها، لضمان إعادة استخدام الفئات الأصلية بفاعلية أثناء التدريب.
- توحيد الأوزان المرن (EWC): تحدّ تقنية التنظيم هذه من تحديثات المعلمات التي كانت بالغة الأهمية للمهام القديمة. ومن خلال تحديد هذه الأوزان الأساسية والحفاظ عليها، تقلل النماذج من النسيان، كما يتضح في التجارب الحديثة حول التغلب على نسيان الشبكات.
- الضبط الدقيق الفعّال من حيث المعلمات (PEFT): تجمّد أساليب مثل التكييف منخفض الرتبة (LoRA) الأوزان الأساسية المدربة مسبقًا، وتحقن مصفوفات صغيرة قابلة للتدريب في الشبكة، ما يمنع الكتابة فوق المعرفة الأساسية.
- تجميد الطبقات: في عمليات التدريب الأقصر، يضمن تجميد طبقات العمود الفقري والعنق بقاء مستخرجات الميزات الأساسية سليمة.
- التحسين الخالي من التدرج: أظهرت أطر عمل مبتكرة مؤخرًا أن الأساليب القائمة على المرور الأمامي يمكنها أيضًا التخفيف من النسيان بكفاءة في البيئات التي تكون فيها تحديثات التدرج مقيّدة.
مثال على التنفيذ في ذكاء الرؤية الاصطناعي#
عند تكييف Ultralytics YOLO لمهمة جديدة في اكتشاف الكائنات، يُعد تجميد الطبقات نهجًا فعّالًا وسهل التطبيق. يوضح المثال التالي كيفية تدريب نموذج Ultralytics YOLO26 على مجموعة بيانات جديدة مع منع النسيان الكارثي من خلال تجميد الطبقات العشر الأولى.
from ultralytics import YOLO
# Load a pretrained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Train on a combined dataset while freezing core backbone layers
# The 'freeze=10' argument prevents catastrophic forgetting of foundational visual features
results = model.train(data="combined_dataset.yaml", epochs=20, freeze=10, lr0=0.001)
# Evaluate the model to ensure it retains performance on old and new tasks
metrics = model.val()





