Catastrophic Forgetting
Sinir ağlarında felaket niteliğinde unutmayı nasıl önleyeceğini keşfet. Ultralytics YOLO modellerini eğitirken kanıtlanmış azaltma stratejilerini incele.
Katastrofik girişim olarak da sıkça adlandırılan katastrofik unutma, bir yapay sinir ağının yeni görevleri öğrenirken daha önce öğrendiği bilgileri aniden kaybettiği makine öğrenimi alanında yaygın olarak incelenen bir olgudur. Bir model yeni bir veri kümesine uyum sağlamak için sıralı eğitime tabi tutulduğunda, geri yayılım kullanan optimizasyon algoritmaları model ağırlıklarını günceller. Bu süreç, önceki görevler için gereken matematiksel temsillerin üzerine çoğu zaman istemeden yazılmasına neden olur. Sonuç olarak, başlangıçtaki amacı için yüksek düzeyde optimize edilmiş bir yapay zekâ sistemi, özel karşı önlemler alınmadan yalnızca yeni verilerle eğitilirse, ilk görevlerde ciddi bir performans düşüşü yaşayabilir.
Katastrofik Unutma Neden Olur?#
Derin öğrenmede, bir modelin bilgisi, birbirine bağlı nöronlardan oluşan dağıtık bir ağda saklanır. İnce ayar sırasında stokastik gradyan inişi gibi optimizasyon işlevleri, yeni verilerdeki hatayı en aza indirmek için bu bağlantıları ayarlar. Yeni eğitim veri kümesi özgün sınıflara ait örnekler içermiyorsa, optimizasyon süreci ağırlıkları yeni veri dağılımına doğru kaydırarak eski dağılımın "belleğini" etkili bir şekilde siler. Yapısal kayma üzerine güncel çalışmalar, bu iç çöküşün modern sinir ağlarının insan benzeri yaşam boyu öğrenme yeteneğine doğrudan kullanılabilir biçimde ulaşmasını temelden sınırladığını göstermektedir.
İlişkili Kavramları Birbirinden Ayırma#
Katastrofik unutmayı diğer yapay zekâ kavramlarıyla karşılaştırmak kritik önem taşır:
- Katastrofik Unutma ve Model Çöküşü: Unutma, yeni görevlerin kademeli olarak öğrenilmesi nedeniyle gerçekleşirken model çöküşü, bir modelin diğer yapay zekâ modelleri tarafından üretilen sentetik verilerle yinelemeli olarak eğitilmesi sonucunda aynı görevdeki performansın kademeli olarak düşmesidir.
- Katastrofik Unutma ve Sürekli Öğrenme: Sürekli öğrenme, katastrofik unutmayı çözmeyi amaçlayan kapsamlı araştırma metodolojisidir. Sürekli öğrenme algoritmaları, modellerin unutmadan sıralı biçimde yeni bilgiler edinmesini sağlamaya çalışır.
Gerçek Dünya Örnekleri#
Katastrofik unutma, dinamik gerçek dünya ortamlarında çalışan çeşitli yapay zekâ alanlarında önemli bir zorluk oluşturur:
- Otonom Sistemler: Otonom araçların algılama işlem hatlarında, başlangıçta yayaları ve standart trafik işaretlerini tanımak üzere eğitilmiş bir bilgisayarlı görü sistemi, yeni ve bölgeye özgü inşaat işaretlerini tanıyacak şekilde ince ayarlanabilir. Önlem alınmadığında sistem, yayaları güvenilir biçimde algılamakta aniden zorlanabilir ve bu da ciddi bir güvenlik riski oluşturur.
- Dil ve Bilişsel Yapay Zekâ: Büyük dil modelleri, tıbbi tanı gibi alana özgü görevler için özelleştirildiğinde model, konuşma uyumunu veya genel akıl yürütme becerilerini unutabilir. LLM'ler üzerine yakın tarihli bir karşılaştırmalı analiz, son derece uzmanlaşmış metinlerle yapılan standart ince ayarın önceki güvenlik uyumunu çoğu zaman aşındırdığını ve modellerin temel talimat izleme yeteneklerini kaybetmesine neden olduğunu göstermektedir.
Katastrofik Unutmanın Üstesinden Gelme#
Yapay zekâ mühendisleri, bu sorunu azaltmak ve en uygun plastisite-kararlılık ikilemini korumak için çeşitli stratejiler kullanır:
- Veri Kümesi Tekrarı ve Birleştirme: En güvenilir yöntem, özgün eğitim verilerinin bir alt kümesini yeni verilerle karıştırmaktır. Ultralytics Platform gibi araçlar, özgün sınıfların eğitim sırasında etkili bir şekilde tekrar kullanılmasını sağlamak için birleşik veri kümelerinin yönetimini ve sürümlendirilmesini kolaylaştırır.
- Elastik Ağırlık Birleştirme (EWC): Bu düzenlileştirme tekniği, eski görevler için kritik olan parametrelerdeki güncellemeleri sınırlar. Modeller, bu temel ağırlıkları belirleyip koruyarak unutmayı azaltır; bu durum ağ unutmasının üstesinden gelmeye yönelik yakın tarihli deneylerde vurgulanmıştır.
- Parametre Verimli İnce Ayar (PEFT): Düşük Sıralı Uyarlama (LoRA) gibi yöntemler, önceden eğitilmiş temel ağırlıkları dondurur ve ağa küçük, eğitilebilir matrisler ekleyerek temel bilginin üzerine yazılmasını önler.
- Katmanları Dondurma: Daha kısa eğitim süreçlerinde omurga ve boyun katmanlarını dondurmak, temel özellik çıkarıcıların bütünlüğünü korumasını sağlar.
- Gradyansız Optimizasyon: Yeni çerçeveler, yakın zamanda, gradyan güncellemelerinin kısıtlı olduğu ortamlarda ileri geçiş tabanlı yöntemlerin de unutmayı etkili bir şekilde azaltabileceğini göstermiştir.
Görü Yapay Zekâsında Uygulama Örneği#
Yeni bir nesne algılama görevine Ultralytics YOLO uyarlanırken katmanları dondurmak etkili ve erişilebilir bir yaklaşımdır. Aşağıdaki örnek, ilk 10 katmanı dondurarak katastrofik unutmayı önlerken yeni bir veri kümesinde Ultralytics YOLO26 modelinin nasıl eğitileceğini göstermektedir.
from ultralytics import YOLO
# Load a pretrained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Train on a combined dataset while freezing core backbone layers
# The 'freeze=10' argument prevents catastrophic forgetting of foundational visual features
results = model.train(data="combined_dataset.yaml", epochs=20, freeze=10, lr0=0.001)
# Evaluate the model to ensure it retains performance on old and new tasks
metrics = model.val()





