Vanishing Gradient
Kaybolan gradyan sorununun derin öğrenmeyi nasıl etkilediğini öğren ve Ultralytics YOLO26'da kullanılan ReLU ile artık bağlantılar gibi etkili çözümleri keşfet.
Kaybolan Gradyan sorunu, derin yapay sinir ağlarının eğitimi sırasında karşılaşılan önemli bir zorluktur. Gradyanlar (ağın parametrelerinin ne kadar değiştirilmesi gerektiğini belirleyen değerler), çıktı katmanından giriş katmanlarına doğru geriye yayılırken aşırı derecede küçüldüğünde ortaya çıkar. Bu gradyanlar model ağırlıklarının güncellenmesi için gerekli olduğundan, ortadan kaybolmaları ağın önceki katmanlarının öğrenmeyi bırakması anlamına gelir. Bu olgu, modelin verilerdeki karmaşık örüntüleri yakalamasını etkili bir şekilde engeller ve derin öğrenme mimarilerinin derinliğini ve performansını sınırlar.
Kaybolan Sinyallerin Mekaniği#
Bunun neden olduğunu anlamak için geri yayılım sürecine bakmak faydalıdır. Eğitim sırasında ağ, bir kayıp fonksiyonu kullanarak tahmini ile gerçek hedef arasındaki hatayı hesaplar. Bu hata, ağırlıkları ayarlamak için katmanlar boyunca geriye gönderilir. Bu ayarlama, aktivasyon fonksiyonlarının türevlerinin katman katman çarpılmasını içeren kalkülüsün zincir kuralına dayanır.
Ağ, sigmoid fonksiyonu veya hiperbolik tanjant (tanh) gibi aktivasyon fonksiyonları kullanıyorsa türevler genellikle 1'den küçüktür. Derin bir ağdaki onlarca veya yüzlerce katmanda bu küçük sayılardan birçoğu birbiriyle çarpıldığında sonuç sıfıra yaklaşır. Bunu, bir mesajın uzun bir insan sırası boyunca fısıldandığı bir "telefon oyunu" gibi düşünebilirsin; mesaj sıranın başına ulaştığında duyulamaz hâle gelir ve ilk kişi ne söyleyeceğini bilmez.
Çözümler ve Modern Mimariler#
Yapay zekâ alanı, kaybolan gradyanları azaltmak için çeşitli güçlü stratejiler geliştirdi ve bu sayede Ultralytics YOLO26 gibi güçlü modellerin oluşturulmasını mümkün kıldı.
- ReLU ve Türevleri: Düzeltilmiş Doğrusal Birim (ReLU) ve Leaky ReLU ile SiLU gibi sonraki türevleri, pozitif değerlerde doyuma ulaşmaz. Türevleri ya 1 ya da küçük bir sabittir; bu da derin katmanlar boyunca gradyan büyüklüğünü korur.
- Artık Bağlantılar: Artık Ağlarda (ResNets) tanıtılan bu bağlantılar, gradyanın bir veya daha fazla katmanı atlamasına olanak tanıyan "atlama bağlantılarıdır". Bu, gradyanın önceki katmanlara engellenmeden akması için bir "süper otoyol" oluşturur ve modern [nesne algılama](https://ultralytics-translation-1.invalid için) için temel bir kavramdır.
- Batch Normalizasyonu: Batch normalizasyonu, her katmanın girdilerini normalleştirerek ağın türevlerin çok küçük olmadığı kararlı bir çalışma aralığında çalışmasını sağlar ve dikkatli başlatma gereksinimini azaltır.
- Kapılı Mimariler: Sıralı veriler için Uzun Kısa Süreli Bellek (LSTM) ağları ve GRU'lar, ne kadar bilginin tutulacağına veya unutulacağına karar vermek için özelleştirilmiş kapılar kullanır ve gradyanın uzun diziler boyunca kaybolmasını etkili bir şekilde önler.
Kaybolan ve Patlayan Gradyanlar#
Aynı temel mekanizmadan (tekrarlanan çarpma) kaynaklansalar da kaybolan gradyanlar patlayan gradyanlardan farklıdır.
- Kaybolan Gradyan: Gradyanlar sıfıra yaklaşır ve öğrenmenin durmasına neden olur. Bu durum, sigmoid aktivasyonları kullanan derin ağlarda yaygındır.
- Patlayan Gradyan: Gradyanlar birikerek aşırı derecede büyür; bu da model ağırlıklarının büyük ölçüde dalgalanmasına veya
NaN(Sayı Değil) değerine ulaşmasına neden olur. Bu sorun genellikle gradyan kırpma ile çözülür.
Gerçek Dünya Uygulamaları#
Kaybolan gradyanların aşılması, modern yapay zekâ uygulamalarının başarısı için ön koşul olmuştur.
-
Derin Nesne Algılama: YOLO serisi gibi otonom araçlar için kullanılan modellerin yayaları, işaretleri ve araçları birbirinden ayırt edebilmesi için yüzlerce katmana ihtiyacı vardır. Artık bloklar ve batch normalizasyonu gibi çözümler olmadan, bu derin ağları COCO gibi büyük veri kümeleri üzerinde eğitmek mümkün olmazdı. Ultralytics Platform gibi araçlar, bu eğitim sürecini kolaylaştırarak bu karmaşık mimarilerin doğru şekilde yakınsamasını sağlar.
-
Makine Çevirisi: Doğal Dil İşleme (NLP) alanında, uzun bir cümleyi çevirmek ilk ve son kelimeler arasındaki ilişkiyi anlamayı gerektirir. RNNs'deki (LSTM'ler aracılığıyla) ve daha sonra Transformer'lar ile kaybolan gradyan sorununun çözülmesi, modellerin uzun paragraflar boyunca bağlamı korumasını sağladı ve Google Translate gibi makine çevirisi hizmetlerinde devrim yarattı.
Python Örneği#
Modern çerçeveler ve modeller, bu karmaşıklıkların çoğunu soyutlar. Ultralytics YOLO26 gibi bir modeli eğittiğinde mimari, gradyanların kaybolmasını önlemek için SiLU aktivasyonu ve Batch Normalization gibi bileşenleri otomatik olarak içerir.
from ultralytics import YOLO
# Load the YOLO26 model (latest generation, Jan 2026)
# This architecture includes residual connections and modern activations
# that inherently prevent vanishing gradients.
model = YOLO("yolo26n.pt")
# Train the model on a dataset
# The optimization process remains stable due to the robust architecture
results = model.train(data="coco8.yaml", epochs=10)








