Capsule Networks (CapsNet)
Kapsül Ağlarını (CapsNets) ve CNN'lerin sınırlamalarını nasıl çözdüklerini keşfet. Dinamik yönlendirmeyi, uzamsal hiyerarşileri ve CapsNets ile YOLO26'nın karşılaştırılmasını öğren.
Genellikle CapsNet'ler olarak kısaltılan Kapsül Ağları, geleneksel sinir ağlarında bulunan belirli sınırlamaların üstesinden gelmek üzere tasarlanmış, derin öğrenme alanında gelişmiş bir mimariyi temsil eder. Geoffrey Hinton ve ekibi tarafından geliştirilen CapsNet'ler, standart modellere kıyasla insan beyninin biyolojik sinirsel organizasyonunu daha yakından taklit etmeye çalışır. Özellikleri algılamada başarılı olan ancak alt örnekleme nedeniyle uzamsal ilişkileri çoğunlukla kaybeden tipik bir evrişimli sinir ağının (CNN) aksine, Kapsül Ağı nöronları "kapsül" adı verilen gruplar hâlinde düzenler. Bu kapsüller yalnızca bir nesnenin mevcut olma olasılığını değil, yönelim, boyut ve doku gibi belirli özelliklerini de kodlayarak görsel verilerdeki hiyerarşik uzamsal ilişkileri etkili bir şekilde korur.
Geleneksel CNN'lerin Sınırlaması#
CapsNet'lerin yenilikçi yönünü anlamak için standart bilgisayarlı görü modellerinin nasıl çalıştığına bakmak faydalıdır. Geleneksel bir CNN, hesaplama yükünü azaltmak ve öteleme değişmezliği elde etmek için özellik çıkarma katmanlarının ardından, özellikle maksimum havuzlama katmanlarını kullanır. Bu, bir CNN'in görüntüde nerede bulunduğuna bakmaksızın bir "kediyi" tanımlayabilmesi anlamına gelir.
Ancak bu süreç çoğu zaman kesin konum verilerini eler ve "Picasso problemi"ne yol açar: Bir CNN, gerekli tüm özellikler mevcut olduğu için, ağız alnın üzerinde olsa bile bir yüzü doğru şekilde sınıflandırabilir. CapsNet'ler, havuzlama katmanlarını kaldırıp bunların yerine nesnelerin uzamsal hiyerarşilerine saygı gösteren bir süreç koyarak bu sorunu ele alır.
Kapsül Ağları Nasıl Çalışır?#
Bu mimarinin temel yapı taşı, skaler bir değer yerine bir vektör çıktısı üreten, iç içe geçmiş bir nöron kümesi olan kapsüldür. Vektör matematiğinde bir vektörün hem büyüklüğü hem de yönü vardır. Bir CapsNet'te:
- Büyüklük (Uzunluk): Belirli bir varlığın mevcut girdide bulunma olasılığını temsil eder.
- Yön (Yönelim): Nesnenin poz tahmini, ölçeği ve dönüşü gibi somutlaştırma parametrelerini kodlar.
Alt katmanlardaki kapsüller (kenarlar gibi basit şekilleri algılayanlar), üst katmanlardaki kapsüllerin (gözler veya lastikler gibi karmaşık nesneleri algılayanlar) çıktısını tahmin eder. Bu iletişim, "dinamik yönlendirme" veya "uyuşmaya göre yönlendirme" adı verilen bir algoritmayla yönetilir. Alt düzey bir kapsülün tahmini, üst düzey kapsülün durumuyla örtüşürse aralarındaki bağlantı güçlendirilir. Bu, ağa CNN'lere dönüş ve ölçek hakkında bilgi vermek için genellikle gereken kapsamlı veri artırma işlemlerine ihtiyaç duymadan nesneleri farklı 3B bakış açılarından tanıma olanağı sağlar.
Temel Farklar: CapsNet'ler ve CNN'ler#
Her iki mimari de bilgisayarlı görü (CV) için temel öneme sahip olsa da görsel verileri işleme ve temsil etme biçimleri farklıdır:
- Skaler ve Vektör: CNN nöronları, özellik varlığını belirtmek için skaler çıktılar kullanır. CapsNet'ler, varlığı (uzunluk) ve poz parametrelerini (yönelim) kodlamak için vektörler kullanır.
- Yönlendirme ve Havuzlama: CNN'ler veriyi alt örneklemek için havuzlama kullanır ve çoğu zaman konum ayrıntılarını kaybeder. CapsNet'ler, uzamsal verileri korumak için dinamik yönlendirme kullanır; bu da onları kesin nesne takibi gerektiren görevlerde son derece etkili kılar.
- Veri Verimliliği: Kapsüller 3B bakış açılarını ve afin dönüşümleri örtük olarak anladığından, nesnenin olası her dönüşünü öğrenmek için kapsamlı örneklere ihtiyaç duyabilen CNN'lere kıyasla genellikle daha az eğitim verisinden genelleme yapabilir.
Gerçek Dünya Uygulamaları#
CapsNet'ler YOLO26 gibi optimize edilmiş modellerden çoğu zaman daha yüksek hesaplama maliyetine sahip olsa da özel alanlarda belirgin avantajlar sunar:
-
Tıbbi Görüntü Analizi: Sağlık hizmetlerinde bir anormalliğin kesin yönelimi ve şekli kritik öneme sahiptir. Araştırmacılar CapsNet'leri beyin tümörü segmentasyonu için uygulamıştır; burada model, standart CNN'lerin yumuşatabileceği ince uzamsal hiyerarşilere dayanarak bir tümörü çevre dokudan ayırt etmelidir. İlgili araştırmaları Tıbbi Görüntülemede Kapsül Ağları sayfasında inceleyebilirsin.
-
Örtüşen Rakam Tanıma: CapsNet'ler, özellikle rakamların örtüştüğü senaryolarda MNIST veri kümesi üzerinde son teknoloji sonuçlara ulaştı. Ağ her rakamın "pozunu" takip ettiğinden, üst üste gelen iki sayıyı (ör. bir '5'in üzerinde '3') tek ve karmaşık bir özellik haritasında birleştirmek yerine farklı nesneler olarak birbirinden ayırabilir.
Pratik Bağlam ve Uygulama#
Kapsül Ağları öncelikle bir sınıflandırma mimarisidir. Teorik açıdan dayanıklılık sunsalar da modern endüstri uygulamaları gerçek zamanlı performans için çoğunlukla yüksek hızlı CNN'leri veya Transformer'ları tercih eder. Bununla birlikte MNIST gibi CapsNet'ler için kullanılan sınıflandırma karşılaştırmalarını anlamak faydalıdır.
Aşağıdaki örnek, ultralytics paketini kullanarak MNIST veri kümesi üzerinde modern bir YOLO sınıflandırma modelinin nasıl eğitileceğini gösterir. Bu, Kapsül Ağlarını doğrulamak için kullanılan temel karşılaştırma göreviyle paralellik gösterir.
from ultralytics import YOLO
# Load a YOLO26 classification model (optimized for speed and accuracy)
model = YOLO("yolo26n-cls.pt")
# Train the model on the MNIST dataset
# This dataset helps evaluate how well a model learns handwritten digit features
results = model.train(data="mnist", epochs=5, imgsz=32)
# Run inference on a sample image
# The model predicts the digit class (0-9)
predict = model("https://docs.ultralytics.com/datasets/classify/mnist")Kapsüllerin ve Görsel Yapay Zekânın Geleceği#
Kapsül Ağlarının temelindeki ilkeler yapay zekâ güvenliği ve yorumlanabilirlik araştırmalarını etkilemeye devam ediyor. Parça-bütün ilişkilerini açıkça modelleyen kapsüller, derin sinir ağlarının "kara kutu" yapısına bir "cam kutu" alternatifi sunarak kararları daha açıklanabilir hâle getirir. Gelecekteki geliştirmeler, 3B nesne algılama ve robotik alanlarındaki performansı artırmak için kapsüllerin uzamsal dayanıklılığını YOLO11 veya daha yeni YOLO26 gibi mimarilerin çıkarım hızıyla birleştirmeyi amaçlıyor. Araştırmacılar ayrıca uyuşma algoritmasının hesaplama maliyetini daha da azaltmak için EM Yönlendirmeli Matris Kapsüllerini inceliyor.
Veri kümelerini yönetmek ve modelleri verimli şekilde eğitmek isteyen geliştiriciler için Ultralytics Platformu, verileri etiketlemek, bulutta eğitim gerçekleştirmek ve CNN'lerin hızını karmaşık görü görevleri için gereken doğrulukla dengeleyen modelleri dağıtmak üzere birleşik bir ortam sağlar.









