Masked Autoencoders (MAE)
Maskeli Otokodlayıcıların (MAE) öz denetimli öğrenmede nasıl devrim yarattığını keşfet. MAE yeniden yapılandırmasının Ultralytics YOLO26 performansını ve verimliliğini nasıl artırdığını öğren.
Maskeli Otokodlayıcılar (MAE), daha geniş bilgisayarla görme alanında öz denetimli öğrenme için son derece verimli ve ölçeklenebilir bir yaklaşım sunar. Yoğun parametreli sinir ağlarını kapsamlı şekilde etiketlenmiş veri kümelerine ihtiyaç duymadan eğitmek için geliştirilen MAE, girdi görüntüsünün büyük ve rastgele bir bölümünü kasıtlı olarak gizler ve modeli eksik pikselleri yeniden oluşturmaya yönelik eğitir. Ağ, gizli görsel bilgileri başarıyla tahmin ederek şekiller, dokular ve uzamsal ilişkiler hakkında derin, anlamsal bir anlayış edinir.
Bu teknik, metin tabanlı sistemlerde maskeli dil modellemesinin başarısından büyük ölçüde esinlenir, ancak görüntü verilerinin yüksek boyutlu yapısına uyarlanmıştır. Mimari, oldukça popüler Transformer çatısına dayanır ve asimetrik bir kodlayıcı-kod çözücü yapısı kullanır.
Maskeli Otokodlayıcılar Nasıl Çalışır#
MAE'nin temel yeniliği, işleme verimliliğinde yatar. Eğitim sırasında girdi görüntüsü bir parça ızgarasına bölünür. Bu parçaların büyük bir yüzdesi (çoğunlukla %75'e kadar) rastgele maskelenir ve çıkarılır. Genellikle bir Görüntü Transformer'ı (ViT) olan kodlayıcı, yalnızca görünür ve maskelenmemiş parçaları işler. Kodlayıcı maskelenmiş bölümleri tamamen atladığı için çok daha az işlem gücü ve bellek gerektirir; bu da eğitim sürecini son derece hızlı hâle getirir.
Kodlayıcı görünür parçaların gizil temsillerini oluşturduktan sonra hafif bir kod çözücü devreye girer. Kod çözücü, kodlanmış görünür parçaları "maske belirteçleri" (eksik veriler için yer tutucular) ile birlikte alır ve özgün görüntüyü yeniden oluşturmaya çalışır. Kod çözücü yalnızca bu ön eğitim aşamasında kullanıldığı için çok küçük tutulabilir ve hesaplama ek yükü daha da azaltılabilir. Ön eğitim tamamlandığında kod çözücü atılır ve güçlü kodlayıcı alt akış uygulamaları için korunur.
İlişkili Terimleri Ayırt Etme#
MAE'leri tam olarak kavramak için, bunların daha eski veya daha genel derin öğrenme kavramlarından nasıl farklı olduğunu anlamak yararlıdır:
- Otokodlayıcı: Geleneksel bir otokodlayıcı, verimli veri kodlamaları öğrenmek için girdinin tamamını daha küçük bir gizil uzaya sıkıştırır ve ardından yeniden oluşturur. MAE ise tüm girdiyi yalnızca sıkıştırıp açmak yerine ağı eksik veriyi tahmin etmeye zorlar.
- Öz Denetimli Öğrenme: Bu, bir modelin insan eliyle açıklanmış etiketler olmadan verinin kendisinden öğrendiği kapsayıcı eğitim paradigmasıdır. MAE, bu kavramın mimariye özgü bir uygulamasıdır.
- Temel Model: MAE'ler, daha sonra özel görevlere göre ince ayar yapılan görsel temel modelleri önceden eğitmek için sıklıkla kullanılır.
Gerçek Dünya Uygulamaları#
MAE'ler görsel verilerin son derece sağlam temsillerini öğrendiği için karmaşık, gerçek dünya yapay zekâ sistemleri için ideal başlangıç noktalarıdır.
- Gelişmiş Nesne Algılama için Ön Eğitim: MAE ön eğitimiyle öğrenilen zengin özellik çıkarma yetenekleri, alt akış nesne algılama sistemlerinin performansını önemli ölçüde artırabilir. Örneğin MAE aracılığıyla öğrenilen özellikler, etiketli verilerin az olduğu özel ve niş veri kümelerinde Ultralytics YOLO26 gibi modelleri eğitirken kullanılabilir.
- Tıbbi Görüntü Analizi: Radyoloji gibi alanlarda, açıklanmış devasa MRI veya CT taramaları veri kümeleri toplamak pahalıdır ve gizlilik yasalarıyla kısıtlanır. Araştırmacılar, bunları çok az sayıda etiketlenmiş örnekle tümörleri veya anomalileri tespit edecek şekilde ince ayarlamadan önce, arXiv'de yayımlanan güncel akademik literatürde açıklanan büyük etiketsiz tıbbi görüntü koleksiyonları üzerinde modelleri önceden eğitmek için MAE'leri kullanır.
Verileri Yönetme ve Dağıtım#
Bir omurga ağ MAE yaklaşımıyla önceden eğitildiğinde, sonraki adım modeli görüntü sınıflandırma veya görüntü segmentasyonu gibi belirli görevlere göre ince ayarlamak ve dağıtmaktır. Modern bulut ekosistemleri bu geçişi sorunsuz hâle getirir. Örneğin ekipler, göreve özel veri kümelerine kolayca açıklama eklemek, bulut eğitimini düzenlemek ve üretime hazır modelleri uç cihazlara veya sunuculara dağıtmak için Ultralytics Platform platformundan yararlanabilir. Bu, genellikle makine öğrenimi operasyonları (MLOps) ile ilişkilendirilen standart altyapı çalışmalarının büyük bölümünü ortadan kaldırır.
Kod Örneği: Parça Maskelemesini Simüle Etme#
Tam bir MAE'yi eğitmek eksiksiz bir Transformer mimarisi gerektirse de parça maskelemenin temel kavramı PyTorch tensör işlemleri kullanılarak kolayca görselleştirilebilir. Bu basit kod parçacığı, bir girdi tensöründeki görünür parçaların rastgele nasıl seçilebileceğini gösterir.
import torch
def create_random_mask(batch_size, num_patches, mask_ratio=0.75):
"""Generates a random mask to simulate MAE patch dropping."""
# Calculate how many patches to keep visible
num_keep = int(num_patches * (1 - mask_ratio))
# Generate random noise to determine patch shuffling
noise = torch.rand(batch_size, num_patches)
# Sort noise to get random indices
ids_shuffle = torch.argsort(noise, dim=1)
# Select the indices of the patches that remain visible
ids_keep = ids_shuffle[:, :num_keep]
return ids_keep
# Simulate a batch of 4 images, each divided into 196 patches
visible_patches = create_random_mask(batch_size=4, num_patches=196)
print(f"Visible patch indices shape: {visible_patches.shape}")Sıfırdan mimari yazmadan güçlü, önceden eğitilmiş görsel yetenekleri iş akışlarına entegre etmek isteyen geliştiriciler için kapsamlı Ultralytics belgelerini incelemek, son teknoloji görüntü modellerini kendi özel sorunlarına uygulamak için mükemmel başlangıç noktaları sunar. Ayrıca TensorFlow gibi başlıca çatılar da en güncel makine öğrenimi araştırmalarını ölçeklenebilir üretim ortamlarında uygulamak için güçlü ekosistemler sağlar.









