Vision Transformer (ViT)
Vision Transformer'ların (ViT) gücünü keşfet. Öz-dikkat ve yama tokenleştirmenin Ultralytics ile CNN'lerin ötesinde bilgisayarlı görüde nasıl devrim yarattığını öğren.
Vision Transformer (ViT), görsel görevleri çözmek için başlangıçta Doğal Dil İşleme (NLP) amacıyla tasarlanan öz-dikkat mekanizmalarını uyarlayan bir derin öğrenme mimarisidir. Görüntüleri yerel piksel ızgaraları hiyerarşisi üzerinden işleyen geleneksel bir Evrişimli Sinir Ağının (CNN) aksine ViT, görüntüyü ayrık yamalardan oluşan bir dizi olarak ele alır. Bu yaklaşım, saf Transformer mimarilerinin evrişim katmanlarına dayanmadan [bilgisayarlı görüde (CV)](https://ultralytics-translation-3.invalid son teknoloji performansına ulaşabileceğini gösteren çığır açıcı "An Image is Worth 16x16 Words" araştırma makalesiyle popüler hâle gelmiştir. ViT'ler, global dikkatten yararlanarak ilk katmandan itibaren tüm görüntüdeki uzun menzilli bağımlılıkları yakalayabilir.
Vision Transformer'lar Nasıl Çalışır#
ViT'nin temel yeniliği, girdi verilerini yapılandırma biçimidir. Görüntüyü standart bir Transformer ile uyumlu hâle getirmek için model, görsel bilgileri bir dizi vektöre ayırır ve bir dil modelinin kelimelerden oluşan bir cümleyi işleme biçimini taklit eder.
-
Yama Token'larına Ayırma: Girdi görüntüsü, genellikle 16x16 piksel boyutunda, sabit boyutlu karelerden oluşan bir ızgaraya bölünür. Her kare, düzleştirilerek bir görsel token hâline gelir.
-
Doğrusal Projeksiyon: Bu düzleştirilmiş yamalar, yoğun gömme vektörleri oluşturmak üzere eğitilebilir bir doğrusal katmandan geçirilir. Bu adım, ham piksel değerlerini modelin işleyebileceği yüksek boyutlu bir uzaya eşler.
-
Konumsal Kodlama: Mimari, dizileri paralel olarak işlediği ve sıra ya da uzama ilişkin içsel bir anlayışa sahip olmadığı için yama gömme vektörlerine öğrenilebilir konumsal kodlamalar eklenir. Bu, modelin her yamanın orijinal görüntüde nereye ait olduğuna ilişkin uzamsal bilgiyi korumasını sağlar.
-
Öz-Dikkat Mekanizması: Dizi, Transformer kodlayıcısına girer ve burada öz-dikkat, her yamanın diğer tüm yamalarla eş zamanlı olarak etkileşime girmesini sağlar. Bu, ağın global bağlamı öğrenmesine ve sol üst köşedeki bir pikselin sağ alt köşedeki bir pikselle nasıl ilişkili olduğunu anlamasına olanak tanır.
-
Sınıflandırma Başlığı: Görüntü sınıflandırma gibi görevler için dizinin başına genellikle özel bir "sınıf token'ı" eklenir. Bu token'ın son çıktı durumu, görüntünün birleştirilmiş temsili olarak kullanılır ve ardından çok katmanlı algılayıcı (MLP) gibi bir sınıflandırıcıya beslenir.
Vision Transformer'lar ve CNN'ler#
Her iki mimari de görsel verileri anlamayı amaçlasa da işleyiş felsefeleri önemli ölçüde farklıdır. CNN'ler, öteleme değişmezliği olarak bilinen güçlü bir "endüktif önyargıya" sahiptir; yani yerel özelliklerin (kenarlar ve dokular gibi) konumlarından bağımsız olarak önemli olduğunu içsel olarak varsayarlar. Bu, CNN'leri daha küçük veri kümelerinde son derece veri verimli ve etkili kılar.
Buna karşılık Vision Transformer'ların görüntüye özgü önyargısı daha azdır. JFT-300M veya ImageNet veri kümelerinin tamamı gibi çok büyük miktarlarda eğitim verisi kullanarak uzamsal ilişkileri sıfırdan öğrenmeleri gerekir. Bu durum eğitimi hesaplama açısından daha yoğun hâle getirse de ViT'lerin olağanüstü ölçekte büyümesini sağlar; yeterli veri ve işlem gücü ile yerel evrişimlerin gözden kaçırabileceği karmaşık global yapıları yakalayarak CNN'lerden daha iyi performans gösterebilirler.
Gerçek Dünya Uygulamaları#
Global bağlamı anlayabilme yeteneği, ViT'leri özellikle karmaşık ve kritik ortamlarda kullanışlı kılar.
- Tıbbi Görüntü Analizi: Sağlık hizmetlerinde yapay zekâ alanında ViT'ler, MR görüntüleri veya histopatoloji lamları gibi yüksek çözünürlüklü taramaları analiz etmek için kullanılır. Örneğin tümör tespitinde bir ViT, dokudaki ince dokusal anormallikleri lam genelindeki daha geniş yapısal değişikliklerle ilişkilendirerek yerel işlemenin gözden kaçırabileceği kötü huylu örüntüleri belirleyebilir.
- Uydu Görüntüleri ve Uzaktan Algılama: ViT'ler, nesneler arasındaki ilişkilerin geniş mesafelere yayıldığı uydu görüntüsü analizinde üstün performans gösterir. Örneğin bir ormansızlaşma alanını uzaktaki bir tomrukçuluk yoluyla ilişkilendirmek, bir arazinin "büyük resmini" anlamayı gerektirir; bu, ViT'nin global dikkatinin standart CNN'lerin sınırlı alıcı alanından daha iyi performans gösterdiği bir görevdir.
Transformer'ları Ultralytics ile Kullanma#
ultralytics kütüphanesi, özellikle RT-DETR (Gerçek Zamanlı Tespit Transformer'ı) olmak üzere Transformer tabanlı mimarileri destekler. Amiral gemisi YOLO26, uç cihazlarda hız ve doğruluk arasındaki dengesi nedeniyle sıklıkla tercih edilirken RT-DETR, global bağlama öncelik veren senaryolar için güçlü bir alternatif sunar.
Aşağıdaki Python örneği, önceden eğitilmiş Transformer tabanlı bir modelin nasıl yükleneceğini ve çıkarımın nasıl çalıştırılacağını gösterir:
from ultralytics import RTDETR
# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")
# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()Geleceğe Bakış#
Araştırmalar, ViT'lerin yüksek hesaplama maliyetini ele almak için hızla ilerlemektedir. FlashAttention gibi teknikler bu modelleri daha hızlı ve bellek açısından daha verimli hâle getirmektedir. Ayrıca CNN'lerin verimliliğini Transformer'ların dikkatiyle birleştiren hibrit mimariler yaygınlaşmaktadır. Bu gelişmiş iş akışlarını yönetmek isteyen ekipler için Ultralytics Platformu, verileri açıklamak, karmaşık modelleri bulut üzerinden eğitmek ve bunları çeşitli uç noktalara dağıtmak için birleşik bir ortam sunar.









