Transformer
Transformer mimarisini ve öz-dikkat mekanizmasını keşfet. Bunların üstün doğruluk için RT-DETR ve Ultralytics YOLO26 gibi yapay zekâ modellerini nasıl güçlendirdiğini öğren.
Transformer, doğal dil veya görsel özellikler gibi sıralı giriş verilerini işlemek için self-attention adı verilen bir mekanizmaya dayanan bir derin öğrenme mimarisidir. İlk olarak Google araştırmacıları tarafından dönüm noktası niteliğindeki Attention Is All You Need makalesinde tanıtılan Transformer, önceki Tekrarlayan Sinir Ağları (RNNs) mimarilerinin sıralı işleme sınırlamalarını ortadan kaldırarak yapay zekâ (AI) alanında devrim yarattı. Bunun yerine Transformers, veri dizilerinin tamamını eş zamanlı olarak analiz ederek modern donanımlarda, örneğin GPU'larda, büyük ölçekte paralelleştirmeye ve çok daha hızlı eğitim sürelerine olanak tanır.
Transformers Nasıl Çalışır#
Transformer'ın temel yeniliği self-attention mekanizmasıdır. Bu mekanizma, modelin giriş verilerinin farklı bölümlerinin birbirlerine göre önemini ağırlıklandırmasını sağlar. Örneğin bir cümlede model, çevresindeki bağlama dayanarak "bank" kelimesinin "river" kelimesinden çok "money" kelimesiyle ilişkili olduğunu öğrenebilir.
Bu mimari genel olarak iki ana bileşenden oluşur:
- Encoder: Giriş verilerini zengin bir sayısal gösterime veya embedding biçimine dönüştürür.
- Decoder: Sonucu, örneğin çevrilmiş bir cümleyi veya tahmin edilen bir sınırlayıcı kutuyu oluşturmak için encoder'ın çıktısını kullanır.
Bilgisayarlı görü (CV) alanında modeller genellikle Vision Transformer (ViT) adı verilen bir varyasyonu kullanır. Görüntü, metin belirteçlerini işlemek yerine sabit boyutlu parçalara (ör. 16x16 piksel) bölünür. Bu parçalar düzleştirilir ve bir dizi olarak ele alınır; böylece model, standart bir Evrişimli Sinir Ağı (CNN) modeline kıyasla "küresel bağlamı"—bir görüntünün uzak bölümleri arasındaki ilişkileri anlama—daha etkili şekilde yakalayabilir.
Transformers ve İlgili Kavramlar#
Transformer mimarisini ilgili terimlerden ayırt etmek önemlidir:
- Attention Mechanism: Verilerin belirli bölümlerine odaklanmaya ilişkin genel kavramdır. Transformer, tamamen attention katmanları etrafında oluşturulmuş özel bir mimaridir; diğer modeller ise attention'ı yalnızca küçük bir ek bileşen olarak kullanabilir.
- Büyük Dil Modeli (LLM): "GPT" gibi terimler, çok büyük miktarda metinle eğitilmiş belirli modelleri ifade eder. Modern LLM'lerin neredeyse tamamı, temel motorları olarak Transformer mimarisini kullanır.
Gerçek Dünya Uygulamaları#
Transformers'ın çok yönlülüğü, çeşitli sektörlerde benimsenmelerini sağladı:
-
Tıbbi Görüntüleme: Sağlık Hizmetlerinde AI alanında Transformers, tıbbi görüntü analizi gibi karmaşık görevlerde kullanılır. Küresel uzamsal ilişkileri anlama yetenekleri, yüksek çözünürlüklü MRI veya CT taramalarında yerel özelliklere odaklanan CNN modellerinin gözden kaçırabileceği ince anormalliklerin tespit edilmesine yardımcı olur.
-
Otonom Sistemler: Otonom araçlar için yayaların ve diğer araçların yörüngelerini anlamak kritik öneme sahiptir. Transformers, nesneleri zaman kareleri boyunca izleyerek ve güvenli navigasyon sağlamak üzere gelecekteki hareketleri tahmin ederek video anlamada üstün performans gösterir.
Transformers ile Nesne Tespiti#
CNN'ler geleneksel olarak nesne tespitine hâkim olsa da Gerçek Zamanlı Tespit Transformer'ı (RT-DETR) gibi Transformer tabanlı modeller güçlü alternatifler olarak ortaya çıktı. RT-DETR, CNN omurgalarının hızını Transformer kod çözme başlıklarının hassasiyetiyle birleştirir.
Bununla birlikte saf Transformer modelleri hesaplama açısından ağır olabilir. Birçok uç uygulaması için, verimli attention mekanizmalarını hızlı evrişimli işlemeyle birleştiren YOLO26 gibi yüksek düzeyde optimize edilmiş hibrit modeller, hız ve doğruluk arasında daha üstün bir denge sunar. Veri kümesi açıklamasından model dışa aktarmaya kadar iş akışını kolaylaştıran Ultralytics Platformu aracılığıyla bu modellerin eğitimini ve dağıtımını kolayca yönetebilirsin.
Python Örneği: RT-DETR Kullanımı#
Aşağıdaki örnek, ultralytics paketi içinde Transformer tabanlı bir model kullanarak çıkarım gerçekleştirmeyi gösterir. Bu kod, önceden eğitilmiş bir RT-DETR modeli yükler ve bir görüntüdeki nesneleri tespit eder.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Matematiksel temeller hakkında daha fazla bilgi için PyTorch'un Transformer katmanlarıyla ilgili dokümantasyonu teknik açıdan derinlemesine bilgi sunarken, IBM'in Transformers rehberi üst düzey bir iş perspektifi sağlar.









