t-distributed Stochastic Neighbor Embedding (t-SNE)
t-SNE'nin yüksek boyutlu verileri nasıl görselleştirdiğini keşfet. Bilgisayarlı görü özelliklerindeki kümeleri ortaya çıkarmayı ve Ultralytics YOLO26 için makine öğrenimi modellerini optimize etmeyi öğren.
t-dağılımlı Stokastik Komşu Gömümleme (t-SNE), her veri noktasına iki veya üç boyutlu bir haritada konum vererek yüksek boyutlu verileri görselleştirmeye yarayan istatistiksel bir yöntemdir. Doğrusal olmayan boyut indirgeme biçimi olan bu teknik, yüzlerce veya binlerce özellik içeren veri kümelerini keşfetmek için makine öğrenmesinde yaygın olarak kullanılır. Küresel yapıları korumaya odaklanan doğrusal yöntemlerin aksine t-SNE, benzer örnekleri birbirine yakın tutma konusunda başarılıdır ve aksi takdirde gizli kalabilecek yerel kümeleri ve manifoldları ortaya çıkarır. Bu da onu genom araştırmalarından derin sinir ağlarının iç mantığını anlamaya kadar pek çok alanda paha biçilmez bir araç hâline getirir.
t-SNE Nasıl Çalışır?#
t-SNE'nin temel fikri, veri noktaları arasındaki benzerlikleri ortak olasılıklara dönüştürmeyi içerir. Özgün yüksek boyutlu uzayda algoritma, noktalar arasındaki benzerliği Gauss dağılımı kullanarak ölçer. İki nokta birbirine yakınsa "komşu" olma olasılıkları yüksektir. Ardından algoritma, bu olasılıkları koruyarak noktaları daha düşük boyutlu bir uzaya (genellikle 2B veya 3B) eşlemeye çalışır.
Bunu gerçekleştirmek için düşük boyutlu haritada Student t-dağılımını kullanarak benzer bir olasılık dağılımı tanımlar. Bu özel dağılımın kuyrukları, normal Gauss dağılımına kıyasla daha ağırdır; bu da yüksek boyutlu uzaydaki noktaların aşağıya izdüşürüldüğünde birbirlerinin üzerine yığılma eğiliminde olduğu "kalabalıklaşma sorununun" ele alınmasına yardımcı olur. t-SNE, benzemeyen noktaları görselleştirmede birbirinden daha uzağa iterek altta yatan eğitim verilerinin yapısını ortaya çıkaran belirgin ve okunabilir kümeler oluşturur. Algoritma, yüksek ve düşük boyutlu olasılık dağılımları arasındaki farklılığı en aza indirerek denetimsiz öğrenme yoluyla en iyi harita gösterimini etkili biçimde öğrenir.
Yapay Zekâda Gerçek Dünya Uygulamaları#
t-SNE, keşifsel veri analizi (EDA) ve model tanılaması için standart bir araçtır. Mühendislerin bir modelin ne öğrendiğini "görmesini" sağlar.
- Bilgisayarlı Görü Özelliklerini Doğrulama: YOLO26 gibi modellerin kullanıldığı nesne algılama iş akışlarında geliştiricilerin genellikle ağın görsel olarak benzer sınıfları birbirinden ayırt edip edemediğini kontrol etmesi gerekir. Ağın son katmanlarından özellik haritalarını çıkarıp t-SNE ile izdüşürerek mühendisler, "kediler"e ait görüntülerin "köpekler"den ayrı kümelenip kümelenmediğini görselleştirebilir. Kümeler iç içe geçmişse bu, modelin özellik çıkarma yeteneklerinin iyileştirilmesi gerektiğini gösterir.
- Doğal Dil İşleme (NLP): t-SNE, sözcük gömülerini görselleştirmek için yoğun biçimde kullanılır. Yüksek boyutlu sözcük vektörleri (genellikle 300'den fazla boyut) 2B'ye izdüşürüldüğünde, benzer anlamsal anlamlara sahip sözcükler doğal olarak bir araya gelir. Örneğin bir t-SNE grafiği "kral", "kraliçe", "prens" ve "hükümdar" sözcüklerini içeren bir küme gösterebilir; bu da Doğal Dil İşleme (NLP) modelinin kraliyet kavramını kavradığını ortaya koyar.
- Genomik ve Biyoinformatik: Araştırmacılar, tek hücreli RNA dizileme verilerini görselleştirmek için t-SNE kullanır. Bilim insanları binlerce gen ifadesi değerini 2B grafiğe indirgeyerek farklı hücre türlerini belirleyebilir ve gelişimsel yörüngeleri izleyebilir; bu da yeni biyolojik içgörülerin ve hastalık belirteçlerinin keşfedilmesine yardımcı olur.
PCA ile Karşılaştırma#
Bir diğer yaygın indirgeme tekniği olan Temel Bileşen Analizi (PCA) ile t-SNE'yi birbirinden ayırmak önemlidir.
- PCA, verilerin küresel varyansını korumaya odaklanan doğrusal bir tekniktir. Deterministik ve hesaplama açısından verimli olması, onu ilk veri sıkıştırma veya gürültü azaltma işlemleri için mükemmel kılar.
- t-SNE, yerel komşulukları korumaya odaklanan doğrusal olmayan bir tekniktir. Olasılıksal (stokastik) ve hesaplama açısından daha ağırdır; ancak karmaşık, doğrusal olmayan manifoldlar için çok daha iyi görselleştirmeler üretir.
Veri ön işleme için yaygın bir en iyi uygulama, verileri yönetilebilir bir boyuta (ör. 50 boyut) indirmek üzere önce PCA kullanmak ve ardından son görselleştirme için t-SNE uygulamaktır. Bu karma yaklaşım, hesaplama yükünü azaltır ve t-SNE sonucunu bozabilecek gürültüyü filtreler.
Python Örneği: Özellikleri Görselleştirme#
Aşağıdaki örnek, sentetik bir veri kümesine t-SNE uygulamak için scikit-learn kullanımını gösterir. Bu iş akışı, derin öğrenme modelinden çıkarılan özelliklerin nasıl görselleştirilebileceğini yansıtır.
import matplotlib.pyplot as plt
from sklearn.datasets import make_blobs
from sklearn.manifold import TSNE
# Generate synthetic high-dimensional data (100 samples, 50 features, 3 centers)
X, y = make_blobs(n_samples=100, n_features=50, centers=3, random_state=42)
# Apply t-SNE to reduce dimensions from 50 to 2
# 'perplexity' balances local vs global aspects of the data
tsne = TSNE(n_components=2, perplexity=30, random_state=42)
X_embedded = tsne.fit_transform(X)
# Plot the result to visualize the 3 distinct clusters
plt.scatter(X_embedded[:, 0], X_embedded[:, 1], c=y)
plt.title("t-SNE Projection of High-Dimensional Data")
plt.show()Dikkat Edilmesi Gereken Temel Noktalar#
Güçlü olmakla birlikte t-SNE, dikkatli hiperparametre ayarlaması gerektirir. "Perplexity" parametresi kritik öneme sahiptir; temel olarak her noktanın kaç yakın komşusu olduğunu tahmin eder. Bu parametrenin çok düşük veya çok yüksek ayarlanması yanıltıcı görselleştirmelere yol açabilir. Ayrıca t-SNE, küresel mesafeleri iyi korumaz; yani grafikteki iki farklı küme arasındaki mesafe, özgün uzaydaki fiziksel mesafelerini zorunlu olarak yansıtmaz. Bu nüanslara rağmen t-SNE, bilgisayarlı görü (CV) mimarilerini doğrulamak ve karmaşık veri kümelerini anlamak için temel bir teknik olmaya devam eder. Büyük ölçekli veri kümelerini yöneten kullanıcılar, bu tür derinlemesine analizleri gerçekleştirmeden önce verilerini düzenlemek için genellikle Ultralytics Platform'dan yararlanır.









