Token Merging (ToMe)
Token Birleştirmenin (ToMe) Transformer ve ViT modellerini nasıl optimize ettiğini öğren. FLOP'ları azaltmayı, gerçek zamanlı çıkarımı hızlandırmayı ve Üretken Yapay Zekâ hızını artırmayı keşfet.
Token Birleştirme (ToMe), ileri geçişler sırasında işlenen token sayısını azaltarak Transformer mimarilerinin performansını ve verimliliğini optimize etmek üzere tasarlanmış, son teknoloji bir tekniktir. Başlangıçta Görsel Transformer (ViT) modellerini hızlandırmak için geliştirilen ToMe, ek eğitim gerektirmeden ağ içindeki yinelenen token'ları sistematik olarak belirleyip birleştirir. Kendine dikkat mekanizmasının hesaplama karmaşıklığı token sayısıyla karesel olarak ölçeklendiğinden, benzer token'ların birleştirilmesi toplam kayan nokta işlemlerini (FLOPs) büyük ölçüde azaltır ve çok daha hızlı gerçek zamanlı çıkarım yapılmasını sağlar.
Token Birleştirme Sürecini Anlama#
ToMe, bir görüntüyü veya metni ayrı token'lara ayıran ilk ön işleme adımı olan tokenleştirmeden temelde farklıdır. Tokenleştirme ayrık öğeler oluştururken Token Birleştirme, modelin ileri yürütmesi sırasında dinamik bir alt örnekleme mekanizması olarak görev yapar.
Algoritma, token benzerliğini değerlendirmek için genellikle iki parçalı eşleştirme kullanır ve çoğu zaman dikkat katmanlarındaki token'ların anahtarları arasındaki kosinüs benzerliğini hesaplar. Görsel veya anlamsal bilgileri büyük ölçüde benzer olan token'lar, genellikle özelliklerinin ortalaması alınarak birleştirilir. Böylece temel uzamsal veya bağlamsal bilgiler korunurken gereksiz hesaplama yükü ortadan kaldırılır ve PyTorch gibi çerçevelerin karmaşık görme modellerini çok daha hızlı işlemesi sağlanır.
Token Birleştirmenin Gerçek Dünyadaki Uygulamaları#
Token Birleştirme, hesaplama kaynakları kısıtlı ortamlarda dikkat tabanlı büyük mimarileri kullanıma sunmak için kritik bir optimizasyon stratejisi hâline gelmiştir.
-
Üretken Yapay Zekâ ve Görüntü Sentezi: Popüler metinden görüntüye difüzyon modellerinde ToMe, görüntü oluşturmayı hızlandırmak için sıkça kullanılır. Arka plan veya düşük ayrıntılı token'ları birleştiren oluşturma süreci daha az adım gerektirir; bu da büyük miktarda GPU kaynağı tasarrufu sağlar ve üretken modellere güvenen son kullanıcılar için gecikmeyi azaltır. Difüzyon süreçleri hakkında daha fazla bilgiyi arXiv üzerindeki temel araştırmalarda bulabilirsin.
-
Uç Yapay Zekâ Dağıtımları: Her Şeyi Segmentleme Modeli (SAM) gibi büyük modelleri mobil cihazlarda kullanıma sunmak, bellek kısıtlamaları nedeniyle oldukça zordur. ToMe, bellek ayak izini dinamik olarak küçültmeye yardımcı olarak karmaşık görüntü segmentasyonu görevlerinin uç donanımda çalışmasını sağlar. Salt hızın kritik olduğu senaryolarda mühendisler, daha hızlı uçtan uca uç çıkarımı için genellikle Ultralytics YOLO26 gibi yerel olarak optimize edilmiş, dikkat mekanizması içermeyen mimarilere yönelir.
Python Örneği: Token Benzerliği Hesaplama#
ToMe'yi eksiksiz bir mimariye entegre etmek, dikkat bloklarının değiştirilmesini gerektirse de temel kavram benzer token'ları bulmaya dayanır. Aşağıdaki PyTorch kod parçacığı, hangilerinin birleştirme adayı olduğunu belirlemek üzere bir token kümesi arasındaki kosinüs benzerliğinin nasıl hesaplanabileceğini gösterir.
import torch
import torch.nn.functional as F
# Simulate a batch of 4 image patches (tokens) with 64-dimensional features
tokens = torch.randn(1, 4, 64)
# Normalize the tokens to easily compute cosine similarity via dot product
normalized_tokens = F.normalize(tokens, p=2, dim=-1)
# Compute the similarity matrix between all tokens (1 x 4 x 4)
similarity_matrix = torch.matmul(normalized_tokens, normalized_tokens.transpose(1, 2))
# Tokens with high similarity scores (close to 1.0) off the diagonal
# are prime candidates for Token Merging.
print("Similarity Matrix:", similarity_matrix)Modern makine öğrenimi işlem hatları, doğruluk ve hız arasında dikkatli bir denge kurulmasını gerektirir. Özel bir ViT'yi optimize etmek için Token Birleştirme kullanıyor veya YOLO26'nın son teknoloji verimliliğinden yararlanıyor olsan da bu karmaşık veri iş akışlarını yönetmek Ultralytics Platformu ile büyük ölçüde kolaylaşır. Platform, otomatik veri açıklama, sorunsuz bulut eğitimi ve çeşitli uç bilişim donanım ortamlarında güçlü model dağıtımı için sezgisel bir ekosistem sunar. Bilgisayarlı görü girişimlerini ölçeklendiren kuruluşlar, son teknoloji modelleri güvenilir ve verimli biçimde üretime geçirmek için bu araçlara güvenir.






