Linear Attention
Doğrusal dikkatin Transformer karmaşıklığını O(N)'e indirerek derin öğrenme modellerini nasıl optimize ettiğini keşfet. Yapay zekâ uygulamaları için verimliliği nasıl ölçeklendirdiğini öğren.
Doğrusal dikkat, modern derin öğrenme (DL) modellerinin hesaplama verimliliğini önemli ölçüde artırmak için tasarlanmış temel bir optimizasyon tekniğidir. Geleneksel Transformer mimarilerinde standart dikkat mekanizmaları, dizileri her bir belirteci diğer tüm belirteçlerle karşılaştırarak işler. Bu, dizinin uzunluğunun N olduğu durumlarda O(N kare) olarak bilinen ciddi bir karesel zaman karmaşıklığı ve bellek darboğazı oluşturur. Doğrusal dikkat, bu temel matematiksel işlemi doğrusal, yani O(N) ölçekte çalışacak şekilde değiştirir. Bu atılım, yapay zekâ (AI) modellerinin donanım belleğini tüketmeden tüm kitaplar veya gigapiksel görüntüler gibi devasa veri kümelerini işlemesini sağlar.
Doğrusal Dikkat Nasıl Çalışır#
Standart dikkatte sinir ağları üç ana vektörü işler: Sorgular (Q), Anahtarlar (K) ve Değerler (V). Klasik formül, tüm Sorgular ve Anahtarlar arasındaki benzerliği bir softmax işleviyle hesaplar; ardından bu matrisi Değerlerle çarpmadan önce devasa bir N x N matrisi oluşturur.
Doğrusal dikkat, bu devasa ara matrisin oluşturulmasını atlar. Bunun yerine, matris çarpımının birleşme özelliğinden yararlanır. Model, özel çekirdek işlevleri kullanarak softmax katmanını kaldırır veya yaklaşıklar ve çarpma işlemlerini farklı biçimde gruplandırır. Önce Anahtarları ve Değerleri çarparak sabit boyutlu bir bağlam matrisi oluşturur, ardından Sorguları bu yeni sıkıştırılmış matrisle çarpar. Bu basit yeniden sıralama hesaplama karmaşıklığını önemli ölçüde azaltır ve GPU (Grafik İşlem Birimi) gibi donanımların çok daha uzun girdileri yerel olarak işlemesini sağlar.
Son Gelişmeler ve DeltaNet#
Stanford Üniversitesi gibi kurumların ve Google DeepMind gibi teknoloji devlerinin öncülük ettiği yapay zekâ araştırma topluluğu, doğruluğu artırmak için doğrusal formülasyonlarda sürekli yenilik yapıyor. Araştırmacılar, 2024 ve 2025 yıllarında doğrusal Transformer'lardaki standart toplamsal güncellemelerin yerine "Delta Kuralı"nı kullanan yeni bir mimari olan DeltaNet'i tanıttı. Bu yöntem, ağın sıfırdan mutlak değerler hesaplamak yerine iç belleğini hâlihazırda depolanmış bilgilere göre güncellemesini sağlar.
Kapılı DeltaNet mimarileri gibi sonraki gelişmeler, kanal bazında azalma oranları getirerek modellerin belirli temel özellikleri zaman içinde seçici biçimde unutmasını veya korumasını sağlar. Donanım açısından verimli bu yenilikler, özellikle karmaşık bağlam içi bilgi getirme görevlerinde doğrusal Transformer'lar ile geleneksel softmax dikkati arasındaki performans farkını kapatır.
Doğrusal Dikkat ve Diğer Dikkat Mekanizmaları#
Ağlarını optimize eden yapay zekâ mühendisleri için bu tekniğin daha geniş dikkat mekanizması ailesindeki ilişkili kavramlardan nasıl ayrıldığını anlamak çok önemlidir:
- Öz Dikkat: Kusursuz bir küresel bağlam yakalamak için hesaplama maliyeti yüksek, tam O(N kare) softmax matrisini kullanan temel mekanizmadır.
- Flash Attention: Verileri GPU bellek katmanları arasında verimli biçimde taşıyarak tam O(N kare) öz dikkat matematiğini hızlandıran, G/Ç farkındalıklı bir optimizasyondur. Doğrusal dikkatin aksine Flash Attention, temel matematiksel formülü değiştirmez.
- Seyrek Dikkat: Ağın yalnızca komşu belirteçlerin yerel bir penceresine bakmasını zorunlu kılarak bellek tasarrufu sağlayan bir yöntemdir; doğrusal dikkat ise tüm küresel görünümü matematiksel olarak sabit bir duruma sıkıştırır.
Gerçek Dünya Uygulamaları#
Dizi uzunluğu sınırını aşan doğrusal ölçekleme, birden fazla yapay zekâ alanında güçlü olanaklar sunar:
- Doğal Dil İşleme (NLP): OpenAI gibi kuruluşların geliştirdiği Büyük Dil Modelleri (LLMs), devasa kod tabanlarını veya karmaşık hukuki belgeleri sorunsuz biçimde işleyebilir. Doğrusal ölçekleme, güçlü belge akıl yürütmesi için gereken büyük bağlam pencerelerini mümkün kılar.
- Yüksek Çözünürlüklü Bilgisayarlı Görü (CV): Tıbbi görüntü analizi veya uydu görüntüsü analizi gibi karmaşık görevlerde gigapiksel görüntülerin düzleştirilmesi, çok uzun belirteç dizileri oluşturur. Doğrusal dikkat, modellerin önemli ayrıntıları yok eden agresif küçültme işlemlerine başvurmadan, yüksek çözünürlüklü girdiler üzerinde doğrudan ayrıntılı görüntü segmentasyonu yapmasını sağlar.
Kod Örneği#
PyTorch ve TensorFlow gibi modern çerçeveler, bu matematiksel kavramların uygulanmasını kolaylaştırır. Aşağıda, doğrusal dikkatin O(N) verimliliği elde etmek için matris çarpımının sırasını nasıl değiştirdiğini gösteren kavramsal bir PyTorch kod parçası yer alıyor.
import torch
import torch.nn as nn
import torch.nn.functional as F
class SimpleLinearAttention(nn.Module):
def __init__(self, dim):
super().__init__()
self.qkv = nn.Linear(dim, dim * 3)
def forward(self, x):
# x shape: (Batch, Sequence Length, Channels)
q, k, v = self.qkv(x).chunk(3, dim=-1)
# Apply an activation function as a kernel approximation (replaces softmax)
q = F.elu(q) + 1.0
k = F.elu(k) + 1.0
# Associative trick: Multiply Key and Value first (O(N) complexity)
# k^T @ v yields a fixed (Batch, Channels, Channels) matrix
kv_context = torch.matmul(k.transpose(-2, -1), v)
# Multiply Query by the fixed context matrix to get the final output
return torch.matmul(q, kv_context)
# Example: Processing a sequence of 1024 tokens
model = SimpleLinearAttention(dim=64)
dummy_input = torch.randn(1, 1024, 64)
output = model(dummy_input)
print(f"Output shape: {output.shape}")Deneysel topluluk modelleri çeşitli doğrusal veya seyrek dikkat katmanları içerebilir; ancak bu modeller genellikle yavaş CPU performansı veya eğitim kararsızlığı sorunları yaşayabilir. Sağlam ve üretime hazır bilgisayarlı görü dağıtımları için Ultralytics YOLO26 önerilen standarttır. Kritik nesne algılama görevlerinde ağır dikkat katmanlarına ihtiyaç duymadan hız ve doğruluğu en üst düzeye çıkaran, uçtan uca çalışan ve yüksek düzeyde optimize edilmiş bir mimariye sahiptir. Geliştiriciler, kapsamlı Ultralytics Platform aracılığıyla bu üst düzey modeller için veri kümelerini kolayca etiketleyebilir, modelleri eğitebilir, dağıtabilir ve izleyebilir.









