PagedAttention
PagedAttention'ın LLM bellek yönetimini ve KV önbelleği verimliliğini nasıl optimize ettiğini öğren. Verim üzerindeki etkisini ve Ultralytics YOLO26 performansıyla karşılaştırmasını keşfet.
PagedAttention, Büyük Dil Modellerinin (LLM'ler) çıkarım hızını ve işlem hacmini optimize etmek için tasarlanmış, son derece verimli bir bellek yönetimi algoritmasıdır. Geleneksel işletim sistemlerindeki sanal bellek ve sayfalama kavramlarından esinlenen bu teknik, metin üretimi sırasında anahtar-değer önbelleği (genellikle KV önbelleği olarak adlandırılır) ile ilişkili devasa bellek tüketimini ele alır. Önbellek için gereken kesintisiz bellek bloklarını daha küçük ve bitişik olmayan "sayfalara" bölerek PagedAttention, hem dahili hem de harici bellek parçalanmasını etkili biçimde ortadan kaldırır. Bu sayede AI sunucuları aynı anda çok daha fazla isteği toplu olarak işleyebilir ve GPU kullanımını en üst düzeye çıkarabilir.
PagedAttention ve Flash Attention karşılaştırması#
Her iki teknik de sinir ağı performansını optimize etse de farklı darboğazları hedefler. Flash Attention, GPU hiyerarşisi boyunca yavaş bellek okuma ve yazma işlemlerini en aza indirerek attention mekanizmasını hızlandıran, hesaplama düzeyinde bir optimizasyondur. Buna karşılık PagedAttention bir bellek ayırma stratejisidir. Yalnızca bağlam penceresi için belleğin nasıl yapılandırılıp depolandığına odaklanır ve büyük, verimsiz bellek bloklarını önceden ayırmadan dinamik ölçeklendirmeye olanak tanır.
Gerçek Dünya Uygulamaları#
PagedAttention'ın sağladığı bellek verimliliği, büyük ölçekli üretken modellerin üretim ortamlarında nasıl dağıtıldığını dönüştürdü.
-
Yüksek İşlem Hacimli API Sunumu: GPT-4 benzeri modeller sunan üretim sistemleri, vLLM gibi framework'ler aracılığıyla PagedAttention'dan yararlanır. Sağlayıcılar, farklı kullanıcı istekleri arasında bellek bloklarını paylaşarak aynı donanımda dört kata kadar daha fazla kullanıcıya hizmet verebilir ve bulut tabanlı AI hizmetlerini çalıştırma maliyetini büyük ölçüde azaltabilir.
-
Karmaşık Kod Çözme Stratejileri: Bir AI modeli aynı anda birden fazla olası yanıt ürettiğinde (beam search veya paralel örnekleme gibi), PagedAttention bu paralel dizilerin aynı temel bellek sayfalarını güvenli biçimde paylaşmasına olanak tanır. Bu, sistemin gereksiz belleği çoğaltmasını önleyerek karmaşık akıl yürütme görevlerini önemli ölçüde hızlandırır.
Bilgisayarlı Görüde Bellek Verimliliği#
PagedAttention öncelikle doğal dil işleme alanında kullanılsa da katı bellek optimizasyonuna dayanan temel ilke bilgisayarlı görüde (CV) de aynı derecede kritiktir. Modelleri kaynakları kısıtlı uç cihazlarda dağıtırken bellek şişmesini önlemek zorunludur. Ultralytics YOLO26, uçtan uca, NMS içermeyen bir mimariden yararlanarak ağır önbellek yönetimi ihtiyacını ortadan kaldırır ve yerel olarak gerçek zamanlı çıkarım verimliliği sağlar.
Nesne algılama işlem hatlarının bellek ve dışa aktarma gereksinimlerini sorunsuz biçimde yönetmek isteyen geliştiriciler için Ultralytics Platform, modelleri optimum donanım yürütmesi için paketleyen otomatik dağıtım araçları sunar.
Kod Örneği#
PagedAttention, sunum framework'lerinde arka planda çalışarak standart attention işlevlerinin yerini optimize edilmiş CUDA çekirdekleriyle doldurur. Aşağıda, vLLM gibi sistemlerin model dağıtımı sırasında sayfalama kullanarak otomatik olarak yakalayıp optimize ettiği standart attention'ın PyTorch içinde nasıl tanımlanabileceğini gösteren kavramsal bir örnek yer alır.
import torch
import torch.nn.functional as F
# Simulated Key, Query, and Value tensors for a standard attention block
batch_size, num_heads, sequence_length, head_dim = 1, 8, 1024, 64
query = torch.randn(batch_size, num_heads, sequence_length, head_dim)
key = torch.randn(batch_size, num_heads, sequence_length, head_dim)
value = torch.randn(batch_size, num_heads, sequence_length, head_dim)
# Standard attention computation (often replaced by PagedAttention kernels in production LLM servers)
attention_output = F.scaled_dot_product_attention(query, key, value)
print(f"Computed attention shape: {attention_output.shape}")Gelişmiş bellek ayırma stratejilerinden yararlanan AI sektörü, mümkün olanın sınırlarını zorlamaya devam ederek devasa temel modellerin dünya genelinde verimli biçimde ölçeklenmesini ve bunlara erişilmesini sağlıyor.









