Prompt Caching
İstem önbelleklemenin gecikmeyi ve maliyetleri azaltarak üretken AI'ı nasıl optimize ettiğini keşfet. Ultralytics YOLO26 ile LLM'lerdeki ve gerçek zamanlı bilgisayarlı görüdeki rolünü öğren.
Prompt önbellekleme (prompt caching), çıkarım sırasında maliyetleri önemli ölçüde azaltmak ve yanıt sürelerini iyileştirmek için öncelikle üretken yapay zekada (generative AI) kullanılan gelişmiş bir optimizasyon stratejisidir. Büyük Dil Modelleri (LLMs) alanında, metin işleme, girdilerin token'lar (tokens) olarak bilinen sayısal dizilere dönüştürülmesini gerektirir. Çoğu zaman, ayrıntılı bir sistem talimatı, uzun bir yasal belge veya bir kod tabanı gibi girdi verilerinin büyük bir kısmı, birçok farklı kullanıcı sorgusu boyunca statik kalır. Bu değişmeyen bölümleri her yeni istek için yeniden işlemek yerine, prompt önbellekleme, önceden hesaplanmış matematiksel durumları (genellikle Anahtar-Değer önbelleği veya Key-Value cache olarak adlandırılır) bellekte saklar. Bu, çıkarım motorunun (inference engine) gereksiz hesaplamaları atlamasını sağlayarak hesaplama gücünü yalnızca kullanıcı prompt'unun yeni ve dinamik kısımlarına odaklamasına olanak tanır.
Mekanizmalar ve Avantajlar#
Prompt önbelleklemenin temel mekanikleri, verileri sırayla işleyen Transformer'ların (Transformers) mimarisine dayanır. Sistem, bir prompt'un tekrarlayan önekini (prefix) belirleyerek, karşılık gelen dikkat mekanizması (attention mechanism) durumlarını doğrudan yüksek hızlı bellekten yükleyebilir.
- Azaltılmış Gecikme: Önbellekleme, çıkarım gecikmesini (inference latency), özellikle de İlk Token'a Kadar Geçen Süreyi (TTFT) önemli ölçüde düşürür. Bu, etkileşimli sohbet botları (chatbots) gibi gerçek zamanlı uygulamaların kullanıcı için anında gerçekleşiyor gibi hissettirmesini sağlar.
- Maliyet Verimliliği: Bulut Bilişim (Cloud Computing) sağlayıcıları genellikle hesaplama süresine veya token işlemeye göre faturalandırma yaptığından, statik bağlam için ağır işlerin atlanması büyük tasarruflar sağlar.
- Artırılmış Verimlilik (Throughput): GPU kaynaklarını serbest bırakarak sunucular, daha yüksek hacimli eşzamanlı istekleri işleyebilir ve bu da tüm model sunumu (model serving) altyapısını daha ölçeklenebilir hale getirir.
Gerçek Dünya Uygulamaları#
İstem önbellekleme, yoğun veri bağlamına dayanan endüstrileri dönüştürüyor.
-
Kodlama Asistanları: Yazılım geliştirmede, GitHub Copilot gibi araçlar kullanıcının açık dosyalarından ve depo yapısından elde edilen büyük miktarda bağlam kullanır. Model, kod tabanının gömme vektörlerini (embeddings) önbelleğe alarak, her tuş vuruşu için tüm proje dosya yapısını yeniden analiz etmeden gerçek zamanlı kod tamamlama önerileri sağlayabilir.
-
Yukuki ve Tıbbi Analiz: Profesyoneller genellikle içtihat arşivleri veya hasta geçmişi kayıtları gibi devasa statik belgeler üzerinde Yapay Zeka Aracılarına (AI Agents) sorgu atarlar. Sistem, Getirme Destekli Üretim (Retrieval-Augmented Generation - RAG) kullanarak metnin ilgili parçalarını getirir. Prompt önbellekleme, getirilen bu belgelerin temel bağlamının takip eden sorular için yeniden hesaplanmasının gerekmemesini sağlayarak Soru Cevaplama (Question Answering) iş akışını kolaylaştırır.
Bilgisayarlı Görüde Alaka Düzeyi#
Geleneksel olarak metinle ilişkilendirilmiş olsa da, önbellekleme kavramı çok modlu Bilgisayarlı Görü (Computer Vision - CV) alanında hayati önem taşır. YOLO-World gibi modeller, kullanıcıların serbest kelime dağarcıklı metin prompt'ları kullanarak nesneleri tespit etmesine olanak tanır. Bir kullanıcı bir sınıf listesi tanımladığında (örn. "person, backpack, car"), model bu sınıflar için metin gömme vektörlerini hesaplar. Bu gömme vektörlerini önbelleğe almak, modelin her bir video kare için metin prompt'larını yeniden kodlamasına gerek kalmasını önler ve yüksek hızda Gerçek Zamanlı Çıkarım (Real-Time Inference) sağlar.
İlgili Terimlerin Ayrıştırılması#
- Prompt Mühendisliğine (Prompt Engineering) Karşı:** Prompt mühendisliği, modele rehberlik edecek en uygun metin girişini tasarlamak için harcanan insan çabasını içerir. Prompt önbellekleme ise makinenin bu metni işlemesini saklayan arka uç bir hesaplama optimizasyonudur.
- Prompt Ayarlamaya (Prompt Tuning) Karşı:** Prompt ayarlama, bir modeli bir göreve uyarlamak için belirli Model Ağırlıklarını (Model Weights) (yumuşak prompt'lar) güncelleyen bir Aktarımlı Öğrenme (Transfer Learning) tekniğidir. Önbellekleme modelin parametrelerini değiştirmez; yalnızca çalışma zamanında aktivasyon durumlarını hatırlar.
Kod Örneği: Görüş Bağlamında Metin Gömülülerini Önbellekleme#
Aşağıdaki Python kod parçacığı, ultralytics paketini kullanarak bir görüntü bağlamında bir prompt'u "önbelleğe alma" kavramını gösterir. Sınıflar bir YOLO-World modelinde bir kez ayarlandığında, metin gömme vektörleri hesaplanır ve saklanır (kalıcı hale getirilir), bu da modelin metin açıklamasını yeniden işlemeden birden fazla görüntü üzerinde verimli bir şekilde tahmin yapmasını sağlar.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLOWorld("yolov8s-world.pt")
# "Cache" the prompt: Define classes once.
# The model computes and stores text embeddings for these specific terms.
model.set_classes(["helmet", "reflective vest", "gloves"])
# Run inference repeatedly. The text prompt is not re-computed for each call.
# This mimics the efficiency gains of prompt caching in LLMs.
results_1 = model.predict("construction_site_1.jpg")
results_2 = model.predict("construction_site_2.jpg")Veri kümelerini yönetmek ve bu optimize edilmiş modelleri dağıtmak için Ultralytics Platform; veri etiketleme, YOLO26 gibi son teknoloji modelleri eğitme ve çeşitli Edge AI cihazlarında dağıtım performansını izleme için kapsamlı bir ortam sağlar.






