Prompt Caching
İstem önbelleğe almanın gecikmeyi ve maliyetleri azaltarak üretken yapay zekâyı nasıl optimize ettiğini keşfet. LLM'lerdeki ve Ultralytics YOLO26 ile gerçek zamanlı bilgisayarlı görüdeki rolünü öğren.
Prompt önbelleğe alma, öncelikle üretken yapay zekâ alanında kullanılan ve çıkarım sırasında maliyetleri önemli ölçüde azaltırken yanıt sürelerini iyileştiren gelişmiş bir optimizasyon stratejisidir. Büyük Dil Modelleri (LLMs) alanında metin işlemek, girdilerin token'lar olarak bilinen sayısal dizilere dönüştürülmesini gerektirir. Ayrıntılı bir sistem talimatı, uzun bir hukuki belge veya bir kod tabanı gibi girdi verilerinin büyük bir bölümü, çoğu zaman birçok farklı kullanıcı sorgusunda sabit kalır. Her yeni istekte bu değişmeyen bölümleri yeniden işlemek yerine prompt önbelleğe alma, önceden hesaplanmış matematiksel durumları (genellikle Anahtar-Değer önbelleği olarak adlandırılır) bellekte depolar. Bu sayede çıkarım motoru yinelenen hesaplamaları atlayarak işlem gücünü yalnızca kullanıcının prompt'undaki yeni ve dinamik bölümlere odaklayabilir.
Mekanizmalar ve Faydalar#
Prompt önbelleğe almanın temel mekanizmaları, verileri sıralı olarak işleyen Transformer'lar mimarisine dayanır. Sistem, bir prompt'un yinelenen ön ekini belirleyerek ilgili dikkat mekanizması durumlarını doğrudan yüksek hızlı bellekten yükleyebilir.
- Azaltılmış Gecikme: Önbelleğe alma, özellikle İlk Token'a Kadar Geçen Süreyi (TTFT) olmak üzere çıkarım gecikmesini önemli ölçüde azaltır. Bu, etkileşimli sohbet botları gibi gerçek zamanlı uygulamaların kullanıcıya anında yanıt veriyormuş gibi hissettirmesini sağlar.
- Maliyet Verimliliği: Bulut Bilişim sağlayıcıları genellikle işlem süresine veya token işlemeye göre ücretlendirme yaptığından statik bağlam için gereken yoğun işlemleri atlamak önemli ölçüde tasarruf sağlar.
- Artırılmış İş Hacmi: GPU kaynaklarını serbest bırakan sunucular, daha yüksek hacimde eşzamanlı isteği işleyebilir ve böylece tüm model sunumu altyapısını daha ölçeklenebilir hâle getirir.
Gerçek Dünya Uygulamaları#
Prompt önbelleğe alma, yoğun veri bağlamına dayanan sektörleri dönüştürüyor.
-
Kodlama Asistanları: Yazılım geliştirmede GitHub Copilot gibi araçlar, kullanıcının açık dosyalarından ve depo yapısından büyük miktarda bağlam kullanır. Kod tabanının embedding'lerini önbelleğe alan model, her tuş vuruşunda projenin tüm dosya yapısını yeniden analiz etmeden gerçek zamanlı kod tamamlama önerileri sunabilir.
-
Hukuki ve Tıbbi Analiz: Uzmanlar, genellikle dava hukuku arşivleri veya hasta geçmişi kayıtları gibi büyük statik belgelere karşı Yapay Zekâ Ajanları ile sorgular gerçekleştirir. Getirme Destekli Üretim (RAG) kullanıldığında sistem, metnin ilgili parçalarını getirir. Prompt önbelleğe alma, getirilen belgelerin temel bağlamının takip soruları için yeniden hesaplanması gerekmediğinden Soru Yanıtlama iş akışını kolaylaştırır.
Bilgisayarlı Görüntülemedeki Önemi#
Geleneksel olarak metinle ilişkilendirilse de önbelleğe alma kavramı, çok modlu Bilgisayarlı Görü (CV) alanında hayati önem taşır. YOLO-World gibi modeller, kullanıcıların açık kelime dağarcığına sahip metin prompt'larını kullanarak nesneleri algılamasına olanak tanır. Kullanıcı bir sınıf listesi (ör. "kişi, sırt çantası, araba") tanımladığında model, bu sınıflar için metin embedding'lerini hesaplar. Bu embedding'lerin önbelleğe alınması, modelin her video karesi için metin prompt'larını yeniden kodlamasını önleyerek yüksek hızlı Gerçek Zamanlı Çıkarım sağlar.
İlişkili Terimleri Ayırt Etme#
- Prompt Mühendisliği ile Karşılaştırma: Prompt mühendisliği, modeli yönlendirmek üzere en uygun metin girdisini tasarlamak için insan emeği gerektirir. Prompt önbelleğe alma ise modelin bu metni işlemesini depolayan arka uç hesaplama optimizasyonudur.
- Prompt Ayarlama ile Karşılaştırma: Prompt ayarlama, bir modeli bir göreve uyarlamak amacıyla belirli Model Ağırlıklarını (yumuşak prompt'lar) güncelleyen bir Aktarım Öğrenimi tekniğidir. Önbelleğe alma modelin parametrelerini değiştirmez; yalnızca çalışma zamanındaki aktivasyon durumlarını hatırlar.
Kod Örneği: Görüntüde Metin Embedding'lerini Önbelleğe Alma#
Aşağıdaki Python kod parçacığı, ultralytics paketi kullanılarak görüntü bağlamında bir prompt'u "önbelleğe alma" kavramını gösterir. Sınıflar bir YOLO-World modelinde bir kez ayarlandığında metin embedding'leri hesaplanıp depolanır (kalıcı hâle getirilir); böylece model, metin açıklamasını yeniden işlemeden birden çok görüntü üzerinde verimli şekilde tahmin yapabilir.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLOWorld("yolov8s-world.pt")
# "Cache" the prompt: Define classes once.
# The model computes and stores text embeddings for these specific terms.
model.set_classes(["helmet", "reflective vest", "gloves"])
# Run inference repeatedly. The text prompt is not re-computed for each call.
# This mimics the efficiency gains of prompt caching in LLMs.
results_1 = model.predict("construction_site_1.jpg")
results_2 = model.predict("construction_site_2.jpg")Veri kümelerini yönetmek ve bu optimize edilmiş modelleri dağıtmak için Ultralytics Platformu, verileri açıklamak, YOLO26 gibi son teknoloji modelleri eğitmek ve çeşitli Edge AI cihazlarında dağıtım performansını izlemek üzere kapsamlı bir ortam sunar.









