Vision Language Model (VLM)
Ultralytics ile Görü-Dil Modellerini (VLM) keşfet. Bilgisayarlı görü ile LLM'leri nasıl birleştirdiklerini ve Ultralytics YOLO26 kullanarak VQA ile açık sözcük dağarcıklı tespiti öğren.
Görü-Dil Modeli (VLM), hem görsel bilgileri (görüntü veya video) hem de metinsel bilgileri aynı anda işleyip yorumlayabilen bir yapay zekâ türüdür. Yalnızca piksel verilerine odaklanan geleneksel bilgisayarlı görü modellerinin veya yalnızca metni anlayan Büyük Dil Modellerinin (LLM'ler) aksine VLM'ler bu iki kiplik arasındaki boşluğu kapatır. Görüntü-metin çiftleri içeren devasa veri kümeleriyle eğitilen bu modeller, görsel özellikleri dilsel kavramlarla ilişkilendirmeyi öğrenir; böylece görüntüleri betimleyebilir, görsel sahneler hakkında soruları yanıtlayabilir ve hatta "gördüklerine" dayanarak komutları yerine getirebilir.
Görü-Dil Modelleri Nasıl Çalışır?#
VLM'ler temel olarak genellikle iki ana bileşenden oluşur: bir görü kodlayıcı ve bir metin kodlayıcı. Görü kodlayıcı, görüntüleri işleyerek özellik haritalarını ve görsel temsilleri çıkarırken metin kodlayıcı dilsel girdiyi işler. Bu farklı veri akışları, görsel ve metinsel bilgileri ortak bir gömme uzayında hizalamak için çapraz dikkati gibi mekanizmalarla birleştirilir.
2024 ve 2025'teki son gelişmeler, tek bir Transformer omurgasının her iki kipliği de işlediği daha birleşik mimarilere yöneldi. Örneğin Google PaliGemma 2 gibi modeller, bu akışları etkili biçimde bütünleştirmenin karmaşık akıl yürütme görevlerindeki performansı nasıl artırabileceğini gösteriyor. Bu hizalama, modelin bağlamı anlamasına olanak tanır; örneğin "apple" sözcüğünün bir market görüntüsünde meyveyi, bir logoda ise teknoloji şirketini ifade ettiğini ayırt edebilir.
Gerçek Dünya Uygulamaları#
Dünyayı hem görerek hem de dil aracılığıyla anlama becerisi, çeşitli sektörlerde farklı uygulamaların önünü açar:
- Görsel Soru Yanıtlama (VQA): VLM'ler, radyologlara yardımcı olmak için sağlık hizmetlerinde tanı süreçlerinde yoğun olarak kullanılır. Bir doktor sisteme "Bu röntgende kırık var mı?" diye sorabilir ve model tıbbi görüntüyü analiz ederek ön değerlendirme sunar; böylece tanı hataları azalır.
- Akıllı E-Ticaret Araması: Perakende ortamlarında VLM'ler, kullanıcıların doğal dildeki açıklamaları görsellerle birleştirerek ürün aramasını sağlar. Bir müşteri, bir ünlünün kıyafetinin fotoğrafını yükleyip "Bana bu desende ama mavi bir elbise bul" diyebilir; sistem de isabetli eşleşmeleri getirmek için anlamsal aramadan yararlanır.
- Otomatik Altyazı Oluşturma ve Erişilebilirlik: VLM'ler web'deki görüntüler için açıklayıcı alternatif metinleri otomatik olarak üretir ve ekran okuyucu kullanan görme engelli kullanıcılar için dijital içeriği daha erişilebilir hâle getirir.
VLM'leri Benzer Kavramlardan Ayırma#
Özel rollerini anlamak için VLM'leri diğer yapay zekâ kategorilerinden ayırmak yararlıdır:
- VLM ile LLM Karşılaştırması: Bir Büyük Dil Modeli (yalnızca metin kullanan GPT-4 sürümleri gibi) sadece metin verilerini işler. Yaratıcı öyküler veya kod üretebilse de bir görüntüyü "göremez". VLM, LLM'ye adeta göz kazandırır.
- VLM ile Nesne Tespiti Karşılaştırması: İlk YOLO sürümleri gibi geleneksel nesne tespiti modelleri, nesnelerin nerede olduğunu ve hangi sınıfa ait olduklarını belirler (ör. "Araba: %99"). VLM ise "yangın musluğunun yanına park etmiş kırmızı bir spor araba" gibi ilişkileri ve nitelikleri de anlayarak bunun ötesine geçer.
- VLM ile Çok Modlu Yapay Zekâ Karşılaştırması: Çok modlu yapay zekâ daha geniş kapsamlı bir terimdir. Tüm VLM'ler çok modlu olsa da (görü ile dili birleştirir), tüm çok modlu modeller VLM değildir; bazıları dil bileşeni içermeden ses ile metni (konuşmayı metne dönüştürme gibi) veya video ile sensör verilerini birleştirebilir.
YOLO ile Açık Kelime Dağarcıklı Tespit#
Modern VLM'ler, önceden tanımlanmış sınıflar yerine serbest biçimli metin istemleriyle nesne tespit edebildiğin "açık kelime dağarcıklı" tespiti mümkün kılar. Bu, yeniden eğitim gerektirmeden sınıfları dinamik olarak tanımlamaya olanak tanıyan Ultralytics YOLO-World gibi modellerin temel bir özelliğidir.
Aşağıdaki örnekte, metinle tanımlanan belirli nesneleri tespit etmek için ultralytics paketinin nasıl kullanılacağı gösteriliyor:
from ultralytics import YOLOWorld
# Görü-dil anlayışı olan bir modeli yükle
model = YOLOWorld("yolov8s-world.pt")
# Doğal dilde metin istemleriyle özel sınıflar tanımla
model.set_classes(["person wearing sunglasses", "red backpack"])
# Görüntüde metinle tanımlanan bu nesneleri bulmak için çıkarımı çalıştır
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Algılama sonuçlarını görüntüle
results[0].show()Zorluklar ve Geleceğe Yönelik Yaklaşımlar#
Güçlü olmalarına rağmen Görü-Dil Modelleri önemli zorluklarla karşılaşıyor. Başlıca sorunlardan biri halüsinasyondur; bu durumda model, görüntüde gerçekte bulunmayan nesneleri veya metinleri kendinden emin biçimde betimler. Araştırmacılar, temellendirme ve doğruluğu geliştirmek için İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF) gibi teknikler üzerinde etkin biçimde çalışıyor.
Bir diğer zorluk hesaplama maliyetidir. Bu devasa modelleri eğitmek için önemli miktarda GPU kaynağı gerekir. Ancak Ultralytics YOLO26 gibi verimli mimarilerin piyasaya sürülmesi, gelişmiş görü yeteneklerinin uç cihazlara taşınmasına yardımcı oluyor. İleride VLM'lerin robotik ajanlarda kritik bir rol oynayarak robotların karmaşık sözlü talimatlara göre gezinmesini ve nesneleri hareket ettirmesini sağlayacağını öngörüyoruz.
Kuramsal temelleri merak edenler için OpenAI'nin özgün CLIP makalesi, karşıt dil-görüntü ön eğitimi hakkında mükemmel bilgiler sunar. Ayrıca, bu mimarilerin hızla gelişimini takip etmek için CVPR konferans makalelerini izlemek önemlidir. Kendi görü modellerini eğitmeyi denemek için kolaylaştırılmış veri kümesi yönetimi ve model dağıtımı sunan Ultralytics Platform ürününden yararlanabilirsin.









