Vision Language Model (VLM)
Ultralytics ile Görsel Dil Modellerini (VLM) keşfet. Ultralytics YOLO26 kullanarak VQA ve açık sözcüklü algılama için bilgisayarlı görü ve LLM'leri nasıl birleştirdiklerini öğren.
Görsel Dil Modeli (VLM), hem görsel bilgileri (görüntü veya video) hem de metinsel bilgileri aynı anda işleyip yorumlayabilen bir yapay zeka türüdür. Yalnızca piksel verilerine odaklanan geleneksel computer vision modellerinin veya yalnızca metni anlayan Large Language Models (LLMs) modellerinin aksine VLM'ler bu iki modalite arasındaki boşluğu doldurur. Görüntü-metin çiftleri içeren devasa veri kümeleri üzerinde eğitilen bu modeller, görsel özellikleri dilsel kavramlarla ilişkilendirmeyi öğrenerek görüntüleri tanımlamalarına, görsel sahneler hakkındaki soruları yanıtlamalarına ve hatta "gördüklerine" dayalı komutlar yürütmelerine olanak tanır.
Görüntü Dil Modelleri Nasıl Çalışır#
Özünde VLM'ler tipik olarak iki ana bileşenden oluşur: bir vizyon kodlayıcı ve bir metin kodlayıcı. Vizyon kodlayıcı feature maps ve görsel temsilleri çıkarmak için görüntüleri işlerken, metin kodlayıcı dilsel girdiyi işler. Bu farklı veri akışları daha sonra görsel ve metinsel bilgileri paylaşılan bir gömme alanında hizalamak için cross-attention gibi mekanizmalar kullanılarak birleştirilir.
2024 ve 2025 yıllarındaki son gelişmeler, tek bir transformer omurgasının her iki modaliteyi de işlediği daha birleşik mimarilere doğru hareket etmiştir. Örneğin, Google PaliGemma 2 gibi modeller, bu akışları entegre etmenin karmaşık akıl yürütme görevlerindeki performansı ne kadar etkili bir şekilde artırabileceğini göstermektedir. Bu hizalama, modelin "apple" kelimesinin bir bakkal görüntüsünde bir meyveyi, ancak bir logoda bir teknoloji şirketini ifade ettiğini tanımak gibi bağlamı anlamasını sağlar.
Gerçek Dünya Uygulamaları#
Dünyayı hem görme hem de dil yoluyla anlama yeteneği, çeşitli endüstrilerde farklı uygulamaların önünü açar:
- Görsel Soru Cevaplama (VQA): VLM'ler, radyologlara yardımcı olmak için healthcare diagnostics alanında yoğun olarak kullanılmaktadır. Bir doktor sisteme "Bu röntgende kırık var mı?" diye sorabilir ve model, ön değerlendirme sağlamak ve tanı hatalarını azaltmak için tıbbi görüntüyü analiz eder.
- Akıllı E-Ticaret Araması: retail environments içinde VLM'ler, kullanıcıların görüntülerle birleştirilmiş doğal dil açıklamalarını kullanarak ürün aramasına olanak tanır. Bir alışverişçi, ünlü bir kişinin kıyafetinin fotoğrafını yükleyebilir ve "Bana bu desende ama mavi renkte bir elbise bul" diyebilir; sistem ise doğru eşleşmeleri getirmek için semantic search kullanır.
- Otomatik Açıklama Ekleme ve Erişilebilirlik: VLM'ler, web üzerindeki görseller için otomatik olarak açıklayıcı alt text oluşturarak dijital içeriği ekran okuyuculara güvenen görme engelli kullanıcılar için daha erişilebilir hale getirir.
VLM'leri İlgili Kavramlardan Ayırma#
VLM'lerin özel rolünü anlamak için onları diğer yapay zeka kategorilerinden ayırmak faydalıdır:
- VLM ile LLM Karşılaştırması: Bir Large Language Model (GPT-4'ün yalnızca metin içeren sürümleri gibi) yalnızca metin verilerini işler. Yaratıcı hikayeler veya kodlar üretebilmesine rağmen bir görüntüyü "göremez". Bir VLM, etkili bir şekilde bir LLM'ye göz verir.
- VLM ile Nesne Tespiti Karşılaştırması: Erken YOLO sürümleri gibi geleneksel object detection modelleri, nesnelerin nerede olduğunu ve hangi sınıfa ait olduğunu tanımlar (örn. "Araba: %99"). Bir VLM, "yangın musluğunun yanına park edilmiş kırmızı bir spor araba" gibi ilişkileri ve öznitelikleri anlayarak daha da ileri gider.
- VLM ile Çok Modlu Yapay Zeka Karşılaştırması: Multimodal AI daha kapsamlı bir üst terimdir. Tüm VLM'ler çok modlu olsa da (görme ve dili birleştirir), tüm çok modlu modeller VLM değildir; bazıları dil bileşeni olmadan ses ve metni (konuşmadan metne gibi) veya video ve sensör verilerini birleştirebilir.
YOLO ile Açık Sözcüklü (Open-Vocabulary) Tespit#
Modern VLM'ler, önceden tanımlanmış sınıflar yerine serbest biçimli metin komut istemlerini kullanarak nesneleri tespit etmenize olanak tanıyan "açık kelime dağarcığı" tespitini mümkün kılar. Bu, yeniden eğitim gerektirmeden dinamik sınıf tanımlarına izin veren Ultralytics YOLO-World gibi modellerin temel bir özelliğidir.
Aşağıdaki örnek, metinle açıklanan belirli nesneleri tespit etmek için ultralytics paketinin nasıl kullanılacağını göstermektedir:
from ultralytics import YOLOWorld
# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])
# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()Zorluklar ve Gelecek Yönelimleri#
Güçlü olmalarına rağmen, Görsel Dil Modelleri önemli zorluklarla karşı karşıyadır. Başlıca sorunlardan biri, modelin bir görüntüde hiç olmayan nesneleri veya metinleri güvenle tanımladığı hallucination durumudur. Araştırmacılar, dayanağı ve doğruluğu iyileştirmek için Reinforcement Learning from Human Feedback (RLHF) gibi teknikler üzerinde aktif olarak çalışmaktadır.
Bir diğer zorluk ise hesaplama maliyetidir. Bu devasa modelleri eğitmek büyük ölçüde GPU resources gerektirir. Bununla birlikte, Ultralytics YOLO26 gibi verimli mimarilerin piyasaya sürülmesi, gelişmiş görüş yeteneklerini uç cihazlara getirmeye yardımcı olmaktadır. İlerledikçe VLM'lerin robotic agents içinde çok önemli bir rol oynamasını bekliyoruz; bu sayede robotlar karmaşık sözlü talimatlara dayanarak nesneleri yönlendirebilecek ve işleyebilecektir.
Teorik temellerle ilgilenenler için orijinal CLIP paper by OpenAI, karşılaştırmalı dil-görsel ön eğitime dair mükemmel bir bakış açısı sunar. Ek olarak, bu mimarilerin hızlı evrimini takip etmek için CVPR conference papers ile güncel kalmak esastır. Kendi vizyon modellerinizi eğiterek denemeler yapmak için, kolaylaştırılmış veri kümesi yönetimi ve model dağıtımı amacıyla Ultralytics Platform kullanabilirsiniz.






