Visual Question Answering (VQA)
CV ve NLP'nin kesişimindeki Görsel Soru Yanıtlamayı (VQA) keşfet. Ultralytics YOLO26'nın gerçek zamanlı uygulamalar ve çok modlu yapay zekâ için VQA'yı nasıl güçlendirdiğini öğren.
Görsel Soru Yanıtlama (VQA), Bilgisayarlı Görü (CV) ile Doğal Dil İşleme (NLP) kesişiminde yer alan gelişmiş bir yapay zekâ görevidir. Bir görüntüye tek bir etiket atayan geleneksel görüntü sınıflandırmanın aksine VQA sistemleri, bir görüntünün görsel içeriği hakkında açık uçlu doğal dil sorularını yanıtlamak üzere tasarlanmıştır. Örneğin, bir mutfak fotoğrafı verildiğinde kullanıcı "Ocak açık mı?" veya "Kâsede kaç elma var?" diye sorabilir. Modelin doğru yanıt verebilmesi için metnin anlamını kavraması, sahnedeki ilgili nesneleri belirlemesi ve bunların öznitelikleri ile uzamsal ilişkileri hakkında akıl yürütmesi gerekir.
Bu yetenek, farklı veri türlerinin eş zamanlı olarak işlenmesini gerektirdiği için VQA'yı modern çok modlu yapay zekânın temel bileşenlerinden biri hâline getirir. Mimari genellikle görüntüden öznitelikleri çıkarmak için Evrişimli Sinir Ağı (CNN) veya Görsel Transformer (ViT) gibi bir görme kodlayıcısı ve dilbilimsel sorguyu işlemek için bir metin kodlayıcısı içerir. Gelişmiş sistemler, metinsel kavramları görüntünün belirli bölgeleriyle hizalamak için bir dikkat mekanizmasından yararlanır; bu da yapay zekânın yanıt oluşturmadan önce fotoğrafın ilgili kısımlarına "bakmasını" sağlar.
Gerçek Dünya Uygulamaları ve Önemi#
Görsel verilere dinamik olarak sorgu gönderilebilmesi, otomasyonu ve erişilebilirliği artırarak çeşitli sektörlerde dönüştürücü uygulamaların ortaya çıkmasını sağlamıştır.
- Yardımcı Teknolojiler: VQA, görme engelli bireyleri destekleyen uygulamalar için hayati önem taşır. Be My Eyes gibi araçlar, kullanıcıların çevrelerinin fotoğrafını çekip "Bu şişede şampuan mı yoksa saç kremi mi var?" veya "Karşıya geçmek güvenli mi?" gibi sorular sormalarını sağlamak için VQA'dan yararlanabilir. Bu, görsel bilgiyi sesli yanıtlara dönüştürerek daha fazla bağımsızlığı destekler.
- Tıbbi Teşhis: Sağlık hizmetlerinde yapay zekâ alanında VQA sistemleri, tıbbi görüntüleri analiz ederek radyologlara yardımcı olur. Bir sağlık uzmanı, bir röntgen hakkında "Sol üst kadranda kırık olduğuna dair bulgu var mı?" gibi sorularla sistemi sorgulayabilir. Ulusal Sağlık Enstitüleri (NIH) bünyesindeki araştırmacılar, klinik karar alma süreçlerini kolaylaştırmak ve teşhis hatalarını azaltmak için VQA'yı incelemiştir.
- Akıllı Güvenlik Gözetimi: Modern güvenlik sistemleri, saatler süren video kayıtlarını taramak için güvenlikte yapay zekâdan yararlanır. Operatörler manuel inceleme yapmak yerine "Gece yarısından sonra yükleme rampasına kırmızı bir kamyon girdi mi?" diye sorabilir. VQA, genel hareket uyarıları yerine belirli ölçütlere dayalı hızlı anomali tespiti sağlar.
VQA'da Nesne Tespitinin Rolü#
Bazı VQA modelleri uçtan uca eğitilirken birçok model, önce sahne öğelerini belirlemek için sağlam bir [nesne tespiti](https://ultralytics-translation-0.invalid omurgasına dayanır. Nesnelerin doğru şekilde konumlandırılması, akıl yürütme motoru için gerekli bağlamı sağlar. Ultralytics YOLO26 modeli, yüksek doğruluğu ve gerçek zamanlı performansı sayesinde bu işlem hatları için mükemmel bir temel oluşturur.
Örneğin geliştiriciler, nesne sınıflarını ve sınırlayıcı kutuları çıkarmak için YOLO26 kullanabilir; bu bilgiler daha sonra kullanıcı sorgularını yanıtlamak üzere bir Büyük Dil Modeline (LLM) veya uzmanlaşmış bir akıl yürütme modülüne aktarılır. Bu tespit omurgalarını eğitmek için kullanılan veri kümelerinin yönetimi, açıklama ekleme ve bulut eğitimi süreçlerini basitleştiren Ultralytics Platformu ile çoğu zaman kolaylaştırılır.
Aşağıdaki Python örneği, bir VQA iş akışındaki temel adım olan görsel bağlamı (nesneleri ve konumlarını) bir görüntüden çıkarmak için Ultralytics YOLO26'nın nasıl kullanılacağını gösterir:
from ultralytics import YOLO
# Load the YOLO26 model (latest generation)
model = YOLO("yolo26n.pt")
# Run inference to detect objects, providing context for VQA
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display detected classes (e.g., 'bus', 'person') to verify scene understanding
for result in results:
result.show() # Visualize the detectionsVQA'yı İlgili Kavramlardan Ayırt Etme#
VQA'nın kendine özgü kapsamını anlamak için onu benzer görme-dil görevlerinden ayırmak faydalıdır.
- VQA ve Görüntü Açıklama: Görüntü açıklama, bir görüntünün tamamına ilişkin genel ve sabit bir açıklama üretir (ör. "Parkta oynayan bir köpek"). VQA ise etkileşimli ve özeldir; geniş kapsamlı bir özet yerine kullanıcının sorusuna yönelik bir yanıt sunar.
- VQA ve Görsel Temellendirme: Görsel temellendirme, bir metin ifadesinde bahsedilen belirli bir nesneyi çevresine [sınırlayıcı kutu](https://ultralytics-translation-1.invalid çizerek konumlandırmaya odaklanır. VQA ise bulunan nesnelerin özniteliklerini, eylemlerini veya miktarlarını analiz ederek bunun ötesine geçer.
- VQA ve OCR: Optik Karakter Tanıma (OCR) yalnızca görüntülerden metin çıkarmaya yönelikken VQA, "Sokak tabelasında ne yazıyor?" gibi soruları yanıtlamak için OCR'ı kullanabilir. Bununla birlikte VQA'nın temel işlevi, yalnızca metin okumaktan daha kapsamlı bir sahne anlayışını içerir.
Araştırmacılar, modellerin milyonlarca görüntü-soru çifti genelinde genelleme yapmasına yardımcı olan VQA Veri Kümesi gibi büyük ölçekli kıyaslamaları kullanarak alanı geliştirmeye devam ediyor. Donanım geliştikçe ve daha hızlı çıkarım gecikmesini mümkün kıldıkça VQA, gerçek zamanlı mobil ve uç uygulamalar için giderek daha uygulanabilir hâle geliyor.









