YOLO Vision 2026:
Yapay Zeka Görüşü

Görsel dil modellerini ve uygulamalarını anlama

Görsel dil modelleri hakkında bilgi edin, nasıl çalıştıklarını ve yapay zekadaki çeşitli uygulamalarını öğren. Bu modellerin görsel ve dil yeteneklerini nasıl birleştirdiğini keşfet.

ABAbirami Vina6 min read
Görüntü ve metin anlayışını birleştiren görsel dil modelleri

Önceki bir makalede, GPT-4o modelinin kelimeleri kullanarak görüntüleri nasıl anlayıp tanımlayabileceğini inceledik. Bu yeteneği Google Gemini ve Claude 3 gibi diğer yeni modellerde de görüyoruz. Bugün, Görsel Dil Modellerinin (Vision Language Models) nasıl çalıştığını ve görsel ile metinsel verileri nasıl birleştirdiğini açıklamak için bu konuyu daha derinlemesine ele alıyoruz.

Bu modeller, fotoğraflar için ayrıntılı altyazılar oluşturma, görüntüler hakkında soruları yanıtlama ve hatta metinsel açıklamalara dayalı yeni görsel içerikler yaratma gibi bir dizi etkileyici görevi yerine getirmek için kullanılabilir. Görüntü Dili Modelleri, görsel ve dilsel bilgileri sorunsuz bir şekilde entegre ederek teknolojiyle etkileşim kurma ve dünyayı anlama biçimimizi değiştiriyor.

Görüntü dili modelleri nasıl çalışır?#

Görüntü Dili Modellerinin (VLM) nerelerde kullanılabileceğine bakmadan önce, ne olduklarını ve nasıl çalıştıklarını anlayalım. VLM'ler, hem görüntüleri hem de metinleri işlemek için vizyon ve dil modellerinin yeteneklerini birleştiren gelişmiş yapay zeka modelleridir. Bu modeller, resimleri metinsel açıklamalarıyla birlikte alır ve ikisi arasında bağlantı kurmayı öğrenir. Modelin vizyon kısmı görüntülerdeki ayrıntıları yakalarken, dil kısmı metni anlar. Bu ekip çalışması, VLM'lerin hem görüntüleri hem de metinleri anlayıp analiz etmesini sağlar.

İşte Görüntü Dili Modellerinin temel yetenekleri:

  • Görüntü Altyazılama (Image Captioning): Görüntülerin içeriğine dayalı açıklayıcı metinler oluşturma.
  • Görsel Soru Cevaplama (VQA): Bir görüntünün içeriğiyle ilgili soruları yanıtlama.
  • MetindenGörsel Üretimine: Metinsel açıklamalara dayanarak görüntüler oluşturma.
  • Görüntü-Metin Erişimi: Belirli bir metin sorgusu için ilgili görüntüleri bulma ve bunun tersi.
  • Çok Modlu İçerik Oluşturma: Yeni içerik oluşturmak için görüntüleri ve metinleri birleştirme.
  • Sahne Anlama veNesne Tespiti: Bir görüntünün içindeki nesneleri ve ayrıntıları tanımlama ve sınıflandırma.

Bir görsel dil modelinin yeteneklerinin örneği

Şekil 1. Bir görsel dil modelinin yeteneklerine bir örnek.

Şimdi, CLIP, SimVLM ve VisualGPT gibi bilinen modeller tarafından kullanılan yaygın VLM mimarilerini ve öğrenme tekniklerini keşfedelim.

Karşılaştırmalı öğrenme (Contrastive learning)#

Karşılaştırmalı öğrenme, modellerin veri noktaları arasındaki farkları karşılaştırarak öğrenmelerine yardımcı olan bir tekniktir. Örneklerin birbirine ne kadar benzer veya farklı olduğunu hesaplar ve bu farkları ölçen karşılaştırmalı kaybı en aza indirmeyi amaçlar. Özellikle, etiketli örneklerden oluşan küçük bir kümenin modeli yeni, görülmemiş verileri etiketlemeye yönlendirdiği yarı denetimli öğrenmede kullanışlıdır. Örneğin, bir kedinin neye benzediğini anlamak için model, onu benzer kedi görüntüleri ve köpek görüntüleri ile karşılaştırır. Yüz yapısı, vücut büyüklüğü ve kürk gibi özellikleri tanımlayarak, karşılaştırmalı öğrenme teknikleri bir kedi ile köpek arasındaki farkı ayırt edebilir.

Karşılaştırmalı öğrenmenin nasıl çalıştığını gösteren şema

Şekil 2. Karşılaştırmalı öğrenme nasıl çalışır.

CLIP, metin açıklamalarını görsellerle eşleştirmek için karşılaştırmalı öğrenmeyi kullanan bir Görsel Dil Modeli'dir. Üç basit adımda çalışır. İlk olarak, modelin hem metni hem de görselleri anlayan kısımlarını eğitir. İkinci olarak, bir veri setindeki kategorileri metin açıklamalarına dönüştürür. Üçüncü olarak, belirli bir görsel için en iyi eşleşen açıklamayı belirler. Bu yöntem sayesinde CLIP modeli, özellikle eğitilmediği görevler için bile doğru tahminler yapabilir.

PrefixLM#

PrefixLM, modelleri eğitmek için kullanılan bir Doğal Dil İşleme (NLP) tekniğidir. Bir cümlenin bir kısmıyla (bir önek/prefix) başlar ve bir sonraki kelimeyi tahmin etmeyi öğrenir. Görüntü Dili Modellerinde PrefixLM, modelin bir görüntüye ve verilen bir metne dayanarak sonraki kelimeleri tahmin etmesine yardımcı olur. Bir görüntüyü küçük parçalara (patch) ayıran ve her birini görüntünün bir kısmını temsil edecek şekilde sırayla işleyen bir Vision Transformer (ViT) kullanır.

PrefixLM tekniği kullanılarak bir VLM eğitilmesine örnek

Şekil 3. PrefixLM tekniğini kullanan bir VLM'yi eğitme örneği.

SimVLM, PrefixLM öğrenme tekniğini kullanan bir VLM'dir. Önceki modellere kıyasla daha basit bir Transformer mimarisi kullanır ancak çeşitli testlerde daha iyi sonuçlar elde eder. Model mimarisi, bir transformer kodlayıcı (encoder) kullanarak görüntüleri metin önekleriyle ilişkilendirmeyi öğrenmeyi ve ardından bir transformer kod çözücü (decoder) kullanarak metin üretmeyi içerir.

Çapraz Dikkat (Cross-Attention) ile Çok Modlu Birleştirme#

Çapraz dikkat ile çok modlu birleştirme, önceden eğitilmiş bir Görüntü Dili Modelinin görsel verileri anlama ve işleme yeteneğini geliştiren bir tekniktir. Modele çapraz dikkat katmanları ekleyerek çalışır; bu da modelin aynı anda hem görsel hem de metinsel bilgilere odaklanmasını sağlar.

İşte nasıl çalıştığı:

  • Bir görüntüdeki önemli nesneler tanımlanır ve vurgulanır.
  • Vurgulanan nesneler, görsel bilgiyi modelin anlayabileceği bir formata dönüştüren bir görsel kodlayıcı tarafından işlenir.
  • Görsel bilgi, görüntüyü önceden eğitilmiş dil modelinin bilgisini kullanarak yorumlayan bir kod çözücüye aktarılır.

VisualGPT, bu teknikten yararlanan bir modele güzel bir örnektir. Modelin kaybolan gradyanlar (vanishing gradients) adı verilen yaygın bir sorundan kaçınmasına yardımcı olan kendi kendini yeniden canlandıran aktivasyon birimi (SRAU) adı verilen özel bir özellik içerir. Kaybolan gradyanlar, modellerin eğitim sırasında önemli bilgileri kaybetmesine neden olabilir, ancak SRAU modelin performansını güçlü tutar.

VisualGPT model mimarisinin şeması

Şekil 4. VisualGPT model mimarisi.

Görüntü dili modellerinin uygulamaları#

Görüntü Dili Modelleri çeşitli sektörlerde etki yaratıyor. E-ticaret platformlarını geliştirmekten interneti daha erişilebilir kılmaya kadar, VLM'lerin potansiyel kullanımları heyecan verici. Şimdi bu uygulamalardan bazılarını keşfedelim.

Ürün açıklamaları oluşturma#

İnternetten alışveriş yaparken her ürünün ayrıntılı açıklamalarını görürsünüz, ancak bu açıklamaları oluşturmak zaman alıcı olabilir. VLM'ler bu açıklamaların üretimini otomatize ederek süreci kolaylaştırır. Çevrim içi perakendeciler, Görsel Dil Modellerini kullanarak ürün görsellerinden doğrudan ayrıntılı ve doğru açıklamalar üretebilir.

Yüksek kaliteli ürün açıklamaları, arama motorlarının ürünleri açıklamada belirtilen belirli özelliklere göre tanımlamasına yardımcı olur. Örneğin, "uzun kollu" ve "pamuklu yaka" içeren bir açıklama, müşterilerin bir "uzun kollu pamuklu gömlek" ürününü daha kolay bulmasına yardımcı olur. Ayrıca müşterilerin istediklerini hızlı bir şekilde bulmalarını sağlar ve bu da satışları ve müşteri memnuniyetini artırır.

Yapay zeka tarafından oluşturulan bir ürün açıklaması örneği

Şekil 5. Yapay zeka tarafından oluşturulan bir ürün açıklamasına örnek.

BLIP-2 gibi üretken yapay zeka modelleri, ürün özelliklerini doğrudan görsellerden tahmin edebilen gelişmiş VLM'lerin örnekleridir. BLIP-2, e-ticaret ürünlerini doğru bir şekilde anlamak ve açıklamak için birkaç bileşen kullanır. Bir görsel kodlayıcı ile ürünün görsel yönlerini işleyerek ve anlayarak başlar. Ardından, sorgulayan bir transformer bu görsel bilgiyi belirli sorular veya görevler bağlamında yorumlar. Son olarak, bir büyük dil modeli ayrıntılı ve doğru ürün açıklamaları üretir.

İnterneti daha erişilebilir kılma#

Görsel Dil Modelleri, özellikle görme engelli bireyler için görüntü açıklaması (image captioning) yoluyla interneti daha erişilebilir hale getirebilir. Geleneksel olarak kullanıcıların web sitelerinde ve sosyal medyada görsel içeriğin açıklamalarını girmesi gerekir. Örneğin, Instagram'da bir gönderi paylaştığınızda ekran okuyucular için alternatif metin ekleyebilirsiniz. Ancak VLM'ler bu süreci otomatikleştirebilir.

Bir VLM, kanepede oturan bir kedi görüntüsü gördüğünde, "Kanepede oturan bir kedi" altyazısını oluşturabilir ve sahneyi görme engelli kullanıcılar için netleştirebilir. VLM'ler, birkaç görüntü-altyazı çiftinden öğrendikleri few-shot prompting ve karmaşık sahneleri mantıksal olarak parçalamalarına yardımcı olan chain-of-thought prompting gibi teknikler kullanır. Bu teknikler, oluşturulan altyazıları daha tutarlı ve ayrıntılı hale getirir.

Görsel açıklamaları oluşturmak için yapay zeka kullanma

Şekil 6. Görsel açıklamaları oluşturmak için yapay zeka kullanımı.

Bu doğrultuda, Google'ın Chrome'daki "Get Image Descriptions from Google" özelliği, alternatif metni olmayan görseller için otomatik olarak açıklama üretir. Yapay zeka tarafından üretilen bu açıklamalar, insanlar tarafından yazılanlar kadar ayrıntılı olmasa da yine de değerli bilgiler sunar.

Görüntü Dili Modellerinin faydaları ve sınırlamaları#

Görüntü Dili Modelleri (VLM), görsel ve metinsel verileri birleştirerek birçok avantaj sunar. Temel faydalardan bazıları şunlardır:

  • Daha İyi İnsan-Makine Etkileşimi: Sistemlerin hem görsel hem de metinsel girdileri anlayıp yanıt vermesini sağlayarak sanal asistanları, sohbet botlarını ve robotik sistemleri geliştirir.
  • Gelişmiş Tanı ve Analiz: Görüntüleri analiz ederek ve açıklamalar üreterek tıp alanına yardımcı olma, sağlık profesyonellerine ikinci görüşlerle destek olma ve anormallik tespiti sağlama.
  • Etkileşimli Hikaye Anlatımı ve Eğlence: Oyun ve sanal gerçeklikte kullanıcı deneyimlerini iyileştirmek için görsel ve metinsel girdileri birleştirerek ilgi çekici anlatılar oluşturur.

Etkileyici yeteneklerine rağmen, Görüntü Dili Modelleri belirli sınırlamalarla da gelir. VLM'ler söz konusu olduğunda aklınızda bulundurmanız gereken bazı noktalar şunlardır:

  • Yüksek Hesaplama Gereksinimleri: VLM'leri eğitmek ve devreye almak önemli ölçüde hesaplama kaynağı gerektirir, bu da onları maliyetli ve daha az erişilebilir kılar.
  • Veri Bağımlılığı ve Önyargı: VLM'ler, çeşitlilik içermeyen veya önyargılı veri kümeleri üzerinde eğitilirlerse önyargılı sonuçlar üretebilirler, bu da klişeleri ve yanlış bilgileri sürdürebilir.
  • Sınırlı Bağlam Anlama: VLM'ler büyük resmi veya bağlamı anlamakta zorlanabilir ve aşırı basitleştirilmiş veya yanlış çıktılar üretebilir.

Öne çıkanlar#

Görsel Dil Modelleri, e-ticaret ve sağlık gibi birçok alanda inanılmaz bir potansiyele sahiptir. Görsel ve metinsel verileri birleştirerek inovasyonu yönlendirebilir ve sektörleri dönüştürebilirler. Bununla birlikte, bu teknolojileri adil bir şekilde kullanılmalarını sağlamak için sorumlu ve etik bir şekilde geliştirmek esastır. VLM'ler gelişmeye devam ettikçe, görsel tabanlı arama ve yardımcı teknolojiler gibi görevleri iyileştirecektir.

Yapay zeka hakkında bilgi edinmeye devam etmek için topluluğumuzla bağlantı kur! İmalat ve sağlık gibi sektörlerde yenilikçi çözümler yaratmak için yapay zekayı nasıl kullandığımızı görmek üzere GitHub depomuzu incele. 🚀

Explore solutions

Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla