Image Captioning
Görüntü altyazısı oluşturma, görsel-dil modelleri kullanarak bir görüntünün doğal dille açıklamasını yazar. Kullanım alanlarını, sınırlamaları ve YOLO ile açıklamaların temellendirilmesini ele alır.
Görüntü açıklaması oluşturma, bir görüntünün doğal dilde açıklamasını otomatik olarak üreten bir yapay zekâ görevidir. Örneğin, bir sokak fotoğrafına “Bir şehir otobüsü kavşakta yayaların yanından geçiyor.” şeklinde bir açıklama üretilebilir. Bu görev, görsel algıyı dil üretimiyle birleştirir; dolayısıyla modelin önemli içerikleri tanıması, nesneler arasındaki ilişkileri anlaması ve bu bilgiyi açıkça ifade etmesi gerekir.
Açıklama oluşturma genellikle görsel ve metinsel veriler üzerinde çalışan bir görsel-dil modeli tarafından gerçekleştirilir. Elle yazılmış fotoğraf açıklamasından farklı olarak yapay zekâ tarafından oluşturulan açıklama, görüntü-metin çiftlerinden öğrenilen örüntülere dayalı bir tahmindir.
Görüntü Açıklaması Oluşturma Nasıl Çalışır?#
Bir görüntü açıklaması oluşturma sistemi genellikle birbirine bağlı iki aşamadan oluşur:
- Görsel kodlayıcı, pikselleri nesneleri, dokuları, konumları ve daha geniş sahne bilgilerini tanımlayan özellik temsillerine dönüştürür.
- Dil kod çözücü, bu görsel özellikleri bir sözcük dizisine dönüştürür.
Birçok sistemde Transformer kod çözücü kullanılır. Kod çözücü bir başlangıç belirteciyle başlar, sonraki belirteci tahmin eder, bunu diziye ekler ve bir bitiş belirteci üretinceye ya da uzunluk sınırına ulaşıncaya kadar tekrarlar. Belirteç belirteç ilerleyen bu sürece otoregresif üretim denir.
Kodlayıcı-kod çözücünün tüm döngüsü şöyle görünür:
Bir dikkat mekanizması, kod çözücünün her sözcüğü seçerken ilgili görüntü bölgelerine odaklanmasına yardımcı olur. “Otobüs” sözcüğünü üretirken aracı vurgulayabilir; “sokak” sözcüğünü üretirken çevresindeki yola yönelebilir. Eksiksiz bir görüntü altyazısı modeli, görüntü özelliklerini, belirteçlemeyi, çapraz dikkati ve bir metin kod çözücüyü birleştirir.
Eğitim için genellikle insan tarafından yazılmış bir veya daha fazla açıklamayla eşleştirilmiş görüntüler gerekir. Bir görüntü farklı şekillerde doğru biçimde açıklanabileceğinden birden fazla açıklama kullanışlıdır; örneğin “Bir köpekle oynayan çocuk” ve “Evcil hayvanına top atan genç biri”.
İlgili Görüntü Görevlerinden Farkları#
Görüntü açıklaması oluşturma, çeşitli yapay zekâ görevleriyle örtüşse de farklı bir çıktı üretir:
- Görüntü sınıflandırma, tüm görüntüye “plaj” gibi bir veya daha fazla etiket atar. Altyazı oluşturma ise nesneleri, eylemleri, nitelikleri ve bağlamı anlatabilecek bir cümle üretir.
- Nesne algılama, önceden tanımlanmış nesneleri sınırlayıcı kutularla belirler ve konumlarını saptar. Altyazı bu nesnelerden söz edebilir, ancak “İki bisikletli bir arabanın yanında ilerliyor” gibi aralarındaki ilişkileri de anlatır.
- Optik karakter tanıma, tabelalarda, belgelerde veya ambalajlarda görünen yazıları çıkarır. Açıklama, tüm metni yazıya dökmek yerine sahneyi özetler.
- Görsel soru yanıtlama, görüntüyle ilgili belirli bir soruyu yanıtlar. Açıklama oluşturma ise soru gerektirmeden genel bir betimleme üretir.
- Alternatif metin, bir görüntünün belirli bir bağlamdaki amacını aktarır. Otomatik açıklama bir taslak sunabilir ancak dekoratif, işlevsel ve karmaşık görüntüler W3C Görseller Öğreticisi uyarınca farklı biçimde ele alınması gerektiğinden otomatik olarak uygun bir alternatif metin sayılmaz.
Gerçek Dünya Uygulamaları#
-
Erişilebilir web içeriği: Bir yayın platformu, yeni yüklenen fotoğraflar için taslak açıklamalar oluşturabilir. Bir haber görselinin açıklaması, bir editör doğruluğunu ve uygunluğunu kontrol etmeden önce ana kişileri, ortamı ve eylemi belirtebilir. Karmaşık diyagramlar için genel bir görsel özet yerine yapılandırılmış, uzun bir açıklama gerekir.
-
Aranabilir medya kütüphaneleri: Bir perakendeci veya medya şirketi, büyük görüntü koleksiyonları için açıklamalar oluşturup üretilen metinleri dizine ekleyebilir. Böylece kullanıcılar dosyalar elle etiketlenmemiş olsa bile “çadırın yanında kırmızı sırt çantası” gibi ifadelerle arama yapabilir. Açıklamalar, görsel gömmeleri ve üst verileri tamamlayarak büyük kataloglardaki içeriklerin bulunmasını kolaylaştırabilir.
Ultralytics YOLO ile Pratik Görsel Temellendirme#
Açıklama oluşturucular, özellikle kalabalık veya alışılmadık sahnelerde desteklenmeyen ayrıntılar uydurabilir. Pratik tasarım seçeneklerinden biri, üretimi Ultralytics YOLO26 tarafından sağlanan yapılandırılmış gözlemlerle temellendirmektir. Belgelenmiş aşağıdaki YOLO tahmin iş akışı, sonraki bir dil bileşeninin görsel bağlam olarak kullanabileceği tespit edilmiş nesne adlarını çıkarır:
from ultralytics import YOLO
# Sonraki açıklama oluşturucuyu temellendirebilecek nesneleri tespit et
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Tespitleri kısa bir metinsel bağlama dönüştür
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)Bu iş akışı nihai açıklamayı üretmez. Bunun yerine, bir dil modelinin çıktılarını kısıtlayabilecek doğrulanabilir nesne etiketleri sağlar. Özel alanlar için Ultralytics Platform, açıklama oluşturma hattının algılama bileşenine yönelik bulut veri kümesi açıklama ekleme, eğitim, dağıtım ve izleme özellikleri sunar.
Sınırlamalar ve Değerlendirme#
Altyazılar önemli nesneleri atlayabilir, ilişkileri karıştırabilir, veri kümesi yanlılığını yeniden üretebilir veya görünmeyen ayrıntılar uydurabilir. Görüntü açıklama API'sinin döndürdüğü türden güven puanları, aday açıklamaları sıralamaya yardımcı olabilir; ancak akıcı bir cümle mutlaka gerçeğe uygun değildir.
Bu nedenle değerlendirmede nesne kapsamı, olgusal temellendirme, okunabilirlik, yanlılık ve hedef kitleye sağlanan fayda incelenmelidir. Birden fazla açıklama eşit derecede doğru olabileceğinden ekipler, üretken yapay zekâ değerlendirmesi ve daha kapsamlı NIST Yapay Zekâ Risk Yönetimi Çerçevesi gibi uygulamaları izleyerek otomatik ölçümleri insan incelemesiyle birleştirmelidir. Erişilebilirlik, tıp, güvenlik açısından kritik veya kamuya açık içeriklerde insan onayı özellikle önemini korur.










