Visual Prompting
Yapay zeka modellerini noktalar ve kutularla yönlendirmek için görsel yönlendirmeyi keşfet. Ultralytics YOLO ve SAM'in hassas segmentasyonu ve daha hızlı veri etiketlemeyi nasıl mümkün kıldığını öğren.
Görsel ipucu sağlama (visual prompting), kullanıcıların bir yapay zeka modelinin odağını bir görüntü içindeki belirli nesnelere veya bölgelere yönlendirmek için noktalar, sınırlayıcı kutular (bounding box'lar) veya karalamalar gibi uzamsal ya da görsel ipuçları sağladığı, bilgisayarlı görü alanında ortaya çıkan bir tekniktir. Birincil olarak metin açıklamalarına dayanan geleneksel prompt mühendisliği yaklaşımının aksine görsel ipucu sağlama, Yapay Zeka (AI) sistemleriyle çok daha hassas ve sezgisel bir etkileşim kurulmasını sağlar. Bu yöntem; kapsamlı bir yeniden eğitime veya büyük etiketli veri setlerine ihtiyaç duyulmadan segmentasyon ve tespit gibi görevleri gerçekleştirmek için modern temel modellerin (foundation models) yeteneklerinden yararlanır. Kullanıcılar, önemli olan noktayı etkili bir şekilde "işaretleyerek" genel amaçlı modelleri anında yeni görevlere uyarlayabilir ve insan niyeti ile makine algısı arasındaki boşluğu kapatabilir.
Görsel İsteme Mekanizmaları#
Özünde görsel ipucu sağlama, uzamsal bilgileri doğrudan modelin işleme hattına (pipeline) enjekte ederek çalışır. Bir kullanıcı bir nesneye tıkladığında veya bir kutu çizdiğinde, bu girdiler sinir ağının görüntü özellikleri ile entegre ettiği koordinat tabanlı gömmelere (embedding'ler) dönüştürülür. Bu süreç, modelin geometrik ipuçlarına dayanarak maskeler öngördüğü, Segment Anything Model (SAM) gibi interaktif mimariler için merkezidir.
Görsel istemenin esnekliği, çeşitli etkileşim türlerine olanak tanır:
- Nokta İstemleri: Kullanıcı, ilgilenilen nesneyi belirtmek için belirli bir piksele tıklar. Model daha sonra bu seçimi tüm nesne sınırlarına genişletir.
- Kutu İpuçları (Box Prompts): Bir sınırlayıcı kutu (bounding box) çizmek, kaba bir yerelleştirme sağlar ve modele o alan içinde kalan her şeyi segmentlere ayırması veya sınıflandırması için sinyal verir.
- Karalama İstemleri: Bir nesne üzerine çizilen serbest el çizgileri, nesnelerin örtüştüğü veya benzer dokulara sahip olduğu karmaşık sahneleri netleştirmeye yardımcı olabilir.
CVPR 2024 konferansında sunulan son araştırmalar, görsel ipucu sağlamanın veri etiketleme için gereken süreyi nasıl önemli ölçüde azalttığını vurgulamaktadır; çünkü insan etiketleyiciler, çokgenleri manuel olarak çizm yerine basit tıklamalarla model tahminlerini gerçek zamanlı olarak düzeltebilir.
Görsel İsteme ve Metin İsteme Karşılaştırması#
Her iki teknik de model davranışını yönlendirmeyi amaçlasa da görsel ipucu sağlamayı metin tabanlı yöntemlerden ayırmak önemlidir. Metinden görsele (Text-to-image) üretimi veya sıfır örnekli (zero-shot) tespit, anlamsal açıklamaları yorumlamak için doğal dil işlemeye (NLP) dayanır (ör. "kırmızı arabayı bul"). Ancak dil, kesin uzamsal konumları veya soyut şekilleri tanımlamak için belirsiz veya yetersiz olabilir.
Görsel ipucu sağlama, talimatı doğrudan piksel uzayında temellendirerek bu belirsizliği giderir. Örneğin tıbbi görüntü analizinde, bir radyoloğun şüpheli bir nodüle tıklaması, tam koordinatlarını ve düzensiz şeklini metin yoluyla tanımlamaya çalışmasından çok daha doğrudur. Çoğu zaman en güçlü iş akışları, metni anlamsal filtreleme için ve görsel ipuçlarını uzamsal kesinlik için kullanarak her iki yaklaşımı birleştirir; bu kavram çok modlu öğrenme (multi-modal learning) olarak bilinir.
Gerçek Dünya Uygulamaları#
Görsel istemenin uyarlanabilirliği, çeşitli endüstrilerde hızla benimsenmesine yol açmıştır:
- İnteraktif Tıbbi Teşhis: Doktorlar, MRI taramalarındaki tümörleri veya organları izole etmek için görsel ipucu sağlama araçlarını kullanır. Yalnızca ilgi alanına tıklayarak anında 3B hacimsel ölçümler üretebilir ve bu sayede kesin tümör tespiti ile cerrahi planlamaya yardımcı olabilirler.
- Akıllı Fotoğraf Düzenleme: Adobe Photoshop veya mobil uygulamalar gibi tüketici yazılımlarında görsel ipucu sağlama, "sihirli seç" araçlarına güç verir. Kullanıcılar, manuel maskeleme becerilerine ihtiyaç duymadan, arka planı kaldırmak veya hedefli filtreler uygulamak için temel örnek segmentasyonu (instance segmentation) teknolojilerinden yararlanarak bir kişiye veya nesneye dokunabilir.
- Robotik Manipülasyon: Roborikte Yapay Zeka (AI in Robotics) alanında robotlara, görsel bir arayüz aracılığıyla belirli öğeleri alması talimatı verilebilir. Bir operatör, robotun kamera akışındaki bir nesneye tıklayarak robotun kavrama koordinatlarına dönüştürdüğü görsel bir ipucu sağlar ve bu da depolarda insan döngüde (human-in-the-loop) otomasyonunu kolaylaştırır.
Ultralytics ile Uygulama#
Ultralytics ekosistemi, özellikle FastSAM ve SAM gibi modeller aracılığıyla görsel isteme iş akışlarını destekler. Bu modeller, geliştiricilerin segmentasyon maskelerini almak için nokta veya kutu koordinatlarını programatik olarak iletmelerine olanak tanır.
Aşağıdaki örnek, modele belirli koordinatlarda bulunan nesneyi segmentlere ayırmasını talimat vererek bir görüntüye nokta ipucu uygulamak için ultralytics paketinin nasıl kullanılacağını göstermektedir.
from ultralytics import SAM
# Load the Segment Anything Model (SAM)
model = SAM("sam2.1_b.pt")
# Apply a visual point prompt to the image
# The 'points' argument accepts [x, y] coordinates
# labels: 1 indicates a foreground point (include), 0 indicates background
results = model("https://ultralytics.com/images/bus.jpg", points=[[300, 350]], labels=[1])
# Display the segmented result
results[0].show()Model Çevikliğini Artırma#
Görsel ipucu sağlama, modellerin artık statik "kara kutular" olmaktan çıkıp etkileşimli araçlar haline geldiği "ipucu verilebilir" (promptable) bilgisayarlı görüye doğru bir geçişi temsil eder. Bu yetenek, modellerin kullanıcı geri bildirimlerini dahil ederek hızla geliştiği aktif öğrenme (active learning) döngüleri için çok önemlidir.
Bu yetenekleri üretime entegre etmek isteyen geliştiriciler için Ultralytics Platform, veri setlerini yönetmek ve dinamik girdileri işleyebilen modelleri dağıtmak için araçlar sunar. Araştırmalar ilerledikçe, görsel ipuçları ile büyük dil modelleri (LLM'ler) arasında daha da sıkı bir entegrasyon görmeyi bekliyoruz; bu da sistemlerin görsel girdileri şu anda metni işledikleri aynı akıcılıkla akıl yürütebilmesini sağlayacaktır.






