Visual Reasoning
Yapay zekâda görsel akıl yürütmeyi keşfet ve modellerin mekânsal mantığı nasıl çıkarsadığını öğren. Ultralytics YOLO26 kullanarak gelişmiş akıl yürütme işlem hatlarının nasıl oluşturulacağını keşfet.
Yapay zekâda görsel akıl yürütme, bir modelin görsel ve uzamsal verileri analiz etme, yorumlama ve bunlardan mantıksal çıkarımlar yapma becerisini ifade eder. Standart bilgisayarlı görü (CV) sistemleri bir sahnede hangi nesnelerin bulunduğunu belirlemede başarılı olurken, görsel akıl yürütme bu nesnelerin nasıl ve neden etkileştiğini anlamak için bir adım daha ileri gider. İnsanların görsel akıl yürütme bilişsel yetisinden ilham alan ve standart bilişsel psikoloji testleriyle değerlendirilen bu beceri, AI modellerinin karmaşık görüntü analizleri gerçekleştirmesini, uzamsal ilişkileri çıkarsamasını ve yalnızca görsel bağlama dayanarak çok adımlı problemleri çözmesini sağlar. Bu, ham algı ile eyleme dönüştürülebilir zekâ arasındaki boşluğu çok modlu AI sistemlerinde kapatmak için kritik bir bileşendir.
Temel Kavramlar ve "Görüntülerle Düşünme" Paradigması#
Geçmişte makine öğrenimi modelleri, mantıksal çıkarım uygulamadan önce görüntü verilerini metne dönüştürüyordu. Ancak 2024 ve 2025'teki son gelişmeler, modellerin doğrudan görüntülerle düşündüğü bir paradigmayı yaygınlaştırdı. Gelişmiş görme-dil modelleri (VLMs), örtük görsel akıl yürütmeden yararlanarak bir sonuca varmadan önce, NIH Toolbox uzamsal parametrelerinde tanımlanan zihinsel bir haritayı insanın zihninde canlandırmasına benzer şekilde, ara görsel temsiller oluşturabilir.
Bu yaklaşım genellikle Multimodal Visualization-of-Thought (MVoT) olarak bilinen bir mekanizmadan yararlanır. Sistemler yalnızca metin tabanlı bir düşünce zincirine güvenmek yerine, geometrik değişiklikleri doğrulamak, örtülmeleri değerlendirmek ve 3B uzaydaki sürekli hareketleri izlemek için uzamsal görselleştirmeyle akıl yürütmeyi inceleyebilir.
Görsel Akıl Yürütme ve İlgili Beceriler#
Görsel akıl yürütmeyi, örtüşen diğer AI terminolojilerinden ayırmak yararlıdır:
- Akıl Yürütme Modelleri: Bu, genellikle metin, matematik veya kodlama alanlarında çok adımlı mantıksal çıkarım yapmak üzere tasarlanmış modelleri kapsayan daha geniş bir kategoridir. Görsel akıl yürütme, bu çıkarımsal ilkeleri özellikle görsel ve uzamsal verilere uygular.
- Görsel Soru Yanıtlama (VQA): VQA, AI'ın bir kullanıcının görüntü hakkındaki istemine doğal dilde yanıt verdiği belirli bir uygulama veya görevdir. Görsel akıl yürütme, VQA'yı destekleyen temel bilişsel beceridir ve modelin uzamsal bağlama dayanarak doğru yanıtı çıkarsamasını sağlar.
Gerçek Dünya Uygulamaları#
Uzamsal bağlamları dinamik biçimde yorumlama becerisi, fiziksel ve dijital alanlarda dönüştürücü etmen tabanlı iş akışlarının önünü açıyor.
- Robotikte AI ve Somutlaşmış Zekâ: Otonom etmenler ve robotik kollar, karmaşık ortamlarda yol alabilmek için gelişmiş uzamsal zekâya ihtiyaç duyar. Bir robot, görsel akıl yürütmeyi kullanarak kırılgan bir nesnenin ağır bir kutunun altında istiflendiği sonucuna varabilir ve dinamik fiziksel kısıtları değerlendirerek nesneyi hasara yol açmadan almak için mantıksal bir hareket dizisi planlayabilir.
- Sağlık Hizmetlerinde Tanı Amaçlı AI: Tıbbi görüntülemede uzmanlar, temel anomali tespitinin ötesine geçmek için görsel akıl yürütme sistemlerini kullanır. Modeller, cerrahi planlama için kritik geometrik bağlam sağlayarak 3B MRI taramalarını değerlendirebilir ve bir tümörün çevresindeki organlara göre büyüme seyrini yapısal olarak analiz edebilir.
Akıl Yürütme İş Akışları İçin Algılamayı Uygulama#
Etkili akıl yürütme sistemleri oluşturmak için geliştiriciler, fiziksel dünyadan yapısal bağlam çıkarmak üzere yüksek hızlı algılama modellerine güvenir. Ultralytics YOLO26, pikselleri hızla yapılandırılmış sınırlayıcı kutu koordinatlarına ve nesne sınıflarına dönüştüren güçlü bir temel katman görevi görür. Bu yapılandırılmış veriler, uzamsal mantığı değerlendirmek üzere PyTorch veya TensorFlow gibi framework'lerle oluşturulmuş özel görsel akıl yürütme motorlarına aktarılır.
Bu görev için YOLO26 ve YOLO11'i karşılaştırıyorsan, YOLO26'nın yerel uçtan uca mimarisi çıkarım gecikmesini en aza indirerek gerçek zamanlı mantıksal iş akışları için ideal hâle gelir.
Aşağıdaki Python kod parçacığı, uzamsal koordinatları çıkarmak için Ultralytics YOLO26'nın nasıl kullanılacağını ve sonraki uzamsal akıl yürütme için gereken temel algısal girdilerin nasıl sağlanacağını gösterir:
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model to act as the perception layer
model = YOLO("yolo26n.pt")
# Run inference to detect objects in a scene
results = model("https://ultralytics.com/images/bus.jpg")
# Extract structured spatial data for the visual reasoning engine
for result in results:
for box in result.boxes:
cls_name = model.names[int(box.cls)]
# xyxy provides exact spatial coordinates (left, top, right, bottom)
coords = box.xyxy[0].tolist()
print(f"Object: {cls_name}, Spatial Coordinates: {coords}")Bu karmaşık, çok modlu uygulamaları ölçeklendirmek için güçlü bir altyapı gerekir. Ultralytics Platform, uzamsal zekâ veri kümelerine sorunsuz biçimde açıklama eklemek, modelleri bulutta eğitmek ve güvenilir uç algılama sistemlerini dağıtmak için birleşik bir ortam sağlar. Alan, daha gelişmiş uzamsal görevler için etmen tabanlı framework'lere doğru ilerlerken ve gelişmiş görme araştırmaları tarafından desteklenirken, yüksek doğruluklu nesne algılamayı mantıksal çıkarımla birleştirmek yapay zekâdaki bir sonraki sınırı temsil eder.









