Visual Reasoning
Yapay zekada görsel akıl yürütmeyi keşfet ve modellerin uzamsal mantığı nasıl çıkardığını öğren. Ultralytics YOLO26 kullanarak gelişmiş akıl yürütme hatları oluşturmayı keşfet.
Yapay zekada görsel akıl yürütme, bir modelin görsel ve uzamsal verileri analiz etme, yorumlama ve bunlardan mantıksal çıkarımlar yapma yeteneğini ifade eder. Standart computer vision (CV) sistemleri bir sahnede hangi nesnelerin mevcut olduğunu belirlemede başarılı olsa da görsel akıl yürütme, bu nesnelerin nasıl ve neden etkileşim kurduğunu anlamak için bir adım daha ileri gider. İnsanların görsel akıl yürütme bilişsel yeteneğinden ilham alan ve standart bilişsel psikoloji testleri ile değerlendirilen bu yetenek, yapay zeka modellerinin karmaşık resim analizleri gerçekleştirmesini, uzamsal ilişkileri çıkarmasını ve yalnızca görsel bağlama dayanarak çok adımlı problemleri çözmesini sağlar. Multimodal AI sistemlerinde hammaddedeki algı ile eyleme dönüştürülebilir zeka arasındaki boşluğu kapatmak için kritik bir bileşendir.
Temel Kavramlar ve "Görüntülerle Düşünme" Paradigması#
Tarihsel olarak makine öğrenimi modelleri, mantıksal çıkarım uygulamadan önce görüntü verilerini metne dönüştürüyordu. Bununla birlikte, 2024 ve 2025 yıllarındaki son gelişmeler, modellerin doğası gereği görsellerle düşündüğü bir paradigma popüler hale getirdi. Gizli görsel akıl yürütmeden yararlanarak gelişmiş vision-language models (VLMs), NIH Toolbox uzamsal parametrelerinde tanımlandığı gibi bir insanın zihinsel bir haritayı nasıl görselleştirebileceğine benzer şekilde, bir sonuca varmadan önce ara görsel temsiller üretebilir.
Bu yaklaşım genellikle Multimodal Visualization-of-Thought (MVoT) olarak bilinen bir mekanizma kullanır. Yalnızca metne dayalı bir düşünce zincirine güvenmek yerine sistemler, 3B uzaydaki geometrik değişiklikleri doğrulamak, tıkanıklıkları değerlendirmek ve sürekli hareketleri takip etmek için uzamsal görselleştirme akıl yürütmesini keşfedebilir.
Görsel Akıl Yürütme ve İlgili Yetenekler#
Görsel akıl yürütmeyi diğer örtüşen yapay zeka terminolojilerinden ayırmak faydalıdır:
- Reasoning Models: Bu, tipik olarak metin, matematik veya kodlama alanında çok adımlı mantıksal çıkarım için tasarlanmış modelleri kapsayan daha geniş bir kategoridir. Görsel akıl yürütme, bu çıkarımsal ilkeleri özellikle görsel ve uzamsal verilere uygular.
- Visual Question Answering (VQA): VQA, bir yapay zekanın bir kullanıcının bir görüntü hakkındaki komutuna doğal dilde yanıt verdiği belirli bir uygulama veya görevdir. Görsel akıl yürütme, modelin uzamsal bağlama dayanarak doğru yanıtı çıkarmasına olanak tanıyarak VQA'ya güç veren temel bilişsel yetenektir.
Gerçek Dünya Uygulamaları#
Uzamsal bağlamları dinamik olarak yorumlama kapasitesi, fiziksel ve dijital alanlarda dönüştürücü agentic workflows süreçlerinin kilidini açmaktadır.
- AI In Robotics And Embodied Intelligence: Otonom ajanlar ve robotik kolların karmaşık ortamlarda gezinmek için gelişmiş uzamsal zekaya ihtiyacı vardır. Görsel akıl yürütmeyi kullanarak bir robot, kırılgan bir nesnenin ağır bir kutunun altında istiflendiğini çıkarabilir ve dinamik fiziksel kısıtlamaları değerlendirmeye büyük ölçüde güvenerek, zarar vermeden almak için bir hareket dizisini mantıksal olarak planlayabilir.
- AI In Healthcare Diagnostics: Tıbbi görüntülemede pratisyenler, temel anomaly detection sınırlarının ötesine geçmek için görsel akıl yürütme sistemleri kullanır. Modeller, cerrahi planlama için çok önemli bir geometrik bağlam sağlayarak bir tümörün çevre organlara göre büyüme yörüngesini yapısal olarak akıl yürütmek için 3B MR taramalarını değerlendirebilir.
Akıl Yürütme Hatları İçin Algının Uygulanması#
Etkili akıl yürütme sistemleri oluşturmak için geliştiriciler, fiziksel dünyadan yapısal bağlamı çıkarmak amacıyla yüksek hızlı algılama modellerine güvenir. Ultralytics YOLO26, pikselleri hızla yapılandırılmış bounding box koordinatlarına ve nesne sınıflarına dönüştüren güçlü bir temel katman görevi görür. Bu yapılandırılmış veriler daha sonra uzamsal mantığı değerlendirmek için PyTorch veya TensorFlow gibi çerçevelerle oluşturulmuş özel görsel akıl yürütme motorlarına beslenir.
Bu görev için YOLO26 ve YOLO11'i karşılaştırıyorsanız, YOLO26'nın yerel uçtan uca mimarisi çıkarım gecikmesini en aza indirerek gerçek zamanlı mantıksal boru hatları için ideal hale getirir.
Aşağıdaki Python kod parçacığı, alt akış uzamsal muhakemesi için gereken temel algısal girdileri sağlayarak uzamsal koordinatları çıkarmak üzere Ultralytics YOLO26'nın nasıl kullanılacağını gösterir:
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model to act as the perception layer
model = YOLO("yolo26n.pt")
# Run inference to detect objects in a scene
results = model("https://ultralytics.com/images/bus.jpg")
# Extract structured spatial data for the visual reasoning engine
for result in results:
for box in result.boxes:
cls_name = model.names[int(box.cls)]
# xyxy provides exact spatial coordinates (left, top, right, bottom)
coords = box.xyxy[0].tolist()
print(f"Object: {cls_name}, Spatial Coordinates: {coords}")Bu karmaşık, çok modlu uygulamaları ölçeklendirmek sağlam bir altyapı gerektirir. Ultralytics Platform; spatial intelligence veri kümelerini sorunsuz bir şekilde etiketlemek, bulutta modeller eğitmek ve güvenilir kenar algılama sistemleri dağıtmak için birleşik bir ortam sağlar. Alan, uzamsal görevler için gelişmiş agentic frameworks çözümlerine doğru ilerledikçe ve gelişmiş vizyon araştırmalarıyla desteklendikçe, yüksek doğruluklu object detection ile mantıksal çıkarımı birleştirmek yapay zekadaki bir sonraki sınırı temsil eder.






