Spatial Intelligence
Mekânsal zekânın yapay zekânın 3B dünyayı algılamasını ve içinde gezinmesini nasıl mümkün kıldığını keşfet. Ultralytics YOLO26 ve Ultralytics Platform ile mekânsal farkındalığa sahip sistemler oluşturmayı öğren.
Uzamsal zekâ, bir yapay zekâ sisteminin fiziksel dünyayı üç boyutlu olarak algılama, anlama ve bu dünyada yolunu bulma becerisini ifade eder. Çoğunlukla 2B görüntüleri statik anlık görüntüler olarak analiz eden geleneksel bilgisayarlı görünün aksine uzamsal zekâ, dinamik bir ortamda derinlik, geometri, hareket ve nesneler arasındaki ilişkiler hakkında akıl yürütmeyi içerir. Makinelerin yalnızca pikselleri "görmesini" değil, bir sahnenin fiziksel bağlamını kavramasını da sağlayarak gerçek dünyayla daha etkili etkileşim kurmalarına olanak tanır. Bu yetenek, dijital görsel veriler ile fiziksel eylem arasındaki köprüdür ve gelişmiş AI aracılarının ve robotik sistemlerin temelini oluşturur.
Uzamsal Zekânın Temel Bileşenleri#
İnsan benzeri bir uzam anlayışına ulaşmak için bir yapay zekâ sistemi, birbiriyle bağlantılı çeşitli teknoloji ve kavramlara dayanır.
- Derinlik Algılama ve 3B Yeniden Yapılandırma: Sistemler, kameralardan alınan 2B girdileri 3B temsillere dönüştürmelidir. Tek görüntüden derinlik tahmini gibi teknikler, modellerin tek bir görüntüden uzaklığı tahmin etmesini sağlarken 3B nesne algılama, bu uzamdaki nesnelerin hacmini ve yönelimini belirlemeye yardımcı olur.
- SLAM (Eşzamanlı Konumlandırma ve Haritalama): Bu teknoloji, robot veya drone gibi bir cihazın kendi konumunu takip ederken bilinmeyen bir ortamın haritasını çıkarmasını sağlar. Modern yaklaşımlar, değişen aydınlatma koşullarında dayanıklılığı artırmak için genellikle görsel SLAM yöntemini derin öğrenmeyle birleştirir.
- Geometrik Akıl Yürütme: Sistem, algılamanın ötesine geçerek fiziksel kısıtlamaları anlamalıdır; örneğin bir bardağın masanın üzerinde durduğunu veya geçmek için bir kapının açılması gerektiğini bilmelidir. Bu işlem, nesnelerin ya da insan eklemlerinin gerçek zamanlı olarak yönelimini takip etmek için genellikle poz tahminini içerir.
- Bedenlenmiş AI: Bu kavram, algıyı eyleme bağlar. Bedenlenmiş bir aracı yalnızca gözlem yapmaz; tıpkı bir üretim sahasında robotikte AI'ın işleyişine benzer şekilde hareketleri planlamak, engellerden kaçınmak ve nesneleri manipüle etmek için uzamsal verileri kullanır.
Gerçek Dünya Uygulamaları#
Uzamsal zekâ, makinelerin karmaşık ortamlarda otonom olarak çalışmasını sağlayarak endüstrileri dönüştürüyor.
- Otonom Robotik ve Lojistik: Depolarda robotlar, kalabalık koridorlarda yolunu bulmak, nesne algılama kullanarak belirli paketleri tanımlamak ve bunları konveyörlere hassas bir şekilde yerleştirmek için uzamsal zekâdan yararlanır. Ürünü ezmeden güvenli bir şekilde kavrayabilmek için kavrayıcıları ile kutu arasındaki uzamsal ilişkiyi hesaplamaları gerekir.
- Artırılmış Gerçeklik (AR) ve Karma Gerçeklik: Akıllı gözlükler gibi cihazlar, dijital içeriği fiziksel dünyaya sabitlemek için uzamsal bilişimi kullanır. Örneğin bir AR bakım uygulaması, onarım talimatlarını doğrudan belirli bir motor parçasının üzerine yerleştirebilir. Bunun için kullanıcı başını hareket ettirdikçe grafiklerin hizalı kalmasını sağlamak üzere hassas nesne takibi gerekir.
Uzamsal Zekâ ve Bilgisayarlı Görü Karşılaştırması#
Yakından ilişkili olsalar da uzamsal zekâ ile bilgisayarlı görü arasındaki farkı ayırt etmek yararlıdır. Bilgisayarlı Görü, dijital görüntülerden, videolardan ve diğer görsel girdilerden anlamlı bilgiler çıkarmaya odaklanan daha geniş bir alandır. Sınıflandırma veya temel 2B algılama gibi görevleri kapsar. Uzamsal Zekâ ise bilgisayarlı görünün, özellikle uzam ve fizik boyutlarını ekleyen uzmanlaşmış bir alt kümesi ya da gelişmiş biçimidir. "Bu nesne nedir?" (Görü) sorusundan "Bu nesne nerede, hangi yönde duruyor ve onunla nasıl etkileşim kurabilirim?" (Uzamsal Zekâ) sorusuna geçer.
Ultralytics ile Uzamsal Farkındalık Uygulama#
Geliştiriciler, Ultralytics Platform kullanarak uzamsal zekâ sistemlerinin temelini oluşturabilir. Ultralytics YOLO26 gibi modelleri Yönlendirilmiş Sınırlayıcı Kutu (OBB) algılama veya poz tahmini gibi görevler üzerinde eğiten mühendisler, alt düzey robotik ya da AR uygulamalarına gerekli geometrik verileri sağlayabilir.
Aşağıda, 3B bir uzamda insan hareketini anlamanın kritik bir adımı olan poz tahmini modeliyle uzamsal kilit noktalarının çıkarılmasına ilişkin basit bir örnek verilmiştir:
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect human keypoints
results = model("path/to/image.jpg")
# Access the keypoints (x, y coordinates and confidence)
for result in results:
# keypoints.xy returns a tensor of shape (N, 17, 2)
keypoints = result.keypoints.xy
print(f"Detected keypoints for {len(keypoints)} persons.")Görsel Transformer'lar (ViT) ve temel modellerdeki son gelişmeler, bu alanı daha da hızlandırarak sistemlerin kapsamlı yeniden eğitim olmadan farklı ortamlardaki uzamsal anlayışı genelleştirmesine olanak tanıyor. Stanford HAI ve Google DeepMind gibi grupların araştırmaları devam ederken uzamsal zekânın yeni nesil akıllı cihazlarda standart bir özellik hâline gelmesini bekleyebiliriz.









