Spatial Intelligence
Uzamsal zekanın yapay zekanın 3D dünyayı algılamasını ve gezinmesini nasıl sağladığını keşfet. Ultralytics YOLO26 ve Ultralytics Platform ile uzamsal farkındalığı olan sistemler kurmayı öğren.
Mekansal zeka, bir yapay zeka sisteminin fiziksel dünyayı üç boyutta algılama, anlama ve bu dünyada gezinebilme yeteneğini ifade eder. Genellikle 2D görüntüleri statik anlık görüntüler olarak analiz eden geleneksel bilgisayarlı görüden farklı olarak mekansal zeka; derinlik, geometri, hareket ve dinamik bir ortamdaki nesneler arasındaki ilişkiler üzerine akıl yürütmeyi içerir. Makinelerin yalnızca pikselleri "görmesini" değil, aynı zamanda bir sahnenin fiziksel bağlamını kavramasını sağlayarak gerçek dünyayla daha etkili bir şekilde etkileşime girmelerine olanak tanır. Bu yetenek, dijital görsel veriler ile fiziksel eylem arasındaki köprü olup gelişmiş AI agents ve robotik sistemler için temel taşını oluşturur.
Mekansal Zekanın Temel Bileşenleri#
İnsan benzeri bir mekan anlayışına ulaşmak için, bir yapay zeka sistemi birbirine bağlı birçok teknolojiye ve kavrama dayanır.
- Derinlik Algısı ve 3B Yeniden Oluşturma: Sistemler, kameralardan gelen 2D girdileri 3B temsiliyetlere dönüştürmelidir. Monoküler derinlik tahmini gibi teknikler modellerin tek bir görüntüden mesafeyi tahmin etmesine olanak tanırken, 3D object detection bu alandaki öğelerin hacmini ve yönelimini belirlemeye yardımcı olur.
- SLAM (Eşzamanlı Konumlandırma ve Haritalama): Bu, bir robot veya drone gibi bir cihazın, içindeki kendi konumunu takip ederken bilinmeyen bir ortamın haritasını çıkarmasına olanak tanır. Modern yaklaşımlar genellikle değişen aydınlatma koşullarında dayanıklılığı artırmak için visual SLAM yöntemini derin öğrenmeyle bütünleştirir.
- Geometrik Akıl Yürütme: Algılamanın ötesinde sistem, bir bardağın masa üzerinde durduğunu veya geçmek için bir kapının açılması gerektiğini bilerek fiziksel kısıtlamaları anlamalıdır. Bu genellikle nesnelerin veya insan eklemlerinin yönelimini gerçek zamanlı olarak takip etmek için pose estimation kullanımını içerir.
- Somutlaştırılmış Yapay Zeka (Embodied AI): Bu kavram algıyı eylemle birbirine bağlar. Somutlaştırılmış bir ajan sadece gözlemlemez; tıpkı bir üretim hattında AI in robotics sistemlerinin işleyişine benzer şekilde hareketleri planlamak, engellerden kaçınmak ve nesneleri manipüle etmek için mekansal verileri kullanır.
Gerçek Dünya Uygulamaları#
Mekansal zeka, makinelerin karmaşık ortamlarda otonom bir şekilde çalışmasını sağlayarak endüstrileri dönüştürüyor.
- Otonom Robotik ve Lojistik: Depolamada robotlar; kalabalık koridorlarda gezinmek, object detection kullanarak belirli paketleri belirlemek ve bunları konveyörlere hassas bir şekilde yerleştirmek için mekansal zekayı kullanır. Öğeyi ezmeden güvenli bir kavrama sağlamak için kavrayıcıları ile kutu arasındaki mekansal ilişkiyi hesaplamaları gerekir.
- Artırılmış Gerçeklik (AR) ve Karma Gerçeklik: Akıllı gözlük gibi cihazlar, dijital içeriği fiziksel dünyaya sabitlemek için mekansal bilişimi kullanır. Örneğin bir AR bakım uygulaması, onarım talimatlarını doğrudan belirli bir motor parçasının üzerine yerleştirebilir. Bu, kullanıcı kafasını hareket ettirdiğinde grafikleri hizalanmış halde tutmak için hassas bir object tracking gerektirir.
Mekansal Zeka ve Bilgisayarlı Görü#
Yakından ilişkili olmakla birlikte, spatial intelligence vs. computer vision ayrımını yapmak faydalıdır. Computer Vision, dijital görüntülerden, videolardan ve diğer görsel girdilerden anlamlı bilgiler elde etmeye odaklanan daha geniş bir alandır. Sınıflandırma veya temel 2D algılama gibi görevleri içerir. Spatial Intelligence, özellikle mekan ve fizik boyutunu ekleyen bilgisayarlı görüünün uzmanlaşmış bir alt kümesi veya evrimidir. "Bu nesne nedir?" sorusundan (Görüü), "Bu nesne nerede, nasıl yönlendirilmiş ve onunla nasıl etkileşime geçebilirim?" sorularına (Mekansal Zeka) geçiş yapar.
Ultralytics ile Mekansal Farkındalığı Uygulama#
Geliştiriciler, Ultralytics Platform kullanarak mekansal zeka sistemlerinin temelini oluşturabilir. Mühendisler, Oriented Bounding Box (OBB) tespiti veya pose estimation gibi görevler üzerinde Ultralytics YOLO26 gibi modelleri eğiterek aşağı akış robotik veya AR uygulamalarına gerekli geometric verileri sağlayabilir.
İşte, 3D bir ortamdaki insan hareketini anlamada kritik bir adım olan pose estimation modeli kullanarak mekansal anahtar noktaları çıkarma konusunda basit bir örnek:
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect human keypoints
results = model("path/to/image.jpg")
# Access the keypoints (x, y coordinates and confidence)
for result in results:
# keypoints.xy returns a tensor of shape (N, 17, 2)
keypoints = result.keypoints.xy
print(f"Detected keypoints for {len(keypoints)} persons.")Vision Transformers (ViT) ve foundation models alanındaki son gelişmeler bu alanı daha da hızlandırarak sistemlerin kapsamlı bir yeniden eğitime gerek kalmadan farklı ortamlarda mekansal anlayışı genellemesine olanak tanımaktadır. Stanford's HAI ve Google DeepMind gibi grupların araştırmaları devam ettikçe, mekansal zekanın yeni nesil akıllı cihazlarda standart bir özellik haline gelmesini bekleyebiliriz.






