3D Object Detection
Yapay zekâda uzamsal farkındalıkta uzmanlaşmak için 3B nesne algılamayı keşfet. Ultralytics YOLO26'nın gerçek dünyada derinlik, yönelim ve 3B sınırlayıcı kutu tahminini nasıl mümkün kıldığını öğren.
3B nesne algılama, makinelerin üç boyutlu bir alandaki nesneleri tanımlamasını, konumlandırmasını ve boyutlarını belirlemesini sağlayan gelişmiş bir bilgisayarlı görü görevidir. Bir görüntüdeki nesnenin etrafına düz bir sınırlayıcı kutu çizen geleneksel 2B nesne algılama yöntemlerinin aksine, 3B nesne algılama nesneyi kapsayan bir küboid (3B kutu) tahmin eder. Bu yöntem; kritik derinlik bilgileri, yönelim (istikamet) ve kesin uzamsal boyutlar sağlayarak sistemlerin yalnızca bir nesnenin ne olduğunu değil, gerçek dünyada sensöre göre tam olarak nerede bulunduğunu da anlamasına olanak tanır. Bu yetenek, çevreleriyle fiziksel olarak etkileşime girmesi gereken teknolojiler için temel öneme sahiptir.
3B Nesne Algılama Nasıl Çalışır#
Derinliği ve hacmi algılamak için 3B algılama modelleri genellikle standart kameraların sağladığından daha zengin veri girdilerine dayanır. Bazı gelişmiş yöntemler tek gözlü (tek mercekli) görüntülerden 3B yapıları çıkarabilse de en sağlam sistemlerin çoğu LiDAR sensörlerinden, radardan veya stereo kameralardan gelen verileri kullanır. Bu sensörler, nesnelerin dış yüzeyini temsil eden devasa veri noktası koleksiyonları olan nokta bulutları oluşturur.
Süreç birkaç temel adımdan oluşur:
- Veri Toplama: Sensörler sahnenin geometrisini yakalar. Örneğin LiDAR, mesafeleri ölçmek için lazer darbeleri kullanarak hassas bir 3B harita oluşturur.
- Özellik Çıkarma: Genellikle Evrişimli Sinir Ağları (CNN'ler) veya Transformers tabanlı derin öğrenme modelleri, kalıpları belirlemek için nokta bulutunu ya da birleştirilmiş görüntü verilerini işler.
- Sınırlayıcı Kutu Tahmini: Model, merkez koordinatları (x, y, z), boyutları (uzunluk, genişlik, yükseklik) ve dönme açısıyla (yaw) tanımlanan bir 3B sınırlayıcı kutu çıktısı verir.
- Sınıflandırma: Görüntü sınıflandırmaya benzer şekilde sistem, algılanan nesneye bir etiket (ör. "yaya", "araç") atar.
2B ve 3B Algılama Arasındaki Fark#
Bu iki ilişkili kavramı birbirinden ayırmak önemlidir.
- 2B Nesne Algılama: Düz görüntüler (pikseller) üzerinde çalışır. Bir nesnenin karenin "sol üst" veya "sağ alt" kısmında bulunduğunu söyler; ancak referans işaretleri olmadan mesafeyi veya gerçek dünya boyutunu etkili biçimde değerlendiremez. Üretim kusurlarını belirleme veya derinliğin daha az kritik olduğu video akışlarını analiz etme gibi görevler için idealdir.
- 3B Nesne Algılama: Hacimsel uzayda (voksel veya noktalar) çalışır. Kameraya olan mesafeyi (derinlik), nesnenin fiziksel boyutunu ve yönelimini sağlar. Bu, dinamik ortamlarda çarpışmaları önlemek için gereklidir.
Gerçek Dünya Uygulamaları#
2B algılamadan 3B algılamaya geçiş, güvenlik ve uzamsal farkındalığın büyük önem taşıdığı sektörlerde güçlü kullanım alanlarının önünü açar.
- Otonom Sürüş: Otonom araçlar güvenli bir şekilde hareket etmek için büyük ölçüde 3B algılamaya dayanır. Araç, LiDAR ve kameralardan gelen verileri işleyerek diğer otomobilleri, yayaları ve engelleri algılayabilir, bunların kesin mesafesini ve hızını hesaplayabilir. Bu sayede algılama sistemi, gerçek zamanlı çıkarım senaryolarında yörüngeleri tahmin edebilir ve frenleme ya da direksiyon kararları verebilir. Waymo gibi şirketler, kentsel ortamları anında haritalamak için bu kapsamlı sensör paketlerinden yararlanır.
- Robotik ve Kutu İçinden Parça Alma: Lojistik ve depolama alanlarında robotların kutulardan farklı şekil ve boyutlardaki nesneleri alması gerekir. 3B algılama, robot kolunun bir paketin yönelimini anlamasını, en uygun kavrama noktasını belirlemesini ve nesneyi taşımak için çarpışmasız bir yol planlamasını sağlar. Bu, karmaşık manuel görevleri otomatikleştirerek lojistikte yapay zekâ alanındaki verimliliği artırır.
Ultralytics ile Nesne Algılamayı Uygulama#
Tam 3B algılama genellikle özel nokta bulutu mimarileri gerektirse de YOLO26 gibi modern 2B algılayıcılar, sözde 3B iş akışlarında bir bileşen olarak veya sınırlayıcı kutu ölçeklendirmesi yoluyla derinlik tahmini için giderek daha fazla kullanılmaktadır. Modelleri kendi veri kümeleri üzerinde eğitmek isteyen geliştiriciler için Ultralytics Platformu, açıklama ekleme ve eğitim süreçleri için kolaylaştırılmış bir ortam sunar.
Ultralytics Python API'sini kullanarak standart algılamanın nasıl çalıştırılacağına ilişkin basit bir örneği burada bulabilirsin; bu işlem genellikle daha büyük bir algılama işlem hattındaki ilk adımdır:
import cv2
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Perform inference on a local image
results = model("path/to/image.jpg")
# Visualize the results
for result in results:
# Plot predictions on the image (returns a numpy array)
im_array = result.plot()
# Display using OpenCV
cv2.imshow("Detections", im_array)
cv2.waitKey(0) # Press any key to close
cv2.destroyAllWindows()Zorluklar ve Gelecekteki Eğilimler#
Yararlı olmasına rağmen 3B nesne algılama, hesaplama maliyeti ve sensör giderleriyle ilgili zorluklarla karşı karşıyadır. Bir nokta bulutundaki milyonlarca noktayı işlemek önemli miktarda GPU gücü gerektirir ve bu da uç cihazlarda dağıtımı zorlaştırır. Ancak model niceleme ve verimli sinir ağı mimarilerindeki yenilikler bu yükü azaltmaktadır.
Ayrıca sensör birleştirme gibi teknikler, kameraların zengin renk bilgilerini LiDAR'ın hassas derinlik verileriyle birleştirerek doğruluğu artırmaktadır. Bu teknolojiler olgunlaştıkça 3B algılamanın artırılmış gerçeklik gözlüklerinden akıllı ev cihazlarına kadar daha erişilebilir cihazlara entegre edildiğini görmeyi bekleyebiliriz.









