Stereo Vision
Stereo vision'ın yapay zeka için 3D derinliği nasıl çıkardığını keşfet. Nasıl çalıştığını, uygulama alanlarını ve en güncel Ultralytics YOLO26 ile nasıl entegre edileceğini öğren.
Stereoskopik görüş olarak da bilinen stereo vision, dijital görüntülerden 3D derinlik bilgisi çıkarmak için kullanılan bir computer vision tekniğidir. İnsan binocular vision yeteneğini taklit ederek aynı sahnenin biraz farklı açılardan çekilmiş iki veya daha fazla 2D görüntüsünü karşılaştıran yapay zeka sistemleri, nesnelere olan mesafeyi doğru bir şekilde hesaplayabilir. Bu yetenek, spatial intelligence için temel oluşturur ve makinelerin çevrelerinde gezinmesine ve fiziksel nesnelerle güvenli bir şekilde etkileşime girmesine olanak tanır.
Stereo Görüş Nasıl Çalışır#
Bu süreç, sol ve sağ kamera görünümleri arasındaki farkların bulunmasına dayanır. Buradaki temel zorluk, her iki görüntütteki tamamen aynı pikselleri veya özellikleri belirlemeyi içeren correspondence problem konusudur. Eşleşen noktalar bulunduktan sonra sistem yatay kaymayı hesaplar ve bir eşitsizlik haritası (disparity map) oluşturur.
Bir disparity map üzerinde daha büyük kaymalar daha yakın nesneleri gösterirken, daha küçük kaymalar nesnenin daha uzakta olduğunu belirtir. Üçgenleme (triangulation) kullanılarak bu harita daha sonra yoğun bir 3D nokta bulutuna dönüştürülür. Geleneksel matematiksel algoritmalar tarihsel olarak bu hesaplamalara yön vermiş olsa da, son yaklaşımlar karmaşık aydınlatma veya dokusuz alanlarda özellik eşleştirme doğruluğunu artırmak için giderek convolutional neural networks (CNNs) ve deep learning yöntemlerine güvenmektedir; bu durum son IEEE computer vision research çalışmalarında ayrıntılı olarak ele alınmıştır.
Stereo Görüş ve Monoküler Derinlik Tahmini#
Stereo vision ile yalnızca tek bir kamera kullanan depth estimation tekniklerini birbirinden ayırmak önemlidir. Monoküler derinlik tahmini, perspektif ve gölgelendirme gibi görsel ipuçlarına dayanarak tek bir 2D görüntüden 3D yapıları tahmin etmek için derin öğrenme modellerini kullanır. Buna karşılık stereo sistemler, iki kamera merceği arasındaki geometrik ilişkiyi kullanarak derinliği doğrudan ölçer. Monoküler yöntemler hesaplama açısından daha hafif olsa da stereo vision genellikle kritik güvenlik sistemleri için gerekli olan daha hassas, gerçek zamanlı derinlik ölçümleri sağlar.
Gerçek Dünyada Yapay Zeka Uygulamaları#
Stereo sistemler, gerçek dünyada 3D object detection ve mekansal farkındalık gerektiren çeşitli endüstrilerde hayati önem taşır.
- Autonomous Driving Navigation: Waymo gibi şirketler tarafından geliştirilen otonom sürüş teknolojileri, yayalara, diğer araçlara ve engellere olan mesafeyi gerçek zamanlı olarak doğru bir şekilde ölçmek için stereo kameralar kullanır ve bu hassas derinlik verilerini güvenli yollar planlamak üzere predictive modeling sistemlerine aktarır.
- Industrial Robotics Automation: Üretim robotları, karmaşık kutudan alma (bin-picking) görevleri için stereo vision kullanır. Konveyör bant üzerindeki dağınık parçaların tam derinliğini ve yönünü hesaplayarak robotik sistemler tutucularını mükemmel bir şekilde hizalayabilir ve smart manufacturing pipelines süreçlerinde verimliliği artırabilir.
- Advanced Medical Imaging: Cerrahi robotlar ve teşhis sistemleri, minimal invaziv prosedürler sırasında cerrahlara hasta anatomisinin son derece doğru bir 3D görünümünü sağlamak için stereoskopik kameralar kullanır; bu eğilim recent arXiv preprints on medical AI çalışmalarında sıklıkla vurgulanmaktadır.
YZ'yi Stereo Verilerle Entegre Etme#
Geliştiriciler genellikle hem ne olduğunu hem de ne kadar uzakta olduğunu bulmak için nesne algılama ile birlikte stereo vision kullanır. OpenCV framework genellikle eşitsizlik haritaları oluşturmak için kullanılır; bu haritalar genellikle daha geniş PyTorch veya TensorFlow boru hatlarına entegre edilirken yapay zeka modelleri algılamayı yönetir. Aşağıda, Ultralytics YOLO26 kullanarak nesneleri algılamaya ve bunlara ait sınırlayıcı kutuları (bounding boxes) almaya yönelik kavramsal bir örnek yer almaktadır; bu kutular daha sonra ilgili bir OpenCV eşitsizlik haritasından ortalama mesafe değerlerini çıkarmak için kullanılabilir.
import cv2
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for high-speed edge inference
model = YOLO("yolo26n.pt")
# Read the left camera frame (typically used as the primary frame for detection)
left_frame = cv2.imread("left_camera_frame.jpg")
# Run inference to detect objects in the scene
results = model(left_frame)
# Extract bounding boxes to later combine with a stereo disparity map
for result in results:
for box in result.boxes.xyxy:
x1, y1, x2, y2 = map(int, box[:4])
print(f"Detected object bounding box: [{x1}, {y1}, {x2}, {y2}]")
# Depth values can now be extracted from the disparity map within this specific regionGelişmeler ve Gelecekteki Eğilimler#
Gelişmiş algılama modellerinin eğitilmesi ve dağıtılması son derece kolaylaştırılmıştır. Ultralytics Platform gibi araçları kullanarak ekipler, stereo çiftleri güvenli bir şekilde etiketleyebilir, sağlam modeller eğitebilir ve bunları edge AI devices üzerinde düşük gecikmeli çıkarım için TensorRT gibi optimize edilmiş formatlara dışarı aktarabilir.
Recent advancements from organizations like the Stanford Vision and Learning Lab show a growing trend in merging stereo vision with Vision Transformers (ViT) and foundational models from Google DeepMind to solve the correspondence problem faster. Furthermore, as multimodal AI models from leaders like Anthropic and OpenAI evolve, the integration of robust 3D spatial data will continue to push the boundaries of what embodied AI agents can perceive and understand.






