Stereo Vision
Stereo görüşün yapay zekâ için 3B derinlik bilgisini nasıl çıkardığını keşfet. Nasıl çalıştığını, uygulamalarını ve en yeni Ultralytics YOLO26 ile nasıl bütünleştirileceğini öğren.
Stereoskopik görme olarak da bilinen stereo görme, dijital görüntülerden 3B derinlik bilgisi elde etmek için kullanılan bir bilgisayarlı görü tekniğidir. Aynı sahnenin biraz farklı açılardan çekilmiş iki veya daha fazla 2B görüntüsünü karşılaştırarak—insan binoküler görüşünü taklit ederek—yapay zekâ sistemleri nesnelere olan mesafeyi doğru biçimde hesaplayabilir. Bu yetenek, makinelerin çevrelerinde gezinmesini ve fiziksel nesnelerle güvenli biçimde etkileşim kurmasını sağlayan uzamsal zekânın temelini oluşturur.
Stereo Görme Nasıl Çalışır#
Süreç, sol ve sağ kamera görüntüleri arasındaki farkları bulmaya dayanır. Buradaki temel zorluk, her iki görüntüdeki aynı pikselleri veya özellikleri belirlemeyi içeren eşleşme problemidir. Eşleşen noktalar bulunduktan sonra sistem yatay kaymayı hesaplayarak bir eşitsizlik haritası oluşturur.
Bir eşitsizlik haritasında daha büyük kaymalar nesnelerin daha yakın, daha küçük kaymalar ise daha uzakta olduğunu gösterir. Üçgenleme kullanılarak bu harita daha sonra yoğun bir 3B nokta bulutuna dönüştürülür. Geleneksel matematiksel algoritmalar geçmişte bu hesaplamaların temelini oluşturmuş olsa da, yakın tarihli IEEE bilgisayarlı görü araştırmalarında ayrıntılı olarak açıklandığı üzere, modern yaklaşımlar karmaşık ışıklandırma veya dokusuz alanlarda özellik eşleştirme doğruluğunu artırmak için giderek daha fazla evrişimli sinir ağlarına (CNN'ler) ve derin öğrenmeye dayanıyor.
Stereo Görme ve Tek Gözlü Derinlik Tahmini#
Stereo görmeyi yalnızca tek kamera kullanan derinlik tahmini tekniklerinden ayırmak önemlidir. Tek gözlü derinlik tahmini, perspektif ve gölgelendirme gibi görsel ipuçlarına dayanarak tek bir 2B görüntüden 3B yapıları tahmin etmek için derin öğrenme modelleri kullanır. Buna karşılık stereo sistemler, iki kamera merceği arasındaki geometrik ilişkiyi kullanarak derinliği doğrudan ölçer. Tek gözlü yöntemler daha az işlem gücü gerektirirken stereo görme, kritik güvenlik sistemleri için gerekli olan daha hassas ve gerçek zamanlı derinlik ölçümleri sağlar.
Gerçek Dünyadaki Yapay Zekâ Uygulamaları#
Stereo sistemler, gerçek dünyada 3B nesne algılama ve uzamsal farkındalık gerektiren çeşitli sektörlerde hayati önem taşır.
- Otonom Sürüş Navigasyonu: Waymo gibi şirketlerin geliştirdiği otonom sürüş teknolojileri, yayalara, diğer araçlara ve engellere olan mesafeyi gerçek zamanlı olarak doğru biçimde ölçmek için stereo kameralar kullanır ve bu hassas derinlik verilerini güvenli rotalar planlayan tahmine dayalı modelleme sistemlerine iletir.
- Endüstriyel Robotik Otomasyonu: Üretim robotları, karmaşık kutudan parça alma görevleri için stereo görme kullanır. Robotik sistemler, bir konveyör bandına dağılmış parçaların kesin derinliğini ve yönelimini hesaplayarak tutucularını kusursuz biçimde hizalayabilir ve akıllı üretim işlem hatlarındaki verimliliği artırabilir.
- İleri Tıbbi Görüntüleme: Cerrahi robotlar ve tanı sistemleri, minimal invaziv işlemler sırasında cerrahlara hastanın anatomisini son derece hassas bir 3B görünümle sunmak için stereoskopik kameralar kullanır. Bu eğilim, tıbbi yapay zekâ üzerine yakın tarihli arXiv ön baskılarında sıkça vurgulanır.
Yapay Zekâyı Stereo Verilerle Bütünleştirme#
Geliştiriciler, hem ne olduğunu hem de ne kadar uzakta olduğunu bulmak için stereo görmeyi genellikle nesne algılamayla birlikte kullanır. OpenCV çatısı, eşitsizlik haritaları oluşturmak için yaygın olarak kullanılır ve algılama işini yapay zekâ modelleri üstlenirken bu haritalar genellikle daha kapsamlı PyTorch veya TensorFlow işlem hatlarına entegre edilir. Aşağıda Ultralytics YOLO26 kullanarak nesneleri algılamaya ve sınırlayıcı kutularını almaya yönelik kavramsal bir örnek verilmiştir; bu kutular daha sonra ilişkili bir OpenCV eşitsizlik haritasından ortalama mesafe değerlerini çıkarmak için kullanılabilir.
import cv2
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for high-speed edge inference
model = YOLO("yolo26n.pt")
# Read the left camera frame (typically used as the primary frame for detection)
left_frame = cv2.imread("left_camera_frame.jpg")
# Run inference to detect objects in the scene
results = model(left_frame)
# Extract bounding boxes to later combine with a stereo disparity map
for result in results:
for box in result.boxes.xyxy:
x1, y1, x2, y2 = map(int, box[:4])
print(f"Detected object bounding box: [{x1}, {y1}, {x2}, {y2}]")
# Depth values can now be extracted from the disparity map within this specific regionGelişmeler ve Gelecek Eğilimleri#
Gelişmiş algılama modellerini eğitmek ve dağıtmak oldukça kolaylaştı. Ultralytics Platform gibi araçları kullanan ekipler stereo çiftlerini güvenli biçimde etiketleyebilir, dayanıklı modeller eğitebilir ve modelleri uç yapay zekâ cihazlarında düşük gecikmeli çıkarım için TensorRT gibi optimize edilmiş biçimlere aktarabilir.
Stanford Vision and Learning Lab gibi kuruluşların yakın tarihli gelişmeleri, eşleşme problemini daha hızlı çözmek için stereo görmeyi Vision Transformer'larla (ViT) ve Google DeepMind temel modelleriyle birleştirme eğiliminin arttığını gösteriyor. Ayrıca Anthropic ve OpenAI gibi liderlerin çok kipli yapay zekâ modelleri geliştikçe, dayanıklı 3B uzamsal verilerin entegrasyonu, fiziksel dünyada etkin yapay zekâ aracıların algılayıp anlayabileceklerinin sınırlarını genişletmeye devam edecek.










