Ultralytics YOLO27:
Kılavuzlar

Tek kameralı derinlik tahmini nedir? Genel bakış

Tek kameralı derinlik tahmininin nasıl çalıştığını, sensör tabanlı derinlik yöntemleriyle nasıl karşılaştırıldığını ve görü sistemlerinde ölçeklenebilir 3B algılamayı nasıl mümkün kıldığını öğren.

ABAbirami Vina15 min read
Tek kameralı derinlik tahmini kullanılarak oluşturulan tahmini derinlik haritası

Otonom araçlar, güvenli bir şekilde ilerleyebilmek için çevrelerinde neler olduğunu anlayacak şekilde tasarlanır. Bu, yayalar veya diğer araçlar gibi nesneleri yalnızca tanımanın ötesine geçer.

Ayrıca doğru tepki verebilmek için bu nesnelerin ne kadar uzakta olduğunu bilmeleri gerekir. Ancak makinelere bu mesafe algısını kazandırmak kolay değildir. İnsanların aksine makineler, görüntülerden derinliği doğal olarak algılayamaz ve bunu yapmaları açıkça öğretilmelidir.

Bunun nedenlerinden biri, çoğu kameranın dünyayı düz, iki boyutlu görüntüler olarak yakalamasıdır. Bu görüntüleri gerçek dünyadaki derinliği ve 3B yapıyı yansıtan bir şeye dönüştürmek zordur; özellikle de sistemlerin günlük koşullarda güvenilir şekilde çalışması gerektiğinde.

İlginç bir şekilde, görsel verileri yorumlamaya ve anlamaya odaklanan bir yapay zeka dalı olan bilgisayarlı görü, makinelerin görüntülerden dünyayı daha iyi anlamasını mümkün kılar. Örneğin monoküler derinlik tahmini, nesnelerin uzaklığını yalnızca tek bir kamera görüntüsünü kullanarak tahmin eden bir bilgisayarlı görü tekniğidir.

Bu modeller; nesne boyutu, perspektif, doku ve gölgelendirme gibi görsel ipuçlarını öğrenerek LiDAR (Işık Algılama ve Mesafe Ölçümü) veya stereo kameralar gibi ek sensörlere ihtiyaç duymadan derinliği tahmin edebilir. Bu makalede monoküler derinlik tahmininin ne olduğunu, nasıl çalıştığını ve gerçek dünyadaki bazı uygulamalarını inceleyeceğiz. Hadi başlayalım!

Monoküler derinlik tahminine kısa bir giriş#

Monoküler derinlik tahmini, bir makinenin yalnızca tek bir görüntüyü kullanarak nesnelerin kendisinden ne kadar uzakta olduğunu anlamasını sağlar. Yalnızca tek bir kameraya dayandığı için bu yaklaşımın daha düşük maliyet ve daha basit donanım gereksinimleri dahil olmak üzere çeşitli avantajları vardır.

Örneğin tek kamerayla çalışan uygun fiyatlı ev robotlarında kullanılabilir. Robotik sistem, tek bir görüntüden bile hangi duvarların daha yakın, hangi kapıların daha uzakta olduğunu belirleyebilir ve alanın genel derinliğini çıkarabilir.

Çoğu zaman tek bir görüntü doğru ölçekte bilgi içermez; bu nedenle monoküler derinlik tahmini genellikle göreli derinliğe odaklanır. Başka bir deyişle, kesin uzaklıklar bilinmese bile hangi nesnelerin daha yakın, hangilerinin daha uzakta olduğunu belirleyebilir.

Bir model, LiDAR gibi sensörlerden alınan derinlik ölçümleri gibi gerçek referans uzaklıklar veya mutlak derinlik içeren verilerle eğitildiğinde, uzaklıkları metre gibi gerçek dünya birimleriyle tahmin etmeyi öğrenebilir. Bu tür referans veriler olmadan model yine göreli derinliği çıkarabilir, ancak mutlak uzaklıkları güvenilir şekilde tahmin edemez.

Monoküler derinlik tahmininin çıktısı genellikle, her pikselin sahnenin o bölümünün ne kadar yakın veya uzak olduğunu temsil ettiği bir görüntü olan derinlik haritasıdır. Derinlik haritası, görü sistemlerine ortamın 3B yapısı hakkında temel bir anlayış sağlar.

Monoküler derinlik tahmini kullanılarak oluşturulan tahmini derinlik haritası örneği

Şekil 1. Monoküler derinlik tahmini kullanılarak oluşturulan tahmini derinlik haritası örneği (Kaynak)

Sensörlerden görüntülere: Derinlik tahmini#

Derinlik tahmini; kullanılabilir sensörlere, donanım kısıtlarına ve doğruluk gereksinimlerine bağlı olarak çeşitli şekillerde gerçekleştirilebilir. Geleneksel yöntemler, uzaklığı doğrudan ölçmek için genellikle birden fazla bakış açısına veya özel sensörlere dayanır.

Yaygın yaklaşımlardan biri, biraz farklı bakış açılarından yakalanan iki senkronize görüntüyü karşılaştırarak derinliği tahmin eden stereo görüdür. Sistem, iki görüntüdeki karşılık gelen noktalar arasındaki farkı ölçerek nesnelerin kameradan ne kadar uzakta olduğunu çıkarabilir.

Bir diğer yaklaşım, her pikseldeki uzaklığı doğrudan ölçmek için etkin derinlik sensörleri kullanan RGB-D (Kırmızı, Yeşil, Mavi ve Derinlik) sistemleridir. Bu sistemler kontrollü ortamlarda doğru derinlik bilgisi sağlayabilir, ancak ek donanım gerektirir.

Buna karşılık LiDAR tabanlı yöntemler, bir sahnenin hassas üç boyutlu temsillerini oluşturmak için lazer darbeleri kullanır. LiDAR sensörleri son derece doğru olsa da genellikle pahalıdır ve donanım karmaşıklığını önemli ölçüde artırır.

Monoküler derinlik tahmini ise yalnızca tek bir RGB görüntüsünü kullanarak derinliği çıkarır. Birden fazla kameraya veya özel sensörlere bağlı olmadığı için büyük ölçekte uygulanması daha kolaydır ve maliyetin ve donanım kaynaklarının sınırlı olduğu durumlarda iyi bir seçenektir.

Tek bir görüntüden derinlik öğrenme#

Tek bir görüntüden derinlik tahmini yaparken monoküler derinlik modelleri, insanların mesafeyi sezgisel olarak değerlendirmek için kullandığı görsel ipuçlarını tanımayı öğrenir. Bu ipuçları arasında perspektif çizgileri, nesne boyutu, doku yoğunluğu, nesnelerin üst üste binmesi ve gölgelendirme bulunur; bunların tümü nesnelerin kameradan ne kadar uzakta olduğuna dair ipuçları sağlar.

Bu ipuçları birlikte çalışarak bir derinlik hissi oluşturur. Daha küçük görünen veya kısmen örtülmüş nesneler genellikle daha uzaktadır; daha net ayrıntılar ve daha büyük görsel görünümler ise genellikle bir şeyin daha yakın olduğunu gösterir.

Bu örüntüleri öğrenmek için monoküler derinlik modelleri, çoğu zaman LiDAR veya stereo sistemler gibi diğer kaynaklardan elde edilen derinlik bilgileriyle eşleştirilmiş büyük ölçekli görüntü veri kümeleri üzerinde eğitilir. Eğitim sırasında modeller, görsel ipuçlarının derinlikle nasıl ilişkili olduğunu öğrenir ve çıkarım sırasında tek bir görüntüden uzaklığı tahmin edebilir.

Çeşitli eğitim verileri sayesinde modern görü modelleri, bu öğrenilmiş anlayışı iç ve dış mekan sahneleri dahil olmak üzere çok çeşitli ortamlara genelleyebilir ve alışılmadık bakış açılarıyla başa çıkabilir.

Çeşitli monoküler derinlik tahmini tekniklerine bakış#

Şimdi, tek bir görüntüden derinlik tahmini yapmak için kullanılan temel yaklaşımları ve bu yöntemlerin zaman içinde nasıl geliştiğini inceleyeceğiz.

Klasik ve geometri tabanlı yaklaşımlar#

İlk derinlik tahmini yöntemleri, kamera geometrisine bağlı basit görsel kurallara dayanıyordu. Uzaklığı tahmin etmek için perspektif, nesne boyutu ve bir nesnenin diğerini engelleyip engellemediği gibi ipuçları kullanılıyordu.

Örneğin, iki benzer nesne farklı boyutlarda göründüğünde küçük olanın daha uzakta olduğu varsayılıyordu. Bu yaklaşımlar; aydınlatma, kamera konumu ve sahne düzeni gibi etkenlerin tutarlı kaldığı kontrollü ortamlarda makul ölçüde iyi çalışıyordu.

Ancak gerçek dünya sahnelerinde bu varsayımlar çoğu zaman geçerliliğini yitirir. Aydınlatmadaki değişiklikler, bakış açısındaki farklılıklar ve artan sahne karmaşıklığı güvenilmez derinlik tahminlerine yol açabilir; bu da klasik yöntemlerin kontrolsüz ortamlardaki etkinliğini sınırlar.

İlk makine öğrenimi yaklaşımları#

İlk makine öğrenimi yöntemleri, örüntüleri doğrudan verilerden öğrenerek derinlik tahminine daha fazla esneklik kazandırdı. Bu modeller yalnızca sabit geometrik kurallara güvenmek yerine, görsel bilgi ile uzaklık arasındaki ilişkiyi öğrenmeye çalıştı ve derinlik tahminini kenarlar, dokular ve renk değişimleri gibi ipuçlarına dayalı bir regresyon problemi olarak ele aldı.

Bu özelliklerin seçilmesi sürecin önemli bir parçasıydı. Mühendislerin hangi görsel sinyalleri çıkaracaklarına ve bunları nasıl temsil edeceklerine karar vermesi gerekiyordu; modelin performansı da büyük ölçüde bu seçimlere bağlıydı.

Bu yaklaşım önceki yöntemlerden daha iyi çalışsa da hâlâ sınırlıydı. Seçilen özellikler önemli bağlamlardan yoksunsa derinlik tahminleri daha az doğru oluyordu. Sahneler daha karmaşık ve çeşitli hale geldikçe bu modeller güvenilir sonuçlar üretmekte çoğu zaman zorlanıyordu.

Derin öğrenme algoritmaları#

Modern monoküler derinlik tahmini sistemlerinin çoğu, verilerden karmaşık örüntüleri öğrenebilen çok katmanlı sinir ağlarını ifade eden derin öğrenmeyi kullanır. Bu modeller derinliği doğrudan görüntülerden tahmin etmeyi ve derinlik haritaları üretmeyi öğrenir.

Birçok yaklaşım, kenarlar ve şekiller gibi örüntüleri algılayarak görüntüleri işlemek üzere tasarlanmış bir sinir ağı türü olan evrişimli sinir ağları (CNN) kullanılarak oluşturulur. Bu modeller genellikle kodlayıcı-kod çözücü düzeninden yararlanır: Kodlayıcı görüntüden görsel özellikleri çıkarır, kod çözücü ise bu özellikleri derinlik haritasına dönüştürür. Görüntünün birden fazla ölçekte işlenmesi, modelin net nesne sınırlarını korurken sahnenin genel düzenini yakalamasına yardımcı olur.

Daha yeni modeller, görüntünün farklı bölümleri arasındaki ilişkileri anlamaya odaklanır. Transformer tabanlı ve Vision Transformer (ViT) modelleri, modelin bir görüntünün hangi bölgelerinin en alakalı olduğunu belirlemesini ve uzaktaki alanları birbiriyle ilişkilendirmesini sağlayan dikkat mekanizmalarını kullanır. Bu, modelin tüm sahne genelinde daha tutarlı bir derinlik anlayışı oluşturmasına yardımcı olur.

Bazı sistemler her iki fikri birleştirir. Hibrit CNN-Transformer modelleri, ince yerel ayrıntıları yakalamak için CNN'leri, sahnenin küresel bağlamını modellemek içinse Transformer'ları kullanır. Bu genellikle doğruluğu artırsa da ek bellek ve işlem gücü gibi daha fazla hesaplama kaynağı gerektirir.

Görü AI sistemleri için derinlik anlayışı neden önemlidir?#

Monoküler derinlik tahmini hakkında bilgi edinirken derinlik anlayışının görü tabanlı AI sistemlerinin neden bu kadar önemli bir parçası olduğunu merak ediyor olabilirsin.

Bir sistem nesnelerin ve yüzeylerin ne kadar uzakta olduğunu tahmin edebildiğinde, bir sahnenin nasıl düzenlendiğini ve farklı unsurların birbiriyle nasıl ilişkili olduğunu daha iyi anlar. Bu tür bir uzamsal farkındalık, özellikle otonom sürüş gibi gerçek dünya uygulamalarında güvenilir kararlar almak için gereklidir.

Derinlik bilgisi, diğer bilgisayarlı görü görevlerine de değerli bir bağlam ekler. Örneğin Ultralytics YOLO26 gibi modellerle desteklenen nesne algılama, bir sisteme sahnede ne bulunduğunu söyleyebilir; ancak derinlik, bu nesnelerin kameraya ve birbirlerine göre nerede bulunduğu sorusunu yanıtlamaya yardımcı olur.

Bu yetenekler birlikte 3B haritalar oluşturma, karmaşık ortamlarda gezinme ve bir sahneyi bütünüyle anlama gibi çok çeşitli görü AI uygulamalarını mümkün kılar.

Robotlar ve otonom araçlar güvenli hareket etmek, engellerden kaçınmak ve gerçek zamanlı değişikliklere tepki vermek için bu bilgilere dayanır. Örneğin Tesla'nın yalnızca görü kullanan sürüş yaklaşımı, nesnelerin ne kadar uzakta olduğunu ve yol üzerinde nasıl konumlandığını anlamak için LiDAR yerine kamera görüntülerini derinlik tahminiyle birleştirir.

Monoküler derinlik tahmini modelleri nasıl çalışır?#

Model mimarileri değişiklik gösterse de çoğu monoküler derinlik tahmini modeli, tek bir görüntüyü derinlik haritasına dönüştürmek için benzer bir süreç izler. Aşağıda sürecin temel adımlarına kısaca göz atacağız:

  • Girdi ve ön işleme: İş akışı bir girdi görüntüsüyle başlar. Orijinal görüntü modele aktarılmadan önce genellikle yeniden boyutlandırılır, normalize edilir ve sinir ağlarının görüntü verilerini verimli şekilde işlemek için kullandığı bir biçim olan tensöre dönüştürülür.
  • Özellik çıkarma: Bir kodlayıcı ağı, anlamlı görsel özellikleri çıkarmak için görüntüyü analiz eder. Bu özellikler dokular, nesne sınırları ve sahnenin genel düzeni gibi bilgileri yakalar. Çoğu model, hem ince ayrıntıları hem de küresel yapıyı anlayabilmek için birden fazla ölçekte çalışır.
  • Derinlik çıkarımı: Model, çıkarılan özellikleri kullanarak sahnedeki uzamsal ilişkiler hakkında çıkarım yapmak için yerel ayrıntıları küresel bağlamla birleştirir. Bu aşamada görüntünün hangi bölgelerinin kameraya daha yakın, hangilerinin daha uzakta olduğunu öğrenir.
  • Derinlik haritası oluşturma: Ardından bir kod çözücü bu bilgileri yoğun bir derinlik haritasına dönüştürür. Doğruluğu ve tutarlılığı artırmak için çoğu zaman farklı ölçeklerdeki tahminler harmanlanarak görüntüdeki her piksele bir derinlik değeri atanır.

Monoküler derinlik tahmini modelleri nasıl eğitilir?#

Az önce ele aldığımız süreç, hâlihazırda eğitilmiş veya önceden eğitilmiş bir modelimiz olduğunu varsayar. Peki monoküler derinlik tahmini modelinin eğitimi gerçekte nasıl işler?

Eğitim, görüntü verilerinin ağ tarafından verimli şekilde işlenebilmesi için hazırlanmasıyla başlar. Girdi görüntüleri tutarlı bir ölçeğe yeniden boyutlandırılır ve normalize edilir, ardından her pikseldeki uzaklığı tahmin eden bir derinlik haritası oluşturmak üzere modelden geçirilir.

Daha sonra tahmini derinlik haritası, bir kayıp fonksiyonu kullanılarak referans derinlik verileriyle karşılaştırılır. Bu fonksiyon, modelin tahmininin gerçek derinlikten ne kadar uzak olduğunu ölçer. Bu kayıp değeri modelin mevcut hatasını temsil eder ve iyileştirme için bir sinyal sağlar.

Bir optimize edici, dahili ağırlıklarını ayarlayarak modeli güncellemek için bu sinyali kullanır. Bunun için optimize edici, kaybın her model parametresine göre nasıl değiştiğini açıklayan gradyanı hesaplar ve bu güncellemeleri birden fazla çağ boyunca veya eğitim veri kümesinin tamamından tekrarlı geçişler boyunca uygular.

Bu yinelemeli denetimli öğrenme eğitim süreci; her güncelleme adımının büyüklüğünü kontrol eden öğrenme oranı ve aynı anda kaç görüntünün işlendiğini belirleyen yığın boyutu gibi hiperparametrelerle yönlendirilir. Eğitim çok sayıda matematiksel işlem içerdiğinden genellikle paralel hesaplama için uygun olan grafik işlem birimi (GPU) kullanılarak hızlandırılır.

Eğitim tamamlandığında model, eğitim sırasında kullanılmamış görüntülerden oluşan bir doğrulama kümesi üzerinde standart değerlendirme metrikleri kullanılarak değerlendirilir. Bu değerlendirme, modelin yeni verilere ne kadar iyi genellendiğini ölçmeye yardımcı olur.

Eğitilmiş model daha sonra yeni senaryolarda yeniden kullanılabilir veya ince ayar yapılabilir. Genel olarak bu eğitim süreci, monoküler derinlik tahmini modellerinin 3B yeniden yapılandırma ve gerçek dünyada dağıtım gibi sonraki görevler için gerekli olan tutarlı derinlik tahminleri üretmesini sağlar.

Son teknoloji modelleri ve araştırma eğilimlerini keşfetme#

Modeller küçük görsel ayrıntılardan ziyade tüm sahneleri anlamada daha iyi hale geldikçe monoküler derinlik tahmini hızla gelişti. Önceki yaklaşımlar, özellikle karmaşık ortamlarda, çoğu zaman düzensiz derinlik haritaları üretiyordu.

Yakın zamanda arXiv'de yayımlanan araştırmalarda görüldüğü üzere daha yeni modeller küresel bağlama daha fazla odaklanıyor; bu da daha kararlı ve gerçekçi görünen derinlik tahminleri sağlıyor. MiDaS ve DPT gibi tanınmış modeller, çeşitli yüksek çözünürlüklü veri kümelerinden derinlik öğrenerek ve birçok sahnede iyi genelleme yaparak bu değişimin yönünü belirlemeye yardımcı oldu.

ZoeDepth ve Depth Anything V2 dahil olmak üzere daha yeni modeller, çok çeşitli ayarlarda güçlü performansı korurken ölçek tutarlılığını iyileştirerek bu çalışmayı ileriye taşıyor. Bu tür ilerlemeler genellikle hem dış hem de iç mekan sahnelerini kapsayan KITTI ve NYU gibi yaygın kıyaslama veri kümeleri kullanılarak ölçülür.

Bir diğer belirgin eğilim, doğruluğu pratiklikle dengelemektir. Daha küçük modeller hız için optimize edilir ve uç veya mobil cihazlarda gerçek zamanlı çalışabilirken, daha büyük modeller daha yüksek çözünürlüğe ve uzun mesafelerde derinlik doğruluğuna öncelik verir.

Monoküler derinlik tahmini uygulamaları#

Şimdi monoküler derinlik tahmininin tek bir görüntüden bir sahnenin 3B yapısı hakkında nasıl çıkarım yaptığını gösteren bazı gerçek dünya örneklerine bakalım.

Tüm bu durumlarda derinlik bilgisinin kesin bir ölçüm değil, görsel ipuçlarından çıkarılan bir tahmin olduğunu akılda tutmak önemlidir. Bu nedenle monoküler derinlik tahmini göreli düzeni ve uzamsal ilişkileri anlamak için kullanışlıdır, ancak LiDAR veya stereo sistemler gibi uzaklığı doğru ölçmek üzere tasarlanmış sensörlerin yerini tutmaz.

Drone tabanlı arazi haritalama ve navigasyon#

Dronlar genellikle ormanlar, şantiyeler, afet bölgeleri veya yoğun kentsel alanlar gibi GPS sinyallerinin güvenilmez olduğu ortamlarda çalışır. Bu koşullarda güvenli uçabilmek için çevredeki araziyi anlamaları ve engellerin ne kadar uzakta olduğunu bilmeleri gerekir. Geçmişte bu genellikle ağırlığı, güç tüketimini ve toplam maliyeti artıran LiDAR veya stereo kameralar gibi sensörlerin eklenmesini gerektiriyordu.

Monoküler derinlik tahmini daha basit bir alternatiftir. Dronlar yalnızca tek bir RGB kamera kullanarak görüntülerden derinliği tahmin edebilir ve çevrelerinin temel bir 3B anlayışını oluşturabilir. Bu sayede binalar, ağaçlar veya arazideki ani değişiklikler gibi engelleri algılayıp uçuş rotalarını gerçek zamanlı olarak ayarlayabilirler.

Bu derinlik tahminleri; engellerden kaçınma, irtifa kontrolü ve güvenli iniş dahil olmak üzere temel navigasyon görevlerini destekler. Sonuç olarak hafif dronlar, özel derinlik sensörlerine güvenmeden haritalama, denetim ve navigasyon görevlerini gerçekleştirebilir.

Drone görüntülerini analiz etmek için kullanılan monoküler derinlik tahmini

Şekil 2. Monoküler derinlik tahmini drone görüntülerini analiz etmek için kullanılabilir (Kaynak)

Otonom yarış araçlarındaki kör noktaları doldurma#

Otonom araçlar genellikle uzaklığı ölçmek ve yolun 3B görünümünü oluşturmak için lazer darbeleri kullanan LiDAR sensörlerine büyük ölçüde güvenir. LiDAR son derece doğru olsa da keskin yol tümsekleri, dik yokuşlar, örtülme veya aracın ani yunuslama hareketiyle başa çıkmakta zorlanabilir ve bazen seyrek ya da eksik derinlik verileri döndürebilir.

Monoküler derinlik tahmini, LiDAR verileri eksik olduğunda bile tek bir RGB görüntüsünden yoğun derinlik bilgisi sağlayarak bu boşlukların doldurulmasına yardımcı olabilir. Otonom bir aracın hızla bir tepe noktasına yaklaştığı bir senaryoyu düşün. LiDAR ışınları tepe noktasının ötesindeki yola erişemeyerek ileride ne olduğu konusunda belirsizlik yaratabilir.

Bununla birlikte kamera tabanlı derinlik tahmini, perspektif ve doku gibi görsel ipuçlarından yolun şeklini yine de çıkarabilir ve LiDAR verileri kararlı hale gelene kadar aracın güvenilir algısını korumasına yardımcı olabilir. LiDAR ve monoküler derinlik tahmini birlikte, zorlu sürüş koşullarında daha kararlı algılama ve daha güvenli kontrol sağlar.

Otonom yarışlarda monoküler derinlik tahmininin kullanımını gösteren görselleştirme

Şekil 3. Otonom yarışlarda monoküler derinlik tahmininin kullanımını gösteren görselleştirme (Kaynak)

Robotik navigasyon ve engellerden kaçınma#

Robotlar çoğu zaman ayrıntılı haritaların bulunmadığı ve koşulların sürekli değiştiği yerlerde çalıştırılır. Güvenli hareket edebilmeleri için çevrelerinde ne kadar alan olduğunu ve engellerin nerede bulunduğunu güvenilir şekilde algılamaları gerekir.

Monoküler derinlik tahmini, ağır veya pahalı donanıma ihtiyaç duymadan tek bir RGB kamerayla bu uzamsal farkındalığı sağlayabilir. Derinlik tahmini modelleri ölçek ve perspektif gibi görsel ipuçlarını öğrenerek çevrenin yoğun derinlik haritalarını oluşturabilir. Bu, robotlara yüzeylere ve nesnelere olan uzaklık hakkında net bir görünüm sağlar.

Özellikle derinlik bilgisi nesne algılama ve anlamsal segmentasyon gibi bilgisayarlı görü görevleriyle birleştirildiğinde robotlar çevrelerinin daha eksiksiz bir görünümünü elde edebilir. Nesneleri tanımlayabilir, uzaklıklarını anlayabilir ve hareket etmenin güvenli olduğu yerlere karar verebilirler. Bu; engellerden kaçınmayı, boş alan algılamayı ve gerçek zamanlı yol planlamayı destekler.

Monoküler derinlik tahmini ve nesne algılama kullanılarak nesnelerin algılanması

Şekil 4. Monoküler derinlik tahmini ve nesne algılama kullanılarak nesnelerin algılanması (Kaynak)

Monoküler derinlik tahmininin artıları ve eksileri#

Monoküler derinlik tahmini kullanmanın başlıca avantajlarından bazıları şunlardır:

  • Hafif ve enerji verimli: Tek bir kamera kullanmak sistem ağırlığını ve güç tüketimini azaltır; bu, özellikle mobil robotlar, dronlar ve gömülü sistemler için önemlidir.
  • Sensör füzyonuna uygun: Monoküler derinlik; boşlukları doldurarak veya yedeklilik sağlayarak LiDAR veya radar gibi diğer sensörleri tamamlayabilir.
  • Birçok ortamda çalışır: Aynı kamera tabanlı yaklaşım, donanım değişikliği gerektirmeden iç ve dış mekanlarda ve farklı platformlarda kullanılabilir.

Monoküler derinlik tahmini önemli avantajlar sunsa da dikkate alınması gereken bazı sınırlamalar şunlardır:

  • Etkin sensörlere kıyasla daha düşük doğruluk: Hızla gelişiyor olsa da monoküler derinlik tahmini, kontrollü koşullarda genellikle LiDAR'ın veya yapılandırılmış ışık sensörlerinin mutlak doğruluğuna ulaşamaz.
  • Aydınlatma koşullarına duyarlılık: Düşük ışıklı ortamlarda, güçlü gölgelerde, parlamada veya dokunun zayıf olduğu sahnelerde performans düşebilir.
  • Genelleme zorlukları: Bir ortamda eğitilen model, uyarlama veya ince ayar yapılmadan daha önce görülmemiş alanlara her zaman güvenilir şekilde aktarılamayabilir.

Monoküler derinlik tahminine ne zaman güvenilmemeli?#

Monoküler derinlik tahmini ilgi çekici bir araştırma alanı olsa da pratikte nerelerde kullanılabileceğini ve nerelerde kullanılamayacağını anlamak önemlidir. Ürettiği uzaklıklar, gerçek dünyada alınmış kesin ölçümler değil, modelin bir görüntüde gördüklerine dayalı tahminlerdir.

Bu nedenle sonuçların kalitesi; aydınlatma, sahne karmaşıklığı ve sahnenin modelin eğitiminde kullanılan verilere ne kadar benzediği gibi etkenlere bağlı olarak değişebilir. Monoküler derinlik tahmini genellikle neyin daha yakın, neyin daha uzakta olduğunu belirlemede iyidir; ancak kesin uzaklıklara ihtiyaç duyduğunda güvenilir değildir.

Güvenliğin kritik olduğu sistemler, endüstriyel denetim veya nesnelerle çok hassas etkileşim kurması gereken robotlar gibi kesinliğin gerçekten önemli olduğu durumlarda derinlik doğrudan ölçülmelidir. LiDAR, radar, stereo kameralar veya yapılandırılmış ışık sistemleri gibi sensörler bunun için tasarlanmıştır ve çok daha güvenilir uzaklık bilgileri sağlar.

Monoküler derinlik tahmini, görsel açıdan zorlu koşullarda da zorlanabilir. Kötü aydınlatma, güçlü gölgeler, yansıtıcı veya saydam yüzeyler, sis, duman veya görsel dokunun çok az olduğu sahnelerin tümü derinlik tahminlerini daha az güvenilir hale getirebilir. Uzun mesafelerde derinlik tahmini yapmak da özel sensörlerin genellikle daha iyi çalıştığı başka bir durumdur.

Gerçek dünya çözümleri söz konusu olduğunda, tek kamerayla derinlik tahmini bağımsız bir çözümden ziyade destekleyici bir araç olarak en iyi şekilde çalışır. Yararlı mekânsal bağlam ekleyebilir, diğer sensörlerin sınırlı olduğu durumlarda eksikleri tamamlamaya yardımcı olabilir ve genel sahne anlayışını geliştirebilir. Ancak doğruluk, güvenlik veya katı güvenilirlik gereksinimleri önemli olduğunda tek derinlik bilgisi kaynağı olmamalıdır.

Önemli çıkarımlar#

Tek kamerayla derinlik tahmini, makinelerin yalnızca tek bir kamera görüntüsünü kullanarak nesnelerin ne kadar uzakta olduğunu tahmin etmesini sağlayan bir bilgisayarlı görü tekniğidir. Bu yapay zekâ modelleri perspektif, nesne boyutu, doku ve gölgelendirme gibi görsel ipuçlarını öğrenerek LiDAR veya stereo kameralar gibi sensörlere ihtiyaç duymadan bir sahnenin 3B yapısını çıkarabilir. Bu özellik, tek kamerayla derinlik tahminini otonom sürüş, robotik ve 3B sahne anlayışı gibi uygulamalar için uygun maliyetli ve ölçeklenebilir bir yaklaşım hâline getirir.

Görsel yapay zekâ hakkında daha fazla bilgi edinmek için GitHub depomuzu ziyaret et ve topluluğumuza katıl. Robotikte yapay zekâ ve üretimde bilgisayarlı görü hakkında bilgi edinmek için çözüm sayfalarımıza göz at. Bilgisayarlı görüye bugün başlamak için lisans seçeneklerimizi keşfet!

Explore solutions

Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin

Yapay zekânın geleceğini birlikte inşa edelim!

Makine öğreniminin geleceğiyle yolculuğuna başla