Görsel yapay zekâda görüntü eşleştirme nedir? Hızlı bir giriş
Görüntü yapay zekâsında görüntü eşleştirmenin nasıl çalıştığını öğren ve makinelerin görsel verileri algılamasına, karşılaştırmasına ve anlamasına yardımcı olan temel teknolojileri keşfet.

Aynı nesnenin iki resmine, örneğin bir araba resmiyle fotoğrafına baktığında, ortak noktalarını fark etmek kolaydır. Ancak makineler için bu o kadar basit değildir.
Bu tür karşılaştırmaları yapmak için makineler, görsel bilgileri yorumlamalarına ve anlamalarına yardımcı olan bir bilgisayarlı görü dalı olan yapay zekâ (AI) teknolojisine dayanır. Bilgisayarlı görü, sistemlerin nesneleri algılamasını, sahneleri anlamasını ve görüntü veya videolardan örüntüler çıkarmasını sağlar.
Özellikle bazı görsel görevler tek bir görüntüyü analiz etmenin ötesine geçer. Benzerlikleri bulmak, farklılıkları tespit etmek veya zaman içindeki değişimleri izlemek için görüntülerin karşılaştırılmasını gerektirir.
Görsel yapay zekâ çok çeşitli teknikleri kapsar ve görüntü eşleştirme olarak bilinen temel yeteneklerden biri, aydınlatma, açılar veya arka planlar değişse bile görüntüler arasındaki benzerlikleri belirlemeye odaklanır. Bu teknik robotik, artırılmış gerçeklik ve coğrafi haritalama gibi çeşitli uygulamalarda kullanılabilir.
Bu makalede görüntü eşleştirmenin ne olduğunu, temel tekniklerini ve gerçek dünyadaki bazı uygulamalarını inceleyeceğiz. Hadi başlayalım!
Görüntü eşleştirme nedir?#
Görüntü eşleştirme, bir bilgisayar sisteminin iki görüntünün benzer içerik barındırıp barındırmadığını anlamasını sağlar. İnsanlar bunu şekilleri, renkleri ve örüntüleri fark ederek sezgisel biçimde yapabilir.
Öte yandan bilgisayarlar sayısal verilere dayanır. Görüntüleri, dijital görüntünün en küçük birimi olan her bir pikseli inceleyerek analiz ederler.
Her görüntü bir piksel ızgarası olarak saklanır ve her piksel genellikle kırmızı, yeşil ve mavi (RGB) değerlerini içerir. Bu değerler görüntü döndürüldüğünde, yeniden boyutlandırıldığında, farklı bir açıdan görüntülendiğinde veya farklı aydınlatma koşullarında çekildiğinde değişebilir. Bu farklılıklar nedeniyle görüntüleri piksel piksel karşılaştırmak çoğu zaman güvenilir değildir.
Karşılaştırmaları daha tutarlı hâle getirmek için görüntü eşleştirme; bir görüntü biraz değişse bile sabit kalma eğilimindeki yerel özelliklere, yani köşelere, kenarlara ve dokulu bölgelere odaklanır. Bir sistem, bu özellikleri veya kilit noktaları birden fazla görüntüde tespit ederek çok daha yüksek doğrulukla karşılaştırabilir.
Bu süreç navigasyon, konumlandırma, artırılmış gerçeklik, haritalama, 3B yeniden yapılandırma ve görsel arama gibi kullanım alanlarında yaygın olarak kullanılır. Sistemler farklı görüntülerde veya birden fazla karede aynı noktaları belirlediğinde hareketi izleyebilir, sahne yapısını anlayabilir ve dinamik ortamlarda güvenilir kararlar verebilir.

Şekil 1. Benzer kilit noktaların belirlendiği araba görüntüsü eşleştirmesine bir örnek. (Kaynak)
Görüntü eşleştirmenin nasıl çalıştığını anlama#
Görüntü eşleştirme, sistemlerin görüntüler içindeki benzer bölgeleri belirleyip karşılaştırmasına yardımcı olan birkaç temel adımı içerir. Her adım, farklı koşullarda doğruluğu, tutarlılığı ve dayanıklılığı artırır.
Görüntü eşleştirmenin nasıl çalıştığına adım adım bakalım:
- Özellik algılama: Sistem ilk olarak, aydınlatma, ölçek veya görüş açısı değiştiğinde bile sabit kalan ayırt edici kilit noktaları görüntüde belirler. Bu noktalar, görsel olarak öne çıkan köşe, kenar veya dokulu bölge gibi alanları vurgular.
- Özellik tanımlama: Her kilit nokta daha sonra, o noktanın çevresindeki görsel örüntüyü yakalayan kompakt bir sayısal vektör olan tanımlayıcıya dönüştürülür. Bu tanımlayıcılar, farklı görüntülerdeki özellikleri karşılaştırmak için güvenilir bir yöntem sağlar.
- Özellik eşleştirme: İki görüntünün tanımlayıcıları, ne kadar benzer olduklarını hesaplayan eşleştirme algoritmaları kullanılarak karşılaştırılır. Bu adım, birbirine karşılık geldiği görülen kilit noktaları eşleştirir ve daha zayıf veya güvenilmez eşleşmeleri filtreler.
- Geometrik doğrulama: Son olarak sistem, eşleşen kilit noktaların gerçekçi bir geometrik ilişki oluşturup oluşturmadığını kontrol eder. Yalnızca güvenilir nokta çiftlerinin tutulmasını sağlayan RANSAC (Rastgele Örnek Uzlaşması) olarak bilinen bir yöntemle hatalı eşleşmeleri (aykırı değerleri) kaldırır. İyi eşleşmeler belirlendikten sonra sistem, iki görüntüyü en iyi şekilde ilişkilendiren dönüşümü tahmin eder. Bu dönüşüm çoğu zaman ölçekleme, döndürme ve kaydırma gibi değişiklikleri düzelten bir afin dönüşüm veya perspektif değişikliklerini de ele alabilen bir homografidir. Bu dönüşümleri kullanmak, görüntüler biraz farklı bakış açılarından çekilmiş olsa bile sistemin görüntüleri doğru şekilde hizalamasını sağlar.

Şekil 2. (a) Özellik noktası çıkarma ve (b) özellik eşleştirme. (Kaynak)
Görüntü eşleştirmede kullanılan temel teknikler#
Görüntü eşleştirmenin gerçek dünyadaki uygulamalarını incelemeden önce, bilgisayarlı görü sistemlerinde kullanılan görüntü eşleştirme tekniklerine daha yakından bakalım.
Şablon eşleştirmeye dayalı görüntü eşleştirme#
Şablon eşleştirme, en basit görüntü eşleştirme yöntemlerinden biridir. Doğrudan piksel karşılaştırmalarına dayandığı ve daha derin görsel özellikleri çıkarmadığı için genellikle modern bir bilgisayarlı görü yöntemi yerine bir görüntü işleme tekniği olarak kabul edilir.
Daha büyük bir sahne içinde daha küçük bir referans görüntüyü veya şablonu bulmak için kullanılır. Bir algoritma, şablonu ana görüntü üzerinde kaydırır ve iki bölgenin ne kadar örtüştüğünü ölçmek için her konumda bir benzerlik puanı hesaplar. En yüksek puana sahip alan en iyi eşleşme olarak kabul edilir ve nesnenin sahnede görünme olasılığının en yüksek olduğu yeri gösterir.

Şekil 3. Şablon eşleştirmenin kullanımına bir bakış. (Kaynak)
Bu teknik, nesnenin ölçeği, dönüşü ve aydınlatması tutarlı kaldığında iyi çalışır; bu da onu kontrollü ortamlar veya temel karşılaştırmalar için uygun bir seçenek hâline getirir. Ancak nesne şablondakinden farklı göründüğünde (örneğin boyutu değiştiğinde, döndürüldüğünde, kısmen örtüldüğünde ya da gürültülü veya karmaşık bir arka planda göründüğünde) performansı düşer.
Görüntü eşleştirme için klasik özellik tabanlı teknikler#
Derin öğrenme yaygın olarak benimsenmeden önce görüntü eşleştirme, çoğunlukla bir görüntüdeki ayırt edici kilit noktaları tespit eden klasik bilgisayarlı görü algoritmalarına dayanıyordu. Bu yöntemler her pikseli karşılaştırmak yerine köşeleri, kenarları ve öne çıkan dokulu bölgeleri vurgulamak için görüntü gradyanlarını, yani yoğunluk değişimlerini analiz eder.
Daha sonra tespit edilen her kilit nokta, tanımlayıcı adı verilen kompakt bir sayısal özet kullanılarak temsil edilir. İki görüntü karşılaştırılırken eşleştirici, en benzer çiftleri bulmak için bu tanımlayıcıları değerlendirir.
Yüksek bir benzerlik puanı genellikle aynı fiziksel noktanın her iki görüntüde de bulunduğunu gösterir. Eşleştiriciler ayrıca özelliklerin ne kadar iyi hizalandığını değerlendirmek için belirli mesafe ölçütleri veya puanlama kuralları kullanarak genel güvenilirliği artırır.
Görüntü eşleştirmede kullanılan temel klasik bilgisayarlı görü algoritmalarından bazıları şunlardır:
-
SIFT (Ölçekten Bağımsız Öznitelik Dönüşümü): Görüntü yoğunluğu gradyanlarını analiz ederek kilit noktaları belirler ve görüntü büyütüldüğünde, küçültüldüğünde veya döndürüldüğünde bu noktaların tanınabilir kalmasını sağlar.
-
SURF (Hızlandırılmış Sağlam Özellikler): Bu algoritma SIFT'e benzer ancak hız için optimize edilmiştir. Gradyan tabanlı işlemlerin hızlı yaklaşımlarını kullanır ve bu sayede hızlı yanıt süreleri gerektiren uygulamalar için uygun hâle gelir.
-
ORB (Yönlendirilmiş FAST ve Döndürülmüş BRIEF): FAST ve BRIEF adlı iki algoritmayı bir araya getirir. FAST, görüntüde köşeye benzeyen noktaları hızla bulurken BRIEF, bu noktaların görüntüler arasında eşleştirilebilmesi için her biri hakkında kompakt bir tanım oluşturur. ORB ayrıca döndürmeyi ele alarak her iki adımı geliştirir ve hızlı ve güvenilir bir yöntem sunar.

Şekil 4. İki görüntü arasında çıkarılan ve eşleştirilen SURF özellik noktaları. (Kaynak)
Görüntü eşleştirme için derin öğrenme tabanlı teknikler#
Belirli kurallara dayanan klasik yöntemlerin aksine derin öğrenme, yapay zekâ modellerinin örüntüleri öğrendiği görsel veri koleksiyonları olan büyük veri kümelerinden özellikleri otomatik olarak öğrenir. Bu modeller genellikle büyük görüntü gruplarını işlemek ve karmaşık sinir ağlarını verimli biçimde eğitmek için gereken yüksek hesaplama gücünü sağlayan GPU'larda (Grafik İşlem Birimleri) çalışır.
Bu sayede yapay zekâ modelleri aydınlatma, kamera açıları ve örtülme gibi gerçek dünya değişikliklerinin üstesinden gelebilir. Bazı modeller tüm adımları tek bir iş akışında da birleştirerek zorlu koşullarda sağlam performans sunar.
Görüntü özelliklerinin çıkarılması ve eşleştirilmesi için bazı derin öğrenme tabanlı yaklaşımlar şunlardır:
-
CNN tabanlı özellik çıkarma: Bu modeller büyük veri kümelerinden temel görsel örüntüleri otomatik olarak öğrenir. Değişme olasılığı düşük özellikleri tanıyarak farklı sahnelerdeki nesneleri eşleştirmede güvenilir sonuç verir.
-
Gömme tabanlı eşleştirme: Bu yöntem, pikselleri doğrudan karşılaştırmak yerine görüntüleri gömme adı verilen kompakt sayısal temsillere dönüştürür. Eşleştirici daha sonra benzer görselleri bulmak için bu gömmeleri karşılaştırır. Yüzleri tanımak ve karşılaştırmak için gömmeler oluşturan FaceNet ile görüntüleri ve metinleri görüntü arama ve anlamsal eşleştirme gibi görevler için ortak bir uzaya taşıyan CLIP gibi modeller bu yaklaşımı izler.
-
Uçtan uca eşleştirme işlem hatları: En gelişmiş derin öğrenme sistemleri genellikle kilit noktaların algılanmasını, tanımlanmasını ve eşleştirilmesini birleşik bir iş akışında bir araya getirir. SuperPoint ve D2-Net gibi modeller hem kilit noktaları hem de tanımlayıcıları doğrudan CNN özellik haritalarından öğrenirken SuperGlue, bu tanımlayıcıları geleneksel yöntemlerden daha güvenilir biçimde eşleştiren öğrenilmiş bir eşleştirici olarak görev yapar. Bu bileşenler birlikte, zorlu koşullarda klasik özellik tabanlı yaklaşımlara kıyasla daha yüksek doğruluk ve daha fazla dayanıklılık sağlayan uçtan uca bir işlem hattı oluşturur.
-
Transformer tabanlı eşleştirme: Bu yöntem, iki görüntüdeki karşılık gelen bölgeleri ilişkilendirmek için dikkat mekanizmalarını kullanır ve güçlü görüş açısı, aydınlatma veya doku değişikliklerinde bile parçaları hizalayabilir. LoFTR (Yerel Özellik Transformer'ı) gibi modeller, Transformer'ın küresel alıcı alanı sayesinde geleneksel algılayıcıların başarısız olduğu düşük dokulu, bulanık veya tekrarlı bölgelerde güvenilir eşleştirme yapabildiği için çok daha yüksek doğruluk elde eder. LoFTR, yarı yoğun ve yüksek güvenli eşleşmeler üretir ve hem iç hem de dış mekân kıyaslamalarında önceki en iyi yöntemleri büyük farkla geride bırakır.
-
Verimlilik odaklı modeller: Daha yeni görüntü eşleştirme modelleri daha hızlı çalışırken yüksek doğruluk sunmayı amaçlar. LightGlue gibi modeller, iyi eşleştirme kalitesini korurken sınırlı hesaplama gücüne sahip cihazlarda verimli çalışacak şekilde tasarlanmıştır.
Görüntü eşleştirmenin gerçek dünyadaki uygulamaları#
Görüntü eşleştirmenin nasıl çalıştığını artık daha iyi anladığımıza göre, önemli bir rol oynadığı bazı gerçek dünya uygulamalarına bakalım.
Görüntü eşleştirmeyle güçlenen daha akıllı robotik#
Robotlar çoğu zaman yoğun ve değişken ortamlarda çalışır; bu ortamlarda hangi nesnelerin bulunduğunu ve nasıl konumlandıklarını anlamaları gerekir. Görüntü eşleştirme, robotların gördükleri nesneleri saklanan veya referans görüntülerle karşılaştırarak anlamasına yardımcı olabilir. Bu, robotların nesneleri tanımasını, hareketlerini izlemesini ve aydınlatma veya kamera açıları değişse bile uyum sağlamasını kolaylaştırır.
Örneğin bir depoda robotik bir al ve yerleştir sistemi, farklı öğeleri belirlemek ve taşımak için görüntü eşleştirmeyi kullanabilir. Robot önce bir nesneyi alır, ardından nesneyi tanımlamak için görüntüsünü referans örneklerle karşılaştırır.

Şekil 5. Bir robot, nesneleri referans görüntülerle eşleştirerek tanır ve alır. (Kaynak)
Eşleşme bulunduğunda robot, nesneyi nasıl doğru şekilde ayıracağını veya yerleştireceğini bilir. Bu yaklaşım, robotların tüm sistemi yeniden eğitmeden hem tanıdık hem de yeni nesneleri tanımasını sağlar. Ayrıca rafları düzenlemek, parçaları birleştirmek veya öğeleri yeniden yerleştirmek gibi daha iyi gerçek zamanlı kararlar almalarına yardımcı olur.
Daha iyi görüntü eşleştirmeyle 3B yeniden yapılandırmayı geliştirme#
Drone haritalama, sanal gerçeklik ve bina denetimi gibi alanlarda sistemlerin çoğu zaman birden fazla 2B görüntüden 3B model oluşturması gerekir. Bunu yapmak için birkaç görüntüde görünen köşeler veya dokulu bölgeler gibi ortak kilit noktaları belirlemek üzere görüntü eşleştirmeye dayanırlar.
Bu ortak noktalar, sistemin görüntülerin 3B uzayda birbirleriyle nasıl ilişkili olduğunu anlamasına yardımcı olur. Bu fikir, farklı bakış açılarından çekilen görüntülerdeki kilit noktaları belirleyip eşleştirerek 3B yapılar oluşturan Structure from Motion (SfM) tekniğiyle yakından ilişkilidir.
Eşleştirme doğru değilse ortaya çıkan 3B model bozulmuş veya eksik görünebilir. Bu nedenle araştırmacılar, 3B yeniden yapılandırma için görüntü eşleştirmenin güvenilirliğini artırmak üzere çalışıyor ve son gelişmeler umut verici sonuçlar gösteriyor.
İlginç bir örnek, daha hızlı ve daha dayanıklı bir görüntü eşleştirme algoritması olan HashMatch'tir. HashMatch, görüntü ayrıntılarını karma kodları adı verilen kompakt örüntülere dönüştürür; bu da aydınlatma veya bakış açıları değişse bile doğru eşleşmeleri belirlemeyi ve aykırı değerleri kaldırmayı kolaylaştırır.
Büyük ölçekli veri kümelerinde test edildiğinde HashMatch, daha az hizalama hatasıyla daha temiz ve daha gerçekçi 3B yeniden yapılandırma modelleri üretti. Bu özellik, onu hassasiyetin kritik olduğu drone haritalama, AR sistemleri ve kültürel mirasın korunması gibi uygulamalar için özellikle kullanışlı hâle getirir.
Artırılmış gerçeklikte görüntü eşleştirmenin rolü#
Artırılmış gerçeklik (AR) söz konusu olduğunda sanal nesneleri gerçek dünyayla hizalı tutmak çoğu zaman zordur. Dış ortamlar güneş ışığı ve hava durumu gibi çevresel koşullara bağlı olarak sürekli değişebilir. Gerçek dünyadaki küçük farklılıklar, sanal öğelerin kararsız veya biraz yanlış konumlanmış görünmesine neden olabilir.
AR sistemleri bu sorunu çözmek için çevrelerini yorumlamak üzere görüntü eşleştirmeyi kullanır. Canlı kamera karelerini saklanan referans görüntülerle karşılaştırarak kullanıcının nerede olduğunu ve sahnenin nasıl değiştiğini anlayabilirler.

Şekil 6. İki görüntü arasında eşleştirilen özellik noktaları. (Kaynak: theijes.com)
Örneğin askeri tarzda dış mekân AR eğitimi ve XR (Genişletilmiş Gerçeklik) gözlüklerini içeren bir çalışmada araştırmacılar, gerçek ve referans görüntüler arasındaki görsel ayrıntıları eşleştirmek için SIFT ve diğer özellik tabanlı yöntemleri kullandı. Doğru eşleşmeler, kullanıcı hızlı hareket ettiğinde veya aydınlatma değiştiğinde bile sanal öğelerin gerçek dünyayla doğru şekilde hizalanmasını sağladı.
Önemli çıkarımlar#
Görüntü eşleştirme, bilgisayarlı görünün temel bir bileşenidir ve sistemlerin farklı görüntülerin birbirleriyle nasıl ilişkili olduğunu veya bir sahnenin zaman içinde nasıl değiştiğini anlamasını sağlar. Hassasiyet ve kararlılığın önemli olduğu robotik, artırılmış gerçeklik, 3B yeniden yapılandırma, otonom navigasyon ve diğer birçok gerçek dünya uygulamasında kritik bir rol oynar.
SuperPoint ve LoFTR gibi gelişmiş yapay zekâ modelleri sayesinde günümüz sistemleri önceki yöntemlere kıyasla çok daha dayanıklı hâle geliyor. Makine öğrenimi teknikleri, özel görsel modüller, sinir ağları ve veri kümeleri gelişmeye devam ettikçe görüntü eşleştirmenin daha hızlı, daha doğru ve daha uyarlanabilir hâle gelmesi muhtemeldir.
Büyüyen topluluğumuza katıl ve uygulamalı yapay zekâ kaynakları için GitHub depomuzu incele. Günümüzde görsel yapay zekâ ile geliştirme yapmak için lisanslama seçeneklerimizi keşfet. Tarımda yapay zekânın tarımı nasıl dönüştürdüğünü ve sağlık hizmetlerinde Görsel Yapay Zekânın geleceği nasıl şekillendirdiğini çözümler sayfalarımızı ziyaret ederek öğren.









