Ultralytics YOLO27:
Görüntü Yapay Zekâsı

Mask R-CNN nedir ve nasıl çalışır?

Mask R-CNN'nin çeşitli sektörlerdeki farklı uygulamalar için görüntü ve videolardaki nesneleri hassas biçimde segmentlere ayırmak üzere nasıl kullanılabileceğini öğren.

ABAbirami Vina7 min read
Mask R-CNN ile örnek segmentasyonu

Yapay zekânın benimsenmesi arttıkça depolardaki robotlar, yoğun caddelerde güvenle ilerleyen otonom araçlar, mahsulleri kontrol eden dronlar ve fabrikalarda ürünleri denetleyen yapay zekâ sistemleri gibi yenilikler daha yaygın hâle geliyor. Bu yenilikleri destekleyen temel teknolojilerden biri, makinelerin görsel verileri anlamasını ve yorumlamasını sağlayan bir yapay zekâ dalı olan computer vision teknolojisidir.

Örneğin nesne algılama, görüntülerdeki nesneleri sınırlayıcı kutuları kullanarak tanımlamaya ve konumlandırmaya yardımcı olan bir computer vision görevidir. Sınırlayıcı kutular yararlı bilgiler sunsa da yalnızca bir nesnenin konumu için kabaca bir tahmin sağlar ve nesnenin tam şeklini veya sınırlarını yakalayamaz. Bu durum, onları hassas tanımlama gerektiren uygulamalarda daha az etkili kılar.

Bu sorunu çözmek için araştırmacılar, nesnelerin tam hatlarını yakalayan ve daha doğru algılama ve analiz için piksel düzeyinde ayrıntılar sağlayan segmentasyon modelleri geliştirdi.

Mask R-CNN bu modellerden biridir. Facebook Yapay Zekâ Araştırma (FAIR) tarafından 2017'de tanıtılan bu model, R-CNN, Fast R-CNN ve Faster R-CNN gibi önceki modelleri temel alır. Computer vision tarihindeki önemli bir dönüm noktası olan Mask R-CNN, Ultralytics YOLO11 gibi daha gelişmiş modellerin önünü açmıştır.

Bu makalede Mask R-CNN'nin ne olduğunu, nasıl çalıştığını, uygulamalarını ve ardından gelen, Ultralytics YOLO11'e uzanan geliştirmeleri inceleyeceğiz.

Mask R-CNN'ye genel bakış#

Mask R-CNN, nesne algılama ve örnek segmentasyonu gibi computer vision görevleri için tasarlanmış bir derin öğrenme modelidir.

Örnek segmentasyonu, bir görüntüdeki nesneleri yalnızca tanımlamakla kalmayıp her birinin hatlarını doğru şekilde belirleyerek geleneksel nesne algılamanın ötesine geçer. Algılanan her nesneye benzersiz bir etiket atar ve nesnenin tam şeklini piksel düzeyinde yakalar. Bu ayrıntılı yaklaşım, üst üste binen nesneleri net biçimde ayırt etmeyi ve karmaşık şekilleri doğru şekilde işlemeyi mümkün kılar.

Mask R-CNN, nesneleri algılayıp etiketleyen ancak tam şekillerini belirlemeyen Faster R-CNN'yi temel alır. Mask R-CNN, her nesneyi oluşturan tam pikselleri tanımlayarak bunu geliştirir ve çok daha ayrıntılı ve doğru görüntü analizi sağlar.

Nesne algılama ve örnek segmentasyonunun karşılaştırması

Şekil 1. Nesne algılama ve örnek segmentasyonunun karşılaştırılması.

Mask R-CNN'nin mimarisine ve çalışma şekline bakış#

Mask R-CNN, nesneleri doğru şekilde algılamak ve segmentlere ayırmak için adım adım ilerler. İlk olarak derin bir sinir ağı (verilerden öğrenen çok katmanlı bir model) kullanarak temel özellikleri çıkarır, ardından bir bölge öneri ağı (olası nesne bölgelerini öneren bir bileşen) ile potansiyel nesne alanlarını belirler ve son olarak her nesnenin tam şeklini yakalayan ayrıntılı segmentasyon maskeleri (nesnelerin hassas hatları) oluşturarak bu alanları iyileştirir.

Şimdi Mask R-CNN'nin nasıl çalıştığını daha iyi anlamak için her adımı inceleyeceğiz.

Mask R-CNN mimarisine genel bakış

Şekil 2. Mask R-CNN mimarisine genel bakış (Kaynak: researchgate.net).

Özellik çıkarımıyla başlamak#

Mask R-CNN mimarisinin ilk adımı, modelin görüntüde ne olduğunu anlayabilmesi için görüntüyü temel parçalarına ayırmaktır. Bunu, bir fotoğrafa baktığında şekiller, renkler ve kenarlar gibi ayrıntıları doğal olarak fark etmene benzetebilirsin. Model de benzer bir işlemi, görüntüyü tarayıp temel ayrıntıları yakalayan ve gözleri gibi görev yapan, "backbone" adı verilen (genellikle ResNet-50 veya ResNet-101) derin bir sinir ağı kullanarak gerçekleştirir.

Görüntülerdeki nesneler çok küçük veya çok büyük olabildiğinden Mask R-CNN, Feature Pyramid Network kullanır. Bu, modelin hem ince ayrıntıları hem de genel görünümü görebilmesini sağlayan farklı büyüteçlere sahip olmaya benzer ve böylece her boyuttaki nesnenin fark edilmesini güvence altına alır.

Bu önemli özellikler çıkarıldıktan sonra model, görüntüdeki potansiyel nesneleri bulmaya geçerek sonraki analiz için zemin hazırlar.

Görüntüde nesne içerebilecek alanları önerme#

Görüntü temel özellikler açısından işlendikten sonra Region Proposal Network devreye girer. Modelin bu bölümü görüntüyü inceleyerek nesne içerme olasılığı yüksek alanları önerir.

Bunu, anchor adı verilen birden fazla olası nesne konumu oluşturarak yapar. Ağ daha sonra bu anchor'ları değerlendirir ve ileri analiz için en umut verici olanları seçer. Böylece model, görüntüdeki her noktayı kontrol etmek yerine yalnızca ilgi çekme olasılığı en yüksek alanlara odaklanır.

Region Proposal Network şeması

Şekil 3. Region Proposal Network örneği.

Çıkarılan özellikleri geliştirme#

Temel alanlar belirlendikten sonraki adım, bu bölgelerden çıkarılan ayrıntıları iyileştirmektir. Önceki modeller, her alandan özellikleri almak için ROI Pooling (İlgi Bölgesi Havuzlama) adı verilen bir yöntem kullanıyordu; ancak bu teknik, bölgeleri yeniden boyutlandırırken bazen küçük hizalama hatalarına yol açıyor ve özellikle daha küçük veya üst üste binen nesnelerde daha az etkili oluyordu.

Mask R-CNN, ROI Align (İlgi Bölgesi Hizalama) adı verilen bir teknik kullanarak bunu geliştirir. ROI Pooling'in yaptığı gibi koordinatları yuvarlamak yerine ROI Align, piksel değerlerini daha hassas tahmin etmek için bilineer enterpolasyon kullanır. Bilineer enterpolasyon, dört en yakın komşusunun değerlerinin ortalamasını alarak yeni bir piksel değeri hesaplayan ve daha yumuşak geçişler oluşturan bir yöntemdir. Bu, özelliklerin orijinal görüntüyle düzgün biçimde hizalanmasını sağlar ve daha doğru nesne algılama ve segmentasyonla sonuçlanır.

Örneğin bir futbol maçında, birbirine yakın duran iki oyuncu, sınırlayıcı kutuları üst üste bindiği için birbiriyle karıştırılabilir. ROI Align, şekillerini birbirinden ayrı tutarak onları ayırmaya yardımcı olur.

Mask R-CNN'nin ROI Align kullanma şeklinin şeması

Şekil 4. Mask R-CNN, ROI Align kullanır.

Nesneleri sınıflandırma ve maskelerini tahmin etme#

ROI Align görüntüyü işledikten sonra sıradaki adım, nesneleri sınıflandırmak ve konumlarını hassaslaştırmaktır. Model, çıkarılan her bölgeyi inceler ve hangi nesneyi içerdiğine karar verir. Farklı kategorilere bir olasılık skoru atar ve en uygun eşleşmeyi seçer.

Aynı zamanda sınırlayıcı kutuları nesnelere daha iyi uyacak şekilde ayarlar. İlk kutular ideal konumda olmayabilir; bu nedenle her kutunun algılanan nesneyi sıkı biçimde çevrelemesini sağlayarak doğruluğu artırır.

Son olarak Mask R-CNN, her nesne için paralel olarak ayrıntılı bir segmentasyon maskesi oluşturur.

Mask R-CNN ve gerçek zamanlı uygulamaları#

Bu model piyasaya çıktığında yapay zekâ topluluğunda büyük bir heyecan yarattı ve kısa sürede çeşitli uygulamalarda kullanılmaya başlandı. Nesneleri gerçek zamanlı olarak algılayıp segmentlere ayırabilmesi, farklı sektörlerde oyunun kurallarını değiştirdi.

Örneğin vahşi doğada nesli tükenmekte olan hayvanları takip etmek zorlu bir görevdir. Birçok tür yoğun ormanlarda hareket eder ve bu da korumacıların onları takip etmesini zorlaştırır. Geleneksel yöntemlerde kamera tuzakları, dronlar ve uydu görüntüleri kullanılır; ancak tüm bu verileri elle ayıklamak zaman alır. Yanlış tanımlamalar ve gözden kaçan görüntüler, koruma çalışmalarını yavaşlatabilir.

Mask R-CNN, kaplan çizgileri, zürafa benekleri veya fil kulaklarının şekli gibi benzersiz özellikleri tanıyarak görüntü ve videolardaki hayvanları daha yüksek doğrulukla algılayıp segmentlere ayırabilir. Hayvanlar ağaçlar tarafından kısmen gizlense veya birbirine yakın dursa bile model onları ayırabilir ve her birini ayrı ayrı tanımlayabilir; bu da yaban hayatı izlemeyi daha hızlı ve güvenilir hâle getirir.

Mask R-CNN kullanarak hayvanları algılama ve segmentlere ayırma

Şekil 5. Mask R-CNN kullanarak hayvanları algılama ve segmentlere ayırma.

Mask R-CNN'nin sınırlamaları#

Nesne algılama ve segmentasyon alanındaki tarihsel önemine rağmen Mask R-CNN'nin bazı önemli dezavantajları da vardır. Mask R-CNN ile ilgili bazı zorluklar şunlardır:

  • Yüksek hesaplama gereksinimi: Güçlü GPU'lara ihtiyaç duyar; bu da çalıştırılmasını maliyetli hâle getirebilir ve büyük miktarda veriyi işlerken yavaşlamasına neden olabilir.
  • Daha düşük işleme hızı: Çok aşamalı süreci, YOLO gibi daha hızlı gerçek zamanlı modellere kıyasla daha yavaş çalışmasına neden olur; bu da zamanın kritik olduğu görevler için ideal olmayabilir.
  • Yüksek kaliteli verilere bağımlılık: Model, en iyi performansı net ve iyi etiketlenmiş görüntülerle gösterir. Bulanık veya kötü aydınlatılmış görüntüler doğruluğunu önemli ölçüde azaltabilir.
  • Karmaşık uygulama: Çok aşamalı mimariyi kurmak ve optimize etmek, özellikle büyük veri kümeleriyle veya sınırlı kaynaklarla çalışırken zor olabilir.

Mask R-CNN'den Ultralytics YOLO11'e#

Mask R-CNN segmentasyon görevlerinde başarılıydı; ancak birçok sektör, hız ve gerçek zamanlı performansa öncelik verirken computer vision teknolojisini benimsemek istiyordu. Bu gereksinim, nesneleri tek geçişte algılayan ve verimliliği büyük ölçüde artıran tek aşamalı modeller geliştirmeleri için araştırmacıları teşvik etti.

Mask R-CNN'nin çok adımlı sürecinin aksine YOLO (You Only Look Once) gibi tek aşamalı computer vision modelleri gerçek zamanlı computer vision görevlerine odaklanır. YOLO modelleri, algılama ve segmentasyonu ayrı ayrı gerçekleştirmek yerine bir görüntüyü tek seferde analiz edebilir. Bu özellik, hızlı karar vermenin kritik olduğu otonom sürüş, sağlık hizmetleri, üretim ve robotik gibi uygulamalar için onları ideal kılar.

Özellikle Ultralytics YOLO11, hem hızlı hem de doğru olarak bunu bir adım ileri taşır. YOLOv8m'den %22 daha az parametre kullanmasına rağmen COCO veri kümesinde daha yüksek ortalama ortalama kesinlik (mAP) değerine ulaşır; bu da nesneleri daha hassas algıladığı anlamına gelir. Geliştirilmiş işleme hızı, her milisaniyenin önemli olduğu gerçek zamanlı uygulamalar için onu iyi bir seçenek hâline getirir.

Ultralytics YOLO11'in diğer modellerle karşılaştırmalı performansı

Şekil 6. YOLO11'in diğer modellerle karşılaştırmalı performansı.

Önemli çıkarımlar#

Computer vision tarihine baktığımızda Mask R-CNN, nesne algılama ve segmentasyon alanında önemli bir atılım olarak kabul edilir. Ayrıntılı çok adımlı süreci sayesinde karmaşık ortamlarda bile oldukça hassas sonuçlar sunar.

Ancak aynı süreç, YOLO gibi gerçek zamanlı modellere kıyasla daha yavaş olmasına neden olur. Hız ve verimlilik ihtiyacı arttıkça birçok uygulama, hızlı ve doğru nesne algılama sunan Ultralytics YOLO11 gibi tek aşamalı modelleri kullanıyor. Mask R-CNN, computer vision teknolojisinin evrimini anlamak açısından önemli olsa da gerçek zamanlı çözümlere yönelim, daha hızlı ve verimli computer vision çözümlerine yönelik artan talebi ortaya koyuyor.

Büyüyen topluluğumuza katıl! Yapay zekâ hakkında daha fazla bilgi edinmek için GitHub depomuzu keşfet. Kendi computer vision projene başlamaya hazır mısın? Lisans seçeneklerimize göz at. Çözüm sayfalarımızı ziyaret ederek tarımda yapay zekâyı ve sağlık hizmetlerinde vision AI teknolojisini keşfet!

Explore solutions

Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin

Yapay zekânın geleceğini birlikte inşa edelim!

Makine öğreniminin geleceğiyle yolculuğuna başla