Nesne algılamada ortalama hassasiyet (mAP)
Nesne Algılamada Ortalama Hassasiyetin (mAP) ne anlama geldiğini anla. Bunun anlamını, hesaplanmasını ve mAP'nin model performansını değerlendirmek için neden önemli olduğunu öğren.

Yapay zeka benimsenmesi hızla artıyor ve yapay zeka; otonom araçlardan raftaki ürünleri tanımlayabilen perakende sistemlerine kadar çeşitli yeniliklere entegre ediliyor. Bu teknolojiler, makinelerin görsel verileri analiz etmesini sağlayan bir yapay zeka (AI) kolu olan computer vision alanına dayanmaktadır.
Bilgisayarlı görü sistemlerinin ve algoritmalarının doğruluğunu ölçmek için kullanılan temel bir değerlendirme metriği ortalama duyarlılıktır (mAP). mAP metriği, bir görü yapay zeka modelinin tahmininin gerçek dünya sonuçlarıyla ne kadar yakından eşleştiğini gösterir.
Yaygın bir computer vision görevi, bir modelin bir görüntünün içindeki birden fazla nesneyi tanımladığı ve bunların etrafına sınırlayıcı kutular çizdiği nesne tespiti (object detection) işlemidir. mAP, nesne tespiti modellerinin performansını değerlendirmek için kullanılan standart metriktir ve Ultralytics YOLO11 gibi derin öğrenme modellerini kıyaslamak için yaygın olarak kullanılır.
Bu makalede, ortalama duyarlılığın nasıl hesaplandığını ve nesne algılama modelleri eğiten veya değerlendiren herkes için neden önemli olduğunu göreceğiz. Hadi başlayalım!
Ortalama duyarlılık (mAP) nedir?#
Mean average precision, bir görüntüdeki farklı nesneleri tespit edip tanımlama gibi görsel bilgi erişimiyle ilgili görevlerde bir derin öğrenme modelinin ne kadar doğru olduğunu gösteren bir puandır. Örneğin, bir köpeğin, bir kedinin ve bir arabanın fotoğrafını analiz eden bir object detection modelini ele alalım. Güvenilir bir model; her nesneyi tanıyarak, nerede olduğunu ve ne olduğunu vurgulayan sınırlayıcı kutular ve etiketler çizerek object detection gerçekleştirebilir.
mAP, modelin bu görevi birçok görüntü ve farklı nesne türü üzerinde ne kadar iyi gerçekleştirdiğini gösterir. Modelin her nesneyi ve görüntü içindeki konumunu doğru bir şekilde tanımlayıp tanımlamadığını kontrol eder. Puan 0 ile 1 arasında değişir; bir, modelin her şeyi mükemmel bir şekilde bulduğu anlamına gelirken, sıfır ise hiçbir nesneyi algılayamadığı anlamına gelir.
Ortalama duyarlılıktaki (mAP) temel kavramlar#
Makine öğreniminde ortalama duyarlılığın arkasındaki kavramları keşfetmeden önce, iki temel terimi daha iyi anlayalım: gerçek değerler (ground truth) ve tahminler.
Gerçek değerler (ground truth), görüntüdeki nesnelerin ve konumlarının insanlar tarafından açıklama (annotation) olarak bilinen bir süreçle dikkatlice etiketlendiği doğru referans verilerini ifade eder. Bu arada tahminler, yapay zeka modellerinin bir görüntüyü analiz ettikten sonra verdiği sonuçlardır. Yapay zeka modelinin tahminlerini gerçek değerlerle karşılaştırarak, modelin doğru sonuçlara ne kadar yaklaştığını ölçebiliriz.

Şekil 1. Model tahmini ve gerçek değer sınırlayıcı kutular. Görsel yazar tarafından hazırlanmıştır.
Karmaşıklık matrisi (Confusion matrix)#
Bir object detection modelinin ne kadar hassas olduğunu anlamak için genellikle bir confusion matrix kullanılır. Bu tablo, modelin tahminlerinin gerçek doğru cevaplarla (ground truth) nasıl eşleştiğini gösterir. Bu tablodan dört temel bileşenin veya sonucun dökümünü elde edebiliriz: true positives, false positives, false negatives ve true negatives.
İşte bu bileşenlerin karmaşıklık matrisinde temsil ettikleri:
- Doğru pozitif (TP): Bir nesne ve konumu, model tarafından doğru bir şekilde algılanmıştır.
- Yanlış pozitif (FP): Model bir algılama yapmıştır, ancak bu yanlıştır.
- Yanlış negatif (FN): Aslında görüntüde bulunan bir nesne, ancak model bunu algılayamamıştır.
- Doğru negatif (TN): Doğru negatifler, model bir nesnenin yokluğunu doğru bir şekilde tanımladığında meydana gelir.
True negatives, bir görüntüdeki birçok boş alanı genellikle göz ardı ettiğimiz için object detection içinde yaygın olarak kullanılmaz. Ancak bu, modelin görüntüye bir etiket atadığı image classification gibi diğer computer vision görevlerinde esastır. Örneğin, görev bir görüntünün kedi içerip içermediğini tespit etmekse ve model görüntüde kedi olmadığında doğru bir şekilde "kedi yok" tanımlaması yaparsa, bu bir true negative'dir.

Şekil 2. Bir karmaşıklık matrisindeki sınıflandırma sonuçları. Görsel yazar tarafından hazırlanmıştır.
Kesişim üzerinden Birlik (IoU)#
Object detection modellerini değerlendirmedeki bir diğer hayati metrik ise Intersection over Union (IoU) değeridir. Bu tür vizyon yapay zeka modelleri için bir görüntüde nesne varlığını tespit etmek yeterli değildir; sınırlayıcı kutular çizebilmek için görüntüde nerede olduğunu da bulması gerekir.
IoU metriği, modelin tahmin ettiği kutunun gerçek, doğru kutuyla (gerçek değerler) ne kadar yakından eşleştiğini ölçer. Puan 0 ile 1 arasındadır; burada 1 mükemmel bir eşleşme, 0 ise hiç örtüşme olmadığı anlamına gelir.
Örneğin, daha yüksek bir IoU (0,80 veya 0,85 gibi), tahmin edilen kutunun gerçek değer kutusuyla yakın bir eşleşme olduğu ve bunun da doğru yerelleştirmeyi işaret ettiği anlamına gelir. Daha düşük bir IoU (0,30 veya 0,25 gibi), modelin nesneyi doğru bir şekilde konumlandıramadığı anlamına gelir.
Bir algılamanın başarılı olup olmadığını belirlemek için farklı eşikler kullanırız. Yaygın bir IoU eşiği 0,5'tir; bu, tahmin edilen bir kutunun doğru pozitif olarak sayılması için gerçek değer kutusuyla en az %50 örtüşmesi gerektiği anlamına gelir. Bu eşiğin altındaki herhangi bir örtüşme yanlış pozitif olarak kabul edilir.

Şekil 3. Kesişim üzerinden Birliği anlamak. Görsel yazar tarafından hazırlanmıştır.
Duyarlılık (Precision) ve anımsama (Recall)#
Şimdiye kadar object detection modellerinin performansını anlamak için bazı temel değerlendirme metriklerini inceledik. Bunun üzerine inşa edilen en önemli iki metrik precision and recall değerleridir. Bunlar bize modelin tespitlerinin ne kadar doğru olduğuna dair net bir tablo sunar. Bunların ne olduğuna bir bakalım.
Duyarlılık değerleri, modelin tahminlerinin kaçının gerçekten doğru olduğunu söyler. Şu soruyu yanıtlar: Modelin algıladığını iddia ettiği tüm nesnelerden kaçı gerçekten oradaydı?
Anımsama değerleri ise modelin görüntüde bulunan tüm gerçek nesneleri ne kadar iyi bulduğunu ölçer. Şu soruyu yanıtlar: Görüntüdeki tüm gerçek nesnelerin kaçını model doğru bir şekilde algıladı?
Duyarlılık ve anımsama birlikte, modelin ne kadar iyi performans gösterdiğine dair daha net bir resim sunar. Örneğin, bir model bir görüntüde 10 araba tahmin ediyorsa ve bunların 9'u gerçekten arabaysa, %90 duyarlılığa (pozitif bir tahmin) sahiptir.
Bu iki değerlendirme metriği genellikle bir ödünleşim (trade-off) içerir: bir model, sadece tamamen emin olduğu tahminleri yaparak yüksek bir duyarlılık değeri elde edebilir, ancak bu durum birçok nesneyi kaçırmasına neden olabilir ve bu da anımsama seviyesini düşürür. Bu arada, neredeyse her yere bir sınırlayıcı kutu tahmin ederek çok yüksek anımsamaya da ulaşabilir, ancak bu da duyarlılığı azaltır.

Şekil 4. Duyarlılık ve anımsama. Görsel yazar tarafından hazırlanmıştır.
Ortalama duyarlılık (Average precision)#
Duyarlılık ve anımsama, modelin bireysel tahminlerde nasıl performans gösterdiğini anlamamıza yardımcı olurken, ortalama duyarlılık (AP) daha geniş bir bakış açısı sağlayabilir. Modelin daha fazla nesneyi algılamaya çalıştıkça duyarlılığının nasıl değiştiğini gösterir ve performansını tek bir sayıda özetler.
Ortalama duyarlılık puanını hesaplamak için, önce her nesne türü için duyarlılık-anımsama eğrisi (veya PR eğrisi) adı verilen birleşik grafik benzeri bir metrik oluşturabiliriz. Bu eğri, model daha fazla tahmin yaptıkça neler olduğunu gösterir.
Modelin sadece en kolay veya en belirgin nesneleri algılayarak başladığı bir senaryo düşün. Bu aşamada, çoğu tahmin doğru olduğu için duyarlılık yüksektir ancak birçok nesne hala kaçırıldığı için anımsama düşüktür. Model daha zor veya nadir olanlar da dahil olmak üzere daha fazla nesneyi algılamaya çalıştıkça, genellikle daha fazla hata yapar. Bu durum, anımsama artarken duyarlılığın düşmesine neden olur.
Ortalama duyarlılık, eğrinin altındaki alandır (PR eğrisinin AUC'si). Daha büyük bir alan, modelin daha fazla nesneyi algılarken bile tahminlerini doğru tutmada daha iyi olduğu anlamına gelir. AP, her sınıf etiketi için ayrı ayrı hesaplanır.
Örneğin, araba, bisiklet ve yayaları algılayabilen bir modelde, bu üç kategorinin her biri için AP değerlerini ayrı ayrı hesaplayabiliriz. Bu, modelin hangi nesneleri algılamada iyi olduğunu ve nerede hala iyileştirmeye ihtiyaç duyabileceğini görmemize yardımcı olur.

Şekil 5. Beş farklı sınıf için bir PR eğrisi. (Source)
Ortalama duyarlılık (Mean average precision)#
Her nesne sınıfı için average precision hesaplandıktan sonra, modelin tüm sınıflardaki genel performansını yansıtan tek bir puana hala ihtiyacımız var. Bu, mean average precision formülü kullanılarak elde edilebilir. Her kategori için AP puanlarının ortalamasını alır.
Örneğin, Ultralytics YOLO11 gibi bir bilgisayarla görü modelinin arabalar için 0.827, motosikletler için 0.679, kamyonlar için 0.355, otobüsler için 0.863 ve bisikletler için 0.982 AP elde ettiğini varsayalım. mAP formülünü kullanarak bu sayıları toplayabilir ve toplam sınıf sayısına şu şekilde bölebiliriz:
mAP = (0,827 + 0,679 + 0,355 + 0,863 + 0,982) ÷ 5 = 0,7432 ≈ 0,743
0,743'lük mAP puanı, modelin tüm nesne sınıflarında ne kadar iyi performans gösterdiğini değerlendirmek için basit bir çözüm sunar. 1'e yakın bir değer, modelin çoğu kategori için doğru olduğu anlamına gelirken, daha düşük bir değer bazı kategorilerde zorlandığını gösterir.
Bilgisayarlı görüde AP ve mAP'nin önemi#
Artık AP ve mAP'nin nasıl hesaplandığı ve bileşenlerinin neler olduğu konusunda daha iyi bir anlayışa sahip olduğumuza göre, bilgisayarlı görüdeki önemlerine genel bir bakış:
-
Belirli bir sınıf için düşük AP: Tek bir sınıf için düşük bir AP, genellikle modelin o belirli nesne sınıfında zorlandığı anlamına gelir. Bu, yetersiz eğitim verisinden veya örtülme gibi görüntülerdeki görsel zorluklardan kaynaklanabilir.
-
Yerelleştirme hataları: Daha düşük bir IoU eşiğinde (mAP@0,50 gibi) daha yüksek bir mAP değeri, daha yüksek bir IoU eşiğinde (mAP@0,75 gibi) önemli bir düşüşle birleştiğinde, modelin nesneleri algılayabildiğini ancak bunları hassas bir şekilde yerelleştirmekte zorlandığını gösterir.
-
Overfitting: Eğitim dataset üzerinde daha yüksek bir mAP değeri, doğrulama veri setinde ise daha düşük bir mAP değeri overfitting'in bir işaretidir ve modeli yeni görüntüler için güvenilmez hale getirir.
Ortalama duyarlılığın gerçek dünya uygulamaları#
Ardından, mAP gibi temel metriklerin gerçek dünya bilgisayarlı görü kullanım durumları oluşturulurken nasıl yardımcı olabileceğini keşfedelim.
Otonom araçlar: Neden daha yüksek bir mAP değeri daha güvenli yollar demektir#
Self-driving cars söz konusu olduğunda, yaya, trafik işareti, bisikletçi ve şerit çizgilerini tanımlamak için object detection çok önemlidir. Örneğin, bir çocuk aniden caddeden koşarak geçerse, arabanın nesneyi (çocuğu) tespit etmek, nerede olduğunu bulmak, hareketini izlemek ve gerekli eylemi gerçekleştirmek (fren yapmak) için saniyeleri vardır.
Ultralytics YOLO11 gibi modeller, bu tür yüksek riskli senaryolarda gerçek zamanlı nesne tespiti için tasarlanmıştır. Bu gibi durumlarda mAP, kritik bir güvenlik ölçüsü haline gelir.
Yüksek bir mAP puanı, sistemin çocuğu hızlı bir şekilde algılamasını, hassas bir şekilde yerelleştirmesini ve minimum gecikmeyle fren yapmasını sağlar. Düşük bir mAP, kaçırılan algılamalar veya çocuğu başka bir küçük nesneyle karıştırmak gibi tehlikeli yanlış sınıflandırmalar anlamına gelebilir.

Şekil 6. Yolda yayaları tespit etmek için kullanılan YOLO11 örneği. (Source)
Doğru ürün algılama için mAP kullanımı#
Benzer şekilde retail sektöründe object detection modelleri, stok izleme ve ödeme süreçleri gibi görevleri otomatikleştirmek için kullanılabilir. Bir müşteri akıllı kasada bir ürün taradığında, tespitteki bir hata hayal kırıklığına neden olabilir.
Yüksek bir mAP puanı, modelin benzer ürünleri doğru bir şekilde ayırt etmesini ve ürünler sıkışık bir şekilde dizilmiş olsa bile hassas sınırlayıcı kutular çizmesini sağlar. Düşük bir mAP puanı karışıklıklara yol açabilir. Örneğin, model bir portakal suyu şişesini görsel olarak benzer bir elma suyu şişesiyle karıştırırsa, bu yanlış faturalandırmaya ve hatalı envanter raporlarına yol açabilir.
Ultralytics YOLO11 gibi modellerle entegre perakende sistemleri, ürünleri gerçek zamanlı olarak tespit edebilir, envanterle karşılaştırabilir ve arka uç sistemlerini anında güncelleyebilir. Hızlı tempolu perakende ortamlarında mAP, operasyonların doğru ve güvenilir kalmasında çok önemli bir rol oynar.
Sağlık hizmetlerinde yüksek mAP ile tanısal doğruluğu artırma#
Sağlık hizmetlerinde teşhis doğruluğunu artırmak, medical imaging alanında hassas tespit ile başlar. YOLO11 gibi modeller, radyologların bu tıbbi taramalardan tümörleri, kırıkları veya diğer anomalileri fark etmesine yardımcı olabilir. Burada mean average precision, bir modelin klinik güvenilirliğini değerlendirmek için temel bir metriktir.
Yüksek bir mAP, modelin hem yüksek anımsama (gerçek sorunların çoğunu tanımlama) hem de yüksek duyarlılık (yanlış alarmlardan kaçınma) elde ettiğini gösterir; bu da klinik karar vermede kritiktir. Ayrıca, sağlık hizmetlerinde IoU eşiği, son derece doğru algılamayı sağlamak için genellikle çok yüksek (0,85 veya 0,90) ayarlanır.
Ancak, düşük bir mAP puanı endişeleri artırabilir. Diyelim ki bir model bir tümörü kaçırdı; bu durum tanıyı geciktirebilir veya yanlış tedaviye yol açabilir.
mAP kullanmanın avantajları ve dezavantajları#
İşte nesne algılama modellerini değerlendirmek için ortalama duyarlılık kullanmanın temel avantajları:
-
Standartlaştırılmış metrik: mAP, nesne algılama modellerini değerlendirmek için endüstri standardıdır. mAP değeri, farklı modeller arasında adil ve tutarlı karşılaştırmalar yapılmasını sağlar.
-
Gerçek dünya performansını yansıtır: Yüksek bir mAP, modelin çeşitli nesne sınıflarını algılamada mükemmel olduğunu ve karmaşık, gerçek dünya senaryolarında güçlü performans sergilediğini gösterir.
-
Sınıf bazlı tanılama: Bir mAP puanı, her sınıf için algılama performansını ayrı ayrı değerlendirir. Bu, düşük performans gösteren kategorileri (bisikletler veya trafik işaretleri gibi) tanımlamayı ve modeli buna göre ince ayarlamayı kolaylaştırır.
mAP metriğini kullanmanın çeşitli faydaları olsa da, göz önünde bulundurulması gereken bazı sınırlamalar da vardır. İşte hesaba katılması gereken birkaç faktör:
-
Teknik olmayan paydaşlar için zor: İş veya klinik ekipler, daha sezgisel ve anlaşılması kolay metriklerin aksine mAP değerlerini soyut bulabilir.
-
Gerçek zamanlı kısıtlamaları yansıtmaz: mAP, zaman duyarlı uygulamalarda dağıtım için çok önemli olan çıkarım hızını veya gecikmeyi hesaba katmaz.
Öne çıkanlar#
Ortalama duyarlılığın sadece teknik bir puan değil, bir modelin potansiyel gerçek dünya performansının bir yansıması olduğunu gördük. İster otonom bir araç sisteminde ister bir perakende ödeme noktasında olsun, yüksek bir mAP puanı, modelin performansı ve pratik hazırlığı için güvenilir bir gösterge görevi görür.
mAP önemli ve etkili bir metrik olsa da, çok yönlü bir değerlendirme stratejisinin parçası olarak görülmelidir. Sağlık hizmetleri ve otonom sürüş gibi kritik uygulamalar için, sadece mAP'ye güvenmek yeterli değildir.
Sistemin güvenli, verimli ve amaçlanan kullanım için gerçekten uygun olduğundan emin olmak adına çıkarım hızı (modelin tahminleri ne kadar hızlı yaptığı), model boyutu (uç cihazlarda dağıtımı etkileyen) ve nitel hata analizi (modelin yaptığı hata türlerini anlamak) gibi ek faktörler de göz önünde bulundurulmalıdır.
Computer vision hakkında daha fazla bilgi edinmek için büyüyen community ve GitHub repository alanımıza katıl. computer vision in agriculture ve AI in logistics alanlarındaki uygulamaları öğrenmek için çözümler sayfalarımızı incele. Kendi computer vision modelinle hemen bugün başlamak için licensing options seçeneklerimize göz at!






