Makine öğreniminde doğruluk ve kesinlik ve geri çağırma karşılaştırması
Makine öğreniminde Doğruluk, Kesinlik ve Geri Çağırma hakkında bilgi edin. Karmaşıklık Matrisini, F1 Skorunu ve bu önemli değerlendirme metriklerinin nasıl kullanılacağını keşfet.

Makine öğrenimi (ML), verilerden öğrenen sistemler oluşturmaya odaklanan bir yapay zekâ (AI) dalıdır. Makinelerin görüntüleri yorumladığı bilgisayarlı görü ve insan dilini anlayıp ürettiği doğal dil işleme de dâhil olmak üzere, diğer birçok AI alanında merkezi bir rol oynar.
Bu tür AI modelleri, verilerden tahminler yapmak için genellikle derin öğrenme tekniklerini kullanır. Bu sistemler son derece etkili olabilse de her zaman doğru tahminler üretmez. Bazı çıktılar doğru olabilirken bazıları hedefi ıskalayabilir.
Bu hataların nasıl oluştuğunu bilmek, bir modelin ne kadar iyi performans gösterdiğini değerlendirmenin önemli bir parçasıdır. Performansı ölçmek için model değerlendirme metriklerini kullanabiliriz.
Yaygın değerlendirme metrikleri arasında doğruluk (genel doğruluk), kesinlik (pozitif tahminlerin güvenilirliği) ve geri çağırma (modelin gerçek pozitifleri ne kadar iyi belirlediği) yer alır. İlk bakışta benzer görünebilirler, ancak her biri model davranışının farklı bir bölümüne odaklanır.
Bu makalede, bu AI model performansı metriklerinin her birine daha yakından bakacağız. Ayrıca birbirleriyle nasıl ilişkili olduklarını ve kullanım alanın için doğru olanı nasıl seçeceğini inceleyeceğiz. Hadi başlayalım!
Makine öğreniminde model değerlendirme metrikleri önemlidir#
Bir makine öğrenimi modeli ilk bakışta iyi performans gösteriyor gibi görünebilir. Ancak doğru değerlendirme metrikleri olmadan sonuçlarının ne kadar doğru olduğunu anlamak zordur. Bu metrikler model değerlendirmesine bir yapı kazandırır ve önemli bir soruyu yanıtlamaya yardımcı olur: Modelin tahminleri belirli bir görev için kullanışlı ve güvenilir mi?
Doğruluk, kesinlik ve geri çağırma gibi metrikler, AI geliştiricilerine bir modelin ne kadar iyi çalıştığını ölçmek için net bir yol sunar. Örneğin farklı modelleri karşılaştırırken bu metrikler, belirli bir görev için hangisinin en iyi performansı gösterdiğini görmeyi mümkün kılar. Performansı değerlendirmeye ve bir AI projesinin hedeflerine en uygun modeli seçmeye yardımcı olurlar.

Şekil 1. Model eğitimi ve değerlendirme iş akışı (Kaynak)
Bu metrikler, performans karşılaştırmalarını da daha nesnel hâle getirir. Tahminlere veya eksik gözlemlere güvenmek yerine, bir modelin farklı durumlarda nasıl davrandığına ilişkin ölçülebilir içgörüler sunarlar. Böylece her bağlamda performansın hangi yönlerinin en önemli olduğunu ortaya koyarlar.
Örneğin metrik seçimi genellikle uygulamaya bağlıdır. AI sağlık uygulamalarında amaç mümkün olduğunca çok pozitif vakayı belirlemek olduğundan, bazı negatifler yanlışlıkla işaretlense bile geri çağırma önemlidir. Buna karşılık bir e-posta spam filtresi, meşru e-postaları yanlışlıkla spam olarak işaretlemekten kaçınmak için kesinliğe öncelik verebilir.
Karışıklık matrisi: Sınıflandırma metriklerinin temeli#
Karışıklık matrisi, AI modellerini değerlendirmek için temel niteliğinde olan ikiye iki bir tablodur. Gerçek sonuçları tahmin edilen sonuçlarla (modelin verdiği yanıtlarla) karşılaştırarak tahminleri dört kategoriye ayırır.
Bu karşılaştırma, modelin performansını ayrıntılı biçimde gösterir. Doğrudan matristeki değerlerden hesaplanan kesinlik ve geri çağırma gibi temel değerlendirme metriklerinin temelini oluşturur.
Tablonun satırları gerçek sınıfları, sütunları ise tahmin edilen sınıfları temsil eder. Her hücre, o kategorideki sonuçların sayısını gösterir. Basitçe söylemek gerekirse, kaç tahminin doğru olduğunu ve modelin ne tür hatalar yaptığını ortaya koyar.
Karışıklık matrisi, bazı kategorilerde diğerlerinden çok daha fazla örnek bulunduğu dengesiz verilerde özellikle kullanışlıdır. Farklı hata türlerinin farklı maliyetler taşıdığı durumlarda da faydalıdır.
Örneğin dolandırıcılık tespitinde hileli faaliyetleri yakalamak kritik öneme sahiptir, ancak gerçek işlemleri yanlışlıkla işaretlemek de sorunlara yol açabilir. Matris, her hata türünün ne sıklıkta gerçekleştiğini açıkça gösterir.
Karışıklık matrisinin ögeleri#
Karışıklık matrisindeki farklı ögelere genel bir bakış:
- Doğru pozitif (TP): Model pozitif bir örneği doğru tahmin ettiğinde bu sonuç doğru pozitif olarak kaydedilir. Örneğin bir bilgisayarlı görü modeli, görüntüdeki bir aracı doğru şekilde sınıflandırır.
- Doğru negatif (TN): Model negatif bir örneği doğru şekilde belirlediğinde doğru negatif oluşur. Örneğin bir e-posta sınıflandırıcısı, normal bir iletiyi spam değil olarak işaretler.
- Yanlış pozitif (FP): Model, aslında negatif olan bir örnek için pozitif sonucu yanlış tahmin ettiğinde yanlış pozitif üretir. Tip I Hatası olarak da bilinen bu durum, bir dolandırıcılık tespit sisteminin geçerli bir işlemi hileli olarak işaretlemesiyle ortaya çıkabilir.
- Yanlış negatif (FN): Model pozitif bir vakayı tespit edemediğinde ve yanlışlıkla negatif olarak tahmin ettiğinde yanlış negatif kaydedilir. Tip II Hatası olarak da adlandırılan bu durum, tanı aracının aslında hasta olan bir kişideki hastalığı gözden kaçırmasıyla meydana gelebilir.

Şekil 2. Karışıklık matrisinin ögeleri (Kaynak)
Karışıklık matrisinin görsel gösterimi ve yorumu#
Karışıklık matrisi ızgara biçiminde görüntülenir. Dikey eksen gerçek sınıfları, yatay eksen ise tahmin edilen sınıfları gösterir. Doğru tahminler köşegen boyunca görünür ve doğru pozitifleri ile doğru negatifleri temsil eder.
Hatalar köşegenin dışında yer alır ve yanlış pozitifleri ile yanlış negatifleri kapsar. Bu yapı, güçlü ve zayıf yönleri kolayca fark etmeyi sağlar.
Makine öğreniminde doğruluk nedir?#
Doğruluk, bir makine öğrenimi modelinin ne kadar iyi performans gösterdiğini değerlendirmek için en yaygın kullanılan metriklerden biridir. Tüm sınıflardaki tahminlerin ne sıklıkta doğru olduğunu ölçer. Başka bir deyişle şu basit soruyu yanıtlar: AI modelinin yaptığı tüm tahminlerin kaçı doğruydu?
Doğruluk formülü, doğru tahminlerin (hem doğru pozitifleri hem de doğru negatifleri içerir) toplam tahmin sayısına bölünmesine dayanır. Doğruluğu hesaplamak ve anlamak kolaydır; bu da onu model değerlendirmesinde yaygın bir başlangıç noktası hâline getirir.
Genellikle doğruluk, dengeli veri kümeleriyle çalışırken güvenilirdir. Ancak bir sınıfın diğerlerine baskın olduğu dengesiz veri kümelerinde doğruluk çoğu zaman yanıltıcı olabilir. Her zaman çoğunluk sınıfını tahmin eden bir model, diğer azınlık sınıflarını tespit edemese bile yüksek bir doğruluk puanına ulaşabilir.
Örneğin yalnızca birkaç görüntünün yaya içerdiği bir görüntü veri kümesinde, her görüntü için “yaya yok” tahmininde bulunan bir model yine de yüksek doğruluk elde edebilir, ancak gerçek yayaları tespit etmede tamamen başarısız olur.
Bunun nedeni, doğruluğun tek başına bir modelin ne tür hatalar yaptığını veya bu hataların ne sıklıkta gerçekleştiğini göstermemesidir. Bu nedenle bir AI modelinin ne kadar iyi çalıştığını tam olarak anlamak için kesinlik ve geri çağırma gibi metriklere de bakmak önemlidir.
Kesinliğe derinlemesine bakış: Yanlış alarmları en aza indirme#
Kesinlik, bir modelin pozitif tahminlerinin doğruluğunu ölçen temel bir değerlendirme metriğidir. Şu soruyu yanıtlar: Pozitif olarak tahmin edilen tüm örneklerin kaçı doğruydu?
Kesinlik formülü, doğru pozitif sayısının doğru pozitifler ile yanlış pozitiflerin toplamına bölünmesine dayanır. Pozitif bir tahminin yanlış çıkması durumunda maliyetli olabileceği durumlarda özellikle önemlidir.

Şekil 3. Doğruluk ve kesinliğin karşılaştırılması. (Kaynak)
Örneğin dolandırıcılık tespitinde düşük kesinliğe sahip bir model, birçok geçerli işlemi hileli olarak işaretleyerek hem kullanıcılar hem de destek ekipleri için gereksiz sorunlar oluşturabilir. Yüksek kesinliğe sahip bir model, işaretlenen işlemlerin gerçek dolandırıcılık olma olasılığını artırarak bu riski azaltır.
Yüksek kesinlik iyi olsa da buna aşırı odaklanan modeller çok seçici hâle gelerek gerçek pozitif vakaları kaçırabilir. Bu nedenle performansı dengeli tutmak için kesinlik metriği genellikle geri çağırma ile birlikte kontrol edilir.
Geri çağırma nedir?#
Geri çağırma, bir modelin gerçek pozitif vakaları ne kadar iyi belirlediğini ölçmek için kullanılan bir metriktir. Duyarlılık veya doğru pozitif oranı olarak bilinir ve şu soruyu yanıtlar: Gerçek pozitif örneklerin tümünün kaçı model tarafından doğru şekilde tespit edildi?
Geri çağırma formülü, doğru pozitif sayısının doğru pozitifler ile yanlış negatiflerin toplamına bölünmesine dayanır. Yüksek geri çağırma puanı, modelin verilerdeki gerçek pozitif vakaların çoğunu yakaladığını gösterir.
Geri çağırma, bir durumu tespit edememenin tedaviyi geciktirip hastaları riske atabileceği sağlık hizmetleri gibi sektörlerde kritik öneme sahiptir. Bazı negatif vakalar yanlışlıkla işaretlense bile tüm gerçek vakaları belirlemek en önemli öncelik olmaya devam eder.
Ancak yalnızca geri çağırmaya odaklanan modeller çok fazla yanlış pozitif işaretleyebilir; bu da kesinliği düşürür ve modelin genel verimliliğine zarar verir. Güvenilir AI model performansı için geri çağırma ile kesinliği dengelemek kritik öneme sahiptir.
Denge kurma: Kesinlik ve geri çağırma arasındaki ödünleşim#
Kesinlik ve geri çağırma çoğu zaman zıt yönlerde hareket eder. Biri iyileştiğinde diğeri düşebilir. Bu ödünleşim, makine öğrenimi görevlerinde yaygın bir zorluktur.
Yüksek kesinliğe sahip bir model, bir şeyi yalnızca emin olduğunda pozitif olarak tahmin eder. Bu, yanlış alarmları azaltır, ancak gerçek pozitifleri kaçırarak geri çağırmayı düşürebilir. Her pozitif vakayı yakalamaya çalışan bir model, geri çağırmayı artırır ancak daha fazla yanlış alarm verme riski taşır; bu da kesinliği düşürür.
Modelin karar eşiğini ayarladığında bu ödünleşim daha net hâle gelir. Eşik, bir sistemin bir puanı veya olasılığı eyleme ya da etikete dönüştürmek için kullandığı kesim noktasıdır. Eşiği düşürmek, sistemin daha sık pozitif yönde hareket etmesini sağlar; bu durum geri çağırmayı artırabilir ancak kesinliği azaltabilir. Eşiği yükseltmenin tersi bir etkisi vardır: model daha az pozitif tahmin eder, kesinlik artar, ancak geri çağırma genellikle düşer.
Spam tespiti üzerinde çalıştığını varsayalım. Model, spam'in gelen kutusuna girmesine izin verme riski ile gerçek e-postaları engelleme riskini dengelemelidir. Sıkı bir filtre yine de bazı spam'leri kaçırabilirken daha esnek bir filtre meşru iletileri yanlışlıkla engelleyebilir. Doğru denge, kullanım alanına ve her hata türünün maliyetine bağlıdır.
Kesinlik–geri çağırma eğrisinin önemi#
Kesinlik-geri çağırma eğrisi veya PR eğrisi, modelin karar eşiği değiştikçe kesinlik ile geri çağırmanın nasıl değiştiğini gösterir. Her nokta, bu ikisi arasındaki farklı bir ödünleşimi temsil eder. PR eğrisi, bir sınıfın çok daha seyrek olduğu dengesiz veri kümelerinde özellikle kullanışlıdır.
Ayrıca, modelin farklı karar eşiklerinde pozitifleri negatiflerden ne kadar iyi ayırdığını gösteren Alıcı İşletim Karakteristiği (ROC) eğrisinden daha anlamlı içgörüler sunar. Hem kesinliği hem de geri çağırması yüksek olan bir modelin kesinlik–geri çağırma eğrisi, genellikle ideal olan sağ üst köşeye yakın kalır.
F1 puanını tanıma: Denge için birleştirilmiş metrik#
F1 puanı, kesinlik ile geri çağırma arasındaki dengeyi tek bir değerle ifade eder. F1 puanı, kesinlik ile geri çağırmanın çarpımının iki katının kesinlik ve geri çağırma toplamına bölünmesiyle hesaplanır. Hem yanlış pozitiflerin hem de yanlış negatiflerin önemli olduğu durumlarda ve dengesiz veri kümeleriyle çalışırken ya da model performansının dengeli bir görünümüne ihtiyaç duyulduğunda kullanışlıdır.

Şekil 4. Kesinlik ve geri çağırmayı kullanarak F1 puanını hesaplama (Kaynak)
Doğruluk, kesinlik ve geri çağırmanın ötesinde#
Doğruluk, kesinlik ve geri çağırma temel öneme sahip olsa da diğer metrikler model türüne ve veri kümesinin özelliklerine bağlı olarak ek içgörüler sunar.
Performansın farklı yönlerini değerlendirmeye yardımcı olan yaygın kullanılan bazı metrikler şunlardır:
- Özgüllük: Modelin gerçek negatifleri ne kadar iyi belirlediğini ölçer. Yanlış pozitiflerden kaçınmanın önemli olduğu durumlarda kullanışlıdır.
- AUC: AUC veya Eğri Altındaki Alan, modelin sınıfları birbirinden ne kadar iyi ayırt edebildiğini yansıtan tek bir puan sağlar.
- Log kaybı: Log kaybı, bir modelin tahmin yaparken ne kadar emin olduğunu ölçmek için kullanılır ve yüksek güvenle yapılan yanlış tahminleri daha fazla cezalandırır. Burada güven, modelin tahmini konusunda ne kadar emin olduğunu ifade eder.
- Çok etiketli değerlendirme: Çok etiketli görevlerde metrikler, genel model performansını yansıtmak için etiketler genelinde ortalaması alınarak hesaplanır.
Bilgisayarlı görüde doğruluk, kesinlik ve geri çağırmayı uygulama#
Artık doğruluk, kesinlik ve geri çağırmayı daha net anladığımıza göre, bu metriklerin bilgisayarlı görüde nasıl uygulandığını inceleyelim.
Ultralytics YOLO11 gibi bilgisayarlı görü modelleri, modelin bir görüntüde hangi nesnelerin bulunduğunu belirlediği ve bunların konumlarını sınırlayıcı kutuları kullanarak tespit ettiği nesne tespiti gibi görevleri destekler. Her tahmin hem nesne etiketini hem de konumunu içerir; bu da değerlendirmeyi yalnızca bir etiketin doğru olup olmadığını kontrol etmekten daha karmaşık hâle getirir.

Şekil 5. Nesne tespiti için Ultralytics YOLO11 kullanımı örneği. (Kaynak)
Raflardaki ürünleri otomatik olarak takip etmek için kameraların kullanıldığı bir perakende uygulamasını ele alalım. Bir nesne tespit modeli, mısır gevreği kutuları, gazlı içecek kutuları veya su şişeleri gibi ürünleri belirleyebilir ve konumlarını işaretleyebilir.
Bu durumda kesinlik, tespit edilen ürünlerin kaçının gerçekten doğru olduğunu gösterir. Yüksek kesinlik, gölgeyi veya arka plandaki bir nesneyi ürün olarak etiketlemek gibi yanlış pozitiflerden sistemin kaçındığı anlamına gelir. Geri çağırma, modelin raftaki gerçek ürünlerin kaçını tespit edebildiğini gösterir. Yüksek geri çağırma, doğru envanter sayımları için kritik olan daha az ürünün gözden kaçırılması anlamına gelir.
Doğruluk yine genel bir doğruluk ölçüsü sağlayabilir, ancak bu tür bir ortamda birkaç ürünü bile kaçırmak veya orada olmayan ürünleri tespit etmek stok yönetimi üzerinde büyük bir etkiye sahip olabilir. Bu nedenle geliştiriciler, sistemin gerçek dünyada kullanım için hem güvenilir hem de pratik olmasını sağlamak amacıyla kesinlik, geri çağırma ve doğruluğu birlikte inceler.
Doğruluk, kesinlik ve geri çağırma: Temel çıkarımlar#
Doğruluk, kesinlik ve geri çağırmanın her biri, bir makine öğrenimi modelinin performansının farklı yönlerini ortaya koyar. Yalnızca tek bir metriğe güvenmek yanıltıcı olabilir.
Karışıklık matrisi, kesinlik–geri çağırma eğrileri ve F1 puanı gibi araçlar ödünleşimleri ortaya çıkarmaya ve ML modelinde iyileştirmeler yapmaya yönelik kararlara rehberlik eder. Belirli bir AI çözümü için doğru metrik kombinasyonunu seçerek modellerinin gerçek dünya uygulamalarında doğru, güvenilir ve etkili olmasını sağlayabilirsin.
Büyüyen topluluğumuzu keşfet! AI hakkında daha fazla bilgi edinmek için GitHub depomuza göz at. Bilgisayarlı görü projelerine başlamaya hazır mısın? Lisans seçeneklerimize göz at. Çözümler sayfalarımızı ziyaret ederek tarımda AI ve robotikte görü AI hakkında bilgi edin!









