Makine öğreniminde doğruluk vs. hassasiyet vs. duyarlılık
Makine öğreniminde Doğruluk (Accuracy), Hassasiyet (Precision) ve Duyarlılık (Recall) hakkında bilgi edin. Karmaşıklık Matrisi'ni (Confusion Matrix), F1 Skoru'nu ve bu hayati değerlendirme metriklerinin nasıl kullanılacağını keşfet.

Machine learning (ML) is a branch of artificial intelligence (AI) that focuses on creating systems that learn from data. It plays a central role in many other areas of AI, including computer vision, where machines interpret images, and natural language processing, where they understand and generate human language.
Genellikle bu tür AI modelleri, verilerden tahminlerde bulunmak için derin öğrenme tekniklerini kullanır. Bu sistemler oldukça etkili olabilse de, her zaman doğru tahminler üretmezler. Bazı çıktılar doğru olabilirken, diğerleri hedefi ıskalayabilir.
Knowing how these errors occur is a key part of evaluating how well a model performs. To measure performance, we can use model evaluation metrics.
Yaygın değerlendirme metrikleri arasında doğruluk (genel doğruluk), kesinlik (pozitif tahminlerin güvenilirliği) ve duyarlılık (modelin gerçek pozitifleri ne kadar iyi tanımladığı) yer alır. İlk bakışta benzer görünebilirler, ancak her biri model davranışının farklı bir kısmına odaklanır.
Bu makalede, bu AI modeli performans metriklerinin her birine daha yakından bakacağız. Ayrıca birbirleriyle nasıl ilişkili olduklarını ve kullanım durumun için doğru olanı nasıl seçeceğini keşfedeceğiz. Hadi başlayalım!
Makine öğreniminde model değerlendirme metrikleri önemlidir#
A machine learning model might seem like it's performing well at first. But without the right evaluation metrics, it's difficult to understand how accurate its results are. These metrics give structure to model assessment and help answer a key question: Are the model’s predictions useful and reliable for a given task?
Doğruluk, kesinlik ve duyarlılık gibi metrikler, AI geliştiricilerine bir modelin ne kadar iyi çalıştığını ölçmek için net bir yol sunar. Örneğin, farklı modelleri karşılaştırırken bu metrikler, belirli bir görev için hangisinin en iyi performansı gösterdiğini görmeyi mümkün kılar. Performansı değerlendirmeye ve bir AI projesinin hedeflerine en uygun modelin seçilmesine yardımcı olurlar.

Fig 1. Model training and evaluation workflow (Source)
Bu metrikler aynı zamanda performans karşılaştırmalarını daha objektif hale getirir. Tahminlere veya eksik gözlemlere güvenmek yerine, bir modelin farklı durumlarda nasıl davrandığına dair ölçülebilir içgörüler sağlarlar. Bunu yaparak, her bağlamda performansın hangi yönlerinin daha önemli olduğunu vurgularlar.
For instance, the choice of metric often depends on the application. In AI healthcare applications, recall is important because the goal is to identify as many positive cases as possible, even if some negatives are mistakenly flagged. In contrast, an email spam filter may prioritize precision to avoid incorrectly marking legitimate emails as spam.
Karmaşıklık matrisi (Confusion matrix): Sınıflandırma metriklerinin temeli#
The confusion matrix is a two-by-two table that is fundamental for evaluating AI models. It organizes predictions into four categories by comparing the actual outcomes with the predicted outcomes (the answers the model gives).
Bu karşılaştırma, modelin performansına dair ayrıntılı bir görünüm sağlar. Matristeki değerlerden doğrudan hesaplanan kesinlik ve duyarlılık gibi temel değerlendirme metriklerinin temelini oluşturur.
Tablonun satırları gerçek sınıfları, sütunları ise tahmin edilen sınıfları temsil eder. Her hücre, o kategorideki sonuçların sayısını gösterir. Basitçe ifade etmek gerekirse, kaç tahminin doğru olduğunu ve modelin yaptığı hata türlerini sergiler.
Karmaşıklık matrisi, veriler dengesiz olduğunda, yani bazı kategoriler diğerlerinden çok daha fazla örneğe sahip olduğunda özellikle yararlıdır. Ayrıca farklı hata türlerinin farklı maliyetleri olduğunda da yardımcı olur.
Örneğin, dolandırıcılık tespitinde, dolandırıcılık faaliyetlerini yakalamak kritiktir, ancak gerçek işlemleri yanlışlıkla işaretlemek de sorunlara yol açabilir. Matris, her hata türünün ne sıklıkla gerçekleştiğini netleştirir.
Karmaşıklık matrisinin öğeleri#
İşte bir karmaşıklık matrisindeki farklı öğelere genel bir bakış:
- True positive (TP): When the model correctly predicts a positive instance, it is recorded as a true positive. For example, a computer vision model correctly classifies a vehicle in an image.
- Gerçek negatif (TN): Model negatif bir durumu doğru tanımladığında gerçek negatif oluşur. Örneğin, bir e-posta sınıflandırıcı normal bir iletiyi spam değil olarak işaretler.
- Yanlış pozitif (FP): Model, aslında negatif olan bir durum için yanlışlıkla pozitif bir sonuç tahmin ettiğinde yanlış pozitif üretir. Tip I Hata olarak da bilinir; bir dolandırıcılık tespit sistemi geçerli bir işlemi dolandırıcılık olarak işaretlediğinde bu durum gerçekleşebilir.
- Yanlış negatif (FN): Model pozitif bir durumu tespit edemediğinde ve yanlışlıkla negatif olarak tahmin ettiğinde yanlış negatif kaydedilir. Tip II Hata olarak da adlandırılır; bir tanı aracı, aslında hasta olan bir kişide hastalığı gözden kaçırdığında bu durum oluşabilir.

Fig 2. The elements of a confusion matrix (Source)
Karmaşıklık matrisinin görsel temsili ve yorumlanması#
Karmaşıklık matrisi ızgara biçiminde görüntülenir. Dikey eksen gerçek sınıfları, yatay eksen ise tahmin edilen sınıfları gösterir. Doğru tahminler, gerçek pozitifleri ve gerçek negatifleri temsil edecek şekilde köşegen boyunca görünür.
Hatalar, yanlış pozitifleri ve yanlış negatifleri kapsayacak şekilde köşegenin dışında kalır. Bu yapı, güçlü ve zayıf yönleri tespit etmeyi kolaylaştırır.
Makine öğreniminde doğruluk (accuracy) nedir?#
Accuracy is one of the most widely used metrics for evaluating how well a machine learning model performs. It measures how often the predictions are correct across all classes. In other words, it answers a simple question: Out of all the predictions the AI model made, how many were right?
Doğruluk formülü, doğru tahminlerin sayısının (gerçek pozitifler ve gerçek negatifler dahil) toplam tahmin sayısına bölünmesidir. Doğruluğu hesaplamak kolaydır ve anlaşılması basittir, bu da onu model değerlendirmesinde yaygın bir başlangıç noktası yapar.
Genel olarak, dengeli veri kümeleriyle çalışırken doğruluk güvenilirdir. Ancak doğruluk, bir sınıfın diğerlerine baskın geldiği dengesiz veri kümelerinde genellikle yanıltıcı olabilir. Her zaman çoğunluk sınıfını tahmin eden bir model, azınlık sınıflarını tespit edemese bile yine de yüksek bir doğruluk puanı elde edebilir.
Örneğin, sadece birkaç görüntünün yaya içerdiği bir görüntü veri kümesinde, her görüntü için “yaya yok” tahmini yapan bir model yine de yüksek doğruluk elde edebilir ancak gerçek yayaları tespit etmede tamamen başarısız olabilir.
Bunun nedeni, doğruluğun kendi başına modelin ne tür hatalar yaptığını veya bunların ne sıklıkla gerçekleştiğini göstermemesidir. Bu nedenle, bir AI modelinin ne kadar iyi çalıştığını tam olarak anlamak için kesinlik ve duyarlılık gibi metrikleri de incelemek önemlidir.
Kesinliğin (precision) derinlemesine incelenmesi: Yanlış alarmları en aza indirme#
Precision is a key evaluation metric that measures the accuracy of a model’s positive predictions. It answers the question: Of all the instances predicted as positive, how many were correct?
Kesinlik formülü, gerçek pozitiflerin sayısının, gerçek pozitifler ve yanlış pozitiflerin toplamına bölünmesidir. Yanlış çıkması durumunda maliyetli olacak pozitif bir tahmin söz konusu olduğunda özellikle önemlidir.

Fig 3. Comparing accuracy and precision. (Source)
Örneğin, dolandırıcılık tespitinde, düşük kesinliğe sahip bir model birçok geçerli işlemi dolandırıcılık olarak işaretleyebilir ve hem kullanıcılar hem de destek ekipleri için gereksiz sorunlar yaratabilir. Yüksek kesinliğe sahip bir model, işaretlenen işlemlerin gerçek dolandırıcılık olma olasılığını artırarak bu riski azaltır.
Yüksek kesinlik iyi olsa da, buna çok fazla odaklanan modeller çok seçici hale gelebilir ve gerçek pozitif vakaları kaçırabilir. Bu nedenle kesinlik metriği, performansı dengeli tutmak için genellikle duyarlılık ile birlikte kontrol edilir.
Duyarlılık (recall) nedir?#
Recall is a metric that is used to measure how well a model identifies actual positive cases. It is known as sensitivity or true positive rate, and it answers the question: Of all the actual positive instances, how many did the model detect correctly?
Duyarlılık formülü, gerçek pozitiflerin sayısının, gerçek pozitifler ve yanlış negatiflerin toplamına bölünmesidir. Yüksek bir duyarlılık puanı, modelin verilerdeki gerçek pozitif vakaların çoğunu yakaladığını gösterir.
Duyarlılık, bir durumu tespit edememenin tedaviyi geciktirebileceği ve hastaları riske atabileceği sağlık gibi sektörlerde çok önemlidir. Bazı negatif vakalar yanlışlıkla işaretlense bile, tüm gerçek vakaları tanımlamak en önemli öncelik olmaya devam eder.
However, models that focus only on recall can flag too many false positives, which lowers precision and hurts the overall efficiency of the model. Balancing recall and precision is crucial for reliable AI model performance.
Dengeleme eylemi: Kesinlik ve duyarlılık ödünleşimi#
Kesinlik ve duyarlılık genellikle zıt yönlerde hareket eder. Biri iyileştiğinde, diğeri düşebilir. Bu ödünleşim, makine öğrenimi görevlerinde yaygın bir zorluktur.
Yüksek kesinliğe sahip bir model, bir şeyi ancak emin olduğunda pozitif olarak tahmin eder. Bu, yanlış alarmları azaltır ancak gerçek pozitifleri kaçırabilir, bu da duyarlılığı düşürür. Her pozitif durumu yakalamaya çalışan bir model duyarlılığı artırır ancak daha fazla yanlış alarm riski taşır, bu da kesinliği düşürür.
Bu ödünleşim, modelin karar eşiğini ayarladığında daha net hale gelir. Eşik, bir sistemin puanı veya olasılığı bir eyleme veya etikete dönüştürmek için kullandığı kesme noktasıdır. Eşiği düşürmek, sistemin daha sık pozitif hareket etmesini sağlar; bu, duyarlılığı artırabilir ancak kesinliği azaltabilir. Eşiği yükseltmek tam tersi bir etkiye sahiptir: model daha az pozitif tahmin eder, kesinlik artar ancak duyarlılık genellikle düşer.
Diyelim ki spam tespiti üzerinde çalışıyorsun. Model, gelen kutusuna spam girmesi riski ile gerçek e-postaları engelleme riski arasında denge kurmalıdır. Katı bir filtre bazı spam'leri yine de kaçırabilirken, daha esnek bir filtre yanlışlıkla meşru iletileri engelleyebilir. Doğru denge, kullanım durumuna ve her hata türünün maliyetine bağlıdır.
Kesinlik-duyarlılık eğrisinin önemi#
Kesinlik-duyarlılık eğrisi veya PR eğrisi, modelin karar eşiği değiştikçe kesinlik ve duyarlılığın nasıl değiştiğini gösterir. Her nokta, ikisi arasında farklı bir ödünleşimi temsil eder. PR eğrisi, bir sınıfın çok daha az sıklıkta olduğu dengesiz veri kümeleri için özellikle yararlıdır.
It also provides more meaningful insight than the Receiver Operating Characteristic (ROC) curve, which also shows how well a model separates positives from negatives at different decision thresholds. A model with both high precision and high recall will have a precision–recall curve that stays near the upper-right corner, which is generally ideal.
F1-score ile tanışın: Denge için birleşik bir metrik#
The F1-score provides a single value that captures the balance between precision and recall. The F1-score is calculated as two times the product of precision and recall, divided by the sum of precision and recall. It’s useful when both false positives and false negatives matter, and it's helpful when working with imbalanced datasets or when a balanced view of model performance is needed.

Fig 4. Calculating F1-score using precision and recall (Source)
Doğruluk, kesinlik ve duyarlılığın ötesinde#
Doğruluk, kesinlik ve duyarlılık temel olsa da, diğer metrikler model türüne ve veri kümesi özelliklerine göre ek içgörüler sunar.
İşte performansın farklı yönlerini değerlendirmeye yardımcı olan bazı yaygın kullanılan metrikler:
- Özgüllük (Specificity): Modelin gerçek negatifleri ne kadar iyi tanımladığını ölçer. Yanlış pozitiflerden kaçınmanın önemli olduğu durumlarda yararlıdır.
- AUC: AUC, or Area Under the Curve, gives a single score that reflects how well the model can distinguish between classes.
- Log loss: Log loss is used to measure how confident a model is when making predictions and gives more penalty to wrong predictions made with high confidence. Here, confidence refers to how sure the model is about its prediction.
- Çok etiketli değerlendirme: Çok etiketli görevlerde, metrikler genel model performansını yansıtacak şekilde etiketler genelinde ortalaması alınır.
Doğruluk, kesinlik ve duyarlılığı bilgisayarlı görüde uygulama#
Artık doğruluk, kesinlik ve duyarlılık hakkında daha net bir anlayışa sahip olduğumuza göre, bu metriklerin bilgisayarlı görüde nasıl uygulandığına bakalım.
Computer vision models like Ultralytics YOLO11 support tasks such as object detection, where the model identifies what objects are present in an image and locates them using bounding boxes. Each prediction includes both the object label and its position, which makes evaluation more complex than simply checking whether a label is correct.

Fig 5. An example of using Ultralytics YOLO11 for object detection. (Source)
Consider a retail application where cameras are used to automatically track products on shelves. An object detection model might identify items like cereal boxes, soda cans, or bottles of water and mark their positions.
Bu durumda kesinlik, algılanan öğelerden kaçının aslında doğru olduğunu söyler. Yüksek kesinlik, sistemin bir gölgeyi veya arka plan nesnesini ürün olarak etiketlemek gibi yanlış pozitiflerden kaçındığı anlamına gelir. Duyarlılık, modelin raftaki gerçek ürünlerden kaçını tespit etmeyi başardığını gösterir. Yüksek duyarlılık, daha az öğenin kaçırıldığı anlamına gelir; bu, doğru envanter sayıları için kritiktir.
Doğruluk yine de genel bir doğruluk ölçüsü sağlayabilir, ancak bu tür bir ortamda birkaç ürünü bile kaçırmak veya orada olmayan öğeleri algılamak stok yönetimi üzerinde büyük bir etkiye sahip olabilir. Geliştiricilerin sistemin hem güvenilir hem de gerçek dünya kullanımı için pratik olmasını sağlamak adına kesinlik, duyarlılık ve doğruluğa birlikte bakmalarının nedeni budur.
Doğruluk, kesinlik ve duyarlılık: Temel çıkarımlar#
Doğruluk, kesinlik ve duyarlılığın her biri bir makine öğrenimi modelinin performansının farklı yönlerini sergiler. Sadece tek bir metriğe güvenmek yanıltıcı olabilir.
Karmaşıklık matrisi, kesinlik-duyarlılık eğrileri ve F1-score gibi araçlar ve metrikler, ödünleşimleri ortaya çıkarmaya ve ML modelinde iyileştirmeler yapma konusundaki kararlara rehberlik etmeye yardımcı olur. Belirli bir AI çözümü için doğru metrik kombinasyonunu seçerek, modellerin gerçek dünya uygulamalarında doğru, güvenilir ve etkili olmasını sağlayabilirsin.
Explore our growing community! Check out our GitHub repository to learn more about AI. Ready to start your computer vision projects? Take a look at our licensing options. Discover AI in agriculture and vision AI in robotics by visiting our solutions pages!






