Değerlendiriciler arası güvenilirlik: Tanım, örnekler ve hesaplamalar
Değerlendiriciler arası güvenilirlik, Cohen Kappa'sı, ICC, değerlendirici eğitimi ve yüzde uyumu hakkında bilgi edin. Bu istatistiksel ölçümlerin araştırma ve veri analizinde gözlemciler arasındaki tutarlılığı ve uyumu nasıl sağladığını öğren.

Bir AI modeli oluştururken verilerinin kalitesi, arkasındaki algoritmalar kadar önemlidir. Aynı verileri birden fazla kişi etiketlediğinde veya incelediğinde anlaşmazlıkların ortaya çıkması kaçınılmazdır. Bu durum araştırma, sağlık hizmetleri ve eğitim dahil olmak üzere birçok alanda geçerlidir.
Özellikle görüntüleri veya videoları yorumlamak üzere Ultralytics YOLO11 gibi modellerin eğitilmesini içeren bir AI dalı olan computer vision alanında, etiketli örnekler kritik bir rol oynar. Bu etiketler tutarsız olduğunda computer vision modelleri doğru örüntüleri öğrenmekte zorlanabilir.
Değerlendiriciler arası güvenilirlik (IRR), farklı kişilerin veya etiketleyicilerin bir görev üzerinde ne kadar tutarlı şekilde uzlaştığını ölçer. Tutarlılığı izlemeye ve eğitim, yönergeler veya yorumlamadaki eksikleri belirlemeye yardımcı olur. Bu, AI modellerinin belirli bir amaç için özel veriler kullanılarak oluşturulduğu özel model eğitimi süreçlerinde özellikle önemlidir.
Bu makalede değerlendiriciler arası güvenilirliğin ne olduğunu, nasıl ölçüleceğini ve gerçek dünya projelerinde nasıl geliştirileceğini inceleyeceğiz. Hadi başlayalım!
Değerlendiriciler arası güvenilirlik nedir?#
Değerlendiriciler arası güvenilirlik, aynı içeriği etiketlerken, puanlarken veya incelerken iki ya da daha fazla kişinin (değerlendirici olarak da bilinir) ne sıklıkla uzlaştığını ölçer. Farklı değerlendiricilerin verilen ölçütleri ne kadar tutarlı kullandığını kontrol etmek için kullanılır. Değerlendiriciler arasındaki yüksek uyum, bir görevin iyi tanımlandığını ve açıkça anlaşıldığını gösterir.
Bu kavram farklı alanlarda kullanılır. Alana bağlı olarak değerlendiriciler arası uyum, gözlemciler arası güvenilirlik veya kodlayıcılar arası güvenilirlik gibi farklı adlarla bilinir. Ancak temel ilke aynıdır.
Görüntü tabanlı AI alanında değerlendiriciler arası güvenilirlik, veri etiketleme sürecinin önemli bir parçasıdır. Computer vision modelleri eğitmek genellikle büyük görüntü veya video karesi veri kümelerinin etiketlenmesini gerektirir; bu nedenle birden fazla AI geliştiricisi aynı veriler üzerinde birlikte çalışır.
Doğru sonuçlar elde etmek için herkesin aynı etiketleme yönergelerini izlemesi gerekir. Örneğin, hayvanları etiketlerken herkesin neyin köpek sayılacağı, etrafına sınırlayıcı kutunun nasıl çizileceği ve bulanık nesnelerin etiketlenip etiketlenmeyeceği veya göz ardı edilip edilmeyeceği konusunda net bir uzlaşmaya sahip olması gerekir.

Şekil 1. Değerlendiriciler arası güvenilirliği anlama (Görsel yazar tarafından hazırlanmıştır)
Değerlendiriciler arası ve değerlendirici içi güvenilirlik ile test-tekrar test güvenilirliği#
Verilerin etiketlenmesine veya puanlanmasına insanlar dahil olduğunda dikkate alınması gereken üç ana güvenilirlik türü vardır. Her biri sonuçların ne kadar tutarlı olduğunu ölçmede farklı bir amaca hizmet eder. Şimdi her birine daha yakından bakalım:
-
Değerlendiriciler arası güvenilirlik: Değerlendiriciler arası güvenilirlik, aynı görevi gerçekleştiren farklı kişiler arasındaki uyumun ne düzeyde olduğunu inceler. Görüntü etiketleme, duygu analizi veya tıbbi incelemeler gibi projelerde birden fazla açıklayıcı yer aldığında özellikle yararlıdır.
-
Değerlendirici içi güvenilirlik: Odak noktasını tek bir kişiye kaydırır. Değerlendirici içi güvenilirlik, değerlendiricinin aynı görevi farklı zamanlarda tekrarladığında tutarlı kalıp kalmadığını kontrol eder. Etiketler çok fazla değişiyorsa bunun nedeni belirsiz yönergeler veya görevin yeterince net olmaması olabilir.
-
Test-tekrar test güvenilirliği: Test-tekrar test güvenilirliği açıklayıcıya değil, kullanılan araca veya yönteme odaklanır. Test benzer koşullar altında tekrarlandığında aynı sonucun ortaya çıkıp çıkmadığını ölçer. Çıktı tutarlı kalıyorsa yöntem güvenilir kabul edilir.
Bu ölçümler birlikte, hem insanların hem de süreçlerin istikrarlı ve güvenilir sonuçlar ürettiğini doğrulamaya yardımcı olur.

Şekil 2. Değerlendiriciler arası, değerlendirici içi ve test-tekrar test güvenilirliğine genel bakış (Görsel yazar tarafından hazırlanmıştır)
Değerlendiriciler arası güvenilirlik neden önemlidir?#
Büyük ölçekli görüntü tabanlı AI projelerinde etiketli verilerin kalitesi, bir modelin ne kadar iyi performans gösterdiğini doğrudan etkiler. Açıklayıcıların yönergeleri uygulama biçimlerindeki küçük farklılıklar bile modelin eğitim sırasında kafasını karıştıran tutarsızlıklara yol açabilir. Zamanla bu durum hatalı tahminlere, kaynak israfına ve maliyetli yeniden etiketleme gereksinimine neden olabilir.
Değerlendiriciler arası güvenilirliği ölçmek, bu sorunların erken fark edilmesine yardımcı olur. Yüksek uyum, açıklayıcıların aynı doğrultuda olduğunu ve daha temiz, daha güvenilir veri kümeleri ürettiğini gösterir. Düşük uyum, proje ilerlemeden önce talimatların, örneklerin veya eğitimin iyileştirilmesi gerekebileceğine işaret eder. Etiketleyicilerin uyum içinde çalışmasını sağlayan ekipler, daha etkili öğrenen ve gerçek dünya uygulamalarında daha iyi sonuçlar sunan AI modelleri oluşturabilir.
Değerlendiriciler arası güvenilirlik için pratik hususlar#
Birden fazla değerlendiriciyle çalışırken ve yüksek değerlendiriciler arası güvenilirliği korumayı hedeflerken aklında tutman gereken bazı önemli pratik hususlar şunlardır:
- Belirsiz veya öznel görevler: Etiketleme, bulanık bir nesnenin yaya olup olmadığına karar verme veya bir görüntünün kalitesini değerlendirme gibi yorumlama gerektirdiğinde, birden fazla değerlendirici kararların tutarlı olmasını ve bireysel önyargılardan aşırı etkilenmemesini sağlar.
- Basit, nesnel görevler: Bir görüntüdeki araç sayısını saymak veya bir nesnenin mevcut olup olmadığını doğrulamak gibi basit görevlerde süreç açıkça tanımlandığında uyum genellikle yüksek olduğundan, çoğu zaman yalnızca iyi eğitimli bir değerlendirici gerekir.
- Açık etiketleme yönergeleri: Ayrıntılı ve kolay izlenen talimatlar, etiketlerin nasıl uygulanacağı konusundaki belirsizliği azaltarak değerlendiriciler arasındaki uyumu artırır. Tutarsız yorumlamaları önlemek için yönergeler sınır durumlarını açıkça kapsamalıdır.
- Düzenli eğitim ve kalibrasyon: Deneyimli değerlendiriciler bile zaman içinde kararlarında sapma yaşayabilir. Düzenli eğitim oturumları ve kalibrasyon kontrolleri tutarlılığın korunmasına ve deneyci önyargısının en aza indirilmesine yardımcı olur.
Değerlendiriciler arası güvenilirlik ölçümleri#
Değerlendiriciler arası güvenilirliği ölçmenin çeşitli yolları vardır ve en iyi seçim verinin ve görevin türüne bağlıdır. Bazı yöntemler basit evet-hayır sorularını ele alan tek değerlendirici için uygunken, diğerleri birden fazla değerlendiricinin dahil olduğu durumlar için tasarlanmıştır.
Yaygın yaklaşımlar arasında yüzde uyumu, Cohen Kappa'sı, Fleiss Kappa'sı ve sınıf içi korelasyon katsayısı bulunur. Her yöntem, değerlendiriciler arasındaki uyum düzeyini ölçer ve bazı uyumların şans eseri ortaya çıkabileceği olasılığını hesaba katar.
Cohen Kappa'sı ve Fleiss Kappa'sı#
Cohen Kappa'sı, iki değerlendirici arasındaki değerlendiriciler arası güvenilirliği ölçmek için yaygın olarak kullanılan bir yöntemdir. Bir görevde ne sıklıkla uzlaştıklarını hesaplarken bazı uyumların şans eseri ortaya çıkabileceği olasılığını düzeltir. Puanlar -1 ile 1 arasında değişir; 1 mükemmel uyumu, 0 ise uyumun rastgele tahminden daha iyi olmadığını gösterir.
Benzer şekilde Fleiss Kappa'sı, ikiden fazla değerlendiricinin dahil olduğu durumlarda kullanılır. Grubun ne kadar tutarlı olduğunu gösteren genel bir puan sağlar. Her iki yöntem de görüntüleri etiketleme veya duyguları etiketleme gibi belirli kategorilere sahip görevlerde kullanılır. Hesaplanmaları kolaydır ve çoğu açıklama aracı tarafından desteklenir.
Yüzde uyumu ve sınıf içi korelasyon katsayısı (ICC)#
Değerlendiriciler arası güvenilirliği ölçmenin bir başka yolu, değerlendiricilerin aynı kararı verdiği durumların yüzdesini hesaplayan yüzde uyumudur. Kullanımı basit olsa da şans eseri ortaya çıkabilecek uyumu hesaba katmaz.
Buna karşılık sınıf içi korelasyon katsayısı, sürekli veya ölçeğe dayalı veriler için kullanılan daha gelişmiş bir yöntemdir. Birden fazla değerlendiricinin verdiği puanların ne kadar tutarlı olduğunu ölçer ve genellikle sabit kategorilerin ötesindeki puanları, ölçümleri veya diğer veri türlerini içeren araştırmalarda uygulanır.
Değerlendiriciler arası güvenilirlik: Örnekler ve uygulamalar#
Artık değerlendiriciler arası güvenilirliğin nasıl ölçüleceğini daha iyi anladığımıza göre, bu yöntemlerin gerçek dünya uygulamalarında nasıl kullanılabileceğine bakalım.
Tıbbi görüntü açıklamalarında değerlendiriciler arası güvenilirlik#
Tıbbi görüntüler söz konusu olduğunda, yorumlamadaki küçük farklılıklar bile sonuçlarda önemli değişikliklere yol açabilir. Örneğin radyologlardan genellikle ince, belirsiz veya tanımlanması zor örüntüleri belirlemeleri istenir. Bu örüntüler AI sistemleri için eğitim verisine dönüştüğünde risk daha da artar. Uzmanlar aynı taramayı farklı şekilde etiketlerse model yanlış örüntüleri öğrenebilir veya hiç öğrenemeyebilir.
Değerlendiriciler arası güvenilirlik, bu tür verilerle çalışan ekiplerin uzman görüşlerinin gerçekte ne kadar tutarlı olduğunu değerlendirmesine yardımcı olur. Örneğin, retinal OCT taramalarına odaklanan yakın tarihli bir çalışmada iki değerlendirici 500 görüntüyü etiketledi.
Retinanın altındaki sarı birikintiler olan drusen gibi net özelliklerde uyum yüksekti ve kappa puanı 0,87 idi. Ancak retinal taramalarda görülen küçük, parlak noktalar olan hiperreflektif odaklar gibi tanımlanması daha zor unsurlarda puan 0,33'e düştü. Bu durum, daha net ve iyi tanımlanmış özelliklerin daha tutarlı uzman değerlendirmeleri üretme eğiliminde olduğunu, belirsiz özelliklerin ise yoruma daha fazla alan bıraktığını gösterir.

Şekil 3. Retina hastalıklarıyla ilişkili farklı özellikler için etiket örnekleri (Kaynak)
Otonom araç veri kümeleri ve değerlendiriciler arası güvenilirlik#
Bir otonom sürüş sistemi için AI modelleri eğitmek, çok çeşitli yol koşullarında doğru ve tutarlı etiketlere bağlıdır. Bu tür projelerde çalışan açıklayıcılardan genellikle yayaları, araçları, trafik işaretlerini ve şerit işaretlerini, çoğu zaman düşük aydınlatma veya kalabalık sahneler altında belirlemeleri istenir.
Bu kararlar, modelin zorlu gerçek dünya ortamlarına nasıl tepki vermeyi öğrendiğini şekillendirir. Değerlendiriciler arası güvenilirlik, ekiplerin bu etiketlerin farklı açıklayıcılar tarafından aynı şekilde uygulanıp uygulanmadığını kontrol etmesini mümkün kılar.

Şekil 4. Açıklama anlaşmazlıklarına bakış (Kaynak)
Değerlendiriciler arası güvenilirliğin ötesinde: Diğer kalite güvence ölçümleri#
Değerlendiriciler arası güvenilirliği ölçmek bir AI çözümü oluşturmanın kritik bir adımı olsa da daha kapsamlı bir kalite güvence sürecinin yalnızca bir parçasıdır. Ekipler ve projeler genelinde veri kalitesini artırmaya yardımcı olabilecek diğer uygulamalardan bazıları şunlardır:
- Açık açıklama yönergeleri: Herkesin aynı standarda göre çalışması için talimatlar etiketlerin tam olarak nasıl uygulanacağını açıklamalıdır.
- Eğitim ve kalibrasyon: Düzenli oturumlar, açıklayıcıların aynı doğrultuda kalmasına yardımcı olur ve onlara soru sorma ve sınır durumlarına uyum sağlama fırsatı verir.
- Sürekli kalite kontrolleri: Örneklem kontrolleri ve altın standart örnekler, proje ölçeklenirken hataları erken yakalayabilir ve kalitenin yüksek kalmasını sağlayabilir.
- Anlaşmazlıkların çözümü: Açıklayıcılar anlaşamadığında, bu durumları incelemek ve nihai kararları vermek için net bir süreç bulunmalıdır.
- Çeşitli açıklayıcı havuzu: Farklı geçmişlere sahip kişileri dahil etmek, önyargıyı azaltabilir ve veri kümesinin gerçek dünyadaki çeşitliliği ne kadar iyi temsil ettiğini artırabilir.
Önemli çıkarımlar#
Değerlendiriciler arası güvenilirlik, insanların etiketleri ne kadar tutarlı uyguladığını veya kararları ne kadar tutarlı verdiğini ölçer. Cohen Kappa'sı, Fleiss Kappa'sı ve ICC gibi yöntemler bu uyumu nicel olarak değerlendirmeye yardımcı olur. Açık yönergeler, eğitim ve önyargı kontrolü sayesinde güvenilir açıklamalar daha güçlü verilere ve daha iyi model sonuçlarına yol açar.
Daha fazla AI bilgisi edinmek için topluluğumuza katıl ve GitHub depomuzu incele. Kendi vision AI projenize başlamak istiyorsan lisans seçeneklerimize göz at. Ayrıca çözüm sayfalarımızı ziyaret ederek sağlık hizmetlerinde AI ve perakendede vision AI uygulamalarının nasıl etki yarattığını görebilirsin.









