Dataset Bias
Yapay zekâda veri kümesi yanlılığının nedenlerini keşfet ve çarpıklığı nasıl azaltacağını öğren. Adaleti iyileştirmek için Ultralytics Platform ve Ultralytics YOLO26'yı nasıl kullanacağını keşfet.
Veri kümesi yanlılığı, makine öğrenimi (ML) modellerini eğitmek için kullanılan bilgilerin sistematik hatalar veya çarpık dağılımlar içermesi ve bunun sonucunda ortaya çıkan yapay zekâ sisteminin bazı sonuçları diğerlerine tercih etmesiyle oluşur. Modeller örüntü tanıma motorları olarak çalıştığından girdilerine tamamen bağımlıdır; eğitim verileri gerçek dünya ortamının çeşitliliğini doğru şekilde yansıtmıyorsa model bu kör noktaları devralır. Bu olgu genellikle zayıf genellemeyle sonuçlanır; yapay zekâ test sırasında yüksek skorlar elde edebilir, ancak çeşitli veya beklenmedik senaryolarda gerçek zamanlı çıkarım için kullanıma alındığında performansı önemli ölçüde düşer.
Veri Çarpıklığının Yaygın Kaynakları#
Yanlılık, geliştirme yaşam döngüsünün çeşitli aşamalarında veri kümesine sızabilir ve çoğunlukla veri toplama veya etiketleme sırasında alınan insan kararlarından kaynaklanır.
- Seçim Yanlılığı: Bu durum, toplanan verilerin hedef popülasyonu rastgele temsil etmemesiyle ortaya çıkar. Örneğin, ağırlıklı olarak ünlülerin görüntülerini kullanarak bir yüz tanıma veri kümesi oluşturmak, modeli yoğun makyaja ve profesyonel aydınlatmaya doğru kaydırabilir ve günlük web kamerası görüntülerinde başarısız olmasına neden olabilir.
- Etiketleme Hataları: Veri etiketleme sırasında öznellik, insan önyargısını veri kümesine taşıyabilir. Etiketleyiciler, açık yönergelerin bulunmaması nedeniyle belirsiz nesneleri sürekli olarak yanlış sınıflandırırsa model bu hataları gerçeğin referansı olarak kabul eder.
- Temsil Yanlılığı: Rastgele seçilmiş olsalar bile azınlık grupları, çoğunluk sınıfı tarafından istatistiksel olarak görünmez hâle gelebilir. Nesne algılama işleminde 10.000 araba görüntüsü ve yalnızca 100 bisiklet görüntüsü içeren bir veri kümesi, arabaları algılamaya eğilimli bir model ortaya çıkarır.
Gerçek Dünya Uygulamaları ve Sonuçları#
Veri kümesi yanlılığının etkisi, özellikle otomatik sistemlerin yüksek riskli kararlar aldığı veya fiziksel dünyayla etkileşime girdiği çeşitli sektörlerde önemlidir.
Otomotiv sektöründe otomotivde yapay zekâ, yayaları ve engelleri tanımlamak için kameralara dayanır. Otonom bir araç çoğunlukla güneşli ve kuru iklimlerde toplanan verilerle eğitilirse kar veya şiddetli yağmur altında çalışırken performans düşüşü gösterebilir. Bu, eğitim dağılımının çalışma dağılımıyla eşleşmemesine ve güvenlik risklerine yol açmasına dair klasik bir örnektir.
Benzer şekilde, tıbbi görüntü analizinde tanı modelleri çoğunlukla geçmiş hasta verileriyle eğitilir. Cilt hastalıklarını tespit etmek üzere tasarlanan bir model, açık ten tonlarının baskın olduğu bir veri kümesiyle eğitilirse daha koyu tenli hastalara tanı koyarken önemli ölçüde daha düşük doğruluk gösterebilir. Bu sorunun ele alınması, tüm demografik gruplar arasında yapay zekâda adaleti sağlayan çeşitli veri kümelerini özenle oluşturmak için ortak bir çaba gerektirir.
Azaltma Stratejileri#
Geliştiriciler, titiz denetim ve gelişmiş eğitim stratejileri uygulayarak veri kümesi yanlılığını azaltabilir. Veri artırma gibi teknikler, yeterince temsil edilmeyen örneklerin varyasyonlarını yapay olarak oluşturarak veri kümelerinin dengelenmesine yardımcı olur (ör. çevirme, döndürme veya parlaklığı ayarlama). Ayrıca sentetik veri oluşturmak, gerçek dünya verilerinin yetersiz veya toplanmasının zor olduğu durumlarda boşlukları doldurabilir.
Bu veri kümelerini etkili bir şekilde yönetmek kritik öneme sahiptir. Ultralytics Platformu, ekiplerin eğitim başlamadan önce sınıf dağılımlarını görselleştirmesine ve dengesizlikleri belirlemesine olanak tanır. Ayrıca NIST Yapay Zekâ Risk Yönetimi Çerçevesi gibi yönergelere uymak, kuruluşların bu riskleri sistematik olarak belirleme ve azaltma yaklaşımlarını yapılandırmasına yardımcı olur.
Veri Kümesi Yanlılığı ve İlgili Kavramlar#
Hatanın kaynağını anlamak için veri kümesi yanlılığını benzer terimlerden ayırmak yararlıdır:
- Algoritmik Yanlılığa karşı: Veri kümesi yanlılığı veri odaklıdır; "malzemelerin" kusurlu olduğunu ifade eder. Algoritmik yanlılık model odaklıdır; algoritmanın kendisinin veya genel metrikleri en üst düzeye çıkarmak uğruna azınlık gruplarının aleyhine çoğunluk sınıflarına öncelik verebilen optimizasyon algoritmasının tasarımından kaynaklanır.
- Model Kaymasına karşı: Veri kümesi yanlılığı, eğitim sırasında mevcut olan statik bir sorundur. Model kayması (veya veri kayması), model kullanıma alındıktan sonra gerçek dünya verileri zaman içinde değiştiğinde meydana gelir ve sürekli model izleme gerektirir.
Kod Örneği: Yanlılığı Azaltmak için Artırma#
Aşağıdaki örnek, YOLO26 ile eğitim sırasında veri artırmanın nasıl uygulanacağını gösterir. Geometrik artırmaları artırarak model daha iyi genelleme yapmayı öğrenir ve eğitim kümesinde bulunan belirli nesne yönelimlerine veya konumlarına yönelik yanlılığı potansiyel olarak azaltır.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)








