Dataset Bias
Yapay zekadaki veri kümesi önyargısının nedenlerini keşfet ve sapmayı nasıl azaltacağını öğren. Adaleti artırmak için Ultralytics Platform'u ve Ultralytics YOLO26'yı nasıl kullanacağını keşfet.
machine learning (ML) modellerini eğitmek için kullanılan bilgiler sistematik hatalar veya çarpık dağılımlar içerdiğinde veri kümesi yanlılığı oluşur ve bu durum ortaya çıkan yapay zeka sisteminin belirli sonuçları diğerlerine tercih etmesine yol açar. Modeller örüntü tanıma motorları olarak işlev gördüğünden tamamen girdilerine bağımlıdır; eğer training data gerçek dünya ortamının çeşitliliğini doğru bir şekilde yansıtmıyorsa model bu kör noktaları devralacaktır. Bu olgu genellikle zayıf genelleştirmeyle sonuçlanır; burada bir yapay zeka test sırasında yüksek puanlar elde edebilir ancak çeşitli veya beklenmedik senaryolarda real-time inference için dağıtıldığında önemli ölçüde başarısız olur.
Yaygın Veri Çarpıklığı Kaynakları#
Yanlılık, geliştirme yaşam döngüsünün çeşitli aşamalarında bir veri kümesine sızabilir ve sıklıkla toplama veya etiketleme sırasındaki insan kararlarından kaynaklanır.
- Selection Bias: Bu durum toplanan veriler hedef popülasyonu rastgele temsil etmediğinde ortaya çıkar. Örneğin, ağırlıklı olarak ünlülerin görüntülerini kullanarak bir facial recognition veri kümesi oluşturmak modeli yoğun makyaj ve profesyonel aydınlatmaya doğru çarpıtarak günlük web kamerası görüntülerinde başarısız olmasına neden olabilir.
- Labeling Errors: data labeling sırasında öznellik insan önyargısını ortaya çıkarabilir. Eğer açıklayıcılar net yönergelerin eksikliği nedeniyle belirsiz nesneleri sürekli olarak yanlış sınıflandırırsa model bu hataları temel gerçeklik olarak kabul eder.
- Representation Bias: Rastgele seçilseler bile azınlık grupları çoğunluk sınıfı tarafından istatistiksel olarak baskılanabilir. object detection alanında 10.000 araba görüntüsüne karşılık yalnızca 100 bisiklet görüntüsü içeren bir veri kümesi, arabaları tespit etmeye yönelik yanlı bir modelle sonuçlanacaktır.
Gerçek Dünya Uygulamaları ve Sonuçları#
Veri kümesi yanlılığının etkisi, özellikle otomatik sistemlerin yüksek riskli kararlar aldığı veya fiziksel dünya ile etkileşime girdiği çeşitli endüstrilerde önemlidir.
Otomotiv endüstrisinde AI in automotive yayaları ve engelleri belirlemek için kameralara güvenir. Otonom bir araba öncelikle güneşli ve kuru iklimlerde toplanan veriler üzerinde eğitilirse karda veya şiddetli yağmurda çalışırken performans düşüşü gösterebilir. Bu durum eğitim dağılımının operasyonel dağılım ile eşleşmemesinin ve güvenlik risklerine yol açmasının klasik bir örneğidir.
Benzer şekilde medical image analysis alanında tanı modelleri genellikle geçmiş hasta verileri üzerinde eğitilir. Cilt rahatsızlıklarını tespit etmek için tasarlanmış bir model daha açık ten tonlarının baskın olduğu bir veri kümesi üzerinde eğitilirse daha koyu tenli hastaları teşhis ederken önemli ölçüde daha düşük bir accuracy gösterebilir. Bunu ele almak tüm demografik gruplarda fairness in AI sağlayan çeşitli veri kümelerini derlemek için ortak bir çaba gerektirir.
Azaltma Stratejileri#
Geliştiriciler titiz denetimler ve gelişmiş eğitim stratejileri kullanarak veri kümesi yanlılığını azaltabilir. data augmentation gibi teknikler, az temsil edilen örneklerin varyasyonlarını yapay olarak oluşturarak (örneğin çevirme, döndürme veya parlaklığı ayarlama) veri kümelerini dengelemeye yardımcı olur. Ayrıca synthetic data üretmek gerçek dünya verilerinin kıt olduğu veya toplanmasının zor olduğu boşlukları doldurabilir.
Bu veri kümelerini etkili bir şekilde yönetmek çok önemlidir. Ultralytics Platform ekiplerin eğitim başlamadan önce sınıf dağılımlarını görselleştirmesine ve dengesizlikleri belirlemesine olanak tanır. Ek olarak NIST AI Risk Management Framework gibi yönergelere uymak kuruluşların bu riskleri sistematik olarak belirleme ve hafifletme yaklaşımlarını yapılandırmasına yardımcı olur.
Veri Kümesi Yanlılığı vs. İlgili Kavramlar#
Hatanın nereden kaynaklandığını anlamak için veri kümesi yanlılığını benzer terimlerden ayırt etmek yararlıdır:
- vs. Algorithmic Bias: Veri kümesi yanlılığı verisentezlidir; "malzemelerin" kusurlu olduğunu gösterir. Algoritmatik yanlılık modelsentezlidir; algoritmanın kendi tasarımından veya azınlık grupları pahasına genel metrikleri en üst düzeye çıkarmak için çoğunluk sınıflarına öncelik verebilecek olan optimization algorithm kaynaklanır.
- vs. Model Drift: Veri kümesi yanlılığı eğitim sırasında mevcut olan statik bir sorundur. Model sapması (veya veri sapması), model dağıtıldıktan sonra gerçek dünya verilerinin zaman içinde değişmesiyle ortaya çıkar ve sürekli model monitoring gerektirir.
Kod Örneği: Yanlılığı Azaltmak için Artırma#
Aşağıdaki örnek YOLO26 ile eğitim sırasında veri artırımının nasıl uygulanacağını göstermektedir. Geometrik artırımların artırılmasıyla model daha iyi genelleme yapmayı öğrenir ve bu da eğitim setinde bulunan belirli nesne yönelimlerine veya konumlarına yönelik yanlılığı potansiyel olarak azaltır.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)





