Data Cleaning
Yapay zeka modeli doğruluğunu artırmak için veri temizlemede ustalaş. Hataları kaldırmak, eksik değerleri ele almak ve Ultralytics YOLO26 için temiz veri kümeleri hazırlamak adına teknikleri öğren.
Veri temizliği, bir kayıt setinden, tablodan veya veritabanından bozuk, yanlış veya alakasız kayıtları tespit edip düzeltme (veya kaldırma) kritik sürecidir. Yapay zeka (AI) ve makine öğrenimi (ML) alanında, bu adım genellikle iş akışının en çok zaman alan ancak en önemli kısmı olarak kabul edilir. YOLO26 gibi bir model nesneleri tanımayı etkili bir şekilde öğrenmeden önce, kalitesiz girdilerin güvenilmez çıktılara yol açtığı "Çöp Girdi, Çöp Çıktı" olgusunu önlemek için eğitim verisi hatalardan arındırılmalıdır.
Yapay Zekada Veri Bütünlüğünün Önemi#
Yüksek performanslı bilgisayarlı görü modelleri, kullandıkları veri kümelerinin kalitesine büyük ölçüde güvenir. Bir veri kümesi yanlış etiketlenmiş resimler, kopyalar veya bozuk dosyalar içeriyorsa, model örüntüleri genelleştirmekte zorlanır; bu da aşırı öğrenmeye (overfitting) veya zayıf çıkarım doğruluğuna yol açar. Etkili veri temizliği, tahmine dayalı modellerin güvenilirliğini artırır ve algoritmanın gürültü yerine geçerli sinyallerden öğrenmesini sağlar.
Yaygın Veri Temizleme Teknikleri#
Uygulayıcılar, tablo verileri için Pandas gibi araçları veya özel görü araçlarını kullanarak veri kümelerini iyileştirmek için çeşitli stratejiler izler.
- Eksik Değerleri Yönetme: Bu, eksik verileri içeren kayıtların kaldırılmasını ya da istatistiksel ortalamalara veya en yakın komşulara dayalı olarak boşlukları doldurmak için atama tekniklerinin kullanılmasını içerir.
- Kopyaları Kaldırma: Bir eğitim setindeki yinelenen resimler modeli yanlışlıkla önyargılı hale getirebilir. Bunların kaldırılması, modelin belirli örnekleri ezberlememesini sağlayarak veri kümesi önyargısının azaltılmasına yardımcı olur.
- Aykırı Değer Tespiti: Normdan önemli ölçüde sapan anormallikleri veya aykırı değerleri tespit edip yönetmek çok önemlidir, çünkü bunlar istatistiksel analizi ve model ağırlıklarını saptırabilir.
- Yapısal Onarım: Bu, sınıf tutarlılığını sağlamak için sınıf etiketlerindeki yazım hatalarının düzeltilmesini (ör. "Car" ile "car" durumunun düzeltilmesi) içerir.
Gerçek Dünya Uygulamaları#
Veri temizleme, yapay zekanın konuşlandırıldığı çeşitli sektörlerde çok önemlidir.
- Tıbbi Görüntü Analizi: Sağlık alanındaki yapay zeka uygulamalarında, veri kümeleri genellikle artefaktlar içeren taramalar, yanlış hasta üst verileri veya alakasız arka plan gürültüsü barındırır. Bu verilerin temizlenmesi, tıbbi görüntü analizi modellerinin yalnızca teşhisle ilgili biyolojik belirteçlere odaklanmasını sağlar.
- Perakende Envanter Yönetimi: Perakende sektöründeki yapay zeka için ürün veri kümeleri eski öğeler veya yanlış en boy oranlarına sahip resimler içerebilir. Bu veri kümelerinin temizlenmesi, nesne tespiti modellerinin canlı bir ortamda stok seviyelerini doğru bir şekilde belirlemesini ve yanlış pozitifleri azaltmasını sağlar.
Veri Temizlemeyi Ön İşlemeden Ayırt Etme#
Genellikle birbirinin yerine kullanılsa da veri temizliği, veri ön işlemeden farklıdır. Veri temizliği hataları düzeltmeye ve "kötü" verileri kaldırmaya odaklanır. Buna karşılık ön işleme; resim yeniden boyutlandırma, normalleştirme veya çeşitliliği artırmak için veri artırma uygulama gibi temiz verileri model için uygun bir biçime dönüştürmeyi içerir.
Kalite Kontrollerini Otomatikleştirme#
Ultralytics Platform üzerinde sunulanlar gibi modern iş akışları, eğitim başlamadan önce bozuk resimleri veya etiket tutarsızlıklarını belirlemek için otomatik kontrolleri entegre eder. Aşağıda, YOLO26 gibi bir modele veri beslemeden önce yaygın bir adım olan standart Pillow kütüphanesini kullanarak bozuk resim dosyalarının nasıl kontrol edileceğini ve tanımlanacağını gösteren basit bir Python örneği yer almaktadır.
from pathlib import Path
from PIL import Image
def verify_images(dataset_path):
"""Iterates through a directory to identify corrupt images."""
for img_path in Path(dataset_path).glob("*.jpg"):
try:
with Image.open(img_path) as img:
img.verify() # Checks file integrity
except (OSError, SyntaxError):
print(f"Corrupt file found: {img_path}")
# Run verification on your dataset
verify_images("./coco8/images/train")





