Data Drift
Veri kaymasının ML modeli doğruluğu üzerindeki etkisini keşfet. Sağlam MLOps için Ultralytics YOLO26 ve Ultralytics Platform'u kullanarak kaymaları nasıl tespit edip azaltacağını öğren.
Veri kayması, bir makine öğrenimi (ML) sisteminde, üretim ortamında gözlemlenen girdi verilerinin istatistiksel özelliklerinin, modeli oluşturmak için başlangıçta kullanılan eğitim verilerine kıyasla zaman içinde değişmesi olgusunu ifade eder. Bir model dağıtıldığında, karşılaştığı gerçek dünya verilerinin, öğrendiği geçmiş verilere temelde benzeyeceği varsayımıyla çalışır. Çevresel koşulların veya kullanıcı davranışlarının değişmesi nedeniyle bu varsayım geçersiz olursa, modelin kodu ve parametreleri değişmeden kalsa bile doğruluğu ve güvenilirliği önemli ölçüde düşebilir. Veri kaymasını tespit etmek ve yönetmek, Makine Öğrenimi Operasyonlarının (MLOps) kritik bir bileşenidir ve yapay zeka sistemlerinin model dağıtımından sonra da değer sunmaya devam etmesini sağlar.
Veri Kayması ve Kavram Kayması Karşılaştırması#
Yapay zeka sistemlerini etkili bir şekilde sürdürebilmek için veri kaymasını, bununla yakından ilişkili bir terim olan kavram kaymasından ayırt etmek gerekir. Her ikisi de performans düşüşüne yol açsa da farklı çevresel değişikliklerden kaynaklanır.
- Veri Kayması (Kovaryat Kayması): Girdi özelliklerinin dağılımı değişirken girdiler ile hedef çıktı arasındaki ilişkinin sabit kaldığı durumdur. Örneğin bilgisayarlı görü (CV) alanında bir model, gündüz çekilmiş görüntülerle eğitilmiş olabilir. Kamera alacakaranlıkta görüntü almaya başlarsa girdi dağılımı (aydınlatma, gölgeler) kaymış olur, ancak "araba" veya "yaya" tanımı aynı kalır.
- Kavram Kayması: Girdi özellikleri ile hedef değişken arasındaki istatistiksel ilişkinin değişmesiyle ortaya çıkar. Başka bir deyişle, gerçek referansın tanımı değişir. Örneğin finansal dolandırıcılık tespitinde, dolandırıcılar taktiklerini uyarladıkça dolandırıcılık oluşturan örüntüler sıklıkla değişir ve güvenli işlemler ile dolandırıcılık içeren işlemler arasındaki sınır farklılaşır.
Gerçek Dünya Uygulamaları ve Örnekleri#
Veri kayması, Yapay Zekanın (AI) dinamik, fiziksel ortamlarla etkileşime girdiği tüm sektörlerde yaygın bir zorluktur.
-
Otonom Sistemler: Otonom araçlar alanında algılama modelleri, güvenli bir şekilde yol alabilmek için nesne algılamaya dayanır. Öncelikle güneşli Kaliforniya yollarından alınan verilerle eğitilmiş bir model, yoğun kar yağışı alan bir bölgede dağıtılırsa ciddi veri kayması yaşayabilir. Görsel girdiler (karla kaplı şeritler, görünmeyen işaretler) eğitim kümesinden büyük ölçüde farklıdır ve bu durum şerit algılama gibi güvenlik özelliklerini tehlikeye atabilir.
-
Sağlık Görüntüleme: Tıbbi görüntü analizi sistemlerinde, hastaneler donanımlarını yükselttiğinde kayma görülebilir. Bir model belirli bir tarayıcı üreticisinin X-ray görüntüleriyle eğitilmişse, farklı çözünürlük veya kontrast ayarlarına sahip yeni bir makinenin kullanıma alınması veri dağılımında bir kaymayı temsil eder. Model bakımı yapılmazsa tanısal performans düşebilir.
Tespit ve Azaltma Stratejileri#
Kaymayı erken tespit etmek, bir modelin kendinden emin ancak hatalı tahminler yaptığı "sessiz hatayı" önler. Ekipler, bu anormallikleri iş sonuçlarını etkilemeden önce belirlemek için çeşitli stratejiler kullanır.
Tespit Yöntemleri#
- İstatistiksel Testler: Mühendisler, gelen üretim verilerinin dağılımını eğitimdeki referans dağılımla matematiksel olarak karşılaştırmak için genellikle Kolmogorov-Smirnov testi gibi yöntemleri kullanır.
- Performans İzleme: Gerçek zamanlı olarak kesinlik ve duyarlılık gibi metrikleri izlemek, kayma tespiti için bir gösterge olarak kullanılabilir. Bir YOLO26 modelinin ortalama güven skorunda ani bir düşüş görülmesi, modelin yeni veri örüntüleriyle başa çıkmakta zorlandığını sıklıkla gösterir.
- Görselleştirme: TensorBoard gibi araçlar veya Grafana gibi özel platformlar, ekiplerin özellik dağılımlarının histogramlarını görselleştirmesine olanak tanıyarak kaymaları görsel olarak tespit etmeyi kolaylaştırır.
Azaltma Teknikleri#
- Yeniden Eğitim: En sağlam çözüm çoğu zaman modeli yeniden eğitmektir. Bu süreç, yeni ve kaymış verilerin toplanmasını, etiketlenmesini ve özgün veri kümesiyle birleştirilmesini içerir. Ultralytics Platformu, veri kümesi yönetimi ve bulutta eğitim araçları sunarak bu süreci basitleştirir.
- Veri Artırma: İlk eğitim sırasında kapsamlı veri artırma uygulamak; parlaklığı değiştirmek, gürültü eklemek veya görüntüleri döndürmek gibi işlemlerle modeli küçük çevresel değişikliklere karşı daha dayanıklı hâle getirebilir.
- Alan Uyarlama: Transfer öğrenimi teknikleri, modellerin daha az miktarda etiketli veri kullanarak yeni bir hedef alana uyum sağlamasına ve kaynak eğitim ortamı ile yeni üretim gerçekliği arasındaki boşluğu kapatmasına olanak tanır.
Modelinizin tahminlerindeki güveni kontrol ederek temel düzeyde kayma izleme uygulayabilirsiniz. Ortalama güven sürekli olarak güvenilir bir eşik değerinin altına düşerse veri incelemesi için bir uyarı tetiklenebilir.
from ultralytics import YOLO
# Load the official YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on a new image from the production stream
results = model("https://ultralytics.com/images/bus.jpg")
# Monitor confidence scores; consistently low scores may signal data drift
for result in results:
for box in result.boxes:
print(f"Class: {box.cls}, Confidence: {box.conf.item():.2f}")Veri kaymasını yönetmek tek seferlik bir düzeltme değil, sürekli devam eden bir yaşam döngüsü sürecidir. Bulut sağlayıcıları, bunu otomatikleştirmek için AWS SageMaker Model Monitor veya Google Cloud Vertex AI gibi yönetilen hizmetler sunar. Kuruluşlar, bu kaymaları proaktif olarak izleyerek modellerinin dayanıklılığını korur ve yüksek yapay zeka güvenliği standartları ile operasyonel verimliliği sürdürür.









