Golden Dataset
Altın veri kümesi, yapay zekâ değerlendirmesinde güvenilir bir yanıt anahtarı olarak kullanılan, özenle etiketlenmiş ve temsili bir veri kümesidir. Nasıl oluşturulacağını ve sürdürüleceğini açıklar.
Altın veri kümesi, bir AI sistemini değerlendirmek için güvenilir bir referans olarak kullanılan; özenle derlenmiş, doğru biçimde etiketlenmiş ve temsili örneklerden oluşan bir koleksiyondur. Boyutu en üst düzeye çıkarmak yerine doğruluğa, kapsam genişliğine ve amaçlanan uygulamayla ilgisine öncelik verir. Ekipler bunu modelleri karşılaştırmak, gerilemeleri kontrol etmek, başarısızlıkları araştırmak ve bir sistemin dağıtıma hazır olup olmadığına karar vermek için istikrarlı bir “yanıt anahtarı” olarak kullanır.
Makine öğreniminde “altın veri kümesi”, evrensel olarak standartlaştırılmış bir veri kümesi türü değil, gayriresmî bir mühendislik terimidir. İçeriği göreve bağlıdır: nesne algılama için doğrulanmış sınırlayıcı kutulara sahip görüntüler, dil modeli için onaylanmış yanıtları içeren istemler veya dolandırıcılık algılama için sonuçları doğrulanmış işlemler.
Bir Veri Kümesini Altın Yapan Nedir?#
Altın veri kümesi, güvenilir beklenen çıktılarla birlikte girdiler içerir; bu çıktılara genellikle gerçek değer denir. Bilgisayarlı görüde bu çıktılar, titiz veri etiketleme yoluyla oluşturulan sınıf etiketleri, sınırlayıcı kutular, bölütleme maskeleri veya kilit noktalar olabilir.
Temel nitelikleri şunlardır:
- Etiket doğruluğu: Alan uzmanları veya eğitimli incelemeciler, açık yönergeler kullanarak etiketleri doğrular. Belirsiz örnekler, kişisel yoruma bırakılmak yerine tutarlı biçimde çözüme kavuşturulur.
- Temsili kapsama: Veri kümesi; yaygın durumlar, zor örnekler, nadir olaylar ve ilgili kullanıcı ya da çevre grupları dâhil önemli üretim koşullarını yansıtır.
- Görevle uyum: Her örnek, depo aydınlatması altında hasarlı paketleri tespit etmek gibi tanımlı bir gereksinimin ölçülmesine yardımcı olur.
- Bağımsızlık: Ekipler, bildirilen performansı yanıltıcı biçimde yüksek gösterebilen veri sızıntısını önlemek için örnekleri eğitim verilerinden ayrı tutar.
- İzlenebilirlik: Ekipler veri kaynaklarını, toplama koşullarını, açıklama kurallarını, inceleyenleri ve değişiklikleri kaydeder. MLflow veri kümesi takibi, karmaların, şemaların, kaynakların ve veri kümesi soy ağacının tekrarlanabilirliği nasıl destekleyebileceğini gösterir.
- Kontrollü değişiklik: Güncellemeler sürümlenir ve incelenir. Kesin veri kümesi sürümü ve değerlendirme ayarları bilinmiyorsa model puanı anlamlı değildir.
Altın veri kümesi kusursuz ya da kalıcı olarak doğru demek değildir. Gerçek dünya koşulları ve tanımlar değişebilir; bu nedenle geçmiş sonuçları sessizce değiştirmeden referans kümesi denetlenmeli ve yenilenmelidir.
Altın Veri Kümesi ve İlgili Terimler#
Altın veri kümesi, bilinen birkaç kavramla örtüşür ancak güven ve yönetişime odaklanır:
- Gerçek değer etiketi, tek bir örnek için kabul edilen yanıttır; altın veri kümesi ise incelenmiş örneklerden ve bunların kabul edilen yanıtlarından oluşan bir koleksiyondur.
- Kıyaslama veri kümesi genellikle sistemleri ortak bir görevde karşılaştırmak için paylaşılır. Altın veri kümesi ise çoğu zaman özeldir ve tek bir kuruluşa, ürüne veya dağıtım ortamına göre hazırlanır.
- Doğrulama verileri, geliştirme sırasında model seçimine ve ayarlamaya yön verir. Bu verilere dayanarak tekrar tekrar karar vermek, geliştirme sürecinin zamanla aşırı uyum göstermesine neden olabilir.
- Test verileri, son değerlendirme için ayrılır. Altın veri kümesi çoğu zaman yüksek kaliteli bir test veya regresyon kümesi işlevi görür; ancak ayrı geliştirme ve son test bölümleri de içerebilir.
- Eğitim verileri model parametrelerini öğretir ve genellikle çok daha büyüktür. Sürümlenmiş bir kopya değerlendirmeden kasıtlı olarak çıkarılmadığı sürece altın veri kümesi eğitim dışında tutulmalıdır.
Google'ın veri kümesi bölme kılavuzu, eğitim, doğrulama ve test örneklerinin birbirinden ayrı tutulmasını önerir. Veri az olduğunda çapraz doğrulama teknikleri tahminleri iyileştirebilir; ancak korunan bir nihai referans kümesi değerini korur.
Gerçek Dünya Uygulamaları#
Üretim kusuru incelemesi: Bir fabrika; kabul edilebilir ürünleri ve çatlaklar, eksik bileşenler veya hatalı montaj gibi doğrulanmış kusurları gösteren, incelenmiş görüntülerden oluşan bir altın veri kümesi oluşturabilir. Veri kümesi birden fazla üretim hattını, kamera konumunu, malzemeyi ve aydınlatma koşulunu kapsar. Her aday model, yayımlanmadan önce aynı kümede değerlendirilir. Küçük çatlaklara yönelik duyarlılık düşerse ekip, genel metrik kabul edilebilir görünse bile dağıtımı engelleyebilir.
Perakende raflarının izlenmesi: Bir perakendeci; kalabalık raflar, boş alanlar, kısmen gizlenmiş ürünler, sezonluk ambalajlar ve yansımalar içeren doğrulanmış mağaza görüntülerini saklayabilir. Bu veri kümesi, bir görüntü sisteminin farklı mağaza ortamlarında ürünleri ve stok boşluklarını güvenilir biçimde tespit edip etmediğini ölçer. Performansı senaryoya veya ürün kategorisine göre incelemek, Microsoft'un sorumlu yapay zekâ kılavuzunda açıklanan yüksek hata oranlı grupları bulmaya yönelik daha geniş uygulamayı izler.
Bu uygulamalar, genel doğruluğun neden tek başına yeterli olmadığını gösterir. Altın veri kümesi; hataların farklı sonuçlar doğurduğu nadir sınıflar, konumlar, cihazlar veya koşullar için dilim tabanlı değerlendirmeyi desteklemelidir. NIST Yapay Zekâ Risk Yönetimi Çerçevesi Temel Belgesi de belgelenmiş test kümelerini, uygun metrikleri ve dağıtım koşullarına benzer koşullarda değerlendirmeyi vurgular.
Altın Veri Kümesi Oluşturma ve Bakımı#
Modelin amaçlanan davranışını ve önemli hata türlerini tanımlayarak başla. Temsili örnekleri topla, kesin açıklama yönergeleri yaz, inceleyicilerin kalibrasyonunu yap ve anlaşmazlıkları alan uzmanlarıyla çöz. Görsel olarak benzer içeriklerin eğitim-değerlendirme sınırını aşmaması için neredeyse yinelenen örnekleri ve ilişkili video karelerini aynı bölmede tut.
Görüntü projeleri için Ultralytics Platform, bulut veri kümesi yönetimini, açıklama eklemeyi, eğitimi ve dağıtımı destekler. Açıklama iş akışı, ekiplerin etiketler oluşturup iyileştirmesini sağlarken veri kümesi görünümleri sınıf dağılımlarını, açıklama eklenmemiş görüntüleri, bölmeleri, yinelenenleri ve aykırı değerleri incelemeye yardımcı olur.
Onaylanan her sürümü numaralandır ve eklemeleri, kaldırmaları, etiket düzeltmelerini ve politika değişikliklerini belgele. NIST'in yapay zekâ testi, değerlendirmesi, doğrulaması ve geçerlemesine ilişkin kılavuzu, anlamlı değerlendirme için daha geniş bir çerçeve sunar. Dağıtımdan sonra gelen verileri altın referansla karşılaştır ve değişen koşulları izle; Azure model izleme kılavuzu, kayma ve veri kalitesi sinyallerinin referans kümesinin ne zaman yenilenmesi gerektiğini nasıl ortaya çıkarabileceğini açıklar.
Bir Görüntü Modelini Değerlendirme#
Ultralytics YOLO, tahminleri incelenmiş etiketlerle Doğrulama modunu kullanarak değerlendirebilir:
from ultralytics import YOLO
# Load a pretrained object detection model
model = YOLO("yolo26n.pt")
# Evaluate predictions against a labeled reference split
metrics = model.val(data="coco8.yaml", split="val")
# Report the primary detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Bu iş akışı, model tarafında altın veri kümesinin rolünü gösterir: Sabit bir modeli sabit, etiketli bir bölme üzerinde çalıştır ve tekrarlanabilir bir metriği kaydet. Üretim projelerinde ekipler, sürümü onaylamadan önce sınıf başına sonuçları, karmaşıklık matrislerini, zor örnekleri ve uygulamaya özgü kabul eşiklerini de incelemelidir.










