Brier Score
Brier Score'un olasılıksal tahmin doğruluğunu, kalibrasyonunu ve çözünürlüğünü nasıl ölçtüğünü öğren. Formülleri, örnekleri, ilgili metrikleri ve YOLO26 değerlendirme iş akışlarını incele.
Brier Skoru, her tahmin edilen olasılık ile fiilen gerçekleşen sonuç arasındaki karesel farkın ortalamasını alarak olasılıksal tahminlerin doğruluğunu ölçer. 0 skoru kusursuz tahminleri temsil eder; daha büyük değerler, tahminlerin daha az doğru, daha kötü kalibre edilmiş veya her ikisi de olduğunu gösterir. Yalnızca nihai sınıf etiketlerine dayanan metriklerin aksine Brier Skoru, bir makine öğrenimi modelinin mantıklı olasılıklar atayıp atamadığını değerlendirir.
Brier Skoru Nasıl Çalışır?#
İkili sınıflandırma için, bir olay gerçekleştiğinde sonucu 1, gerçekleşmediğinde 0 olarak kodla. Her örnek için (predicted probability - outcome) squared değerini hesapla ve ardından bu değerlerin ortalamasını al.
Bir modelin bir görselin kusur içerme olasılığını %80 olarak tahmin ettiğini varsayalım:
- Kusur mevcutsa karesel hata
(0.8 - 1) squaredyani 0.04'tür. - Kusur mevcut değilse hata
(0.8 - 0) squaredyani 0.64'tür.
İkinci tahmin çok daha büyük bir cezalandırma alır çünkü model özgüvenli bir şekilde hatalıdır. Bu durum Brier Skorunu katı bir şekilde uygun bir skorlama kuralı (strictly proper scoring rule) yapar: ortalamada bir tahminci, en iyi skoru dürüst olasılık tahminini rapor ederek elde eder. scikit-learn Brier skor kaybı belgeleri standart bir uygulama sağlar.
İkili problemler için geleneksel aralık 0 ile 1 arasındadır. Çok sınıflı sürümler her sınıftaki karesel hataları toplar, dolayısıyla ikiye bölünmediği sürece aralıkları 0 ile 2 arasında olabilir. Kütüphaneler farklı ölçeklendirme kuralları kullandığından, yardstick’in çok sınıflı Brier Skorundaki yeniden ölçeklendirilmiş yaklaşım gibi, karşılaştırmalar aynı uygulamayı ve ayarları kullanmalıdır.
İyi Bir Brier Skorunu Yorumlamak#
Düşük olması daha iyidir, ancak “iyi” bir Brier Skoru için evrensel bir eşik yoktur. Anlamı, olayın sıklığına, veri kümesinin zorluğuna ve makul bir taban çizgisinin kalitesine bağlıdır.
Örneğin, bir olay vakaların %10'unda meydana geliyorsa, her zaman 0.10 tahmin eden bir model 0.09'luk beklenen bir skor alır. Yararlı bir model genellikle bu yaygınlığa dayalı taban çizgisini geliştirmelidir. Değerlendirme, önemli sınıflar, çalışma ortamları veya demografik gruplar için ayrı raporlamalarla birlikte temsilci doğrulama verilerini kullanmalıdır.
Skor, birbiriyle ilişkili iki özelliği yansıtır:
- Kalibrasyon: 0.80'lik tahminler zamanın yaklaşık %80'inde doğru olmalıdır. Olasılık kalibrasyon yöntemleri ve güvenilirlik diyagramları sistematik aşırı özgüveni veya yetersiz özgüveni ortaya çıkarabilir.
- Çözünürlük: Tahminler, olası olayları olası olmayanlardan anlamlı bir şekilde ayırmalıdır. Her zaman temel oranı tahmin eden bir model genel olarak kalibre edilmiş olabilir ancak vakaya özel çok az bilgi sağlar.
Tek bir toplulaştırılmış skor yerel problemleri gizleyebilir. Bunu bir kalibrasyon eğrisi, alt grup analizi ve daha geniş belirsizlik nicelemesi ile eşleştir.
Brier Skoru ve İlgili Metrikler#
-
Doğruluk, kesinlik ve anımsama: Bunlar bir eşik uygulandıktan sonra ayrık kararları değerlendirir. Brier Skoru, eşikleme yapmadan önce olasılıkları değerlendirerek 0.51'lik temkinli doğru tahmini 0.99'luk özgüvenli bir tahminden ayırır.
-
ROC AUC: AUC sıralamayı ölçer; yani pozitiflerin negatiflerden daha yüksek skorlar alma eğiliminde olup olmadığını inceler. Bir model vakaları doğru sıralayabilir ancak yine de zayıf kalibre edilmiş olasılıklar üretebilir.
-
Log kaybı: Her ikisi de uygun skorlama kurallarıdır, ancak log kaybı aşırı özgüvenli hataları daha keskin bir şekilde cezalandırır. Brier Skorunun karesel hata yorumunun açıklanması genellikle daha kolaydır.
-
Güven: “Güven” olarak etiketlenen bir model çıktısı otomatik olarak kalibre edilmiş bir olay olasılığı değildir. Brier Skoru uygulanmadan önce anlamı doğrulanmalıdır.
Gerçek Dünya Uygulamaları#
Tıbbi görsel triyajında, bir görüntü sınıflandırma modeli bir taramanın anormallik içerme olasılığını tahmin edebilir. Brier Skoru, yönlendirme kuralları %90'lık bir tahmini %55'lik bir tahminden farklı ele aldığında önem kazanan bu olasılıkların gözlemlenen tanıkarla eşleşip eşleşmediğini değerlendirebilir.
Üretim görsel denetiminde, bir model bir ürünün kusurlu olma olasılığını tahmin edebilir. İyi kalibre edilmiş tahminler risk tabanlı yönlendirmeyi destekler: yüksek olasılıklı vakalar reddedilebilir, belirsiz vakalar insan denetimine gönderilebilir ve düşük olasılıklı vakalar kabul edilebilir. Kötü kalibrasyon kaçan kusurlara veya gereksiz atıklara neden olabilir. NIST Yapay Zeka Risk Yönetimi Çerçevesi Çekirdeği, dağıtık sistemlerde belirsizliğin ölçülmesini ve performansın izlenmesini vurgular.
Pratik Değerlendirme İş Akışı#
Aşağıdaki örnek, bir modelin skorunu hesaplar ve bunu sabit bir yaygınlık taban çizgisiyle karşılaştırır:
from sklearn.metrics import brier_score_loss
# Binary outcomes and predicted event probabilities
y_true = [0, 1, 1, 0, 1, 0]
y_probability = [0.10, 0.75, 0.60, 0.30, 0.90, 0.40]
model_score = brier_score_loss(y_true, y_probability)
# Compare against always predicting the observed event rate
event_rate = sum(y_true) / len(y_true)
baseline_probability = [event_rate] * len(y_true)
baseline_score = brier_score_loss(y_true, baseline_probability)
print(f"Model: {model_score:.3f}")
print(f"Baseline: {baseline_score:.3f}")Bilgisayarlı görü için Ultralytics YOLO26 sınıflandırma tahminleri, Predict modu aracılığıyla sınıf olasılıklarını ortaya çıkarır. Skoru hesaplamadan önce bu olasılıkları etiketlenmiş ayrılmış (held-out) görseller üzerinde topla. Sonucu, göreve özel metriklerin yerini alacak şekilde ele almak yerine, Ultralytics doğrulama modu ve YOLO performans metrikleri kılavuzu ile birleştir.
Dağıtımdan sonra, yeni temel gerçeklik (ground-truth) etiketleri kullanılabilir hale geldiğinde skoru yeniden hesapla. Ultralytics Platform dağıtım izleme özelliği çevreleyen operasyonel iş akışını destekleyebilirken, yinelenen etiketli değerlendirmeler veri kaymasından kaynaklanan kalibrasyon değişikliklerinin tespit edilmesine yardımcı olur.






