Brier Score
Aprende como o Brier Score mede a precisão da previsão probabilística, calibração e resolução. Explora fórmulas, exemplos, métricas relacionadas e fluxos de trabalho de avaliação do YOLO26.
O Brier Score mede a precisão de previsões probabilísticas fazendo a média da diferença ao quadrado entre cada probabilidade prevista e o resultado que realmente ocorreu. Uma pontuação de 0 representa previsões perfeitas; valores maiores indicam que as previsões foram menos precisas, mal calibradas ou ambas. Ao contrário das métricas baseadas apenas em rótulos de classe finais, o Brier Score avalia se um machine learning model atribui probabilidades sensatas.
Como Funciona o Brier Score#
Para classificação binária, codifique o resultado como 1 quando um evento ocorre e 0 quando não ocorre. Para cada exemplo, calcule (predicted probability - outcome) squared, e depois tire a média desses valores.
Suponha que um modelo preveja uma probabilidade de 80% de que uma imagem contenha um defeito:
- Se o defeito estiver presente, o erro quadrático é
(0.8 - 1) squared, ou seja, 0,04. - Se nenhum defeito estiver presente, o erro é
(0.8 - 0) squared, ou seja, 0,64.
A segunda previsão recebe uma penalidade muito maior porque o modelo estava errando com confiança. Isso torna o Brier Score uma regra de pontuação estritamente correta (strictly proper scoring rule): em média, um previsor obtém a melhor pontuação ao relatar sua estimativa de probabilidade honesta. A scikit-learn Brier score loss documentation fornece uma implementação padrão.
Para problemas binários, o intervalo convencional é de 0 a 1. Versões multiclasse somam os erros quadráticos em todas as classes, portanto, o intervalo delas pode ser de 0 a 2, a menos que seja dividido por dois. Como as bibliotecas usam diferentes convenções de escala, como a abordagem redimensionada no yardstick’s multiclass Brier Score, as comparações devem usar a mesma implementação e configurações.
Interpretando um Bom Brier Score#
Quanto menor, melhor, mas não há um limite universal para um "bom" Brier Score. Seu significado depende da prevalência do evento, da dificuldade do conjunto de dados e da qualidade de uma linha de base razoável.
Por exemplo, se um evento ocorre em 10% dos casos, um modelo que sempre prevê 0,10 recebe uma pontuação esperada de 0,09. Um modelo útil deve geralmente melhorar em relação a essa linha de base baseada na prevalência. A avaliação deve usar validation data representativos, com relatórios separados para classes importantes, ambientes operacionais ou grupos demográficos.
A pontuação reflete duas propriedades relacionadas:
- Calibração: Previsões de 0,80 devem estar corretas aproximadamente 80% das vezes. Probability calibration methods e diagramas de confiabilidade podem revelar excesso ou falta de confiança sistêmicos.
- Resolução: As previsões devem separar de forma significativa eventos prováveis de improváveis. Um modelo que sempre prevê a taxa base pode estar calibrado no geral, mas fornece pouca informação específica do caso.
Uma única pontuação agregada pode ocultar problemas locais. Combine-a com uma calibration curve, análise de subgrupos e uncertainty quantification mais ampla.
Brier Score vs. Métricas Relacionadas#
-
Accuracy, precision, and recall: Estas avaliam decisões discretas após a aplicação de um limite. O Brier Score avalia as probabilidades antes da aplicação do limite, distinguindo uma previsão correta cautelosa de 0,51 de uma confiante de 0,99.
-
ROC AUC: A AUC mede a ordenação — se os positivos tendem a receber pontuações mais altas do que os negativos. Um modelo pode ordenar os casos corretamente e ainda produzir probabilidades mal calibradas.
-
Log loss: Ambas são regras de pontuação corretas, mas o log loss penaliza erros extremamente confiantes de forma mais drástica. A interpretação de erro quadrático do Brier Score costuma ser mais fácil de explicar.
-
Confidence: A saída de um modelo rotulada como "confiança" não é automaticamente uma probabilidade de evento calibrada. Seu significado deve ser validado antes de aplicar o Brier Score.
Aplicações no Mundo Real#
Em triagem de imagens médicas, um modelo de image classification pode estimar a probabilidade de uma varredura conter uma anomalia. O Brier Score pode avaliar se essas probabilidades correspondem aos diagnósticos observados, o que importa quando as regras de encaminhamento tratam uma estimativa de 90% de forma diferente de uma estimativa de 55%.
Em inspeção visual de fabricação, um modelo pode estimar a probabilidade de um produto apresentar defeito. Previsões bem calibradas apoiam o direcionamento baseado em risco: casos de alta probabilidade podem ser rejeitados, casos incertos enviados para inspeção humana e casos de baixa probabilidade aceitos. Uma calibração inadequada pode causar defeitos ignorados ou desperdício desnecessário. O NIST AI Risk Management Framework Core enfatiza a medição da incerteza e o monitoramento do desempenho em sistemas implantados.
Fluxo de Trabalho de Avaliação Prática#
O exemplo a seguir calcula a pontuação de um modelo e a compara com uma linha de base de prevalência constante:
from sklearn.metrics import brier_score_loss
# Binary outcomes and predicted event probabilities
y_true = [0, 1, 1, 0, 1, 0]
y_probability = [0.10, 0.75, 0.60, 0.30, 0.90, 0.40]
model_score = brier_score_loss(y_true, y_probability)
# Compare against always predicting the observed event rate
event_rate = sum(y_true) / len(y_true)
baseline_probability = [event_rate] * len(y_true)
baseline_score = brier_score_loss(y_true, baseline_probability)
print(f"Model: {model_score:.3f}")
print(f"Baseline: {baseline_score:.3f}")Para visão computacional, as previsões de classificação do Ultralytics YOLO26 expõem probabilidades de classe por meio do Predict mode. Colete essas probabilidades em imagens rotuladas mantidas à parte antes de calcular a pontuação. Combine o resultado com o Ultralytics validation mode e o YOLO performance metrics guide em vez de tratá-lo como um substituto para métricas específicas de tarefas.
Após a implantação, recalcule a pontuação quando novos rótulos de verdade de campo estiverem disponíveis. O Ultralytics Platform deployment monitoring pode dar suporte ao fluxo de trabalho operacional associado, enquanto avaliações rotuladas recorrentes ajudam a detectar alterações de calibração causadas por desvio de dados (data drift).






