Brier Score
Aprende cómo el Brier Score mide la precisión de las predicciones probabilísticas, la calibración y la resolución. Explora fórmulas, ejemplos, métricas relacionadas y flujos de trabajo de evaluación de YOLO26.
El Brier Score mide la precisión de las predicciones probabilísticas promediando la diferencia al cuadrado entre cada probabilidad predicha y el resultado que ocurrió realmente. Una puntuación de 0 representa predicciones perfectas; los valores más altos indican que las predicciones fueron menos precisas, peor calibradas o ambas cosas. A diferencia de las métricas basadas únicamente en etiquetas de clases finales, el Brier Score evalúa si un machine learning model asigna probabilidades razonables.
Cómo funciona el Brier Score#
Para la clasificación binaria, codifica el resultado como 1 cuando ocurre un evento y 0 cuando no ocurre. Para cada ejemplo, calcula (predicted probability - outcome) squared, y luego promedia esos valores.
Supón que un modelo predice una probabilidad del 80 % de que una imagen contenga un defecto:
- Si el defecto está presente, el error cuadrático es
(0.8 - 1) squared, o 0,04. - Si no hay ningún defecto presente, el error es
(0.8 - 0) squared, o 0,64.
La segunda predicción recibe una penalización mucho mayor porque el modelo se equivocó con total seguridad. Esto convierte al Brier Score en una regla de puntuación estrictamente propia: en promedio, un pronosticador obtiene la mejor puntuación al informar su estimación de probabilidad honesta. La scikit-learn Brier score loss documentation proporciona una implementación estándar.
Para problemas binarios, el rango convencional es de 0 a 1. Las versiones multiclase suman los errores al cuadrado de cada clase, por lo que su rango puede ser de 0 a 2 a menos que se divida por dos. Debido a que las bibliotecas utilizan diferentes convenciones de escala, como el enfoque reescalado en el yardstick’s multiclass Brier Score, las comparaciones deben utilizar la misma implementación y configuración.
Cómo interpretar un buen Brier Score#
Cuanto más bajo, mejor, pero no existe un umbral universal para un «buen» Brier Score. Su significado depende de la prevalencia del evento, la dificultad del conjunto de datos y la calidad de una línea base razonable.
Por ejemplo, si un evento ocurre en el 10 % de los casos, un modelo que siempre predice 0,10 recibe una puntuación esperada de 0,09. Un modelo útil generalmente debería mejorar esa línea base basada en la prevalencia. La evaluación debe utilizar validation data representativos, con informes separados para clases importantes, entornos operativos o grupos demográficos.
La puntuación refleja dos propiedades relacionadas:
- Calibración: Las predicciones de 0,80 deben ser correctas aproximadamente el 80 % de las veces. Los Probability calibration methods y los diagramas de fiabilidad pueden revelar un exceso o una falta de confianza sistemáticos.
- Resolución: Las predicciones deben separar de manera significativa los eventos probables de los improbables. Un modelo que siempre predice la tasa base puede estar calibrado en general, pero proporciona poca información específica para cada caso.
Una única puntuación agregada puede ocultar problemas locales. Combínala con una calibration curve, un análisis de subgrupos y una uncertainty quantification más amplia.
Brier Score frente a métricas relacionadas#
-
Accuracy, precision, and recall: Estas evalúan decisiones discretas después de aplicar un umbral. El Brier Score evalúa las probabilidades antes de aplicar el umbral, distinguiendo una predicción correcta prudente de 0,51 de una segura de 0,99.
-
ROC AUC: El AUC mide la clasificación: si los positivos tienden a recibir puntuaciones más altas que los negativos. Un modelo puede clasificar los casos correctamente y, aun así, producir probabilidades mal calibradas.
-
Log loss: Ambas son reglas de puntuación propias, pero el log loss penaliza los errores extremadamente seguros de forma más drástica. La interpretación del error cuadrático del Brier Score suele ser más fácil de explicar.
-
Confidence: La salida de un modelo etiquetada como «confianza» no es automáticamente una probabilidad de evento calibrada. Su significado debe validarse antes de aplicar el Brier Score.
Aplicaciones en el mundo real#
En el triaje de imágenes médicas, un modelo de image classification puede estimar la probabilidad de que una exploración contenga una anomalía. El Brier Score puede evaluar si esas probabilidades coinciden con los diagnósticos observados, lo cual importa cuando las normas de derivación tratan una estimación del 90 % de forma diferente a una del 55 %.
En la inspección visual de fabricación, un modelo puede estimar la probabilidad de que un producto sea defectuoso. Las predicciones bien calibradas admiten un enrutamiento basado en riesgos: los casos de alta probabilidad se pueden rechazar, los casos inciertos se pueden enviar para su inspección humana y los casos de baja probabilidad se pueden aceptar. Una mala calibración puede provocar defectos que se escapen o residuos innecesarios. El NIST AI Risk Management Framework Core hace hincapié en medir la incertidumbre y supervisar el rendimiento en los sistemas implementados.
Flujo de trabajo de evaluación práctica#
El siguiente ejemplo calcula la puntuación de un modelo y la compara con una línea base de prevalencia constante:
from sklearn.metrics import brier_score_loss
# Binary outcomes and predicted event probabilities
y_true = [0, 1, 1, 0, 1, 0]
y_probability = [0.10, 0.75, 0.60, 0.30, 0.90, 0.40]
model_score = brier_score_loss(y_true, y_probability)
# Compare against always predicting the observed event rate
event_rate = sum(y_true) / len(y_true)
baseline_probability = [event_rate] * len(y_true)
baseline_score = brier_score_loss(y_true, baseline_probability)
print(f"Model: {model_score:.3f}")
print(f"Baseline: {baseline_score:.3f}")Para la visión artificial, las predicciones de clasificación de Ultralytics YOLO26 exponen las probabilidades de clase a través del Predict mode. Recopila estas probabilidades en imágenes etiquetadas reservadas antes de calcular la puntuación. Combina el resultado con el Ultralytics validation mode y la YOLO performance metrics guide en lugar de tratarlo como un sustituto de las métricas específicas de la tarea.
Después de la implementación, vuelve a calcular la puntuación cuando haya nuevas etiquetas de verdad de terreno disponibles. El Ultralytics Platform deployment monitoring puede respaldar el flujo de trabajo operativo circundante, mientras que las evaluaciones etiquetadas periódicas ayudan a detectar los cambios de calibración causados por la deriva de datos.






