Brier Score
Узнай, как оценка Brier Score измеряет точность вероятностных прогнозов, калибровку и разрешение. Изучи формулы, примеры, сопутствующие метрики и рабочие процессы оценки YOLO26.
Brier Score измеряет точность вероятностных предсказаний путем усреднения квадратичной разницы между каждой предсказанной вероятностью и фактически произошедшим результатом. Оценка 0 представляет собой идеальные предсказания; большие значения указывают на то, что предсказания были менее точными, хуже откалиброванными или и то, и другое. В отличие от метрик, основанных только на финальных метках классов, Brier Score оценивает, присваивает ли модель машинного обучения разумные вероятности.
Как работает Brier Score#
Для бинарной классификации закодируй результат как 1, когда событие происходит, и 0, когда оно не происходит. Для каждого примера вычисли (predicted probability - outcome) squared, а затем усредни эти значения.
Предположим, модель предсказывает 80% вероятность того, что изображение содержит дефект:
- Если дефект присутствует, квадратичная ошибка составляет
(0.8 - 1) squared, или 0,04. - Если дефект отсутствует, ошибка составляет
(0.8 - 0) squared, или 0,64.
Второе предсказание получает гораздо больший штраф, потому что модель была уверенно неправа. Это делает Brier Score строго правильным правилом оценивания: в среднем прогнозист получает лучшую оценку, сообщая свою честную оценку вероятности. Документация scikit-learn по функции потерь Brier score loss предоставляет стандартную реализацию.
Для бинарных задач стандартный диапазон составляет от 0 до 1. Многоклассовые версии суммируют квадратичные ошибки по каждому классу, поэтому их диапазон может составлять от 0 до 2, если не разделить его на два. Поскольку библиотеки используют разные конвенции масштабирования, такие как измененный подход в многоклассовом Brier Score от yardstick, для сравнений следует использовать одну и ту же реализацию и настройки.
Интерпретация хорошего Brier Score#
Меньше — значит лучше, но универсального порогового значения для «хорошего» Brier Score не существует. Его смысл зависит от распространенности событий, сложности набора данных и качества разумного базового уровня.
Например, если событие происходит в 10% случаев, модель, которая всегда предсказывает 0,10, получает ожидаемую оценку 0,09. Полезная модель должна в целом превосходить этот базовый уровень, основанный на распространенности. Оценка должна использовать репрезентативные данные валидации с раздельной отчетностью для важных классов, операционных сред или демографических групп.
Оценка отражает два связанных свойства:
- Калибровка: Предсказания со значением 0,80 должны быть верными примерно в 80% случаев. Методы калибровки вероятностей и диаграммы надежности могут выявить систематическую самоуверенность или недостаток уверенности.
- Разрешение: Предсказания должны содержательно отделять вероятные события от маловероятных. Модель, которая всегда предсказывает базовую частоту, может быть откалибрована в целом, но предоставляет мало специфичной для конкретного случая информации.
Единая совокупная оценка может скрывать локальные проблемы. Сочетай ее с кривой калибровки, анализом подгрупп и более широкой оценкой неопределенности.
Brier Score против связанных метрик#
-
Точность, прецизионность и полнота: Они оценивают дискретные решения после применения порога. Brier Score оценивает вероятности до пороговой обработки, отличая осторожное правильное предсказание 0,51 от уверенного предсказания 0,99.
-
ROC AUC: AUC измеряет ранжирование — получают ли положительные результаты более высокие оценки, чем отрицательные. Модель может правильно ранжировать случаи, но при этом выдавать плохо откалиброванные вероятности.
-
Логарифмические потери: Обе метрики являются правильными правилами оценивания, но логарифмические потери более резко штрафуют за крайне самоуверенные ошибки. Интерпретацию квадратичной ошибки Brier Score часто легче объяснить.
-
Уверенность: Выходные данные модели, помеченные как «уверенность», не автоматически являются откалиброванной вероятностью события. Ее значение должно быть проверено перед применением Brier Score.
Реальные приложения#
В медицинской триаж-диагностике по изображениям модель классификации изображений может оценивать вероятность того, что снимок содержит аномалию. Brier Score может оценить, соответствуют ли эти вероятности наблюдаемым диагнозам, что важно, когда правила направления на консультацию трактуют оценку 90% иначе, чем оценку 55%.
В производственном визуальном контроле модель может оценивать вероятность того, что изделие является бракованным. Хорошо откалиброванные предсказания поддерживают маршрутизацию на основе рисков: случаи с высокой вероятностью могут быть отклонены, случаи с неопределенностью отправлены на ручную проверку, а случаи с низкой вероятностью приняты. Плохая калибровка может привести к пропуску дефектов или ненужным отходам. Основа структуры управления рисками ИИ NIST подчеркивает важность измерения неопределенности и мониторинга производительности в развернутых системах.
Практический рабочий процесс оценки#
Следующий пример вычисляет оценку модели и сравнивает ее с постоянным базовым уровнем распространенности:
from sklearn.metrics import brier_score_loss
# Binary outcomes and predicted event probabilities
y_true = [0, 1, 1, 0, 1, 0]
y_probability = [0.10, 0.75, 0.60, 0.30, 0.90, 0.40]
model_score = brier_score_loss(y_true, y_probability)
# Compare against always predicting the observed event rate
event_rate = sum(y_true) / len(y_true)
baseline_probability = [event_rate] * len(y_true)
baseline_score = brier_score_loss(y_true, baseline_probability)
print(f"Model: {model_score:.3f}")
print(f"Baseline: {baseline_score:.3f}")Для компьютерного зрения предсказания классификации Ultralytics YOLO26 предоставляют вероятности классов через режим Predict. Собери эти вероятности на размеченных отложенных изображениях перед вычислением оценки. Объедини результат с режимом валидации Ultralytics и руководством по метрикам производительности YOLO, а не рассматривай его как замену метрик для конкретных задач.
После развертывания пересчитывай оценку по мере появления новых меток истинных данных (ground-truth). Мониторинг развертывания на платформе Ultralytics может поддержать сопутствующий операционный рабочий процесс, в то время как регулярные размеченные оценки помогают обнаруживать изменения калибровки, вызванные дрейфом данных.






