Uncertainty Quantification
Изучи количественную оценку неопределённости в ИИ и машинном обучении, включая алеаторную и эпистемическую неопределённость, калибровку, методы оценки и рабочие процессы Ultralytics YOLO.
Количественная оценка неопределённости (UQ) — это процесс оценки, анализа и передачи информации о том, насколько AI- или модель машинного обучения не уверена в своих прогнозах. Вместо возврата только метки, значения или ограничивающей рамки рабочий процесс UQ предоставляет дополнительную информацию, например распределение вероятностей, интервал прогнозирования, оценку уверенности или набор прогнозов. Это помогает понять не только что прогнозирует модель, но и насколько можно доверять этому прогнозу.
Почему важна количественная оценка неопределённости#
Модели изучают закономерности на ограниченных данных, поэтому их результаты никогда не бывают абсолютно достоверными. Входные данные могут быть зашумлёнными, метки — неоднозначными, а производственные данные — отличаться от распределения обучающих данных. UQ делает эти ограничения измеримыми и помогает принимать более безопасные решения, организовывать проверку человеком и эффективнее собирать данные.
Эта идея расширяет более общую цель — характеризовать качество моделей, описанную в виртуальной программе измерений NIST. В AI-системах оценки неопределённости могут помогать командам:
- Отклонять прогнозы или отправлять их на проверку, если неопределённость превышает допустимый уровень.
- Сравнивать альтернативные прогнозы, а не полагаться на единственный ответ.
- Выявлять незнакомые входные данные и возможный сдвиг данных.
- Определять приоритетные неуверенные образцы для разметки с помощью активного обучения.
- Учитывать неопределённость в последующих расчётах и решениях, как показано в обзоре Министерства энергетики США о неопределённости в вычислительных моделях.
UQ особенно важна, когда ошибки прогнозирования имеют разные последствия. Пропустить пешехода серьёзнее, чем ошибочно обнаружить дорожный знак, поэтому допустимый порог неопределённости зависит от конкретного применения.
Алеаторная и эпистемическая неопределённость#
Существуют две категории, объясняющие происхождение неопределённости прогнозов:
- Алеаторная неопределённость, также называемая случайной неопределённостью, возникает из-за присущей данным случайности или неоднозначности. Размытие из-за движения, шум сенсора, частичное перекрытие и непоследовательная разметка могут затруднить интерпретацию изображения даже для хорошо обученной модели. Дополнительные обучающие данные могут помочь оценить эту неопределённость, но не способны полностью устранить исходную неоднозначность.
- Эпистемическая неопределённость возникает из-за неполноты знаний модели. Она часто проявляется, когда обучающих данных недостаточно, они нерепрезентативны или не охватывают важные ситуации. Её нередко можно уменьшить, собрав релевантные примеры, улучшив аннотации или изменив модель.
UQ объединяет информацию об этих источниках в полезные результаты. Инструменты вероятностного моделирования, такие как TensorFlow Probability, могут представлять прогнозы в виде распределений, а ансамблевые методы оценивают неопределённость, сравнивая несколько моделей или запусков обучения. Значительное расхождение обычно указывает на более высокую эпистемическую неопределённость.
Неопределённость связана с оценкой уверенности, но имеет более широкое значение. Уверенность описывает силу одного прогноза, тогда как UQ оценивает надёжность этой оценки и источники неопределённости, которые на неё влияют. Аналогично, конформный прогноз — это конкретный метод формирования наборов прогнозов или интервалов с заданным покрытием при определённых предположениях.
Методы и оценка#
К распространённым подходам UQ относятся вероятностные выходные данные, ансамбли, повторная выборка, байесовское моделирование и интервалы прогнозирования. Доверительные интервалы методом Bootstrap оценивают вариативность посредством многократной повторной выборки наблюдаемых данных. Для классификации калибровка проверяет, оказываются ли прогнозы с назначенной вероятностью около 80% правильными примерно в 80% случаев.
Модель может быть точной, но плохо откалиброванной, поэтому командам следует оценивать как производительность задачи, так и качество неопределённости. Инструменты калибровки вероятностей используют диаграммы надёжности и методы калибровки для сравнения прогнозируемых вероятностей с наблюдаемыми результатами. В Правилах машинного обучения Google также подчёркивается важность интерпретируемых вероятностных прогнозов, находящихся под контролем.
К полезным критериям оценки относятся покрытие, ширина интервала, ошибка калибровки и производительность на сложных срезах данных. Для компьютерного зрения режим валидации Ultralytics и руководство по метрикам производительности YOLO помогают анализировать precision, recall, матрицы ошибок и поведение уверенности для разных классов и порогов.
Практические применения#
- Анализ медицинских изображений: Диагностическая модель может направить снимок на проверку специалистом, если несколько правдоподобных находок имеют схожие оценки или изображение отличается от обучающих данных. Без такой эскалации чрезмерно уверенный ошибочный прогноз может задержать лечение.
- Визуальный контроль на производстве: Детектор дефектов может столкнуться с бликами, новыми материалами или ранее не встречавшимися повреждениями. Маршрутизация с учётом неопределённости может направлять неоднозначные изделия на ручную проверку вместо автоматического принятия или отбраковки, сокращая как количество пропущенных дефектов, так и ненужные отходы.
Эти политики связывают неопределённость модели с операционным риском. В основе структуры управления рисками AI NIST рекомендуется измерять неопределённость, документировать ограничения обобщения и контролировать системы на протяжении всего развёртывания.
Неопределённость в рабочих процессах Ultralytics YOLO#
Ultralytics YOLO26 предоставляет оценки уверенности обнаружения через документированный режим Predict:
from ultralytics import YOLO
# Load an official detection model
model = YOLO("yolo26n.pt")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Inspect each detection's confidence
for box in result.boxes:
class_id = int(box.cls.item())
class_name = result.names[class_id]
confidence = box.conf.item()
print(f"{class_name}: {confidence:.3f}")Этот рабочий процесс предоставляет полезный сигнал, связанный с неопределённостью, но одной уверенности недостаточно для полноценной UQ, и её не следует автоматически интерпретировать как откалиброванную вероятность. Проверяй оценки на репрезентативных отложенных данных, выбирай пороги с учётом стоимости ошибок и отслеживай распределения уверенности после развёртывания.
Команды могут использовать Ultralytics Platform для разметки наборов данных, обучения и развёртывания моделей, а также мониторинга конечных точек. В сочетании с постоянным мониторингом и обслуживанием моделей сигналы неопределённости могут выявлять незнакомые условия, направлять случаи на проверку человеком и показывать, когда требуются новые данные или повторное обучение.









