Uncertainty Quantification
Узнай об оценке неопределенности в ИИ и машинном обучении, включая алеаторную и эпистемическую неопределенность, калибровку, методы оценки и рабочие процессы Ultralytics YOLO.
Количественная оценка неопределенности (UQ) — это процесс оценки, анализа и передачи степени неуверенности модели искусственного интеллекта или machine learning в отношении ее прогнозов. Вместо того чтобы возвращать только метку, значение или ограничивающую рамку, рабочий процесс UQ предоставляет дополнительную информацию, такую как распределение вероятностей, интервал прогноза, показатель уверенности или набор прогнозов. Это помогает понять не только что именно прогнозирует модель, но и насколько сильно можно доверять этому прогнозу.
Link to this sectionПочему количественная оценка неопределенности важна#
Модели изучают закономерности по ограниченному набору данных, поэтому их результаты никогда не бывают абсолютно достоверными. Входные данные могут содержать шумы, метки могут быть неоднозначными, а производственные данные могут отличаться от обучающего распределения. UQ делает эти ограничения измеримыми и способствует принятию более безопасных решений, проверке человеком и улучшению сбора данных.
Эта идея развивает более широкую задачу определения качества модели, описанную в виртуальной измерительной программе NIST. В системах искусственного интеллекта оценки неопределенности помогают командам:
- Отклонять или проверять прогнозы, когда неопределенность превышает допустимый уровень.
- Сравнивать альтернативные прогнозы вместо того, чтобы полагаться на единственный ответ.
- Выявлять незнакомые входные данные и возможное дрейф данных.
- Приоритезировать неопределенные образцы для разметки с помощью активное обучение.
- Переносить неопределенность в последующие расчеты и решения, как показано в обзоре Министерства энергетики США, посвященном неопределенности в вычислительных моделях.
UQ особенно важна, когда ошибки прогнозирования имеют неравноценные последствия. Пропуск пешехода гораздо опаснее, чем неверное определение дорожного знака, поэтому допустимый порог неопределенности зависит от конкретной задачи.
Link to this sectionАлеаторная и эпистемическая неопределенность#
Существует две категории, объясняющие происхождение неопределенности прогнозов:
- Алеаторная неопределенность, также называемая случайной, обусловлена присущей данным случайностью или неоднозначностью. Размытие при движении, шум датчиков, частичное перекрытие и противоречивые метки могут сделать изображение трудным для интерпретации даже для хорошо обученной модели. Дополнительные обучающие данные могут помочь оценить эту неопределенность, но они не способны полностью устранить исходную двусмысленность.
- Эпистемическая неопределенность возникает из-за неполноты знаний модели. Она часто проявляется, когда обучающих данных недостаточно, они нерепрезентативны или в них отсутствуют важные сценарии. Ее часто можно уменьшить путем сбора релевантных примеров, улучшения аннотаций или изменения модели.
UQ объединяет информацию об этих источниках в полезные результаты. Инструменты вероятностного моделирования, такие как TensorFlow Probability, позволяют представлять прогнозы в виде распределений, в то время как методы ансамблирования оценивают неопределенность путем сравнения нескольких моделей или прогонов обучения. Значительные расхождения обычно указывают на более высокую эпистемическую неопределенность.
Неопределенность связана с показатель уверенности, но шире его. Уверенность описывает силу одного прогноза, тогда как UQ оценивает, насколько этот показатель надежен и какие источники неопределенности на него влияют. Аналогично, конформное прогнозирование — это особый метод получения наборов или интервалов прогнозов с целевым покрытием при заданных допущениях.
Link to this sectionМетоды и оценка#
Распространенные подходы UQ включают вероятностные выходы, ансамбли, многократную выборку, байесовское моделирование и интервалы прогнозов. Доверительные интервалы бутстрэпа оценивают вариативность путем многократного повторного сэмплирования наблюдаемых данных. Для классификации калибровка проверяет, верны ли прогнозы с вероятностью около 80% примерно в 80% случаев.
Модель может быть точной, но плохо откалиброванной, поэтому следует оценивать как производительность задачи, так и качество неопределенности. Инструменты калибровки вероятностей используют диаграммы надежности и методы калибровки для сравнения прогнозируемых вероятностей с наблюдаемыми результатами. Правила машинного обучения от Google также подчеркивают важность интерпретируемых и контролируемых вероятностных прогнозов.
Полезные критерии оценки включают покрытие, ширину интервала, ошибку калибровки и производительность на сложных срезах данных. Для задач компьютерного зрения режим валидации Ultralytics и руководство по метрикам производительности YOLO помогают анализировать точность, полноту, матрицы ошибок и поведение уверенности для разных классов и пороговых значений.
Link to this sectionРеальные приложения#
- Анализ медицинских изображений: Диагностическая модель может пометить снимок для проверки специалистом, когда несколько правдоподобных результатов имеют схожие оценки или когда изображение отличается от обучающих данных. Без такого эскалирования излишне самоуверенный ошибочный прогноз может задержать лечение.
- Визуальный контроль на производстве: Детектор дефектов может столкнуться с бликами, новыми материалами или ранее не встречавшимися повреждениями. Маршрутизация с учетом неопределенности может направлять неоднозначные изделия на ручной контроль вместо автоматического приема или брака, сокращая как пропущенные дефекты, так и ненужные отходы.
Эти политики связывают неопределенность модели с операционными рисками. Базовый документ структуры управления рисками ИИ NIST рекомендует измерять неопределенность, документировать пределы обобщения и отслеживать системы на протяжении всего развертывания.
Link to this sectionНеопределенность в рабочих процессах Ultralytics YOLO#
Ultralytics YOLO26 предоставляет оценки уверенности обнаружения через свой задокументированный режим предсказания:
from ultralytics import YOLO
# Load an official detection model
model = YOLO("yolo26n.pt")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Inspect each detection's confidence
for box in result.boxes:
class_id = int(box.cls.item())
class_name = result.names[class_id]
confidence = box.conf.item()
print(f"{class_name}: {confidence:.3f}")Этот рабочий процесс предоставляет полезный сигнал, связанный с неопределенностью, но одна лишь уверенность не является полной UQ и ее не следует автоматически интерпретировать как откалиброванную вероятность. Проверяй оценки на репрезентативных отложенных данных, выбирай пороги на основе стоимости ошибок и следи за распределением уверенности после развертывания.
Команды могут использовать Ultralytics Platform для разметки наборов данных, обучения и развертывания моделей, а также мониторинга конечных точек. В сочетании с непрерывным мониторингом и обслуживанием моделей сигналы неопределенности могут выявлять незнакомые условия, направлять проверку человеком и определять, когда требуются новые данные или повторное обучение.






