Точность, прецизионность и полнота в машинном обучении: сравнение
Узнай о точности, прецизионности и полноте в машинном обучении. Изучи матрицу ошибок, показатель F1 и способы использования этих важных метрик оценки.

Машинное обучение (ML) — это раздел искусственного интеллекта (AI), посвящённый созданию систем, которые обучаются на данных. Оно играет центральную роль во многих других областях AI, включая компьютерное зрение, где машины интерпретируют изображения, и обработку естественного языка, где они понимают и генерируют человеческую речь.
Часто такие модели AI используют методы глубокого обучения для построения прогнозов на основе данных. Хотя такие системы могут быть очень эффективными, они не всегда выдают правильные прогнозы. Некоторые результаты могут быть точными, а другие — ошибочными.
Понимание того, как возникают эти ошибки, — важная часть оценки качества работы модели. Для измерения производительности можно использовать метрики оценки модели.
К распространённым метрикам оценки относятся accuracy (общая правильность), precision (надёжность положительных прогнозов) и recall (насколько хорошо модель выявляет фактически положительные случаи). На первый взгляд они могут казаться похожими, но каждая из них сосредоточена на отдельной стороне поведения модели.
В этой статье мы подробнее рассмотрим каждую из этих метрик производительности моделей AI. Также мы разберём, как они связаны друг с другом и как выбрать подходящую метрику для твоего сценария использования. Давай начнём!
Метрики оценки модели важны в машинном обучении#
Модель машинного обучения поначалу может казаться эффективной. Но без подходящих метрик оценки сложно понять, насколько точны её результаты. Эти метрики обеспечивают системный подход к оценке модели и помогают ответить на ключевой вопрос: полезны и надёжны ли прогнозы модели для конкретной задачи?
Такие метрики, как accuracy, precision и recall, дают разработчикам AI понятный способ измерить, насколько хорошо работает модель. Например, при сравнении разных моделей эти метрики позволяют определить, какая из них лучше справляется с конкретной задачей. Они помогают оценить производительность и выбрать модель, которая лучше всего соответствует целям проекта AI.

Рис. 1. Процесс обучения и оценки модели (Источник)
Эти метрики также делают сравнение производительности более объективным. Вместо догадок или неполных наблюдений они дают измеримые сведения о поведении модели в разных ситуациях. Благодаря этому они показывают, какие аспекты производительности наиболее важны в каждом контексте.
Например, выбор метрики часто зависит от области применения. В медицинских приложениях AI важна полнота, поскольку цель — выявить как можно больше положительных случаев, даже если некоторые отрицательные случаи будут ошибочно отмечены как положительные. Напротив, почтовый фильтр спама может отдавать приоритет precision, чтобы не помечать корректные письма как спам.
Матрица ошибок: основа метрик классификации#
Матрица ошибок — это таблица размером два на два, имеющая фундаментальное значение для оценки моделей AI. Она распределяет прогнозы по четырём категориям, сопоставляя фактические результаты с предсказанными (ответами, которые выдаёт модель).
Такое сравнение даёт подробное представление о производительности модели. Оно служит основой для ключевых метрик оценки, таких как precision и recall, которые вычисляются непосредственно по значениям в матрице.
Строки таблицы представляют фактические классы, а столбцы — предсказанные. В каждой ячейке указано количество результатов в соответствующей категории. Проще говоря, матрица показывает, сколько прогнозов были правильными и какие ошибки допустила модель.
Матрица ошибок особенно полезна при несбалансированных данных, когда в некоторых категориях значительно больше примеров, чем в других. Она также помогает, когда разные типы ошибок имеют разную стоимость.
Например, при обнаружении мошенничества критически важно выявлять мошеннические действия, но ошибочная пометка настоящих транзакций тоже может привести к проблемам. Матрица показывает, как часто возникает каждый тип ошибки.
Элементы матрицы ошибок#
Ниже представлен обзор различных элементов матрицы ошибок:
- Истинно положительный результат (TP): Когда модель правильно прогнозирует положительный случай, он регистрируется как истинно положительный результат. Например, модель компьютерного зрения правильно классифицирует транспортное средство на изображении.
- Истинно отрицательный результат (TN): Истинно отрицательный результат возникает, когда модель правильно распознаёт отрицательный случай. Например, классификатор электронной почты помечает обычное сообщение как не являющееся спамом.
- Ложноположительный результат (FP): Модель выдаёт ложноположительный результат, когда ошибочно прогнозирует положительный исход для случая, который на самом деле является отрицательным. Также известная как ошибка I рода, такая ситуация может возникнуть, когда система обнаружения мошенничества помечает действительную транзакцию как мошенническую.
- Ложноотрицательный результат (FN): Ложноотрицательный результат регистрируется, когда модель не обнаруживает положительный случай и ошибочно прогнозирует его как отрицательный. Также известная как ошибка II рода, такая ситуация может возникнуть, когда диагностический инструмент не обнаруживает заболевание у действительно больного пациента.

Рис. 2. Элементы матрицы ошибок (Источник)
Визуальное представление и интерпретация матрицы ошибок#
Матрица ошибок отображается в виде сетки. Вертикальная ось показывает фактические классы, а горизонтальная — предсказанные. Правильные прогнозы расположены на диагонали и представляют истинно положительные и истинно отрицательные результаты.
Ошибки находятся вне диагонали и включают ложноположительные и ложноотрицательные результаты. Такая структура упрощает выявление сильных и слабых сторон.
Что такое accuracy в машинном обучении?#
Accuracy — одна из наиболее широко используемых метрик для оценки качества работы модели машинного обучения. Она измеряет, как часто прогнозы оказываются правильными для всех классов. Иными словами, она отвечает на простой вопрос: сколько из всех прогнозов, сделанных моделью AI, были верными?
Формула accuracy: количество правильных прогнозов (включая истинно положительные и истинно отрицательные результаты), делённое на общее количество прогнозов. Accuracy легко вычислять и интерпретировать, поэтому она часто используется как отправная точка при оценке модели.
Как правило, accuracy надёжна при работе со сбалансированными наборами данных. Однако в несбалансированных наборах данных, где один класс преобладает над другими, accuracy часто может вводить в заблуждение. Модель, которая всегда прогнозирует наиболее многочисленный класс, может получить высокий показатель accuracy, не выявляя при этом другие малочисленные классы.
Например, в наборе данных изображений, где лишь на нескольких изображениях есть пешеходы, модель, которая для каждого изображения прогнозирует «нет пешехода», может получить высокую accuracy, но полностью не справиться с обнаружением настоящих пешеходов.
Это происходит потому, что сама по себе accuracy не показывает, какие именно ошибки допускает модель и как часто они возникают. Поэтому важно также изучать такие метрики, как precision и recall, чтобы полностью понять, насколько хорошо работает модель AI.
Подробно о precision: минимизация ложных тревог#
Precision — ключевая метрика оценки, измеряющая точность положительных прогнозов модели. Она отвечает на вопрос: сколько из всех случаев, предсказанных как положительные, действительно были положительными?
Формула precision: количество истинно положительных результатов, делённое на сумму истинно положительных и ложноположительных результатов. Эта метрика особенно важна, когда ошибочный положительный прогноз может дорого обойтись.

Рис. 3. Сравнение accuracy и precision. (Источник)
Например, при обнаружении мошенничества модель с низким precision может пометить множество действительных транзакций как мошеннические, создав ненужные проблемы для пользователей и команд поддержки. Модель с высоким precision снижает этот риск, гарантируя, что отмеченные транзакции с большей вероятностью действительно являются мошенническими.
Высокий precision — это хорошо, но модели, чрезмерно сосредоточенные на нём, могут стать слишком избирательными и пропускать фактически положительные случаи. Поэтому метрику precision часто проверяют вместе с recall, чтобы сохранять сбалансированную производительность.
Что такое recall?#
Recall — метрика, используемая для измерения того, насколько хорошо модель выявляет фактически положительные случаи. Она также известна как чувствительность или доля истинно положительных результатов и отвечает на вопрос: сколько из всех фактически положительных случаев модель обнаружила правильно?
Формула recall: количество истинно положительных результатов, делённое на сумму истинно положительных и ложноотрицательных результатов. Высокий показатель recall означает, что модель выявляет большинство реальных положительных случаев в данных.
Recall незаменима в таких областях, как здравоохранение, где необнаружение заболевания может задержать лечение и подвергнуть пациентов риску. Даже если некоторые отрицательные случаи будут ошибочно отмечены как положительные, выявление всех истинных случаев остаётся главным приоритетом.
Однако модели, ориентированные только на recall, могут выдавать слишком много ложноположительных результатов, что снижает precision и ухудшает общую эффективность модели. Баланс между recall и precision критически важен для надёжной производительности модели AI.
Баланс: компромисс между precision и recall#
Precision и recall часто изменяются в противоположных направлениях. Когда одна метрика улучшается, другая может снижаться. Этот компромисс — распространённая проблема в задачах машинного обучения.
Модель с высоким precision прогнозирует что-либо как положительное, только если уверена в этом. Это уменьшает количество ложных тревог, но может привести к пропуску реальных положительных случаев и снижению recall. Модель, пытающаяся выявить каждый положительный случай, повышает recall, но рискует чаще выдавать ложные тревоги, что снижает precision.
Этот компромисс становится понятнее при настройке порога принятия решений модели. Порог — это граница, которую система использует для преобразования оценки или вероятности в действие либо метку. Снижение порога заставляет систему чаще выдавать положительный результат, что может повысить recall, но снизить precision. Повышение порога даёт противоположный эффект: модель прогнозирует меньше положительных случаев, precision улучшается, но recall обычно снижается.
Представь, что ты работаешь над обнаружением спама. Модель должна балансировать между риском пропустить спам во входящие и риском заблокировать настоящие письма. Строгий фильтр может всё ещё пропускать часть спама, а более мягкий — случайно блокировать корректные сообщения. Правильный баланс зависит от сценария использования и стоимости каждого типа ошибки.
Значение кривой precision–recall#
Кривая precision–recall, или PR-кривая, показывает, как изменяются precision и recall при изменении порога принятия решений модели. Каждая точка представляет отдельный компромисс между этими метриками. PR-кривая особенно полезна для несбалансированных наборов данных, где один класс встречается значительно реже.
Она также даёт более содержательную информацию, чем кривая рабочих характеристик приёмника (ROC), которая тоже показывает, насколько хорошо модель разделяет положительные и отрицательные случаи при разных порогах принятия решений. У модели с одновременно высоким precision и высоким recall кривая precision–recall будет проходить рядом с верхним правым углом, что обычно считается идеальным результатом.
Знакомство с F1-score: объединённая метрика баланса#
F1-score даёт одно значение, отражающее баланс между precision и recall. F1-score вычисляется как удвоенное произведение precision и recall, делённое на их сумму. Эта метрика полезна, когда важны и ложноположительные, и ложноотрицательные результаты, а также при работе с несбалансированными наборами данных или необходимости сбалансированно оценить производительность модели.

Рис. 4. Вычисление F1-score с использованием precision и recall (Источник)
Помимо accuracy, precision и recall#
Хотя accuracy, precision и recall необходимы, другие метрики дают дополнительные сведения в зависимости от типа модели и характеристик набора данных.
Ниже приведены некоторые часто используемые метрики, которые помогают оценить различные аспекты производительности:
- Специфичность: Она измеряет, насколько хорошо модель выявляет фактически отрицательные случаи. Она полезна, когда важно избегать ложноположительных результатов.
- AUC: AUC, или площадь под кривой, даёт единую оценку того, насколько хорошо модель различает классы.
- Log loss: Log loss используется для измерения уверенности модели при построении прогнозов и сильнее штрафует ошибочные прогнозы, сделанные с высокой уверенностью. Здесь уверенность означает степень уверенности модели в своём прогнозе.
- Оценка с несколькими метками: В задачах с несколькими метками метрики усредняются по меткам, чтобы отразить общую производительность модели.
Применение accuracy, precision и recall в компьютерном зрении#
Теперь, когда мы лучше понимаем accuracy, precision и recall, рассмотрим, как эти метрики применяются в компьютерном зрении.
Модели компьютерного зрения, такие как Ultralytics YOLO11, поддерживают такие задачи, как обнаружение объектов, где модель определяет, какие объекты присутствуют на изображении, и находит их с помощью ограничивающих рамок. Каждый прогноз включает и метку объекта, и его положение, поэтому оценка становится сложнее, чем простая проверка правильности метки.

Рис. 5. Пример использования Ultralytics YOLO11 для обнаружения объектов. (Источник)
Рассмотрим сценарий розничной торговли, где камеры используются для автоматического отслеживания товаров на полках. Модель обнаружения объектов может находить такие предметы, как коробки с хлопьями, банки с газированными напитками или бутылки с водой, и отмечать их положение.
В этом случае precision показывает, сколько обнаруженных предметов действительно распознаны правильно. Высокий precision означает, что система избегает ложноположительных результатов, например принятия тени или фонового объекта за товар. Recall показывает, сколько реальных товаров на полке модель смогла обнаружить. Высокий recall означает, что пропускается меньше товаров, что критически важно для точного подсчёта запасов.
Accuracy по-прежнему может служить общей мерой правильности, но в такой ситуации пропуск даже нескольких товаров или обнаружение несуществующих предметов может сильно повлиять на управление запасами. Поэтому разработчики рассматривают precision, recall и accuracy вместе, чтобы убедиться, что система надёжна и пригодна для практического использования в реальных условиях.
Accuracy, precision и recall: основные выводы#
Accuracy, precision и recall отражают разные аспекты производительности модели машинного обучения. Опора только на одну метрику может вводить в заблуждение.
Такие инструменты и метрики, как матрица ошибок, кривые precision–recall и F1-score, помогают выявить компромиссы и принять решения об улучшении ML-модели. Выбирая правильное сочетание метрик для конкретного решения AI, ты можешь убедиться, что модели точны, надёжны и эффективны в реальных приложениях.
Присоединяйся к нашему растущему сообществу! Загляни в наш репозиторий GitHub, чтобы узнать больше об AI. Готов начать проекты в области компьютерного зрения? Ознакомься с нашими вариантами лицензирования. Узнай больше об AI в сельском хозяйстве и компьютерном зрении AI в робототехнике, посетив страницы наших решений!









