객체 탐지의 평균 정밀도(mAP)
객체 탐지에서 평균 정밀도(mAP)를 이해해 보세요. mAP의 의미와 계산 방법, 모델 성능 평가에서 mAP가 중요한 이유를 알아보세요.

AI 도입이 빠르게 증가하고 있으며, 자율주행 자동차부터 선반 위 제품을 식별할 수 있는 소매 시스템에 이르기까지 다양한 혁신에 AI가 통합되고 있습니다. 이러한 기술은 기계가 시각 데이터를 분석할 수 있도록 하는 인공지능(AI)의 한 분야인 컴퓨터 비전에 의존합니다.
컴퓨터 비전 시스템과 알고리즘의 정확도를 측정하는 데 사용되는 주요 평가 지표는 평균 정밀도(mAP)입니다. mAP 지표는 비전 AI 모델의 예측이 실제 결과와 얼마나 일치하는지를 나타냅니다.
일반적인 컴퓨터 비전 작업 중 하나는 객체 탐지로, 모델이 이미지에서 여러 객체를 식별하고 객체 주위에 바운딩 박스를 그립니다. mAP는 객체 탐지 모델의 성능을 평가하는 표준 지표이며, Ultralytics YOLO11과 같은 딥러닝 모델의 벤치마크에 널리 사용됩니다.
이 글에서는 평균 정밀도가 어떻게 계산되는지와 객체 탐지 모델을 학습하거나 평가하는 모든 사람에게 왜 중요한지를 살펴보겠습니다. 시작해 보겠습니다!
평균 정밀도(mAP)란 무엇인가요?#
평균 정밀도는 이미지에서 서로 다른 객체를 탐지하고 식별하는 것과 같은 시각 정보 검색 관련 작업에서 딥러닝 모델이 얼마나 정확한지를 보여주는 점수입니다. 예를 들어 개, 고양이, 자동차가 포함된 사진을 분석하는 객체 탐지 모델을 생각해 보겠습니다. 신뢰할 수 있는 모델은 각 객체를 인식하고 그 주변에 바운딩 박스와 레이블을 그려 객체의 위치와 종류를 강조함으로써 객체 탐지를 수행할 수 있습니다.
mAP는 여러 이미지와 다양한 유형의 객체에 걸쳐 모델이 이 작업을 얼마나 잘 수행하는지를 나타냅니다. 모델이 각 객체와 이미지 내 위치를 정확하게 식별하는지 확인합니다. 점수 범위는 0에서 1까지이며, 1은 모델이 모든 것을 완벽하게 찾았다는 의미이고 0은 객체를 전혀 탐지하지 못했다는 의미입니다.
평균 정밀도(mAP)의 핵심 개념#
머신러닝에서 평균 정밀도의 기본 개념을 살펴보기 전에 ground truth와 predictions라는 두 가지 기본 용어를 더 잘 이해해 보겠습니다.
Ground truth는 정확한 참조 데이터를 의미하며, 이미지 속 객체와 해당 위치에 사람이 annotation이라는 과정을 통해 신중하게 레이블을 지정합니다. 반면 predictions는 AI 모델이 이미지를 분석한 후 제공하는 결과입니다. AI 모델의 predictions를 ground truth와 비교하면 모델의 결과가 정답에 얼마나 근접했는지를 측정할 수 있습니다.

그림 1. 모델 prediction과 ground truth 바운딩 박스. 이미지 제공: 저자.
혼동 행렬#
혼동 행렬은 객체 탐지 모델의 정밀도를 파악하는 데 자주 사용됩니다. 혼동 행렬은 모델의 predictions가 실제 정답(ground truth)과 어떻게 일치하는지를 보여주는 표입니다. 이 표를 통해 true positives, false positives, false negatives, true negatives라는 네 가지 주요 구성 요소 또는 결과를 파악할 수 있습니다.
혼동 행렬에서 이러한 구성 요소가 나타내는 의미는 다음과 같습니다.
- True positive (TP): 객체와 그 위치를 모델이 정확하게 탐지합니다.
- False positive (FP): 모델이 탐지를 수행했지만 그 결과가 잘못되었습니다.
- False negative (FN): 이미지에 실제로 존재하는 객체를 모델이 탐지하지 못했습니다.
- True negative (TN): 모델이 객체의 부재를 정확하게 식별한 경우에 true negative가 발생합니다.
이미지 내 빈 영역이 많은 경우가 일반적으로 무시되므로, 객체 탐지에서는 true negative가 흔히 사용되지 않습니다. 그러나 모델이 이미지에 레이블을 할당하는 이미지 분류와 같은 다른 컴퓨터 비전 작업에서는 중요합니다. 예를 들어 이미지에 고양이가 포함되어 있는지를 탐지하는 작업에서 이미지에 고양이가 없을 때 모델이 올바르게 “고양이 없음”으로 식별하면 true negative입니다.

그림 2. 혼동 행렬의 분류 결과. 이미지 제공: 저자.
교집합 대비 합집합(IoU)#
객체 탐지 모델을 평가하는 또 다른 중요한 지표는 교집합 대비 합집합(IoU)입니다. 이러한 비전 AI 모델에서는 이미지에 객체가 존재한다는 사실을 탐지하는 것만으로는 충분하지 않으며, 바운딩 박스를 그리기 위해 이미지에서 객체가 어디에 있는지도 찾아야 합니다.
IoU 지표는 모델이 예측한 박스가 실제 정답 박스(ground truth)와 얼마나 일치하는지를 측정합니다. 점수는 0에서 1 사이이며, 1은 완벽하게 일치한다는 의미이고 0은 전혀 겹치지 않는다는 의미입니다.
예를 들어 0.80 또는 0.85와 같이 IoU가 높다는 것은 예측 박스가 ground truth 박스와 거의 일치하여 위치를 정확하게 찾았음을 의미합니다. 0.30 또는 0.25와 같이 IoU가 낮다는 것은 모델이 객체의 위치를 정확하게 찾지 못했다는 의미입니다.
탐지가 성공했는지 판단하기 위해 다양한 threshold를 사용합니다. 일반적인 IoU threshold는 0.5이며, 이는 true positive로 집계되려면 예측 박스가 ground truth 박스와 최소 50% 겹쳐야 한다는 의미입니다. 이 threshold보다 낮은 겹침은 false positive로 간주됩니다.

그림 3. 교집합 대비 합집합 이해하기. 이미지 제공: 저자.
정밀도와 재현율#
지금까지 객체 탐지 모델의 성능을 이해하기 위한 몇 가지 기본 평가 지표를 살펴보았습니다. 이를 바탕으로 가장 중요한 지표 중 두 가지는 정밀도와 재현율입니다. 이 지표는 모델의 탐지가 얼마나 정확한지 명확하게 보여줍니다. 이제 두 지표가 무엇인지 살펴보겠습니다.
정밀도 값은 모델의 predictions 중 실제로 정확한 것이 몇 개인지를 알려줍니다. 즉, 모델이 탐지했다고 주장한 모든 객체 중 실제로 존재하는 객체가 몇 개인지를 나타냅니다.
반면 재현율 값은 이미지에 실제로 존재하는 모든 객체를 모델이 얼마나 잘 찾아내는지를 측정합니다. 즉, 실제로 존재하는 모든 객체 중 모델이 정확하게 탐지한 객체가 몇 개인지를 나타냅니다.
정밀도와 재현율을 함께 사용하면 모델의 성능을 더 명확하게 파악할 수 있습니다. 예를 들어 모델이 이미지에서 자동차 10대를 예측했고 그중 9대가 실제 자동차라면, 정밀도는 90%(positive prediction)입니다.
이 두 평가 지표에는 흔히 상충 관계가 있습니다. 모델은 확신이 높은 predictions만 수행하여 높은 정밀도를 달성할 수 있지만, 이 경우 많은 객체를 놓쳐 재현율이 낮아질 수 있습니다. 반대로 거의 모든 위치에 바운딩 박스를 예측하여 매우 높은 재현율을 얻을 수도 있지만, 이렇게 하면 정밀도가 낮아집니다.

그림 4. 정밀도와 재현율. 이미지 제공: 저자.
평균 정밀도#
정밀도와 재현율은 개별 predictions에 대한 모델의 성능을 이해하는 데 도움이 되지만, 평균 정밀도(AP)는 더 넓은 관점을 제공합니다. 평균 정밀도는 모델이 더 많은 객체를 탐지하려 할 때 정밀도가 어떻게 변하는지를 보여주고, 성능을 하나의 숫자로 요약합니다.
평균 정밀도 점수를 계산하려면 먼저 객체 유형별로 정밀도-재현율 곡선(또는 PR 곡선)이라는 그래프 형태의 통합 지표를 만들 수 있습니다. 이 곡선은 모델이 더 많은 predictions를 수행할 때 어떤 일이 발생하는지를 보여줍니다.
모델이 가장 쉽거나 명확한 객체만 탐지하는 상황을 생각해 보겠습니다. 이 단계에서는 대부분의 predictions가 정확하므로 정밀도는 높지만, 여전히 많은 객체를 놓치기 때문에 재현율은 낮습니다. 모델이 더 어려운 객체나 드문 객체를 포함하여 더 많은 객체를 탐지하려 하면 일반적으로 오류가 증가합니다. 그 결과 정밀도는 낮아지고 재현율은 높아집니다.
평균 정밀도는 곡선 아래 영역(PR 곡선의 AUC)입니다. 영역이 클수록 더 많은 객체를 탐지하면서도 predictions의 정확도를 잘 유지한다는 의미입니다. AP는 각 클래스 레이블에 대해 개별적으로 계산됩니다.
예를 들어 자동차, 자전거, 보행자를 탐지할 수 있는 모델에서는 이 세 가지 범주 각각에 대해 AP 값을 개별적으로 계산할 수 있습니다. 이를 통해 모델이 어떤 객체를 잘 탐지하는지, 그리고 어떤 부분을 개선해야 하는지를 파악할 수 있습니다.

그림 5. 서로 다른 5개 클래스의 PR 곡선. (출처)
평균 평균 정밀도#
각 객체 클래스의 평균 정밀도를 계산한 후에도 모든 클래스에 걸친 모델의 전반적인 성능을 반영하는 단일 점수가 필요합니다. 이는 평균 평균 정밀도 공식을 사용하여 구할 수 있습니다. 이 공식은 모든 범주의 AP 점수를 평균냅니다.
예를 들어 Ultralytics YOLO11과 같은 컴퓨터 비전 모델이 자동차에서 AP 0.827, 오토바이에서 0.679, 트럭에서 0.355, 버스에서 0.863, 자전거에서 0.982를 달성했다고 가정해 보겠습니다. mAP 공식을 사용하면 다음과 같이 이 숫자들을 더한 후 전체 클래스 수로 나눌 수 있습니다.
mAP = (0.827 + 0.679 + 0.355 + 0.863 + 0.982) ÷ 5 = 0.7432 ≈ 0.743
mAP 점수 0.743은 모든 객체 클래스에 걸친 모델의 성능을 판단할 수 있는 간단한 기준을 제공합니다. 1에 가까운 값은 모델이 대부분의 범주에서 정확하다는 의미이며, 낮은 값은 일부 범주에서 어려움을 겪는다는 의미입니다.
컴퓨터 비전에서 AP와 mAP의 중요성#
AP와 mAP가 어떻게 계산되는지와 그 구성 요소를 더 잘 이해했으므로, 이제 컴퓨터 비전에서 두 지표가 갖는 중요성을 살펴보겠습니다.
-
특정 클래스의 낮은 AP: 단일 클래스의 AP가 낮다는 것은 모델이 해당 객체 클래스에서 어려움을 겪는다는 의미인 경우가 많습니다. 이는 불충분한 학습 데이터나 가림과 같은 이미지의 시각적 문제 때문일 수 있습니다.
-
위치 지정 오류: 낮은 IoU threshold(예: mAP@0.50)에서 mAP 값이 높지만 높은 IoU threshold(예: mAP@0.75)에서 크게 하락한다면, 모델이 객체는 탐지할 수 있지만 위치를 정밀하게 지정하는 데 어려움을 겪는다는 의미입니다.
-
과적합: 학습 dataset에서 mAP 값은 높지만 검증 dataset에서 mAP 값이 낮다면 과적합의 징후이며, 새로운 이미지에 대해 모델을 신뢰하기 어렵습니다.
평균 정밀도의 실제 활용 사례#
다음으로 mAP와 같은 핵심 지표가 실제 컴퓨터 비전 활용 사례를 구축할 때 어떻게 도움이 되는지 살펴보겠습니다.
자율주행 자동차: mAP 값이 높을수록 도로가 안전해지는 이유#
자율주행 자동차에서는 보행자, 도로 표지판, 자전거 이용자, 차선 표시를 식별하기 위해 객체 탐지가 매우 중요합니다. 예를 들어 어린이가 갑자기 도로를 가로질러 달려 나오면 자동차는 몇 초 안에 객체(어린이)를 탐지하고, 위치를 파악하고, 움직임을 추적한 후 필요한 조치(브레이크 작동)를 취해야 합니다.
Ultralytics YOLO11과 같은 모델은 이러한 고위험 상황에서 실시간 객체 탐지를 수행하도록 설계되었습니다. 이러한 경우 mAP는 안전성을 판단하는 핵심 지표가 됩니다.
높은 mAP 점수는 시스템이 어린이를 신속하게 탐지하고 정확하게 위치를 지정하며 최소한의 지연으로 제동을 작동하도록 합니다. 낮은 mAP는 탐지 누락이나 어린이를 다른 작은 객체로 혼동하는 것과 같은 위험한 오분류를 의미할 수 있습니다.

그림 6. 도로의 보행자를 탐지하는 YOLO11 활용 예시. (출처)
정확한 제품 탐지를 위한 mAP 활용#
마찬가지로 소매 분야에서는 객체 탐지 모델을 사용하여 재고 모니터링과 결제 프로세스 같은 작업을 자동화할 수 있습니다. 고객이 셀프 계산대에서 제품을 스캔할 때 탐지 오류가 발생하면 불편을 초래할 수 있습니다.
높은 mAP 점수는 제품이 밀집해 있는 경우에도 모델이 유사한 제품을 정확하게 구분하고 정밀한 바운딩 박스를 그리도록 합니다. 낮은 mAP 점수는 혼동을 일으킬 수 있습니다. 예를 들어 모델이 오렌지 주스 병을 외관이 유사한 사과 주스 병으로 잘못 인식하면 잘못된 청구와 부정확한 재고 보고로 이어질 수 있습니다.
Ultralytics YOLO11과 같은 모델이 통합된 소매 시스템은 실시간으로 제품을 탐지하고, 재고와 대조하며, 백엔드 시스템을 즉시 업데이트할 수 있습니다. 빠르게 변화하는 소매 환경에서 mAP는 운영의 정확성과 신뢰성을 유지하는 데 중요한 역할을 합니다.
높은 mAP를 통한 의료 진단 정확도 향상#
의료 분야의 진단 정확도 향상은 의료 영상에서 정밀한 탐지를 수행하는 것에서 시작됩니다. YOLO11과 같은 모델은 방사선 전문의가 의료 스캔에서 종양, 골절 또는 기타 이상을 발견하는 데 도움을 줄 수 있습니다. 이 경우 평균 정밀도는 모델의 임상적 신뢰성을 평가하는 데 필수적인 지표입니다.
높은 mAP는 모델이 높은 재현율(실제 문제의 대부분을 식별)과 높은 정밀도(오탐 방지)를 모두 달성한다는 의미이며, 이는 임상 의사 결정에 매우 중요합니다. 또한 의료 분야에서는 탐지의 정확도를 극도로 높이기 위해 IoU threshold를 0.85 또는 0.90과 같이 매우 높게 설정하는 경우가 많습니다.
그러나 낮은 mAP 점수는 우려를 불러일으킬 수 있습니다. 모델이 종양을 놓치면 진단이 지연되거나 잘못된 치료로 이어질 수 있습니다.
mAP 사용의 장단점#
객체 탐지 모델을 평가할 때 평균 정밀도를 사용하는 주요 장점은 다음과 같습니다.
-
표준화된 지표: mAP는 객체 탐지 모델을 평가하는 업계 표준입니다. mAP 값은 서로 다른 모델을 공정하고 일관되게 비교할 수 있도록 합니다.
-
실제 성능 반영: 높은 mAP는 모델이 다양한 객체 클래스를 탐지하는 데 뛰어나고 복잡한 실제 환경에서도 높은 성능을 유지한다는 의미입니다.
-
클래스별 진단: mAP 점수는 각 클래스의 탐지 성능을 개별적으로 평가합니다. 따라서 성능이 낮은 범주(예: 자전거 또는 도로 표지판)를 더 쉽게 식별하고 그에 맞게 모델을 미세 조정할 수 있습니다.
mAP 지표를 사용하면 다양한 이점이 있지만 고려해야 할 몇 가지 한계도 있습니다. 다음은 감안해야 할 요소입니다.
-
기술에 익숙하지 않은 이해관계자에게 어려움: 비즈니스 또는 임상 팀은 더 직관적이고 이해하기 쉬운 지표와 달리 mAP 값을 추상적으로 느낄 수 있습니다.
-
실시간 제약을 반영하지 않음: mAP는 시간에 민감한 애플리케이션을 배포할 때 중요한 추론 속도나 지연 시간을 고려하지 않습니다.
핵심 요점#
평균 정밀도는 단순한 기술 점수가 아니라 모델의 실제 성능 잠재력을 반영한다는 점을 살펴보았습니다. 자율주행 자동차 시스템이든 소매 결제 시스템이든 높은 mAP 점수는 모델의 성능과 실제 활용 준비 상태를 나타내는 신뢰할 수 있는 지표입니다.
mAP는 중요하고 영향력 있는 지표이지만, 균형 잡힌 평가 전략의 일부로 보아야 합니다. 의료 및 자율주행과 같은 중요한 애플리케이션에서는 mAP에만 의존하는 것으로 충분하지 않습니다.
시스템이 안전하고 효율적이며 의도한 목적에 실제로 적합한지 확인하려면 추론 속도(모델이 predictions를 얼마나 빠르게 수행하는지), 모델 크기(edge device 배포에 미치는 영향), 정성적 오류 분석(모델이 어떤 유형의 실수를 하는지 파악)과 같은 추가 요소도 고려해야 합니다.
컴퓨터 비전에 대해 더 알아보려면 성장 중인 커뮤니티와 GitHub 저장소에 참여해 보세요. 솔루션 페이지에서 농업 분야의 컴퓨터 비전 및 물류 분야의 AI 활용 사례를 알아보세요. 지금 바로 자신만의 컴퓨터 비전 모델을 시작하려면 라이선싱 옵션을 확인해 보세요!









