평가자 간 신뢰도: 정의, 예시, 계산 방법
평가자 간 신뢰도, Cohen의 카파, ICC, 평가자 교육 및 일치율을 이해해 보세요. 이러한 통계적 측정값이 연구 및 데이터 분석에서 관찰자 간 일관성과 일치를 보장하는 방법을 알아보세요.

AI 모델을 구축할 때는 모델을 뒷받침하는 알고리즘만큼 데이터의 품질도 중요합니다. 여러 사람이 동일한 데이터를 라벨링하거나 검토할 때는 의견 차이가 발생하기 마련입니다. 이는 연구, 의료, 교육을 비롯한 다양한 분야에서 마찬가지입니다.
특히 이미지나 동영상과 같은 시각 데이터를 해석하도록 Ultralytics YOLO11과 같은 모델을 학습하는 AI 분야인 컴퓨터 비전에서는 라벨링된 예제가 중요한 역할을 합니다. 이러한 라벨이 일관되지 않으면 컴퓨터 비전 모델이 올바른 패턴을 학습하는 데 어려움을 겪을 수 있습니다.
평가자 간 신뢰도(IRR)는 여러 개인 또는 라벨러가 작업에 대해 얼마나 일관되게 동의하는지를 측정합니다. 이를 통해 일관성을 모니터링하고 교육, 가이드라인 또는 해석의 격차를 파악할 수 있습니다. 이는 특정 목적에 맞는 데이터를 사용해 AI 모델을 구축하는 커스텀 모델 학습에서 특히 중요합니다.
이 글에서는 평가자 간 신뢰도의 개념, 측정 방법, 실제 프로젝트 전반에서 이를 개선하는 방법을 살펴봅니다. 시작해 보겠습니다!
평가자 간 신뢰도란 무엇인가요?#
평가자 간 신뢰도는 두 명 이상의 사람(평가자라고도 함)이 동일한 콘텐츠를 라벨링, 평가 또는 검토할 때 얼마나 자주 동의하는지를 측정합니다. 이는 서로 다른 평가자가 주어진 기준을 얼마나 일관되게 사용하는지 확인하는 데 활용됩니다. 평가자 간 동의도가 높다는 것은 작업이 잘 정의되어 있고 명확하게 이해되고 있음을 의미합니다.
이 개념은 다양한 분야에서 사용됩니다. 분야에 따라 평가자 간 일치도, 관찰자 간 신뢰도 또는 코더 간 신뢰도 등 서로 다른 이름으로 불립니다. 그러나 기본 원리는 동일합니다.
비전 AI에서 평가자 간 신뢰도는 데이터 라벨링 프로세스의 핵심 요소입니다. 컴퓨터 비전 모델을 학습하려면 대규모 이미지 또는 비디오 프레임 데이터셋에 라벨을 지정해야 하는 경우가 많으므로, 여러 AI 개발자가 동일한 데이터를 함께 작업합니다.
정확한 결과를 얻으려면 모두 동일한 라벨링 가이드라인을 따라야 합니다. 예를 들어 동물에 라벨을 지정할 때는 무엇을 개로 간주할지, 개 주위에 바운딩 박스를 어떻게 그릴지, 흐릿한 객체에 라벨을 지정할지 무시할지에 대해 모두가 명확하게 합의해야 합니다.

그림 1. 평가자 간 신뢰도 이해하기 (이미지 작성자 제공)
평가자 간 신뢰도와 평가자 내 신뢰도 및 검사-재검사 신뢰도 비교#
사람이 데이터를 라벨링하거나 점수를 매길 때 고려해야 할 신뢰도는 크게 세 가지입니다. 각각 결과의 일관성을 측정하는 목적이 다릅니다. 각 유형을 자세히 살펴보겠습니다.
-
평가자 간 신뢰도: 평가자 간 신뢰도는 동일한 작업을 수행하는 서로 다른 사람들 사이에 어느 정도의 동의가 있는지 살펴봅니다. 이미지 라벨링, 감성 분석 또는 의료 검토와 같은 프로젝트에 여러 어노테이터가 참여할 때 특히 유용합니다.
-
평가자 내 신뢰도: 평가자 내 신뢰도는 한 사람에게 초점을 맞춥니다. 동일한 작업을 서로 다른 시점에 반복할 때 평가자가 일관성을 유지하는지 확인합니다. 라벨이 지나치게 달라진다면 가이드라인이 불명확하거나 작업의 명확성이 부족하기 때문일 수 있습니다.
-
검사-재검사 신뢰도: 검사-재검사 신뢰도는 어노테이터가 아니라 사용 중인 도구나 방법에 초점을 맞춥니다. 유사한 조건에서 검사를 반복했을 때 동일한 결과가 나타나는지를 측정합니다. 출력이 일관되게 유지되면 해당 방법은 신뢰할 수 있는 것으로 간주됩니다.
이러한 측정 방법을 함께 사용하면 사람과 프로세스 모두 안정적이고 신뢰할 수 있는 결과를 내고 있는지 확인할 수 있습니다.

그림 2. 평가자 간 신뢰도, 평가자 내 신뢰도 및 검사-재검사 신뢰도 개요 (이미지 작성자 제공)
평가자 간 신뢰도가 중요한 이유는 무엇인가요?#
대규모 비전 AI 프로젝트에서는 라벨링된 데이터의 품질이 모델의 성능에 직접적인 영향을 미칩니다. 어노테이터가 가이드라인을 적용하는 방식에서 발생하는 작은 차이도 모델을 학습 중 혼란스럽게 만드는 불일치를 초래할 수 있습니다. 시간이 지나면 부정확한 예측, 자원 낭비, 비용이 많이 드는 재라벨링으로 이어질 수 있습니다.
평가자 간 신뢰도를 측정하면 이러한 문제를 조기에 발견하는 데 도움이 됩니다. 동의도가 높다는 것은 어노테이터가 동일한 기준에 따라 작업하여 더 깔끔하고 신뢰할 수 있는 데이터셋을 생성한다는 의미입니다. 동의도가 낮다면 프로젝트를 진행하기 전에 지침, 예제 또는 교육을 개선해야 할 수 있음을 나타냅니다. 라벨러가 서로 일관되게 작업하도록 하면 팀은 더 효과적으로 학습하고 실제 애플리케이션에서 더 나은 결과를 제공하는 AI 모델을 구축할 수 있습니다.
평가자 간 신뢰도를 위한 실무적 고려 사항#
여러 평가자와 작업하면서 높은 평가자 간 신뢰도를 유지하려면 다음과 같은 주요 실무적 고려 사항을 염두에 두어야 합니다.
- 모호하거나 주관적인 작업: 흐릿한 객체가 보행자인지 판단하거나 이미지의 품질을 평가하는 등 해석이 필요한 라벨링에서는 여러 평가자가 참여하면 의사결정의 일관성을 높이고 개인의 편향이 과도하게 영향을 미치는 것을 방지할 수 있습니다.
- 단순하고 객관적인 작업: 이미지에 있는 자동차 수를 세거나 객체의 존재 여부를 확인하는 것과 같은 간단한 작업은 프로세스가 명확하게 정의되면 일반적으로 동의도가 높으므로, 잘 교육받은 평가자 한 명만 필요한 경우가 많습니다.
- 명확한 라벨링 가이드라인: 상세하고 따라 하기 쉬운 지침은 라벨 적용 방식에 대한 불확실성을 줄여 평가자 간 동의도를 높입니다. 가이드라인에는 일관되지 않은 해석을 방지하기 위해 예외적인 사례를 명시적으로 다뤄야 합니다.
- 정기적인 교육 및 보정: 숙련된 평가자도 시간이 지나면서 판단 기준이 달라질 수 있습니다. 정기적인 교육 세션과 보정 검사를 통해 일관성을 유지하고 실험자 편향을 최소화할 수 있습니다.
평가자 간 신뢰도 측정 방법#
평가자 간 신뢰도를 측정하는 방법은 여러 가지이며, 가장 적합한 방법은 데이터와 작업의 유형에 따라 달라집니다. 일부 방법은 단일 평가자가 간단한 예 또는 아니요 질문을 처리하는 데 적합하고, 다른 방법은 여러 평가자가 참여하는 상황을 위해 설계되었습니다.
일반적인 접근 방식으로는 백분율 일치도, Cohen의 카파, Fleiss의 카파 및 클래스 내 상관계수가 있습니다. 각 방법은 평가자 간 동의 수준을 측정하고 일부 동의가 우연히 발생했을 가능성을 고려합니다.
Cohen의 카파와 Fleiss의 카파#
Cohen의 카파는 두 평가자 간 평가자 간 신뢰도를 측정하는 데 널리 사용되는 방법입니다. 작업에서 두 평가자가 얼마나 자주 동의하는지 계산하면서 일부 동의가 우연히 발생했을 가능성을 조정합니다. 점수 범위는 -1에서 1까지이며, 1은 완벽한 동의를, 0은 동의도가 무작위 추측보다 나을 것이 없음을 의미합니다.
마찬가지로 Fleiss의 카파는 세 명 이상의 평가자가 참여할 때 사용됩니다. 그룹이 얼마나 일관적인지를 보여주는 종합 점수를 제공합니다. 두 방법 모두 이미지 라벨링이나 감정 태그 지정처럼 정해진 카테고리를 사용하는 작업에 활용됩니다. 계산이 쉽고 대부분의 어노테이션 도구에서 지원됩니다.
백분율 일치도 및 클래스 내 상관계수(ICC)#
평가자 간 신뢰도를 측정하는 또 다른 방법은 백분율 일치도입니다. 이는 평가자들이 동일한 결정을 내린 횟수의 비율을 계산합니다. 사용하기는 간단하지만 우연히 발생할 수 있는 동의는 고려하지 않습니다.
한편 클래스 내 상관계수는 연속형 데이터 또는 척도 기반 데이터에 사용되는 고급 방법입니다. 여러 평가자의 평점이 얼마나 일관적인지 측정하며, 고정된 카테고리를 넘어 점수, 측정값 또는 기타 데이터 유형을 다루는 연구에 자주 적용됩니다.
평가자 간 신뢰도의 예시와 활용 분야#
이제 평가자 간 신뢰도를 측정하는 방법을 더 잘 이해했으므로, 이러한 방법이 실제 애플리케이션에서 어떻게 활용되는지 살펴보겠습니다.
의료 영상 어노테이션에서의 평가자 간 신뢰도#
의료 영상에서는 해석의 작은 차이도 결과에 큰 변화를 가져올 수 있습니다. 예를 들어 방사선 전문의는 미묘하거나 모호하거나 정의하기 어려운 패턴을 식별해야 하는 경우가 많습니다. 이러한 패턴이 AI 시스템의 학습 데이터가 되면 그 중요성은 더욱 커집니다. 전문가들이 동일한 스캔에 서로 다르게 라벨을 지정하면 모델이 잘못된 패턴을 학습하거나 아예 학습하지 못할 수 있습니다.
평가자 간 신뢰도를 사용하면 이러한 데이터를 다루는 팀이 전문가 판단의 실제 일관성을 평가할 수 있습니다. 예를 들어 최근 망막 OCT 스캔을 대상으로 한 연구에서 두 명의 평가자가 이미지 500장에 라벨을 지정했습니다.
망막 아래의 노란색 침착물인 드루젠과 같은 명확한 특징에서는 카파 점수가 0.87로 동의도가 높았습니다. 그러나 망막 스캔에서 보이는 작고 밝은 반점인 과반사 초점과 같이 정의하기 어려운 요소에서는 점수가 0.33으로 떨어졌습니다. 이는 더 명확하고 잘 정의된 특징일수록 전문가의 판단이 더 일관되게 나타나는 반면, 모호한 특징은 해석의 여지를 더 많이 남긴다는 것을 보여줍니다.

그림 3. 망막 질환과 관련된 다양한 특징의 라벨 예시 (출처)
자율주행 차량 데이터셋과 평가자 간 신뢰도#
자율주행 시스템용 AI 모델을 학습하려면 다양한 도로 조건에서 정확하고 일관된 라벨이 필요합니다. 이러한 프로젝트에서 작업하는 어노테이터는 조명이 좋지 않거나 복잡한 장면에서 보행자, 차량, 교통 표지판 및 차선 표시를 식별해야 하는 경우가 많습니다.
이러한 결정은 모델이 열악한 실제 환경에 대응하는 방법을 학습하는 데 영향을 미칩니다. 평가자 간 신뢰도를 사용하면 팀이 어노테이터마다 동일한 방식으로 라벨을 적용하고 있는지 확인할 수 있습니다.

그림 4. 어노테이션 불일치 살펴보기 (출처)
평가자 간 신뢰도를 넘어: 기타 품질 보증 방법#
AI 솔루션을 구축할 때 평가자 간 신뢰도를 측정하는 것은 중요한 단계이지만, 더 광범위한 품질 보증 프로세스의 일부이기도 합니다. 팀과 프로젝트 전반에서 데이터 품질을 개선하는 데 도움이 되는 다른 방법은 다음과 같습니다.
- 명확한 어노테이션 가이드라인: 모든 사람이 동일한 기준에 따라 작업할 수 있도록 라벨을 적용하는 방법을 지침에 정확하게 설명해야 합니다.
- 교육 및 보정: 정기적인 세션은 어노테이터가 동일한 기준을 유지하도록 돕고, 질문을 하거나 예외적인 사례에 맞게 조정할 기회를 제공합니다.
- 지속적인 품질 검사: 샘플 검사와 골드 스탠더드 예제를 활용하면 실수를 조기에 발견하고 프로젝트 규모가 커져도 높은 품질을 유지할 수 있습니다.
- 불일치 해결: 어노테이터 간 의견이 다를 때는 해당 사례를 검토하고 최종 결정을 내릴 수 있는 명확한 프로세스가 있어야 합니다.
- 다양한 어노테이터 풀: 서로 다른 배경을 가진 사람을 참여시키면 편향을 줄이고 데이터셋이 실제 세계의 다양성을 얼마나 잘 반영하는지 개선할 수 있습니다.
핵심 요점#
평가자 간 신뢰도는 사람들이 얼마나 일관되게 라벨을 적용하거나 결정을 내리는지를 측정합니다. Cohen의 카파, Fleiss의 카파 및 ICC와 같은 방법은 이러한 동의도를 정량화하는 데 도움이 됩니다. 명확한 가이드라인, 교육 및 편향 제어를 통해 신뢰할 수 있는 어노테이션은 더 우수한 데이터와 더 나은 모델 결과로 이어집니다.
커뮤니티에 참여하고 GitHub 리포지토리를 살펴보며 AI에 대해 더 알아보세요. 자체 비전 AI 프로젝트를 시작하려는 경우 라이선싱 옵션을 확인해 보세요. 또한 솔루션 페이지를 방문하여 의료 분야의 AI와 소매업의 비전 AI가 어떻게 영향을 미치고 있는지 확인할 수 있습니다.






