Active learning이 컴퓨터 비전 개발을 가속합니다
컴퓨터 비전에서 active learning을 활용해 어노테이션 작업을 최소화하는 방법과 다양한 산업의 실제 애플리케이션을 살펴보세요.

컴퓨터 비전 모델을 학습시키는 일은 아이에게 색상을 인식하도록 가르치는 일과 매우 비슷합니다. 먼저 색상이 있는 물체 모음이 필요합니다. 그런 다음 아이가 각 색상을 올바르게 식별하도록 지도해야 하는데, 이 작업은 시간이 많이 걸리고 반복적인 경우가 많습니다.
아이도 학습하려면 많은 예제가 필요하듯이, 비전 모델도 이미지에서 패턴과 객체를 인식하려면 레이블이 지정된 대규모 데이터 세트가 필요합니다. 그러나 방대한 양의 데이터에 레이블을 지정하려면 많은 시간과 노력이 필요하며, 리소스도 무시할 수 없습니다. 능동 학습과 같은 기법은 이 프로세스를 간소화하는 데 도움이 될 수 있습니다.
능동 학습은 대규모 데이터 세트에서 가장 중요한 데이터를 선택하고 레이블을 지정하는 단계별 프로세스입니다. 모델은 이 레이블이 지정된 데이터에서 학습하여 더 정확하고 효과적으로 작동합니다. 가장 가치 있는 데이터에만 집중하면 필요한 레이블 지정 작업량이 줄어들고 모델 개발 속도가 빨라집니다.
이 글에서는 능동 학습이 모델 학습을 어떻게 지원하고, 레이블 지정 비용을 줄이며, 모델의 전반적인 정확도를 향상하는지 살펴봅니다.
이미지 데이터 세트는 쉽게 구축할 수 없습니다#
데이터 세트는 컴퓨터 비전 및 딥러닝 모델의 기반입니다. ImageNet과 같은 인기 데이터 세트는 다양한 객체 범주를 포함한 수백만 개의 이미지를 제공합니다. 그러나 이처럼 방대한 고품질 데이터 세트를 생성하고 유지 관리하는 데에는 여러 가지 어려움이 따릅니다.
예를 들어 데이터를 수집하고 레이블을 지정하려면 시간, 리소스, 숙련된 어노테이터가 필요하므로, 구체적인 애플리케이션에 따라 이 프로세스가 어려울 수 있습니다. 증가하는 이미지 데이터 세트 수요에 대응하려면 혁신적이고 더 효율적인 솔루션이 필요하며, 바로 이것이 능동 학습이 해결하고자 하는 과제입니다.
능동 학습은 데이터 레이블 지정 프로세스를 최적화하여 효과적인 솔루션을 제공합니다. 어노테이션에 가장 유용한 데이터 포인트를 전략적으로 선택함으로써, 능동 학습은 레이블 지정 작업을 최소화하면서 모델 성능을 극대화합니다.
능동 학습이란 무엇인가요?#
능동 학습은 레이블이 지정되지 않은 대규모 데이터 풀에서 모델이 레이블을 지정할 가장 중요한 데이터 포인트를 선택하는 반복적 머신러닝 기법입니다. 이렇게 선택된 데이터 포인트에는 수동으로 레이블을 지정하고 학습 데이터 세트에 추가합니다.
그런 다음 업데이트된 데이터 세트로 모델을 재학습하고, 레이블을 지정할 다음 데이터 포인트 집합을 선택합니다. 이 프로세스는 반복되며, 모델은 가장 유용한 데이터 포인트에 지속적으로 집중하면서 점점 개선됩니다. 모델이 원하는 정확도에 도달하거나 사전에 설정한 레이블 지정 기준을 충족할 때까지 이 주기가 계속됩니다.

그림 1. 능동 학습 개요입니다.
능동 학습의 작동 방식 이해하기#
능동 학습 기법이 어떤 데이터 포인트에 수동으로 레이블을 지정해야 하는지, 그리고 다음에 어떤 데이터 포인트에 레이블을 지정할지 어떻게 결정하는지 궁금할 수 있습니다. 시험을 준비하는 과정과 비교하면 능동 학습의 작동 방식을 이해할 수 있습니다. 시험에서는 잘 모르는 주제에 집중하면서도 다양한 과목을 다루어 충분히 대비합니다.
초기 데이터 선택 프로세스에서 능동 학습은 불확실성 샘플링 및 다양성 기반 샘플링과 같은 전략을 사용합니다. 불확실성 샘플링은 모델의 예측에 대한 확신이 가장 낮은 데이터 포인트를 우선시하여 어려운 사례의 정확도를 향상하는 것을 목표로 합니다. 다양성 기반 샘플링은 광범위한 특성을 포괄하는 데이터 포인트를 선택하여 모델이 다양한 예제에 노출되도록 하고, 이를 통해 보지 못한 데이터에도 잘 일반화되도록 합니다.

그림 2. 불확실성 샘플링(왼쪽)과 다양성 기반 샘플링(오른쪽)입니다.
초기 데이터 선택 후 능동 학습은 레이블 지정을 위해 풀 기반 샘플링과 스트림 기반 샘플링이라는 두 가지 주요 접근 방식을 사용합니다. 이는 교사가 학생이 가장 중요한 내용에 집중하도록 돕는 방식과 유사합니다.
풀 기반 샘플링에서는 모델이 레이블이 지정되지 않은 대규모 데이터 풀을 스캔하고 레이블을 지정할 가장 어렵거나 유용한 예제를 선택합니다. 이는 학생이 가장 어려워하는 플래시카드를 우선적으로 학습하는 것과 비슷합니다. 스트림 기반 샘플링에서는 모델이 데이터가 들어오는 즉시 처리하면서 레이블을 지정할지 건너뛸지 결정합니다. 이는 학생이 막혔을 때만 도움을 요청하는 것과 유사합니다. 두 경우 모두 레이블이 지정된 데이터를 학습 세트에 추가하고 모델을 재학습하며, 모델은 각 반복 과정에서 꾸준히 개선됩니다.
능동 학습의 애플리케이션 살펴보기#
능동 학습은 의료 영상 및 자율 주행과 같은 컴퓨터 비전 애플리케이션에서 모델 정확도를 높이고 데이터 레이블 지정 프로세스를 간소화하는 핵심 역할을 합니다. 흥미로운 사례로는 저조도나 안개 상황에서 보행자 또는 객체를 감지하는 자율주행차의 컴퓨터 비전 모델을 들 수 있습니다. 능동 학습은 다양하고 어려운 주행 시나리오에 집중하여 정확도를 향상할 수 있습니다.
구체적으로 능동 학습은 이러한 시나리오에서 불확실한 데이터나 프레임을 식별하여 선택적으로 레이블을 지정하는 데 사용할 수 있습니다. 이렇게 레이블이 지정된 예제를 학습 세트에 추가하면 악천후나 야간 주행과 같은 어려운 환경에서 모델이 보행자와 객체를 더 잘 인식할 수 있습니다.
예를 들어 NVIDIA는 자율주행 모델에서 야간 보행자 감지 성능을 향상하기 위해 능동 학습을 사용했습니다. 특히 어려운 시나리오에서 학습에 가장 유용한 데이터를 전략적으로 선택함으로써 모델 성능이 크게 향상됩니다.

그림 3. 능동 학습을 사용한 우산을 든 보행자 감지입니다.
능동 학습으로 레이블 지정 비용을 줄일 수 있습니다#
능동 학습의 또 다른 주요 측면은 레이블 지정 비용을 줄일 수 있다는 점입니다. 전체 데이터 세트에 어노테이션을 요구하는 대신 가장 중요한 데이터 포인트에만 집중하여 이를 실현합니다. 이러한 타깃 방식은 시간, 노력, 비용을 절약합니다. 불확실하거나 다양한 샘플에 집중함으로써 능동 학습은 높은 모델 정확도를 유지하면서 필요한 어노테이션 수를 줄입니다.
실제로 연구에 따르면 능동 학습은 성능 저하 없이 레이블 지정 비용을 40~60% 절감할 수 있습니다. 이는 데이터 레이블 지정 비용이 높은 의료 및 제조와 같은 산업에서 특히 유용합니다. 어노테이션 프로세스를 간소화하면 기업은 정확도를 유지하면서 모델을 더 빠르게 개발하고 더욱 효율적으로 배포할 수 있습니다.
능동 학습의 이점#
능동 학습이 제공하는 다른 주요 이점은 다음과 같습니다.
- 클래스 불균형 해결: 능동 학습은 소수 데이터 클래스에 속한 인스턴스에 레이블을 지정하여 클래스 불균형 문제를 해결하는 데 도움이 될 수 있습니다. 제한된 데이터로도 모델이 드문 시나리오에서 더 나은 성능을 발휘할 수 있습니다.
- 더 빠른 개발 주기: 더 적은 데이터에 레이블을 지정하면 머신러닝 및 컴퓨터 비전 모델의 개발 프로세스가 간접적으로 가속화되어 추가 반복과 실험에 더 많은 시간과 리소스를 사용할 수 있습니다.
- 적응성: 불확실한 샘플이나 엣지 케이스 샘플을 반복적으로 처리하여 학습 데이터를 지속적으로 개선할 수 있으므로, 동적이거나 변화하는 데이터 세트에 적합합니다.
능동 학습과 AutoML은 함께 작동할 수 있습니다#
자동화된 머신러닝 (AutoML)은 머신러닝 모델을 구축하고 배포하는 데 필요한 시간이 많이 걸리는 반복 작업을 자동화하는 데 중점을 둡니다. 모델 선택 및 성능 평가와 같은 작업을 자동화하여 수작업의 필요성을 줄이고 머신러닝 워크플로를 간소화합니다.
능동 학습을 AutoML과 통합하면 모델 개발 수명 주기를 가속화하고 최적화할 수 있습니다. 능동 학습 구성 요소는 레이블을 지정할 가장 유용한 데이터 포인트를 전략적으로 선택하고, AutoML은 아키텍처, 파라미터 및 튜닝 선택을 자동화하여 모델을 개선합니다.

그림 4. AutoML 워크플로입니다.
예를 들어 이 기술 조합이 어떻게 작동하는지 살펴보겠습니다.
레이블이 지정된 데이터 세트를 확보하기 어렵고 비용이 많이 드는 사용 사례인 의료 영상에서 희귀 질환을 감지하려 한다고 가정해 보겠습니다. 능동 학습은 모델이 분류하지 못하는 X선 이미지의 미묘한 변화와 같은 불확실한 데이터를 식별하고 선택할 수 있습니다. 그런 다음 불확실한 데이터에 우선적으로 수동 어노테이션을 적용하여 모델의 이해도를 향상할 수 있습니다.
어노테이션이 지정된 데이터를 사용하면 AutoML은 다양한 아키텍처, 하이퍼파라미터 및 기타 데이터 증강 기법을 탐색하여 모델을 최적화할 수 있습니다. 이러한 반복 프로세스는 의료 전문가가 정확한 진단을 내리는 데 도움이 되는 Ultralytics YOLO11과 같은 신뢰할 수 있는 비전 모델의 개발을 가속화합니다.
능동 학습의 과제#
능동 학습과 그 기법은 다양한 이점을 제공하지만, 이러한 전략을 구현할 때 고려해야 할 몇 가지 사항이 있습니다.
- 쿼리 전략 선택: 능동 학습에는 다양한 기법이 있으며, 최적의 방법을 선택하는 것이 모델의 효과에 큰 영향을 미칩니다. 적절하지 않은 전략을 선택하면 특정 애플리케이션에서 모델 성능이 저하될 수 있습니다.
- 재학습 비용: 능동 학습의 반복적 특성으로 인해 특히 대규모 데이터 세트에서는 많은 계산 리소스가 필요합니다. 각 레이블 지정 라운드 후 모델을 재학습하므로 복잡성이 증가합니다.
- 초기 모델 품질: 능동 학습의 효과는 초기 모델의 품질에 따라 달라집니다. 성능이 낮은 초기 모델은 유용한 데이터 포인트를 정확하게 식별하지 못할 수 있으며, 이로 인해 품질이 낮은 레이블 요청이 발생하고 전반적인 성능이 저하될 수 있습니다.
능동 학습과 AutoML의 미래#
최근 AI 및 컴퓨터 비전의 발전에 따라 능동 학습은 더욱 복잡한 과제를 해결하고 머신러닝 워크플로를 간소화할 전망입니다. 능동 학습을 연합 학습 및 자기지도 학습과 같은 기법과 결합하면 비전 모델의 효율성과 확장성을 더욱 향상할 수 있습니다.
연합 학습을 사용하면 데이터가 원래 위치를 벗어나지 않아도 분산 프레임워크를 통해 여러 디바이스 또는 서버에서 모델을 학습할 수 있습니다. 데이터 개인정보 보호가 중요한 의료와 같은 산업을 생각해 보면, 연합 학습을 통해 민감한 로컬 데이터의 보안을 유지하면서 해당 데이터로 직접 학습할 수 있습니다. 원시 데이터를 공유하는 대신 모델 업데이트 또는 인사이트만 공유하므로, 학습 프로세스에 기여하면서도 개인정보를 보호할 수 있습니다.
한편 자기지도 학습은 레이블이 지정되지 않은 데이터로 모델을 사전 학습하여 레이블이 지정된 데이터의 필요성을 줄이는 데 도움이 됩니다. 이 프로세스는 모델을 위한 강력한 기반을 구축합니다. 그런 다음 능동 학습은 가장 중요한 데이터 포인트를 식별하고 선택하여 사람이 어노테이션을 지정하도록 함으로써 이를 바탕으로 모델을 더욱 개선할 수 있습니다.
능동 학습에서 능동적 영향력으로#
능동 학습은 높은 데이터 어노테이션 비용과 더 정확한 모델의 필요성 등 컴퓨터 비전의 주요 과제를 해결하는 실용적인 방법을 제공합니다. 가장 가치 있는 데이터 포인트에만 레이블을 지정하는 데 집중하여 사람에게 필요한 작업을 줄이는 동시에 모델 성능을 향상합니다.
능동 학습을 AutoML과 같은 기술과 결합하면 시간이 많이 걸리는 작업을 자동화하여 모델 개발을 간소화할 수 있습니다. 기술이 계속 발전함에 따라 능동 학습은 더 스마트하고 효율적인 컴퓨터 비전 시스템을 구축하는 데 필수적인 도구가 될 전망입니다.
GitHub 리포지토리를 살펴보고 커뮤니티에 참여하여 AI 및 컴퓨터 비전 모델에 대해 자세히 알아보세요. 솔루션 페이지에서 제조 분야의 컴퓨터 비전 및 의료 분야의 컴퓨터 비전의 다양한 애플리케이션을 확인해 보세요. 또한 라이선싱 옵션을 살펴보고 지금 비전 AI 여정을 시작할 수 있습니다.









