Ultralytics YOLO27:
비전 AI

Mask R-CNN이란 무엇이며 어떻게 작동하나요?

Mask R-CNN을 사용하여 다양한 산업 분야의 여러 애플리케이션에서 이미지와 동영상 속 객체를 정밀하게 분할하는 방법을 알아보세요.

ABAbirami Vina8 min read
Mask R-CNN을 활용한 인스턴스 세그멘테이션

AI 도입이 증가하면서 창고의 로봇, 혼잡한 도로를 안전하게 주행하는 자율주행 자동차, 작물을 점검하는 드론, 공장에서 제품을 검사하는 AI 시스템과 같은 혁신이 점점 더 보편화되고 있습니다. 이러한 혁신을 이끄는 핵심 기술은 컴퓨터 비전으로, 기계가 시각 데이터를 이해하고 해석할 수 있도록 하는 AI의 한 분야입니다.

예를 들어 객체 감지는 바운딩 박스를 사용해 이미지에서 객체를 식별하고 위치를 찾는 컴퓨터 비전 작업입니다. 바운딩 박스는 유용한 정보를 제공하지만 객체의 위치를 대략적으로만 추정할 수 있으며 정확한 형태나 경계를 포착하지 못합니다. 따라서 정밀한 식별이 필요한 애플리케이션에서는 효과가 떨어질 수 있습니다.

이 문제를 해결하기 위해 연구자들은 객체의 정확한 윤곽을 포착하는 세그멘테이션 모델을 개발했으며, 이를 통해 더욱 정확한 감지와 분석을 위한 픽셀 수준의 세부 정보를 제공합니다.

Mask R-CNN은 이러한 모델 중 하나입니다. 2017년 Facebook AI 연구(FAIR)에서 소개된 이 모델은 R-CNN, Fast R-CNN, Faster R-CNN과 같은 이전 모델을 기반으로 합니다. 컴퓨터 비전 역사에서 중요한 이정표인 Mask R-CNN은 Ultralytics YOLO11과 같은 더욱 발전된 모델의 기반을 마련했습니다.

이 글에서는 Mask R-CNN이 무엇인지, 어떻게 작동하는지, 어떤 애플리케이션에 사용되는지, 그리고 이후 어떤 개선이 이루어져 Ultralytics YOLO11로 이어졌는지 살펴보겠습니다.

Mask R-CNN 개요#

Mask R-CNN은 Mask Region-based Convolutional Neural Network의 약자로, 객체 감지 및 인스턴스 세그멘테이션과 같은 컴퓨터 비전 작업을 위해 설계된 딥러닝 모델입니다.

인스턴스 세그멘테이션은 이미지에서 객체를 식별하는 것뿐만 아니라 각 객체의 윤곽을 정확하게 표시함으로써 기존 객체 감지보다 더 많은 기능을 제공합니다. 감지된 모든 객체에 고유한 라벨을 할당하고 픽셀 수준에서 정확한 형태를 포착합니다. 이러한 세부적인 접근 방식을 통해 겹쳐 있는 객체를 명확하게 구분하고 복잡한 형태를 정확하게 처리할 수 있습니다.

Mask R-CNN은 객체를 감지하고 라벨을 지정하지만 정확한 형태를 정의하지는 못하는 Faster R-CNN을 기반으로 합니다. Mask R-CNN은 각 객체를 구성하는 정확한 픽셀을 식별하여 이를 개선하므로, 훨씬 더 세밀하고 정확한 이미지 분석이 가능합니다.

객체 감지와 인스턴스 세그멘테이션 비교

그림 1. 객체 감지와 인스턴스 세그멘테이션 비교.

Mask R-CNN의 아키텍처와 작동 방식 살펴보기#

Mask R-CNN은 객체를 정확하게 감지하고 세그멘테이션하기 위해 단계별 접근 방식을 사용합니다. 먼저 딥 뉴럴 네트워크(데이터에서 학습하는 다층 모델)를 사용해 핵심 특징을 추출한 다음, 영역 제안 네트워크(가능성이 높은 객체 영역을 제안하는 구성 요소)를 통해 잠재적인 객체 영역을 식별하고, 마지막으로 세부 세그멘테이션 마스크(객체의 정확한 윤곽)를 생성해 이러한 영역을 정교화하여 각 객체의 정확한 형태를 포착합니다.

다음으로 각 단계를 살펴보며 Mask R-CNN의 작동 방식을 자세히 알아보겠습니다.

Mask R-CNN 아키텍처 개요

그림 2. Mask R-CNN 아키텍처 개요(출처: researchgate.net).

특징 추출부터 시작하기#

Mask R-CNN 아키텍처의 첫 번째 단계는 모델이 이미지 속 내용을 이해할 수 있도록 이미지를 핵심 부분으로 나누는 것입니다. 사진을 볼 때 형태, 색상, 가장자리와 같은 세부 정보를 자연스럽게 알아차리는 것과 비슷합니다. 모델은 "백본"이라는 딥 뉴럴 네트워크(대개 ResNet-50 또는 ResNet-101)를 사용해 이와 유사한 작업을 수행합니다. 백본은 모델의 눈과 같은 역할을 하며 이미지를 훑어 핵심 세부 정보를 포착합니다.

이미지 속 객체는 매우 작거나 매우 클 수 있으므로 Mask R-CNN은 Feature Pyramid Network를 사용합니다. 이는 다양한 확대경을 사용해 모델이 세밀한 세부 정보와 전체적인 구도를 모두 볼 수 있도록 하는 것과 같으며, 모든 크기의 객체를 놓치지 않게 합니다.

이러한 중요한 특징이 추출되면 모델은 이미지에서 잠재적인 객체의 위치를 찾는 단계로 넘어가며, 이후 분석을 위한 기반을 마련합니다.

이미지에서 객체가 있을 가능성이 있는 영역 제안하기#

이미지에서 핵심 특징 처리가 완료되면 Region Proposal Network가 작업을 이어받습니다. 이 모델 구성 요소는 이미지를 살펴보고 객체가 포함되어 있을 가능성이 높은 영역을 제안합니다.

이를 위해 앵커라고 하는 여러 가능한 객체 위치를 생성합니다. 그런 다음 네트워크는 이러한 앵커를 평가하고 추가 분석을 위해 가장 유망한 앵커를 선택합니다. 이를 통해 모델은 이미지의 모든 위치를 확인하는 대신 관심 대상일 가능성이 가장 높은 영역에만 집중합니다.

Region Proposal Network 다이어그램

그림 3. Region Proposal Network의 예시.

추출된 특징 개선하기#

핵심 영역이 식별되면 다음 단계에서는 이러한 영역에서 추출된 세부 정보를 정교화합니다. 이전 모델은 각 영역에서 특징을 추출하기 위해 ROI Pooling(관심 영역 풀링)이라는 방법을 사용했지만, 영역 크기를 조정할 때 이 기법으로 인해 약간의 정렬 불일치가 발생하는 경우가 있어 특히 작거나 겹쳐 있는 객체를 처리할 때 효과가 떨어졌습니다.

Mask R-CNN은 ROI Align(관심 영역 정렬)이라는 기법을 사용해 이를 개선합니다. ROI Pooling처럼 좌표를 반올림하는 대신 ROI Align은 이중 선형 보간을 사용해 픽셀 값을 더 정밀하게 추정합니다. 이중 선형 보간은 가장 가까운 네 개 이웃 픽셀의 값을 평균 내어 새로운 픽셀 값을 계산하는 방법으로, 더 부드러운 전환을 만듭니다. 이를 통해 특징이 원본 이미지와 정확하게 정렬되어 더욱 정확한 객체 감지와 세그멘테이션이 가능합니다.

예를 들어 축구 경기에서 가까이 서 있는 두 선수가 바운딩 박스가 겹치기 때문에 서로 하나의 선수로 잘못 인식될 수 있습니다. ROI Align은 선수들의 형태를 구분된 상태로 유지하여 두 선수를 분리하는 데 도움을 줍니다.

Mask R-CNN의 ROI Align 사용 방식 다이어그램

그림 4. Mask R-CNN은 ROI Align을 사용합니다.

객체 분류 및 마스크 예측#

ROI Align이 이미지를 처리하면 다음 단계에서는 객체를 분류하고 위치를 세밀하게 조정합니다. 모델은 추출된 각 영역을 살펴보고 그 안에 어떤 객체가 있는지 판단합니다. 다양한 카테고리에 확률 점수를 할당한 후 가장 적합한 항목을 선택합니다.

동시에 바운딩 박스를 조정해 객체에 더 잘 맞춥니다. 초기 박스의 위치가 최적이 아닐 수 있으므로, 각 박스가 감지된 객체를 빈틈없이 둘러싸도록 하여 정확도를 높입니다.

마지막으로 Mask R-CNN은 한 단계 더 나아가 각 객체에 대한 세부 세그멘테이션 마스크를 병렬로 생성합니다.

Mask R-CNN과 실시간 애플리케이션#

이 모델이 출시되었을 때 AI 커뮤니티에서는 큰 호응을 보였으며 곧 다양한 애플리케이션에 사용되었습니다. 실시간으로 객체를 감지하고 세그멘테이션하는 기능은 여러 산업 분야의 판도를 바꾸었습니다.

예를 들어 야생에서 멸종 위기 동물을 추적하는 일은 어려운 작업입니다. 많은 종이 울창한 숲속을 이동하기 때문에 보호 활동가가 동물을 계속 추적하기가 어렵습니다. 기존 방법으로는 카메라 트랩, 드론, 위성 이미지를 사용하지만, 이 모든 데이터를 수작업으로 분류하려면 많은 시간이 걸립니다. 잘못된 식별과 관찰 누락은 보호 활동을 지연시킬 수 있습니다.

Mask R-CNN은 호랑이 줄무늬, 기린의 반점, 코끼리 귀의 형태와 같은 고유한 특징을 인식하여 이미지와 동영상에서 동물을 더욱 정확하게 감지하고 세그멘테이션할 수 있습니다. 동물이 나무에 일부 가려져 있거나 서로 가까이 서 있는 경우에도 모델은 동물을 분리하고 각각을 개별적으로 식별할 수 있어 야생동물 모니터링을 더 빠르고 안정적으로 수행할 수 있습니다.

Mask R-CNN을 사용한 동물 감지 및 세그멘테이션

그림 5. Mask R-CNN을 사용한 동물 감지 및 세그멘테이션.

Mask R-CNN의 한계#

객체 감지와 세그멘테이션 분야에서 역사적으로 중요한 의미를 지니지만, Mask R-CNN에는 몇 가지 주요 단점도 있습니다. Mask R-CNN과 관련된 과제는 다음과 같습니다.

  • 높은 컴퓨팅 요구 사항: 강력한 GPU에 의존하므로 실행 비용이 높아질 수 있으며, 대량의 데이터를 처리할 때 속도가 느려질 수 있습니다.
  • 느린 처리 속도: 여러 단계로 구성된 프로세스로 인해 YOLO와 같은 더 빠른 실시간 모델보다 처리 속도가 느리므로, 시간에 민감한 작업에는 적합하지 않을 수 있습니다.
  • 고품질 데이터에 대한 의존성: 명확하고 라벨이 잘 지정된 이미지에서 가장 뛰어난 성능을 발휘합니다. 흐릿하거나 조명이 좋지 않은 이미지는 정확도를 크게 낮출 수 있습니다.
  • 복잡한 구현: 여러 단계로 구성된 아키텍처는 특히 대규모 데이터 세트나 제한된 리소스를 다룰 때 설정하고 최적화하기가 어려울 수 있습니다.

Mask R-CNN에서 Ultralytics YOLO11까지#

Mask R-CNN은 세그멘테이션 작업에 뛰어났지만, 많은 산업 분야에서는 속도와 실시간 성능을 우선시하면서 컴퓨터 비전을 도입하려고 했습니다. 이러한 요구 사항으로 인해 연구자들은 한 번의 패스로 객체를 감지하는 1단계 모델을 개발했고, 효율성을 크게 향상시켰습니다.

Mask R-CNN의 여러 단계 프로세스와 달리 YOLO(You Only Look Once)와 같은 1단계 컴퓨터 비전 모델은 실시간 컴퓨터 비전 작업에 중점을 둡니다. YOLO 모델은 감지와 세그멘테이션을 별도로 처리하는 대신 한 번에 이미지를 분석할 수 있습니다. 따라서 빠른 의사 결정이 중요한 자율주행, 헬스케어, 제조, 로보틱스와 같은 애플리케이션에 적합합니다.

특히 Ultralytics YOLO11은 빠르면서도 정확하여 이러한 발전을 한 단계 더 이끌었습니다. YOLOv8m보다 파라미터 수가 22% 적지만 COCO 데이터 세트에서 더 높은 평균 정밀도(mAP)를 달성하므로 객체를 더욱 정확하게 감지합니다. 향상된 처리 속도 덕분에 매 밀리초가 중요한 실시간 애플리케이션에 적합합니다.

다른 모델과 비교한 Ultralytics YOLO11의 성능

그림 6. 다른 모델과 비교한 YOLO11의 성능.

핵심 요점#

컴퓨터 비전의 역사를 돌아보면 Mask R-CNN은 객체 감지와 세그멘테이션 분야의 주요 혁신으로 평가됩니다. 세밀한 다단계 프로세스 덕분에 복잡한 환경에서도 매우 정밀한 결과를 제공합니다.

그러나 이러한 동일한 프로세스로 인해 YOLO와 같은 실시간 모델보다 속도가 느립니다. 속도와 효율성에 대한 요구가 증가함에 따라 현재 많은 애플리케이션에서는 빠르고 정확한 객체 감지를 제공하는 Ultralytics YOLO11과 같은 1단계 모델을 사용합니다. Mask R-CNN은 컴퓨터 비전의 발전 과정을 이해하는 데 중요하지만, 실시간 솔루션으로의 전환은 더 빠르고 효율적인 컴퓨터 비전 솔루션에 대한 수요가 증가하고 있음을 보여줍니다.

성장하는 커뮤니티에 참여해 보세요! GitHub 리포지토리를 살펴보고 AI에 대해 자세히 알아보세요. 직접 컴퓨터 비전 프로젝트를 시작할 준비가 되셨나요? 라이선스 옵션을 확인해 보세요. 솔루션 페이지를 방문하여 농업 분야의 AI헬스케어 분야의 비전 AI에 대해 알아보세요!

Explore solutions

항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기

AI의 미래를 함께 만들어가세요!

머신러닝의 미래와 함께 여정을 시작하세요